52Evidence
saturatedWhat it measures
Erkennung ueber viele Sprachen, Akzente und Aufnahmequalitaeten hinweg.
What it does not measure
Fachvokabular, Mehrsprecher-Situationen.
How the score is composed
Currency100
Discrimination2
Headroom2
Contamination safety55
Gaming resistance100
Methodological rigor80
Reproducibility60
Details
- Benchmaxxing risk
- low
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Letzter Messwert
- 2026-09-28
- Skala
- 0–100 % WER (niedriger besser)
Best measured models
- 1azure-speech-06Microsoft1.8 % WER
- 2azure-speech-07Microsoft1.82 % WER
- 3azure-speech-06Microsoft1.88 % WER
- 4speechmatics-enhanced1.99 % WER
- 5azure-speech-07Microsoft2.01 % WER
- 6speechmatics-enhanced2.05 % WER
- 7elevenlabs-scribe-v22.17 % WER
- 8elevenlabs-scribe-v22.19 % WER
- 9azure-speech-06Microsoft2.24 % WER
- 10azure-speech-07Microsoft2.36 % WER