52Evidence
saturatedWhat it measures
Spracherkennung in 102 Sprachen, vergleichbar aufgebaut.
What it does not measure
Spontansprache, Laerm.
How the score is composed
Currency100
Discrimination6
Headroom1
Contamination safety55
Gaming resistance100
Methodological rigor80
Reproducibility60
Details
- Benchmaxxing risk
- low
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Letzter Messwert
- 2026-09-28
- Skala
- 0–100 % WER (niedriger besser)
Best measured models
- 1azure-speech-07Microsoft0.87 % WER
- 2elevenlabs-scribe-v20.9 % WER
- 3assemblyai-universal-3-5-pro1.01 % WER
- 4azure-speech-06Microsoft1.03 % WER
- 5assemblyai-universal-3-pro1.56 % WER
- 6azure-speech-06Microsoft1.75 % WER
- 7azure-speech-07Microsoft1.75 % WER
- 8azure-speech-07Microsoft1.83 % WER
- 9elevenlabs-scribe-v21.85 % WER
- 10Phi-4-multimodalMicrosoft1.88 % WER