58Evidence
activeWhat it measures
Wortfehlerrate ueber acht englische Datensaetze gemittelt, dazu Geschwindigkeit als Echtzeitfaktor. Die wichtigste vergleichbare Quelle fuer lokale Spracherkennung.
What it does not measure
Nicht-englische Sprachen, Sprecherzuordnung, Zeichensetzung nach Sinn, Verhalten bei Fachbegriffen und Eigennamen.
Der Mittelwert verdeckt grosse Unterschiede je Datensatz. Fuer eine Kaufentscheidung gehoert der Einzelwert des passenden Datensatzes dazu, nicht nur der Mittelwert.
How the score is composed
Currency100
Discrimination20
Headroom7
Contamination safety55
Gaming resistance100
Methodological rigor80
Reproducibility100
Details
- Benchmaxxing risk
- low
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Letzter Messwert
- 2026-09-28
- Skala
- 0–100 % WER (niedriger besser)
Best measured models
- 1elevenlabs-scribe-v27.315 % WER
- 2assemblyai-universal-3-pro8.34 % WER
- 3speechmatics-enhanced8.8 % WER
- 4revai-machine9.6375 % WER
- 5transcribe-03Cohere9.733125 % WER
- 6parakeet-tdt-v3NVIDIA10.72 % WER
- 7whisper-v3OpenAI11.01 % WER
- 8parakeet-tdt-v2NVIDIA11.1775 % WER
- 9whisper-v3OpenAI11.2275 % WER
- 10parakeet-ctcNVIDIA12.935 % WER