49Evidence
saturatedWhat it measures
Word error rate on TED talk recordings: prepared, clearly articulated speech.
What it does not measure
Spontane Gespraeche, Ueberlappungen, Telefonqualitaet, Fachvokabular.
Die einfachste der Langform-Aufgaben. Aktuelle Modelle liegen unter 3 % — als Unterscheidungsmerkmal kaum noch tauglich.
How the score is composed
Currency100
Discrimination5
Headroom2
Contamination safety55
Gaming resistance100
Methodological rigor80
Reproducibility60
Details
- Benchmaxxing risk
- low
- Difficulty
- low
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Letzter Messwert
- 2026-09-28
- Skala
- 0–100 % WER (niedriger besser)
Best measured models
- 1elevenlabs-scribe-v22.12 % WER
- 2transcribe-03Cohere2.23 % WER
- 3speechmatics-enhanced2.26 % WER
- 4assemblyai-universal-3-pro2.32 % WER
- 5parakeet-tdt-v3NVIDIA2.77 % WER
- 6revai-machine2.92 % WER
- 7parakeet-tdt-v2NVIDIA3.07 % WER
- 8whisper-v3OpenAI3.15 % WER
- 9parakeet-ctcNVIDIA3.23 % WER
- 10whisper-v3OpenAI3.23 % WER