ModelRadar
/
← All benchmarks

TED-LIUM 3

audio-stt · prepared-speech↗ Quelle
49Evidence
saturated

What it measures

Word error rate on TED talk recordings: prepared, clearly articulated speech.

What it does not measure

Spontane Gespraeche, Ueberlappungen, Telefonqualitaet, Fachvokabular.

Die einfachste der Langform-Aufgaben. Aktuelle Modelle liegen unter 3 % — als Unterscheidungsmerkmal kaum noch tauglich.

How the score is composed

Currency100
Discrimination5
Headroom2
Contamination safety55
Gaming resistance100
Methodological rigor80
Reproducibility60

Details

Benchmaxxing risk
low
Difficulty
low
Public test set
yes
Human-verified
yes
LLM-judged
no
Letzter Messwert
2026-09-28
Skala
0–100 % WER (niedriger besser)

Best measured models

  1. 1elevenlabs-scribe-v22.12 % WER
  2. 2transcribe-03Cohere2.23 % WER
  3. 3speechmatics-enhanced2.26 % WER
  4. 4assemblyai-universal-3-pro2.32 % WER
  5. 5parakeet-tdt-v3NVIDIA2.77 % WER
  6. 6revai-machine2.92 % WER
  7. 7parakeet-tdt-v2NVIDIA3.07 % WER
  8. 8whisper-v3OpenAI3.15 % WER
  9. 9parakeet-ctcNVIDIA3.23 % WER
  10. 10whisper-v3OpenAI3.23 % WER