48Evidence
not yet measuredWhat it measures
Wortfehlerrate auf vorgelesenen Hoerbuechern, schwierigere Haelfte.
What it does not measure
Spontansprache, Hintergrundgeraeusche, Akzente ausserhalb der Aufnahme.
Seit Jahren praktisch ausgereizt und sehr wahrscheinlich in jedem Trainingsdatensatz enthalten. Fuer heutige Entscheidungen kaum noch aussagekraeftig.
How the score is composed
Currency50
Discrimination50
Headroom50
Contamination safety9
Gaming resistance100
Methodological rigor80
Reproducibility60
Details
- Benchmaxxing risk
- low
- Difficulty
- low
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Skala
- 0–100 % WER (niedriger besser)
Best measured models
No results ingested yet.