ModelRadar
/
← All benchmarks

Common Voice (ASR)

audio-stt · crowdsourced-accents↗ Quelle
52Evidence
saturated

What it measures

Erkennung ueber viele Sprachen, Akzente und Aufnahmequalitaeten hinweg.

What it does not measure

Fachvokabular, Mehrsprecher-Situationen.

How the score is composed

Currency100
Discrimination2
Headroom2
Contamination safety55
Gaming resistance100
Methodological rigor80
Reproducibility60

Details

Benchmaxxing risk
low
Difficulty
medium
Public test set
yes
Human-verified
yes
LLM-judged
no
Letzter Messwert
2026-09-28
Skala
0–100 % WER (niedriger besser)

Best measured models

  1. 1azure-speech-06Microsoft1.8 % WER
  2. 2azure-speech-07Microsoft1.82 % WER
  3. 3azure-speech-06Microsoft1.88 % WER
  4. 4speechmatics-enhanced1.99 % WER
  5. 5azure-speech-07Microsoft2.01 % WER
  6. 6speechmatics-enhanced2.05 % WER
  7. 7elevenlabs-scribe-v22.17 % WER
  8. 8elevenlabs-scribe-v22.19 % WER
  9. 9azure-speech-06Microsoft2.24 % WER
  10. 10azure-speech-07Microsoft2.36 % WER