ModelRadar
/
← All benchmarks

FLEURS

audio-stt · multilingual-asr↗ Quelle
52Evidence
saturated

What it measures

Spracherkennung in 102 Sprachen, vergleichbar aufgebaut.

What it does not measure

Spontansprache, Laerm.

How the score is composed

Currency100
Discrimination6
Headroom1
Contamination safety55
Gaming resistance100
Methodological rigor80
Reproducibility60

Details

Benchmaxxing risk
low
Difficulty
medium
Public test set
yes
Human-verified
yes
LLM-judged
no
Letzter Messwert
2026-09-28
Skala
0–100 % WER (niedriger besser)

Best measured models

  1. 1azure-speech-07Microsoft0.87 % WER
  2. 2elevenlabs-scribe-v20.9 % WER
  3. 3assemblyai-universal-3-5-pro1.01 % WER
  4. 4azure-speech-06Microsoft1.03 % WER
  5. 5assemblyai-universal-3-pro1.56 % WER
  6. 6azure-speech-06Microsoft1.75 % WER
  7. 7azure-speech-07Microsoft1.75 % WER
  8. 8azure-speech-07Microsoft1.83 % WER
  9. 9elevenlabs-scribe-v21.85 % WER
  10. 10Phi-4-multimodalMicrosoft1.88 % WER