ModelRadar
/
← All benchmarks

MMLU

knowledge · broad-academic↗ Quelle
43Evidence
superseded

What it measures

57 Faecher im Multiple-Choice-Format, der lange Zeit meistzitierte Wert.

What it does not measure

Alles, was ueber Faktenabruf hinausgeht.

Ausgereizt und stark kontaminiert; enthaelt zudem nachweislich fehlerhafte Fragen. Bleibt gelistet, damit aeltere Herstellerangaben einordbar sind.

How the score is composed

Currency95
Discrimination56
Headroom41
Contamination safety15
Gaming resistance15
Methodological rigor70
Reproducibility20

Details

Benchmaxxing risk
high
Difficulty
low
Public test set
yes
Human-verified
no
LLM-judged
no
Sample size
14042
Letzter Messwert
2026-09-10
Skala
0–100 % correct (höher besser)

Best measured models

  1. 1DeepSeek V4 ProDeepSeekvendor number87.8 % correct
  2. 2Nemotron 3 UltraNVIDIAvendor number86.8 % correct
  3. 3Motif-3Motif Technologiesvendor number86.2 % correct
  4. 4LongCat-Flash-Lite-SparseMeituan LongCatvendor number85.52 % correct
  5. 5Nemotron 3.5 LightningNVIDIAvendor number81.07 % correct
  6. 6edge0-edge0-35b-a3b-previewvendor number81 % correct
  7. 7saanora-mark-1x-9bvendor number80.6 % correct
  8. 8upstage--solar-open2-250bvendor number80.4 % correct
  9. 9Solar-Open2Upstagevendor number80.4 % correct
  10. 10DeepSeek V4.1 FlashDeepSeekvendor number68.3 % correct