ModelRadar
/
← All benchmarks

MMLU-Pro

knowledge · broad-academic↗ Quelle
50Evidence
not yet measured

What it measures

Breites Fachwissen mit zehn Antwortoptionen statt vier und bereinigten Fragen — die Nachfolge fuer das ausgereizte MMLU.

What it does not measure

Anwendung, Werkzeugnutzung, Codearbeit.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance55
Methodological rigor100
Reproducibility60

Details

Benchmaxxing risk
medium
Difficulty
medium
Public test set
yes
Human-verified
yes
LLM-judged
no
Sample size
12032
Skala
0–100 % correct (höher besser)

Best measured models

No results ingested yet.