50Evidence
not yet measuredWhat it measures
Breites Fachwissen mit zehn Antwortoptionen statt vier und bereinigten Fragen — die Nachfolge fuer das ausgereizte MMLU.
What it does not measure
Anwendung, Werkzeugnutzung, Codearbeit.
How the score is composed
Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance55
Methodological rigor100
Reproducibility60
Details
- Benchmaxxing risk
- medium
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Sample size
- 12032
- Skala
- 0–100 % correct (höher besser)
Best measured models
No results ingested yet.