ModelRadar
/
← All benchmarks

Global-MMLU

multilingual · knowledge↗ Quelle
49Evidence
not yet measured

What it measures

MMLU in 42 Sprachen, kulturell geprueft statt nur maschinell uebersetzt.

What it does not measure

Generieren in der Zielsprache.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance55
Methodological rigor80
Reproducibility60

Details

Benchmaxxing risk
medium
Difficulty
medium
Public test set
yes
Human-verified
yes
LLM-judged
no
Skala
0–100 % correct (höher besser)

Best measured models

No results ingested yet.