ModelRadar
/
← All benchmarks

INCLUDE

multilingual · regional-knowledge↗ Quelle
57Evidence
not yet measured

What it measures

Regional verankertes Wissen in 44 Sprachen, aus lokalen Pruefungen.

What it does not measure

Uebersetzung, Sprachqualitaet.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety60
Gaming resistance100
Methodological rigor80
Reproducibility20

Details

Benchmaxxing risk
low
Difficulty
medium
Public test set
yes
Human-verified
yes
LLM-judged
no
Skala
0–100 % correct (höher besser)

Hand-maintained — no automatic adapter yet.

Best measured models

No results ingested yet.