67Evidence
not yet measuredWhat it measures
Alltagsaufgaben, die Werkzeuge, Websuche und mehrere Schritte brauchen — fuer Menschen leicht, fuer Modelle lange schwer.
What it does not measure
Fachwissen in der Tiefe, Codequalitaet.
How the score is composed
Currency50
Discrimination50
Headroom50
Contamination safety100
Gaming resistance100
Methodological rigor80
Reproducibility20
Details
- Benchmaxxing risk
- low
- Difficulty
- high
- Public test set
- no
- Human-verified
- yes
- LLM-judged
- no
- Sample size
- 466
- Skala
- 0–100 % correct (höher besser)
Hand-maintained — no automatic adapter yet.
Best measured models
No results ingested yet.