50Evidence
saturatedWhat it measures
Naturwissenschaftliche Fragen auf Promotionsniveau, die Fachleute anderer Gebiete auch mit Google nicht loesen.
What it does not measure
Alltagstauglichkeit, Rechenarbeit, Codearbeit.
Nur 198 Fragen im Multiple-Choice-Format bei sehr hoher Marketingwirkung. Das ist die klassische Benchmaxxing-Konstellation; Zahlen nahe der Spitze sind mit Vorsicht zu lesen.
How the score is composed
Currency95
Discrimination60
Headroom22
Contamination safety15
Gaming resistance15
Methodological rigor80
Reproducibility60
Details
- Benchmaxxing risk
- high
- Difficulty
- high
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Sample size
- 198
- Letzter Messwert
- 2026-09-10
- Skala
- 0–100 % correct (höher besser)
Best measured models
- 1DeepSeek V4.1 FlashDeepSeekvendor number93.4 % correct
- 2DeepSeek V4 ProDeepSeekvendor number91.3 % correct
- 3GLM-5.2Z.ai (Zhipu)vendor number91.2 % correct
- 4Ling 3.0 Flash FinAnt Group (inclusionAI)vendor number86.3 % correct
- 5GLM-5.1Z.ai (Zhipu)vendor number86.2 % correct
- 6GLM-5Z.ai (Zhipu)vendor number86 % correct
- 7Muse GlimmerMetavendor number83.5 % correct
- 8Muse GlimmerMetavendor number83.5 % correct
- 9Nex-N2-ProNex AGI (Shanghai Innovation Inst.)vendor number82.6 % correct
- 10edge0-edge0-35b-a3b-previewvendor number79.8 % correct