61Evidence
saturatedWhat it measures
Harvard-MIT-Mathematikwettbewerb, jaehrlich neue Aufgaben.
What it does not measure
Angewandte Mathematik, Beweise in Textform.
How the score is composed
Currency94
Discrimination100
Headroom10
Contamination safety55
Gaming resistance55
Methodological rigor30
Reproducibility20
Details
- Benchmaxxing risk
- medium
- Difficulty
- high
- Public test set
- yes
- Human-verified
- no
- LLM-judged
- no
- Sample size
- 30
- Letzter Messwert
- 2026-09-08
- Skala
- 0–100 % correct (höher besser)
Best measured models
- 1GLM-5Z.ai (Zhipu)vendor number96.9 % correct
- 2DeepSeek V4 ProDeepSeekvendor number96.2 % correct
- 3GLM-5.2Z.ai (Zhipu)vendor number94.4 % correct
- 4GLM-5.1Z.ai (Zhipu)vendor number94 % correct
- 5saanora-mark-1x-9bvendor number63.6 % correct
- 6LongCat-Flash-Lite-SparseMeituan LongCatvendor number40.53 % correct