35Evidence
saturatedWhat it measures
500 Aufgaben aus dem MATH-Datensatz, mittlere Schwierigkeit.
What it does not measure
Forschungsnahe Mathematik.
How the score is composed
Currency84
Discrimination0
Headroom11
Contamination safety15
Gaming resistance55
Methodological rigor50
Reproducibility60
Details
- Benchmaxxing risk
- medium
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- no
- LLM-judged
- no
- Letzter Messwert
- 2026-07-31
- Skala
- 0–100 % correct (höher besser)
Best measured models
- 1LongCat-Flash-Lite-SparseMeituan LongCatvendor number96.8 % correct