53Evidence
saturatedWhat it measures
Wettbewerbsmathematik der US-Oberstufe, jaehrlich neue Aufgaben.
What it does not measure
Beweisfuehrung, angewandte Mathematik.
Nur 30 Aufgaben je Jahrgang. Ein einzelner Treffer verschiebt das Ergebnis um 3,3 Punkte, was Vergleiche zwischen eng beieinanderliegenden Modellen wertlos macht. Immer den Jahrgang mitlesen.
How the score is composed
Currency94
Discrimination83
Headroom3
Contamination safety15
Gaming resistance55
Methodological rigor60
Reproducibility20
Details
- Benchmaxxing risk
- medium
- Difficulty
- high
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Sample size
- 30
- Letzter Messwert
- 2026-09-08
- Skala
- 0–100 % correct (höher besser)
Best measured models
- 1GLM-5.2Z.ai (Zhipu)vendor number99.2 % correct
- 2GLM-5.1Z.ai (Zhipu)vendor number95.3 % correct
- 3GLM-5Z.ai (Zhipu)vendor number92.7 % correct
- 4Muse GlimmerMetavendor number89.2 % correct
- 5Muse GlimmerMetavendor number89.2 % correct
- 6edge0-edge0-35b-a3b-previewvendor number86.6 % correct
- 7upstage--solar-open2-250bvendor number80 % correct
- 8Solar-Open2Upstagevendor number80 % correct
- 9saanora-mark-1x-9bvendor number78.3 % correct
- 10LongCat-Flash-Lite-SparseMeituan LongCatvendor number65.73 % correct