ModelRadar
/
← All benchmarks

AIME

math · competition↗ Quelle
53Evidence
saturated

What it measures

Wettbewerbsmathematik der US-Oberstufe, jaehrlich neue Aufgaben.

What it does not measure

Beweisfuehrung, angewandte Mathematik.

Nur 30 Aufgaben je Jahrgang. Ein einzelner Treffer verschiebt das Ergebnis um 3,3 Punkte, was Vergleiche zwischen eng beieinanderliegenden Modellen wertlos macht. Immer den Jahrgang mitlesen.

How the score is composed

Currency94
Discrimination83
Headroom3
Contamination safety15
Gaming resistance55
Methodological rigor60
Reproducibility20

Details

Benchmaxxing risk
medium
Difficulty
high
Public test set
yes
Human-verified
yes
LLM-judged
no
Sample size
30
Letzter Messwert
2026-09-08
Skala
0–100 % correct (höher besser)

Best measured models

  1. 1GLM-5.2Z.ai (Zhipu)vendor number99.2 % correct
  2. 2GLM-5.1Z.ai (Zhipu)vendor number95.3 % correct
  3. 3GLM-5Z.ai (Zhipu)vendor number92.7 % correct
  4. 4Muse GlimmerMetavendor number89.2 % correct
  5. 5Muse GlimmerMetavendor number89.2 % correct
  6. 6edge0-edge0-35b-a3b-previewvendor number86.6 % correct
  7. 7upstage--solar-open2-250bvendor number80 % correct
  8. 8Solar-Open2Upstagevendor number80 % correct
  9. 9saanora-mark-1x-9bvendor number78.3 % correct
  10. 10LongCat-Flash-Lite-SparseMeituan LongCatvendor number65.73 % correct