ModelRadar
/
← All benchmarks

MATH-500

math · school-competition↗ Quelle
35Evidence
saturated

What it measures

500 Aufgaben aus dem MATH-Datensatz, mittlere Schwierigkeit.

What it does not measure

Forschungsnahe Mathematik.

How the score is composed

Currency84
Discrimination0
Headroom11
Contamination safety15
Gaming resistance55
Methodological rigor50
Reproducibility60

Details

Benchmaxxing risk
medium
Difficulty
medium
Public test set
yes
Human-verified
no
LLM-judged
no
Letzter Messwert
2026-07-31
Skala
0–100 % correct (höher besser)

Best measured models

  1. 1LongCat-Flash-Lite-SparseMeituan LongCatvendor number96.8 % correct