ModelRadar
/
← All benchmarks

HMMT

math · competition↗ Quelle
61Evidence
saturated

What it measures

Harvard-MIT-Mathematikwettbewerb, jaehrlich neue Aufgaben.

What it does not measure

Angewandte Mathematik, Beweise in Textform.

How the score is composed

Currency94
Discrimination100
Headroom10
Contamination safety55
Gaming resistance55
Methodological rigor30
Reproducibility20

Details

Benchmaxxing risk
medium
Difficulty
high
Public test set
yes
Human-verified
no
LLM-judged
no
Sample size
30
Letzter Messwert
2026-09-08
Skala
0–100 % correct (höher besser)

Best measured models

  1. 1GLM-5Z.ai (Zhipu)vendor number96.9 % correct
  2. 2DeepSeek V4 ProDeepSeekvendor number96.2 % correct
  3. 3GLM-5.2Z.ai (Zhipu)vendor number94.4 % correct
  4. 4GLM-5.1Z.ai (Zhipu)vendor number94 % correct
  5. 5saanora-mark-1x-9bvendor number63.6 % correct
  6. 6LongCat-Flash-Lite-SparseMeituan LongCatvendor number40.53 % correct