ModelRadar
/
← All benchmarks

GPQA Diamond

reasoning · expert-science↗ Quelle
50Evidence
saturated

What it measures

Naturwissenschaftliche Fragen auf Promotionsniveau, die Fachleute anderer Gebiete auch mit Google nicht loesen.

What it does not measure

Alltagstauglichkeit, Rechenarbeit, Codearbeit.

Nur 198 Fragen im Multiple-Choice-Format bei sehr hoher Marketingwirkung. Das ist die klassische Benchmaxxing-Konstellation; Zahlen nahe der Spitze sind mit Vorsicht zu lesen.

How the score is composed

Currency95
Discrimination60
Headroom22
Contamination safety15
Gaming resistance15
Methodological rigor80
Reproducibility60

Details

Benchmaxxing risk
high
Difficulty
high
Public test set
yes
Human-verified
yes
LLM-judged
no
Sample size
198
Letzter Messwert
2026-09-10
Skala
0–100 % correct (höher besser)

Best measured models

  1. 1DeepSeek V4.1 FlashDeepSeekvendor number93.4 % correct
  2. 2DeepSeek V4 ProDeepSeekvendor number91.3 % correct
  3. 3GLM-5.2Z.ai (Zhipu)vendor number91.2 % correct
  4. 4Ling 3.0 Flash FinAnt Group (inclusionAI)vendor number86.3 % correct
  5. 5GLM-5.1Z.ai (Zhipu)vendor number86.2 % correct
  6. 6GLM-5Z.ai (Zhipu)vendor number86 % correct
  7. 7Muse GlimmerMetavendor number83.5 % correct
  8. 8Muse GlimmerMetavendor number83.5 % correct
  9. 9Nex-N2-ProNex AGI (Shanghai Innovation Inst.)vendor number82.6 % correct
  10. 10edge0-edge0-35b-a3b-previewvendor number79.8 % correct