ModelRadar
/
← All benchmarks

MMMU-Pro

vision · expert-multimodal↗ Quelle
80Evidence
active

What it measures

Fachaufgaben mit Diagrammen, Tabellen und Skizzen auf Hochschulniveau, mit verschaerftem Aufbau gegen Ratestrategien.

What it does not measure

Bilderzeugung, Video, reine Texterkennung.

How the score is composed

Currency95
Discrimination100
Headroom87
Contamination safety55
Gaming resistance55
Methodological rigor80
Reproducibility60

Details

Benchmaxxing risk
medium
Difficulty
high
Public test set
yes
Human-verified
yes
LLM-judged
no
Letzter Messwert
2026-09-10
Skala
0–100 % correct (höher besser)

Best measured models

  1. 1Muse GlimmerMetavendor number74 % correct
  2. 2Muse GlimmerMetavendor number74 % correct
  3. 3DeepSeek V4.1 FlashDeepSeekvendor number56.5 % correct
  4. 4Phi-4-multimodalMicrosoftvendor number21.8 % correct