ModelRadar
/
← All benchmarks

ARC-AGI-2

reasoning · abstract-reasoning↗ Quelle
71Evidence
not yet measured

What it measures

Abstraktionsfaehigkeit an Aufgaben, die bewusst nicht im Trainingsmaterial stehen koennen. Der private Testsatz ist der Kern des Verfahrens.

What it does not measure

Wissen, Sprache, Werkzeugnutzung.

Einer der wenigen Benchmarks mit echtem, verwaltetem Geheimtestsatz.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety100
Gaming resistance100
Methodological rigor80
Reproducibility100

Details

Benchmaxxing risk
low
Difficulty
high
Public test set
no
Human-verified
yes
LLM-judged
no
Skala
0–100 % solved (höher besser)

Hand-maintained — no automatic adapter yet.

Best measured models

No results ingested yet.