80Evidence
activeWhat it measures
Wettbewerbsaufgaben, die NACH dem Trainingsschnitt eines Modells veroeffentlicht wurden. Genau dieser Zeitschnitt ist der Sinn der Sache.
What it does not measure
Arbeit an bestehendem Code, Lesbarkeit, Wartbarkeit.
Kontaminationsarm durch das rollierende Zeitfenster. Nur mit angegebenem Zeitraum vergleichbar, sonst misst man verschiedene Aufgabensaetze.
How the score is composed
Currency81
Discrimination100
Headroom37
Contamination safety100
Gaming resistance100
Methodological rigor50
Reproducibility60
Details
- Benchmaxxing risk
- low
- Difficulty
- high
- Public test set
- yes
- Human-verified
- no
- LLM-judged
- no
- Letzter Messwert
- 2026-07-22
- Skala
- 0–100 % pass@1 (höher besser)
Best measured models
- 1Nemotron 3 UltraNVIDIAvendor number89 % pass@1
- 2DeepSeek V4 ProDeepSeekvendor number88.8 % pass@1
- 3upstage--solar-open2-250bvendor number56.5 % pass@1
- 4Solar-Open2Upstagevendor number56.5 % pass@1