68Evidence
saturatedWhat it measures
Bis zu welcher Laenge ein Modell seinen angegebenen Kontext tatsaechlich nutzt. Deckt zuverlaessig auf, wenn ein 1M-Fenster praktisch bei 128K endet.
What it does not measure
Qualitaet langer Texte, Schliessen ueber Dokumente hinweg.
Aufgaben werden generiert, daher kaum kontaminierbar. Nur mit angegebener Kontextlaenge vergleichbar.
How the score is composed
Currency84
Discrimination100
Headroom18
Contamination safety100
Gaming resistance55
Methodological rigor50
Reproducibility100
Details
- Benchmaxxing risk
- medium
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- no
- LLM-judged
- no
- Letzter Messwert
- 2026-08-01
- Skala
- 0–100 % correct (höher besser)
Best measured models
- 1Nemotron 3 UltraNVIDIAvendor number94.7 % correct
- 2Nemotron 3.5 LightningNVIDIAvendor number82.36 % correct