ModelRadar
/
← All benchmarks

RULER

long-context · synthetic-retrieval↗ Quelle
68Evidence
saturated

What it measures

Bis zu welcher Laenge ein Modell seinen angegebenen Kontext tatsaechlich nutzt. Deckt zuverlaessig auf, wenn ein 1M-Fenster praktisch bei 128K endet.

What it does not measure

Qualitaet langer Texte, Schliessen ueber Dokumente hinweg.

Aufgaben werden generiert, daher kaum kontaminierbar. Nur mit angegebener Kontextlaenge vergleichbar.

How the score is composed

Currency84
Discrimination100
Headroom18
Contamination safety100
Gaming resistance55
Methodological rigor50
Reproducibility100

Details

Benchmaxxing risk
medium
Difficulty
medium
Public test set
yes
Human-verified
no
LLM-judged
no
Letzter Messwert
2026-08-01
Skala
0–100 % correct (höher besser)

Best measured models

  1. 1Nemotron 3 UltraNVIDIAvendor number94.7 % correct
  2. 2Nemotron 3.5 LightningNVIDIAvendor number82.36 % correct