ModelRadar
/
← All benchmarks

Needle in a Haystack

long-context · retrieval↗ Quelle
46Evidence
not yet measured

What it measures

Ob ein eingefuegter Satz in einem langen Text wiedergefunden wird.

What it does not measure

Schliessen, Mehrfachbezuege, Textverstaendnis.

Von aktuellen Modellen praktisch immer geloest. Ein gruenes NIAH-Bild sagt heute fast nichts mehr; RULER oder MRCR sind aussagekraeftiger.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety60
Gaming resistance55
Methodological rigor50
Reproducibility60

Details

Benchmaxxing risk
medium
Difficulty
low
Public test set
yes
Human-verified
no
LLM-judged
no
Skala
0–100 % gefunden (höher besser)

Hand-maintained — no automatic adapter yet.

Best measured models

No results ingested yet.