ModelRadar
/
← All benchmarks

Arena-Hard

instruction-following · llm-judged-preference↗ Quelle
43Evidence
not yet measured

What it measures

500 schwierige Alltagsanfragen, bewertet von einem starken Modell als Richter.

What it does not measure

Faktentreue, Formattreue, Fachwissen.

LLM-als-Richter bevorzugt messbar laengere und selbstsicherere Antworten. Nuetzlich als Tendenz, ungeeignet als alleiniges Entscheidungskriterium.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance55
Methodological rigor45
Reproducibility20

Details

Benchmaxxing risk
medium
Difficulty
medium
Public test set
yes
Human-verified
no
LLM-judged
yes
Sample size
500
Skala
0–100 % Siege (höher besser)

Best measured models

No results ingested yet.