ModelRadar
/
← All benchmarks

LMArena

instruction-following · human-preference↗ Quelle
63Evidence
not yet measured

What it measures

Blindvergleich durch Menschen ueber sehr viele Anfragen, ausgewertet als Elo. Die groesste Stichprobe echter Nutzerpraeferenz, die es gibt.

What it does not measure

Richtigkeit, Fachtiefe, Verhalten in Agentenketten. Gemessen wird, was Menschen in einem kurzen Vergleich besser gefaellt.

Anfaellig fuer Stilpraeferenzen: Formatierung, Laenge und Freundlichkeit wirken stark. Modelle lassen sich gezielt darauf abstimmen, ohne faehiger zu werden.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety100
Gaming resistance100
Methodological rigor80
Reproducibility20

Details

Benchmaxxing risk
low
Difficulty
medium
Public test set
no
Human-verified
yes
LLM-judged
no
Skala
800–1600 Elo (höher besser)

Hand-maintained — no automatic adapter yet.

Best measured models

No results ingested yet.