63Evidence
not yet measuredWhat it measures
Blindvergleich durch Menschen ueber sehr viele Anfragen, ausgewertet als Elo. Die groesste Stichprobe echter Nutzerpraeferenz, die es gibt.
What it does not measure
Richtigkeit, Fachtiefe, Verhalten in Agentenketten. Gemessen wird, was Menschen in einem kurzen Vergleich besser gefaellt.
Anfaellig fuer Stilpraeferenzen: Formatierung, Laenge und Freundlichkeit wirken stark. Modelle lassen sich gezielt darauf abstimmen, ohne faehiger zu werden.
How the score is composed
Currency50
Discrimination50
Headroom50
Contamination safety100
Gaming resistance100
Methodological rigor80
Reproducibility20
Details
- Benchmaxxing risk
- low
- Difficulty
- medium
- Public test set
- no
- Human-verified
- yes
- LLM-judged
- no
- Skala
- 800–1600 Elo (höher besser)
Hand-maintained — no automatic adapter yet.
Best measured models
No results ingested yet.