43Evidence
not yet measuredWhat it measures
500 schwierige Alltagsanfragen, bewertet von einem starken Modell als Richter.
What it does not measure
Faktentreue, Formattreue, Fachwissen.
LLM-als-Richter bevorzugt messbar laengere und selbstsicherere Antworten. Nuetzlich als Tendenz, ungeeignet als alleiniges Entscheidungskriterium.
How the score is composed
Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance55
Methodological rigor45
Reproducibility20
Details
- Benchmaxxing risk
- medium
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- no
- LLM-judged
- yes
- Sample size
- 500
- Skala
- 0–100 % Siege (höher besser)
Best measured models
No results ingested yet.