43Evidence
not yet measuredWhat it measures
Aufgaben aus echten Nutzerdialogen statt aus einem Aufgabenkatalog.
What it does not measure
Fachpruefungen, Codeausfuehrung.
How the score is composed
Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance55
Methodological rigor25
Reproducibility60
Details
- Benchmaxxing risk
- medium
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- no
- LLM-judged
- yes
- Skala
- 0–100 WB-Score (höher besser)
Hand-maintained — no automatic adapter yet.
Best measured models
No results ingested yet.