42Evidence
outdatedWhat it measures
Ob ein Modell Codeaenderungen in mehreren Sprachen korrekt UND im geforderten Bearbeitungsformat ausliefert. Das Format ist der eigentliche Pruefstein.
What it does not measure
Agentische Mehrschritt-Arbeit, Werkzeugnutzung.
Praxisnah, weil Formattreue im Alltag oft mehr kostet als Denkleistung.
How the score is composed
Currency1
Discrimination50
Headroom50
Contamination safety55
Gaming resistance55
Methodological rigor50
Reproducibility100
Details
- Benchmaxxing risk
- medium
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- no
- LLM-judged
- no
- Sample size
- 225
- Letzter Messwert
- 2025-10-03
- Skala
- 0–100 % correct (höher besser)
Best measured models
No results ingested yet.