53Evidence
not yet measuredWhat it measures
Ob ein Agent schaedliche Auftraege ausfuehrt, wenn Werkzeuge bereitstehen.
What it does not measure
Nuetzlichkeit, Ueberblockierung.
How the score is composed
Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance100
Methodological rigor80
Reproducibility20
Details
- Benchmaxxing risk
- low
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Skala
- 0–100 % refusal (höher besser)
Hand-maintained — no automatic adapter yet.
Best measured models
No results ingested yet.