55Evidence
not yet measuredWhat it measures
Ob Funktionsaufrufe syntaktisch und semantisch korrekt sind, inklusive Mehrfach- und Parallelaufrufen sowie dem Erkennen, wann NICHT aufzurufen ist.
What it does not measure
Laengere Agentenketten, Weltwissen.
How the score is composed
Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance100
Methodological rigor80
Reproducibility60
Details
- Benchmaxxing risk
- low
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- yes
- LLM-judged
- no
- Skala
- 0–100 % correct (höher besser)
Best measured models
No results ingested yet.