ModelRadar
/
← All benchmarks

WildBench

instruction-following · real-user-tasks↗ Quelle
43Evidence
not yet measured

What it measures

Aufgaben aus echten Nutzerdialogen statt aus einem Aufgabenkatalog.

What it does not measure

Fachpruefungen, Codeausfuehrung.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance55
Methodological rigor25
Reproducibility60

Details

Benchmaxxing risk
medium
Difficulty
medium
Public test set
yes
Human-verified
no
LLM-judged
yes
Skala
0–100 WB-Score (höher besser)

Hand-maintained — no automatic adapter yet.

Best measured models

No results ingested yet.