ModelRadar
/
← All benchmarks

Berkeley Function Calling Leaderboard

tool-use · function-calling↗ Quelle
55Evidence
not yet measured

What it measures

Ob Funktionsaufrufe syntaktisch und semantisch korrekt sind, inklusive Mehrfach- und Parallelaufrufen sowie dem Erkennen, wann NICHT aufzurufen ist.

What it does not measure

Laengere Agentenketten, Weltwissen.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety33
Gaming resistance100
Methodological rigor80
Reproducibility60

Details

Benchmaxxing risk
low
Difficulty
medium
Public test set
yes
Human-verified
yes
LLM-judged
no
Skala
0–100 % correct (höher besser)

Best measured models

No results ingested yet.