ModelRadar
/
← All benchmarks

LiveCodeBench

coding · competitive-programming↗ Quelle
80Evidence
active

What it measures

Wettbewerbsaufgaben, die NACH dem Trainingsschnitt eines Modells veroeffentlicht wurden. Genau dieser Zeitschnitt ist der Sinn der Sache.

What it does not measure

Arbeit an bestehendem Code, Lesbarkeit, Wartbarkeit.

Kontaminationsarm durch das rollierende Zeitfenster. Nur mit angegebenem Zeitraum vergleichbar, sonst misst man verschiedene Aufgabensaetze.

How the score is composed

Currency81
Discrimination100
Headroom37
Contamination safety100
Gaming resistance100
Methodological rigor50
Reproducibility60

Details

Benchmaxxing risk
low
Difficulty
high
Public test set
yes
Human-verified
no
LLM-judged
no
Letzter Messwert
2026-07-22
Skala
0–100 % pass@1 (höher besser)

Best measured models

  1. 1Nemotron 3 UltraNVIDIAvendor number89 % pass@1
  2. 2DeepSeek V4 ProDeepSeekvendor number88.8 % pass@1
  3. 3upstage--solar-open2-250bvendor number56.5 % pass@1
  4. 4Solar-Open2Upstagevendor number56.5 % pass@1