42Evidence
not yet measuredWhat it measures
Einbettungsqualitaet ueber Retrieval, Clustering, Klassifikation und mehr.
What it does not measure
Generieren, Latenz im Betrieb, Speicherbedarf.
Der Mittelwert ueber sehr verschiedene Teilaufgaben laedt zum Optimieren auf die Rangliste ein. Fuer eine konkrete Anwendung zaehlt die passende Teilaufgabe, nicht der Gesamtwert.
How the score is composed
Currency50
Discrimination50
Headroom50
Contamination safety9
Gaming resistance55
Methodological rigor50
Reproducibility60
Details
- Benchmaxxing risk
- medium
- Difficulty
- medium
- Public test set
- yes
- Human-verified
- no
- LLM-judged
- no
- Skala
- 0–100 avg. score (höher besser)
Best measured models
No results ingested yet.