ModelRadar
/
← All benchmarks

MTEB

embedding · aggregate↗ Quelle
42Evidence
not yet measured

What it measures

Einbettungsqualitaet ueber Retrieval, Clustering, Klassifikation und mehr.

What it does not measure

Generieren, Latenz im Betrieb, Speicherbedarf.

Der Mittelwert ueber sehr verschiedene Teilaufgaben laedt zum Optimieren auf die Rangliste ein. Fuer eine konkrete Anwendung zaehlt die passende Teilaufgabe, nicht der Gesamtwert.

How the score is composed

Currency50
Discrimination50
Headroom50
Contamination safety9
Gaming resistance55
Methodological rigor50
Reproducibility60

Details

Benchmaxxing risk
medium
Difficulty
medium
Public test set
yes
Human-verified
no
LLM-judged
no
Skala
0–100 avg. score (höher besser)

Best measured models

No results ingested yet.