ModelRadar
/

Phi-4-multimodal

Microsoft🇺🇸 USMajor lab·

Audioopen weights

No description yet — the model card or announcement hasn't been summarised.

Modalities
text → text

1 variant

InstructHF

Sources

HuggingFace

Benchmarks

BenchmarkDomainValueEvidence
Video-MMEvendor numbermultimodal50.8 % correct81
MMMU-Provendor numbervision21.8 % correct80
DocVQAvendor numbervision69.3 ANLS71
MathVistavendor numbervision43.9 % correct53
Common Voice (ASR)Open ASR Leaderboardaudio-stt6.89 % WER52
Common Voice (ASR)Open ASR Leaderboardaudio-stt4.25 % WER52
Common Voice (ASR)Open ASR Leaderboardaudio-stt4.04 % WER52
Common Voice (ASR)Open ASR Leaderboardaudio-stt3.84 % WER52
FLEURSOpen ASR Leaderboardaudio-stt4.08 % WER52
FLEURSOpen ASR Leaderboardaudio-stt3.99 % WER52
FLEURSOpen ASR Leaderboardaudio-stt3.44 % WER52
FLEURSOpen ASR Leaderboardaudio-stt3.23 % WER52
FLEURSOpen ASR Leaderboardaudio-stt1.88 % WER52
AI2Dvendor numbervision78.1 % correct44
ChartQAvendor numbervision81.8 % correct41

Vendor-reported numbers are marked and count with factor 0.7 in rankings. The evidence score says how much a benchmark still tells you today.

Provenance

Detected
Aug 25, 2026
First source
openasr
Description
not yet
Editorially reviewed
—