Phi-4-multimodal
Microsoft🇺🇸 USMajor lab·
Audioopen weights
No description yet — the model card or announcement hasn't been summarised.
- Modalities
- text → text
1 variant
| Instruct | HF |
Sources
HuggingFaceBenchmarks
| Benchmark | Domain | Value | Evidence |
|---|---|---|---|
| Video-MMEvendor number | multimodal | 50.8 % correct | 81 |
| MMMU-Provendor number | vision | 21.8 % correct | 80 |
| DocVQAvendor number | vision | 69.3 ANLS | 71 |
| MathVistavendor number | vision | 43.9 % correct | 53 |
| Common Voice (ASR)Open ASR Leaderboard | audio-stt | 6.89 % WER | 52 |
| Common Voice (ASR)Open ASR Leaderboard | audio-stt | 4.25 % WER | 52 |
| Common Voice (ASR)Open ASR Leaderboard | audio-stt | 4.04 % WER | 52 |
| Common Voice (ASR)Open ASR Leaderboard | audio-stt | 3.84 % WER | 52 |
| FLEURSOpen ASR Leaderboard | audio-stt | 4.08 % WER | 52 |
| FLEURSOpen ASR Leaderboard | audio-stt | 3.99 % WER | 52 |
| FLEURSOpen ASR Leaderboard | audio-stt | 3.44 % WER | 52 |
| FLEURSOpen ASR Leaderboard | audio-stt | 3.23 % WER | 52 |
| FLEURSOpen ASR Leaderboard | audio-stt | 1.88 % WER | 52 |
| AI2Dvendor number | vision | 78.1 % correct | 44 |
| ChartQAvendor number | vision | 81.8 % correct | 41 |
Vendor-reported numbers are marked and count with factor 0.7 in rankings. The evidence score says how much a benchmark still tells you today.
Provenance
- Detected
- Aug 25, 2026
- First source
- openasr
- Description
- not yet
- Editorially reviewed
- —