# MMMU-Pro

College-level multimodal (vision+text) questions across six academic disciplines. Only scored for multimodal models.

**Use this for:** Tasks combining visual and textual inputs — charts, diagrams, visual reasoning.

**Source:** Artificial Analysis (artificialanalysis.ai), April 2026.
"—" = no data. For multimodal models without scores, infer from similar models in the same family, but tell the user you're inferring. Text-only models cannot be scored on this benchmark — do not infer scores for them.

| # | Model                               | Family      | Score |
| - | ----------------------------------- | ----------- | ----- |
| 1 | Nova 2.0 Lite (mode: high)          | Amazon Nova | 63.8% |
| 2 | Nova 2.0 Lite (mode: medium)        | Amazon Nova | 62.5% |
| 3 | Nova 2.0 Lite (mode: low)           | Amazon Nova | 58.0% |
| 4 | Llama 4 Scout 17B                   | Meta Llama  | 52.9% |
| 5 | Nova 2.0 Lite (mode: non-reasoning) | Amazon Nova | 49.0% |
| 6 | Nova Pro                            | Amazon Nova | 44.3% |
| 7 | Nova Lite                           | Amazon Nova | 37.8% |
| — | Llama 3.3 70B Instruct              | Meta Llama  | —     |
| — | Llama 3.2 3B Instruct               | Meta Llama  | —     |
| — | Llama 3.2 1B Instruct               | Meta Llama  | —     |
| — | Llama 3.1 8B Instruct               | Meta Llama  | —     |
| — | Qwen3 32B (mode: reasoning)         | Qwen        | —     |
| — | Qwen3 32B (mode: non-reasoning)     | Qwen        | —     |
| — | Qwen3 14B (mode: reasoning)         | Qwen        | —     |
| — | Qwen3 14B (mode: non-reasoning)     | Qwen        | —     |
| — | Qwen3 8B (mode: reasoning)          | Qwen        | —     |
| — | Qwen3 8B (mode: non-reasoning)      | Qwen        | —     |
| — | Qwen3 4B (mode: reasoning)          | Qwen        | —     |
| — | Qwen3 4B (mode: non-reasoning)      | Qwen        | —     |
| — | Qwen3 1.7B (mode: reasoning)        | Qwen        | —     |
| — | Qwen3 1.7B (mode: non-reasoning)    | Qwen        | —     |
| — | Qwen3 0.6B (mode: reasoning)        | Qwen        | —     |
| — | Qwen3 0.6B (mode: non-reasoning)    | Qwen        | —     |
| — | Qwen2.5 72B Instruct                | Qwen        | —     |
| — | Qwen2.5 32B Instruct                | Qwen        | —     |
| — | DeepSeek R1 Distill Llama 70B       | DeepSeek    | —     |
| — | DeepSeek R1 Distill Llama 8B        | DeepSeek    | —     |
| — | DeepSeek R1 Distill Qwen 32B        | DeepSeek    | —     |
| — | DeepSeek R1 Distill Qwen 14B        | DeepSeek    | —     |
| — | DeepSeek R1 Distill Qwen 1.5B       | DeepSeek    | —     |
| — | GPT-OSS 120B (mode: high)           | OpenAI      | —     |
| — | GPT-OSS 120B (mode: low)            | OpenAI      | —     |
| — | GPT-OSS 20B (mode: high)            | OpenAI      | —     |
| — | GPT-OSS 20B (mode: low)             | OpenAI      | —     |
| — | Nova Micro                          | Amazon Nova | —     |
| — | Qwen2.5 14B Instruct                | Qwen        | —     |
| — | Qwen2.5 7B Instruct                 | Qwen        | —     |
| — | DeepSeek R1 Distill Qwen 7B         | DeepSeek    | —     |
