# GPQA (Diamond)

Graduate-level "Google-proof" questions in biology, physics, and chemistry (hardest 198 of 448).

**Use this for:** Scientific reasoning, technical analysis in natural sciences.

**Source:** Artificial Analysis (artificialanalysis.ai), April 2026.
"—" = no data — infer from similar models in the same family, but tell the user you're inferring.

| #  | Model                               | Family      | Score |
| -- | ----------------------------------- | ----------- | ----- |
| 1  | Nova 2.0 Lite (mode: high)          | Amazon Nova | 81.1% |
| 2  | GPT-OSS 120B (mode: high)           | OpenAI      | 78.2% |
| 3  | Nova 2.0 Lite (mode: medium)        | Amazon Nova | 76.8% |
| 4  | Nova 2.0 Lite (mode: low)           | Amazon Nova | 69.8% |
| 5  | GPT-OSS 20B (mode: high)            | OpenAI      | 68.8% |
| 6  | GPT-OSS 120B (mode: low)            | OpenAI      | 67.2% |
| 7  | Qwen3 32B (mode: reasoning)         | Qwen        | 66.8% |
| 8  | DeepSeek R1 Distill Qwen 32B        | DeepSeek    | 61.5% |
| 9  | GPT-OSS 20B (mode: low)             | OpenAI      | 61.1% |
| 10 | Qwen3 14B (mode: reasoning)         | Qwen        | 60.4% |
| 11 | Nova 2.0 Lite (mode: non-reasoning) | Amazon Nova | 60.3% |
| 12 | Qwen3 8B (mode: reasoning)          | Qwen        | 58.9% |
| 13 | Llama 4 Scout 17B                   | Meta Llama  | 58.7% |
| 14 | Qwen3 32B (mode: non-reasoning)     | Qwen        | 53.5% |
| 15 | Qwen3 4B (mode: reasoning)          | Qwen        | 52.2% |
| 16 | Nova Pro                            | Amazon Nova | 49.9% |
| 17 | Llama 3.3 70B Instruct              | Meta Llama  | 49.8% |
| 18 | Qwen2.5 72B Instruct                | Qwen        | 49.1% |
| 19 | DeepSeek R1 Distill Qwen 14B        | DeepSeek    | 48.4% |
| 20 | Qwen3 14B (mode: non-reasoning)     | Qwen        | 47.0% |
| 21 | Qwen2.5 32B Instruct                | Qwen        | 46.6% |
| 22 | Qwen3 8B (mode: non-reasoning)      | Qwen        | 45.2% |
| 23 | Nova Lite                           | Amazon Nova | 43.3% |
| 24 | DeepSeek R1 Distill Llama 70B       | DeepSeek    | 40.2% |
| 25 | Qwen3 4B (mode: non-reasoning)      | Qwen        | 39.8% |
| 26 | Nova Micro                          | Amazon Nova | 35.8% |
| 27 | Qwen3 1.7B (mode: reasoning)        | Qwen        | 35.6% |
| 28 | DeepSeek R1 Distill Llama 8B        | DeepSeek    | 30.2% |
| 29 | Qwen3 1.7B (mode: non-reasoning)    | Qwen        | 28.3% |
| 30 | Llama 3.1 8B Instruct               | Meta Llama  | 25.9% |
| 31 | Llama 3.2 3B Instruct               | Meta Llama  | 25.5% |
| 32 | Qwen3 0.6B (mode: reasoning)        | Qwen        | 23.9% |
| 33 | Qwen3 0.6B (mode: non-reasoning)    | Qwen        | 23.1% |
| 34 | Llama 3.2 1B Instruct               | Meta Llama  | 19.6% |
| 35 | DeepSeek R1 Distill Qwen 1.5B       | DeepSeek    | 9.8%  |
| —  | Qwen2.5 14B Instruct                | Qwen        | —     |
| —  | Qwen2.5 7B Instruct                 | Qwen        | —     |
| —  | DeepSeek R1 Distill Qwen 7B         | DeepSeek    | —     |
