# HLE (Humanity's Last Exam)

2,500 frontier-difficulty questions across dozens of subjects. Most models score in the single digits.

**Use this for:** Differentiating the most capable frontier models. Less useful for mid-range comparisons.

**Source:** Artificial Analysis (artificialanalysis.ai), April 2026.
"—" = no data — infer from similar models in the same family, but tell the user you're inferring.

| #  | Model                               | Family      | Score |
| -- | ----------------------------------- | ----------- | ----- |
| 1  | GPT-OSS 120B (mode: high)           | OpenAI      | 18.5% |
| 2  | Nova 2.0 Lite (mode: high)          | Amazon Nova | 10.9% |
| 3  | GPT-OSS 20B (mode: high)            | OpenAI      | 9.8%  |
| 4  | Nova 2.0 Lite (mode: medium)        | Amazon Nova | 8.6%  |
| 5  | Qwen3 32B (mode: reasoning)         | Qwen        | 8.3%  |
| 6  | DeepSeek R1 Distill Llama 70B       | DeepSeek    | 6.1%  |
| 7  | Qwen3 0.6B (mode: reasoning)        | Qwen        | 5.7%  |
| 8  | DeepSeek R1 Distill Qwen 32B        | DeepSeek    | 5.5%  |
| 9  | Llama 3.2 1B Instruct               | Meta Llama  | 5.3%  |
| 10 | Llama 3.2 3B Instruct               | Meta Llama  | 5.2%  |
| 11 | Qwen3 1.7B (mode: non-reasoning)    | Qwen        | 5.2%  |
| 12 | Qwen3 0.6B (mode: non-reasoning)    | Qwen        | 5.2%  |
| 13 | GPT-OSS 120B (mode: low)            | OpenAI      | 5.2%  |
| 14 | Llama 3.1 8B Instruct               | Meta Llama  | 5.1%  |
| 15 | Qwen3 4B (mode: reasoning)          | Qwen        | 5.1%  |
| 16 | GPT-OSS 20B (mode: low)             | OpenAI      | 5.1%  |
| 17 | Qwen3 1.7B (mode: reasoning)        | Qwen        | 4.8%  |
| 18 | Nova Micro                          | Amazon Nova | 4.7%  |
| 19 | Nova Lite                           | Amazon Nova | 4.6%  |
| 20 | DeepSeek R1 Distill Qwen 14B        | DeepSeek    | 4.4%  |
| 21 | Llama 4 Scout 17B                   | Meta Llama  | 4.3%  |
| 22 | Qwen3 32B (mode: non-reasoning)     | Qwen        | 4.3%  |
| 23 | Qwen3 14B (mode: reasoning)         | Qwen        | 4.3%  |
| 24 | Qwen3 14B (mode: non-reasoning)     | Qwen        | 4.2%  |
| 25 | Qwen3 8B (mode: reasoning)          | Qwen        | 4.2%  |
| 26 | Qwen2.5 72B Instruct                | Qwen        | 4.2%  |
| 27 | DeepSeek R1 Distill Llama 8B        | DeepSeek    | 4.2%  |
| 28 | Nova 2.0 Lite (mode: low)           | Amazon Nova | 4.2%  |
| 29 | Llama 3.3 70B Instruct              | Meta Llama  | 4.0%  |
| 30 | Qwen2.5 32B Instruct                | Qwen        | 3.8%  |
| 31 | Qwen3 4B (mode: non-reasoning)      | Qwen        | 3.7%  |
| 32 | Nova Pro                            | Amazon Nova | 3.4%  |
| 33 | DeepSeek R1 Distill Qwen 1.5B       | DeepSeek    | 3.3%  |
| 34 | Nova 2.0 Lite (mode: non-reasoning) | Amazon Nova | 3.0%  |
| 35 | Qwen3 8B (mode: non-reasoning)      | Qwen        | 2.8%  |
| —  | Qwen2.5 14B Instruct                | Qwen        | —     |
| —  | Qwen2.5 7B Instruct                 | Qwen        | —     |
| —  | DeepSeek R1 Distill Qwen 7B         | DeepSeek    | —     |
