knowledge benchmark · included in ECI
HLE
Humanity's Last Exam: expert-written questions across many subjects.
Results
48
Random baseline
4.8%
Score ceiling
100%
Released
23 Jan 2025
Score by model release date
Best score by organisation
Leaderboard
| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra (unknown thinking) OpenAI | 54.8% | unknown | 3 Sep 2026 | — | Source ↗ | |
| 2 | Claude Fable 5.1 (xhigh) Anthropic | 46.5% | xhigh | 1 Sep 2026 | — | Source ↗ | |
| 3 | Gemini 3.1 Pro Preview Google | 46.4% | — | 19 Feb 2026 | — | Source ↗ | |
| 4 | Gemini 3.8 Flash (unknown) Google DeepMind | 44.5% | unknown | 2 Sep 2026 | — | Source ↗ | |
| 5 | GPT-5.4 Pro OpenAI | 44.3% | unknown | 5 Mar 2026 | — | Source ↗ | |
| 6 | Muse Spark Meta AI | 40.6% | — | 8 Apr 2026 | — | Source ↗ | |
| 7 | Gemini 3 Pro Preview Google DeepMind | 37.5% | — | 18 Nov 2025 | — | Source ↗ | |
| 8 | GPT-5.4 (xhigh) OpenAI | 36.2% | xhigh | 5 Mar 2026 | — | Source ↗ | |
| 9 | Claude Opus 4.7 (unknown) Anthropic | 36.2% | unknown | 16 Apr 2026 | — | Source ↗ | |
| 10 | Claude Opus 4.6 Anthropic | 34.4% | max | 5 Feb 2026 | — | Source ↗ | |
| 11 | GPT-5 Pro OpenAI | 31.6% | unknown | 7 Oct 2025 | — | Source ↗ | |
| 12 | GPT-5.2 (unknown thinking) OpenAI | 27.8% | unknown | 11 Dec 2025 | — | Source ↗ | |
| 13 | GPT-5 OpenAI | 25.3% | high | 7 Aug 2025 | — | Source ↗ | |
| 14 | GPT-5 (unknown thinking) OpenAI | 25.3% | unknown | 7 Aug 2025 | — | Source ↗ | |
| 15 | Claude Opus 4.5 (unknown thinking) Anthropic | 25.2% | unknown | 24 Nov 2025 | — | Source ↗ | |
| 16 | Kimi K2.5 Open source MoonshotAI | 24.4% | — | 27 Jan 2026 | — | Source ↗ | |
| 17 | GPT-5.1 (unknown thinking) OpenAI | 23.7% | unknown | 13 Nov 2025 | — | Source ↗ | |
| 18 | Gemini 2.5 Pro Preview (Jun 2025) Google DeepMind | 21.6% | — | 5 Jun 2025 | — | Source ↗ | |
| 19 | o3 OpenAI | 20.3% | high | 16 Apr 2025 | — | Source ↗ | |
| 20 | GPT-5 mini (unknown thinking) OpenAI | 19.4% | unknown | 7 Aug 2025 | — | Source ↗ | |
| 21 | o3 (medium) OpenAI | 19.2% | medium | 16 Apr 2025 | — | Source ↗ | |
| 22 | Claude Opus 4.6 (no thinking) Anthropic | 19.0% | — | 5 Feb 2026 | — | Source ↗ | |
| 23 | Gemini 2.5 Pro Exp (Mar 2025) Google DeepMind | 18.2% | — | 25 Mar 2025 | — | Source ↗ | |
| 24 | o4 Mini OpenAI | 18.1% | high | 16 Apr 2025 | — | Source ↗ | |
| 25 | o4-mini (medium) OpenAI | 14.3% | medium | 16 Apr 2025 | — | Source ↗ | |
| 26 | Claude Sonnet 4.5 (unknown thinking) Anthropic | 13.7% | unknown | 29 Sep 2025 | — | Source ↗ | |
| 27 | Gemini 2.5 Flash Preview (Apr 2025) Google DeepMind | 12.1% | — | 17 Apr 2025 | — | Source ↗ | |
| 28 | Claude Opus 4.1 (unknown thinking) Anthropic | 11.5% | unknown | 5 Aug 2025 | — | Source ↗ | |
| 29 | Gemini 2.5 Flash (May 2025) Google DeepMind | 11.0% | — | 20 May 2025 | — | Source ↗ | |
| 30 | Claude Opus 4 Anthropic | 10.7% | unknown | 22 May 2025 | — | Source ↗ | |
| 31 | Gemini 3.1 Flash Lite Google | 8.6% | — | 3 Mar 2026 | — | Source ↗ | |
| 32 | GLM 4.5 Open source Z.ai | 8.3% | — | 25 Jul 2025 | — | Source ↗ | |
| 33 | GLM 4.5 Air Open source Z.ai | 8.1% | — | 25 Jul 2025 | — | Source ↗ | |
| 34 | o1-pro OpenAI | 8.1% | — | 19 Mar 2025 | — | Source ↗ | |
| 35 | Claude 3.7 Sonnet (unknown thinking) Anthropic | 8.0% | unknown | 24 Feb 2025 | — | Source ↗ | |
| 36 | o1 (unknown thinking) OpenAI | 8.0% | unknown | 17 Dec 2024 | — | Source ↗ | |
| 37 | Claude Sonnet 4 (unknown thinking) Anthropic | 7.8% | unknown | 22 May 2025 | — | Source ↗ | |
| 38 | GPT-5.1 (no thinking) OpenAI | 6.8% | none | 13 Nov 2025 | — | Source ↗ | |
| 39 | Gemini 2.0 Flash Thinking Exp Google DeepMind,Google | 6.6% | — | 21 Jan 2025 | — | Source ↗ | |
| 40 | Llama 4 Maverick Open source Meta | 5.7% | — | 6 Apr 2025 | — | Source ↗ | |
| 41 | GPT-4.5 Preview (Feb 2025) OpenAI | 5.4% | — | 27 Feb 2025 | — | Source ↗ | |
| 42 | GPT-4.1 OpenAI | 5.4% | — | 14 Apr 2025 | — | Source ↗ | |
| 43 | Gemini 1.5 Pro (Sept 2024) Google DeepMind | 4.6% | — | 24 Sep 2024 | — | Source ↗ | |
| 44 | Mistral Medium 3 Mistral | 4.5% | — | 7 May 2025 | — | Source ↗ | |
| 45 | Amazon Nova Pro Amazon | 4.4% | — | 3 Dec 2024 | — | Source ↗ | |
| 46 | Claude 3.5 Sonnet (Oct 2024) Anthropic | 4.1% | — | 22 Oct 2024 | — | Source ↗ | |
| 47 | Amazon Nova Lite Amazon | 3.6% | — | 3 Dec 2024 | — | Source ↗ | |
| 48 | GPT-4o (Nov 2024) OpenAI | 2.7% | — | 20 Nov 2024 | — | Source ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.