Skip to content
knowledge benchmark · included in ECI

HLE

Humanity's Last Exam: expert-written questions across many subjects.
Results
48
Random baseline
4.8%
Score ceiling
100%
Released
23 Jan 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-6 Astra (unknown thinking)
OpenAI
54.8%Source ↗
2Claude Fable 5.1 (xhigh)
Anthropic
46.5%Source ↗
3Gemini 3.1 Pro Preview
Google
46.4%Source ↗
4Gemini 3.8 Flash (unknown)
Google DeepMind
44.5%Source ↗
5GPT-5.4 Pro
OpenAI
44.3%Source ↗
6Muse Spark
Meta AI
40.6%Source ↗
7Gemini 3 Pro Preview
Google DeepMind
37.5%Source ↗
8GPT-5.4 (xhigh)
OpenAI
36.2%Source ↗
9Claude Opus 4.7 (unknown)
Anthropic
36.2%Source ↗
10Claude Opus 4.6
Anthropic
34.4%Source ↗
11GPT-5 Pro
OpenAI
31.6%Source ↗
12GPT-5.2 (unknown thinking)
OpenAI
27.8%Source ↗
13GPT-5
OpenAI
25.3%Source ↗
14GPT-5 (unknown thinking)
OpenAI
25.3%Source ↗
15Claude Opus 4.5 (unknown thinking)
Anthropic
25.2%Source ↗
16Kimi K2.5 Open source
MoonshotAI
24.4%Source ↗
17GPT-5.1 (unknown thinking)
OpenAI
23.7%Source ↗
18Gemini 2.5 Pro Preview (Jun 2025)
Google DeepMind
21.6%Source ↗
19o3
OpenAI
20.3%Source ↗
20GPT-5 mini (unknown thinking)
OpenAI
19.4%Source ↗
21o3 (medium)
OpenAI
19.2%Source ↗
22Claude Opus 4.6 (no thinking)
Anthropic
19.0%Source ↗
23Gemini 2.5 Pro Exp (Mar 2025)
Google DeepMind
18.2%Source ↗
24o4 Mini
OpenAI
18.1%Source ↗
25o4-mini (medium)
OpenAI
14.3%Source ↗
26Claude Sonnet 4.5 (unknown thinking)
Anthropic
13.7%Source ↗
27Gemini 2.5 Flash Preview (Apr 2025)
Google DeepMind
12.1%Source ↗
28Claude Opus 4.1 (unknown thinking)
Anthropic
11.5%Source ↗
29Gemini 2.5 Flash (May 2025)
Google DeepMind
11.0%Source ↗
30Claude Opus 4
Anthropic
10.7%Source ↗
31Gemini 3.1 Flash Lite
Google
8.6%Source ↗
32GLM 4.5 Open source
Z.ai
8.3%Source ↗
33GLM 4.5 Air Open source
Z.ai
8.1%Source ↗
34o1-pro
OpenAI
8.1%Source ↗
35Claude 3.7 Sonnet (unknown thinking)
Anthropic
8.0%Source ↗
36o1 (unknown thinking)
OpenAI
8.0%Source ↗
37Claude Sonnet 4 (unknown thinking)
Anthropic
7.8%Source ↗
38GPT-5.1 (no thinking)
OpenAI
6.8%Source ↗
39Gemini 2.0 Flash Thinking Exp
Google DeepMind,Google
6.6%Source ↗
40Llama 4 Maverick Open source
Meta
5.7%Source ↗
41GPT-4.5 Preview (Feb 2025)
OpenAI
5.4%Source ↗
42GPT-4.1
OpenAI
5.4%Source ↗
43Gemini 1.5 Pro (Sept 2024)
Google DeepMind
4.6%Source ↗
44Mistral Medium 3
Mistral
4.5%Source ↗
45Amazon Nova Pro
Amazon
4.4%Source ↗
46Claude 3.5 Sonnet (Oct 2024)
Anthropic
4.1%Source ↗
47Amazon Nova Lite
Amazon
3.6%Source ↗
48GPT-4o (Nov 2024)
OpenAI
2.7%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.