knowledge benchmark · included in ECI
HLE
Humanity's Last Exam: expert-written questions across many subjects.
Results
4
Random baseline
4.8%
Score ceiling
100%
Released
23 Jan 2025
Score by model release date
Best score by organisation
Leaderboard
| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | Kimi K2.5 Open source MoonshotAI | 24.4% | — | 27 Jan 2026 | — | External ↗ | |
| 2 | GLM 4.5 Open source Z.ai | 8.3% | — | 25 Jul 2025 | — | External ↗ | |
| 3 | GLM 4.5 Air Open source Z.ai | 8.1% | — | 25 Jul 2025 | — | External ↗ | |
| 4 | Llama 4 Maverick Open source Meta | 5.7% | — | 6 Apr 2025 | — | External ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.