Skip to content
knowledge benchmark · included in ECI

HLE

Humanity's Last Exam: expert-written questions across many subjects.
Results
4
Random baseline
4.8%
Score ceiling
100%
Released
23 Jan 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Kimi K2.5 Open source
MoonshotAI
24.4%External ↗
2GLM 4.5 Open source
Z.ai
8.3%External ↗
3GLM 4.5 Air Open source
Z.ai
8.1%External ↗
4Llama 4 Maverick Open source
Meta
5.7%External ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.