Skip to content
math benchmark · included in ECI

FrontierMath-Tier-4-v2-Private

The hardest FrontierMath tier: research problems that take experts days.
Results
11
Random baseline
0.0%
Score ceiling
100%
Released
12 Jun 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Kimi K3 Open source
MoonshotAI
39.0% ±7.7Log ↗
2GLM 5.3 Open source
Z.ai
29.3% ±7.2Source ↗
3GLM 5.2 Open source
Z.ai
29.3% ±7.2Log ↗
4DeepSeek V4 Pro 0813 Open source
DeepSeek
26.8% ±7.0Log ↗
5Kimi K2.6 Open source
MoonshotAI
25.6% ±7.1Log ↗
6DeepSeek V4 Flash 0731 Open source
DeepSeek
24.4% ±6.8Log ↗
7GLM 5.3 Flash Open source
Z.ai
17.1% ±5.9Source ↗
8Inkling Small (xhigh) Open source
Thinking Machines
17.1% ±5.9Log ↗
9Kimi K2.7 Code Open source
MoonshotAI
12.2% ±5.2Log ↗
10Inkling (xhigh) Open source
Thinking Machines
4.9% ±3.4Log ↗
11DeepSeek v4 Pro (high) Open source
DeepSeek
2.4% ±2.4Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.