Skip to content
math benchmark · included in ECI

FrontierMath-Tiers-1-3-v2-Private

Unpublished, expert-written research-level mathematics problems (tiers 1-3).
Results
15
Random baseline
0.0%
Score ceiling
100%
Released
12 Jun 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Kimi K3 Open source
MoonshotAI
72.2% ±2.7Source ↗
2GLM 5.3 Open source
Z.ai
68.8% ±2.7Source ↗
3DeepSeek V4 Pro 0813 Open source
DeepSeek
64.6% ±2.8Log ↗
4GLM 5.2 Open source
Z.ai
59.2% ±3.0Source ↗
5DeepSeek V4 Flash 0731 Open source
DeepSeek
57.5% ±2.9Log ↗
6Kimi K2.6 Open source
MoonshotAI
57.2% ±2.9Log ↗
7GLM 5.3 Flash Open source
Z.ai
55.8% ±2.9Source ↗
8Kimi K2.7 Code Open source
MoonshotAI
54.0% ±3.0Log ↗
9Inkling Small (xhigh) Open source
Thinking Machines
46.3% ±3.0Log ↗
10DeepSeek v4 Pro (high) Open source
DeepSeek
45.3% ±3.0Log ↗
11GLM 5.1 Open source
Z.ai
36.8% ±2.9Log ↗
12Qwen3.6 27B Open source
Qwen
35.1% ±2.8Log ↗
13Inkling (xhigh) Open source
Thinking Machines
33.3% ±2.8Log ↗
14Qwen3.5 397B A17B Open source
Qwen
31.2% ±2.7Log ↗
15Qwen3.6 35B A3B Open source
Qwen
20.4% ±2.4Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.