Skip to content
math benchmark · included in ECI

FrontierMath-Tiers-1-3-v2-Private

Unpublished, expert-written research-level mathematics problems (tiers 1-3).
Results
95
Random baseline
0.0%
Score ceiling
100%
Released
12 Jun 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-6 Astra
OpenAI
93.7% ±1.4Source ↗
2Claude Fable 5.1
Anthropic
90.2% ±1.8Source ↗
3GPT-5.6 Sol
OpenAI
89.1% ±1.8Log ↗
4GPT-5.5 Pro (xhigh)
OpenAI
87.7% ±1.9Source ↗
5Claude Fable 5
Anthropic
87.0% ±2.0Log ↗
6GPT-5.6 Terra
OpenAI
86.0% ±2.1Log ↗
7Claude Opus 5
Anthropic
85.6% ±2.1Log ↗
8GPT-5.5 (xhigh)
OpenAI
85.3% ±2.1Source ↗
9GPT-5.4 Pro (xhigh)
OpenAI
82.5% ±2.3Log ↗
10GPT-5.6 Luna
OpenAI
82.1% ±2.3Log ↗
11Claude Opus 4.8
Anthropic
80.0% ±2.4Log ↗
12GPT-5.4 (xhigh)
OpenAI
78.6% ±2.4Log ↗
13Qwen3.8 Max (xhigh)
Alibaba
74.7% ±2.6Log ↗
14Muse Spark 1.3 (xhigh)
Meta AI
74.4% ±2.6Source ↗
15Muse Spark 1.3
Meta
74.0% ±2.6Source ↗
16GPT-5.2 Pro
OpenAI
74.0% ±2.6Source ↗
17Kimi K3 Open source
MoonshotAI
72.2% ±2.7Source ↗
18Gemini 3.7 Flash
Google
71.6% ±2.7Log ↗
19Claude Opus 4.7
Anthropic
70.2% ±2.7Log ↗
20GLM 5.3 Open source
Z.ai
68.8% ±2.7Source ↗
21Gemini 3.8 Flash
Google
68.4% ±2.8Source ↗
22GPT-5.2 (xhigh)
OpenAI
67.4% ±2.8Source ↗
23Grok 4.6 (xhigh)
xAI
66.0% ±2.8Log ↗
24Claude Opus 4.6
Anthropic
66.0% ±2.8Log ↗
25Qwen3.8 Max (0902) (xhigh)
Alibaba
65.6% ±2.8Source ↗
26Claude Sonnet 5
Anthropic
65.6% ±2.8Log ↗
27DeepSeek V4 Pro 0813 Open source
DeepSeek
64.6% ±2.8Log ↗
28Qwen3.7 Max
Qwen
64.6% ±2.8Log ↗
29Gemini 3.5 Flash
Google
62.8% ±2.9Log ↗
30Gemini 3.1 Pro Preview
Google
59.6% ±2.9Log ↗
31GLM 5.2 Open source
Z.ai
59.2% ±3.0Source ↗
32Gemini 3.6 Flash
Google
58.9% ±2.9Log ↗
33DeepSeek V4 Flash 0731 Open source
DeepSeek
57.5% ±2.9Log ↗
34Grok 4.5
SpaceXAI
57.2% ±2.9Source ↗
35Kimi K2.6 Open source
MoonshotAI
57.2% ±2.9Log ↗
36GLM 5.3 Flash Open source
Z.ai
55.8% ±2.9Source ↗
37GPT-5 Pro
OpenAI
55.8% ±2.9Log ↗
38GPT-5
OpenAI
55.4% ±2.9Source ↗
39Kimi K2.7 Code Open source
MoonshotAI
54.0% ±3.0Log ↗
40GPT-5.4 mini (xhigh)
OpenAI
51.2% ±3.0Source ↗
41Gemini 3 Flash Preview
Google
51.2% ±3.0Log ↗
42GPT-5 Mini
OpenAI
46.7% ±3.0Log ↗
43Inkling Small (xhigh) Open source
Thinking Machines
46.3% ±3.0Log ↗
44DeepSeek v4 Pro (high) Open source
DeepSeek
45.3% ±3.0Log ↗
45GPT-5.4 Nano
OpenAI
44.9% ±3.0Log ↗
46Grok 4.20
SpaceXAI
44.9% ±3.0Log ↗
47Grok 4.3 Beta
xAI
42.8% ±2.9Log ↗
48GPT-5.6 Luna (low)
OpenAI
41.4% ±2.9Log ↗
49GPT-5.6 Luna (none)
OpenAI
39.6% ±2.9Log ↗
50Qwen 3.6 Plus (2026-04-02)
Alibaba
38.2% ±2.9Log ↗
51GPT-5 (low)
OpenAI
37.2% ±2.9Log ↗
52GLM 5.1 Open source
Z.ai
36.8% ±2.9Log ↗
53o4 Mini
OpenAI
36.1% ±2.9Log ↗
54Qwen3.6 27B Open source
Qwen
35.1% ±2.8Log ↗
55Qwen3.7 Plus
Qwen
34.4% ±2.8Log ↗
56Claude Opus 4.5 (32k thinking)
Anthropic
34.4% ±2.8Log ↗
57Inkling (xhigh) Open source
Thinking Machines
33.3% ±2.8Log ↗
58o3
OpenAI
33.3% ±2.8Log ↗
59Qwen3.5 397B A17B Open source
Qwen
31.2% ±2.7Log ↗
60o3 (medium)
OpenAI
29.8% ±2.7Log ↗
61o4-mini (medium)
OpenAI
28.8% ±2.7Log ↗
62Gemini 3.1 Flash Lite
Google
27.7% ±2.7Log ↗
63GPT-5.5 Instant
OpenAI
26.3% ±2.6Log ↗
64Gemini 3.5 Flash Lite
Google
26.0% ±2.6Log ↗
65GPT-5.4 mini (low)
OpenAI
24.6% ±2.6Log ↗
66Gemini 2.5 Pro (Jun 2025)
Google DeepMind
24.6% ±2.6Log ↗
67Claude Sonnet 4.5 (32k thinking)
Anthropic
23.9% ±2.5Log ↗
68Qwen 3.6 Flash (2026-04-16)
Alibaba
22.5% ±2.5Log ↗
69Qwen3.6 35B A3B Open source
Qwen
20.4% ±2.4Log ↗
70GPT-5.4 nano (low)
OpenAI
20.4% ±2.4Log ↗
71GPT-5 Nano
OpenAI
20.0% ±2.4Log ↗
72Qwen3.7 Flash
Qwen
19.3% ±2.3Log ↗
73o3 (low)
OpenAI
19.3% ±2.3Log ↗
74Qwen3-Max-Instruct
Alibaba
18.9% ±2.3Log ↗
75o3 Mini
OpenAI
18.6% ±2.3Log ↗
76Qwen3.5-Flash
Qwen
18.2% ±2.3Log ↗
77GPT-5 (minimal)
OpenAI
18.2% ±2.3Log ↗
78GPT-5 mini (low)
OpenAI
18.2% ±2.3Log ↗
79GPT-5.4 mini (none)
OpenAI
17.2% ±2.2Log ↗
80o4-mini (low)
OpenAI
16.1% ±2.2Log ↗
81o1
OpenAI
14.7% ±2.1Log ↗
82Claude Opus 4.1
Anthropic
12.6% ±2.0Log ↗
83o3-mini (medium)
OpenAI
10.5% ±1.8Log ↗
84o1 (medium)
OpenAI
10.2% ±1.8Log ↗
85o1 (low)
OpenAI
8.4% ±1.6Log ↗
86GPT-4.1 Mini
OpenAI
6.7% ±1.5Log ↗
87GPT-5 mini (minimal)
OpenAI
6.0% ±1.4Log ↗
88GPT-5 nano (low)
OpenAI
6.0% ±1.4Log ↗
89GPT-4.1
OpenAI
6.0% ±1.4Log ↗
90GPT-5.4 nano (no thinking)
OpenAI
4.6% ±1.2Log ↗
91GPT-5 nano (minimal)
OpenAI
1.8% ±0.8Log ↗
92GPT-4o-mini
OpenAI
0.7% ±0.5Log ↗
93GPT-4 Turbo (Apr 2024)
OpenAI
0.7% ±0.5Log ↗
94GPT-4o (Aug 2024)
OpenAI
0.4% ±0.4Log ↗
95GPT-3.5 Turbo (Jan 2024)
OpenAI
0.0%Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.