Skip to content
math benchmark · included in ECI

FrontierMath-Tier-4-v2-Private

The hardest FrontierMath tier: research problems that take experts days.
Results
63
Random baseline
0.0%
Score ceiling
100%
Released
12 Jun 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-6 Astra
OpenAI
97.6% ±2.4Source ↗
2GPT-6 Astra (xhigh)
OpenAI
97.6% ±2.4Source ↗
3GPT-6 Astra (medium)
OpenAI
97.6% ±2.4Source ↗
4Claude Fable 5
Anthropic
90.2% ±4.6Log ↗
5GPT-6 Astra (low)
OpenAI
87.8% ±5.2Source ↗
6Claude Fable 5.1
Anthropic
87.8% ±5.2Source ↗
7GPT-6 Astra (none)
OpenAI
82.9% ±5.9Source ↗
8GPT-5.6 Sol
OpenAI
82.9% ±5.9Log ↗
9GPT-5.6 Sol (pro, max)
OpenAI
80.5% ±6.3Log ↗
10GPT-5.5 Pro (xhigh)
OpenAI
78.0% ±6.5Source ↗
11AI co-mathematician
Google DeepMind
75.6% ±6.7Source ↗
12Claude Opus 5
Anthropic
73.2% ±7.0Log ↗
13GPT-5.5 (xhigh)
OpenAI
72.5% ±7.1Source ↗
14GPT-5.6 Terra
OpenAI
70.7% ±7.2Log ↗
15GPT-5.6 Luna
OpenAI
61.0% ±7.7Log ↗
16GPT-5.4 Pro (xhigh)
OpenAI
58.5% ±7.8Log ↗
17Claude Opus 4.8
Anthropic
56.1% ±7.8Log ↗
18GPT-5.4 (xhigh)
OpenAI
49.0% ±8.0Log ↗
19Muse Spark 1.3
Meta
46.3% ±7.9Source ↗
20Qwen3.8 Max (xhigh)
Alibaba
46.3% ±7.9Log ↗
21GPT-5.2 Pro
OpenAI
46.0% ±7.8Source ↗
22Muse Spark 1.3 (xhigh)
Meta AI
41.5% ±7.8Source ↗
23Kimi K3 Open source
MoonshotAI
39.0% ±7.7Log ↗
24Gemini 3.7 Flash
Google
36.6% ±7.6Log ↗
25Qwen3.8 Max (0902) (xhigh)
Alibaba
34.1% ±7.5Source ↗
26Qwen3.7 Max
Qwen
34.1% ±7.5Log ↗
27Grok 4.6 (xhigh)
xAI
31.7% ±7.4Log ↗
28Claude Opus 4.7
Anthropic
31.7% ±7.4Log ↗
29GPT-5.2 (xhigh)
OpenAI
31.7% ±7.3Source ↗
30GLM 5.3 Open source
Z.ai
29.3% ±7.2Source ↗
31Claude Sonnet 5
Anthropic
29.3% ±7.2Log ↗
32GLM 5.2 Open source
Z.ai
29.3% ±7.2Log ↗
33DeepSeek V4 Pro 0813 Open source
DeepSeek
26.8% ±7.0Log ↗
34Gemini 3.5 Flash
Google
26.8% ±7.0Log ↗
35Gemini 3.1 Pro Preview
Google
26.8% ±7.0Log ↗
36Claude Opus 4.6
Anthropic
26.8% ±7.0Log ↗
37Kimi K2.6 Open source
MoonshotAI
25.6% ±7.1Log ↗
38DeepSeek V4 Flash 0731 Open source
DeepSeek
24.4% ±6.8Log ↗
39Grok 4.5
SpaceXAI
24.4% ±6.8Source ↗
40Gemini 3.8 Flash
Google
22.0% ±6.5Source ↗
41Gemini 3.6 Flash
Google
22.0% ±6.5Log ↗
42GPT-5
OpenAI
22.0% ±6.5Source ↗
43GPT-5 Pro
OpenAI
19.5% ±6.3Log ↗
44GLM 5.3 Flash Open source
Z.ai
17.1% ±5.9Source ↗
45Inkling Small (xhigh) Open source
Thinking Machines
17.1% ±5.9Log ↗
46Grok 4.20
SpaceXAI
17.1% ±5.9Log ↗
47Gemini 3 Flash Preview
Google
17.1% ±5.9Log ↗
48Grok 4.3 Beta
xAI
14.6% ±5.6Log ↗
49Kimi K2.7 Code Open source
MoonshotAI
12.2% ±5.2Log ↗
50GPT-5.4 Nano
OpenAI
12.2% ±5.2Log ↗
51GPT-5 Mini
OpenAI
12.2% ±5.2Log ↗
52GPT-5.4 mini (xhigh)
OpenAI
9.8% ±4.7Source ↗
53Inkling (xhigh) Open source
Thinking Machines
4.9% ±3.4Log ↗
54Claude Opus 4.5 (32k thinking)
Anthropic
4.9% ±3.4Log ↗
55o4 Mini
OpenAI
4.9% ±3.4Log ↗
56GPT-5.5 Instant
OpenAI
2.4% ±2.4Log ↗
57DeepSeek v4 Pro (high) Open source
DeepSeek
2.4% ±2.4Log ↗
58Claude Sonnet 4.5 (32k thinking)
Anthropic
2.4% ±2.4Log ↗
59GPT-5 Nano
OpenAI
2.4% ±2.4Log ↗
60Claude Opus 4.1
Anthropic
2.4% ±2.4Log ↗
61Gemini 3.5 Flash Lite
Google
0.0%Log ↗
62Gemini 2.5 Pro (Jun 2025)
Google DeepMind
0.0%Log ↗
63o3 Mini
OpenAI
0.0%Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.