Skip to content
other benchmark · included in ECI

FrontierSWE

FrontierSWE benchmark (score column: Score).
Results
16
Random baseline
0.0%
Score ceiling
100%
Released
2 Sep 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-6 Astra
OpenAI
65.5%Source ↗
2Claude Opus 5.5
Anthropic
62.3%Source ↗
3Claude Sonnet 5.5
Anthropic
61.9%Source ↗
4Claude Fable 5.1
Anthropic
56.3%Source ↗
5Claude Opus 5
Anthropic
52.0%Source ↗
6Claude Fable 5
Anthropic
47.0%Source ↗
7GPT-5.6 Sol
OpenAI
32.2%Source ↗
8GLM 5.3 Open source
Z.ai
30.2%Source ↗
9Grok 4.7 (xhigh)
xAI
29.5%Source ↗
10Kimi K3 Open source
MoonshotAI
25.9%Source ↗
11Grok 4.6 (xhigh)
xAI
25.3%Source ↗
12Gemini 3.7 Flash
Google
20.3%Source ↗
13Gemini 3.8 Flash
Google
19.6%Source ↗
14Qwen3.8 Max (xhigh)
Alibaba
15.8%Source ↗
15Muse Spark 1.2 (xhigh)
Meta AI
12.0%Source ↗
16Inkling (xhigh) Open source
Thinking Machines
4.1%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.