Skip to content
coding benchmark · included in ECI

GSO-Bench

GSO-Bench benchmark (score column: Score OPT@1).
Results
36
Random baseline
0.0%
Score ceiling
100%
Released
29 May 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Claude Opus 4.8
Anthropic
47.1%Source ↗
2Claude Opus 4.7
Anthropic
44.1%Source ↗
3Claude Opus 4.7 (no thinking)
Anthropic
44.1%Source ↗
4Claude Opus 4.6
Anthropic
41.2%Source ↗
5GPT-5.5 (xhigh)
OpenAI
40.2%Source ↗
6Claude Sonnet 5 (unknown thinking)
Anthropic
37.3%Source ↗
7Claude Opus 4.6 (no thinking)
Anthropic
33.3%Source ↗
8Claude Opus 4.6 (unknown thinking)
Anthropic
33.3%Source ↗
9GPT-5.4 (xhigh)
OpenAI
31.4%Source ↗
10GPT-5.2
OpenAI
27.5%Source ↗
11Claude Opus 4.5 (no thinking)
Anthropic
26.5%Source ↗
12Claude Opus 4.5 (unknown thinking)
Anthropic
26.5%Source ↗
13GPT-5.4
OpenAI
25.5%Source ↗
14Gemini 3.1 Pro Preview
Google
22.6%Source ↗
15Gemini 3 Pro Preview
Google DeepMind
18.6%Source ↗
16Claude Sonnet 4.5 (unknown thinking)
Anthropic
14.7%Source ↗
17Claude Sonnet 4.5 (no thinking)
Anthropic
14.7%Source ↗
18GPT-5.1 (unknown thinking)
OpenAI
13.7%Source ↗
19GPT-5.1
OpenAI
13.7%Source ↗
20Gemini 3 Flash Preview
Google
9.8%Source ↗
21o3
OpenAI
8.8%Source ↗
22Claude Opus 4
Anthropic
6.9%Source ↗
23GPT-5
OpenAI
6.9%Source ↗
24Qwen3 Coder 480B A35B Open source
Qwen
4.9%Source ↗
25Kimi K2 Instruct Open source
Moonshot
4.9%Source ↗
26Claude Sonnet 4
Anthropic
4.9%Source ↗
27Claude Sonnet 4 (unknown thinking)
Anthropic
4.9%Source ↗
28Claude 3.5 Sonnet (Oct 2024)
Anthropic
4.6%Source ↗
29Gemini 2.5 Pro (Jun 2025)
Google DeepMind
3.9%Source ↗
30Gemini 2.5 Pro Preview (Jun 2025)
Google DeepMind
3.9%Source ↗
31Claude 3.7 Sonnet
Anthropic
3.8%Source ↗
32Claude 3.7 Sonnet (unknown thinking)
Anthropic
3.8%Source ↗
33o4 Mini
OpenAI
3.6%Source ↗
34GLM 4.5 Air Open source
Z.ai
2.9%Source ↗
35o3 Mini
OpenAI
1.3%Source ↗
36GPT-4o (Nov 2024)
OpenAI
0.0%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.