coding benchmark · included in ECI
GSO-Bench
GSO-Bench benchmark (score column: Score OPT@1).
Results
36
Random baseline
0.0%
Score ceiling
100%
Released
29 May 2025
Score by model release date
Best score by organisation
Leaderboard
| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.8 Anthropic | 47.1% | unknown | 28 May 2026 | — | Source ↗ | |
| 2 | Claude Opus 4.7 Anthropic | 44.1% | high | 16 Apr 2026 | — | Source ↗ | |
| 3 | Claude Opus 4.7 (no thinking) Anthropic | 44.1% | — | 16 Apr 2026 | — | Source ↗ | |
| 4 | Claude Opus 4.6 Anthropic | 41.2% | high | 5 Feb 2026 | — | Source ↗ | |
| 5 | GPT-5.5 (xhigh) OpenAI | 40.2% | xhigh | 23 Apr 2026 | — | Source ↗ | |
| 6 | Claude Sonnet 5 (unknown thinking) Anthropic | 37.3% | unknown | 30 Jun 2026 | — | Source ↗ | |
| 7 | Claude Opus 4.6 (no thinking) Anthropic | 33.3% | — | 5 Feb 2026 | — | Source ↗ | |
| 8 | Claude Opus 4.6 (unknown thinking) Anthropic | 33.3% | unknown | 5 Feb 2026 | — | Source ↗ | |
| 9 | GPT-5.4 (xhigh) OpenAI | 31.4% | xhigh | 5 Mar 2026 | — | Source ↗ | |
| 10 | GPT-5.2 OpenAI | 27.5% | high | 11 Dec 2025 | — | Source ↗ | |
| 11 | Claude Opus 4.5 (no thinking) Anthropic | 26.5% | — | 24 Nov 2025 | — | Source ↗ | |
| 12 | Claude Opus 4.5 (unknown thinking) Anthropic | 26.5% | unknown | 24 Nov 2025 | — | Source ↗ | |
| 13 | GPT-5.4 OpenAI | 25.5% | high | 5 Mar 2026 | — | Source ↗ | |
| 14 | Gemini 3.1 Pro Preview Google | 22.6% | — | 19 Feb 2026 | — | Source ↗ | |
| 15 | Gemini 3 Pro Preview Google DeepMind | 18.6% | — | 18 Nov 2025 | — | Source ↗ | |
| 16 | Claude Sonnet 4.5 (unknown thinking) Anthropic | 14.7% | unknown | 29 Sep 2025 | — | Source ↗ | |
| 17 | Claude Sonnet 4.5 (no thinking) Anthropic | 14.7% | — | 29 Sep 2025 | — | Source ↗ | |
| 18 | GPT-5.1 (unknown thinking) OpenAI | 13.7% | unknown | 13 Nov 2025 | — | Source ↗ | |
| 19 | GPT-5.1 OpenAI | 13.7% | high | 13 Nov 2025 | — | Source ↗ | |
| 20 | Gemini 3 Flash Preview Google | 9.8% | — | 17 Dec 2025 | — | Source ↗ | |
| 21 | o3 OpenAI | 8.8% | high | 16 Apr 2025 | — | Source ↗ | |
| 22 | Claude Opus 4 Anthropic | 6.9% | — | 22 May 2025 | — | Source ↗ | |
| 23 | GPT-5 OpenAI | 6.9% | high | 7 Aug 2025 | — | Source ↗ | |
| 24 | Qwen3 Coder 480B A35B Open source Qwen | 4.9% | — | 23 Jul 2025 | — | Source ↗ | |
| 25 | Kimi K2 Instruct Open source Moonshot | 4.9% | — | 12 Jul 2025 | — | Source ↗ | |
| 26 | Claude Sonnet 4 Anthropic | 4.9% | — | 22 May 2025 | — | Source ↗ | |
| 27 | Claude Sonnet 4 (unknown thinking) Anthropic | 4.9% | unknown | 22 May 2025 | — | Source ↗ | |
| 28 | Claude 3.5 Sonnet (Oct 2024) Anthropic | 4.6% | — | 22 Oct 2024 | — | Source ↗ | |
| 29 | Gemini 2.5 Pro (Jun 2025) Google DeepMind | 3.9% | — | 5 Jun 2025 | — | Source ↗ | |
| 30 | Gemini 2.5 Pro Preview (Jun 2025) Google DeepMind | 3.9% | — | 5 Jun 2025 | — | Source ↗ | |
| 31 | Claude 3.7 Sonnet Anthropic | 3.8% | — | 24 Feb 2025 | — | Source ↗ | |
| 32 | Claude 3.7 Sonnet (unknown thinking) Anthropic | 3.8% | unknown | 24 Feb 2025 | — | Source ↗ | |
| 33 | o4 Mini OpenAI | 3.6% | high | 16 Apr 2025 | — | Source ↗ | |
| 34 | GLM 4.5 Air Open source Z.ai | 2.9% | — | 25 Jul 2025 | — | Source ↗ | |
| 35 | o3 Mini OpenAI | 1.3% | low | 31 Jan 2025 | — | Source ↗ | |
| 36 | GPT-4o (Nov 2024) OpenAI | 0.0% | — | 20 Nov 2024 | — | Source ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.