coding benchmark · included in ECI
Cybench
Cybench benchmark (score column: Unguided % Solved).
Results
22
Random baseline
0.0%
Score ceiling
100%
Released
15 Aug 2024
Score by model release date
Best score by organisation
Leaderboard
| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 (unknown thinking) Anthropic | 93.0% | unknown | 5 Feb 2026 | — | Source ↗ | |
| 2 | Claude Opus 4.5 (unknown thinking) Anthropic | 82.0% | unknown | 24 Nov 2025 | — | Source ↗ | |
| 3 | Claude Sonnet 4.5 (unknown thinking) Anthropic | 60.0% | unknown | 29 Sep 2025 | — | Source ↗ | |
| 4 | Claude Sonnet 4.5 (no thinking) Anthropic | 55.0% | — | 29 Sep 2025 | — | Source ↗ | |
| 5 | Grok 4 xAI | 43.0% | — | 9 Jul 2025 | — | Source ↗ | |
| 6 | Claude Opus 4.1 Anthropic | 42.0% | — | 5 Aug 2025 | — | Source ↗ | |
| 7 | Grok 4.1 xAI | 39.0% | — | 17 Nov 2025 | — | Source ↗ | |
| 8 | Claude Opus 4 Anthropic | 38.0% | — | 22 May 2025 | — | Source ↗ | |
| 9 | Claude Sonnet 4 Anthropic | 35.0% | — | 22 May 2025 | — | Source ↗ | |
| 10 | Grok 4 Fast xAI | 30.0% | — | 19 Sep 2025 | — | Source ↗ | |
| 11 | o3-mini (medium) OpenAI | 22.5% | medium | 31 Jan 2025 | — | Source ↗ | |
| 12 | Claude 3.7 Sonnet Anthropic | 20.0% | — | 24 Feb 2025 | — | Source ↗ | |
| 13 | GPT-4.5 Preview (Feb 2025) OpenAI | 17.5% | — | 27 Feb 2025 | — | Source ↗ | |
| 14 | Claude 3.5 Sonnet (Jun 2024) Anthropic | 17.5% | — | 20 Jun 2024 | — | Source ↗ | |
| 15 | GPT-4o (Nov 2024) OpenAI | 12.5% | — | 20 Nov 2024 | — | Source ↗ | |
| 16 | o1-preview OpenAI | 10.0% | — | 12 Sep 2024 | — | Source ↗ | |
| 17 | o1-mini (medium) OpenAI | 10.0% | medium | 12 Sep 2024 | — | Source ↗ | |
| 18 | Claude 3 Opus Anthropic | 10.0% | — | 29 Feb 2024 | — | Source ↗ | |
| 19 | Llama 3.1-405B Open source Meta AI | 7.5% | — | 23 Jul 2024 | — | Source ↗ | |
| 20 | Mixtral 8x22B Open source Mistral AI | 7.5% | — | 17 Apr 2024 | — | Source ↗ | |
| 21 | Gemini 1.5 Pro (Feb 2024) Google DeepMind | 7.5% | — | 15 Feb 2024 | — | Source ↗ | |
| 22 | Llama 3-70B Open source Meta AI | 5.0% | — | 18 Apr 2024 | — | Source ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.