Skip to content
coding benchmark · included in ECI

Cybench

Cybench benchmark (score column: Unguided % Solved).
Results
22
Random baseline
0.0%
Score ceiling
100%
Released
15 Aug 2024

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Claude Opus 4.6 (unknown thinking)
Anthropic
93.0%Source ↗
2Claude Opus 4.5 (unknown thinking)
Anthropic
82.0%Source ↗
3Claude Sonnet 4.5 (unknown thinking)
Anthropic
60.0%Source ↗
4Claude Sonnet 4.5 (no thinking)
Anthropic
55.0%Source ↗
5Grok 4
xAI
43.0%Source ↗
6Claude Opus 4.1
Anthropic
42.0%Source ↗
7Grok 4.1
xAI
39.0%Source ↗
8Claude Opus 4
Anthropic
38.0%Source ↗
9Claude Sonnet 4
Anthropic
35.0%Source ↗
10Grok 4 Fast
xAI
30.0%Source ↗
11o3-mini (medium)
OpenAI
22.5%Source ↗
12Claude 3.7 Sonnet
Anthropic
20.0%Source ↗
13GPT-4.5 Preview (Feb 2025)
OpenAI
17.5%Source ↗
14Claude 3.5 Sonnet (Jun 2024)
Anthropic
17.5%Source ↗
15GPT-4o (Nov 2024)
OpenAI
12.5%Source ↗
16o1-preview
OpenAI
10.0%Source ↗
17o1-mini (medium)
OpenAI
10.0%Source ↗
18Claude 3 Opus
Anthropic
10.0%Source ↗
19Llama 3.1-405B Open source
Meta AI
7.5%Source ↗
20Mixtral 8x22B Open source
Mistral AI
7.5%Source ↗
21Gemini 1.5 Pro (Feb 2024)
Google DeepMind
7.5%Source ↗
22Llama 3-70B Open source
Meta AI
5.0%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.