Skip to content
coding benchmark · included in ECI

CadEval

CadEval benchmark (score column: Overall pass (%)).
Results
14
Random baseline
0.0%
Score ceiling
100%
Released
22 Apr 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1o3 (medium)
OpenAI
74.0%Source ↗
2Gemini 2.5 Pro Preview (Mar 2025)
Google DeepMind
64.0%Source ↗
3o4-mini (medium)
OpenAI
62.0%Source ↗
4o1 (medium)
OpenAI
56.0%Source ↗
5Claude 3.7 Sonnet
Anthropic
54.0%Source ↗
6o3-mini (medium)
OpenAI
54.0%Source ↗
7Claude 3.5 Sonnet (Oct 2024)
Anthropic
48.0%Source ↗
8GPT-4.1
OpenAI
42.0%Source ↗
9Gemini 1.5 Pro (Sept 2024)
Google DeepMind
34.0%Source ↗
10Claude 3.5 Haiku (Oct 2024)
Anthropic
32.0%Source ↗
11Gemini 2.0 Flash (Feb 2025)
Google DeepMind,Google
30.0%Source ↗
12GPT-4o (Aug 2024)
OpenAI
26.0%Source ↗
13GPT-4.1 Mini
OpenAI
16.0%Source ↗
14Claude 3 Haiku
Anthropic
12.0%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.