Skip to content
coding benchmark · included in ECI

Aider polyglot

Code editing exercises in C++, Go, Java, JavaScript, Python and Rust.
Results
60
Random baseline
0.0%
Score ceiling
100%
Released
21 Dec 2024

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-5
OpenAI
88.0%Source ↗
2GPT-5 (medium)
OpenAI
86.7%Source ↗
3o3 Pro
OpenAI
84.9%Source ↗
4Gemini 2.5 Pro Preview (Jun 2025)
Google DeepMind
83.1%Source ↗
5GPT-5 (low)
OpenAI
81.3%Source ↗
6o3
OpenAI
81.3%Source ↗
7Grok 4
xAI
79.6%Source ↗
8o3 (medium)
OpenAI
76.9%Source ↗
9o3 (unknown thinking)
OpenAI
76.9%Source ↗
10DeepSeek V3.2 Open source
DeepSeek
74.2%Source ↗
11DeepSeek V3.2 Exp Open source
DeepSeek
74.2%Source ↗
12Gemini 2.5 Pro Preview (Mar 2025)
Google DeepMind
72.9%Source ↗
13Gemini 2.5 Pro Exp (Mar 2025)
Google DeepMind
72.9%Source ↗
14Claude Opus 4
Anthropic
72.0%Source ↗
15o4 Mini
OpenAI
72.0%Source ↗
16DeepSeek-R1 (May 2025) Open source
DeepSeek
71.4%Source ↗
17Claude 3.7 Sonnet (32k thinking)
Anthropic
64.9%Source ↗
18o1
OpenAI
61.7%Source ↗
19Claude Sonnet 4
Anthropic
61.3%Source ↗
20Claude 3.7 Sonnet
Anthropic
60.4%Source ↗
21o3 Mini
OpenAI
60.4%Source ↗
22Qwen3-235B-A22B-Instruct (Jul 2025) Open source
Alibaba
59.6%Source ↗
23Qwen3 235B A22B Open source
Qwen
59.6%Source ↗
24Kimi K2 0905 (Novita) Open source
Moonshot
59.1%Source ↗
25Kimi K2 Instruct Open source
Moonshot
59.1%Source ↗
26R1 Open source
DeepSeek
56.9%Source ↗
27Gemini 2.5 Flash (May 2025)
Google DeepMind
55.1%Source ↗
28DeepSeek-V3 (Mar 2025) Open source
DeepSeek
55.1%Source ↗
29o3-mini (medium)
OpenAI
53.8%Source ↗
30Grok 3
xAI
53.3%Source ↗
31GPT-4.1
OpenAI
52.4%Source ↗
32Claude 3.5 Sonnet (Oct 2024)
Anthropic
51.6%Source ↗
33Grok-3 mini
xAI
49.3%Source ↗
34DeepSeek V3 Open source
DeepSeek
48.4%Source ↗
35Gemini 2.5 Flash Preview (Apr 2025)
Google DeepMind
47.1%Source ↗
36GPT-4o (Mar 2025)
OpenAI
45.3%Source ↗
37GPT-4.5 Preview (Feb 2025)
OpenAI
44.9%Source ↗
38gpt-oss-120b Open source
OpenAI
41.8%Source ↗
39Qwen3 32B Open source
Qwen
40.0%Source ↗
40Gemini 2.0 Flash (Dec 2024)
Google DeepMind,Google
38.2%Source ↗
41Gemini 2.0 Pro Exp (Feb 2025)
Google DeepMind
35.6%Source ↗
42o1-mini (unknown thinking)
OpenAI
32.9%Source ↗
43GPT-4.1 Mini
OpenAI
32.4%Source ↗
44Claude 3.5 Haiku (Oct 2024)
Anthropic
28.0%Source ↗
45GPT-4o (Jan 2025)
OpenAI
27.1%Source ↗
46GPT-4o (Aug 2024)
OpenAI
23.1%Source ↗
47Qwen2.5-Max
Alibaba
21.8%Source ↗
48QwQ-32B Open source
Alibaba
20.9%Source ↗
49Gemini 2.0 Flash Thinking Exp
Google DeepMind,Google
18.2%Source ↗
50GPT-4o (Nov 2024)
OpenAI
18.2%Source ↗
51DeepSeek-V2.5 (Sep 2024) Open source
DeepSeek
17.8%Source ↗
52Qwen2.5 Coder 32B Instruct Open source
qwen
16.4%Source ↗
53Llama 4 Maverick Open source
Meta
15.6%Source ↗
54Yi-Lightning
01.AI
12.9%Source ↗
55Cohere Command A Open source
Cohere
12.0%Source ↗
56Codestral Open source
Mistral AI
11.1%Source ↗
57openhands-lm-32b-v0.1
10.2%Source ↗
58GPT-4.1 Nano
OpenAI
8.9%Source ↗
59Gemma 3 27B Open source
Google
4.9%Source ↗
60GPT-4o-mini
OpenAI
3.6%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.