Skip to content
coding benchmark · included in ECI

Aider polyglot

Code editing exercises in C++, Go, Java, JavaScript, Python and Rust.
Results
19
Random baseline
0.0%
Score ceiling
100%
Released
21 Dec 2024

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek V3.2 Open source
DeepSeek
74.2%External ↗
2DeepSeek V3.2 Exp Open source
DeepSeek
74.2%Aider LLM Leaderboards ↗
3DeepSeek-R1 (May 2025) Open source
DeepSeek
71.4%External ↗
4Qwen3-235B-A22B-Instruct (Jul 2025) Open source
Alibaba
59.6%External ↗
5Qwen3 235B A22B Open source
Qwen
59.6%Aider LLM Leaderboards ↗
6Kimi K2 0905 (Novita) Open source
Moonshot
59.1%External ↗
7Kimi K2 Instruct Open source
Moonshot
59.1%Aider LLM Leaderboards ↗
8R1 Open source
DeepSeek
56.9%External ↗
9DeepSeek-V3 (Mar 2025) Open source
DeepSeek
55.1%External ↗
10DeepSeek V3 Open source
DeepSeek
48.4%Aider LLM Leaderboards ↗
11gpt-oss-120b Open source
OpenAI
41.8%Aider LLM Leaderboards ↗
12Qwen3 32B Open source
Qwen
40.0%External ↗
13QwQ-32B Open source
Alibaba
20.9%External ↗
14DeepSeek-V2.5 (Sep 2024) Open source
DeepSeek
17.8%External ↗
15Qwen2.5 Coder 32B Instruct Open source
qwen
16.4%Aider LLM Leaderboards ↗
16Llama 4 Maverick Open source
Meta
15.6%External ↗
17Cohere Command A Open source
Cohere
12.0%External ↗
18Codestral Open source
Mistral AI
11.1%External ↗
19Gemma 3 27B Open source
Google
4.9%External ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.