Skip to content
games benchmark · included in ECI

Chess Puzzles

Chess tactics puzzles solved by the model without tools.
Results
65
Random baseline
5.0%
Score ceiling
100%
Released
10 Dec 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek V4 Pro 0813 Open source
DeepSeek
47.0% ±5.0Source ↗
2Kimi K3 Open source
MoonshotAI
39.0% ±4.9Source ↗
3DeepSeek V4 Flash 0731 Open source
DeepSeek
33.0% ±4.7Source ↗
4Qwen3.6 35B A3B Open source
Qwen
26.0% ±4.4Log ↗
5Kimi K2.6 Open source
MoonshotAI
26.0% ±4.4Log ↗
6Qwen3.6 27B Open source
Qwen
22.0% ±4.2Log ↗
7GLM 5.3 Open source
Z.ai
21.0% ±4.1Source ↗
8Inkling (xhigh) Open source
Thinking Machines
21.0% ±4.1Source ↗
9GLM 5.2 Open source
Z.ai
21.0% ±4.1Source ↗
10Kimi K2.7 Code Open source
MoonshotAI
21.0% ±4.1Log ↗
11Kimi K3 (low) Open source
Moonshot
20.0% ±4.0Log ↗
12DeepSeek v4 Pro (high) Open source
DeepSeek
20.0% ±4.0Source ↗
13Kimi K2 Thinking Turbo Open source
Moonshot
20.0% ±4.0Log ↗
14gpt-oss-120b Open source
OpenAI
20.0% ±3.1Log ↗
15GLM 5.1 Open source
Z.ai
19.0% ±3.9Log ↗
16Inkling Small (xhigh) Open source
Thinking Machines
18.0% ±3.9Source ↗
17GLM 5.3 Flash Open source
Z.ai
14.0% ±3.5Source ↗
18MiniMax M3 Open source
MiniMax
14.0% ±3.5Log ↗
19DeepSeek V3.2 Open source
DeepSeek
14.0% ±3.5Log ↗
20Qwen3.5 397B A17B Open source
Qwen
13.0% ±3.4Log ↗
21Nemotron 3 Ultra Open source
NVIDIA
12.0% ±3.3Log ↗
22Qwen3.5-9B Open source
Qwen
12.0% ±3.3Log ↗
23Kimi K2.5 (Fireworks) Open source
Moonshot
12.0% ±3.3Log ↗
24Qwen3-235B-A22B-Thinking (Jul 2025) Open source
Alibaba
12.0% ±3.3Log ↗
25Qwen3.5-35B-A3B Open source
Qwen
10.0% ±3.0Log ↗
26GLM 5 Open source
Z.ai
10.0% ±3.0Log ↗
27Qwen3-30B-A3B-Thinking (Jul 2025) Open source
Alibaba
8.0% ±2.7Log ↗
28DeepSeek v4 Pro (unknown thinking) Open source
DeepSeek
7.0% ±2.6Log ↗
29Gemma 4 26B A4B Open source
Google
6.0% ±2.4Log ↗
30GLM 4.7 Open source
Z.ai
6.0% ±1.6Log ↗
31Gemma 4 31B Open source
Google
5.0% ±2.2Log ↗
32Qwen3 32B Open source
Qwen
5.0% ±2.2Log ↗
33Qwen3 8B Open source
Qwen
5.0% ±2.2Log ↗
34QwQ-32B Open source
Alibaba
5.0% ±2.2Log ↗
35gpt-oss-20b Open source
OpenAI
4.0% ±2.0Log ↗
36Qwen3 14B Open source
Qwen
4.0% ±2.0Log ↗
37Qwen3 30B A3B Open source
Qwen
4.0% ±2.0Log ↗
38Magistral Small 1.2 Open source
Mistral AI
3.0% ±1.7Log ↗
39Qwen3-30B-A3B-Instruct (Jul 2025) Open source
Alibaba
2.0% ±1.4Log ↗
40Mistral Small 3.2 Open source
Mistral AI
1.0% ±1.0Log ↗
41Qwen3-4B Open source
Alibaba
1.0% ±1.0Log ↗
42Mistral Small 3.1 Open source
Mistral AI
1.0% ±1.0Log ↗
43DeepSeek-R1-Distill-Qwen-32B Open source
DeepSeek
1.0% ±1.0Log ↗
44DeepSeek-R1-Distill-Qwen-14B Open source
DeepSeek
1.0% ±1.0Log ↗
45Phi 4 Open source
Microsoft
1.0% ±1.0Log ↗
46Qwen3.5-2B Open source
Alibaba
0.0%Log ↗
47GLM 4.7 Flash Open source
Z.ai
0.0%Log ↗
48Granite 4.0 Micro Open source
IBM
0.0%Log ↗
49Qwen3-1.7B Open source
Alibaba
0.0%Log ↗
50Gemma 3 4B Open source
Google
0.0%Log ↗
51Gemma 3 12B Open source
Google
0.0%Log ↗
52Gemma 3 27B Open source
Google
0.0%Log ↗
53Gemma 3 1B Open source
Google DeepMind
0.0%Log ↗
54Mistral Small 3 Open source
Mistral
0.0%Log ↗
55DeepSeek-R1-Distill-Qwen-1.5B Open source
DeepSeek
0.0%Log ↗
56Llama 3.2 1B Open source
Meta AI
0.0%Log ↗
57Qwen2.5-7B Open source
Alibaba
0.0%Log ↗
58Qwen2.5-32B Open source
Alibaba
0.0%Log ↗
59Llama 3.1-8B Open source
Meta AI
0.0%Log ↗
60Mistral 7B v0.3 Open source
Mistral AI
0.0%Log ↗
61phi-3-mini 3.8B Open source
Microsoft
0.0%Log ↗
62Llama 3-8B Open source
Meta AI
0.0%Log ↗
63DeepSeek LLM 67B Open source
DeepSeek
0.0%Log ↗
64Llama 2-13B Open source
Meta AI
0.0%Log ↗
65Llama 2-7B Open source
Meta AI
0.0%Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.