Skip to content
games benchmark · included in ECI

Chess Puzzles

Chess tactics puzzles solved by the model without tools.
Results
188
Random baseline
5.0%
Score ceiling
100%
Released
10 Dec 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-6 Astra
OpenAI
72.0% ±4.5Source ↗
2GPT-5.6 Sol (pro, max)
OpenAI
64.0% ±4.8Source ↗
3GPT-5.5 Pro (xhigh)
OpenAI
64.0% ±4.8Source ↗
4Gemini 3.8 Flash
Google
61.0% ±4.9Source ↗
5GPT-5.4 Pro (xhigh)
OpenAI
58.6% ±5.0Source ↗
6GPT-5.6 Sol
OpenAI
55.0% ±5.0Source ↗
7Gemini 3.1 Pro Preview
Google
55.0% ±5.0Log ↗
8GPT-5.6 Terra
OpenAI
54.0% ±5.0Source ↗
9GPT-5.5 (xhigh)
OpenAI
54.0% ±5.0Log ↗
10Gemini 3.5 Flash
Google
50.0% ±5.0Log ↗
11GPT-5.2 (xhigh)
OpenAI
49.0% ±5.0Source ↗
12Claude Fable 5.1
Anthropic
47.0% ±5.0Source ↗
13Gemini 3.7 Flash
Google
47.0% ±5.0Source ↗
14DeepSeek V4 Pro 0813 Open source
DeepSeek
47.0% ±5.0Source ↗
15GPT-5.4 (xhigh)
OpenAI
44.0% ±5.0Log ↗
16Gemini 3.6 Flash
Google
43.0% ±5.0Log ↗
17Claude Opus 5
Anthropic
42.0% ±5.0Source ↗
18Claude Fable 5
Anthropic
41.0% ±4.9Log ↗
19Qwen3.8 Max (0902) (xhigh)
Alibaba
40.0% ±4.9Source ↗
20Grok 4.6
SpaceXAI
40.0% ±4.9Source ↗
21GPT-5.6 Luna
OpenAI
40.0% ±4.9Source ↗
22Gemini 3 Flash Preview
Google
40.0% ±4.9Log ↗
23GPT-5.2
OpenAI
40.0% ±4.9Log ↗
24GPT-5.2 (medium)
OpenAI
40.0% ±4.9Log ↗
25Kimi K3 Open source
MoonshotAI
39.0% ±4.9Source ↗
26Muse Spark 1.3
Meta
38.0% ±4.9Source ↗
27GPT-5.4
OpenAI
38.0% ±4.9Log ↗
28GPT-5.4 (medium)
OpenAI
38.0% ±4.9Log ↗
29o3 (medium)
OpenAI
38.0% ±4.9Log ↗
30GPT-5
OpenAI
37.0% ±4.9Log ↗
31Grok 4.5
SpaceXAI
36.0% ±4.8Source ↗
32Muse Spark 1.3 (xhigh)
Meta AI
35.0% ±4.8Source ↗
33Claude Sonnet 5 (xhigh)
Anthropic
35.0% ±4.8Source ↗
34Claude Opus 4.8
Anthropic
34.0% ±4.8Source ↗
35o3
OpenAI
34.0% ±4.8Log ↗
36DeepSeek V4 Flash 0731 Open source
DeepSeek
33.0% ±4.7Source ↗
37GPT-5.1
OpenAI
32.0% ±4.7Log ↗
38Grok 4.6 (xhigh)
xAI
31.0% ±4.6Source ↗
39Gemini 3 Pro Preview
Google DeepMind
31.0% ±4.6Log ↗
40Claude Opus 4.7 (xhigh)
Anthropic
30.0% ±4.6Source ↗
41GPT-5.4 Nano
OpenAI
30.0% ±4.6Log ↗
42GPT-5 Mini
OpenAI
30.0% ±4.6Log ↗
43Qwen3.8 Max (xhigh)
Alibaba
29.0% ±4.6Source ↗
44GPT-5 (medium)
OpenAI
29.0% ±4.6Log ↗
45Claude Fable 5 (low)
Anthropic
28.0% ±4.5Log ↗
46Grok 4
xAI
28.0% ±4.5Log ↗
47GPT-5.6 Sol (low)
OpenAI
27.0% ±4.5Log ↗
48GPT-5 Nano
OpenAI
27.0% ±4.5Log ↗
49o3 (low)
OpenAI
27.0% ±4.5Log ↗
50Qwen3.6 35B A3B Open source
Qwen
26.0% ±4.4Log ↗
51GPT-5.5 (low)
OpenAI
26.0% ±4.4Log ↗
52Kimi K2.6 Open source
MoonshotAI
26.0% ±4.4Log ↗
53o4 Mini
OpenAI
26.0% ±4.4Log ↗
54Grok 4.3 Beta
xAI
25.0% ±4.4Source ↗
55Gemini 3.1 Flash Lite
Google
25.0% ±4.4Log ↗
56Qwen3.7 Plus
Qwen
24.0% ±4.3Log ↗
57GPT-5.4 mini (xhigh)
OpenAI
24.0% ±4.3Log ↗
58Grok 4.20
SpaceXAI
24.0% ±4.3Source ↗
59GPT-5 (low)
OpenAI
24.0% ±4.3Log ↗
60Qwen3.7 Flash
Qwen
23.0% ±4.2Log ↗
61GPT-5.2 (low)
OpenAI
23.0% ±4.2Log ↗
62Gemini 3.5 Flash Lite
Google
22.0% ±4.2Log ↗
63GPT-5.6 Terra (low)
OpenAI
22.0% ±4.2Log ↗
64Qwen3.6 27B Open source
Qwen
22.0% ±4.2Log ↗
65Qwen3.5 Plus 2026-02-15
Qwen
22.0% ±4.2Log ↗
66GLM 5.3 Open source
Z.ai
21.0% ±4.1Source ↗
67Inkling (xhigh) Open source
Thinking Machines
21.0% ±4.1Source ↗
68GPT-5.6 Luna (low)
OpenAI
21.0% ±4.1Log ↗
69GLM 5.2 Open source
Z.ai
21.0% ±4.1Source ↗
70Kimi K2.7 Code Open source
MoonshotAI
21.0% ±4.1Log ↗
71Qwen3.5-Flash
Qwen
21.0% ±4.1Log ↗
72Claude Opus 5 (low)
Anthropic
20.0% ±4.0Log ↗
73Kimi K3 (low) Open source
Moonshot
20.0% ±4.0Log ↗
74Qwen 3.6 Flash (2026-04-16)
Alibaba
20.0% ±4.0Log ↗
75DeepSeek v4 Pro (high) Open source
DeepSeek
20.0% ±4.0Source ↗
76Qwen 3.6 Max (Preview)
Alibaba
20.0% ±4.0Log ↗
77Claude Opus 4.7 (low)
Anthropic
20.0% ±4.0Log ↗
78GPT-5.4 (low)
OpenAI
20.0% ±4.0Log ↗
79Kimi K2 Thinking Turbo Open source
Moonshot
20.0% ±4.0Log ↗
80gpt-oss-120b Open source
OpenAI
20.0% ±3.1Log ↗
81Gemini 2.5 Pro (Jun 2025)
Google DeepMind
20.0% ±4.0Log ↗
82o4-mini (medium)
OpenAI
20.0% ±4.0Log ↗
83Qwen3.7 Max
Qwen
19.0% ±3.9Log ↗
84GLM 5.1 Open source
Z.ai
19.0% ±3.9Log ↗
85Inkling Small (xhigh) Open source
Thinking Machines
18.0% ±3.9Source ↗
86GPT-5.4 Mini
OpenAI
18.0% ±3.9Log ↗
87Qwen 3.6 Plus (2026-04-02)
Alibaba
17.0% ±3.8Log ↗
88GPT-5.4 nano (low)
OpenAI
17.0% ±3.8Log ↗
89Claude Opus 4.6 (32k thinking)
Anthropic
17.0% ±3.8Log ↗
90GPT-5.1 (no thinking)
OpenAI
17.0% ±3.8Log ↗
91o3 Mini
OpenAI
17.0% ±3.8Log ↗
92Claude Sonnet 5
Anthropic
16.0% ±3.7Log ↗
93GPT-5 (minimal)
OpenAI
16.0% ±3.7Log ↗
94GPT-5 nano (low)
OpenAI
15.0% ±3.6Log ↗
95o1
OpenAI
15.0% ±3.6Log ↗
96GLM 5.3 Flash Open source
Z.ai
14.0% ±3.5Source ↗
97MiniMax M3 Open source
MiniMax
14.0% ±3.5Log ↗
98Claude Opus 4.6
Anthropic
14.0% ±3.5Log ↗
99DeepSeek V3.2 Open source
DeepSeek
14.0% ±3.5Log ↗
100GPT-5.1 (low)
OpenAI
14.0% ±3.5Log ↗
101o4-mini (low)
OpenAI
14.0% ±3.5Log ↗
102Claude Sonnet 4.6 (32k thinking)
Anthropic
13.0% ±3.4Log ↗
103Qwen3.5 397B A17B Open source
Qwen
13.0% ±3.4Log ↗
104Claude Opus 4.6 (120k thinking)
Anthropic
13.0% ±3.4Log ↗
105seed-oss-36b-instruct
13.0% ±3.4Log ↗
106GPT-4o (Aug 2024)
OpenAI
13.0% ±3.4Log ↗
107Nemotron 3 Ultra Open source
NVIDIA
12.0% ±3.3Log ↗
108GPT-5.5 Instant
OpenAI
12.0% ±3.3Source ↗
109Qwen3.5-9B Open source
Qwen
12.0% ±3.3Log ↗
110Kimi K2.5 (Fireworks) Open source
Moonshot
12.0% ±3.3Log ↗
111Claude Opus 4.5 (32k thinking)
Anthropic
12.0% ±3.3Log ↗
112Claude Sonnet 4.5 (32k thinking)
Anthropic
12.0% ±3.3Log ↗
113GPT-5 mini (low)
OpenAI
12.0% ±3.3Log ↗
114Qwen3-235B-A22B-Thinking (Jul 2025) Open source
Alibaba
12.0% ±3.3Log ↗
115o1 (medium)
OpenAI
12.0% ±3.3Log ↗
116GPT-5.5 (no thinking)
OpenAI
10.0% ±3.0Log ↗
117Qwen3.5-35B-A3B Open source
Qwen
10.0% ±3.0Log ↗
118GLM 5 Open source
Z.ai
10.0% ±3.0Log ↗
119Claude Opus 4.6 (64k thinking)
Anthropic
10.0% ±3.0Log ↗
120o3-mini (medium)
OpenAI
9.0% ±2.9Log ↗
121Claude Sonnet 4.6 (medium)
Anthropic
8.0% ±2.7Log ↗
122Claude Haiku 4.5
Anthropic
8.0% ±2.7Log ↗
123Qwen3-30B-A3B-Thinking (Jul 2025) Open source
Alibaba
8.0% ±2.7Log ↗
124GPT-5.6 Sol (none)
OpenAI
7.0% ±2.6Log ↗
125DeepSeek v4 Pro (unknown thinking) Open source
DeepSeek
7.0% ±2.6Log ↗
126Claude Opus 4.7
Anthropic
7.0% ±2.6Log ↗
127GPT-5 mini (minimal)
OpenAI
7.0% ±2.6Log ↗
128Claude Opus 4.1
Anthropic
7.0% ±2.6Log ↗
129GPT-4.1 Mini
OpenAI
7.0% ±2.6Log ↗
130o1 (low)
OpenAI
7.0% ±2.6Log ↗
131Gemma 4 26B A4B Open source
Google
6.0% ±2.4Log ↗
132GLM 4.7 Open source
Z.ai
6.0% ±1.6Log ↗
133GPT-4.1
OpenAI
6.0% ±2.4Log ↗
134GPT-4 Turbo (Apr 2024)
OpenAI
6.0% ±2.4Log ↗
135GPT-5.6 Terra (none)
OpenAI
5.0% ±2.2Log ↗
136Gemma 4 31B Open source
Google
5.0% ±2.2Log ↗
137GPT-5.4 (none)
OpenAI
5.0% ±2.2Log ↗
138Claude Sonnet 4.6
Anthropic
5.0% ±2.2Log ↗
139Qwen3 32B Open source
Qwen
5.0% ±2.2Log ↗
140Qwen3 8B Open source
Qwen
5.0% ±2.2Log ↗
141QwQ-32B Open source
Alibaba
5.0% ±2.2Log ↗
142Claude 3 Opus
Anthropic
5.0% ±2.2Log ↗
143GPT-5.2 (none)
OpenAI
4.0% ±2.0Log ↗
144Claude Opus 4.5 (no thinking)
Anthropic
4.0% ±2.0Log ↗
145Claude Sonnet 4.5 (no thinking)
Anthropic
4.0% ±2.0Log ↗
146Qwen3-Max-Instruct
Alibaba
4.0% ±2.0Log ↗
147qwen3-4b-instruct-2507
4.0% ±2.0Log ↗
148gpt-oss-20b Open source
OpenAI
4.0% ±2.0Log ↗
149Qwen3 14B Open source
Qwen
4.0% ±2.0Log ↗
150Qwen3 30B A3B Open source
Qwen
4.0% ±2.0Log ↗
151GPT-4 (Jun 2023)
OpenAI
4.0% ±2.0Log ↗
152GPT-5.4 mini (none)
OpenAI
3.0% ±1.7Log ↗
153GPT-5.4 nano (no thinking)
OpenAI
3.0% ±1.7Log ↗
154Magistral Small 1.2 Open source
Mistral AI
3.0% ±1.7Log ↗
155deepseek-r1-0528-qwen3-8b
3.0% ±1.7Log ↗
156GPT-5.6 Luna (none)
OpenAI
2.0% ±1.4Log ↗
157Qwen3-30B-A3B-Instruct (Jul 2025) Open source
Alibaba
2.0% ±1.4Log ↗
158GPT-5 nano (minimal)
OpenAI
1.0% ±1.0Log ↗
159Mistral Small 3.2 Open source
Mistral AI
1.0% ±1.0Log ↗
160Qwen3-4B Open source
Alibaba
1.0% ±1.0Log ↗
161Mistral Small 3.1 Open source
Mistral AI
1.0% ±1.0Log ↗
162DeepSeek-R1-Distill-Qwen-32B Open source
DeepSeek
1.0% ±1.0Log ↗
163DeepSeek-R1-Distill-Qwen-14B Open source
DeepSeek
1.0% ±1.0Log ↗
164Phi 4 Open source
Microsoft
1.0% ±1.0Log ↗
165Qwen3.5-2B Open source
Alibaba
0.0%Log ↗
166GLM 4.7 Flash Open source
Z.ai
0.0%Log ↗
167granite-4.0-1b
0.0%Log ↗
168granite-4.0-350m
0.0%Log ↗
169Granite 4.0 Micro Open source
IBM
0.0%Log ↗
170Qwen3-1.7B Open source
Alibaba
0.0%Log ↗
171Gemma 3 4B Open source
Google
0.0%Log ↗
172Gemma 3 12B Open source
Google
0.0%Log ↗
173Gemma 3 27B Open source
Google
0.0%Log ↗
174Gemma 3 1B Open source
Google DeepMind
0.0%Log ↗
175Mistral Small 3 Open source
Mistral
0.0%Log ↗
176DeepSeek-R1-Distill-Qwen-1.5B Open source
DeepSeek
0.0%Log ↗
177Llama 3.2 1B Open source
Meta AI
0.0%Log ↗
178Qwen2.5-7B Open source
Alibaba
0.0%Log ↗
179Qwen2.5-32B Open source
Alibaba
0.0%Log ↗
180Llama 3.1-8B Open source
Meta AI
0.0%Log ↗
181GPT-4o-mini
OpenAI
0.0%Log ↗
182Mistral 7B v0.3 Open source
Mistral AI
0.0%Log ↗
183phi-3-mini 3.8B Open source
Microsoft
0.0%Log ↗
184Llama 3-8B Open source
Meta AI
0.0%Log ↗
185GPT-3.5 Turbo (Jan 2024)
OpenAI
0.0%Log ↗
186DeepSeek LLM 67B Open source
DeepSeek
0.0%Log ↗
187Llama 2-13B Open source
Meta AI
0.0%Log ↗
188Llama 2-7B Open source
Meta AI
0.0%Log ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.