Benchmark · ReasoningCompetitive

Chess Puzzles

Chess Puzzles · tests strategic and tactical reasoning by having models solve chess puzzle positions, evaluating lookahead and pattern recognition abilities.

Updated 2026-09-04
Models tested
86
Top score
70.5
GPT-6 Astra
Median
17.9
min 0.0
Top-5 spread
σ 6.1
wide open

Best score over time · one chart, every benchmark

CHESS PUZZLES82 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24May 25Oct 25Mar 26Sep 26RELEASE DATE →benchgecko.ai/benchmark/chess-puzzles · frontier
Frontier on Chess Puzzles rose from 8.5 to 70.5 in 22 months · +62.1 points · latest leader GPT-6 Astra from OpenAI.
Pink dots = frontier records · 9 totalClick to open model page

86 models tested · sorted by score

#ModelScore
1OpenAI logoGPT-6 Astra70.5
2OpenAI logoGPT-5.6 Sol62.1
3Google DeepMind logoGemini 3.8 Flash59.0
4OpenAI logoGPT-5.4 Pro56.4
5Google DeepMind logoGemini 3.1 Pro Preview52.6
6OpenAI logoGPT-5.6 Terra51.6
7Google DeepMind logoGemini 3.5 Flash47.4
8OpenAI logoGPT-5.246.3
9Anthropic logoClaude Fable 5.144.2
10DeepSeek logoDeepSeek V4 Pro 081344.2
11Google DeepMind logoGemini 3.7 Flash44.2
12OpenAI logoGPT-5.441.1
13Google DeepMind logoGemini 3.6 Flash40.0
14Anthropic logoClaude Opus 539.0
15Anthropic logoClaude Fable 537.9
16Google DeepMind logoGemini 3 Flash Preview36.9
17OpenAI logoGPT-5.6 Luna36.9
18xAI logoGrok 4.636.9
19moonshotai logoKimi K335.8
20OpenAI logoo334.8
21OpenAI logoGPT-533.7
22xAI logoGrok 4.532.7
23Anthropic logoClaude Sonnet 531.6
24Anthropic logoClaude Opus 4.830.6
25DeepSeek logoDeepSeek V4 Flash 073129.5
26OpenAI logoGPT-5.128.4
27Google DeepMind logoGemini 3 Pro27.4
28Anthropic logoClaude Opus 4.726.4
29OpenAI logoGPT-5 Mini26.4
30OpenAI logoGPT-5.4 Nano26.4
31Alibaba Qwen logoQwen3.8 Max (0902)25.3
32xAI logoGrok 424.2
33OpenAI logoGPT-5 Nano23.2
34moonshotai logoKimi K2.622.1
35OpenAI logoo4 Mini22.1
36Alibaba Qwen logoQwen3.6 35B A3B22.1
37Google DeepMind logoGemini 3.1 Flash Lite21.1
38xAI logoGrok 4.321.1
39OpenAI logoGPT-5.4 Mini20.0
40xAI logoGrok 4.2020.0
41Alibaba Qwen logoQwen3.7 Plus20.0
42Alibaba Qwen logoQwen3.7 Flash19.0
43Google DeepMind logoGemini 3.5 Flash Lite17.9
44Alibaba Qwen logoQwen 3.5 Plus (hosted 397B-A17B)17.9
45Alibaba Qwen logoQwen3.6 27B17.9
46z-ai logoGLM 5.216.9
47z-ai logoGLM 5.316.9
48moonshotai logoKimi K2.7 Code16.9
49Alibaba Qwen logoQwen3.5-Flash16.9
50DeepSeek logoDeepSeek V4 Pro15.8
51Google DeepMind logoGemini 2.5 Pro15.8
52OpenAI logogpt-oss-120b15.8
53moonshotai logoKimi K2 Thinking15.8
54Alibaba Qwen logoQwen3.6 Flash15.8
55Alibaba Qwen logoQwen3.6 Max Preview15.8
56z-ai logoGLM 5.114.8
57Alibaba Qwen logoQwen3.7 Max14.8
58Anthropic logoClaude Opus 4.612.7
59OpenAI logoo3 Mini12.7
60Alibaba Qwen logoQwen3.6 Plus12.7
61OpenAI logoo110.6
62DeepSeek logoDeepSeek V3.29.5
63z-ai logoGLM 5.3 Flash9.5
64minimax logoMiniMax M39.5
65Anthropic logoClaude Sonnet 4.68.5
66OpenAI logoGPT-4o (2024-11-20)8.5
67Alibaba Qwen logoQwen3.5 397B A17B8.5
68Anthropic logoClaude Opus 4.57.4
69Anthropic logoClaude Sonnet 4.57.4
70moonshotai logoKimi K2.57.4
71NVIDIA logoNemotron 3 Ultra7.4
72Alibaba Qwen logoQwen3 235B A22B Thinking 25077.4
73Alibaba Qwen logoQwen3.5-9B7.4
74z-ai logoGLM 55.3
75Alibaba Qwen logoQwen3.5-35B-A3B5.3
76Anthropic logoClaude Haiku 4.53.2
77Anthropic logoClaude Opus 4.12.1
78OpenAI logoGPT-4.1 Mini2.1
79Google DeepMind logoGemma 4 26B A4B 1.1
80z-ai logoGLM 4.71.1
81OpenAI logoGPT-4.11.1
82Anthropic logoClaude 3 Opus0.0
83Google DeepMind logoGemma 4 31B0.0
84Alibaba Qwen logoQwen3 32B0.0
85Alibaba Qwen logoQwen3 8B0.0
86Alibaba Qwen logoQwQ 32B0.0
Details
Category
Reasoning
Max score
100
Models
86
Updated
2026-09-04

Same category · related evaluations