Benchmark · ReasoningSettled

SimpleBench

SimpleBench · tests fundamental reasoning capabilities with straightforward problems designed to expose gaps in basic logical and spatial thinking.

Updated 2026-08-12
Models tested
77
Top score
78.3
Claude Fable 5
Median
35.6
min 0.9
Top-5 spread
σ 2.6
Competitive

Best score over time · one chart, every benchmark

SIMPLEBENCH58 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24Apr 25Sep 25Mar 26Aug 26RELEASE DATE →benchgecko.ai/benchmark/simplebench · frontier
Frontier on SimpleBench rose from 28.1 to 78.3 in 18 months · +50.2 points · latest leader Claude Fable 5 from Anthropic.
Pink dots = frontier records · 7 totalClick to open model page

77 models tested · sorted by score

#ModelScore
1Anthropic logoClaude Fable 578.3
2Anthropic logoClaude Opus 576.7
3Google DeepMind logoGemini 3.1 Pro Preview75.5
4Google DeepMind logoGemini 3.5 Flash72.0
5Google DeepMind logoGemini 3 Pro71.7
6xAI logoGrok 4.671.1
7OpenAI logoGPT-5.4 Pro68.9
8OpenAI logoGPT-5.6 Sol66.0
9Alibaba Qwen logoQwen3.7 Max64.5
10xAI logoGrok 4.564.0
11Anthropic logoClaude Opus 4.661.1
12Anthropic logoClaude Opus 4.857.8
13Alibaba Qwen logoQwen3.6 Max Preview55.6
14Google DeepMind logoGemini 2.5 Pro54.9
15Anthropic logoClaude Opus 4.554.4
16Anthropic logoClaude Opus 4.754.0
17OpenAI logoGPT-5 Pro53.9
18DeepSeek logoDeepSeek V4 Flash 073153.3
19Google DeepMind logoGemini 3 Flash Preview53.3
20moonshotai logoKimi K352.8
21Anthropic logoClaude Sonnet 552.7
22xAI logoGrok 452.6
23Anthropic logoClaude Opus 4.152.0
24Anthropic logoClaude Opus 450.6
25z-ai logoGLM 5.250.6
26moonshotai logoKimi K2.7 Code49.5
27OpenAI logoGPT-5.2 Pro48.9
28OpenAI logoGPT-548.0
29z-ai logoGLM 5.146.1
30Anthropic logoClaude Sonnet 4.545.2
31z-ai logoGLM 543.8
32OpenAI logoGPT-5.143.8
33OpenAI logoo343.7
34OpenAI logoGPT-5.6 Terra38.7
35z-ai logoGLM 4.737.2
36OpenAI logoGPT-5.6 Luna36.2
37moonshotai logoKimi K2.536.2
38Anthropic logoClaude 3.7 Sonnet35.7
39DeepSeek logoDeepSeek V4 Flash35.6
40OpenAI logoGPT-5.235.0
41minimax logoMiniMax M335.0
42Anthropic logoClaude Sonnet 434.6
43OpenAI logoo1-preview30.0
44Google DeepMind logoGemini 2.5 Flash29.4
45DeepSeek logoR1 052829.0
46OpenAI logoo128.1
47DeepSeek logoDeepSeek V3.128.0
48OpenAI logoo4 Mini26.4
49xAI logoGrok 323.3
50Alibaba Qwen logoQwen3.6 Flash22.2
51OpenAI logoGPT-4.521.4
52Google DeepMind logoGemini 2.0 Flash17.3
53Google DeepMind logoGemini 2.0 Flash (Dec 2024)17.3
54Alibaba Qwen logoQwen3 235B A22B17.2
55DeepSeek logoR117.1
56Google DeepMind logoGemini 2.0 Flash Thinking (Jan 2025)16.8
57Meta logoLlama 4 Maverick13.2
58Anthropic logoClaude 3.5 Sonnet13.0
59Google DeepMind logoGemini 1.5 Pro (Feb 2024)12.5
60Google DeepMind logoGemini 1.5 Pro (May 2024)12.5
61OpenAI logoGPT-4.112.4
62moonshotai logoKimi K2 071111.6
63OpenAI logoGPT-4 Turbo10.1
64Anthropic logoClaude 3 Opus8.2
65Meta logoLlama 3.1 405B7.6
66OpenAI logoo3 Mini7.4
67xAI logoGrok-2 (Dec 2024)7.2
68Mistral AI logoMistral Large7.0
69Mistral AI logoMistral Large 24077.0
70OpenAI logogpt-oss-120b6.5
71Meta logoLlama 3.3 70B Instruct3.9
72Meta logoLlama 3.3 70B Instruct (free)3.9
73DeepSeek logoDeepSeek V32.7
74OpenAI logoo1-mini1.7
75OpenAI logoGPT-4o (2024-08-06)1.4
76OpenAI logoGPT-4o (2024-11-20)1.4
77Cohere logoCommand R (08-2024)0.9
Details
Category
Reasoning
Max score
100
Models
77
Updated
2026-08-12

Same category · related evaluations