Benchmark · ReasoningSettled

ARC-AGI

ARC-AGI · the original Abstraction and Reasoning Corpus, testing whether AI can solve novel visual pattern recognition tasks without memorization.

Updated 2026-09-22
Models tested
71
Top score
98.5
Claude Fable 5
Median
65.3
min 0.5
Top-5 spread
σ 0.4
Settled

Best score over time · one chart, every benchmark

ARC-AGI61 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24May 25Oct 25Apr 26Sep 26RELEASE DATE →benchgecko.ai/benchmark/arc-agi · frontier
Frontier on ARC-AGI rose from 4.5 to 98.5 in 19 months · +94.0 points · latest leader Claude Fable 5 from Anthropic.
Pink dots = frontier records · 13 totalClick to open model page

71 models tested · sorted by score

#ModelScore
1Anthropic logoClaude Fable 598.5
2OpenAI logoGPT-6 Astra98.5
3Google DeepMind logoGemini 3.1 Pro Preview98.0
4Anthropic logoClaude Fable 5.197.5
5Anthropic logoClaude Opus 597.5
6Anthropic logoClaude Opus 5.597.5
7OpenAI logoGPT-5.6 Sol97.5
8OpenAI logoGPT-5.6 Terra96.5
9Google DeepMind logoGemini 3.7 Flash95.5
10OpenAI logoGPT-5.595.0
11OpenAI logoGPT-5.4 Pro94.5
12moonshotai logoKimi K394.5
13Anthropic logoClaude Opus 4.694.0
14OpenAI logoGPT-5.493.7
15Anthropic logoClaude Opus 4.793.5
16Anthropic logoClaude Opus 4.892.5
17Google DeepMind logoGemini 3.5 Flash92.5
18Google DeepMind logoGemini 3.6 Flash91.2
19DeepSeek logoDeepSeek V4 Pro 081390.5
20OpenAI logoGPT-5.2 Pro90.5
21xAI logoGrok 4.2089.5
22DeepSeek logoDeepSeek V4 Flash 073189.0
23OpenAI logoGPT-5.6 Luna88.0
24xAI logoGrok 4.687.5
25xAI logoGrok 4.587.2
26Anthropic logoClaude Sonnet 4.686.5
27OpenAI logoGPT-5.286.2
28Google DeepMind logoGemini 3 Flash Preview84.7
29Anthropic logoClaude Opus 4.580.0
30z-ai logoGLM 5.277.0
31Google DeepMind logoGemini 3 Pro75.0
32OpenAI logoGPT-5.172.8
33OpenAI logoGPT-5 Pro70.2
34xAI logoGrok 466.7
35OpenAI logoGPT-565.7
36moonshotai logoKimi K2.565.3
37Anthropic logoClaude Sonnet 4.563.7
38OpenAI logoGPT-5.4 Mini63.7
39minimax logoMiniMax M2.563.7
40OpenAI logoo360.8
41OpenAI logoo3 Pro59.3
42OpenAI logoo4 Mini58.7
43DeepSeek logoDeepSeek V3.257.0
44OpenAI logoGPT-5 Mini54.3
45Google DeepMind logoGemini 3.5 Flash Lite53.5
46OpenAI logoGPT-5.4 Nano51.5
47xAI logoGrok 4 Fast48.5
48Anthropic logoClaude Haiku 4.547.7
49z-ai logoGLM 544.7
50Google DeepMind logoGemini 2.5 Pro41.0
51Anthropic logoClaude Sonnet 440.0
52Anthropic logoClaude Opus 435.7
53OpenAI logoo3 Mini34.5
54Google DeepMind logoGemini 2.5 Flash32.3
55OpenAI logoo130.7
56Anthropic logoClaude 3.7 Sonnet28.6
57DeepSeek logoR1 052821.2
58OpenAI logoGPT-5 Nano20.7
59OpenAI logoo1-preview18.0
60xAI logoGrok-3 mini16.5
61DeepSeek logoR115.8
62OpenAI logoo1-mini14.0
63Alibaba Qwen logoQwen3 235B A22B Instruct 250711.0
64OpenAI logoGPT-4.510.3
65OpenAI logoGPT-4.15.5
66xAI logoGrok 35.5
67Magistral Small 1.15.0
68OpenAI logoGPT-4o (2024-11-20)4.5
69Meta logoLlama 4 Maverick4.4
70OpenAI logoGPT-4.1 Mini3.5
71Meta logoLlama 4 Scout0.5

Same category · related evaluations