Benchmark · KnowledgeSettled

SimpleQA Verified

SimpleQA Verified · short factual questions with verified answers, measuring factual accuracy and the tendency to hallucinate or provide incorrect information.

Updated 2026-09-28
Models tested
79
Top score
75.6
GPT-6 Astra
Median
41.0
min 6.0
Top-5 spread
σ 1.6
Settled

Best score over time · one chart, every benchmark

SIMPLEQA VERIFIED71 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24May 25Oct 25Apr 26Sep 26RELEASE DATE →benchgecko.ai/benchmark/simpleqa-verified · frontier
Frontier on SimpleQA Verified rose from 26.0 to 75.6 in 22 months · +49.6 points · latest leader GPT-6 Astra from OpenAI.
Pink dots = frontier records · 7 totalClick to open model page

79 models tested · sorted by score

#ModelScore
1OpenAI logoGPT-6 Astra75.6
2Google DeepMind logoGemini 3.1 Pro Preview73.5
3Google DeepMind logoGemini 3 Pro72.9
4Anthropic logoClaude Opus 5.572.2
5Anthropic logoClaude Fable 5.170.8
6Anthropic logoClaude Fable 570.7
7Google DeepMind logoGemini 3.8 Flash69.7
8OpenAI logoGPT-5.6 Sol69.7
9Google DeepMind logoGemini 3.7 Flash69.2
10Google DeepMind logoGemini 3 Flash Preview66.8
11Muse Spark66.3
12Google DeepMind logoGemini 3.5 Flash66.2
13Google DeepMind logoGemini 3.6 Flash66.2
14Anthropic logoClaude Opus 559.9
15Google DeepMind logoGemini 2.5 Pro56.0
16Alibaba Qwen logoQwen3.7 Max55.8
17Anthropic logoClaude Opus 4.853.0
18DeepSeek logoDeepSeek V4 Pro 081352.9
19Alibaba Qwen logoQwen3.6 Max Preview52.0
20Anthropic logoClaude Opus 4.751.7
21moonshotai logoKimi K350.6
22OpenAI logoGPT-550.1
23OpenAI logoo349.4
24xAI logoGrok 4.649.3
25Alibaba Qwen logoQwen3 Max48.8
26xAI logoGrok 4.548.3
27OpenAI logoGPT-5.148.0
28xAI logoGrok 447.9
29Anthropic logoClaude Opus 4.647.0
30DeepSeek logoDeepSeek V4 Pro47.0
31Anthropic logoClaude Sonnet 5.546.5
32OpenAI logoGPT-5.4 Pro46.3
33Alibaba Qwen logoQwen3.8 Max (0902)45.8
34OpenAI logoGPT-5.445.1
35Alibaba Qwen logoQwen3.6 Plus44.1
36OpenAI logoGPT-5.6 Terra43.2
37Anthropic logoClaude Opus 4.541.8
38OpenAI logoo141.1
39z-ai logoGLM 5.341.0
40OpenAI logoGPT-5.6 Luna41.0
41Alibaba Qwen logoQwen3 235B A22B Thinking 250740.4
42OpenAI logoGPT-5.237.1
43moonshotai logoKimi K2.7 Code36.5
44Anthropic logoClaude Sonnet 4.635.5
45moonshotai logoKimi K2.634.9
46Anthropic logoClaude Opus 4.134.8
47moonshotai logoKimi K2.534.3
48z-ai logoGLM 5.234.2
49z-ai logoGLM 5.134.0
50Anthropic logoClaude Sonnet 533.7
51DeepSeek logoDeepSeek V4 Flash 073133.6
52xAI logoGrok 4.333.2
53z-ai logoGLM 4.732.2
54moonshotai logoKimi K2 Thinking31.6
55OpenAI logoGPT-4.131.1
56Anthropic logoClaude Sonnet 4.530.7
57xAI logoGrok 4.2030.2
58OpenAI logoGPT-5.4 Mini29.4
59DeepSeek logoDeepSeek V3.227.5
60DeepSeek logoR127.4
61DeepSeek logoR1 052827.4
62OpenAI logoGPT-4o (2024-11-20)26.0
63Alibaba Qwen logoQwen 3.5 Plus (hosted 397B-A17B)25.4
64OpenAI logoGPT-5 Mini21.6
65xAI logoGrok-3 mini21.1
66Alibaba Qwen logoQwen3.5-Flash20.3
67OpenAI logoo4 Mini19.6
68Alibaba Qwen logoQwen3.6 Flash15.9
69OpenAI logoo3 Mini15.3
70OpenAI logogpt-oss-120b13.9
71Anthropic logoClaude Haiku 4.513.2
72OpenAI logoGPT-4.1 Mini12.7
73Anthropic logoClaude 3 Opus12.6
74OpenAI logoGPT-5 Nano11.7
75OpenAI logoGPT-5.4 Nano11.7
76Google DeepMind logoGemma 4 31B10.4
77OpenAI logoGPT-4o-mini8.3
78Anthropic logoClaude 3.5 Haiku6.7
79OpenAI logoGPT-4.1 Nano6.0

Same category · related evaluations