Benchmark · ReasoningSettled

GPQA diamond

Graduate-Level Google-Proof QA (Diamond set) · expert-crafted questions in physics, biology, and chemistry that are difficult even for domain PhDs.

Updated 2026-09-28

Opus 4.7 hits 94.2%. Five models above 91%. The benchmark is approaching saturation.

Scoring: Exact-match accuracy on 198 multiple-choice questions. Four options per question. No partial credit.

Models tested
169
Top score
94.5
Claude Mythos Preview
Median
67.7
min 1.4
Top-5 spread
σ 0.2
Settled

Best score over time · one chart, every benchmark

GPQA DIAMOND115 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Oct 24Apr 25Oct 25Apr 26Sep 26RELEASE DATE →benchgecko.ai/benchmark/gpqa-diamond · frontier
Frontier on GPQA diamond rose from 35.1 to 94.5 in 17 months · +59.4 points · latest leader Claude Mythos Preview from Anthropic.
Pink dots = frontier records · 11 totalClick to open model page

169 models tested · sorted by score · includes 7 verified scores

#ModelScore
1Anthropic logoClaude Mythos Preview94.5
2OpenAI logoGPT-6 Astra94.4
3Google logoGemini 3.1 Proverified94.3
4OpenAI logoGPT-5.5 Pro94.2
5Anthropic logoClaude Sonnet 5.594.1
6Google DeepMind logoGemini 3.8 Flash93.9
7OpenAI logoGPT-5.593.6
8Google DeepMind logoGemini 3.7 Flash93.1
9OpenAI logoGPT-5.4 Pro92.8
10Google DeepMind logoGemini 3.1 Pro Preview92.6
11Google DeepMind logoGemini 3.6 Flash92.2
12xAI logoGrok 4.692.0
13Anthropic logoClaude Opus 591.8
14OpenAI logoGPT-5.6 Sol91.3
15xAI logoGrok 4.591.3
16OpenAI logoGPT-5.6 Terra91.1
17OpenAI logoGPT-5.491.1
18moonshotai logoKimi K390.8
19Google DeepMind logoGemini 3.5 Flash90.4
20Alibaba Qwen logoQwen3.8 Max (0902)90.2
21Google DeepMind logoGemini 3 Pro90.2
22z-ai logoGLM 5.289.1
23DeepSeek logoDeepSeek V4 Pro 081388.9
24OpenAI logoGPT-5.6 Luna88.8
25OpenAI logoGPT-5.288.5
26Anthropic logoClaude Opus 4.888.0
27DeepSeek logoDeepSeek V4 Flash 073188.0
28DeepSeek logoDeepSeek V4 Pro87.9
29z-ai logoGLM 5.387.9
30minimax logoMiniMax M387.9
31Alibaba Qwen logoQwen3.7 Max87.9
32moonshotai logoKimi K2.687.7
33Anthropic logoClaude Opus 5.587.5
34Anthropic logoClaude Opus 4.687.4
35Anthropic logoClaude Sonnet 587.4
36Anthropic logoClaude Opus 4.786.9
37z-ai logoGLM 5.3 Flash86.9
38z-ai logoGLM 5.186.5
39Muse Spark86.4
40Google DeepMind logoGemini 3 Flash Preview85.9
41xAI logoGrok 4.2085.8
42xAI logoGrok 4.385.1
43Alibaba Qwen logoQwen3.6 Plus84.5
44moonshotai logoKimi K2.7 Code83.8
45Alibaba Qwen logoQwen3.7 Plus83.8
46z-ai logoGLM 583.8
47OpenAI logoGPT-5.183.5
48moonshotai logoKimi K2.583.5
49Anthropic logoClaude Sonnet 4.683.2
50Alibaba Qwen logoQwen3.6 Max Preview83.2
51xAI logoGrok 482.7
52OpenAI logoGPT-5.4 Mini82.5
53Alibaba Qwen logoQwen3.5 397B A17B81.8
54OpenAI logoGPT-581.6
55Anthropic logoClaude Opus 4.581.4
56Anthropic logoClaude Fable 581.1
57Alibaba Qwen logoQwen3.6 27B81.1
58NVIDIA logoNemotron 3 Ultra80.5
59Google DeepMind logoGemini 2.5 Pro80.4
60Alibaba Qwen logoQwen 3.5 Plus (hosted 397B-A17B)79.8
61Alibaba Qwen logoQwen3.6 35B A3B79.8
62moonshotai logoKimi K2 Thinking79.0
63Alibaba Qwen logoQwen3.5-35B-A3B78.0
64DeepSeek logoDeepSeek V3.277.9
65Google DeepMind logoGemini 3.5 Flash Lite77.8
66z-ai logoGLM 4.777.8
67Alibaba Qwen logoQwen3.6 Flash77.8
68Anthropic logoClaude Sonnet 4.576.4
69Alibaba Qwen logoQwen3.5-Flash76.4
70Alibaba Qwen logoQwen3.7 Flash76.4
71Google DeepMind logoGemini 3.1 Flash Lite75.8
72OpenAI logoo375.8
73Alibaba Qwen logoQwen3 235B A22B Thinking 250773.4
74Anthropic logoClaude 3.7 Sonnet73.0
75OpenAI logoo4 Mini72.8
76Anthropic logoClaude Sonnet 472.3
77Alibaba Qwen logoQwen3.5-9B72.0
78OpenAI logoGPT-5.4 Nano71.3
79Anthropic logoClaude Opus 4.169.7
80OpenAI logoo3 Mini69.4
81OpenAI logoo169.0
82DeepSeek logoR1 052868.4
83Anthropic logoClaude Opus 468.3
84xAI logoGrok-3 mini68.3
85Google DeepMind logoGemma 4 31B67.7
86OpenAI logogpt-oss-120b67.7
87xAI logoGrok 367.7
88OpenAI logoGPT-5 Mini66.7
89Google DeepMind logoGemma 4 26B A4B 64.3
90Alibaba Qwen logoQwen3 Max63.5
91DeepSeek logoR162.3
92Anthropic logoClaude Haiku 4.561.6
93Alibaba Qwen logoQwen3 235B A22B60.9
94OpenAI logoGPT-5 Nano59.3
95OpenAI logoGPT-4.558.3
96Meta logoLlama 4 Maverick56.0
97OpenAI logoGPT-4.155.9
98OpenAI logoGPT-4.1 Mini54.5
99Alibaba Qwen logoQwen3 32B54.3
100Google DeepMind logoGemini 2.0 Pro54.2
101Alibaba Qwen logoQwQ 32B53.8
102DeepSeek logoDeepSeek R1 Distill Qwen 32B52.2
103Google DeepMind logoGemini 2.0 Flash52.2
104Google DeepMind logoGemini 2.0 Flash (Dec 2024)52.2
105Alibaba Qwen logoQwen3 14B51.7
106OpenAI logoo1-mini49.8
107Alibaba Qwen logoQwen3 30B A3B48.9
108OpenAI logogpt-oss-20b47.7
109Mistral AI logoMistral Medium 346.0
110Google DeepMind logoGemini 2.0 Flash Thinking (Jan 2025)42.8
111Alibaba Qwen logoQwen3 8B42.3
112DeepSeek logoDeepSeek V342.0
113Alibaba Qwen logoQwen2.5-Max41.5
114Microsoft logoPhi 441.4
115Anthropic logoClaude 3.5 Sonnet38.7
116xAI logoGrok-2 (Dec 2024)38.4
117Meta logoLlama 4 Scout35.8
118Mistral AI logoMistral Large 241135.1
119Meta logoLlama 3.1 405B34.5
120OpenAI logoo1-preview33.8
121OpenAI logoGPT-4o (2024-08-06)32.3
122OpenAI logoGPT-4o (2024-11-20)32.3
123Alibaba Qwen logoQwen2.5 72B Instruct32.2
124Mistral AI logoMistral Small 3.2 24B32.1
125Mistral AI logoMistral Large 240732.0
126OpenAI logoGPT-4.1 Nano31.9
127OpenAI logoGPT-4o (2024-05-13)31.9
128Google DeepMind logoGemma 3 27B (free)31.8
129Magistral Small 1.131.2
130Google DeepMind logoGemma 3 27B30.3
131Mistral AI logoMistral Small 3.1 24B30.0
132Meta logoLlama 3.3 70B Instruct29.9
133Meta logoLlama 3.3 70B Instruct (free)29.9
134Mistral AI logoMistral Small 329.7
135Anthropic logoClaude 3 Opus29.6
136Alibaba logoQwen2.5 32B Instruct28.1
137Google DeepMind logoGemini 1.5 Pro (Feb 2024)27.8
138Google DeepMind logoGemini 1.5 Pro (May 2024)27.8
139DeepSeek logoDeepSeek R1 Distill Qwen 14B26.3
140Meta logoLlama 3.1 70B Instruct25.6
141Meta logoLlama 3.2 90B21.4
142Alibaba Qwen logoQwen2-72B21.0
143Anthropic logoClaude 3 Sonnet20.8
144Meta logoLlama 3 70B Instruct20.8
145Meta logoLlama 3-70B20.8
146Google DeepMind logoGemini 1.5 Flash (May 2024)20.5
147Google DeepMind logoGemma 3 12B19.3
148Mistral AI logoMistral Large18.4
149Anthropic logoClaude 3.5 Haiku17.5
150OpenAI logoGPT-4o-mini17.0
151OpenAI logoGPT-4o-mini (2024-07-18)17.0
152Google DeepMind logoGemma 2 27B15.3
153Anthropic logoClaude 3 Haiku15.1
154OpenAI logoGPT-4 (older v0314)14.3
155Alibaba Qwen logoQwen2.5 7B Instruct14.0
156Anthropic logoClaude 212.9
157Mistral AI logoMixtral 8x22B Instruct12.1
158Google DeepMind logoGemini 1.0 Pro11.9
159Anthropic logoClaude 2.110.6
160OpenAI logoGPT-4 Turbo7.5
161Mistral AI logoMixtral 8x7B7.5
162Mistral AI logoMixtral 8x7B Instruct7.5
163Mistral AI logoMistral Nemo6.5
164Microsoft logophi-3-medium 14B3.5
165Google DeepMind logoGemma 2 9B3.3
166OpenAI logoGPT-3.5 Turbo (older v0613)2.9
167Meta logoLlama 3.1 8B Instruct2.6
168Meta logoLlama 2-13B1.8
169Meta logoLlama 3 8B Instruct1.4
Details
Category
Reasoning
Creator
NYU (Rein et al.)
Max score
100
Dataset
198 questions
Modality
Text
Format
JSON
License
CC-BY-4.0
Scoring
Exact-match accuracy on 198 multiple-choice questions. Four options per question. No partial credit.
Models
169
Published
2023-11-20
Updated
2026-09-28
Tests
Expert-level sciencePhysicsBiologyChemistryReasoning under uncertainty
Does not test
CodeLong contextSpeedTool useVisionCreative writing
Gecko's Take

“GPQA Diamond served its purpose brilliantly, but the ceiling is cracking. When models outscore the PhDs who wrote the questions, we need GPQA Platinum.”

Same category · related evaluations