Benchmark · KnowledgeSettled

DeepResearch Bench

DeepResearch Bench · evaluates AI on complex multi-step research tasks requiring information gathering, synthesis, and producing comprehensive analyses.

Updated 2026-05-27
Models tested
26
Top score
55.3
Claude Opus 4.6
Median
45.9
min 29.2
Top-5 spread
σ 1.9
Settled

Best score over time · one chart, every benchmark

DEEPRESEARCH BENCH23 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Jan 25May 25Sep 25Jan 26May 26RELEASE DATE →benchgecko.ai/benchmark/deepresearch-bench · frontier
Frontier on DeepResearch Bench rose from 35.1 to 55.3 in 13 months · +20.2 points · latest leader Claude Opus 4.6 from Anthropic.
Pink dots = frontier records · 9 totalClick to open model page

Same category · related evaluations