Benchmark · CodeCompetitive

GSO-Bench

GSO-Bench · evaluates AI models on real-world open-source software engineering tasks, testing the ability to understand and resolve actual GitHub issues.

Updated 2026-06-30
Models tested
22
Top score
47.1
Claude Opus 4.8
Median
11.8
min 1.3
Top-5 spread
σ 5.5
wide open

Best score over time · one chart, every benchmark

GSO-BENCH19 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Jan 25Jun 25Oct 25Feb 26Jun 26RELEASE DATE →benchgecko.ai/benchmark/gso-bench · frontier
Frontier on GSO-Bench rose from 1.3 to 47.1 in 16 months · +45.8 points · latest leader Claude Opus 4.8 from Anthropic.
Pink dots = frontier records · 8 totalClick to open model page

Same category · related evaluations