Benchmark · ReasoningCompetitive

Balrog

Balrog · benchmarks AI agents on text-based adventure games, testing language understanding, strategic planning, and long-horizon reasoning.

Updated 2026-09-04
Models tested
36
Top score
68.3
GPT-6 Astra
Median
30.4
min 6.6
Top-5 spread
σ 4.1
Competitive

Best score over time · one chart, every benchmark

BALROG19 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Oct 24Apr 25Sep 25Mar 26Sep 26RELEASE DATE →benchgecko.ai/benchmark/balrog · frontier
Frontier on Balrog rose from 34.9 to 68.3 in 20 months · +33.4 points · latest leader GPT-6 Astra from OpenAI.
Pink dots = frontier records · 8 totalClick to open model page

Same category · related evaluations