Benchmark · CodeSettled

Terminal Bench

Terminal-Bench 2.0 · evaluates AI agents on real terminal-based coding tasks · writing scripts, debugging, running tests, and managing projects entirely through command-line interaction. Tests both code quality and terminal fluency. Claude Opus 4.7 scores 69.4%, demonstrating significant agentic terminal competence.

Updated 2026-04-27

Tests both code quality AND terminal fluency. Opus 4.7 scores 69.4%.

Scoring: Task completion rate based on filesystem state comparison. The model's terminal session produces a final state that is diff-checked against the expected output.

Models tested
37
Top score
82.7
GPT-5.5
Median
44.1
min 3.4
Top-5 spread
σ 1.0
Settled

Best score over time · one chart, every benchmark

TERMINAL BENCH34 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Jun 25Sep 25Nov 25Feb 26Apr 26RELEASE DATE →benchgecko.ai/benchmark/terminal-bench · frontier
Frontier on Terminal Bench rose from 17.1 to 82.7 in 10 months · +65.6 points · latest leader GPT-5.5 from OpenAI.
Pink dots = frontier records · 11 totalClick to open model page

37 models tested · sorted by score · includes 6 verified scores

#ModelScore
1OpenAI logoGPT-5.582.7
2Anthropic logoClaude Mythos Preview82.0
3OpenAI logoGPT-5.481.8
4Anthropic logoClaude Opus 4.780.2
5Google DeepMind logoGemini 3.1 Pro Preview80.2
6Anthropic logoClaude Opus 4.679.8
7OpenAI logoGPT-5.3-Codex78.4
8Google DeepMind logoGemini 3 Pro69.4
9Google logoGemini 3.1 Proverified68.5
10OpenAI logoGPT-5.264.9
11Google DeepMind logoGemini 3 Flash Preview64.3
12Anthropic logoClaude Opus 4.563.1
13xAI logoGrok 4.2057.3
14Anthropic logoClaude Sonnet 4.653.4
15z-ai logoGLM 552.4
16OpenAI logoGPT-549.6
17OpenAI logoGPT-5.147.6
18Anthropic logoClaude Sonnet 4.546.5
19minimax logoMiniMax M2.745.1
20moonshotai logoKimi K2.543.2
21minimax logoMiniMax M2.542.7
22DeepSeek logoDeepSeek V3.239.5
23Anthropic logoClaude Opus 4.138.0
24moonshotai logoKimi K2 Thinking35.7
25Anthropic logoClaude Haiku 4.535.5
26OpenAI logoGPT-5 Mini34.8
27z-ai logoGLM 4.733.4
28Google DeepMind logoGemini 2.5 Pro32.6
29moonshotai logoKimi K2 071127.8
30xAI logoGrok 427.2
31z-ai logoGLM 4.624.5
32Alibaba Qwen logoQwen3.6 35B A3B23.0
33OpenAI logoGPT-5 Nano21.8
34OpenAI logogpt-oss-120b18.7
35Google DeepMind logoGemini 2.5 Flash17.1
36Alibaba Qwen logoQwen3.5-9B9.2
37OpenAI logogpt-oss-20b3.4
Details
Category
Code
Creator
Terminal Research
Max score
100
Modality
Code
Scoring
Task completion rate based on filesystem state comparison. The model's terminal session produces a final state that is diff-checked against the expected output.
Models
37
Updated
2026-04-27
Tests
Terminal fluencyScript writingDebuggingGit operationsMulti-file projects
Does not test
VisionLong contextScientific reasoningSafety
Gecko's Take

“Terminal-Bench is the developer's benchmark. It tests exactly what AI coding assistants do: write code, debug it, run tests, all through the terminal. Mythos at 82.0% means terminal-based AI coding is approaching reliability.”

Same category · related evaluations