Benchmark · AgentCompetitive

APEX-Agents

APEX-Agents · evaluates AI agents on complex, multi-step tasks requiring planning, tool use, and autonomous decision-making in realistic environments.

Updated 2026-09-28
Models tested
56
Top score
75.5
Claude Sonnet 5.5
Median
33.0
min 1.1
Top-5 spread
σ 3.7
Competitive

Best score over time · one chart, every benchmark

APEX-AGENTS52 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24May 25Oct 25Apr 26Sep 26RELEASE DATE →benchgecko.ai/benchmark/apex-agents · frontier
Frontier on APEX-Agents rose from 1.1 to 75.5 in 23 months · +74.4 points · latest leader Claude Sonnet 5.5 from Anthropic.
Pink dots = frontier records · 13 totalClick to open model page

56 models tested · sorted by score

#ModelScore
1Anthropic logoClaude Sonnet 5.575.5
2Anthropic logoClaude Opus 5.573.5
3Anthropic logoClaude Fable 5.168.6
4Google DeepMind logoGemini 3.7 Flash67.8
5Anthropic logoClaude Opus 565.8
6xAI logoGrok 4.665.3
7OpenAI logoGPT-6 Astra64.7
8Google DeepMind logoGemini 3.8 Flash64.3
9Anthropic logoClaude Fable 563.6
10OpenAI logoGPT-5.6 Terra58.2
11z-ai logoGLM 5.356.6
12xAI logoGrok 4.556.2
13Anthropic logoClaude Sonnet 554.5
14z-ai logoGLM 5.3 Flash52.8
15OpenAI logoGPT-5.452.4
16OpenAI logoGPT-5.6 Sol51.4
17moonshotai logoKimi K350.6
18Anthropic logoClaude Opus 4.749.2
19Anthropic logoClaude Opus 4.848.9
20DeepSeek logoDeepSeek V4 Pro 081347.3
21Google DeepMind logoGemini 3.6 Flash46.9
22Anthropic logoClaude Opus 4.646.3
23Anthropic logoClaude Sonnet 4.643.0
24z-ai logoGLM 5.140.9
25minimax logoMiniMax M337.7
26moonshotai logoKimi K2.7 Code37.6
27Google DeepMind logoGemini 3.1 Pro Preview35.3
28OpenAI logoGPT-5.234.3
29OpenAI logoGPT-5.3-Codex31.7
30Google DeepMind logoGemini 3.5 Flash27.5
31Alibaba Qwen logoQwen3.5 397B A17B24.9
32OpenAI logoGPT-5.4 Mini24.6
33Google DeepMind logoGemini 3 Flash Preview24.0
34Anthropic logoClaude Opus 4.518.4
35Google DeepMind logoGemini 3 Pro18.4
36OpenAI logoGPT-518.3
37OpenAI logoGPT-5.117.5
38z-ai logoGLM 517.2
39OpenAI logoo317.2
40OpenAI logoGPT-5.4 Nano16.9
41xAI logoGrok 415.2
42moonshotai logoKimi K2.514.4
43Alibaba Qwen logoQwen 3.5 Plus (hosted 397B-A17B)13.6
44Anthropic logoClaude Sonnet 49.3
45Anthropic logoClaude Haiku 4.58.9
46DeepSeek logoDeepSeek V3.27.0
47Google DeepMind logoGemini 2.5 Pro6.6
48minimax logoMiniMax M2.56.2
49OpenAI logogpt-oss-120b4.4
50moonshotai logoKimi K2 Thinking4.0
51z-ai logoGLM 4.73.1
52z-ai logoGLM 4.63.0
53xAI logoGrok 32.1
54Google DeepMind logoGemini 2.5 Flash1.8
55OpenAI logoGPT-4o (2024-11-20)1.1
56OpenAI logoo11.1
Details
Category
Agent
Max score
100
Models
56
Updated
2026-09-28

Same category · related evaluations