Benchmark · MathSettled

MATH level 5

MATH Level 5 · the hardest tier of the MATH benchmark, featuring competition-level problems from AMC, AIME, and Olympiad-style mathematics.

Updated 2025-10-15
Models tested
81
Top score
98.1
GPT-5
Median
53.3
min 3.3
Top-5 spread
σ 0.1
Settled

Best score over time · one chart, every benchmark

MATH LEVEL 535 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24Feb 25May 25Jul 25Oct 25RELEASE DATE →benchgecko.ai/benchmark/math-level-5 · frontier
Frontier on MATH level 5 rose from 94.7 to 98.1 in 8 months · +3.4 points · latest leader GPT-5 from OpenAI.
Pink dots = frontier records · 5 totalClick to open model page

81 models tested · sorted by score

#ModelScore
1OpenAI logoGPT-598.1
2OpenAI logoGPT-5 Mini97.8
3OpenAI logoo4 Mini97.8
4OpenAI logoo397.8
5Anthropic logoClaude Sonnet 4.597.7
6Alibaba Qwen logoQwen3 Max97.1
7DeepSeek logoR1 052896.6
8OpenAI logoo3 Mini96.5
9Anthropic logoClaude Haiku 4.596.4
10Google DeepMind logoGemini 2.5 Pro95.6
11OpenAI logoGPT-5 Nano95.2
12OpenAI logoo194.7
13DeepSeek logoR193.0
14Anthropic logoClaude 3.7 Sonnet91.2
15xAI logoGrok-3 mini90.9
16OpenAI logoo1-mini89.2
17xAI logoGrok 388.8
18OpenAI logoGPT-4.1 Mini87.3
19DeepSeek logoDeepSeek R1 Distill Qwen 14B87.1
20Anthropic logoClaude Opus 485.0
21Anthropic logoClaude Sonnet 484.4
22Google DeepMind logoGemini 2.0 Pro83.5
23OpenAI logoGPT-4.183.0
24Google DeepMind logoGemini 2.0 Flash82.2
25Google DeepMind logoGemini 2.0 Flash (Dec 2024)82.2
26OpenAI logoo1-preview81.7
27Mistral AI logoMistral Medium 381.6
28OpenAI logoGPT-4.578.6
29Google DeepMind logoGemma 3 27B74.0
30Google DeepMind logoGemma 3 27B (free)74.0
31Meta logoLlama 4 Maverick73.0
32OpenAI logoGPT-4.1 Nano70.0
33Alibaba Qwen logoQwen3 235B A22B68.9
34Alibaba Qwen logoQwen2.5-Max67.2
35Microsoft logoPhi 464.9
36DeepSeek logoDeepSeek V364.8
37xAI logoGrok-2 (Dec 2024)63.5
38Alibaba Qwen logoQwen2.5 72B Instruct63.2
39Meta logoLlama 4 Scout62.3
40Alibaba logoQwen2.5 32B Instruct56.1
41OpenAI logoGPT-4o (2024-08-06)53.3
42OpenAI logoGPT-4o (2024-11-20)53.3
43OpenAI logoGPT-4o-mini52.6
44OpenAI logoGPT-4o-mini (2024-07-18)52.6
45Anthropic logoClaude 3.5 Sonnet51.7
46OpenAI logoGPT-4o (2024-05-13)51.0
47Mistral AI logoMistral Large 241150.3
48Meta logoLlama 3.1 405B49.8
49Mistral AI logoMistral Small 3.1 24B46.8
50Anthropic logoClaude 3.5 Haiku46.4
51Mistral AI logoMistral Large 240744.8
52Mistral AI logoMistral Small 344.8
53Meta logoLlama 3.3 70B Instruct41.6
54Meta logoLlama 3.3 70B Instruct (free)41.6
55Google DeepMind logoGemini 1.5 Pro (Feb 2024)40.8
56Google DeepMind logoGemini 1.5 Pro (May 2024)40.8
57Meta logoLlama 3.2 90B39.4
58Alibaba Qwen logoQwen2-72B39.1
59Anthropic logoClaude 3 Opus37.5
60Meta logoLlama 3.1 70B Instruct36.7
61Google DeepMind logoGemma 2 27B27.9
62Google DeepMind logoGemini 1.5 Flash (May 2024)25.1
63Mistral AI logoMistral Large24.5
64Mistral AI logoMixtral 8x22B Instruct24.2
65OpenAI logoGPT-4 Turbo23.0
66Meta logoLlama 3.1 8B Instruct22.9
67Meta logoLlama 3 70B Instruct22.6
68Meta logoLlama 3-70B22.6
69Google DeepMind logoGemma 2 9B21.0
70Anthropic logoClaude 3 Sonnet18.2
71Microsoft logophi-3-medium 14B17.6
72Anthropic logoClaude 3 Haiku14.9
73Anthropic logoClaude 211.7
74OpenAI logoGPT-3.5 Turbo (older v0613)11.6
75Google DeepMind logoGemini 1.0 Pro11.2
76Mistral AI logoMistral Nemo10.8
77Mistral AI logoMixtral 8x7B9.9
78Mistral AI logoMixtral 8x7B Instruct9.9
79Meta logoLlama 3 8B Instruct6.1
80Yi 6B5.2
81Meta logoLlama 2-13B3.3

Same category · related evaluations