Benchmark · MathCompetitive

FrontierMath-2025-02-28-Private

FrontierMath (Feb 2025) · original research-level math problems created by mathematicians, testing capabilities at the boundary of current AI mathematical reasoning.

Updated 2026-05-27
Models tested
65
Top score
68.4
Muse Spark
Median
14.1
min 0.3
Top-5 spread
σ 7.0
wide open

Best score over time · one chart, every benchmark

FRONTIERMATH-2025-02-28-PRIVATE50 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24Apr 25Aug 25Jan 26May 26RELEASE DATE →benchgecko.ai/benchmark/frontiermath-2025-02-28-private · frontier
Frontier on FrontierMath-2025-02-28-Private rose from 9.3 to 56.8 in 14 months · +47.5 points · latest leader Claude Sonnet 4.6 from Anthropic.
Pink dots = frontier records · 8 totalClick to open model page

65 models tested · sorted by score

#ModelScore
1Muse Spark68.4
2Google DeepMind logoGemini 3 Pro66.0
3Anthropic logoClaude Sonnet 4.656.8
4OpenAI logoGPT-5.154.5
5OpenAI logoGPT-5.4 Pro50.0
6moonshotai logoKimi K2.549.0
7OpenAI logoGPT-5.447.6
8Anthropic logoClaude Opus 4.847.2
9Anthropic logoClaude Opus 4.743.8
10Anthropic logoClaude Opus 4.640.7
11OpenAI logoGPT-5.240.7
12Alibaba Qwen logoQwen3.6 Max Preview40.5
13Google DeepMind logoGemini 3.5 Flash39.0
14moonshotai logoKimi K2.639.0
15DeepSeek logoDeepSeek V3.238.8
16moonshotai logoKimi K2 Thinking37.5
17Google DeepMind logoGemini 3.1 Pro Preview36.9
18Alibaba Qwen logoQwen 3.5 Plus (hosted 397B-A17B)36.9
19Google DeepMind logoGemini 3 Flash Preview35.6
20xAI logoGrok 434.5
21z-ai logoGLM 5.133.5
22OpenAI logoGPT-532.4
23z-ai logoGLM 528.8
24OpenAI logoGPT-5.4 Mini28.3
25OpenAI logoGPT-5 Mini27.2
26Alibaba Qwen logoQwen3.6 Plus26.2
27OpenAI logoGPT-5.4 Nano25.9
28OpenAI logoo4 Mini24.8
29Anthropic logoClaude Opus 4.520.7
30OpenAI logoo318.7
31Anthropic logoClaude Sonnet 4.515.2
32Alibaba Qwen logoQwen3 235B A22B Thinking 250714.9
33Google DeepMind logoGemini 2.5 Pro14.1
34OpenAI logoo3 Mini12.4
35Anthropic logoClaude Haiku 4.510.4
36Alibaba Qwen logoQwen3.6 Flash10.3
37xAI logoGrok-3 mini10.3
38OpenAI logoo19.3
39Google DeepMind logoGemini 2.5 Flash8.5
40OpenAI logoGPT-5 Nano8.3
41Anthropic logoClaude Opus 47.9
42Anthropic logoClaude 3.7 Sonnet7.3
43Anthropic logoClaude Sonnet 47.3
44Anthropic logoClaude Opus 4.17.2
45xAI logoGrok 36.7
46Alibaba Qwen logoQwen3.5-Flash6.2
47OpenAI logoGPT-4.15.5
48OpenAI logoGPT-4.1 Mini4.5
49z-ai logoGLM 4.74.3
50z-ai logoGLM 4.63.8
51DeepSeek logoDeepSeek V33.0
52Google DeepMind logoGemini 2.0 Flash (Dec 2024)3.0
53OpenAI logoo1-mini3.0
54Anthropic logoClaude 3.5 Sonnet1.8
55OpenAI logoGPT-4.1 Nano1.8
56Alibaba Qwen logoQwen2.5-Max1.8
57Google DeepMind logoGemini 2.0 Flash1.7
58xAI logoGrok-2 (Dec 2024)1.2
59Meta logoLlama 4 Maverick1.2
60Mistral AI logoMistral Medium 30.6
61Anthropic logoClaude 3.5 Haiku0.6
62OpenAI logoGPT-4o (2024-11-20)0.6
63Mistral AI logoMistral Large0.6
64OpenAI logoGPT-4o (2024-08-06)0.3
65Mistral AI logoMistral Large 24110.3

Same category · related evaluations