Benchmark · KnowledgeSettled

MATH Level 5

Updated 2025-10-17
Models tested
75
Top score
62.5
Qwen2.5 32B Instruct
Median
15.5
min 0.1
Top-5 spread
σ 2.5
Competitive

Best score over time · one chart, every benchmark

MATH LEVEL 520 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Oct 24Jan 25Apr 25Jul 25Oct 25RELEASE DATE →benchgecko.ai/benchmark/hf-math-lvl5 · frontier
Only 20 models have been tested on MATH Level 5 · not enough history to compute a frontier yet.
Pink dots = frontier records · 0 totalClick to open model page

75 models tested · sorted by score

#ModelScore
1Alibaba logoQwen2.5 32B Instruct62.5
2Qwen2.5 72B Instruct Abliterated60.1
3Alibaba Qwen logoQwen2.5 72B Instruct59.8
4DeepSeek logoDeepSeek R1 Distill Qwen 14B57.0
5Alibaba logoQwen2.5 14B Instruct55.3
6Alibaba Qwen logoQwen2.5 7B Instruct50.0
7Alibaba Qwen logoQwen2.5 Coder 32B Instruct49.5
8Meta logoLlama 3.3 70B Instruct48.3
9Microsoft logoPhi 445.2
10Meta logoLlama 3.1 70B Instruct38.1
11Alibaba Qwen logoQwen2.5 Coder 7B Instruct37.2
12Alibaba logoQwen2.5 Coder 7B Instruct37.2
13Alibaba logoQwen2.5 3B Instruct36.8
14Alibaba logoQwen2.5 Coder 14B Instruct32.5
15Alibaba Qwen logoQwen2-72B31.1
16DeepSeek logoDeepSeek R1 Distill Llama 8B30.7
17DeepSeek logoR1 Distill Llama 70B30.7
18Alibaba logoQwen2 7B Instruct27.6
19Microsoft logoWizardLM-2 8x22B25.0
20Google DeepMind logoGemma 2 27B23.9
21Alibaba logoQwen2.5 1.5B Instruct22.1
22nousresearch logoHermes 3 70B Instruct21.0
23anthracite-org logoMagnum v4 72B20.0
24Alibaba logoQwen2 VL 7B Instruct19.9
25Microsoft logoPhi 3.5 Mini Instruct19.6
26DeepSeek logoDeepSeek R1 Distill Qwen 7B19.6
27Google DeepMind logoGemma 2 9B19.5
28Dolphin 2.9.1 Yi 1.5 34b18.7
29Meta logoMeta Llama 3 8B18.6
30Meta logoLlama 3.2 3B Instruct17.7
31DeepSeek logoDeepSeek R1 Distill Qwen 32B17.1
32DeepSeek logoR1 Distill Qwen 32B17.1
33Microsoft logoPhi 4 Mini Instruct17.0
34Microsoft logoPhi 4 Mini Instruct17.0
35DeepSeek logoDeepSeek R1 Distill Qwen 1.5B16.9
36Microsoft logoPhi 3 Mini 4k Instruct16.4
37Alibaba Qwen logoQwQ 32B16.1
38Meta logoLlama 3.1 8B Instruct15.5
39Alibaba logoQwen2.5 0.5B Instruct10.3
40Meta logoMeta Llama 3 8B Instruct8.7
41nousresearch logoHermes 2 Pro - Llama-3 8B8.4
42Meta logoLlama 3.2 1B Instruct8.2
43Google DeepMind logoGemma 2B7.4
44Alibaba logoQwen2 1.5B Instruct7.2
45StarCoder 2 15B6.0
46Meta logoLlama 3-70B5.7
47Yi 6B5.1
48Stable Beluga 24.4
49Meta logoLlama 3 8B Instruct3.9
50Meta logoLLaMA-13B3.1
51Google DeepMind logoGemma 2 2b3.0
52Mistral AI logoMistral 7B Instruct V0.23.0
53Mistral AI logoMistral 7B V0.13.0
54Microsoft logoPhi 23.0
55Alibaba logoQwen2 0.5B Instruct2.9
56TII logoFalcon-180B2.8
57Alibaba logoQwen2 0.5B2.6
58Mistral AI logoMistral 7B Instruct v0.12.3
59Meta logoLlama 2 7b Chat Hf2.0
60Meta logoLlama 3.2 3B Instruct (free)1.9
61Microsoft logoPhi-1.51.8
62Meta logoLlama 2 7b Hf1.7
63MPT-30B1.6
64RedPajama-INCITE-7B-Base1.6
65TinyLlama 1.1B Chat V1.01.5
66Vicuna 7b V1.51.4
67OpenAI logoGpt2 Large1.2
68SmolLM2 135M1.2
69eleutherai logoPythia 160m0.9
70OpenAI logoGpt2 Medium0.8
71Distilgpt20.6
72eleutherai logoGpt Neo 125m0.6
73OpenAI logoGpt20.3
74SmolLM2 135M Instruct0.3
75Google DeepMind logoGemma 2 2b It0.1

Same category · related evaluations