Benchmark · KnowledgeSettled

MMLU-PRO

Updated 2025-10-17
Models tested
78
Top score
52.6
Qwen2-72B
Median
24.2
min 0.3
Top-5 spread
σ 1.5
Settled

Best score over time · one chart, every benchmark

MMLU-PRO21 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Oct 24Jan 25Apr 25Jul 25Oct 25RELEASE DATE →benchgecko.ai/benchmark/hf-mmlu-pro · frontier
Only 21 models have been tested on MMLU-PRO · not enough history to compute a frontier yet.
Pink dots = frontier records · 0 totalClick to open model page

78 models tested · sorted by score

#ModelScore
1Alibaba Qwen logoQwen2-72B52.6
2Alibaba logoQwen2.5 32B Instruct51.9
3Alibaba Qwen logoQwen2.5 72B Instruct51.4
4Qwen2.5 72B Instruct Abliterated50.4
5Microsoft logoPhi 448.3
6Meta logoLlama 3.3 70B Instruct48.1
7Meta logoLlama 3.1 70B Instruct47.9
8Alibaba logoQwen2.5 14B Instruct43.2
9DeepSeek logoDeepSeek R1 Distill Llama 8B41.6
10DeepSeek logoR1 Distill Llama 70B41.6
11nousresearch logoHermes 3 70B Instruct41.4
12Meta logoMeta Llama 3 8B41.2
13DeepSeek logoDeepSeek R1 Distill Qwen 32B41.0
14DeepSeek logoR1 Distill Qwen 32B41.0
15DeepSeek logoDeepSeek R1 Distill Qwen 14B40.7
16Microsoft logoWizardLM-2 8x22B40.0
17Dolphin 2.9.1 Yi 1.5 34b39.1
18Google DeepMind logoGemma 2 27B38.4
19Alibaba Qwen logoQwen2.5 Coder 32B Instruct37.9
20Yi 6B37.9
21Alibaba Qwen logoQwen2.5 7B Instruct36.5
22z-ai logoGLM 4 32B 34.9
23Alibaba logoQwen2 VL 7B Instruct34.4
24Microsoft logoPhi 3 Mini 4k Instruct33.6
25Microsoft logoPhi 3.5 Mini Instruct32.9
26Alibaba logoQwen2.5 Coder 14B Instruct32.7
27Microsoft logoPhi 4 Mini Instruct32.6
28Microsoft logoPhi 4 Mini Instruct32.6
29Google DeepMind logoGemma 2 9B31.9
30Alibaba logoQwen2 7B Instruct31.6
31anthracite-org logoMagnum v4 72B31.4
32Meta logoLlama 3.1 8B Instruct30.9
33Meta logoMeta Llama 3 8B Instruct29.6
34Alibaba Qwen logoQwen2.5 Coder 7B Instruct26.1
35Alibaba logoQwen2.5 Coder 7B Instruct26.1
36Stable Beluga 225.9
37Meta logoLlama 3.1 405B25.7
38Alibaba logoQwen2.5 3B Instruct25.1
39Meta logoLlama 3.2 3B Instruct24.4
40Meta logoLlama 3-70B24.0
41Meta logoLLaMA-13B23.1
42nousresearch logoHermes 2 Pro - Llama-3 8B22.8
43Mistral AI logoMistral 7B V0.122.4
44Google DeepMind logoGemma 2B21.6
45Alibaba logoQwen2.5 1.5B Instruct20.0
46Mistral AI logoMistral 7B Instruct V0.219.1
47Microsoft logoPhi 218.1
48Meta logoLlama 3 8B Instruct17.8
49Google DeepMind logoGemma 2 2b It17.2
50Alibaba logoQwen2 1.5B Instruct16.7
51Meta logoLlama 3.2 3B Instruct (free)16.5
52Mistral AI logoMistral 7B Instruct v0.115.7
53TII logoFalcon-180B15.4
54StarCoder 2 15B15.0
55DeepSeek logoDeepSeek R1 Distill Qwen 7B14.7
56Google DeepMind logoGemma 2 2b13.5
57Vicuna 7b V1.512.7
58Meta logoLlama 2 7b Hf9.6
59Meta logoLlama 3.2 1B Instruct8.2
60Alibaba logoQwen2 0.5B8.0
61Alibaba logoQwen2.5 0.5B Instruct8.0
62Microsoft logoPhi-1.57.7
63Meta logoLlama 2 7b Chat Hf7.6
64Alibaba logoQwen2 0.5B Instruct5.9
65MPT-30B2.3
66RedPajama-INCITE-7B-Base2.2
67Alibaba Qwen logoQwQ 32B2.2
68DeepSeek logoDeepSeek R1 Distill Qwen 1.5B2.1
69Distilgpt22.1
70OpenAI logoGpt2 Medium2.0
71OpenAI logoGpt21.7
72OpenAI logoGpt2 Large1.6
73INTELLECT-11.3
74eleutherai logoPythia 160m1.3
75SmolLM2 135M Instruct1.3
76TinyLlama 1.1B Chat V1.01.1
77SmolLM2 135M1.1
78eleutherai logoGpt Neo 125m0.3

Same category · related evaluations