Benchmark · KnowledgeSettled

MMLU

Massive Multitask Language Understanding · 57 subjects spanning STEM, humanities, social sciences, and more. The standard benchmark for broad knowledge.

Updated 2025-04-15
Models tested
83
Top score
82.9
DeepSeek V3
Median
60.8
min 1.1
Top-5 spread
σ 0.5
Settled

Best score over time · one chart, every benchmark

MMLU12 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Oct 24Nov 24Jan 25Feb 25Apr 25RELEASE DATE →benchgecko.ai/benchmark/mmlu · frontier
Only 12 models have been tested on MMLU · not enough history to compute a frontier yet.
Pink dots = frontier records · 1 totalClick to open model page

83 models tested · sorted by score

#ModelScore
1DeepSeek logoDeepSeek V382.9
2Anthropic logoClaude 3.5 Sonnet82.0
3OpenAI logoGPT-4 (older v0314)81.9
4Meta logoLlama 3.3 70B Instruct81.7
5Meta logoLlama 3.3 70B Instruct (free)81.7
6Google DeepMind logoGemini 1.5 Pro (May 2024)81.2
7Alibaba Qwen logoQwen2.5 72B Instruct80.4
8Microsoft logoPhi 479.7
9Anthropic logoClaude 3 Opus79.5
10Meta logoLlama 3.1 405B79.3
11OpenAI logoGPT-4o (2024-08-06)79.1
12OpenAI logoGPT-4o (2024-11-20)79.1
13OpenAI logoGPT-4o (2024-05-13)78.9
14Google DeepMind logoGemini 1.5 Pro (Feb 2024)76.9
15OpenAI logoGPT-4 Turbo76.5
16Alibaba Qwen logoQwen2-72B76.5
17OpenAI logoGPT-4o-mini75.7
18OpenAI logoGPT-4o-mini (2024-07-18)75.7
19Meta logoLlama 3.2 90B73.7
20Meta logoLlama 3.1 70B Instruct73.5
21Mistral AI logoMistral Large 240773.3
22Google DeepMind logoGemini 2.0 Flash72.9
23Google DeepMind logoGemini 2.0 Flash (Dec 2024)72.9
24Meta logoLlama 3 70B Instruct72.4
25Meta logoLlama 3-70B72.4
26Alibaba Qwen logoQwen2.5 Coder 32B Instruct72.1
27Anthropic logoClaude 271.3
28DeepSeek logoDeepSeek-V2 (MoE-236B, May 2024)71.2
29Microsoft logophi-3-medium 14B70.7
30Google DeepMind logoGemini 1.5 Flash (May 2024)70.5
31Mistral AI logoMixtral 8x22B Instruct70.4
32Anthropic logoClaude 3 Sonnet67.9
33Google DeepMind logoGemma 2 27B67.6
34Microsoft logophi-3-small 7.4B67.6
35Alibaba logoQwen2.5 Coder 14B Instruct66.9
36Anthropic logoClaude 3.5 Haiku65.7
37Anthropic logoClaude 3 Haiku65.1
38Anthropic logoClaude 2.164.7
39Anthropic logoClaude Instant64.5
40Alibaba Qwen logoQwen2.5 7B Instruct63.9
41Google DeepMind logoGemma 2 9B62.8
42TII logoFalcon-180B60.8
43Mistral AI logoMixtral 8x7B60.8
44Mistral AI logoMixtral 8x7B Instruct60.8
45Google DeepMind logoGemini 1.0 Pro60.0
46Cohere logoCommand R (08-2024)59.2
47Meta logoLlama 3 8B Instruct58.4
48Mistral AI logoMistral Large58.4
49Microsoft logophi-3-mini 3.8B58.4
50Stable Beluga 258.1
51Alibaba Qwen logoQwen2.5 Coder 7B Instruct57.3
52Alibaba logoQwen2.5 Coder 7B Instruct57.3
53OpenAI logoGPT-3.5 Turbo (older v0613)56.4
54Alibaba Qwen logoQwen-14B55.1
55StarCoder 2 15B52.1
56Yi 6B52.0
57Mistral AI logoMistral 7B V0.150.0
58DeepSeek logoDeepSeek-Coder-V2-Lite-Base47.3
59Nemotron-4 15B44.9
60TII logoFalcon 2 11B44.5
61Microsoft logoPhi 244.5
62Meta logoLlama 3.1 8B Instruct41.5
63Meta logoLlama 2-13B40.8
64Baichuan 2-7B38.9
65Alibaba logoQwen2.5 Coder 1.5B Instruct38.1
66internlm-20b34.7
67INTELLECT-133.2
68MPT-30B30.5
69Meta logoLLaMA-13B30.3
70Baichuan1-7B23.1
71Google DeepMind logoGemma 2B23.1
72Alibaba logoQwen2.5 Coder 0.5B Instruct22.7
73Alibaba Qwen logoCodeQwen1.5-7B20.7
74DeepSeek logoDeepSeek Coder 33B19.2
75Microsoft logoPhi-1.516.8
76DeepSeek logoDeepSeek Coder 6.7B15.2
77XGen-7B15.1
78Meta logoopen_llama_7b6.5
79Alibaba Qwen logoQwen-1_8B4.3
80RedPajama-INCITE-7B-Base1.7
81OpenAI logoCerebras-GPT-13B1.6
82Dolly 2.0-12b1.6
83DeepSeek logoDeepSeek Coder 1.3B1.1

Same category · related evaluations