Benchmark · KnowledgeCompetitive

MUSR

Updated 2025-10-17
Models tested
78
Top score
28.7
DeepSeek R1 Distill Qwen 14B
Median
9.6
min 1.4
Top-5 spread
σ 3.7
Competitive

Best score over time · one chart, every benchmark

MUSR21 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Oct 24Jan 25Apr 25Jul 25Oct 25RELEASE DATE →benchgecko.ai/benchmark/hf-musr · frontier
Only 21 models have been tested on MUSR · not enough history to compute a frontier yet.
Pink dots = frontier records · 1 totalClick to open model page

78 models tested · sorted by score

#ModelScore
1DeepSeek logoDeepSeek R1 Distill Qwen 14B28.7
2nousresearch logoHermes 3 70B Instruct23.4
3Meta logoLlama 3 8B Instruct19.9
4Alibaba Qwen logoQwen2-72B19.7
5Stable Beluga 218.6
6Meta logoLlama 3.1 70B Instruct17.7
7Dolphin 2.9.1 Yi 1.5 34b17.0
8DeepSeek logoDeepSeek R1 Distill Qwen 32B16.1
9DeepSeek logoR1 Distill Qwen 32B16.1
10Meta logoMeta Llama 3 8B16.0
11Meta logoLlama 3.3 70B Instruct15.6
12Microsoft logoWizardLM-2 8x22B14.5
13z-ai logoGLM 4 32B 14.2
14Microsoft logoPhi 213.8
15Alibaba Qwen logoQwen2.5 Coder 32B Instruct13.7
16Alibaba logoQwen2 VL 7B Instruct13.6
17Alibaba logoQwen2.5 32B Instruct13.5
18anthracite-org logoMagnum v4 72B13.4
19DeepSeek logoDeepSeek R1 Distill Llama 8B13.3
20DeepSeek logoR1 Distill Llama 70B13.3
21Microsoft logoPhi 3 Mini 4k Instruct13.1
22OpenAI logoGpt213.0
23Qwen2.5 72B Instruct Abliterated12.3
24Alibaba logoQwen2 1.5B Instruct12.0
25Alibaba Qwen logoQwen2.5 72B Instruct11.7
26Microsoft logoPhi 411.4
27Vicuna 7b V1.511.4
28Google DeepMind logoGemma 2 2b11.3
29nousresearch logoHermes 2 Pro - Llama-3 8B11.3
30Distilgpt211.2
31Alibaba Qwen logoQwQ 32B11.1
32Google DeepMind logoGemma 2B11.0
33Mistral AI logoMistral 7B V0.110.7
34eleutherai logoPythia 160m10.7
35Alibaba logoQwen2.5 14B Instruct10.6
36Microsoft logoPhi 3.5 Mini Instruct10.1
37SmolLM2 135M10.0
38Google DeepMind logoGemma 2 9B9.7
39Yi 6B9.7
40Alibaba Qwen logoQwen2.5 Coder 7B Instruct9.5
41Alibaba logoQwen2.5 Coder 7B Instruct9.5
42Google DeepMind logoGemma 2 27B9.1
43Meta logoLlama 3.1 8B Instruct8.5
44Alibaba Qwen logoQwen2.5 7B Instruct8.4
45Mistral AI logoMistral 7B Instruct V0.27.6
46Alibaba logoQwen2.5 3B Instruct7.6
47TII logoFalcon-180B7.5
48Alibaba logoQwen2 7B Instruct7.4
49Meta logoLlama 3-70B7.1
50Google DeepMind logoGemma 2 2b It7.1
51Alibaba logoQwen2.5 Coder 14B Instruct7.0
52Microsoft logoPhi 4 Mini Instruct6.5
53Microsoft logoPhi 4 Mini Instruct6.5
54OpenAI logoGpt2 Medium6.2
55Mistral AI logoMistral 7B Instruct v0.16.1
56OpenAI logoGpt2 Large5.7
57Alibaba logoQwen2 0.5B4.6
58TinyLlama 1.1B Chat V1.04.3
59INTELLECT-14.1
60Meta logoLlama 3.2 3B Instruct (free)3.8
61Meta logoLlama 2 7b Hf3.8
62SmolLM2 135M Instruct3.7
63DeepSeek logoDeepSeek R1 Distill Qwen 7B3.5
64Microsoft logoPhi-1.53.4
65Meta logoLlama 2 7b Chat Hf3.3
66Alibaba logoQwen2.5 1.5B Instruct3.2
67RedPajama-INCITE-7B-Base3.0
68DeepSeek logoDeepSeek R1 Distill Qwen 1.5B3.0
69StarCoder 2 15B2.9
70MPT-30B2.9
71eleutherai logoGpt Neo 125m2.6
72Alibaba logoQwen2 0.5B Instruct2.4
73Meta logoLlama 3.1 405B2.2
74Meta logoLLaMA-13B2.0
75Meta logoLlama 3.2 1B Instruct1.9
76Meta logoMeta Llama 3 8B Instruct1.6
77Meta logoLlama 3.2 3B Instruct1.4
78Alibaba logoQwen2.5 0.5B Instruct1.4

Same category · related evaluations