Benchmark · KnowledgeSettled

BBH (HuggingFace)

Updated 2025-10-17
Models tested
78
Top score
61.9
Qwen2.5 72B Instruct
Median
24.7
min 1.0
Top-5 spread
σ 2.4
Competitive

Best score over time · one chart, every benchmark

BBH (HUGGINGFACE)21 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Oct 24Jan 25Apr 25Jul 25Oct 25RELEASE DATE →benchgecko.ai/benchmark/hf-bbh · frontier
Only 21 models have been tested on BBH (HuggingFace) · not enough history to compute a frontier yet.
Pink dots = frontier records · 0 totalClick to open model page

78 models tested · sorted by score

#ModelScore
1Alibaba Qwen logoQwen2.5 72B Instruct61.9
2Qwen2.5 72B Instruct Abliterated60.5
3Meta logoLlama 3.3 70B Instruct56.6
4Alibaba logoQwen2.5 32B Instruct56.5
5Meta logoLlama 3.1 70B Instruct55.9
6Microsoft logoPhi 455.7
7nousresearch logoHermes 3 70B Instruct53.8
8Alibaba Qwen logoQwen2.5 Coder 32B Instruct52.3
9Alibaba Qwen logoQwen2-72B51.9
10Google DeepMind logoGemma 2 27B49.3
11Meta logoMeta Llama 3 8B48.7
12Microsoft logoWizardLM-2 8x22B48.6
13Alibaba logoQwen2.5 14B Instruct48.6
14Alibaba logoQwen2.5 Coder 14B Instruct44.2
15Dolphin 2.9.1 Yi 1.5 34b44.2
16Google DeepMind logoGemma 2 9B42.1
17Stable Beluga 241.3
18DeepSeek logoDeepSeek R1 Distill Qwen 14B40.7
19Microsoft logoPhi 4 Mini Instruct38.7
20Microsoft logoPhi 4 Mini Instruct38.7
21Alibaba logoQwen2 7B Instruct37.8
22Microsoft logoPhi 3.5 Mini Instruct36.8
23Microsoft logoPhi 3 Mini 4k Instruct36.6
24Alibaba logoQwen2 VL 7B Instruct35.9
25DeepSeek logoDeepSeek R1 Distill Llama 8B35.8
26DeepSeek logoR1 Distill Llama 70B35.8
27z-ai logoGLM 4 32B 35.8
28anthracite-org logoMagnum v4 72B35.5
29Yi 6B35.5
30Alibaba Qwen logoQwen2.5 7B Instruct34.9
31nousresearch logoHermes 2 Pro - Llama-3 8B30.7
32Meta logoLlama 3.1 8B Instruct29.2
33Alibaba Qwen logoQwen2.5 Coder 7B Instruct28.9
34Alibaba logoQwen2.5 Coder 7B Instruct28.9
35Meta logoMeta Llama 3 8B Instruct28.2
36Microsoft logoPhi 228.0
37Meta logoLlama 3-70B26.7
38Alibaba logoQwen2.5 3B Instruct25.8
39Meta logoLLaMA-13B25.3
40Meta logoLlama 3.2 3B Instruct24.1
41Mistral AI logoMistral 7B Instruct V0.222.9
42Mistral AI logoMistral 7B V0.122.0
43TII logoFalcon-180B21.9
44Google DeepMind logoGemma 2B21.1
45StarCoder 2 15B20.4
46Alibaba logoQwen2.5 1.5B Instruct19.8
47Meta logoLlama 3 8B Instruct18.4
48Google DeepMind logoGemma 2 2b It18.0
49DeepSeek logoDeepSeek R1 Distill Qwen 32B17.1
50DeepSeek logoR1 Distill Qwen 32B17.1
51Vicuna 7b V1.515.2
52Meta logoLlama 3.2 3B Instruct (free)14.2
53Alibaba logoQwen2 1.5B Instruct13.7
54Google DeepMind logoGemma 2 2b12.5
55Meta logoLlama 2 7b Hf10.3
56Meta logoLlama 3.2 1B Instruct8.3
57Alibaba logoQwen2.5 0.5B Instruct8.2
58Alibaba logoQwen2 0.5B7.9
59DeepSeek logoDeepSeek R1 Distill Qwen 7B7.9
60Meta logoLlama 3.1 405B7.8
61Mistral AI logoMistral 7B Instruct v0.17.7
62Microsoft logoPhi-1.57.5
63MPT-30B6.5
64Alibaba logoQwen2 0.5B Instruct5.9
65RedPajama-INCITE-7B-Base5.1
66DeepSeek logoDeepSeek R1 Distill Qwen 1.5B4.7
67SmolLM2 135M Instruct4.7
68Meta logoLlama 2 7b Chat Hf4.5
69TinyLlama 1.1B Chat V1.04.0
70SmolLM2 135M3.7
71eleutherai logoGpt Neo 125m3.4
72OpenAI logoGpt2 Large3.3
73Alibaba Qwen logoQwQ 32B2.9
74Distilgpt22.8
75OpenAI logoGpt2 Medium2.7
76OpenAI logoGpt22.7
77eleutherai logoPythia 160m2.2
78INTELLECT-11.0

Same category · related evaluations