Benchmark · ReasoningSettled

Winogrande

WinoGrande · large-scale commonsense reasoning benchmark where models must resolve ambiguous pronouns in carefully constructed sentence pairs.

Updated 2025-04-15
Models tested
53
Top score
78.4
Llama 3.1 405B
Median
46.8
min 3.0
Top-5 spread
σ 1.5
Settled

Best score over time · one chart, every benchmark

WINOGRANDE5 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24Dec 24Jan 25Mar 25Apr 25RELEASE DATE →benchgecko.ai/benchmark/winogrande · frontier
Only 5 models have been tested on Winogrande · not enough history to compute a frontier yet.
Pink dots = frontier records · 0 totalClick to open model page

53 models tested · sorted by score

#ModelScore
1Meta logoLlama 3.1 405B78.4
2Anthropic logoClaude 3 Opus77.0
3OpenAI logoGPT-4 (older v0314)75.0
4OpenAI logoGPT-4 Turbo75.0
5TII logoFalcon-180B74.2
6DeepSeek logoDeepSeek-V2 (MoE-236B, May 2024)72.6
7DeepSeek logoDeepSeek V370.4
8Meta logoLlama 3 70B Instruct67.0
9Meta logoLlama 3-70B67.0
10PaLM 2-L66.0
11Alibaba Qwen logoQwen2.5 72B Instruct64.6
12OpenAI logoGPT-3.5 Turbo (older v0613)63.2
13Microsoft logophi-3-medium 14B63.0
14Microsoft logophi-3-small 7.4B63.0
15Alibaba Qwen logoQwen2.5 Coder 32B Instruct61.6
16PaLM 2-M58.4
17TII logoFalcon 2 11B56.6
18Nemotron-4 15B56.0
19PaLM 2-S55.8
20Mistral AI logoMixtral 8x7B54.4
21Mistral AI logoMixtral 8x7B Instruct54.4
22Alibaba logoQwen2.5 Coder 14B Instruct53.6
23Meta logoLlama 3 8B Instruct51.4
24Mistral AI logoMistral 7B V0.150.6
25Anthropic logoClaude 3 Sonnet50.2
26Anthropic logoClaude 3 Haiku48.4
27Microsoft logoPhi-1.546.8
28Meta logoLLaMA-13B46.0
29DeepSeek logoDeepSeek-Coder-V2-Lite-Base45.8
30Alibaba Qwen logoQwen2.5 Coder 7B Instruct45.8
31Alibaba logoQwen2.5 Coder 7B Instruct45.8
32Meta logoLlama 2-13B45.6
33Yi 6B42.6
34MPT-30B42.0
35Microsoft logophi-3-mini 3.8B41.6
36vicuna-13b-v1.141.6
37Alibaba Qwen logoQwen2.5-Coder-3B34.8
38Meta logoopen_llama_7b34.0
39INTELLECT-131.6
40Google DeepMind logoGemma 2B30.8
41XGen-7B29.8
42StarCoder 2 15B28.6
43RedPajama-INCITE-7B-Base27.6
44DeepSeek logoDeepSeek Coder 33B24.0
45Dolly 2.0-12b23.6
46OpenAI logoCerebras-GPT-13B21.6
47Alibaba logoQwen2.5 Coder 1.5B Instruct21.4
48Alibaba Qwen logoCodeQwen1.5-7B19.6
49DeepSeek logoDeepSeek Coder 6.7B15.2
50Alibaba logoQwen2.5 Coder 0.5B Instruct9.6
51Microsoft logoPhi 29.4
52DeepSeek logoDeepSeek Coder 1.3B6.6
53stablelm-tuned-alpha-7b3.0
Details
Category
Reasoning
Max score
100
Models
53
Updated
2025-04-15

Same category · related evaluations