Compare · ModelsLive · 2 picked · head to head
gpt-oss-20b vs Qwen3 235B A22B Instruct 2507
Side by side · benchmarks, pricing, and signals you can act on.
Winner summary
Qwen3 235B A22B Instruct 2507 wins on 6/10 benchmarks
Qwen3 235B A22B Instruct 2507 wins 6 of 10 shared benchmarks. Leads in arena · general · knowledge.
Category leads
arena·Qwen3 235B A22B Instruct 2507general·Qwen3 235B A22B Instruct 2507math·gpt-oss-20bknowledge·Qwen3 235B A22B Instruct 2507language·gpt-oss-20bcoding·gpt-oss-20b
Hype vs Reality
Attention vs performance
gpt-oss-20b
#97 by perf·no signal
Qwen3 235B A22B Instruct 2507
#134 by perf·#2 by attention
Best value
gpt-oss-20b
6.5x better value than Qwen3 235B A22B Instruct 2507
gpt-oss-20b
983.3 pts/$
$0.05/M
Qwen3 235B A22B Instruct 2507
150.9 pts/$
$0.32/M
Vendor risk
Who is behind the model
OpenAI
$840.0B·Tier 1
Alibaba (Qwen)
$293.0B·Tier 1
Head to head
10 benchmarks · 2 models
gpt-oss-20bQwen3 235B A22B Instruct 2507
Chatbot Arena Elo · Overall
Qwen3 235B A22B Instruct 2507 leads by +104.8
gpt-oss-20b
1317.6
Qwen3 235B A22B Instruct 2507
1422.4
Dtbench
Qwen3 235B A22B Instruct 2507 leads by +17.3
gpt-oss-20b
46.7
Qwen3 235B A22B Instruct 2507
64.0
Lmca
Qwen3 235B A22B Instruct 2507 leads by +10.6
gpt-oss-20b
17.1
Qwen3 235B A22B Instruct 2507
27.7
OpenCompass · AIME2025
gpt-oss-20b leads by +18.4
gpt-oss-20b
87.9
Qwen3 235B A22B Instruct 2507
69.5
OpenCompass · GPQA-Diamond
Qwen3 235B A22B Instruct 2507 leads by +6.6
gpt-oss-20b
68.9
Qwen3 235B A22B Instruct 2507
75.5
OpenCompass · HLE
Qwen3 235B A22B Instruct 2507 leads by +0.7
gpt-oss-20b
11.6
Qwen3 235B A22B Instruct 2507
12.3
OpenCompass · IFEval
gpt-oss-20b leads by +0.6
gpt-oss-20b
88.9
Qwen3 235B A22B Instruct 2507
88.3
OpenCompass · LiveCodeBenchV6
gpt-oss-20b leads by +25.4
gpt-oss-20b
68.4
Qwen3 235B A22B Instruct 2507
43.0
OpenCompass · MMLU-Pro
Qwen3 235B A22B Instruct 2507 leads by +6.4
gpt-oss-20b
72.8
Qwen3 235B A22B Instruct 2507
79.2
WeirdML
gpt-oss-20b leads by +2.2
WeirdML · tests models on unusual and adversarial machine learning tasks that require creative problem-solving beyond standard patterns.
gpt-oss-20b
40.9
Qwen3 235B A22B Instruct 2507
38.7
Full benchmark table
| Benchmark | gpt-oss-20b | Qwen3 235B A22B Instruct 2507 |
|---|---|---|
Chatbot Arena Elo · Overall | 1317.6 | 1422.4 |
Dtbench | 46.7 | 64.0 |
Lmca | 17.1 | 27.7 |
OpenCompass · AIME2025 | 87.9 | 69.5 |
OpenCompass · GPQA-Diamond | 68.9 | 75.5 |
OpenCompass · HLE | 11.6 | 12.3 |
OpenCompass · IFEval | 88.9 | 88.3 |
OpenCompass · LiveCodeBenchV6 | 68.4 | 43.0 |
OpenCompass · MMLU-Pro | 72.8 | 79.2 |
WeirdML WeirdML · tests models on unusual and adversarial machine learning tasks that require creative problem-solving beyond standard patterns. | 40.9 | 38.7 |
Pricing · per 1M tokens · projected $/mo at 10M tokens
| Model | Input | Output | Context | Projected $/mo |
|---|---|---|---|---|
| $0.02 | $0.09 | 131K tokens (~66 books) | $0.36 | |
| $0.09 | $0.55 | 262K tokens (~131 books) | $2.05 |