Benchmark · KnowledgeSettled

HELM · WildBench

Updated 2026-01-21
Models tested
40
Top score
86.3
GPT-5.1
Median
81.3
min 65.1
Top-5 spread
σ 0.2
Settled

Best score over time · one chart, every benchmark

HELM · WILDBENCH27 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24Mar 25Jun 25Oct 25Jan 26RELEASE DATE →benchgecko.ai/benchmark/helm-wildbench · frontier
Frontier on HELM · WildBench rose from 82.8 to 86.3 in 12 months · +3.5 points · latest leader GPT-5.1 from OpenAI.
Pink dots = frontier records · 7 totalClick to open model page

40 models tested · sorted by score

Same category · related evaluations