Benchmark · KnowledgeSettled

Fiction.LiveBench

Fiction.LiveBench · a continuously updated benchmark using recently published fiction to test reading comprehension and reasoning, preventing data contamination.

Updated 2026-01-27
Models tested
49
Top score
97.2
GPT-5
Median
61.1
min 25.0
Top-5 spread
σ 2.1
Competitive

Best score over time · one chart, every benchmark

FICTION.LIVEBENCH39 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Dec 24Mar 25Jul 25Oct 25Jan 26RELEASE DATE →benchgecko.ai/benchmark/fiction-livebench · frontier
Frontier on Fiction.LiveBench rose from 33.3 to 97.2 in 6 months · +63.9 points · latest leader o3 Pro from OpenAI.
Pink dots = frontier records · 4 totalClick to open model page

49 models tested · sorted by score

#ModelScore
1OpenAI logoGPT-597.2
2OpenAI logoo3 Pro97.2
3xAI logoGrok 494.4
4xAI logoGrok 4 Fast94.4
5Google DeepMind logoGemini 2.5 Pro91.7
6OpenAI logoo388.9
7moonshotai logoKimi K2.586.1
8Anthropic logoClaude 3.7 Sonnet83.3
9DeepSeek logoDeepSeek V3.2 Exp83.3
10OpenAI logoo183.3
11Alibaba Qwen logoQwQ 32B83.3
12OpenAI logoo4 Mini77.8
13Alibaba Qwen logoQwen3 235B A22B Thinking 250775.0
14Alibaba Qwen logoQwen3 32B74.2
15OpenAI logoGPT-5 Mini69.4
16DeepSeek logoR169.4
17Alibaba Qwen logoQwen3 235B A22B67.7
18xAI logoGrok-3 mini66.7
19Alibaba Qwen logoQwen2.5-Max66.7
20Alibaba Qwen logoQwen3 Max66.7
21OpenAI logoGPT-4.163.9
22OpenAI logoGPT-4.563.9
23Alibaba Qwen logoQwen3 14B62.5
24Alibaba Qwen logoQwen3 8B62.1
25Anthropic logoClaude Opus 461.1
26Google DeepMind logoGemini 2.0 Flash61.1
27Google DeepMind logoGemini 2.0 Flash (Dec 2024)61.1
28moonshotai logoKimi K2 071161.1
29xAI logoGrok 358.3
30Alibaba Qwen logoQwen3 235B A22B Instruct 250752.9
31DeepSeek logoDeepSeek V3.152.8
32Google DeepMind logoGemini 2.0 Flash Thinking (Jan 2025)52.8
33DeepSeek logoDeepSeek V350.0
34OpenAI logoo3 Mini50.0
35Google DeepMind logoGemini 2.5 Flash47.2
36Google DeepMind logoGemini 2.5 Flash Lite47.2
37Anthropic logoClaude Sonnet 446.9
38Meta logoLlama 4 Maverick46.2
39OpenAI logoGPT-4.1 Mini44.4
40OpenAI logoGPT-5 Nano44.4
41OpenAI logogpt-oss-120b44.4
42Google DeepMind logoGemini 2.0 Pro41.7
43Alibaba Qwen logoQwen3 30B A3B40.6
44Meta logoLlama 4 Scout36.0
45Google DeepMind logoGemma 3 27B33.3
46Google DeepMind logoGemma 3 27B (free)33.3
47Meta logoLlama 3.3 70B Instruct33.3
48Meta logoLlama 3.3 70B Instruct (free)33.3
49OpenAI logoGPT-4.1 Nano25.0

Same category · related evaluations