BenchAtlas

Benchmarks / Long Context & Instruction

AA Long Context Reasoning

Artificial Analysis's long-context reasoning benchmark.

maintained by Artificial Analysis · 614 observations on record

Versions

1 version
VersionTasks
AA-LCR current
aa-lcr

Current leaderboard

AA-LCR · Accuracy · top 25 of 224 systems
8082848587
GPT 5.5 (2026-04-22)
84.3
GPT 5.5 (2026-04-22)
84.3
GPT 5.6 Sol
84.0
GPT 5.6 Luna
83.7
GPT 5.3 Codex
83.3
GPT 5.5 (2026-04-22)
83.0
Minimax M3
83.0
GPT 5.6 Terra
83.0
GPT 5.2 (2025-12-11)
82.7
GPT 5.6 Sol
82.3
#SystemAccuracy %
1GPT 5.5 (2026-04-22)high effort
OpenAI
84.3%
2GPT 5.5 (2026-04-22)xhigh effort
OpenAI
84.3%
3GPT 5.6 Solmax effort
OpenAI
84.0%
4GPT 5.6 Lunamax effort
OpenAI
83.7%
5GPT 5.3 Codexxhigh effort
OpenAI
83.3%
6GPT 5.5 (2026-04-22)medium effort
OpenAI
83.0%
7Minimax M3
MiniMax
83.0%
8GPT 5.6 Terramax effort
OpenAI
83.0%
9GPT 5.2 (2025-12-11)xhigh effort
OpenAI
82.7%
10GPT 5.6 Solxhigh effort
OpenAI
82.3%
11GPT 5.2 Codexxhigh effort
OpenAI
82.3%
12GPT 5.4 (2026-03-05)xhigh effort
OpenAI
82.0%
13Claude Sonnet 5max effort
Anthropic
82.0%
14Gemini 3.1 Pro Preview
Google DeepMind
82.0%
15GPT 5.6 Lunaxhigh effort
OpenAI
81.7%
16GPT 5.6 Solhigh effort
OpenAI
81.7%
17Kimi K2 6
Moonshot AI
81.0%
18GPT 5.5 (2026-04-22)low effort
OpenAI
81.0%
19GPT 5.6 Lunahigh effort
OpenAI
80.3%
20GPT 5.6 Solmedium effort
OpenAI
80.3%
21GPT 5.1 (2025-11-13)high effort
OpenAI
80.0%
22Claude Sonnet 4.6max effort
Anthropic
80.0%
23Mimo V2 5 Pro
xiaomi
79.7%
24Grok 4.5high effort
xAI
79.3%
25Nemotron 3 Ultra 550B A55bthinking
NVIDIA
79.3%

One row per evaluated system — reasoning-effort variants rank separately.