Benchmarks / Long Context & Instruction
AA Long Context Reasoning
Artificial Analysis's long-context reasoning benchmark.
maintained by Artificial Analysis · 614 observations on record
Versions
1 version
| Version | Tasks |
|---|---|
| AA-LCR current aa-lcr | — |
Current leaderboard
AA-LCR · Accuracy · top 25 of 224 systems
| # | System | Accuracy % |
|---|---|---|
| 1 | GPT 5.5 (2026-04-22)high effort OpenAI | 84.3% |
| 2 | GPT 5.5 (2026-04-22)xhigh effort OpenAI | 84.3% |
| 3 | GPT 5.6 Solmax effort OpenAI | 84.0% |
| 4 | GPT 5.6 Lunamax effort OpenAI | 83.7% |
| 5 | GPT 5.3 Codexxhigh effort OpenAI | 83.3% |
| 6 | GPT 5.5 (2026-04-22)medium effort OpenAI | 83.0% |
| 7 | Minimax M3 MiniMax | 83.0% |
| 8 | GPT 5.6 Terramax effort OpenAI | 83.0% |
| 9 | GPT 5.2 (2025-12-11)xhigh effort OpenAI | 82.7% |
| 10 | GPT 5.6 Solxhigh effort OpenAI | 82.3% |
| 11 | GPT 5.2 Codexxhigh effort OpenAI | 82.3% |
| 12 | GPT 5.4 (2026-03-05)xhigh effort OpenAI | 82.0% |
| 13 | Claude Sonnet 5max effort Anthropic | 82.0% |
| 14 | Gemini 3.1 Pro Preview Google DeepMind | 82.0% |
| 15 | GPT 5.6 Lunaxhigh effort OpenAI | 81.7% |
| 16 | GPT 5.6 Solhigh effort OpenAI | 81.7% |
| 17 | Kimi K2 6 Moonshot AI | 81.0% |
| 18 | GPT 5.5 (2026-04-22)low effort OpenAI | 81.0% |
| 19 | GPT 5.6 Lunahigh effort OpenAI | 80.3% |
| 20 | GPT 5.6 Solmedium effort OpenAI | 80.3% |
| 21 | GPT 5.1 (2025-11-13)high effort OpenAI | 80.0% |
| 22 | Claude Sonnet 4.6max effort Anthropic | 80.0% |
| 23 | Mimo V2 5 Pro xiaomi | 79.7% |
| 24 | Grok 4.5high effort xAI | 79.3% |
| 25 | Nemotron 3 Ultra 550B A55bthinking NVIDIA | 79.3% |
One row per evaluated system — reasoning-effort variants rank separately.
