BenchAtlas

Benchmarks / Reasoning & Math

LiveBench Reasoning

Contamination-limited monthly-refreshed benchmark; category mean over its tasks.

maintained by LiveBench · livebench.ai · 40 observations on record

Versions

1 version
VersionTasks
Release 2026-06-25 current
livebench-reasoning-2026-06-25

Current leaderboard

Release 2026-06-25 · Accuracy · top 25 of 40 systems
8688909294
GPT 5.6 Sol
91.7
GPT 5.6 Terra
90.6
GPT 5.6 Sol
90.2
Claude Opus 4.8
89.7
GPT 5.5 (2026-04-22)
89.7
Claude Fable 5
89.7
GPT 5.5 (2026-04-22)
89.7
Claude Opus 4.8
89.2
Claude Sonnet 5
88.7
Claude Opus 4.6
88.7
#SystemAccuracy %
1GPT 5.6 Solmax effort
OpenAI
91.7%
2GPT 5.6 Terramax effort
OpenAI
90.6%
3GPT 5.6 Solxhigh effort
OpenAI
90.2%
4Claude Opus 4.8xhigh effort
Anthropic
89.7%
5GPT 5.5 (2026-04-22)high effort
OpenAI
89.7%
6Claude Fable 5max effort
Anthropic
89.7%
7GPT 5.5 (2026-04-22)xhigh effort
OpenAI
89.7%
8Claude Opus 4.8max effort
Anthropic
89.2%
9Claude Sonnet 5xhigh effort
Anthropic
88.7%
10Claude Opus 4.6high effort
Anthropic
88.7%
11Muse Spark 1.1high effort
Meta AI
88.4%
12GPT 5.4 (2026-03-05)xhigh effort
OpenAI
88.1%
13Muse Spark 1.1xhigh effort
Meta AI
87.7%
14Claude Fable 5xhigh effort
Anthropic
87.7%
15GPT 5.5 (2026-04-22)
OpenAI
87.3%
16Claude Opus 4.7xhigh effort
Anthropic
87.2%
17Grok 4.5
xAI
87.2%
18GPT 5.6 Lunamax effort
OpenAI
85.6%
19GPT 5.6 Terraxhigh effort
OpenAI
84.9%
20Claude Sonnet 4.6medium effort
Anthropic
84.8%
21GPT 5.6 Lunaxhigh effort
OpenAI
84.7%
22Gemini 3.1 Pro Previewhigh effort
Google DeepMind
84.0%
23Qwen3 7 Max
Alibaba (Qwen)
83.3%
24GPT 5.2 (2025-12-11)high effort
OpenAI
83.2%
25Kimi K2 7 Code
Moonshot
82.8%

One row per evaluated system — reasoning-effort variants rank separately.