BenchAtlas

Benchmarks / Reasoning & Math

LiveBench Mathematics

Contamination-limited monthly-refreshed benchmark; category mean over its tasks.

maintained by LiveBench · livebench.ai · 40 observations on record

Versions

1 version
VersionTasks
Release 2026-06-25 current
livebench-math-2026-06-25

Current leaderboard

Release 2026-06-25 · Accuracy · top 25 of 40 systems
9294969799
GPT 5.6 Sol
96.2
Claude Fable 5
96.0
GPT 5.5 (2026-04-22)
95.9
Claude Fable 5
95.7
GPT 5.6 Sol
95.5
Claude Opus 4.8
95.3
GPT 5.5 (2026-04-22)
95.2
GPT 5.6 Terra
94.9
Claude Opus 4.8
94.3
GPT 5.4 (2026-03-05)
94.2
#SystemAccuracy %
1GPT 5.6 Solmax effort
OpenAI
96.2%
2Claude Fable 5max effort
Anthropic
96.0%
3GPT 5.5 (2026-04-22)xhigh effort
OpenAI
95.9%
4Claude Fable 5xhigh effort
Anthropic
95.7%
5GPT 5.6 Solxhigh effort
OpenAI
95.5%
6Claude Opus 4.8xhigh effort
Anthropic
95.3%
7GPT 5.5 (2026-04-22)high effort
OpenAI
95.2%
8GPT 5.6 Terramax effort
OpenAI
94.9%
9Claude Opus 4.8max effort
Anthropic
94.3%
10GPT 5.4 (2026-03-05)xhigh effort
OpenAI
94.2%
11GPT 5.2 (2025-12-11)high effort
OpenAI
93.2%
12Claude Sonnet 5xhigh effort
Anthropic
92.9%
13Claude Opus 4.7xhigh effort
Anthropic
92.8%
14Gemini 3.1 Pro Previewhigh effort
Google DeepMind
91.0%
15GPT 5.4 Nano (2026-03-17)xhigh effort
OpenAI
91.0%
16Grok 4.5
xAI
90.8%
17Deepseek V4 Pro
DeepSeek
90.7%
18Claude Opus 4.5 20251101high effort · 64K budget
Anthropic
90.4%
19GLM 5.2
Z.ai
89.8%
20GPT 5.6 Terraxhigh effort
OpenAI
89.5%
21Claude Opus 4.6high effort
Anthropic
89.3%
22GPT 5.2 Codex
OpenAI
88.8%
23Nemotron 3 Ultra 550B A55b
NVIDIA
88.7%
24Gemini 3.5 Flashhigh effort
Google DeepMind
88.2%
25Muse Spark 1.1high effort
Meta AI
87.3%

One row per evaluated system — reasoning-effort variants rank separately.