BenchAtlas

Benchmarks / Coding

LiveBench Coding

Contamination-limited monthly-refreshed benchmark; category mean over its tasks.

maintained by LiveBench · livebench.ai · 40 observations on record

Versions

1 version
VersionTasks
Release 2026-06-25 current
livebench-coding-2026-06-25

Current leaderboard

Release 2026-06-25 · Accuracy · top 25 of 40 systems
7881838688
Claude Fable 5
86.0
GPT 5.6 Sol
83.9
GPT 5.2 Codex
83.6
GPT 5.6 Luna
82.9
Claude Fable 5
82.5
GPT 5.5 (2026-04-22)
82.2
Claude Opus 4.7
82.1
GPT 5.6 Sol
81.8
Claude Opus 4.8
81.8
Claude Sonnet 5
80.7
#SystemAccuracy %
1Claude Fable 5max effort
Anthropic
86.0%
2GPT 5.6 Solmax effort
OpenAI
83.9%
3GPT 5.2 Codex
OpenAI
83.6%
4GPT 5.6 Lunamax effort
OpenAI
82.9%
5Claude Fable 5xhigh effort
Anthropic
82.5%
6GPT 5.5 (2026-04-22)xhigh effort
OpenAI
82.2%
7Claude Opus 4.7xhigh effort
Anthropic
82.1%
8GPT 5.6 Solxhigh effort
OpenAI
81.8%
9Claude Opus 4.8max effort
Anthropic
81.8%
10Claude Sonnet 5xhigh effort
Anthropic
80.7%
11Muse Spark 1.1high effort
Meta AI
80.4%
12GPT 5.5 (2026-04-22)high effort
OpenAI
80.0%
13GLM 5.2
Z.ai
79.7%
14Claude Opus 4.5 20251101high effort · 64K budget
Anthropic
79.7%
15Claude Opus 4.8xhigh effort
Anthropic
79.3%
16Claude Sonnet 4.6medium effort
Anthropic
79.3%
17GPT 5.5 (2026-04-22)
OpenAI
78.6%
18Kimi K2 6thinking
Moonshot AI
78.6%
19GPT 5.6 Terramax effort
OpenAI
78.3%
20Claude Opus 4.6high effort
Anthropic
78.2%
21Gemini 3.5 Flashhigh effort
Google DeepMind
78.2%
22Qwen3 6 Plus
Alibaba
78.2%
23GPT 5.4 (2026-03-05)xhigh effort
OpenAI
77.5%
24Muse Spark 1.1xhigh effort
Meta AI
77.2%
25GPT 5.6 Lunaxhigh effort
OpenAI
76.7%

One row per evaluated system — reasoning-effort variants rank separately.