BenchAtlas

Benchmarks / Agentic Coding

LiveBench Agentic Coding

Contamination-limited monthly-refreshed benchmark; category mean over its tasks.

maintained by LiveBench · livebench.ai · 51 observations on record

Versions

1 version
VersionTasks
Release 2026-06-25 current
livebench-agentic-coding-2026-06-25

Current leaderboard

Release 2026-06-25 · Accuracy · top 25 of 40 systems
5155586265
Claude Fable 5
62.2
Claude Sonnet 5
59.4
Muse Spark 1.1
58.5
GPT 5.6 Sol
56.6
Grok 4.5
56.5
GPT 5.6 Sol
56.2
Claude Opus 4.8
56.1
GPT 5.6 Terra
55.0
GPT 5.5 (2026-04-22)
54.0
GPT 5.4 (2026-03-05)
53.8
#SystemAccuracy %
1Claude Fable 5max effort
Anthropic
62.2%
2Claude Sonnet 5xhigh effort
Anthropic
59.4%
3Muse Spark 1.1xhigh effort
Meta AI
58.5%
4GPT 5.6 Solxhigh effort
OpenAI
56.6%
5Grok 4.5
xAI
56.5%
6GPT 5.6 Solmax effort
OpenAI
56.2%
7Claude Opus 4.8xhigh effort
Anthropic
56.1%
8GPT 5.6 Terramax effort
OpenAI
55.0%
9GPT 5.5 (2026-04-22)xhigh effort
OpenAI
54.0%
10GPT 5.4 (2026-03-05)xhigh effort
OpenAI
53.8%
11GPT 5.6 Terraxhigh effort
OpenAI
53.3%
12GLM 5.2
Z.ai
51.8%
13Muse Spark 1.1high effort
Meta AI
51.6%
14Claude Fable 5xhigh effort
Anthropic
50.7%
15Claude Opus 4.7xhigh effort
Anthropic
50.7%
16Claude Opus 4.8max effort
Anthropic
50.5%
17GPT 5.2 (2025-12-11)high effort
OpenAI
50.3%
18GPT 5.2 Codex
OpenAI
49.4%
19Claude Opus 4.6high effort
Anthropic
49.0%
20Gemini 3.5 Flashhigh effort
Google DeepMind
49.0%
21GPT 5.6 Lunaxhigh effort
OpenAI
48.8%
22GPT 5.6 Lunamax effort
OpenAI
48.4%
23Kimi K2 6thinking
Moonshot AI
46.9%
24GPT 5.4 Nano (2026-03-17)xhigh effort
OpenAI
46.8%
25GPT 5.5 (2026-04-22)high effort
OpenAI
46.8%

One row per evaluated system — reasoning-effort variants rank separately.