BenchAtlas

Benchmarks / Long Context & Instruction

LiveBench Instruction Following

Contamination-limited monthly-refreshed benchmark; category mean over its tasks.

maintained by LiveBench · livebench.ai · 40 observations on record

Versions

1 version
VersionTasks
Release 2026-06-25 current
livebench-if-2026-06-25

Current leaderboard

Release 2026-06-25 · Accuracy · top 25 of 40 systems
6972767982
Gemini 3.1 Pro Preview
79.1
Claude Fable 5
75.8
Gemini 3.5 Flash
75.6
Qwen3 7 Max
74.0
Nemotron 3 Ultra 550B A55b
73.5
Claude Opus 4.8
72.4
Claude Opus 4.8
72.0
Claude Fable 5
72.0
GPT 5.6 Sol
71.8
Grok 4.5
71.5
#SystemAccuracy %
1Gemini 3.1 Pro Previewhigh effort
Google DeepMind
79.1%
2Claude Fable 5max effort
Anthropic
75.8%
3Gemini 3.5 Flashhigh effort
Google DeepMind
75.6%
4Qwen3 7 Max
Alibaba (Qwen)
74.0%
5Nemotron 3 Ultra 550B A55b
NVIDIA
73.5%
6Claude Opus 4.8xhigh effort
Anthropic
72.4%
7Claude Opus 4.8max effort
Anthropic
72.0%
8Claude Fable 5xhigh effort
Anthropic
72.0%
9GPT 5.6 Solmax effort
OpenAI
71.8%
10Grok 4.5
xAI
71.5%
11GPT 5.5 (2026-04-22)high effort
OpenAI
71.4%
12GPT 5.5 (2026-04-22)xhigh effort
OpenAI
70.7%
13GPT 5.4 (2026-03-05)xhigh effort
OpenAI
70.2%
14Muse Spark 1.1high effort
Meta AI
70.1%
15Muse Spark 1.1xhigh effort
Meta AI
69.6%
16GPT 5.6 Solxhigh effort
OpenAI
67.4%
17GPT 5.4 Nano (2026-03-17)xhigh effort
OpenAI
67.2%
18Claude Opus 4.7xhigh effort
Anthropic
66.7%
19GPT 5.2 Codex
OpenAI
66.5%
20GPT 5.5 (2026-04-22)
OpenAI
65.7%
21Grok Build 0.1
xAI
65.2%
22GPT 5.6 Terramax effort
OpenAI
64.6%
23Kimi K2 6thinking
Moonshot AI
64.4%
24Claude Sonnet 5xhigh effort
Anthropic
63.9%
25Claude Opus 4.6high effort
Anthropic
63.3%

One row per evaluated system — reasoning-effort variants rank separately.