BenchAtlas

Benchmarks / Professional Domains

LegalBench

Legal reasoning task suite run by Vals AI.

maintained by Vals AI · www.vals.ai · 131 observations on record

Versions

1 version
VersionTasks
LegalBench current
legal-bench

Current leaderboard

LegalBench · Accuracy · top 25 of 131 systems
8385878991
Claude Fable 5
88.6
Gemini 3.1 Pro Preview
87.4
Gemini 3 Pro Preview
87.0
GPT 5.6 Sol
87.0
Gemini 3 Flash Preview
86.9
GPT 5.5 (2026-04-22)
86.5
GPT 5.4 (2026-03-05)
86.0
GPT 5 (2025-08-07)
86.0
Grok 4.5
86.0
GPT 5.1 (2025-11-13)
85.7
#SystemAccuracy %
1Claude Fable 5max effort
Anthropic
88.6%
2Gemini 3.1 Pro Previewhigh effort
Google DeepMind
87.4%
3Gemini 3 Pro Previewhigh effort
Google DeepMind
87.0%
4GPT 5.6 Solmax effort
OpenAI
87.0%
5Gemini 3 Flash Previewhigh effort
Google DeepMind
86.9%
6GPT 5.5 (2026-04-22)xhigh effort
OpenAI
86.5%
7GPT 5.4 (2026-03-05)xhigh effort
OpenAI
86.0%
8GPT 5 (2025-08-07)high effort
OpenAI
86.0%
9Grok 4.5high effort
xAI
86.0%
10GPT 5.1 (2025-11-13)high effort
OpenAI
85.7%
11Minimax M3
MiniMax
85.4%
12Claude Opus 4.6max effort
Anthropic
85.3%
13Claude Opus 4.7max effort
Anthropic
85.3%
14GPT 5.6 Terraxhigh effort
OpenAI
85.1%
15GPT 5.6 Terramax effort
OpenAI
85.1%
16Qwen3 5 Plusthinking
Alibaba
85.1%
17Muse Spark 1.1xhigh effort
Meta AI
85.0%
18Qwen3 7 Max
Alibaba (Qwen)
84.9%
19Kimi K2 6
Moonshot AI
84.7%
20Claude Opus 4.5 20251101high effort
Anthropic
84.6%
21Grok 4.3
xAI
84.5%
22GLM 5.1
Z.ai
84.4%
23GLM 5.1
Z.ai
84.4%
24Gemini 2.5 Pro Exp 03.25
Google DeepMind
84.3%
25Qwen3 5 Flash
Alibaba
84.3%

One row per evaluated system — reasoning-effort variants rank separately.