BenchAtlas

Benchmarks / Professional Domains

TaxEval

Vals AI's tax-law reasoning benchmark.

maintained by Vals AI · www.vals.ai · 131 observations on record

Versions

1 version
VersionTasks
TaxEval current
tax-eval

Current leaderboard

TaxEval · Accuracy · top 25 of 131 systems
7375788082
Muse Spark 1.1
79.7
Muse Spark
77.7
Claude Sonnet 4.6
77.1
Claude Fable 5
76.9
GPT 5.6 Terra
76.2
GPT 5.6 Luna
76.2
Claude Opus 4.6
76.0
Grok 3
75.9
GPT 5.2 (2025-12-11)
75.8
Grok 4 Fast Reasoning
75.7
#SystemAccuracy %
1Muse Spark 1.1xhigh effort
Meta AI
79.7%
2Muse Spark
Meta AI
77.7%
3Claude Sonnet 4.6max effort
Anthropic
77.1%
4Claude Fable 5max effort
Anthropic
76.9%
5GPT 5.6 Terraxhigh effort
OpenAI
76.2%
6GPT 5.6 Lunamax effort
OpenAI
76.2%
7Claude Opus 4.6max effort
Anthropic
76.0%
8Grok 3
xAI
75.9%
9GPT 5.2 (2025-12-11)xhigh effort
OpenAI
75.8%
10Grok 4 Fast Reasoning
xAI
75.7%
11Claude Sonnet 5max effort
Anthropic
75.6%
12Claude Opus 4.8max effort
Anthropic
75.6%
13Qwen3 7 Max
Alibaba (Qwen)
75.3%
14Claude Opus 4.7max effort
Anthropic
75.3%
15GPT 5 Mini (2025-08-07)high effort
OpenAI
75.2%
16GPT 4.1 (2025-04-14)high effort
OpenAI
75.1%
17GPT 5.5 (2026-04-22)xhigh effort
OpenAI
75.0%
18GPT 5.1 (2025-11-13)high effort
OpenAI
74.9%
19Claude Opus 4.5 20251101high effort
Anthropic
74.9%
20O4 Mini (2025-04-16)high effort
OpenAI
74.8%
21GPT 5.6 Solmax effort
OpenAI
74.8%
22Qwen3 6 Plus
Alibaba
74.7%
23Kimi K2 6
Moonshot AI
74.7%
24O3 (2025-04-16)high effort
OpenAI
74.6%
25GPT 4o (2024-11-20)high effort
OpenAI
74.5%

One row per evaluated system — reasoning-effort variants rank separately.