BenchAtlas

Benchmarks / Reasoning & Math

EnigmaEval

Long, multimodal puzzle-solving benchmark (Scale Labs).

maintained by Scale (Scale Labs) · 52 observations on record

Versions

1 version
VersionTasks
EnigmaEval current
enigmaeval

Current leaderboard

EnigmaEval · Accuracy · top 25 of 52 systems
1120283745
Claude Fable 5
39.3
GPT 5.6 Sol
37.1
Gemini 3.1 Pro Preview
36.8
Gemini 3.5 Flash
25.4
GPT 5.4 Pro (2026-03-05)
23.8
Claude Opus 4.8
23.5
Gemini 3.1 Pro Preview
19.8
GPT 5 Pro (2025-10-06)
18.8
Gemini 3 Pro Preview
18.2
GPT 5.4 (2026-03-05)
16.0
#SystemAccuracy %
1Claude Fable 5high effort
Anthropic
39.3%
36.542.1
2GPT 5.6 Solhigh effort
OpenAI
37.1%
34.339.9
3Gemini 3.1 Pro Previewhigh effort
Google DeepMind
36.8%
34.139.5
4Gemini 3.5 Flashhigh effort
Google DeepMind
25.4%
23.027.9
5GPT 5.4 Pro (2026-03-05)
OpenAI
23.8%
21.426.3
6Claude Opus 4.8xhigh effort
Anthropic
23.5%
21.125.9
7Gemini 3.1 Pro Preview
Google DeepMind
19.8%
17.522.0
8GPT 5 Pro (2025-10-06)
OpenAI
18.8%
16.521.0
9Gemini 3 Pro Preview
Google DeepMind
18.2%
16.020.4
10GPT 5.4 (2026-03-05)max effort
OpenAI
16.0%
13.918.1
11o3 (medium) (April 2025)
OpenAI
13.1%
11.215.0
12Claude Opus 4.5 20251101thinking
Anthropic
11.9%
10.113.8
13o3 (high) (April 2025)
OpenAI
11.9%
10.113.8
14GPT 5.1 (2025-11-13)thinking
OpenAI
11.2%
9.413.0
15GPT 5 (2025-08-07)
OpenAI
10.5%
8.712.2
16GPT 5.2 (2025-12-11)
OpenAI
10.4%
8.712.1
17o4-mini (high) (April 2025)
OpenAI
9.2%
7.610.9
18GPT 5 Mini (2025-08-07)
OpenAI
8.2%
6.69.8
19Claude Opus 4.6max effort
Anthropic
7.6%
6.19.1
20Claude Opus 4.1 20250805thinking
Anthropic
7.2%
5.78.7
21Claude Opus 4.6no reasoning
Anthropic
6.8%
5.48.3
22o4-mini (medium) (April 2025)
OpenAI
6.8%
6.07.6
23o1 Pro (March 2025)
OpenAI
6.1%
4.87.5
24Claude Sonnet 4.5 20250929thinking
Anthropic
6.0%
4.77.3
25o1 (December 2024)
OpenAI
5.7%
4.37.0

One row per evaluated system — reasoning-effort variants rank separately.