Benchmarks / Reasoning & Math
EnigmaEval
Long, multimodal puzzle-solving benchmark (Scale Labs).
maintained by Scale (Scale Labs) · 52 observations on record
Versions
1 version
| Version | Tasks |
|---|---|
| EnigmaEval current enigmaeval | — |
Current leaderboard
EnigmaEval · Accuracy · top 25 of 52 systems
| # | System | Accuracy % |
|---|---|---|
| 1 | Claude Fable 5high effort Anthropic | 39.3% 36.5–42.1 |
| 2 | GPT 5.6 Solhigh effort OpenAI | 37.1% 34.3–39.9 |
| 3 | Gemini 3.1 Pro Previewhigh effort Google DeepMind | 36.8% 34.1–39.5 |
| 4 | Gemini 3.5 Flashhigh effort Google DeepMind | 25.4% 23.0–27.9 |
| 5 | GPT 5.4 Pro (2026-03-05) OpenAI | 23.8% 21.4–26.3 |
| 6 | Claude Opus 4.8xhigh effort Anthropic | 23.5% 21.1–25.9 |
| 7 | Gemini 3.1 Pro Preview Google DeepMind | 19.8% 17.5–22.0 |
| 8 | GPT 5 Pro (2025-10-06) OpenAI | 18.8% 16.5–21.0 |
| 9 | Gemini 3 Pro Preview Google DeepMind | 18.2% 16.0–20.4 |
| 10 | GPT 5.4 (2026-03-05)max effort OpenAI | 16.0% 13.9–18.1 |
| 11 | o3 (medium) (April 2025) OpenAI | 13.1% 11.2–15.0 |
| 12 | Claude Opus 4.5 20251101thinking Anthropic | 11.9% 10.1–13.8 |
| 13 | o3 (high) (April 2025) OpenAI | 11.9% 10.1–13.8 |
| 14 | GPT 5.1 (2025-11-13)thinking OpenAI | 11.2% 9.4–13.0 |
| 15 | GPT 5 (2025-08-07) OpenAI | 10.5% 8.7–12.2 |
| 16 | GPT 5.2 (2025-12-11) OpenAI | 10.4% 8.7–12.1 |
| 17 | o4-mini (high) (April 2025) OpenAI | 9.2% 7.6–10.9 |
| 18 | GPT 5 Mini (2025-08-07) OpenAI | 8.2% 6.6–9.8 |
| 19 | Claude Opus 4.6max effort Anthropic | 7.6% 6.1–9.1 |
| 20 | Claude Opus 4.1 20250805thinking Anthropic | 7.2% 5.7–8.7 |
| 21 | Claude Opus 4.6no reasoning Anthropic | 6.8% 5.4–8.3 |
| 22 | o4-mini (medium) (April 2025) OpenAI | 6.8% 6.0–7.6 |
| 23 | o1 Pro (March 2025) OpenAI | 6.1% 4.8–7.5 |
| 24 | Claude Sonnet 4.5 20250929thinking Anthropic | 6.0% 4.7–7.3 |
| 25 | o1 (December 2024) OpenAI | 5.7% 4.3–7.0 |
One row per evaluated system — reasoning-effort variants rank separately.
