BenchAtlas

Benchmarks / Factuality

SimpleQA Verified

Short-form factuality benchmark (verified subset).

maintainer unknown · 130 observations on record

Versions

1 version
VersionTasks
SimpleQA Verified current
simpleqa-verified

Current leaderboard

SimpleQA Verified · Accuracy · top 25 of 83 systems
6468727680
Gemini 3.1 Pro Preview
77.3
Gemini 3.1 Pro Preview
73.5
Gemini 3 Pro Preview
72.9
GPT 5.6 Sol
71.6
Claude Fable 5
70.7
Gemini 3.5 Flash
68.4
Qwen3 Max (2025-09-23)
67.5
Gemini 3 Flash Preview
67.4
Gemini 3 Flash Preview
66.8
Muse Spark
66.3
#SystemAccuracy %
1Gemini 3.1 Pro Preview
Google DeepMind
77.3%
2Gemini 3.1 Pro Previewhigh effort
Google DeepMind
73.5%
3Gemini 3 Pro Preview
Google DeepMind
72.9%
4GPT 5.6 Solmax effort
OpenAI
71.6%
5Claude Fable 5xhigh effort
Anthropic
70.7%
6Gemini 3.5 Flashhigh effort
Google DeepMind
68.4%
7Qwen3 Max (2025-09-23)
Alibaba
67.5%
8Gemini 3 Flash Preview
Google DeepMind
67.4%
9Gemini 3 Flash Previewhigh effort
Google DeepMind
66.8%
10Muse Spark
Meta AI
66.3%
11GPT 5.5 Pro Pre Releasexhigh effort
OpenAI
64.5%
12GPT 5.5 Pre Releasexhigh effort
OpenAI
63.1%
13GPT 5.5 (2026-04-22)xhigh effort
OpenAI
63.0%
14Qwen3 7max effort
Alibaba
58.5%
15Muse Spark 1.1
Meta AI
57.8%
16Deepseek V4 Promax effort
DeepSeek
57.0%
17Qwen3 6 Max Preview
Alibaba
56.9%
18Gemini 2.5 Pro (2025-06-17)
Google DeepMind
56.0%
19Grok 4.5high effort
xAI
53.5%
20Claude Opus 4.8max effort
Anthropic
53.0%
21O3 (2025-04-16)high effort
OpenAI
53.0%
22Claude Opus 4.7xhigh effort
Anthropic
51.7%
23GPT 5 (2025-08-07)high effort
OpenAI
50.6%
24Qwen3 235B A22b 2507thinking
Alibaba
50.1%
25Qwen3 6 Plus
Alibaba
49.1%

One row per evaluated system — reasoning-effort variants rank separately. Where a system has attr variants for this version (eval splits, style control), only the canonical variant is ranked: split=semi_private, style_control=true, or the unsplit run.