Benchmarks / Factuality
SimpleQA Verified
Short-form factuality benchmark (verified subset).
maintainer unknown · 130 observations on record
Versions
1 version
| Version | Tasks |
|---|---|
| SimpleQA Verified current simpleqa-verified | — |
Current leaderboard
SimpleQA Verified · Accuracy · top 25 of 83 systems
| # | System | Accuracy % |
|---|---|---|
| 1 | Gemini 3.1 Pro Preview Google DeepMind | 77.3% |
| 2 | Gemini 3.1 Pro Previewhigh effort Google DeepMind | 73.5% |
| 3 | Gemini 3 Pro Preview Google DeepMind | 72.9% |
| 4 | GPT 5.6 Solmax effort OpenAI | 71.6% |
| 5 | Claude Fable 5xhigh effort Anthropic | 70.7% |
| 6 | Gemini 3.5 Flashhigh effort Google DeepMind | 68.4% |
| 7 | Qwen3 Max (2025-09-23) Alibaba | 67.5% |
| 8 | Gemini 3 Flash Preview Google DeepMind | 67.4% |
| 9 | Gemini 3 Flash Previewhigh effort Google DeepMind | 66.8% |
| 10 | Muse Spark Meta AI | 66.3% |
| 11 | GPT 5.5 Pro Pre Releasexhigh effort OpenAI | 64.5% |
| 12 | GPT 5.5 Pre Releasexhigh effort OpenAI | 63.1% |
| 13 | GPT 5.5 (2026-04-22)xhigh effort OpenAI | 63.0% |
| 14 | Qwen3 7max effort Alibaba | 58.5% |
| 15 | Muse Spark 1.1 Meta AI | 57.8% |
| 16 | Deepseek V4 Promax effort DeepSeek | 57.0% |
| 17 | Qwen3 6 Max Preview Alibaba | 56.9% |
| 18 | Gemini 2.5 Pro (2025-06-17) Google DeepMind | 56.0% |
| 19 | Grok 4.5high effort xAI | 53.5% |
| 20 | Claude Opus 4.8max effort Anthropic | 53.0% |
| 21 | O3 (2025-04-16)high effort OpenAI | 53.0% |
| 22 | Claude Opus 4.7xhigh effort Anthropic | 51.7% |
| 23 | GPT 5 (2025-08-07)high effort OpenAI | 50.6% |
| 24 | Qwen3 235B A22b 2507thinking Alibaba | 50.1% |
| 25 | Qwen3 6 Plus Alibaba | 49.1% |
One row per evaluated system — reasoning-effort variants rank separately. Where a system has attr variants for this version (eval splits, style control), only the canonical variant is ranked: split=semi_private, style_control=true, or the unsplit run.
