BenchAtlas

Rankings / xAI

Grok 4.20 0309 Reasoning

released 2026-02-17

BenchAtlas Index

as of 2026-09-11
64.2
base configuration
rank #120
8 families · 3 categories · medium

Benchmark evidence

15 results
external indices
ECI152.0 pointsindependentEpoch AI Benchmarking Hub
Vals Index17.6 pointsindependentVals AI
factuality
SimpleQA Verified35.1 %independentEpoch AI Benchmarking Hub
2026-07-13
SimpleQA Verified30.2 %independentEpoch AI Benchmarking Hub
2026-08-27
knowledge science
GPQA Diamond89.3 %independentEpoch AI Benchmarking Hub
2026-07-13
GPQA Diamond
implementation=vals-ai
88.6 %independentVals AI
MMLU-Pro
implementation=vals-ai
86.3 %independentVals AI
multimodal
MMMU
implementation=vals-ai
83.5 %independentVals AI
professional
CaseLaw54.4 %independentVals AI
CorpFin63.7 %independentVals AI
LegalBench77.7 %independentVals AI
MedQA94.5 %independentVals AI
TaxEval74.1 %independentVals AI
reasoning math
AIME
implementation=vals-ai
96.5 %independentVals AI
OTIS Mock AIME 2024–202592.2 %independentEpoch AI Benchmarking Hub
2026-07-13

Agent + model results

systems, not bare-model scores
agent + model grok-cli + Grok 4.20 0309 ReasoningTerminal-Bench 2.057.3 %unverifiedTerminal-Bench Leaderboard

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.