BenchAtlas

Rankings / xAI

Grok 4 0709

released 2025-07-09

BenchAtlas Index

as of 2026-09-11
56.3
base configuration
rank #189
10 families · 5 categories · high
52.3
base configuration
rank #221
5 families · 3 categories · medium

Benchmark evidence

54 results
external indices
ECI146.5 pointsindependentEpoch AI Benchmarking Hub
ECIhigh effort146.5 pointsindependentEpoch AI Benchmarking Hub
factuality
SimpleQA Verified47.9 %independentEpoch AI Benchmarking Hub
2025-12-08
human preference
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1437.9
1424.91450.9
communityLMArena Leaderboard Dataset
Coding (style control)older version
arena=text · category=coding · style_control=true
1435.0
1428.11442.0
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1434.1
1426.51441.8
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1432.9
1420.01445.9
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1431.6
1418.21445.0
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1429.6
1418.11441.1
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1426.5
1414.11438.9
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1425.2
1419.51430.9
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1423.2
1416.41430.0
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1423.0
1411.11434.8
communityLMArena Leaderboard Dataset
French (style control)older version
arena=text · category=french · style_control=true
1422.8
1397.41448.2
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1420.2
1415.21425.3
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1419.1
1413.91424.3
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1418.9
1407.01430.9
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1417.9
1397.61438.1
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1415.6
1408.91422.3
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1413.8
1394.41433.1
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1412.1
1404.31419.9
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1411.0
1407.01414.9
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1410.2
1399.11421.2
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1400.8
1395.91405.6
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1398.3
1391.61405.1
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1396.7
1391.31402.1
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1396.6
1390.41402.8
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1394.7
1387.31402.1
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1394.5
1385.91403.0
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1394.4
1373.81414.9
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1386.3
1379.01393.6
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1369.9
1348.21391.5
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=vals-ai
88.1 %independentVals AI
GPQA Diamond87.0 %independentEpoch AI Benchmarking Hub
MMLU-Pro
implementation=vals-ai
85.3 %independentVals AI
multimodal
MMMU
implementation=vals-ai
76.3 %independentVals AI
professional
CaseLaw65.8 %independentVals AI
CorpFin66.0 %independentVals AI
LegalBench83.2 %independentVals AI
MedQA92.5 %independentVals AI
TaxEval65.1 %independentVals AI
reasoning math
AIME
implementation=vals-ai
90.6 %independentVals AI
ARC-AGI-1older version
split=public_eval · model_type=CoT
73.7 %independentARC Prize Leaderboard
ARC-AGI-1older version
split=semi_private · model_type=CoT
66.7 %independentARC Prize Leaderboard
ARC-AGI-2
split=public_eval · model_type=CoT
21.1 %independentARC Prize Leaderboard
ARC-AGI-2
split=semi_private · model_type=CoT
16.0 %independentARC Prize Leaderboard
ARC-AGI-2
split=semi_private · model_type=CoT
2.2 usd_per_taskindependentARC Prize Leaderboard
ARC-AGI-2
split=public_eval · model_type=CoT
2.1 usd_per_taskindependentARC Prize Leaderboard
ARC-AGI-1older version
split=semi_private · model_type=CoT
1.0 usd_per_taskindependentARC Prize Leaderboard
ARC-AGI-1older version
split=public_eval · model_type=CoT
0.8 usd_per_taskindependentARC Prize Leaderboard
FrontierMath19.7 %independentEpoch AI Benchmarking Hub
2025-11-13
FrontierMath Tier 4older version2.1 %independentEpoch AI Benchmarking Hub
2025-08-11
MATH-500
implementation=vals-ai
96.2 %independentVals AI
OTIS Mock AIME 2024–202584.0 %independentEpoch AI Benchmarking Hub

Agent + model results

systems, not bare-model scores
agent + model OpenHands + Grok 4 0709Terminal-Bench 2.027.2 %communityTerminal-Bench Leaderboard
agent + model mini-SWE-agent + Grok 4 0709Terminal-Bench 2.025.4 %communityTerminal-Bench Leaderboard
agent + model terminus-2 + Grok 4 0709Terminal-Bench 2.023.1 %communityTerminal-Bench Leaderboard

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants