BenchAtlas

Rankings / xAI

Grok 4.3

released 2026-04-17

BenchAtlas Index

as of 2026-09-11
58.1
high effort
rank #175
8 families · 5 categories · high
52.2
medium effort
rank #222
7 families · 4 categories · medium
50.9
base configuration
rank #230
8 families · 4 categories · medium

Benchmark evidence

84 results
agentic coding
Release 2026-06-25
tasks_counted=3 · livebench_version=2026-06-25
18.5 %independentLiveBench
τ²-Benchhigh effort97.7 %independentArtificial Analysis
τ²-Benchmedium effort91.2 %independentArtificial Analysis
τ²-Benchlow effort88.9 %independentArtificial Analysis
τ²-Benchno reasoning65.8 %independentArtificial Analysis
τ²-Bench
subset=banking
high effort12.4 %independentArtificial Analysis
τ²-Bench
subset=banking
no reasoning8.0 %independentArtificial Analysis
coding
Release 2026-06-25
tasks_counted=2 · livebench_version=2026-06-25
69.9 %independentLiveBench
SciCodehigh effort48.3 %independentArtificial Analysis
SciCodemedium effort44.6 %independentArtificial Analysis
SciCodelow effort41.9 %independentArtificial Analysis
SciCodeno reasoning39.4 %independentArtificial Analysis
data analysis
Release 2026-06-25
tasks_counted=3 · livebench_version=2026-06-25
55.8 %independentLiveBench
external indices
AA Coding Indexhigh effort42.2 pointsindependentArtificial Analysis
AA Coding Indexno reasoning35.2 pointsindependentArtificial Analysis
Intelligence Index v4.1high effort25.4 pointsindependentArtificial Analysis
Intelligence Index v4.1medium effort24.8 pointsindependentArtificial Analysis
Intelligence Index v4.1low effort24.3 pointsindependentArtificial Analysis
Intelligence Index v4.1no reasoning14.5 pointsindependentArtificial Analysis
ECI149.2 pointsindependentEpoch AI Benchmarking Hub
ECIhigh effort149.2 pointsindependentEpoch AI Benchmarking Hub
ECIno reasoning149.2 pointsindependentEpoch AI Benchmarking Hub
Vals Indexhigh effort24.3 pointsindependentVals AI
factuality
SimpleQA Verifiedhigh effort38.0 %independentEpoch AI Benchmarking Hub
2026-06-16
SimpleQA Verifiedhigh effort33.2 %independentEpoch AI Benchmarking Hub
2026-08-27
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1488.1
1482.21493.9
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1479.5
1474.31484.6
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1478.9
1468.21489.7
communityLMArena Leaderboard Dataset
French (style control)older version
arena=text · category=french · style_control=true
1462.8
1448.41477.3
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1462.2
1456.61467.9
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1460.1
1453.21467.0
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1457.2
1452.71461.7
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1454.2
1444.61463.8
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1452.5
1444.31460.8
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1451.7
1446.81456.5
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1446.7
1428.51465.0
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1445.8
1439.01452.5
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1445.1
1439.91450.2
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1443.0
1439.21446.7
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1442.2
1434.01450.3
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1442.1
1437.21447.1
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1441.8
1426.61456.9
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1440.0
1419.91460.1
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1439.6
1433.11446.1
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1436.0
1426.81445.2
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1435.5
1424.61446.4
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1429.9
1425.21434.5
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1428.1
1404.41451.9
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1426.7
1419.91433.6
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1426.3
1420.31432.3
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1420.4
1409.01431.7
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1417.8
1411.61424.0
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1415.5
1410.11421.0
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1404.2
1384.21424.3
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=vals-ai
91.4 %independentVals AI
GPQA Diamond
implementation=artificial-analysis
high effort90.1 %independentArtificial Analysis
GPQA Diamond
implementation=artificial-analysis
medium effort89.0 %independentArtificial Analysis
GPQA Diamondhigh effort88.8 %independentEpoch AI Benchmarking Hub
2026-06-17
GPQA Diamond
implementation=artificial-analysis
low effort84.3 %independentArtificial Analysis
GPQA Diamond
implementation=artificial-analysis
no reasoning65.8 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
high effort37.2 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
medium effort30.0 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
low effort18.4 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
no reasoning6.8 %independentArtificial Analysis
MMLU-Pro
implementation=vals-ai
high effort85.8 %independentVals AI
MMLU-Pro
implementation=vals-ai
85.8 %independentVals AI
language
Release 2026-06-25
tasks_counted=3 · livebench_version=2026-06-25
73.6 %independentLiveBench
long context instruction
AA-LCRmedium effort75.0 %independentArtificial Analysis
AA-LCRlow effort74.0 %independentArtificial Analysis
AA-LCRhigh effort73.0 %independentArtificial Analysis
AA-LCRno reasoning32.3 %independentArtificial Analysis
IFBenchmedium effort83.3 %independentArtificial Analysis
IFBenchhigh effort81.3 %independentArtificial Analysis
IFBenchlow effort81.0 %independentArtificial Analysis
IFBenchno reasoning47.6 %independentArtificial Analysis
Release 2026-06-25
tasks_counted=4 · livebench_version=2026-06-25
62.8 %independentLiveBench
multimodal
MMMU
implementation=vals-ai
83.1 %independentVals AI
professional
CaseLaw79.3 %independentVals AI
CorpFin68.5 %independentVals AI
LegalBench84.5 %independentVals AI
TaxEval70.8 %independentVals AI
reasoning math
Release 2026-06-25
tasks_counted=4 · livebench_version=2026-06-25
84.3 %independentLiveBench
Release 2026-06-25
tasks_counted=4 · livebench_version=2026-06-25
70.8 %independentLiveBench
OTIS Mock AIME 2024–2025high effort93.3 %independentEpoch AI Benchmarking Hub
2026-06-17

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Grok 4.3Terminal-Bench 2.139.7 %independentArtificial Analysis
agent + model Artificial Analysis harness + Grok 4.3Terminal-Bench Hard37.9 %independentArtificial Analysis
agent + model Artificial Analysis harness + Grok 4.3Terminal-Bench 2.134.1 %independentArtificial Analysis
agent + model Artificial Analysis harness + Grok 4.3Terminal-Bench Hard30.3 %independentArtificial Analysis
agent + model Artificial Analysis harness + Grok 4.3Terminal-Bench Hard26.5 %independentArtificial Analysis
agent + model Artificial Analysis harness + Grok 4.3Terminal-Bench Hard18.9 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants