BenchAtlas

Rankings / Google DeepMind

Gemma 4 31B

open weights

released 2026-04-02

BenchAtlas Index

as of 2026-09-11
49.8
thinking
rank #239
7 families · 4 categories · medium
43.4
no reasoning
rank #284
7 families · 4 categories · medium

Benchmark evidence

35 results
agentic coding
τ²-Benchno reasoning65.5 %independentArtificial Analysis
τ²-Benchthinking59.9 %independentArtificial Analysis
τ²-Bench
subset=banking
thinking14.8 %independentArtificial Analysis
τ²-Bench
subset=banking
no reasoning8.9 %independentArtificial Analysis
coding
SciCodethinking45.5 %independentArtificial Analysis
SciCodeno reasoning41.1 %independentArtificial Analysis
external indices
AA Coding Indexthinking43.4 pointsindependentArtificial Analysis
AA Coding Indexno reasoning33.2 pointsindependentArtificial Analysis
Intelligence Index v4.1thinking15.4 pointsindependentArtificial Analysis
Intelligence Index v4.1no reasoning13.9 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1498.9
1483.51514.2
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1491.4
1479.21503.6
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1484.8
1468.81500.8
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1473.7
1463.81483.5
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1473.5
1454.01492.9
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1468.0
1447.61488.5
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1467.5
1453.81481.2
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1464.4
1446.61482.1
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1462.6
1450.61474.6
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1454.3
1443.21465.4
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1452.4
1438.51466.3
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1451.3
1443.71458.9
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1445.8
1428.81462.7
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1436.8
1427.31446.4
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1433.4
1417.61449.2
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1420.1
1400.81439.4
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1416.4
1398.41434.4
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
thinking85.7 %independentArtificial Analysis
GPQA Diamond
implementation=artificial-analysis
no reasoning76.3 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
thinking23.6 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
no reasoning11.8 %independentArtificial Analysis
long context instruction
AA-LCRthinking69.7 %independentArtificial Analysis
AA-LCRno reasoning46.7 %independentArtificial Analysis
IFBenchthinking75.6 %independentArtificial Analysis
IFBenchno reasoning53.5 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Gemma 4 31BTerminal-Bench 2.143.5 %independentArtificial Analysis
agent + model Artificial Analysis harness + Gemma 4 31BTerminal-Bench Hard36.4 %independentArtificial Analysis
agent + model Artificial Analysis harness + Gemma 4 31BTerminal-Bench Hard30.3 %independentArtificial Analysis
agent + model Artificial Analysis harness + Gemma 4 31BTerminal-Bench 2.129.2 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants