BenchAtlas

Rankings / Google

Gemma 4 26B A4b

open weights

released 2026-04-02

BenchAtlas Index

as of 2026-09-11
44.2
thinking
rank #279
7 families · 4 categories · medium
37.5
no reasoning
rank #324
7 families · 4 categories · medium

Benchmark evidence

34 results
agentic coding
τ²-Benchthinking43.6 %independentArtificial Analysis
τ²-Benchno reasoning40.4 %independentArtificial Analysis
τ²-Bench
subset=banking
thinking12.0 %independentArtificial Analysis
coding
SciCodethinking40.0 %independentArtificial Analysis
SciCodeno reasoning37.3 %independentArtificial Analysis
external indices
AA Coding Indexthinking39.3 pointsindependentArtificial Analysis
Intelligence Index v4.1thinking16.7 pointsindependentArtificial Analysis
Intelligence Index v4.1no reasoning13.1 pointsindependentArtificial Analysis
ECI141.9 pointsindependentEpoch AI Benchmarking Hub
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1481.0
1465.81496.2
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1475.2
1463.01487.5
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1473.2
1456.81489.5
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1461.8
1451.81471.9
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1452.6
1433.41471.8
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1450.9
1438.61463.1
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1448.8
1434.51463.1
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1448.1
1430.61465.6
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1447.1
1429.61464.5
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1441.3
1422.21460.3
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1438.8
1424.81452.7
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1438.5
1430.81446.1
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1435.5
1424.31446.6
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1423.7
1414.11433.2
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1410.0
1392.01428.1
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1409.9
1394.31425.6
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1403.8
1384.91422.7
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
thinking79.2 %independentArtificial Analysis
GPQA Diamond
implementation=artificial-analysis
no reasoning71.4 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
thinking19.3 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
no reasoning11.5 %independentArtificial Analysis
long context instruction
AA-LCRthinking65.7 %independentArtificial Analysis
AA-LCRno reasoning42.3 %independentArtificial Analysis
IFBenchthinking72.5 %independentArtificial Analysis
IFBenchno reasoning45.4 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Gemma 4 26B A4bTerminal-Bench 2.139.0 %independentArtificial Analysis
agent + model Artificial Analysis harness + Gemma 4 26B A4bTerminal-Bench Hard25.0 %independentArtificial Analysis
agent + model Artificial Analysis harness + Gemma 4 26B A4bTerminal-Bench Hard13.6 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.