BenchAtlas

Rankings / ibm

Granite 4.1 8B

open weights

released 2026-04-29

BenchAtlas Index

as of 2026-09-11
17.9
base configuration
rank #444
7 families · 4 categories · medium

Benchmark evidence

25 results
agentic coding
τ²-Bench27.8 %independentArtificial Analysis
τ²-Bench
subset=banking
3.1 %independentArtificial Analysis
coding
SciCode21.8 %independentArtificial Analysis
external indices
AA Coding Index9.5 pointsindependentArtificial Analysis
Intelligence Index v4.16.6 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1353.6
1333.61373.6
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1351.1
1334.81367.4
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1338.7
1320.91356.5
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1331.0
1316.71345.4
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1323.3
1298.21348.4
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1321.2
1308.31334.0
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1306.0
1295.81316.2
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1301.2
1276.91325.5
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1293.9
1276.81311.0
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1287.3
1269.71305.0
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1284.2
1258.81309.6
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1275.9
1261.71290.0
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1275.9
1254.71297.1
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1268.1
1242.61293.5
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1261.1
1238.31283.9
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1253.8
1239.41268.2
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
43.3 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
3.8 %independentArtificial Analysis
long context instruction
AA-LCR13.3 %independentArtificial Analysis
IFBench38.6 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Granite 4.1 8BTerminal-Bench 2.13.4 %independentArtificial Analysis
agent + model Artificial Analysis harness + Granite 4.1 8BTerminal-Bench Hard0.0 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.