BenchAtlas

Rankings / allenai

Olmo 3.1 32B Instruct

open weights

released 2026-01-13

BenchAtlas Index

as of 2026-09-11
18.7
base configuration
rank #440
7 families · 4 categories · medium

Benchmark evidence

29 results
agentic coding
τ²-Bench21.4 %independentArtificial Analysis
coding
SciCode16.7 %independentArtificial Analysis
external indices
Intelligence Index v4.11.0 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1381.5
1369.31393.6
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1377.7
1368.11387.4
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1375.2
1362.91387.5
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1371.0
1362.01380.1
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1356.9
1336.31377.5
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1349.5
1336.51362.5
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1348.2
1340.21356.2
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1342.6
1328.01357.2
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1337.5
1326.31348.6
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1330.0
1323.71336.2
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1329.9
1316.51343.3
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1324.5
1302.61346.4
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1324.3
1301.61347.0
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1321.0
1310.21331.8
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1318.5
1294.81342.1
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1301.8
1278.51325.1
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1301.7
1289.71313.8
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1295.3
1280.31310.3
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1294.9
1281.41308.4
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1294.2
1286.61301.9
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1293.4
1278.21308.5
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1276.9
1267.61286.2
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
53.9 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
5.0 %independentArtificial Analysis
long context instruction
AA-LCR0.0 %independentArtificial Analysis
IFBench39.2 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Olmo 3.1 32B InstructTerminal-Bench Hard0.0 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.