BenchAtlas

Rankings / allenai

Olmo 3.1 32B Think

open weights

released 2025-12-12

BenchAtlas Index

as of 2026-09-11
24.9
base configuration
rank #407
9 families · 5 categories · high

Benchmark evidence

32 results
agentic coding
τ²-Bench0.0 %independentArtificial Analysis
coding
LiveCodeBench v6
implementation=artificial-analysis
69.5 %independentArtificial Analysis
SciCode29.3 %independentArtificial Analysis
external indices
Intelligence Index v4.17.1 pointsindependentArtificial Analysis
AA Math Index77.3 pointsindependentArtificial Analysis
human preference
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1348.1
1333.61362.6
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1347.5
1337.11357.9
communityLMArena Leaderboard Dataset
Coding (style control)older version
arena=text · category=coding · style_control=true
1340.2
1324.51355.9
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1334.3
1308.01360.5
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1332.8
1320.81344.8
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1308.3
1291.71324.9
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1304.7
1290.91318.4
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1304.6
1295.01314.2
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1300.1
1275.51324.7
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1288.1
1261.41314.7
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1285.6
1278.31293.0
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1278.5
1265.11291.9
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1277.5
1261.31293.6
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1271.2
1247.01295.4
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1269.3
1255.21283.3
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1265.9
1247.71284.2
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1255.1
1240.11270.2
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1246.7
1229.41264.1
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1231.3
1221.91240.6
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1223.4
1204.21242.7
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1209.7
1198.21221.1
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
59.1 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
6.3 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
76.3 %independentArtificial Analysis
long context instruction
AA-LCR0.0 %independentArtificial Analysis
IFBench66.0 %independentArtificial Analysis
reasoning math
AIME
year=2025 · implementation=artificial-analysis
77.3 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Olmo 3.1 32B ThinkTerminal-Bench Hard0.0 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.