BenchAtlas

Rankings / allenai

Olmo 3 32B Think

open weights

released 2025-11-20

BenchAtlas Index

as of 2026-09-11
24.6
base configuration
rank #409
9 families · 5 categories · high

Benchmark evidence

28 results
agentic coding
τ²-Bench0.0 %independentArtificial Analysis
coding
LiveCodeBench v6
implementation=artificial-analysis
67.2 %independentArtificial Analysis
SciCode28.6 %independentArtificial Analysis
external indices
Intelligence Index v4.16.5 pointsindependentArtificial Analysis
AA Math Index73.7 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1363.7
1345.01382.4
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1359.6
1345.61373.6
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1356.0
1339.31372.6
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1351.4
1339.31363.4
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1327.9
1308.11347.8
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1326.5
1315.21337.7
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1320.9
1304.31337.5
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1310.2
1291.91328.6
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1306.7
1298.41315.0
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1300.7
1278.51322.8
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1299.7
1283.81315.7
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1277.9
1261.21294.7
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1272.3
1247.11297.5
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1267.9
1249.41286.3
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1265.0
1254.01276.0
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1264.2
1243.41285.1
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1248.9
1236.61261.2
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
61.0 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
6.4 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
75.9 %independentArtificial Analysis
long context instruction
AA-LCR0.0 %independentArtificial Analysis
IFBench49.1 %independentArtificial Analysis
reasoning math
AIME
year=2025 · implementation=artificial-analysis
73.7 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Olmo 3 32B ThinkTerminal-Bench Hard1.5 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.