BenchAtlas

Rankings / Alibaba

Qwen2 5 Coder 32B Instruct

open weights

released 2024-11-11

BenchAtlas Index

as of 2026-09-11
18.6
base configuration
rank #441
7 families · 4 categories · medium

Benchmark evidence

28 results
coding
LiveCodeBench v6
implementation=artificial-analysis
29.5 %independentArtificial Analysis
SciCode27.1 %independentArtificial Analysis
external indices
Intelligence Index v4.16.7 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1342.2
1323.71360.7
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1319.3
1304.41334.1
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1317.7
1298.01337.4
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1302.8
1288.31317.4
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1286.8
1268.01305.7
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1285.9
1274.71297.1
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1282.8
1260.51305.1
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1281.1
1256.11306.1
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1277.1
1259.11295.2
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1270.3
1262.21278.4
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1270.3
1251.71288.9
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1269.6
1250.31288.9
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1268.7
1247.81289.6
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1263.9
1252.01275.8
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1251.2
1233.31269.2
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1247.1
1236.41257.9
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1227.3
1212.51242.1
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1206.4
1187.11225.7
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1186.8
1168.31205.4
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1183.9
1170.41197.5
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
41.7 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
3.5 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
63.5 %independentArtificial Analysis
reasoning math
AIME
implementation=artificial-analysis
12.0 %independentArtificial Analysis
MATH-500
implementation=artificial-analysis
76.7 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Skywork-SWE-32B + Qwen2 5 Coder 32B InstructSWE-bench Verified47.0 %communitySWE-bench Leaderboard
agent + model Skywork-SWE-32B + Qwen2 5 Coder 32B InstructSWE-bench Verified38.0 %communitySWE-bench Leaderboard
agent + model mini-SWE-agent + Qwen2 5 Coder 32B InstructSWE-bench bash-only9.0 %communitySWE-bench Leaderboard
agent + model mini-SWE-agent + Qwen2 5 Coder 32B InstructSWE-bench Verified9.0 %communitySWE-bench Leaderboard
agent + model mini-SWE-agent + Qwen2 5 Coder 32B InstructSWE-bench Verified0.1 usd_per_taskcommunitySWE-bench Leaderboard
agent + model mini-SWE-agent + Qwen2 5 Coder 32B InstructSWE-bench bash-only0.1 usd_per_taskcommunitySWE-bench Leaderboard

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.