BenchAtlas

Rankings / Alibaba

Qwen3 Coder 480B A35b Instruct

open weights

released 2025-07-22

BenchAtlas Index

as of 2026-09-11
35.2
base configuration
rank #342
11 families · 5 categories · high

Benchmark evidence

41 results
agentic coding
τ²-Bench43.6 %independentArtificial Analysis
coding
LiveCodeBench v6
implementation=artificial-analysis
58.5 %independentArtificial Analysis
SciCode35.9 %independentArtificial Analysis
external indices
Intelligence Index v4.111.9 pointsindependentArtificial Analysis
AA Math Index39.3 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1457.5
1448.51466.6
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1436.1
1428.91443.2
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1425.9
1417.11434.6
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1413.7
1407.21420.1
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1410.7
1394.51426.9
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1407.8
1399.01416.5
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1404.6
1390.11419.1
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1400.8
1385.41416.1
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1397.2
1387.61406.8
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1396.8
1390.31403.3
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1395.8
1386.01405.5
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1391.8
1377.71405.9
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1391.4
1381.91401.0
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1387.3
1382.31392.3
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1387.0
1363.51410.6
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1383.6
1375.71391.6
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1379.0
1363.31394.6
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1378.5
1362.01395.0
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1374.0
1359.31388.8
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1370.8
1364.81376.8
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1369.0
1353.91384.2
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1366.2
1357.71374.7
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1363.6
1356.81370.4
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1362.3
1351.61373.1
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1352.9
1343.81362.0
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1351.2
1325.81376.6
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1328.8
1303.31354.4
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1324.8
1304.01345.6
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
61.8 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
4.5 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
78.8 %independentArtificial Analysis
long context instruction
AA-LCR45.7 %independentArtificial Analysis
IFBench40.5 %independentArtificial Analysis
reasoning math
AIME
implementation=artificial-analysis
47.7 %independentArtificial Analysis
AIME
year=2025 · implementation=artificial-analysis
39.3 %independentArtificial Analysis
MATH-500
implementation=artificial-analysis
94.2 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model OpenHands + Qwen3 Coder 480B A35b InstructSWE-bench Verified69.6 %unverifiedSWE-bench Leaderboard
agent + model mini-SWE-agent + Qwen3 Coder 480B A35b InstructSWE-bench Verified55.4 %communitySWE-bench Leaderboard
agent + model mini-SWE-agent + Qwen3 Coder 480B A35b InstructSWE-bench bash-only55.4 %communitySWE-bench Leaderboard
agent + model mini-SWE-agent + Qwen3 Coder 480B A35b InstructSWE-bench Verified0.2 usd_per_taskcommunitySWE-bench Leaderboard
agent + model mini-SWE-agent + Qwen3 Coder 480B A35b InstructSWE-bench bash-only0.2 usd_per_taskcommunitySWE-bench Leaderboard
agent + model iflow-cli + Qwen3 Coder 480B A35b InstructTerminal-Bench 1.039.0 %unverifiedTerminal-Bench Leaderboard
agent + model Artificial Analysis harness + Qwen3 Coder 480B A35b InstructTerminal-Bench Hard18.9 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.