BenchAtlas

Rankings / Alibaba

Qwen3 5 397B A17b

open weights

released 2026-02-16

BenchAtlas Index

as of 2026-09-11
57.0
thinking
rank #183
7 families · 4 categories · medium
52.1
no reasoning
rank #223
8 families · 5 categories · high

Benchmark evidence

51 results
agentic coding
τ²-Benchthinking95.6 %independentArtificial Analysis
τ²-Benchno reasoning83.9 %independentArtificial Analysis
τ²-Bench
subset=banking
thinking13.4 %independentArtificial Analysis
coding
SciCodethinking44.8 %independentArtificial Analysis
SciCodeno reasoning41.1 %independentArtificial Analysis
external indices
AA Coding Indexthinking48.2 pointsindependentArtificial Analysis
Intelligence Index v4.1no reasoning21.4 pointsindependentArtificial Analysis
Intelligence Index v4.1thinking19.1 pointsindependentArtificial Analysis
ECI147.0 pointsindependentEpoch AI Benchmarking Hub
ECIno reasoning147.0 pointsindependentEpoch AI Benchmarking Hub
human preference
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1495.7
1486.11505.4
communityLMArena Leaderboard Dataset
Coding (style control)older version
arena=text · category=coding · style_control=true
1490.8
1485.61496.1
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1480.1
1475.51484.8
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1479.4
1471.91487.0
communityLMArena Leaderboard Dataset
French (style control)older version
arena=text · category=french · style_control=true
1471.9
1457.91485.8
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1466.5
1461.41471.7
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1464.7
1458.51470.9
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1463.2
1459.21467.3
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1462.9
1454.11471.7
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1457.8
1447.91467.7
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1453.5
1448.71458.2
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1452.7
1446.41458.9
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1448.4
1438.81458.1
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1447.1
1442.71451.5
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1443.2
1437.41449.0
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1443.1
1427.11459.2
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1442.6
1429.41455.8
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1442.0
1423.61460.3
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1441.1
1432.61449.7
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1441.1
1437.71444.5
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1439.8
1435.31444.4
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1435.8
1428.51443.1
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1434.4
1429.51439.2
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1432.6
1428.51436.7
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1427.4
1405.01449.8
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1419.9
1414.41425.3
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1405.0
1398.71411.3
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1402.5
1396.71408.3
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1382.1
1364.01400.2
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
thinking89.3 %independentArtificial Analysis
GPQA Diamondno reasoning86.4 %independentEpoch AI Benchmarking Hub
2026-08-07
GPQA Diamond
implementation=artificial-analysis
no reasoning86.1 %independentArtificial Analysis
GPQA Diamond85.9 %independentEpoch AI Benchmarking Hub
2026-08-07
Humanity's Last Exam
implementation=artificial-analysis
thinking29.0 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
no reasoning19.8 %independentArtificial Analysis
long context instruction
AA-LCRthinking77.3 %independentArtificial Analysis
AA-LCRno reasoning64.3 %independentArtificial Analysis
IFBenchthinking78.8 %independentArtificial Analysis
IFBenchno reasoning51.6 %independentArtificial Analysis
reasoning math
OTIS Mock AIME 2024–202588.9 %independentEpoch AI Benchmarking Hub
2026-08-07
OTIS Mock AIME 2024–2025no reasoning82.2 %independentEpoch AI Benchmarking Hub
2026-08-07

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Qwen3 5 397B A17bTerminal-Bench 2.151.3 %independentArtificial Analysis
agent + model Artificial Analysis harness + Qwen3 5 397B A17bTerminal-Bench Hard40.9 %independentArtificial Analysis
agent + model Artificial Analysis harness + Qwen3 5 397B A17bTerminal-Bench Hard35.6 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.