BenchAtlas

Rankings / Alibaba

Qwen3 5 35B A3b

open weights

released 2026-02-24

BenchAtlas Index

as of 2026-09-11
45.5
thinking
rank #273
7 families · 4 categories · medium
39.6
no reasoning
rank #310
8 families · 5 categories · high

Benchmark evidence

48 results
agentic coding
τ²-Benchthinking89.2 %independentArtificial Analysis
τ²-Benchno reasoning86.3 %independentArtificial Analysis
τ²-Bench
subset=banking
no reasoning5.0 %independentArtificial Analysis
coding
SciCodethinking37.7 %independentArtificial Analysis
SciCodeno reasoning29.3 %independentArtificial Analysis
external indices
AA Coding Indexno reasoning37.0 pointsindependentArtificial Analysis
Intelligence Index v4.1thinking19.3 pointsindependentArtificial Analysis
Intelligence Index v4.1no reasoning15.1 pointsindependentArtificial Analysis
ECIno reasoning142.5 pointsindependentEpoch AI Benchmarking Hub
ECI142.5 pointsindependentEpoch AI Benchmarking Hub
human preference
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1452.5
1438.31466.7
communityLMArena Leaderboard Dataset
Coding (style control)older version
arena=text · category=coding · style_control=true
1434.8
1427.61442.1
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1431.3
1425.11437.5
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1429.0
1415.81442.1
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1424.8
1417.71431.8
communityLMArena Leaderboard Dataset
French (style control)older version
arena=text · category=french · style_control=true
1421.4
1399.81443.0
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1419.7
1407.91431.5
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1414.2
1405.51422.9
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1413.2
1407.91418.4
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1410.6
1404.71416.4
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1407.6
1392.61422.6
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1402.5
1394.41410.5
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1401.2
1394.71407.6
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1399.9
1385.91414.0
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1398.8
1386.01411.7
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1395.2
1390.81399.5
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1393.7
1385.01402.3
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1388.2
1381.51394.8
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1383.0
1363.31402.6
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1377.1
1366.61387.6
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1375.8
1351.91399.8
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1375.8
1370.41381.2
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1375.1
1369.21381.1
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1365.1
1357.41372.7
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1345.2
1336.91353.5
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1343.7
1334.41353.0
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
thinking84.5 %independentArtificial Analysis
GPQA Diamond83.5 %independentEpoch AI Benchmarking Hub
2026-08-28
GPQA Diamond
implementation=artificial-analysis
no reasoning81.9 %independentArtificial Analysis
GPQA Diamondno reasoning81.2 %independentEpoch AI Benchmarking Hub
2026-08-28
Humanity's Last Exam
implementation=artificial-analysis
thinking21.0 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
no reasoning13.4 %independentArtificial Analysis
long context instruction
AA-LCRthinking72.0 %independentArtificial Analysis
AA-LCRno reasoning63.0 %independentArtificial Analysis
IFBenchthinking72.5 %independentArtificial Analysis
IFBenchno reasoning44.5 %independentArtificial Analysis
reasoning math
OTIS Mock AIME 2024–2025no reasoning70.0 %independentEpoch AI Benchmarking Hub
2026-08-30
OTIS Mock AIME 2024–202554.4 %independentEpoch AI Benchmarking Hub
2026-08-30

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Qwen3 5 35B A3bTerminal-Bench 2.140.8 %independentArtificial Analysis
agent + model Artificial Analysis harness + Qwen3 5 35B A3bTerminal-Bench Hard26.5 %independentArtificial Analysis
agent + model Artificial Analysis harness + Qwen3 5 35B A3bTerminal-Bench Hard10.6 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.