BenchAtlas

Rankings / Alibaba

Qwen3 30B A3b

open weights

released 2025-04-28

BenchAtlas Index

as of 2026-09-11
28.4
thinking
rank #391
10 families · 5 categories · high
21.9
no reasoning
rank #425
11 families · 5 categories · high

Benchmark evidence

58 results
agentic coding
τ²-Benchthinking26.0 %independentArtificial Analysis
τ²-Benchno reasoning22.2 %independentArtificial Analysis
coding
LiveCodeBench v6
implementation=artificial-analysis
thinking50.6 %independentArtificial Analysis
LiveCodeBench v6
implementation=artificial-analysis
no reasoning32.2 %independentArtificial Analysis
SciCodethinking28.5 %independentArtificial Analysis
SciCodeno reasoning26.4 %independentArtificial Analysis
external indices
Intelligence Index v4.1thinking7.6 pointsindependentArtificial Analysis
Intelligence Index v4.1no reasoning1.3 pointsindependentArtificial Analysis
AA Math Indexthinking72.3 pointsindependentArtificial Analysis
AA Math Indexno reasoning21.7 pointsindependentArtificial Analysis
ECI136.2 pointsindependentEpoch AI Benchmarking Hub
ECIno reasoning136.2 pointsindependentEpoch AI Benchmarking Hub
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1385.8
1377.01394.7
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1371.1
1364.21378.1
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1365.2
1350.61379.7
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1359.7
1351.31368.2
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1359.3
1344.21374.4
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1351.6
1337.91365.3
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1344.6
1338.51350.8
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1344.3
1338.01350.7
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1343.2
1326.71359.7
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1338.5
1329.61347.4
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1336.3
1321.31351.3
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1332.6
1323.51341.8
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1330.0
1320.51339.5
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1326.8
1322.11331.6
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1323.9
1309.91337.9
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1320.0
1310.91329.2
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1310.1
1302.31318.0
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1307.7
1295.61319.7
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1304.6
1298.81310.4
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1304.1
1296.11312.1
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1303.4
1281.91324.9
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1303.0
1289.21316.9
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1283.3
1272.81293.8
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1275.0
1268.31281.8
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1269.7
1260.81278.6
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1256.3
1233.81278.7
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond61.7 %independentEpoch AI Benchmarking Hub
2026-08-30
GPQA Diamond
implementation=artificial-analysis
thinking61.6 %independentArtificial Analysis
GPQA Diamond
implementation=artificial-analysis
no reasoning51.5 %independentArtificial Analysis
GPQA Diamondno reasoning50.4 %independentEpoch AI Benchmarking Hub
2026-08-30
Humanity's Last Exam
implementation=artificial-analysis
thinking6.2 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
no reasoning4.6 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
thinking77.7 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
no reasoning71.0 %independentArtificial Analysis
long context instruction
AA-LCRno reasoning0.0 %independentArtificial Analysis
AA-LCRthinking0.0 %independentArtificial Analysis
IFBenchthinking41.5 %independentArtificial Analysis
IFBenchno reasoning31.9 %independentArtificial Analysis
reasoning math
AIME
implementation=artificial-analysis
thinking75.3 %independentArtificial Analysis
AIME
year=2025 · implementation=artificial-analysis
thinking72.3 %independentArtificial Analysis
AIME
implementation=artificial-analysis
no reasoning26.0 %independentArtificial Analysis
AIME
year=2025 · implementation=artificial-analysis
no reasoning21.7 %independentArtificial Analysis
MATH-500
implementation=artificial-analysis
thinking95.9 %independentArtificial Analysis
MATH-500
implementation=artificial-analysis
no reasoning86.3 %independentArtificial Analysis
OTIS Mock AIME 2024–202562.8 %independentEpoch AI Benchmarking Hub
2026-08-28
OTIS Mock AIME 2024–2025no reasoning25.6 %independentEpoch AI Benchmarking Hub
2026-08-30

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Qwen3 30B A3bTerminal-Bench Hard6.8 %independentArtificial Analysis
agent + model Artificial Analysis harness + Qwen3 30B A3bTerminal-Bench Hard2.3 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.