BenchAtlas

Rankings / Alibaba

Qwen3 6 Max Preview

released 2026-04-20

BenchAtlas Index

as of 2026-09-11
63.6
base configuration
rank #123
4 families · 3 categories · medium

Benchmark evidence

30 results
external indices
ECIno reasoning149.3 pointsindependentEpoch AI Benchmarking Hub
ECI149.3 pointsindependentEpoch AI Benchmarking Hub
factuality
SimpleQA Verified56.9 %independentEpoch AI Benchmarking Hub
2026-05-15
SimpleQA Verified52.0 %independentEpoch AI Benchmarking Hub
2026-08-27
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1509.1
1493.61524.6
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1498.6
1472.81524.3
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1496.9
1483.91509.8
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1484.8
1465.01504.7
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1483.8
1468.91498.7
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1481.6
1471.21492.0
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1473.9
1460.51487.3
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1468.4
1448.11488.8
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1467.2
1455.11479.4
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1462.6
1451.31473.8
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1460.1
1451.81468.5
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1456.6
1430.41482.9
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1449.8
1431.61468.0
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1449.8
1431.01468.6
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1449.6
1435.51463.7
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1447.0
1435.71458.2
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1438.2
1415.21461.2
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1432.3
1412.61452.1
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond89.1 %independentEpoch AI Benchmarking Hub
2026-05-15
GPQA Diamond87.4 %independentEpoch AI Benchmarking Hub
2026-08-07
professional
CaseLaw47.9 %independentVals AI
CorpFin66.5 %independentVals AI
reasoning math
FrontierMath23.1 %independentEpoch AI Benchmarking Hub
2026-05-27
FrontierMath Tier 4older version4.2 %independentEpoch AI Benchmarking Hub
2026-05-28
OTIS Mock AIME 2024–202591.1 %independentEpoch AI Benchmarking Hub
2026-08-07
OTIS Mock AIME 2024–202591.1 %independentEpoch AI Benchmarking Hub
2026-05-15

Agent + model results

systems, not bare-model scores
agent + model Epoch Inspect harness + Qwen3 6 Max PreviewSWE-bench Verified76.7 %independentEpoch AI Benchmarking Hub

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.