BenchAtlas

Rankings / Unknown

Intellect 3

open weights

released 2025-11-27

BenchAtlas Index

as of 2026-09-11
37.9
base configuration
rank #320
9 families · 5 categories · high

Benchmark evidence

28 results
agentic coding
τ²-Bench26.6 %independentArtificial Analysis
coding
LiveCodeBench v6
implementation=artificial-analysis
77.7 %independentArtificial Analysis
SciCode39.1 %independentArtificial Analysis
external indices
Intelligence Index v4.110.6 pointsindependentArtificial Analysis
AA Math Index88.0 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1411.7
1393.01430.4
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1400.5
1386.31414.7
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1398.2
1381.71414.7
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1383.5
1371.51395.6
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1373.7
1362.31385.1
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1368.2
1348.31388.1
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1364.5
1346.01383.0
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1356.2
1335.71376.7
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1356.2
1347.81364.5
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1352.8
1336.01369.6
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1335.2
1318.51351.9
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1333.6
1309.01358.3
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1329.9
1314.11345.7
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1326.9
1316.01337.9
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1317.1
1305.11329.1
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1311.4
1289.91333.0
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1304.8
1286.21323.5
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
76.1 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
13.1 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
82.2 %independentArtificial Analysis
long context instruction
AA-LCR39.7 %independentArtificial Analysis
IFBench34.0 %independentArtificial Analysis
reasoning math
AIME
year=2025 · implementation=artificial-analysis
88.0 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Intellect 3Terminal-Bench Hard9.1 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.