BenchAtlas

Rankings / MiniMax

Minimax M2

released 2025-10-26

BenchAtlas Index

as of 2026-09-11
47.6
base configuration
rank #257
10 families · 5 categories · high

Benchmark evidence

27 results
agentic coding
τ²-Bench86.8 %independentArtificial Analysis
coding
LiveCodeBench v6
implementation=artificial-analysis
82.6 %independentArtificial Analysis
SciCode36.1 %independentArtificial Analysis
external indices
Intelligence Index v4.118.6 pointsindependentArtificial Analysis
AA Math Index78.3 pointsindependentArtificial Analysis
human preference
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1390.9
1376.41405.5
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1383.9
1371.81396.1
communityLMArena Leaderboard Dataset
Coding (style control)older version
arena=text · category=coding · style_control=true
1382.9
1367.71398.2
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1371.9
1361.01382.9
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1369.1
1359.11379.0
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1361.5
1343.71379.3
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1357.9
1339.81376.1
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1349.5
1332.91366.2
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1345.7
1337.91353.4
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1342.4
1327.71357.2
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1337.1
1324.01350.2
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1316.4
1306.51326.4
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1303.0
1292.21313.8
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1299.8
1284.01315.6
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1299.7
1282.51317.0
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1286.8
1266.31307.3
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
77.7 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
13.7 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
82.0 %independentArtificial Analysis
long context instruction
AA-LCR64.3 %independentArtificial Analysis
IFBench72.3 %independentArtificial Analysis
reasoning math
AIME
year=2025 · implementation=artificial-analysis
78.3 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model mini-SWE-agent + Minimax M2SWE-bench bash-only61.0 %communitySWE-bench Leaderboard
agent + model mini-SWE-agent + Minimax M2SWE-bench Verified61.0 %communitySWE-bench Leaderboard
agent + model mini-SWE-agent + Minimax M2SWE-bench Verified0.4 usd_per_taskcommunitySWE-bench Leaderboard
agent + model mini-SWE-agent + Minimax M2SWE-bench bash-only0.4 usd_per_taskcommunitySWE-bench Leaderboard
agent + model iflow-cli + Minimax M2Terminal-Bench 1.042.0 %unverifiedTerminal-Bench Leaderboard
agent + model Artificial Analysis harness + Minimax M2Terminal-Bench Hard25.8 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants