BenchAtlas

Rankings / MiniMax

Minimax M2 5

released 2026-02-12

BenchAtlas Index

as of 2026-09-11
63.5
base configuration
rank #127
9 families · 5 categories · high
59.7
base configuration
rank #163
9 families · 3 categories · medium

Benchmark evidence

52 results
agentic coding
τ²-Bench95.3 %independentArtificial Analysis
coding
SciCode42.6 %independentArtificial Analysis
external indices
Intelligence Index v4.122.8 pointsindependentArtificial Analysis
ECI146.5 pointsindependentEpoch AI Benchmarking Hub
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1444.3
1437.71450.9
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1435.7
1430.01441.4
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1431.9
1419.51444.4
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1429.5
1423.11436.0
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1420.5
1410.01431.0
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1415.5
1410.61420.4
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1412.3
1407.01417.7
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1408.9
1401.01416.8
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1408.4
1396.71420.0
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1404.1
1398.11410.0
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1404.1
1392.61415.5
communityLMArena Leaderboard Dataset
French (style control)older version
arena=text · category=french · style_control=true
1402.1
1383.31420.9
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1400.6
1387.81413.5
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1399.8
1392.51407.2
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1395.6
1383.51407.7
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1395.3
1387.71402.9
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1392.0
1383.01400.9
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1391.2
1366.71415.8
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1390.5
1386.61394.5
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1380.7
1374.71386.7
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1375.3
1358.31392.2
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1371.5
1364.71378.2
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1371.4
1366.01376.8
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1370.5
1350.51390.5
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1367.3
1362.31372.2
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1362.7
1355.41370.0
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1358.6
1350.51366.7
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1270.7
1245.71295.8
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
84.8 %independentArtificial Analysis
GPQA Diamond
implementation=vals-ai
82.1 %independentVals AI
Humanity's Last Exam
implementation=artificial-analysis
20.5 %independentArtificial Analysis
MMLU-Pro
implementation=vals-ai
80.1 %independentVals AI
long context instruction
AA-LCR73.3 %independentArtificial Analysis
IFBench71.6 %independentArtificial Analysis
professional
CaseLaw53.5 %independentVals AI
CorpFin59.6 %independentVals AI
LegalBench80.0 %independentVals AI
MedQA92.5 %independentVals AI
TaxEval68.2 %independentVals AI
reasoning math
AIME
implementation=vals-ai
88.8 %independentVals AI
ARC-AGI-1older version
split=semi_private · model_type=CoT
63.7 %independentARC Prize Leaderboard
ARC-AGI-1older version
split=public_eval · model_type=CoT
59.1 %independentARC Prize Leaderboard
ARC-AGI-2
split=public_eval · model_type=CoT
5.4 %independentARC Prize Leaderboard
ARC-AGI-2
split=semi_private · model_type=CoT
4.9 %independentARC Prize Leaderboard
ARC-AGI-2
split=public_eval · model_type=CoT
0.2 usd_per_taskindependentARC Prize Leaderboard
ARC-AGI-2
split=semi_private · model_type=CoT
0.2 usd_per_taskindependentARC Prize Leaderboard
ARC-AGI-1older version
split=public_eval · model_type=CoT
0.1 usd_per_taskindependentARC Prize Leaderboard
ARC-AGI-1older version
split=semi_private · model_type=CoT
0.1 usd_per_taskindependentARC Prize Leaderboard

Agent + model results

systems, not bare-model scores
agent + model mini-SWE-agent + Minimax M2 5SWE-bench bash-only75.8 %unverifiedSWE-bench Leaderboard
agent + model mini-SWE-agent + Minimax M2 5SWE-bench Verified75.8 %unverifiedSWE-bench Leaderboard
agent + model mini-SWE-agent + Minimax M2 5SWE-bench Verified0.1 usd_per_taskunverifiedSWE-bench Leaderboard
agent + model mini-SWE-agent + Minimax M2 5SWE-bench bash-only0.1 usd_per_taskunverifiedSWE-bench Leaderboard
agent + model cchuter + Minimax M2 5Terminal-Bench 2.042.7 %unverifiedTerminal-Bench Leaderboard
agent + model terminus-2 + Minimax M2 5Terminal-Bench 2.042.3 %unverifiedTerminal-Bench Leaderboard
agent + model Artificial Analysis harness + Minimax M2 5Terminal-Bench Hard34.9 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants