BenchAtlas

Rankings / inception-ai

Mercury 2

proprietary

released 2026-02-20

BenchAtlas Index

as of 2026-09-11
38.5
base configuration
rank #315
7 families · 4 categories · medium

Benchmark evidence

23 results
agentic coding
τ²-Bench70.8 %independentArtificial Analysis
τ²-Bench
subset=banking
9.5 %independentArtificial Analysis
coding
SciCode37.7 %independentArtificial Analysis
external indices
AA Coding Index31.1 pointsindependentArtificial Analysis
Intelligence Index v4.111.5 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1393.7
1372.71414.7
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1383.8
1365.91401.8
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1372.3
1350.41394.2
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1370.1
1353.21387.1
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1360.2
1346.31374.1
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1346.5
1335.81357.2
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1342.7
1316.71368.7
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1327.2
1306.81347.5
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1323.8
1303.81343.8
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1322.5
1308.91336.1
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1315.5
1292.61338.3
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1310.5
1287.91333.0
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1300.2
1273.41327.1
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1299.4
1283.31315.4
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
77.0 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
17.1 %independentArtificial Analysis
long context instruction
AA-LCR43.7 %independentArtificial Analysis
IFBench69.8 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Mercury 2Terminal-Bench 2.127.3 %independentArtificial Analysis
agent + model Artificial Analysis harness + Mercury 2Terminal-Bench Hard26.5 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants