BenchAtlas

Rankings / DeepSeek

Deepseek V3 0324

released 2025-03-24

BenchAtlas Index

as of 2026-09-11
32.2
base configuration
rank #363
5 families · 3 categories · medium
30.2
base configuration
rank #377
12 families · 5 categories · high

Benchmark evidence

56 results
agentic coding
τ²-Bench47.1 %independentArtificial Analysis
τ²-Bench
subset=banking
4.7 %independentArtificial Analysis
coding
LiveCodeBench v6
implementation=artificial-analysis
40.5 %independentArtificial Analysis
SciCode39.0 %independentArtificial Analysis
external indices
AA Coding Index21.2 pointsindependentArtificial Analysis
Intelligence Index v4.19.7 pointsindependentArtificial Analysis
AA Math Index41.0 pointsindependentArtificial Analysis
ECI136.0 pointsindependentEpoch AI Benchmarking Hub
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1428.6
1421.81435.4
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1426.6
1414.81438.3
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1423.5
1417.91429.2
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1420.4
1413.71427.1
communityLMArena Leaderboard Dataset
French (style control)older version
arena=text · category=french · style_control=true
1416.2
1391.41441.0
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1415.7
1404.71426.7
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1414.8
1407.61422.0
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1411.2
1404.01418.4
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1411.1
1399.91422.3
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1409.0
1404.01414.0
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1408.1
1402.91413.4
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1399.7
1390.11409.2
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1398.9
1386.31411.4
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1396.1
1384.01408.2
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1395.7
1391.81399.6
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1393.7
1387.01400.5
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1391.3
1373.61409.0
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1389.7
1382.11397.2
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1389.5
1381.41397.6
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1386.2
1379.71392.6
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1382.2
1375.21389.2
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1379.1
1374.31383.9
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1378.2
1372.31384.1
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1378.0
1358.41397.6
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1376.7
1371.21382.1
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1368.5
1358.11378.8
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1366.2
1355.41377.1
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1344.1
1325.01363.2
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1339.5
1319.71359.3
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond67.6 %independentEpoch AI Benchmarking Hub
2025-04-01
GPQA Diamond
implementation=artificial-analysis
65.5 %independentArtificial Analysis
GPQA Diamond
implementation=vals-ai
61.6 %independentVals AI
Humanity's Last Exam
implementation=artificial-analysis
4.7 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
81.9 %independentArtificial Analysis
MMLU-Pro
implementation=vals-ai
79.5 %independentVals AI
long context instruction
AA-LCR40.7 %independentArtificial Analysis
IFBench41.0 %independentArtificial Analysis
professional
CorpFin54.7 %independentVals AI
LegalBench77.7 %independentVals AI
MedQA82.0 %independentVals AI
TaxEval71.1 %independentVals AI
reasoning math
AIME
implementation=vals-ai
52.2 %independentVals AI
AIME
implementation=artificial-analysis
52.0 %independentArtificial Analysis
AIME
year=2025 · implementation=artificial-analysis
41.0 %independentArtificial Analysis
MATH-500
implementation=artificial-analysis
94.2 %independentArtificial Analysis
MATH-500
implementation=vals-ai
88.6 %independentVals AI
MATH Level 575.5 %independentEpoch AI Benchmarking Hub
2025-04-01
OTIS Mock AIME 2024–202537.8 %independentEpoch AI Benchmarking Hub
2025-04-01

Agent + model results

systems, not bare-model scores
agent + model SWE-Exp + Deepseek V3 0324SWE-bench Verified42.0 %unverifiedSWE-bench Leaderboard
agent + model Artificial Analysis harness + Deepseek V3 0324Terminal-Bench Hard15.2 %independentArtificial Analysis
agent + model Artificial Analysis harness + Deepseek V3 0324Terminal-Bench 2.113.9 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants