BenchAtlas

Rankings / OpenAI

GPT 4o Mini (2024-07-18)

released 2024-07-18

BenchAtlas Index

as of 2026-09-11
24.3
base configuration
rank #410
5 families · 3 categories · medium
23.0
high effort
rank #420
6 families · 3 categories · medium

Benchmark evidence

47 results
coding
LiveCodeBench v5older version
problems=279 · window_start=2024-08-01
27.7 %independentLiveCodeBench Leaderboard
LiveCodeBench v6
problems=454 · window_start=2024-08-01
27.5 %independentLiveCodeBench Leaderboard
external indices
ECI126.6 pointsindependentEpoch AI Benchmarking Hub
factuality
SimpleQA Verified8.3 %independentEpoch AI Benchmarking Hub
2026-08-31
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1348.3
1341.81354.9
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1347.0
1336.11357.8
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1338.3
1332.71343.8
communityLMArena Leaderboard Dataset
French (style control)older version
arena=text · category=french · style_control=true
1337.7
1313.21362.2
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1334.0
1322.61345.4
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1328.3
1323.91332.6
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1326.5
1319.91333.2
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1325.9
1318.81333.0
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1319.4
1313.01325.8
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1317.5
1313.91321.0
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1316.6
1307.41325.8
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1313.2
1307.61318.9
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1311.5
1304.71318.2
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1310.7
1305.41316.1
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1310.7
1302.91318.4
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1308.9
1285.01332.8
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1308.8
1301.31316.3
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1301.0
1285.71316.4
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1300.4
1295.81304.9
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1293.7
1286.71300.7
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1293.1
1288.31298.0
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1285.8
1278.41293.1
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1284.9
1274.01295.8
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1283.8
1277.31290.4
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1275.4
1268.41282.4
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1260.7
1255.31266.0
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1250.5
1235.11265.8
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1237.9
1217.41258.5
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=vals-ai
high effort44.2 %independentVals AI
GPQA Diamond37.7 %independentEpoch AI Benchmarking Hub
2025-01-27
MMLU-Pro
implementation=vals-ai
high effort62.7 %independentVals AI
multimodal
MMMU
implementation=vals-ai
high effort56.6 %independentVals AI
professional
CorpFinhigh effort45.5 %independentVals AI
MedQAhigh effort72.4 %independentVals AI
TaxEvalhigh effort60.5 %independentVals AI
reasoning math
AIME
implementation=vals-ai
high effort11.5 %independentVals AI
ARC-AGI-2
split=public_eval · model_type=Base LLM
0.0 usd_per_taskindependentARC Prize Leaderboard
ARC-AGI-2
split=semi_private · model_type=Base LLM
0.0 usd_per_taskindependentARC Prize Leaderboard
ARC-AGI-2
split=public_eval · model_type=Base LLM
0.0 %independentARC Prize Leaderboard
ARC-AGI-2
split=semi_private · model_type=Base LLM
0.0 %independentARC Prize Leaderboard
MATH-500
implementation=vals-ai
high effort72.6 %independentVals AI
MATH Level 552.6 %independentEpoch AI Benchmarking Hub
2025-01-27
OTIS Mock AIME 2024–20256.9 %independentEpoch AI Benchmarking Hub
2025-07-30