BenchAtlas

Rankings / OpenAI

GPT 4o (2024-08-06)

released 2024-08-06

BenchAtlas Index

as of 2026-09-11
30.4
high effort
rank #375
6 families · 3 categories · medium
27.4
base configuration
rank #396
5 families · 3 categories · medium

Benchmark evidence

43 results
coding
LiveCodeBench v5older version
problems=279 · window_start=2024-08-01
30.0 %independentLiveCodeBench Leaderboard
LiveCodeBench v6
problems=454 · window_start=2024-08-01
29.5 %independentLiveCodeBench Leaderboard
external indices
ECI129.4 pointsindependentEpoch AI Benchmarking Hub
factuality
SimpleQA Verified26.0 %independentEpoch AI Benchmarking Hub
2026-08-31
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1360.2
1352.21368.1
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1348.0
1342.61353.4
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1347.9
1339.81356.0
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1347.8
1335.31360.3
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1346.8
1340.11353.5
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1342.3
1328.41356.2
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1340.4
1333.51347.3
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1338.4
1330.01346.9
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1337.6
1329.91345.4
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1335.2
1330.91339.4
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1330.5
1319.71341.2
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1327.8
1300.71355.0
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1326.9
1319.01334.8
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1326.5
1320.11333.0
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1326.5
1317.91335.0
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1324.4
1316.11332.7
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1324.0
1315.21332.8
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1318.3
1312.51324.2
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1316.2
1310.61321.7
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1312.9
1295.41330.4
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1312.8
1304.31321.3
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1311.2
1298.41324.0
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1308.5
1300.51316.6
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1301.9
1292.81311.0
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1291.9
1272.91310.9
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1288.8
1264.11313.5
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1285.7
1279.21292.2
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond49.2 %independentEpoch AI Benchmarking Hub
2025-01-27
MMLU-Pro
implementation=vals-ai
high effort74.1 %independentVals AI
multimodal
MMMU
implementation=vals-ai
high effort64.0 %independentVals AI
professional
CorpFinhigh effort39.4 %independentVals AI
LegalBenchhigh effort80.1 %independentVals AI
MedQAhigh effort88.2 %independentVals AI
TaxEvalhigh effort71.1 %independentVals AI
reasoning math
AIME
implementation=vals-ai
high effort14.0 %independentVals AI
FrontierMath0.3 %independentEpoch AI Benchmarking Hub
2025-03-07
MATH-500
implementation=vals-ai
high effort75.2 %independentVals AI
MATH Level 553.3 %independentEpoch AI Benchmarking Hub
2025-01-27
OTIS Mock AIME 2024–20256.4 %independentEpoch AI Benchmarking Hub
2025-02-25

Agent + model results

systems, not bare-model scores
agent + model OpenCSG Starship Agentic Coder + GPT 4o (2024-08-06)SWE-bench Lite39.7 %unverifiedSWE-bench Leaderboard
agent + model MASAI + GPT 4o (2024-08-06)SWE-bench Verified32.6 %unverifiedSWE-bench Leaderboard
agent + model GUIRepair + GPT 4o (2024-08-06)SWE-bench Multimodal30.4 %communitySWE-bench Leaderboard
agent + model Agentless + GPT 4o (2024-08-06)SWE-bench Lite29.7 %unverifiedSWE-bench Leaderboard
agent + model reproducedRG + GPT 4o (2024-08-06)SWE-bench Lite28.0 %unverifiedSWE-bench Leaderboard
agent + model EPAM AI/Run Developer Agent + GPT 4o (2024-08-06)SWE-bench Verified27.0 %unverifiedSWE-bench Leaderboard
agent + model HyperAgent + GPT 4o (2024-08-06)SWE-bench Lite25.3 %unverifiedSWE-bench Leaderboard
agent + model Bytedance AutoSE (based on SWE-Agent) + GPT 4o (2024-08-06)SWE-bench Lite21.7 %unverifiedSWE-bench Leaderboard
agent + model RAG + GPT 4o (2024-08-06)SWE-bench Multimodal6.0 %communitySWE-bench Leaderboard
agent + model Agentless + GPT 4o (2024-08-06)SWE-bench Multimodal3.1 %communitySWE-bench Leaderboard

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants