BenchAtlas

Rankings / OpenAI

GPT 4o (2024-05-13)

released 2024-05-13

BenchAtlas Index

as of 2026-09-11
35.8
base configuration
rank #335
4 families · 3 categories · medium

Benchmark evidence

34 results
coding
LiveCodeBench v5older version
problems=279 · window_start=2024-08-01
32.9 %independentLiveCodeBench Leaderboard
external indices
ECI129.0 pointsindependentEpoch AI Benchmarking Hub
human preference
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1371.7
1361.51381.8
communityLMArena Leaderboard Dataset
Coding (style control)older version
arena=text · category=coding · style_control=true
1369.2
1362.71375.6
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1359.9
1354.31365.5
communityLMArena Leaderboard Dataset
French (style control)older version
arena=text · category=french · style_control=true
1359.8
1338.71380.8
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1356.2
1351.61360.8
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1354.0
1347.21360.8
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1352.6
1341.91363.3
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1347.5
1341.01353.9
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1345.8
1342.31349.2
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1344.6
1338.71350.5
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1341.2
1320.91361.5
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1340.7
1334.01347.3
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1338.8
1330.11347.5
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1337.4
1330.51344.3
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1337.1
1331.71342.5
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1337.1
1329.91344.3
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1332.1
1324.61339.6
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1331.7
1324.71338.7
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1329.3
1315.91342.8
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1329.0
1324.21333.8
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1325.3
1320.31330.4
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1321.4
1313.81329.0
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1311.1
1300.91321.4
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1309.7
1302.51316.9
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1305.0
1289.71320.3
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1304.6
1297.71311.5
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1304.3
1298.71309.8
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1294.1
1276.71311.4
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=vals-ai
high effort50.3 %independentVals AI
GPQA Diamond48.9 %independentEpoch AI Benchmarking Hub
2025-01-27
reasoning math
MATH Level 551.0 %independentEpoch AI Benchmarking Hub
2025-01-27
OTIS Mock AIME 2024–20256.3 %independentEpoch AI Benchmarking Hub
2025-02-25

Agent + model results

systems, not bare-model scores
agent + model Agentless-1.5 + GPT 4o (2024-05-13)SWE-bench Verified38.8 %unverifiedSWE-bench Leaderboard
agent + model AutoCodeRover (v20240620) + GPT 4o (2024-05-13)SWE-bench Verified38.4 %unverifiedSWE-bench Leaderboard
agent + model AbanteAI MentatBot + GPT 4o (2024-05-13)SWE-bench Lite38.0 %unverifiedSWE-bench Leaderboard
agent + model Bytedance MarsCode Agent + GPT 4o (2024-05-13)SWE-bench Lite34.0 %unverifiedSWE-bench Leaderboard
agent + model Agentless-1.5 + GPT 4o (2024-05-13)SWE-bench Lite32.0 %unverifiedSWE-bench Leaderboard
agent + model CodeShellTester + GPT 4o (2024-05-13)SWE-bench Lite31.3 %unverifiedSWE-bench Leaderboard
agent + model AutoCodeRover (v20240620) + GPT 4o (2024-05-13)SWE-bench Lite30.7 %unverifiedSWE-bench Leaderboard
agent + model SIMA + GPT 4o (2024-05-13)SWE-bench Lite27.7 %unverifiedSWE-bench Leaderboard
agent + model MASAI + GPT 4o (2024-05-13)SWE-bench Lite27.3 %unverifiedSWE-bench Leaderboard
agent + model Agentless + GPT 4o (2024-05-13)SWE-bench Lite27.3 %unverifiedSWE-bench Leaderboard
agent + model AppMap Navie + GPT 4o (2024-05-13)SWE-bench Verified26.2 %communitySWE-bench Leaderboard
agent + model Moatless Tools + GPT 4o (2024-05-13)SWE-bench Lite24.7 %communitySWE-bench Leaderboard
agent + model SWE-agent + GPT 4o (2024-05-13)SWE-bench Verified23.2 %communitySWE-bench Leaderboard
agent + model AppMap Navie + GPT 4o (2024-05-13)SWE-bench Lite21.7 %communitySWE-bench Leaderboard
agent + model AutoCodeRover (v20240620) + GPT 4o (2024-05-13)SWE-bench (full test split)18.8 %unverifiedSWE-bench Leaderboard
agent + model SWE-agent + GPT 4o (2024-05-13)SWE-bench Lite18.3 %communitySWE-bench Leaderboard
agent + model AppMap Navie + GPT 4o (2024-05-13)SWE-bench (full test split)14.6 %communitySWE-bench Leaderboard
agent + model SWE-agent + GPT 4o (2024-05-13)SWE-bench (full test split)12.0 %communitySWE-bench Leaderboard

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants