BenchAtlas

Rankings / Z.ai

GLM 4.5

open weights

released 2025-07-28

BenchAtlas Index

as of 2026-09-11
43.3
base configuration
rank #285
8 families · 3 categories · medium
43.0
thinking
rank #287
11 families · 5 categories · high

Benchmark evidence

49 results
agentic coding
τ²-Benchthinking43.0 %independentArtificial Analysis
coding
LiveCodeBench v6
implementation=artificial-analysis
thinking73.8 %independentArtificial Analysis
SciCodethinking34.8 %independentArtificial Analysis
external indices
Intelligence Index v4.1thinking12.8 pointsindependentArtificial Analysis
AA Math Indexthinking73.7 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1454.6
1445.81463.4
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1444.5
1437.41451.7
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1440.4
1423.01457.9
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1436.0
1427.21444.7
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1435.6
1419.31452.0
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1433.3
1419.01447.7
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1432.5
1426.21438.9
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1430.0
1406.41453.7
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1422.8
1413.01432.5
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1421.4
1414.81428.0
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1417.1
1400.21434.1
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1417.1
1408.51425.7
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1415.2
1399.31431.0
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1413.1
1397.51428.6
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1411.4
1402.11420.7
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1411.3
1406.41416.3
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1404.9
1395.01414.8
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1404.5
1396.61412.4
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1397.3
1390.51404.2
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1395.5
1389.51401.4
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1394.4
1380.11408.7
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1391.9
1369.01414.9
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1384.8
1369.81399.9
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1382.8
1374.31391.3
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1382.6
1373.41391.8
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1376.6
1351.01402.2
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1372.9
1362.01383.9
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1353.8
1329.41378.2
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
thinking78.2 %independentArtificial Analysis
GPQA Diamond
implementation=vals-ai
72.2 %independentVals AI
Humanity's Last Exam
implementation=artificial-analysis
thinking13.0 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
thinking83.5 %independentArtificial Analysis
MMLU-Pro
implementation=vals-ai
81.2 %independentVals AI
long context instruction
AA-LCRthinking52.7 %independentArtificial Analysis
IFBenchthinking44.1 %independentArtificial Analysis
professional
CorpFin61.0 %independentVals AI
LegalBench75.6 %independentVals AI
MedQA90.0 %independentVals AI
TaxEval72.4 %independentVals AI
reasoning math
AIME
implementation=artificial-analysis
thinking87.3 %independentArtificial Analysis
AIME
implementation=vals-ai
86.7 %independentVals AI
AIME
year=2025 · implementation=artificial-analysis
thinking73.7 %independentArtificial Analysis
MATH-500
implementation=artificial-analysis
thinking97.9 %independentArtificial Analysis
MATH-500
implementation=vals-ai
94.0 %independentVals AI

Agent + model results

systems, not bare-model scores
agent + model GLM-4.5 + GLM 4.5SWE-bench Verified64.2 %unverifiedSWE-bench Leaderboard
agent + model mini-SWE-agent + GLM 4.5SWE-bench Verified54.2 %communitySWE-bench Leaderboard
agent + model mini-SWE-agent + GLM 4.5SWE-bench bash-only54.2 %communitySWE-bench Leaderboard
agent + model mini-SWE-agent + GLM 4.5SWE-bench bash-only0.3 usd_per_taskcommunitySWE-bench Leaderboard
agent + model mini-SWE-agent + GLM 4.5SWE-bench Verified0.3 usd_per_taskcommunitySWE-bench Leaderboard
agent + model terminus-1 + GLM 4.5Terminal-Bench 1.039.9 %communityTerminal-Bench Leaderboard
agent + model Artificial Analysis harness + GLM 4.5Terminal-Bench Hard22.0 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.

Related variants