BenchAtlas

Rankings / zai

GLM 4.5 Air

open weights

released 2025-07-28

BenchAtlas Index

as of 2026-09-11
37.2
base configuration
rank #326
10 families · 5 categories · high

Benchmark evidence

42 results
agentic coding
τ²-Bench46.5 %independentArtificial Analysis
coding
LiveCodeBench v6
implementation=artificial-analysis
68.4 %independentArtificial Analysis
SciCode30.6 %independentArtificial Analysis
external indices
Intelligence Index v4.111.1 pointsindependentArtificial Analysis
AA Math Index80.7 pointsindependentArtificial Analysis
human preference
Coding (style control)older version
arena=text · category=coding · style_control=true
1427.2
1419.51434.9
communityLMArena Leaderboard Dataset
Industry Software And It Services (style control)older version
arena=text · category=industry_software_and_it_services · style_control=true
1415.2
1409.01421.5
communityLMArena Leaderboard Dataset
Chinese (style control)older version
arena=text · category=chinese · style_control=true
1406.9
1394.21419.5
communityLMArena Leaderboard Dataset
Hard Prompts English (style control)older version
arena=text · category=hard_prompts_english · style_control=true
1403.0
1395.51410.5
communityLMArena Leaderboard Dataset
French (style control)older version
arena=text · category=french · style_control=true
1397.7
1370.31425.2
communityLMArena Leaderboard Dataset
Industry Life And Physical And Social Science (style control)older version
arena=text · category=industry_life_and_physical_and_social_science · style_control=true
1396.5
1388.01405.1
communityLMArena Leaderboard Dataset
Industry Medicine And Healthcare (style control)older version
arena=text · category=industry_medicine_and_healthcare · style_control=true
1394.2
1379.51408.8
communityLMArena Leaderboard Dataset
Expert (style control)older version
arena=text · category=expert · style_control=true
1390.7
1375.01406.4
communityLMArena Leaderboard Dataset
English (style control)older version
arena=text · category=english · style_control=true
1390.5
1384.71396.2
communityLMArena Leaderboard Dataset
Hard Prompts (style control)older version
arena=text · category=hard_prompts · style_control=true
1390.4
1384.91395.9
communityLMArena Leaderboard Dataset
Industry Mathematical (style control)older version
arena=text · category=industry_mathematical · style_control=true
1390.0
1374.51405.5
communityLMArena Leaderboard Dataset
Math (style control)older version
arena=text · category=math · style_control=true
1388.5
1373.61403.5
communityLMArena Leaderboard Dataset
Longer Query (style control)older version
arena=text · category=longer_query · style_control=true
1378.9
1371.41386.5
communityLMArena Leaderboard Dataset
Spanish (style control)older version
arena=text · category=spanish · style_control=true
1376.3
1354.91397.8
communityLMArena Leaderboard Dataset
Overall (style control)
arena=text · category=overall · style_control=true
1373.2
1368.91377.4
communityLMArena Leaderboard Dataset
Industry Legal And Government (style control)older version
arena=text · category=industry_legal_and_government · style_control=true
1372.5
1358.81386.2
communityLMArena Leaderboard Dataset
Industry Business And Management And Financial Operations (style control)older version
arena=text · category=industry_business_and_management_and_financial_operations · style_control=true
1372.1
1363.91380.3
communityLMArena Leaderboard Dataset
Multi Turn (style control)older version
arena=text · category=multi_turn · style_control=true
1367.3
1358.71375.9
communityLMArena Leaderboard Dataset
Instruction Following (style control)older version
arena=text · category=instruction_following · style_control=true
1361.1
1354.31368.0
communityLMArena Leaderboard Dataset
Russian (style control)older version
arena=text · category=russian · style_control=true
1360.3
1347.51373.1
communityLMArena Leaderboard Dataset
Non English (style control)older version
arena=text · category=non_english · style_control=true
1352.4
1347.21357.7
communityLMArena Leaderboard Dataset
German (style control)older version
arena=text · category=german · style_control=true
1351.6
1329.31374.0
communityLMArena Leaderboard Dataset
Exclude Ties (style control)older version
arena=text · category=exclude_ties · style_control=true
1343.3
1337.31349.3
communityLMArena Leaderboard Dataset
Polish (style control)older version
arena=text · category=polish · style_control=true
1341.7
1327.21356.2
communityLMArena Leaderboard Dataset
Industry Writing And Literature And Language (style control)older version
arena=text · category=industry_writing_and_literature_and_language · style_control=true
1340.3
1332.81347.7
communityLMArena Leaderboard Dataset
Japanese (style control)older version
arena=text · category=japanese · style_control=true
1331.5
1310.31352.8
communityLMArena Leaderboard Dataset
Creative Writing (style control)older version
arena=text · category=creative_writing · style_control=true
1326.9
1317.31336.6
communityLMArena Leaderboard Dataset
Industry Entertainment And Sports And Media (style control)older version
arena=text · category=industry_entertainment_and_sports_and_media · style_control=true
1324.5
1316.41332.6
communityLMArena Leaderboard Dataset
Korean (style control)older version
arena=text · category=korean · style_control=true
1288.2
1264.51311.8
communityLMArena Leaderboard Dataset
knowledge science
GPQA Diamond
implementation=artificial-analysis
73.3 %independentArtificial Analysis
Humanity's Last Exam
implementation=artificial-analysis
7.0 %independentArtificial Analysis
MMLU-Pro
implementation=artificial-analysis
81.5 %independentArtificial Analysis
long context instruction
AA-LCR46.7 %independentArtificial Analysis
IFBench37.5 %independentArtificial Analysis
reasoning math
AIME
year=2025 · implementation=artificial-analysis
80.7 %independentArtificial Analysis
AIME
implementation=artificial-analysis
67.3 %independentArtificial Analysis
MATH-500
implementation=artificial-analysis
96.5 %independentArtificial Analysis

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + GLM 4.5 AirTerminal-Bench Hard20.4 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.