Rankings / Z.ai
GLM 5
released 2026-02-20
BenchAtlas Index
as of 2026-09-11
thinking
rank #101
9 families · 4 categories · medium
thinking
rank #130
8 families · 3 categories · medium
base configuration
rank #136
6 families · 3 categories · medium
Benchmark evidence
63 results
agentic coding
| τ²-Bench | thinking | 98.3 % | independent | Artificial Analysis |
| τ²-Bench | no reasoning | 97.4 % | independent | Artificial Analysis |
coding
| SciCode | thinking | 46.2 % | independent | Artificial Analysis |
| SciCode | no reasoning | 38.3 % | independent | Artificial Analysis |
external indices
| Intelligence Index v4.1 | thinking | 27.9 points | independent | Artificial Analysis |
| Intelligence Index v4.1 | no reasoning | 21.8 points | independent | Artificial Analysis |
| ECI | 145.9 points | independent | Epoch AI Benchmarking Hub |
human preference
| Chinese (style control)older version arena=text · category=chinese · style_control=true | 1515.2 1500.7–1529.7 | community | LMArena Leaderboard Dataset | |
| Coding (style control)older version arena=text · category=coding · style_control=true | 1497.5 1490.1–1505.0 | community | LMArena Leaderboard Dataset | |
| Hard Prompts English (style control)older version arena=text · category=hard_prompts_english · style_control=true | 1488.4 1481.3–1495.6 | community | LMArena Leaderboard Dataset | |
| Industry Software And It Services (style control)older version arena=text · category=industry_software_and_it_services · style_control=true | 1487.4 1481.1–1493.7 | community | LMArena Leaderboard Dataset | |
| Expert (style control)older version arena=text · category=expert · style_control=true | 1482.2 1470.0–1494.3 | community | LMArena Leaderboard Dataset | |
| Industry Life And Physical And Social Science (style control)older version arena=text · category=industry_life_and_physical_and_social_science · style_control=true | 1479.2 1470.1–1488.2 | community | LMArena Leaderboard Dataset | |
| Hard Prompts (style control)older version arena=text · category=hard_prompts · style_control=true | 1478.3 1473.0–1483.6 | community | LMArena Leaderboard Dataset | |
| French (style control)older version arena=text · category=french · style_control=true | 1477.9 1456.9–1499.0 | community | LMArena Leaderboard Dataset | |
| Industry Medicine And Healthcare (style control)older version arena=text · category=industry_medicine_and_healthcare · style_control=true | 1477.9 1464.4–1491.4 | community | LMArena Leaderboard Dataset | |
| English (style control)older version arena=text · category=english · style_control=true | 1473.3 1467.4–1479.3 | community | LMArena Leaderboard Dataset | |
| Multi Turn (style control)older version arena=text · category=multi_turn · style_control=true | 1473.2 1464.0–1482.3 | community | LMArena Leaderboard Dataset | |
| Longer Query (style control)older version arena=text · category=longer_query · style_control=true | 1469.7 1463.2–1476.2 | community | LMArena Leaderboard Dataset | |
| Industry Legal And Government (style control)older version arena=text · category=industry_legal_and_government · style_control=true | 1468.8 1455.7–1482.0 | community | LMArena Leaderboard Dataset | |
| Exclude Ties (style control)older version arena=text · category=exclude_ties · style_control=true | 1461.7 1455.8–1467.7 | community | LMArena Leaderboard Dataset | |
| Industry Mathematical (style control)older version arena=text · category=industry_mathematical · style_control=true | 1458.3 1442.9–1473.7 | community | LMArena Leaderboard Dataset | |
| Overall (style control) arena=text · category=overall · style_control=true | 1457.8 1453.4–1462.1 | community | LMArena Leaderboard Dataset | |
| Spanish (style control)older version arena=text · category=spanish · style_control=true | 1455.9 1437.7–1474.1 | community | LMArena Leaderboard Dataset | |
| Industry Business And Management And Financial Operations (style control)older version arena=text · category=industry_business_and_management_and_financial_operations · style_control=true | 1451.3 1443.1–1459.5 | community | LMArena Leaderboard Dataset | |
| Industry Writing And Literature And Language (style control)older version arena=text · category=industry_writing_and_literature_and_language · style_control=true | 1449.9 1442.2–1457.5 | community | LMArena Leaderboard Dataset | |
| Creative Writing (style control)older version arena=text · category=creative_writing · style_control=true | 1448.1 1438.9–1457.4 | community | LMArena Leaderboard Dataset | |
| Russian (style control)older version arena=text · category=russian · style_control=true | 1448.0 1437.5–1458.5 | community | LMArena Leaderboard Dataset | |
| Polish (style control)older version arena=text · category=polish · style_control=true | 1446.4 1422.6–1470.2 | community | LMArena Leaderboard Dataset | |
| Instruction Following (style control)older version arena=text · category=instruction_following · style_control=true | 1446.4 1439.6–1453.1 | community | LMArena Leaderboard Dataset | |
| Math (style control)older version arena=text · category=math · style_control=true | 1442.9 1428.4–1457.4 | community | LMArena Leaderboard Dataset | |
| Industry Entertainment And Sports And Media (style control)older version arena=text · category=industry_entertainment_and_sports_and_media · style_control=true | 1438.9 1430.6–1447.3 | community | LMArena Leaderboard Dataset | |
| Non English (style control)older version arena=text · category=non_english · style_control=true | 1438.8 1433.5–1444.2 | community | LMArena Leaderboard Dataset | |
| Korean (style control)older version arena=text · category=korean · style_control=true | 1427.2 1401.4–1452.9 | community | LMArena Leaderboard Dataset |
knowledge science
| GPQA Diamond | 87.8 % | independent | Epoch AI Benchmarking Hub 2026-02-12 | |
| GPQA Diamond implementation=vals-ai | thinking | 83.3 % | independent | Vals AI |
| GPQA Diamond implementation=artificial-analysis | thinking | 82.0 % | independent | Artificial Analysis |
| GPQA Diamond implementation=artificial-analysis | no reasoning | 66.6 % | independent | Artificial Analysis |
| Humanity's Last Exam implementation=artificial-analysis | thinking | 29.3 % | independent | Artificial Analysis |
| Humanity's Last Exam implementation=artificial-analysis | no reasoning | 7.6 % | independent | Artificial Analysis |
| MMLU-Pro implementation=vals-ai | thinking | 86.0 % | independent | Vals AI |
| MMLU-Pro implementation=vals-ai | thinking | 86.0 % | independent | Vals AI |
long context instruction
| AA-LCR | thinking | 75.7 % | independent | Artificial Analysis |
| AA-LCR | no reasoning | 43.7 % | independent | Artificial Analysis |
| IFBench | thinking | 72.3 % | independent | Artificial Analysis |
| IFBench | no reasoning | 55.2 % | independent | Artificial Analysis |
professional
| CaseLaw | thinking | 52.5 % | independent | Vals AI |
| CorpFin | thinking | 62.9 % | independent | Vals AI |
| LegalBench | thinking | 84.1 % | independent | Vals AI |
| MedQA | thinking | 94.3 % | independent | Vals AI |
| TaxEval | thinking | 70.0 % | independent | Vals AI |
reasoning math
| AIME implementation=vals-ai | thinking | 91.7 % | independent | Vals AI |
| ARC-AGI-1older version split=public_eval · model_type=CoT | 58.6 % | independent | ARC Prize Leaderboard | |
| ARC-AGI-1older version split=semi_private · model_type=CoT | 44.7 % | independent | ARC Prize Leaderboard | |
| ARC-AGI-2 split=public_eval · model_type=CoT | 5.4 % | independent | ARC Prize Leaderboard | |
| ARC-AGI-2 split=semi_private · model_type=CoT | 4.9 % | independent | ARC Prize Leaderboard | |
| ARC-AGI-2 split=public_eval · model_type=CoT | 0.3 usd_per_task | independent | ARC Prize Leaderboard | |
| ARC-AGI-2 split=semi_private · model_type=CoT | 0.3 usd_per_task | independent | ARC Prize Leaderboard | |
| ARC-AGI-1older version split=semi_private · model_type=CoT | 0.2 usd_per_task | independent | ARC Prize Leaderboard | |
| ARC-AGI-1older version split=public_eval · model_type=CoT | 0.1 usd_per_task | independent | ARC Prize Leaderboard | |
| FrontierMath | 16.4 % | independent | Epoch AI Benchmarking Hub 2026-02-19 | |
| FrontierMath Tier 4older version | 2.1 % | independent | Epoch AI Benchmarking Hub 2026-02-19 | |
| OTIS Mock AIME 2024–2025 | 80.0 % | independent | Epoch AI Benchmarking Hub 2026-02-12 |
Agent + model results
systems, not bare-model scores
| agent + model mini-SWE-agent + GLM 5 | SWE-bench Verified | 72.8 % | unverified | SWE-bench Leaderboard |
| agent + model mini-SWE-agent + GLM 5 | SWE-bench bash-only | 72.8 % | unverified | SWE-bench Leaderboard |
| agent + model Epoch Inspect harness + GLM 5 | SWE-bench Verified | 72.1 % | independent | Epoch AI Benchmarking Hub |
| agent + model mini-SWE-agent + GLM 5 | SWE-bench Multilingual | 69.7 % | community | SWE-bench Leaderboard |
| agent + model mini-SWE-agent + GLM 5 | SWE-bench Multilingual | 0.6 usd_per_task | community | SWE-bench Leaderboard |
| agent + model mini-SWE-agent + GLM 5 | SWE-bench bash-only | 0.5 usd_per_task | unverified | SWE-bench Leaderboard |
| agent + model mini-SWE-agent + GLM 5 | SWE-bench Verified | 0.5 usd_per_task | unverified | SWE-bench Leaderboard |
| agent + model terminus-2 + GLM 5 | Terminal-Bench 2.0 | 52.4 % | unverified | Terminal-Bench Leaderboard |
| agent + model Artificial Analysis harness + GLM 5 | Terminal-Bench Hard | 43.2 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GLM 5 | Terminal-Bench Hard | 39.4 % | independent | Artificial Analysis |
These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.
