BenchAtlas

Rankings / Moonshot

Kimi K2 7 Code

released 2026-06-12

BenchAtlas Index

as of 2026-09-11
50.9
base configuration
rank #231
13 families · 5 categories · high

Benchmark evidence

23 results
agentic coding
Release 2026-06-25
tasks_counted=3 · livebench_version=2026-06-25
45.7 %independentLiveBench
τ²-Bench90.1 %independentArtificial Analysis
τ²-Bench
subset=banking
20.2 %independentArtificial Analysis
coding
Release 2026-06-25
tasks_counted=2 · livebench_version=2026-06-25
74.0 %independentLiveBench
SciCode47.8 %independentArtificial Analysis
data analysis
Release 2026-06-25
tasks_counted=3 · livebench_version=2026-06-25
62.7 %independentLiveBench
external indices
AA Coding Index60.8 pointsindependentArtificial Analysis
Intelligence Index v4.126.3 pointsindependentArtificial Analysis
ECI150.3 pointsindependentEpoch AI Benchmarking Hub
factuality
SimpleQA Verified39.2 %independentEpoch AI Benchmarking Hub
2026-06-12
SimpleQA Verified36.5 %independentEpoch AI Benchmarking Hub
2026-08-27
knowledge science
GPQA Diamond
implementation=artificial-analysis
89.6 %independentArtificial Analysis
GPQA Diamond89.5 %independentEpoch AI Benchmarking Hub
2026-06-12
GPQA Diamond87.9 %independentEpoch AI Benchmarking Hub
2026-08-07
Humanity's Last Exam
implementation=artificial-analysis
35.0 %independentArtificial Analysis
language
Release 2026-06-25
tasks_counted=3 · livebench_version=2026-06-25
77.9 %independentLiveBench
long context instruction
AA-LCR79.3 %independentArtificial Analysis
IFBench63.1 %independentArtificial Analysis
Release 2026-06-25
tasks_counted=4 · livebench_version=2026-06-25
56.3 %independentLiveBench
reasoning math
Release 2026-06-25
tasks_counted=4 · livebench_version=2026-06-25
79.6 %independentLiveBench
Release 2026-06-25
tasks_counted=4 · livebench_version=2026-06-25
82.8 %independentLiveBench
OTIS Mock AIME 2024–202596.4 %independentEpoch AI Benchmarking Hub
2026-06-13
OTIS Mock AIME 2024–202595.6 %independentEpoch AI Benchmarking Hub
2026-08-07

Agent + model results

systems, not bare-model scores
agent + model Artificial Analysis harness + Kimi K2 7 CodeTerminal-Bench 2.167.4 %independentArtificial Analysis
agent + model Artificial Analysis harness + Kimi K2 7 CodeTerminal-Bench Hard44.7 %independentArtificial Analysis

These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.