Rankings / OpenAI
GPT 5.6 Terra
released 2026-07-09
BenchAtlas Index
as of 2026-09-11
xhigh effort
rank #14
7 families · 4 categories · medium
high effort
rank #18
8 families · 5 categories · high
max effort
rank #20
14 families · 5 categories · high
Benchmark evidence
136 results
agentic coding
| Release 2026-06-25 tasks_counted=3 · livebench_version=2026-06-25 | max effort | 55.0 % | independent | LiveBench |
| Release 2026-06-25 tasks_counted=3 · livebench_version=2026-06-25 | xhigh effort | 53.3 % | independent | LiveBench |
| τ²-Bench | max effort | 86.3 % | independent | Artificial Analysis |
| τ²-Bench | xhigh effort | 80.4 % | independent | Artificial Analysis |
| τ²-Bench | high effort | 78.4 % | independent | Artificial Analysis |
| τ²-Bench | medium effort | 72.8 % | independent | Artificial Analysis |
| τ²-Bench | low effort | 60.5 % | independent | Artificial Analysis |
| τ²-Bench subset=banking | max effort | 40.2 % | independent | Artificial Analysis |
| τ²-Bench subset=banking | xhigh effort | 29.7 % | independent | Artificial Analysis |
| τ²-Bench subset=banking | high effort | 28.7 % | independent | Artificial Analysis |
| τ²-Bench subset=banking | medium effort | 25.6 % | independent | Artificial Analysis |
| τ²-Bench subset=banking | low effort | 18.8 % | independent | Artificial Analysis |
| τ²-Bench subset=banking | no reasoning | 15.7 % | independent | Artificial Analysis |
coding
| Release 2026-06-25 tasks_counted=2 · livebench_version=2026-06-25 | max effort | 78.3 % | independent | LiveBench |
| Release 2026-06-25 tasks_counted=2 · livebench_version=2026-06-25 | xhigh effort | 75.4 % | independent | LiveBench |
| SciCode | max effort | 55.0 % | independent | Artificial Analysis |
| SciCode | high effort | 52.4 % | independent | Artificial Analysis |
| SciCode | xhigh effort | 52.3 % | independent | Artificial Analysis |
| SciCode | medium effort | 50.5 % | independent | Artificial Analysis |
| SciCode | low effort | 49.9 % | independent | Artificial Analysis |
| SciCode | no reasoning | 44.6 % | independent | Artificial Analysis |
data analysis
| Release 2026-06-25 tasks_counted=3 · livebench_version=2026-06-25 | max effort | 79.3 % | independent | LiveBench |
| Release 2026-06-25 tasks_counted=3 · livebench_version=2026-06-25 | xhigh effort | 77.4 % | independent | LiveBench |
external indices
| AA Coding Index | max effort | 76.7 points | independent | Artificial Analysis |
| AA Coding Index | xhigh effort | 70.6 points | independent | Artificial Analysis |
| AA Coding Index | high effort | 67.1 points | independent | Artificial Analysis |
| AA Coding Index | medium effort | 64.7 points | independent | Artificial Analysis |
| AA Coding Index | low effort | 58.1 points | independent | Artificial Analysis |
| AA Coding Index | no reasoning | 52.3 points | independent | Artificial Analysis |
| Intelligence Index v4.1 | max effort | 42.3 points | independent | Artificial Analysis |
| Intelligence Index v4.1 | xhigh effort | 38.2 points | independent | Artificial Analysis |
| Intelligence Index v4.1 | high effort | 34.5 points | independent | Artificial Analysis |
| Intelligence Index v4.1 | medium effort | 30.4 points | independent | Artificial Analysis |
| Intelligence Index v4.1 | low effort | 27.9 points | independent | Artificial Analysis |
| Intelligence Index v4.1 | no reasoning | 22.3 points | independent | Artificial Analysis |
| ECI | low effort | 159.2 points | independent | Epoch AI Benchmarking Hub |
| ECI | high effort | 159.2 points | independent | Epoch AI Benchmarking Hub |
| ECI | 159.2 points | independent | Epoch AI Benchmarking Hub | |
| ECI | medium effort | 159.2 points | independent | Epoch AI Benchmarking Hub |
| ECI | no reasoning | 159.2 points | independent | Epoch AI Benchmarking Hub |
| ECI | max effort | 159.2 points | independent | Epoch AI Benchmarking Hub |
| ECI | xhigh effort | 159.2 points | independent | Epoch AI Benchmarking Hub |
| Vals Index | max effort | 59.6 points | independent | Vals AI |
| Vals Index | xhigh effort | 56.5 points | independent | Vals AI |
factuality
| SimpleQA Verified | max effort | 43.2 % | independent | Epoch AI Benchmarking Hub 2026-08-10 |
| SimpleQA Verified | max effort | 43.1 % | independent | Epoch AI Benchmarking Hub 2026-07-09 |
knowledge science
| GPQA Diamond | max effort | 93.3 % | independent | Epoch AI Benchmarking Hub 2026-07-09 |
| GPQA Diamond implementation=artificial-analysis | max effort | 92.5 % | independent | Artificial Analysis |
| GPQA Diamond implementation=vals-ai | xhigh effort | 90.9 % | independent | Vals AI |
| GPQA Diamond implementation=artificial-analysis | xhigh effort | 90.8 % | independent | Artificial Analysis |
| GPQA Diamond implementation=artificial-analysis | high effort | 89.6 % | independent | Artificial Analysis |
| GPQA Diamond | low effort | 87.4 % | independent | Epoch AI Benchmarking Hub 2026-08-07 |
| GPQA Diamond implementation=artificial-analysis | medium effort | 87.2 % | independent | Artificial Analysis |
| GPQA Diamond implementation=artificial-analysis | low effort | 84.3 % | independent | Artificial Analysis |
| GPQA Diamond | no reasoning | 77.3 % | independent | Epoch AI Benchmarking Hub 2026-08-07 |
| GPQA Diamond implementation=artificial-analysis | no reasoning | 74.6 % | independent | Artificial Analysis |
| Humanity's Last Exam implementation=artificial-analysis | max effort | 42.9 % | independent | Artificial Analysis |
| Humanity's Last Exam implementation=artificial-analysis | xhigh effort | 41.9 % | independent | Artificial Analysis |
| Humanity's Last Exam implementation=artificial-analysis | high effort | 38.5 % | independent | Artificial Analysis |
| Humanity's Last Exam implementation=artificial-analysis | medium effort | 33.3 % | independent | Artificial Analysis |
| Humanity's Last Exam implementation=artificial-analysis | low effort | 29.2 % | independent | Artificial Analysis |
| Humanity's Last Exam implementation=artificial-analysis | no reasoning | 11.4 % | independent | Artificial Analysis |
| MMLU-Pro implementation=vals-ai | xhigh effort | 86.7 % | independent | Vals AI |
language
| Release 2026-06-25 tasks_counted=3 · livebench_version=2026-06-25 | max effort | 82.9 % | independent | LiveBench |
| Release 2026-06-25 tasks_counted=3 · livebench_version=2026-06-25 | xhigh effort | 79.9 % | independent | LiveBench |
long context instruction
| AA-LCR | max effort | 83.0 % | independent | Artificial Analysis |
| AA-LCR | xhigh effort | 79.0 % | independent | Artificial Analysis |
| AA-LCR | high effort | 77.7 % | independent | Artificial Analysis |
| AA-LCR | medium effort | 74.0 % | independent | Artificial Analysis |
| AA-LCR | low effort | 71.3 % | independent | Artificial Analysis |
| AA-LCR | no reasoning | 58.7 % | independent | Artificial Analysis |
| IFBench | max effort | 71.2 % | independent | Artificial Analysis |
| IFBench | xhigh effort | 66.3 % | independent | Artificial Analysis |
| IFBench | high effort | 64.4 % | independent | Artificial Analysis |
| IFBench | medium effort | 62.2 % | independent | Artificial Analysis |
| IFBench | low effort | 59.7 % | independent | Artificial Analysis |
| Release 2026-06-25 tasks_counted=4 · livebench_version=2026-06-25 | max effort | 64.6 % | independent | LiveBench |
| Release 2026-06-25 tasks_counted=4 · livebench_version=2026-06-25 | xhigh effort | 59.4 % | independent | LiveBench |
multimodal
| MMMU implementation=vals-ai | xhigh effort | 86.5 % | independent | Vals AI |
| MMMU implementation=vals-ai | max effort | 86.5 % | independent | Vals AI |
professional
| CorpFin | xhigh effort | 65.3 % | independent | Vals AI |
| LegalBench | xhigh effort | 85.1 % | independent | Vals AI |
| LegalBench | max effort | 85.1 % | independent | Vals AI |
| TaxEval | xhigh effort | 76.2 % | independent | Vals AI |
reasoning math
| ARC-AGI-1older version split=public_eval · model_type=CoT | max effort | 98.3 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | max effort | 96.5 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=public_eval · model_type=CoT | high effort | 95.8 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=public_eval · model_type=CoT | xhigh effort | 95.6 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | xhigh effort | 94.0 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | high effort | 92.0 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | max effort | 91.3 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=public_eval · model_type=CoT | medium effort | 84.8 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | max effort | 83.9 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | xhigh effort | 82.6 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | medium effort | 77.0 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | xhigh effort | 74.2 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | high effort | 73.9 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=public_eval · model_type=CoT | low effort | 70.8 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | high effort | 67.1 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | low effort | 60.2 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | medium effort | 38.9 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | medium effort | 37.5 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | low effort | 18.8 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | low effort | 14.9 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | max effort | 1.2 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | max effort | 1.1 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-3older version split=semi_private · model_type=CoT | max effort | 0.8 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | xhigh effort | 0.7 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | xhigh effort | 0.7 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-3older version split=semi_private · model_type=CoT | xhigh effort | 0.7 % | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | high effort | 0.6 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | high effort | 0.6 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | max effort | 0.6 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-3older version split=semi_private · model_type=CoT | high effort | 0.5 % | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=public_eval · model_type=CoT | max effort | 0.3 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | medium effort | 0.3 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | medium effort | 0.3 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | xhigh effort | 0.3 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | high effort | 0.2 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=public_eval · model_type=CoT | xhigh effort | 0.2 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=public_eval · model_type=CoT | low effort | 0.2 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-2 split=semi_private · model_type=CoT | low effort | 0.2 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=public_eval · model_type=CoT | high effort | 0.1 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | medium effort | 0.1 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=public_eval · model_type=CoT | medium effort | 0.1 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=semi_private · model_type=CoT | low effort | 0.1 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-1older version split=public_eval · model_type=CoT | low effort | 0.1 usd_per_task | independent | ARC Prize Leaderboard |
| ARC-AGI-3older version split=semi_private · model_type=CoT | medium effort | 0.1 % | independent | ARC Prize Leaderboard |
| ARC-AGI-3older version split=semi_private · model_type=CoT | low effort | 0.0 % | independent | ARC Prize Leaderboard |
| Release 2026-06-25 tasks_counted=4 · livebench_version=2026-06-25 | max effort | 94.9 % | independent | LiveBench |
| Release 2026-06-25 tasks_counted=4 · livebench_version=2026-06-25 | xhigh effort | 89.5 % | independent | LiveBench |
| Release 2026-06-25 tasks_counted=4 · livebench_version=2026-06-25 | max effort | 90.6 % | independent | LiveBench |
| Release 2026-06-25 tasks_counted=4 · livebench_version=2026-06-25 | xhigh effort | 84.9 % | independent | LiveBench |
| OTIS Mock AIME 2024–2025 | max effort | 99.7 % | independent | Epoch AI Benchmarking Hub 2026-07-09 |
| OTIS Mock AIME 2024–2025 | low effort | 88.9 % | independent | Epoch AI Benchmarking Hub 2026-08-07 |
| OTIS Mock AIME 2024–2025 | no reasoning | 53.3 % | independent | Epoch AI Benchmarking Hub 2026-08-07 |
Agent + model results
systems, not bare-model scores
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench 2.1 | 88.0 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench 2.1 | 80.2 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench 2.1 | 75.7 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench 2.1 | 72.3 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench Hard | 62.9 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench 2.1 | 62.5 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench Hard | 57.6 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench Hard | 57.6 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench 2.1 | 56.2 % | independent | Artificial Analysis |
| agent + model Artificial Analysis harness + GPT 5.6 Terra | Terminal-Bench Hard | 43.9 % | independent | Artificial Analysis |
These scores measure the whole agent system (scaffold, tools, budgets) — they are never merged into the bare model’s numbers.
