Benchmarks / Coding
SciCode
Scientific-computing code generation from research problems.
maintainer unknown · 302 observations on record
Versions
1 version
| Version | Tasks |
|---|---|
| SciCode current scicode | — |
Current leaderboard
SciCode · Accuracy · top 25 of 239 systems
| # | System | Accuracy % |
|---|---|---|
| 1 | Muse Spark 1.1xhigh effort Meta AI | 58.8% |
| 2 | Gemini 3.1 Pro Preview Google DeepMind | 58.7% |
| 3 | GPT 5.6 Solhigh effort OpenAI | 57.8% |
| 4 | GPT 5.6 Solmedium effort OpenAI | 57.4% |
| 5 | GPT 5.6 Solxhigh effort OpenAI | 57.1% |
| 6 | GPT 5.6 Solmax effort OpenAI | 57.1% |
| 7 | GPT 5.4 (2026-03-05)xhigh effort OpenAI | 56.6% |
| 8 | GPT 5.6 Sollow effort OpenAI | 56.4% |
| 9 | Gemini 3 Pro Previewhigh effort Google DeepMind | 56.1% |
| 10 | GPT 5.5 (2026-04-22)high effort OpenAI | 56.1% |
| 11 | GPT 5.5 (2026-04-22)xhigh effort OpenAI | 55.8% |
| 12 | GPT 5.6 Terramax effort OpenAI | 55.0% |
| 13 | Grok 4.5high effort xAI | 55.0% |
| 14 | GPT 5.2 Codexxhigh effort OpenAI | 54.6% |
| 15 | Claude Opus 4.7max effort Anthropic | 54.5% |
| 16 | GPT 5.5 (2026-04-22)medium effort OpenAI | 54.5% |
| 17 | Claude Opus 4.8max effort Anthropic | 54.4% |
| 18 | Claude Sonnet 5high effort Anthropic | 54.3% |
| 19 | Claude Sonnet 5max effort Anthropic | 54.3% |
| 20 | Claude Sonnet 5xhigh effort Anthropic | 54.1% |
| 21 | Gemini 3.5 Flashhigh effort Google DeepMind | 53.9% |
| 22 | GPT 5.6 Lunamax effort OpenAI | 53.6% |
| 23 | GPT 5.3 Codexxhigh effort OpenAI | 53.2% |
| 24 | Gemini 3.5 Flashmedium effort Google DeepMind | 53.0% |
| 25 | GPT 5.6 Terrahigh effort OpenAI | 52.4% |
One row per evaluated system — reasoning-effort variants rank separately.
