Terminal-Bench
Agentic terminal tasks. Epoch publishes one row per agent harness; the best score per model is kept, because the harness is not a property of the model. Aggregated from Epoch AI's AI Benchmarking Hub (terminalbench_external.csv, column 'Accuracy mean'), used under CC-BY 4.0. The Known Good aggregates published results; it runs no evaluations.
55 models scored
Higher is better
Published by Epoch AI
CC-BY 4.0
Terminal-Bench
Terminal-Bench as measured and published by Epoch AI (CC-BY 4.0). Ingested, normalised only where it feeds an index, and never re-run by us. Higher is better.
16 of 55 models ▾
☰⚙⇩
+Add model from specific provider
💡 Reasoning models are indicated by a lightbulb
The Known Good
Every model we hold a Terminal-Bench score for
55 of 55 models
| # | Model | Creator | Terminal-Bench | Known Good Index | Measured |
|---|---|---|---|---|---|
| 1 |
|
Anthropic | 90.2 | 94 | 25 Jul 2026 |
| 2 |
|
OpenAI | 84.7 | — | 25 Jul 2026 |
| 3 |
|
OpenAI | 81.8 | 90 | 25 Jul 2026 |
| 4 |
|
80.2 | 96 | 25 Jul 2026 | |
| 5 |
|
Anthropic | 79.8 | 88 | 25 Jul 2026 |
| 6 |
|
OpenAI | 78.4 | — | 25 Jul 2026 |
| 7 |
|
69.4 | — | 25 Jul 2026 | |
| 8 |
|
OpenAI | 66.5 | — | 25 Jul 2026 |
| 9 |
|
OpenAI | 64.9 | 80 | 25 Jul 2026 |
| 10 |
|
64.3 | 83 | 25 Jul 2026 | |
| 11 |
|
Anthropic | 63.1 | — | 25 Jul 2026 |
| 12 |
|
Anthropic | 63.1 | 72 | 25 Jul 2026 |
| 13 |
|
61.8 | 83 | 25 Jul 2026 | |
| 14 |
|
OpenAI | 61.6 | — | 25 Jul 2026 |
| 15 |
|
OpenAI | 60.4 | — | 25 Jul 2026 |
| 16 |
|
Anthropic | 59.1 | — | 25 Jul 2026 |
| 17 |
|
OpenAI | 57.8 | — | 25 Jul 2026 |
| 18 |
|
xAI | 57.3 | — | 25 Jul 2026 |
| 19 |
|
Anthropic | 53.4 | 80 | 25 Jul 2026 |
| 20 |
|
Z.ai | 52.4 | 77 | 25 Jul 2026 |
| 21 |
|
51.7 | — | 25 Jul 2026 | |
| 22 |
|
OpenAI | 49.6 | 73 | 25 Jul 2026 |
| 23 |
|
OpenAI | 47.6 | 74 | 25 Jul 2026 |
| 24 |
|
Anthropic | 46.5 | — | 25 Jul 2026 |
| 25 |
|
MiniMax | 45.1 | — | 25 Jul 2026 |
| 26 |
|
OpenAI | 44.3 | — | 25 Jul 2026 |
| 27 |
|
Moonshot AI | 43.2 | — | 25 Jul 2026 |
| 28 |
|
Anthropic | 42.8 | 59 | 25 Jul 2026 |
| 29 |
|
MiniMax | 42.7 | — | 25 Jul 2026 |
| 30 |
|
Anthropic | 42.7 | — | 25 Jul 2026 |
| 31 |
|
DeepSeek | 39.6 | — | 25 Jul 2026 |
| 32 |
|
Anthropic | 38.0 | — | 25 Jul 2026 |
| 33 |
|
Anthropic | 38.0 | 49 | 25 Jul 2026 |
| 34 |
|
MiniMax | 36.6 | — | 25 Jul 2026 |
| 35 |
|
Moonshot AI | 35.7 | — | 25 Jul 2026 |
| 36 |
|
Anthropic | 35.5 | — | 25 Jul 2026 |
| 37 |
|
OpenAI | 34.8 | 60 | 25 Jul 2026 |
| 38 |
|
Z.ai | 33.4 | 68 | 25 Jul 2026 |
| 39 |
|
32.6 | 64 | 25 Jul 2026 | |
| 40 |
|
MiniMax | 30.0 | — | 25 Jul 2026 |
| 41 |
|
Anthropic | 29.8 | 56 | 25 Jul 2026 |
| 42 |
|
Moonshot AI | 27.8 | — | 25 Jul 2026 |
| 43 |
|
xAI | 27.2 | 67 | 25 Jul 2026 |
| 44 |
|
xAI | 27.2 | — | 25 Jul 2026 |
| 45 |
|
Alibaba | 27.2 | — | 25 Jul 2026 |
| 46 |
|
xAI | 25.8 | — | 25 Jul 2026 |
| 47 |
|
Alibaba | 25.4 | — | 25 Jul 2026 |
| 48 |
|
Alibaba | 24.6 | — | 25 Jul 2026 |
| 49 |
|
Z.ai | 24.5 | — | 25 Jul 2026 |
| 50 |
|
OpenAI | 21.8 | 57 | 25 Jul 2026 |
| 51 |
|
OpenAI | 18.7 | 61 | 25 Jul 2026 |
| 52 |
|
17.1 | — | 25 Jul 2026 | |
| 53 |
|
17.1 | — | 25 Jul 2026 | |
| 54 |
|
Alibaba | 9.2 | — | 25 Jul 2026 |
| 55 |
|
OpenAI | 3.4 | — | 25 Jul 2026 |
The Known Good
Provenance. These figures are published by Epoch AI and redistributed here under CC-BY 4.0.
The publisher's own page is here. We did not run this evaluation and we do not adjust the published numbers — where a score feeds an index it is
min-max normalised against every other model holding the same evaluation, and nothing else is done to it.
This evaluation is one of the six components of the
Known Good Index. Full licence detail is on attribution, and every score here is
in the CSV download.