The Known Good Updated 25 Jul 2026
Evaluations· Epoch AI· CC-BY 4.0· Known Good Index component

Terminal-Bench

Agentic terminal tasks. Epoch publishes one row per agent harness; the best score per model is kept, because the harness is not a property of the model. Aggregated from Epoch AI's AI Benchmarking Hub (terminalbench_external.csv, column 'Accuracy mean'), used under CC-BY 4.0. The Known Good aggregates published results; it runs no evaluations.

Publisher's page Licence & attribution How we use this score
55 models scored Higher is better Published by Epoch AI CC-BY 4.0
Terminal-Bench

Terminal-Bench as measured and published by Epoch AI (CC-BY 4.0). Ingested, normalised only where it feeds an index, and never re-run by us. Higher is better.

16 of 55 models +Add model from specific provider
💡 Reasoning models are indicated by a lightbulb
The Known Good
Every model we hold a Terminal-Bench score for
55 of 55 models
# Model Creator Terminal-Bench Known Good Index Measured
1 Anthropic: Claude Opus 4.7 💡 Anthropic 90.2 94 25 Jul 2026
2 OpenAI: GPT-5.5 💡 OpenAI 84.7 25 Jul 2026
3 OpenAI: GPT-5.4 💡 OpenAI 81.8 90 25 Jul 2026
4 Google: Gemini 3.1 Pro Preview 💡 Google 80.2 96 25 Jul 2026
5 Anthropic: Claude Opus 4.6 💡 Anthropic 79.8 88 25 Jul 2026
6 OpenAI: GPT-5.3-Codex 💡 OpenAI 78.4 25 Jul 2026
7 Gemini 3 Pro Google 69.4 25 Jul 2026
8 OpenAI: GPT-5.2-Codex 💡 OpenAI 66.5 25 Jul 2026
9 OpenAI: GPT-5.2 💡 OpenAI 64.9 80 25 Jul 2026
10 Google: Gemini 3 Flash Preview 💡 Google 64.3 83 25 Jul 2026
11 Anthropic: Claude Opus 4.5 💡 Anthropic 63.1 25 Jul 2026
12 claude-opus-4-5-20251101 Anthropic 63.1 72 25 Jul 2026
13 gemini-3-pro-preview Google 61.8 83 25 Jul 2026
14 OpenAI: GPT-5.1-Codex-Mini 💡 OpenAI 61.6 25 Jul 2026
15 OpenAI: GPT-5.1-Codex-Max 💡 OpenAI 60.4 25 Jul 2026
16 claude-opus-4-5-20251101_128K Anthropic 59.1 25 Jul 2026
17 OpenAI: GPT-5.1-Codex 💡 OpenAI 57.8 25 Jul 2026
18 xAI: Grok 4.20 💡 xAI 57.3 25 Jul 2026
19 Anthropic: Claude Sonnet 4.6 💡 Anthropic 53.4 80 25 Jul 2026
20 Z.ai: GLM 5 💡 Z.ai 52.4 77 25 Jul 2026
21 gemini-3-flash Google 51.7 25 Jul 2026
22 OpenAI: GPT-5 💡 OpenAI 49.6 73 25 Jul 2026
23 OpenAI: GPT-5.1 💡 OpenAI 47.6 74 25 Jul 2026
24 Anthropic: Claude Sonnet 4.5 💡 Anthropic 46.5 25 Jul 2026
25 MiniMax: MiniMax M2.7 💡 MiniMax 45.1 25 Jul 2026
26 OpenAI: GPT-5 Codex 💡 OpenAI 44.3 25 Jul 2026
27 MoonshotAI: Kimi K2.5 💡 Moonshot AI 43.2 25 Jul 2026
28 claude-sonnet-4-5-20250929 Anthropic 42.8 59 25 Jul 2026
29 MiniMax: MiniMax M2.5 💡 MiniMax 42.7 25 Jul 2026
30 Claude 4.5 Sonnet Anthropic 42.7 25 Jul 2026
31 DeepSeek: DeepSeek V3.2 💡 DeepSeek 39.6 25 Jul 2026
32 Anthropic: Claude Opus 4.1 💡 Anthropic 38.0 25 Jul 2026
33 claude-opus-4-1-20250805 Anthropic 38.0 49 25 Jul 2026
34 MiniMax: MiniMax M2.1 💡 MiniMax 36.6 25 Jul 2026
35 MoonshotAI: Kimi K2 Thinking 💡 Moonshot AI 35.7 25 Jul 2026
36 Anthropic: Claude Haiku 4.5 💡 Anthropic 35.5 25 Jul 2026
37 OpenAI: GPT-5 Mini 💡 OpenAI 34.8 60 25 Jul 2026
38 Z.ai: GLM 4.7 💡 Z.ai 33.4 68 25 Jul 2026
39 Google: Gemini 2.5 Pro 💡 Google 32.6 64 25 Jul 2026
40 MiniMax: MiniMax M2 💡 MiniMax 30.0 25 Jul 2026
41 claude-haiku-4-5-20251001 Anthropic 29.8 56 25 Jul 2026
42 Kimi-K2-Instruct Moonshot AI 27.8 25 Jul 2026
43 grok-4-0709 xAI 27.2 67 25 Jul 2026
44 Grok 4 xAI 27.2 25 Jul 2026
45 Qwen 3 Coder 480B Alibaba 27.2 25 Jul 2026
46 grok-code-fast-1 xAI 25.8 25 Jul 2026
47 Qwen3-Coder-480B-A35B-Instruct Alibaba 25.4 25 Jul 2026
48 Qwen: Qwen3.6 35B A3B 💡 Alibaba 24.6 25 Jul 2026
49 Z.ai: GLM 4.6 💡 Z.ai 24.5 25 Jul 2026
50 OpenAI: GPT-5 Nano 💡 OpenAI 21.8 57 25 Jul 2026
51 OpenAI: gpt-oss-120b 💡 OpenAI 18.7 61 25 Jul 2026
52 Google: Gemini 2.5 Flash 💡 Google 17.1 25 Jul 2026
53 gemini-2.5-flash-preview-09-2025 Google 17.1 25 Jul 2026
54 Qwen: Qwen3.5-9B 💡 Alibaba 9.2 25 Jul 2026
55 OpenAI: gpt-oss-20b 💡 OpenAI 3.4 25 Jul 2026
The Known Good
Provenance. These figures are published by Epoch AI and redistributed here under CC-BY 4.0. The publisher's own page is here. We did not run this evaluation and we do not adjust the published numbers — where a score feeds an index it is min-max normalised against every other model holding the same evaluation, and nothing else is done to it. This evaluation is one of the six components of the Known Good Index. Full licence detail is on attribution, and every score here is in the CSV download.