The Known Good Updated 25 Jul 2026
Evaluations· Epoch AI· CC-BY 4.0· Tracked, not in the index

MATH Level 5

Hardest tier of the MATH dataset. Aggregated from Epoch AI's AI Benchmarking Hub (math_level_5.csv, column 'mean_score'), used under CC-BY 4.0. The Known Good aggregates published results; it runs no evaluations.

Publisher's page Licence & attribution How we use this score
101 models scored Higher is better Published by Epoch AI CC-BY 4.0
MATH Level 5

MATH Level 5 as measured and published by Epoch AI (CC-BY 4.0). Ingested, normalised only where it feeds an index, and never re-run by us. Higher is better.

16 of 101 models +Add model from specific provider
💡 Reasoning models are indicated by a lightbulb
The Known Good
Every model we hold a MATH Level 5 score for
101 of 101 models
# Model Creator MATH Level 5 Known Good Index Measured
1 OpenAI: GPT-5 💡 OpenAI 98.1 73 25 Jul 2026
2 OpenAI: GPT-5 Mini 💡 OpenAI 97.8 60 25 Jul 2026
3 OpenAI: o4 Mini 💡 OpenAI 97.8 25 Jul 2026
4 OpenAI: o3 💡 OpenAI 97.8 67 25 Jul 2026
5 claude-sonnet-4-5-20250929 Anthropic 97.7 59 25 Jul 2026
6 Qwen: Qwen3 Max 💡 Alibaba 97.1 25 Jul 2026
7 DeepSeek: R1 0528 💡 DeepSeek 96.6 25 Jul 2026
8 deepseek-r1-0528 DeepSeek 96.6 25 Jul 2026
9 OpenAI: o3 Mini 💡 OpenAI 96.5 82 25 Jul 2026
10 claude-haiku-4-5-20251001 Anthropic 96.4 56 25 Jul 2026
11 Google: Gemini 2.5 Pro Preview 05-06 💡 Google 95.9 25 Jul 2026
12 gemini-2.5-pro-preview-03-25 Google 95.6 25 Jul 2026
13 OpenAI: GPT-5 Nano 💡 OpenAI 95.2 57 25 Jul 2026
14 OpenAI: o1 💡 OpenAI 94.7 63 25 Jul 2026
15 DeepSeek: R1 💡 DeepSeek 93.1 68 25 Jul 2026
16 deepseek-r1 DeepSeek 93.1 68 25 Jul 2026
17 claude-3-7-sonnet-20250219_64K Anthropic 91.2 25 Jul 2026
18 grok-3-mini-beta xAI 90.9 25 Jul 2026
19 claude-3-7-sonnet-20250219 Anthropic 90.0 70 25 Jul 2026
20 DeepSeek: R1 Distill Llama 70B 💡 DeepSeek 89.9 52 25 Jul 2026
21 o1-mini OpenAI 89.2 56 25 Jul 2026
22 grok-3-beta xAI 88.7 25 Jul 2026
23 OpenAI: GPT-4.1 Mini OpenAI 87.3 25 Jul 2026
24 DeepSeek-R1-Distill-Qwen-14B DeepSeek 87.1 25 Jul 2026
25 claude-3-7-sonnet-20250219_16K Anthropic 86.3 25 Jul 2026
26 claude-opus-4-20250514 Anthropic 85.0 62 25 Jul 2026
27 claude-sonnet-4-20250514 Anthropic 84.4 25 Jul 2026
28 gemini-2.0-pro-exp-02-05 Google 83.5 25 Jul 2026
29 OpenAI: GPT-4.1 OpenAI 83.0 36 25 Jul 2026
30 gemini-2.0-flash-001 Google DeepMind,Google 82.2 53 25 Jul 2026
31 o1-preview OpenAI 81.6 25 Jul 2026
32 mistral-medium-2505 Mistral 81.6 25 Jul 2026
33 gpt-4.5-preview OpenAI 78.6 47 25 Jul 2026
34 DeepSeek: DeepSeek V3 0324 DeepSeek 75.5 60 25 Jul 2026
35 Google: Gemma 3 27B Google 74.0 37 25 Jul 2026
36 gemma-3-27b-it Google 74.0 37 25 Jul 2026
37 Llama-4-Maverick-17B-128E-Instruct-FP8 Meta 73.0 25 Jul 2026
38 gemini-1.5-pro-002 Google 70.4 25 Jul 2026
39 OpenAI: GPT-4.1 Nano OpenAI 70.0 25 Jul 2026
40 Qwen: Qwen3 235B A22B 💡 Alibaba 68.9 25 Jul 2026
41 qwen-max Alibaba 67.2 25 Jul 2026
42 Qwen: Qwen-Plus 💡 Alibaba 65.3 25 Jul 2026
43 Microsoft: Phi 4 Microsoft 64.9 33 25 Jul 2026
44 DeepSeek: DeepSeek V3 DeepSeek 64.9 44 25 Jul 2026
45 grok-2-1212 xAI 63.5 38 25 Jul 2026
46 Qwen2.5 72B Instruct Alibaba 63.2 25 Jul 2026
47 Llama-4-Scout-17B-16E-Instruct Meta 62.3 25 Jul 2026
48 gemini-1.5-flash-002 Google 61.9 25 Jul 2026
49 claude-3-5-sonnet-20241022 Anthropic 56.9 40 25 Jul 2026
50 qwen-turbo Alibaba 56.2 25 Jul 2026
51 qwen2.5-32b-instruct Alibaba 56.1 25 Jul 2026
52 OpenAI: GPT-4o OpenAI 53.3 21 25 Jul 2026
53 OpenAI: GPT-4o-mini OpenAI 52.6 23 25 Jul 2026
54 claude-3-5-sonnet-20240620 Anthropic 51.7 25 Jul 2026
55 mistral-large-2411 Mistral 50.3 33 25 Jul 2026
56 Llama-3.1-405B-Instruct Meta 49.8 25 Jul 2026
57 mistral-small-2503 Mistral 46.8 28 25 Jul 2026
58 OpenAI: GPT-4 Turbo OpenAI 46.7 25 Jul 2026
59 claude-3-5-haiku-20241022 Anthropic 46.4 23 25 Jul 2026
60 Mistral Large 2407 Mistral 44.8 25 Jul 2026
61 mistral-small-2501 Mistral 44.8 26 25 Jul 2026
62 Llama-3.1-Tulu-3-70B-DPO Allen Institute for AI,University of Washington 42.7 25 Jul 2026
63 Meta: Llama 3.3 70B Instruct Meta 41.6 31 25 Jul 2026
64 gemini-1.5-pro-001 Google 40.7 25 Jul 2026
65 gpt-4-1106-preview OpenAI 40.0 25 Jul 2026
66 Llama-3.2-90B-Vision-Instruct Meta 39.4 25 Jul 2026
67 qwen2-72b-instruct Alibaba 39.1 25 Jul 2026
68 claude-3-opus-20240229 Anthropic 37.5 30 25 Jul 2026
69 Meta: Llama 3.1 70B Instruct Meta 36.7 25 Jul 2026
70 gpt-4-0125-preview OpenAI 35.4 25 Jul 2026
71 Google: Gemma 2 27B Google 27.9 19 25 Jul 2026
72 gemma-2-27b-it Google 27.9 19 25 Jul 2026
73 WizardLM-2 8x22B Microsoft 25.7 25 Jul 2026
74 Yi-1.5-34B-Chat 01.AI 25.5 25 Jul 2026
75 gemini-1.5-flash-001 Google 25.1 25 Jul 2026
76 mistral-large-2402 Mistral 24.5 25 Jul 2026
77 open-mixtral-8x22b Mistral 24.2 25 Jul 2026
78 gpt-4-0613 OpenAI 23.0 25 Jul 2026
79 Meta: Llama 3.1 8B Instruct Meta 22.9 25 Jul 2026
80 Hermes-2-Theta-Llama-3-70B Nous Research,Arcee AI 22.7 25 Jul 2026
81 Meta-Llama-3-70B-Instruct Meta 22.6 25 Jul 2026
82 gemma-2-9b-it Google 21.0 10 25 Jul 2026
83 claude-3-sonnet-20240229 Anthropic 18.2 25 Jul 2026
84 Phi-3-medium-128k-instruct Microsoft 17.6 25 Jul 2026
85 gpt-3.5-turbo-1106 OpenAI 15.9 25 Jul 2026
86 ministral-8b-2410 Mistral 14.9 25 Jul 2026
87 claude-3-haiku-20240307 Anthropic 14.9 25 Jul 2026
88 ministral-3b-2410 Mistral 14.4 25 Jul 2026
89 claude-2.0 Anthropic 11.7 25 Jul 2026
90 dbrx-instruct Databricks 11.7 25 Jul 2026
91 gpt-3.5-turbo-0125 OpenAI 11.6 25 Jul 2026
92 gemini-1.0-pro-001 Google 11.2 25 Jul 2026
93 open-mistral-nemo-2407 Mistral 10.8 25 Jul 2026
94 open-mixtral-8x7b Mistral 10.0 25 Jul 2026
95 Mixtral-8x7B-Instruct-v0.1 Mistral 9.3 25 Jul 2026
96 deepseek-llm-67b-chat DeepSeek 6.4 25 Jul 2026
97 Meta-Llama-3-8B-Instruct Meta 6.1 25 Jul 2026
98 Yi-34B-Chat 01.AI 5.1 25 Jul 2026
99 open-mistral-7b Mistral 3.7 25 Jul 2026
100 Mistral-7B-Instruct-v0.3 Mistral 3.6 25 Jul 2026
101 Llama-2-70b-chat-hf Meta 3.3 25 Jul 2026
The Known Good
Provenance. These figures are published by Epoch AI and redistributed here under CC-BY 4.0. The publisher's own page is here. We did not run this evaluation and we do not adjust the published numbers — where a score feeds an index it is min-max normalised against every other model holding the same evaluation, and nothing else is done to it. Full licence detail is on attribution, and every score here is in the CSV download.