The Known Good Updated 4 Sep 2026 Subscribe
Evaluations· Epoch AI· CC-BY 4.0· Known Good Index component

MATH Level 5

Hardest tier of the MATH dataset. Aggregated from Epoch AI's AI Benchmarking Hub (math_level_5.csv, column 'mean_score'), used under CC-BY 4.0. The Known Good aggregates published results; it runs no evaluations.

Publisher's page Licence & attribution How we use this score
97 models scored Higher is better Published by Epoch AI CC-BY 4.0
MATH Level 5

MATH Level 5 as measured and published by Epoch AI (CC-BY 4.0). Ingested, normalised only where it feeds an index, and never re-run by us. Higher is better.

98
98
98
98
98
97
97
96
96
96
96
95
95
93
91
91
90
90
89
89
87
87
💡
💡
💡
💡
💡 A lightbulb marks a model its provider publishes as a reasoning model
The Known Good
Every model we hold a MATH Level 5 score for
All 97 of 97 models
# Model Creator MATH Level 5 Known Good Index Measured
1 OpenAI: GPT-5 💡 OpenAI 98.1 78 4 Sep 2026
2 OpenAI: GPT-5 Mini 💡 OpenAI 97.8 67 4 Sep 2026
3 OpenAI: o4 Mini 💡 OpenAI 97.8 4 Sep 2026
4 OpenAI: o3 💡 OpenAI 97.8 74 4 Sep 2026
5 claude-sonnet-4-5-20250929 Anthropic 97.7 66 4 Sep 2026
6 Qwen: Qwen3 Max 💡 Alibaba 97.1 4 Sep 2026
7 DeepSeek: R1 0528 💡 DeepSeek 96.6 4 Sep 2026
8 OpenAI: o3 Mini 💡 OpenAI 96.5 86 4 Sep 2026
9 claude-haiku-4-5-20251001 Anthropic 96.4 67 4 Sep 2026
10 Google: Gemini 2.5 Pro Preview 05-06 💡 Google 95.9 4 Sep 2026
11 gemini-2.5-pro-preview-03-25 Google 95.6 4 Sep 2026
12 OpenAI: GPT-5 Nano 💡 OpenAI 95.2 68 4 Sep 2026
13 OpenAI: o1 💡 OpenAI 94.7 70 4 Sep 2026
14 DeepSeek: R1 💡 DeepSeek 93.1 75 4 Sep 2026
15 claude-3-7-sonnet-20250219_64K Anthropic 91.2 4 Sep 2026
16 grok-3-mini-beta xAI 90.9 4 Sep 2026
17 claude-3-7-sonnet-20250219 Anthropic 90.0 74 4 Sep 2026
18 DeepSeek: R1 Distill Llama 70B 💡 DeepSeek 89.9 63 4 Sep 2026
19 o1-mini OpenAI 89.2 65 4 Sep 2026
20 grok-3-beta xAI 88.7 4 Sep 2026
21 OpenAI: GPT-4.1 Mini OpenAI 87.3 4 Sep 2026
22 DeepSeek-R1-Distill-Qwen-14B DeepSeek 87.1 4 Sep 2026
23 claude-3-7-sonnet-20250219_16K Anthropic 86.3 4 Sep 2026
24 claude-opus-4-20250514 Anthropic 85.0 68 4 Sep 2026
25 claude-sonnet-4-20250514 Anthropic 84.4 4 Sep 2026
26 gemini-2.0-pro-exp-02-05 Google 83.5 74 4 Sep 2026
27 OpenAI: GPT-4.1 OpenAI 83.0 46 4 Sep 2026
28 gemini-2.0-flash-001 Google DeepMind,Google 82.2 61 4 Sep 2026
29 o1-preview OpenAI 81.6 4 Sep 2026
30 Mistral: Mistral Medium 3 Mistral 81.6 4 Sep 2026
31 gpt-4.5-preview OpenAI 78.6 54 4 Sep 2026
32 DeepSeek: DeepSeek V3 0324 DeepSeek 75.5 64 4 Sep 2026
33 Google: Gemma 3 27B 💡 Google 74.0 47 4 Sep 2026
34 Llama-4-Maverick-17B-128E-Instruct-FP8 Meta 73.0 4 Sep 2026
35 gemini-1.5-pro-002 Google 70.4 4 Sep 2026
36 OpenAI: GPT-4.1 Nano OpenAI 70.0 4 Sep 2026
37 Qwen: Qwen3 235B A22B 💡 Alibaba 68.9 4 Sep 2026
38 qwen-max Alibaba 67.2 4 Sep 2026
39 Qwen: Qwen-Plus 💡 Alibaba 65.3 4 Sep 2026
40 Microsoft: Phi 4 Microsoft 64.9 41 4 Sep 2026
41 DeepSeek: DeepSeek V3 DeepSeek 64.9 62 4 Sep 2026
42 grok-2-1212 xAI 63.5 45 4 Sep 2026
43 Qwen2.5 72B Instruct Alibaba 63.2 4 Sep 2026
44 Llama-4-Scout-17B-16E-Instruct Meta 62.3 4 Sep 2026
45 gemini-1.5-flash-002 Google 61.9 4 Sep 2026
46 claude-3-5-sonnet-20241022 Anthropic 56.9 45 4 Sep 2026
47 qwen-turbo Alibaba 56.2 4 Sep 2026
48 qwen2.5-32b-instruct Alibaba 56.1 4 Sep 2026
49 OpenAI: GPT-4o OpenAI 53.3 27 4 Sep 2026
50 OpenAI: GPT-4o-mini OpenAI 52.6 31 4 Sep 2026
51 claude-3-5-sonnet-20240620 Anthropic 51.7 4 Sep 2026
52 mistral-large-2411 Mistral 50.3 37 4 Sep 2026
53 Llama-3.1-405B-Instruct Meta 49.8 4 Sep 2026
54 mistral-small-2503 Mistral 46.8 33 4 Sep 2026
55 OpenAI: GPT-4 Turbo OpenAI 46.7 4 Sep 2026
56 claude-3-5-haiku-20241022 Anthropic 46.4 30 4 Sep 2026
57 Mistral Large 2407 Mistral 44.8 4 Sep 2026
58 mistral-small-2501 Mistral 44.8 31 4 Sep 2026
59 Llama-3.1-Tulu-3-70B-DPO Allen Institute for AI,University of Washington 42.7 4 Sep 2026
60 Meta: Llama 3.3 70B Instruct Meta 41.6 34 4 Sep 2026
61 gemini-1.5-pro-001 Google 40.7 4 Sep 2026
62 gpt-4-1106-preview OpenAI 40.0 4 Sep 2026
63 Llama-3.2-90B-Vision-Instruct Meta 39.4 4 Sep 2026
64 qwen2-72b-instruct Alibaba 39.1 4 Sep 2026
65 claude-3-opus-20240229 Anthropic 37.5 32 4 Sep 2026
66 Meta: Llama 3.1 70B Instruct Meta 36.7 4 Sep 2026
67 gpt-4-0125-preview OpenAI 35.4 4 Sep 2026
68 Google: Gemma 2 27B Google 27.9 21 4 Sep 2026
69 WizardLM-2 8x22B Microsoft 25.7 4 Sep 2026
70 Yi-1.5-34B-Chat 01.AI 25.5 4 Sep 2026
71 gemini-1.5-flash-001 Google 25.1 4 Sep 2026
72 mistral-large-2402 Mistral 24.5 4 Sep 2026
73 open-mixtral-8x22b Mistral 24.2 4 Sep 2026
74 gpt-4-0613 OpenAI 23.0 4 Sep 2026
75 Meta: Llama 3.1 8B Instruct Meta 22.9 4 Sep 2026
76 Hermes-2-Theta-Llama-3-70B Nous Research,Arcee AI 22.7 4 Sep 2026
77 Meta-Llama-3-70B-Instruct Meta 22.6 4 Sep 2026
78 gemma-2-9b-it Google 21.0 13 4 Sep 2026
79 claude-3-sonnet-20240229 Anthropic 18.2 4 Sep 2026
80 Phi-3-medium-128k-instruct Microsoft 17.6 4 Sep 2026
81 gpt-3.5-turbo-1106 OpenAI 15.9 4 Sep 2026
82 ministral-8b-2410 Mistral 14.9 4 Sep 2026
83 Anthropic: Claude 3 Haiku Anthropic 14.9 4 Sep 2026
84 ministral-3b-2410 Mistral 14.4 4 Sep 2026
85 claude-2.0 Anthropic 11.7 4 Sep 2026
86 dbrx-instruct Databricks 11.7 4 Sep 2026
87 gpt-3.5-turbo-0125 OpenAI 11.6 4 Sep 2026
88 gemini-1.0-pro-001 Google 11.2 4 Sep 2026
89 open-mistral-nemo-2407 Mistral 10.8 4 Sep 2026
90 open-mixtral-8x7b Mistral 10.0 4 Sep 2026
91 Mixtral-8x7B-Instruct-v0.1 Mistral 9.3 4 Sep 2026
92 deepseek-llm-67b-chat DeepSeek 6.4 4 Sep 2026
93 Meta-Llama-3-8B-Instruct Meta 6.1 4 Sep 2026
94 Yi-34B-Chat 01.AI 5.1 4 Sep 2026
95 open-mistral-7b Mistral 3.7 4 Sep 2026
96 Mistral-7B-Instruct-v0.3 Mistral 3.6 4 Sep 2026
97 Llama-2-70b-chat-hf Meta 3.3 4 Sep 2026
The Known Good
Provenance. These figures are published by Epoch AI and redistributed here under CC-BY 4.0. The publisher's own page is here. We did not run this evaluation and we do not adjust the published numbers — where a score feeds an index it is min-max normalised against every other model holding the same evaluation, and nothing else is done to it. This evaluation is one of the seven components of the Known Good Index. Full licence detail is on attribution, and every score here is in the CSV download.