MATH Level 5
Hardest tier of the MATH dataset. Aggregated from Epoch AI's AI Benchmarking Hub (math_level_5.csv, column 'mean_score'), used under CC-BY 4.0. The Known Good aggregates published results; it runs no evaluations.
101 models scored
Higher is better
Published by Epoch AI
CC-BY 4.0
MATH Level 5
MATH Level 5 as measured and published by Epoch AI (CC-BY 4.0). Ingested, normalised only where it feeds an index, and never re-run by us. Higher is better.
16 of 101 models ▾
☰⚙⇩
+Add model from specific provider
💡 Reasoning models are indicated by a lightbulb
The Known Good
Every model we hold a MATH Level 5 score for
101 of 101 models
| # | Model | Creator | MATH Level 5 | Known Good Index | Measured |
|---|---|---|---|---|---|
| 1 |
|
OpenAI | 98.1 | 73 | 25 Jul 2026 |
| 2 |
|
OpenAI | 97.8 | 60 | 25 Jul 2026 |
| 3 |
|
OpenAI | 97.8 | — | 25 Jul 2026 |
| 4 |
|
OpenAI | 97.8 | 67 | 25 Jul 2026 |
| 5 |
|
Anthropic | 97.7 | 59 | 25 Jul 2026 |
| 6 |
|
Alibaba | 97.1 | — | 25 Jul 2026 |
| 7 |
|
DeepSeek | 96.6 | — | 25 Jul 2026 |
| 8 |
|
DeepSeek | 96.6 | — | 25 Jul 2026 |
| 9 |
|
OpenAI | 96.5 | 82 | 25 Jul 2026 |
| 10 |
|
Anthropic | 96.4 | 56 | 25 Jul 2026 |
| 11 |
|
95.9 | — | 25 Jul 2026 | |
| 12 |
|
95.6 | — | 25 Jul 2026 | |
| 13 |
|
OpenAI | 95.2 | 57 | 25 Jul 2026 |
| 14 |
|
OpenAI | 94.7 | 63 | 25 Jul 2026 |
| 15 |
|
DeepSeek | 93.1 | 68 | 25 Jul 2026 |
| 16 |
|
DeepSeek | 93.1 | 68 | 25 Jul 2026 |
| 17 |
|
Anthropic | 91.2 | — | 25 Jul 2026 |
| 18 |
|
xAI | 90.9 | — | 25 Jul 2026 |
| 19 |
|
Anthropic | 90.0 | 70 | 25 Jul 2026 |
| 20 |
|
DeepSeek | 89.9 | 52 | 25 Jul 2026 |
| 21 |
|
OpenAI | 89.2 | 56 | 25 Jul 2026 |
| 22 |
|
xAI | 88.7 | — | 25 Jul 2026 |
| 23 |
|
OpenAI | 87.3 | — | 25 Jul 2026 |
| 24 |
|
DeepSeek | 87.1 | — | 25 Jul 2026 |
| 25 |
|
Anthropic | 86.3 | — | 25 Jul 2026 |
| 26 |
|
Anthropic | 85.0 | 62 | 25 Jul 2026 |
| 27 |
|
Anthropic | 84.4 | — | 25 Jul 2026 |
| 28 |
|
83.5 | — | 25 Jul 2026 | |
| 29 |
|
OpenAI | 83.0 | 36 | 25 Jul 2026 |
| 30 | GD gemini-2.0-flash-001 | Google DeepMind,Google | 82.2 | 53 | 25 Jul 2026 |
| 31 |
|
OpenAI | 81.6 | — | 25 Jul 2026 |
| 32 |
|
Mistral | 81.6 | — | 25 Jul 2026 |
| 33 |
|
OpenAI | 78.6 | 47 | 25 Jul 2026 |
| 34 |
|
DeepSeek | 75.5 | 60 | 25 Jul 2026 |
| 35 |
|
74.0 | 37 | 25 Jul 2026 | |
| 36 |
|
74.0 | 37 | 25 Jul 2026 | |
| 37 |
|
Meta | 73.0 | — | 25 Jul 2026 |
| 38 |
|
70.4 | — | 25 Jul 2026 | |
| 39 |
|
OpenAI | 70.0 | — | 25 Jul 2026 |
| 40 |
|
Alibaba | 68.9 | — | 25 Jul 2026 |
| 41 |
|
Alibaba | 67.2 | — | 25 Jul 2026 |
| 42 |
|
Alibaba | 65.3 | — | 25 Jul 2026 |
| 43 |
|
Microsoft | 64.9 | 33 | 25 Jul 2026 |
| 44 |
|
DeepSeek | 64.9 | 44 | 25 Jul 2026 |
| 45 |
|
xAI | 63.5 | 38 | 25 Jul 2026 |
| 46 |
|
Alibaba | 63.2 | — | 25 Jul 2026 |
| 47 |
|
Meta | 62.3 | — | 25 Jul 2026 |
| 48 |
|
61.9 | — | 25 Jul 2026 | |
| 49 |
|
Anthropic | 56.9 | 40 | 25 Jul 2026 |
| 50 |
|
Alibaba | 56.2 | — | 25 Jul 2026 |
| 51 |
|
Alibaba | 56.1 | — | 25 Jul 2026 |
| 52 |
|
OpenAI | 53.3 | 21 | 25 Jul 2026 |
| 53 |
|
OpenAI | 52.6 | 23 | 25 Jul 2026 |
| 54 |
|
Anthropic | 51.7 | — | 25 Jul 2026 |
| 55 |
|
Mistral | 50.3 | 33 | 25 Jul 2026 |
| 56 |
|
Meta | 49.8 | — | 25 Jul 2026 |
| 57 |
|
Mistral | 46.8 | 28 | 25 Jul 2026 |
| 58 |
|
OpenAI | 46.7 | — | 25 Jul 2026 |
| 59 |
|
Anthropic | 46.4 | 23 | 25 Jul 2026 |
| 60 |
|
Mistral | 44.8 | — | 25 Jul 2026 |
| 61 |
|
Mistral | 44.8 | 26 | 25 Jul 2026 |
| 62 | AI Llama-3.1-Tulu-3-70B-DPO | Allen Institute for AI,University of Washington | 42.7 | — | 25 Jul 2026 |
| 63 |
|
Meta | 41.6 | 31 | 25 Jul 2026 |
| 64 |
|
40.7 | — | 25 Jul 2026 | |
| 65 |
|
OpenAI | 40.0 | — | 25 Jul 2026 |
| 66 |
|
Meta | 39.4 | — | 25 Jul 2026 |
| 67 |
|
Alibaba | 39.1 | — | 25 Jul 2026 |
| 68 |
|
Anthropic | 37.5 | 30 | 25 Jul 2026 |
| 69 |
|
Meta | 36.7 | — | 25 Jul 2026 |
| 70 |
|
OpenAI | 35.4 | — | 25 Jul 2026 |
| 71 |
|
27.9 | 19 | 25 Jul 2026 | |
| 72 |
|
27.9 | 19 | 25 Jul 2026 | |
| 73 |
|
Microsoft | 25.7 | — | 25 Jul 2026 |
| 74 | 0A Yi-1.5-34B-Chat | 01.AI | 25.5 | — | 25 Jul 2026 |
| 75 |
|
25.1 | — | 25 Jul 2026 | |
| 76 |
|
Mistral | 24.5 | — | 25 Jul 2026 |
| 77 |
|
Mistral | 24.2 | — | 25 Jul 2026 |
| 78 |
|
OpenAI | 23.0 | — | 25 Jul 2026 |
| 79 |
|
Meta | 22.9 | — | 25 Jul 2026 |
| 80 | NR Hermes-2-Theta-Llama-3-70B | Nous Research,Arcee AI | 22.7 | — | 25 Jul 2026 |
| 81 |
|
Meta | 22.6 | — | 25 Jul 2026 |
| 82 |
|
21.0 | 10 | 25 Jul 2026 | |
| 83 |
|
Anthropic | 18.2 | — | 25 Jul 2026 |
| 84 |
|
Microsoft | 17.6 | — | 25 Jul 2026 |
| 85 |
|
OpenAI | 15.9 | — | 25 Jul 2026 |
| 86 |
|
Mistral | 14.9 | — | 25 Jul 2026 |
| 87 |
|
Anthropic | 14.9 | — | 25 Jul 2026 |
| 88 |
|
Mistral | 14.4 | — | 25 Jul 2026 |
| 89 |
|
Anthropic | 11.7 | — | 25 Jul 2026 |
| 90 | Da dbrx-instruct | Databricks | 11.7 | — | 25 Jul 2026 |
| 91 |
|
OpenAI | 11.6 | — | 25 Jul 2026 |
| 92 |
|
11.2 | — | 25 Jul 2026 | |
| 93 |
|
Mistral | 10.8 | — | 25 Jul 2026 |
| 94 |
|
Mistral | 10.0 | — | 25 Jul 2026 |
| 95 |
|
Mistral | 9.3 | — | 25 Jul 2026 |
| 96 |
|
DeepSeek | 6.4 | — | 25 Jul 2026 |
| 97 |
|
Meta | 6.1 | — | 25 Jul 2026 |
| 98 | 0A Yi-34B-Chat | 01.AI | 5.1 | — | 25 Jul 2026 |
| 99 |
|
Mistral | 3.7 | — | 25 Jul 2026 |
| 100 |
|
Mistral | 3.6 | — | 25 Jul 2026 |
| 101 |
|
Meta | 3.3 | — | 25 Jul 2026 |
The Known Good
Provenance. These figures are published by Epoch AI and redistributed here under CC-BY 4.0.
The publisher's own page is here. We did not run this evaluation and we do not adjust the published numbers — where a score feeds an index it is
min-max normalised against every other model holding the same evaluation, and nothing else is done to it.
Full licence detail is on attribution, and every score here is
in the CSV download.