Skip to content

Best for math

Ranked by Epoch's mock AIME 2024-2025 (competition mathematics).

Ranked by Epoch's mock AIME 2024-2025 (competition mathematics). Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.

#ModelCapabilityReasoningCodingContext$/M
1GPT-6 AstraNEWOpenAI166.695.873.21.05M$20.00
2Claude Fable 5.1NEWAnthropic165.0——1M$20.00
3Claude Fable 5Anthropic · +1 variant163.685.969.71M$20.00
4GPT-5.6 SolOpenAI · +2 variants162.093.572.71.05M$4.00
5GPT-5.5xhighOpenAI · +2 variants—94.067.0——
6GPT-5.5 ProxhighOpenAI—93.9———
7Qwen3.8 Max (0902)NEWxhighAlibaba (Qwen)—92.3———
8GPT-5.6 TerraOpenAI · +2 variants159.393.369.61.05M$4.50
9Qwen3.8 MaxxhighAlibaba (Qwen)—92.757.5——
10Grok 4.6xhighxAI · +1 variant—93.266.7——
11Muse Spark 1.3NEWxhighMeta—————
12Claude Opus 5Anthropic · +1 variant162.793.973.61M$10.00
13Gemini 3.8 FlashNEWGoogle157.195.473.81.05M$1.50
14DeepSeek V4 Pro 0813DeepSeek155.491.7—1.05M$1.41
15Claude Opus 4.8Anthropic158.391.059.01M$10.00
16GPT-5.6 LunaOpenAI · +2 variants156.391.667.21.05M$0.45
17Claude Opus 4.7xhighAnthropic · +1 variant—90.2———
18GPT-5.4OpenAI · +4 variants156.989.9—1.05M$5.63
19Grok 4.5xAI154.093.453.8500K$3.00
20Gemini 3.7 FlashGoogle157.794.865.31.05M$1.50
21Kimi K3Moonshot AI · +1 variant157.793.168.51.05M$6.00
22DeepSeek v4 ProhighDeepSeek · +1 variant—90.9———
23GPT-5.2OpenAI · +4 variants153.488.2—400K$4.81
24Kimi K2.6Moonshot AI151.090.8—262K$1.34
25Gemini 3.1 Pro PreviewGoogle—94.411.71.05M$4.50
26Gemini 3.5 FlashGoogle154.692.837.41.05M$3.38
27Qwen3.7 MaxAlibaba (Qwen)153.790.9—1M$2.21
28Kimi K2.7 CodeMoonshot AI150.087.930.5262K$1.32
29Gemini 3 Flash PreviewGoogle—89.4—1.05M$1.13
30Claude Sonnet 5xhighAnthropic · +1 variant—90.549.7——
31DeepSeek V4 Flash 0731DeepSeek154.591.0—1.31M$0.093
32Claude Opus 4.664k thinkingAnthropic · +2 variants—88.8———
33Gemini 3.6 FlashGoogle154.494.146.71.05M$1.50
34GLM 5.3 FlashZ.ai (Zhipu AI)151.990.263.41.31M$0.24
35GLM 5.1Z.ai (Zhipu AI)149.989.9—205K$2.15
36Grok 4.3 BetaxAI149.188.8———
37Qwen3.7 PlusAlibaba (Qwen)147.487.9—1M$0.56
38Qwen 3.6 Plus (2026-04-02)Alibaba (Qwen)—88.4———
39Grok 4.20xAI152.089.3—2M$1.56
40Kimi K2.5 (Fireworks)Moonshot AI—87.6———
41GPT-5OpenAI · +2 variants150.086.2—400K$3.44
42Gemini 3 Pro PreviewGoogle—92.6———
43GLM 5.3Z.ai (Zhipu AI)155.690.969.01.31M$2.15
44Qwen 3.6 Max (Preview)Alibaba (Qwen)149.387.4———
45Qwen3.6 27BAlibaba (Qwen)146.585.9—262K$1.04
46Inkling SmallxhighThinking Machines Lab—88.5———
47Muse SparkMeta152.189.8———
48Qwen3.5 397B A17BAlibaba (Qwen)146.686.4—262K$1.29
49gpt-oss-120bOpenAI139.975.8—131K$0.070
50GPT-5.4 minixhighOpenAI · +2 variants—86.9———
— means no published score from that source yet · click a model for every benchmark with its source

New - awaiting independent evaluation

All new models →

Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.

Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research