Skip to content

Best for reasoning

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up.

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up. Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.

#ModelCapabilityReasoningCodingContext$/M
1GPT-6 AstraNEWOpenAI166.695.873.21.05M$20.00
2Claude Sonnet 5.5NEWAnthropic—95.6—1M$4.00
3Gemini 3.8 FlashNEWGoogle157.195.473.81.05M$1.50
4Gemini 3.7 FlashGoogle157.794.865.31.05M$1.50
5GPT-5.4 ProxhighOpenAI—94.6———
6Gemini 3.1 Pro PreviewGoogle—94.411.71.05M$4.50
7Gemini 3.6 FlashGoogle154.494.146.71.05M$1.50
8Grok 4.6xAI · +1 variant156.594.065.2500K$3.00
9GPT-5.5xhighOpenAI · +2 variants—94.067.0——
10GPT-5.5 ProxhighOpenAI—93.9———
11Claude Opus 5Anthropic · +1 variant162.793.973.61M$10.00
12GPT-5.6 SolOpenAI · +2 variants162.093.572.71.05M$4.00
13Grok 4.5xAI154.093.453.8500K$3.00
14GPT-5.6 TerraOpenAI · +2 variants159.393.369.61.05M$4.50
15GPT-5.4xhighOpenAI · +4 variants—93.351.8——
16Kimi K3Moonshot AI · +1 variant157.793.168.51.05M$6.00
17Gemini 3.5 FlashGoogle154.692.837.41.05M$3.38
18Qwen3.8 MaxxhighAlibaba (Qwen)—92.757.5——
19Gemini 3 Pro PreviewGoogle—92.6———
20Qwen3.8 Max (0902)NEWxhighAlibaba (Qwen)—92.3———
21GLM 5.2Z.ai (Zhipu AI)151.891.943.81.05M$1.30
22DeepSeek V4 Pro 0813DeepSeek155.491.7—1.05M$0.99
23GPT-5.6 LunaOpenAI · +2 variants156.391.667.21.05M$0.45
24GPT-5.2xhighOpenAI · +4 variants—91.4———
25Claude Opus 4.8Anthropic158.391.059.01M$10.00
26DeepSeek V4 Flash 0731DeepSeek154.591.0—1.05M$0.33
27GLM 5.3Z.ai (Zhipu AI)155.690.969.01.05M$2.15
28Qwen3.7 MaxAlibaba (Qwen)153.790.9—1M$2.21
29MiniMax M3MiniMax147.090.9—1.05M$0.53
30DeepSeek v4 ProhighDeepSeek · +1 variant—90.9———
31Kimi K2.6Moonshot AI151.090.8—262K$1.34
32Claude Opus 5.5NEWAnthropic—90.6—1M$8.00
33Claude Opus 4.632k thinkingAnthropic · +2 variants—90.5———
34Claude Sonnet 5xhighAnthropic · +1 variant—90.549.7——
35GLM 5.3 FlashZ.ai (Zhipu AI)151.990.263.41.05M$0.24
36Claude Opus 4.7xhighAnthropic · +1 variant—90.2———
37GLM 5.1Z.ai (Zhipu AI)149.989.9—205K$1.48
38Muse SparkMeta152.189.8———
39Gemini 3 Flash PreviewGoogle—89.4—1.05M$1.13
40Grok 4.20xAI152.089.3—2M$1.56
41Grok 4.3 BetaxAI149.188.8———
42Inkling SmallxhighThinking Machines Lab—88.5———
43Qwen 3.6 Plus (2026-04-02)Alibaba (Qwen)—88.4———
44InklingxhighThinking Machines Lab—88.3———
45Kimi K2.7 CodeMoonshot AI150.087.930.5262K$1.34
46Qwen3.7 PlusAlibaba (Qwen)147.487.9—1M$0.56
47GLM 5Z.ai (Zhipu AI)145.887.8—205K$0.93
48GPT-5.1OpenAI · +2 variants149.787.6—400K$3.44
49Kimi K2.5 (Fireworks)Moonshot AI—87.6———
50Qwen 3.6 Max (Preview)Alibaba (Qwen)149.387.4———
— means no published score from that source yet · click a model for every benchmark with its source

New - awaiting independent evaluation

All new models →

Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.

Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research