Skip to content

Best for reasoning

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up.

Ranked by GPQA Diamond - graduate-level science questions written to be hard to look up. Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.

#ModelCapabilityReasoningCodingContext$/M
51Claude Sonnet 4.632k thinkingAnthropic · +2 variants—87.4———
52Grok 4xAI146.587.0———
53GPT-5.4 minixhighOpenAI · +2 variants—86.9———
54Qwen3.5 397B A17BAlibaba (Qwen)146.686.4—262K$1.29
55GPT-5OpenAI · +2 variants150.086.2—400K$3.44
56Claude Opus 4.532k thinkingAnthropic · +2 variants—86.0———
57Claude Fable 5Anthropic · +1 variant163.685.969.71M$20.00
58Qwen3.6 27BAlibaba (Qwen)146.585.9—262K$1.04
59Nemotron 3 UltraNVIDIA146.285.4—262K$1.05
60Gemini 2.5 Pro (Jun 2025)Google145.385.3———
61Gemini 2.5 Pro Preview (Jun 2025)Google—84.8———
62Qwen3.5 Plus 2026-02-15Alibaba (Qwen)—84.8—1M$0.58
63Qwen3.6 35B A3BAlibaba (Qwen)—84.8—262K$0.36
64Kimi K2 Thinking TurboMoonshot AI—84.2———
65Gemini 2.5 Pro Exp (Mar 2025)Google—83.8———
66Qwen3.5-35B-A3BAlibaba (Qwen)142.583.5—262K$0.45
67DeepSeek V3.2DeepSeek146.383.4—164K$0.32
68Gemini 3.5 Flash LiteGoogle145.183.3—1.05M$0.85
69GLM 4.7Z.ai (Zhipu AI)143.583.3—205K$1.00
70Qwen 3.6 Flash (2026-04-16)Alibaba (Qwen)—83.3———
71GPT-5.5 InstantOpenAI142.582.5———
72Qwen3.7 FlashAlibaba (Qwen)144.682.3—1M$0.055
73Claude Sonnet 4.559k thinkingAnthropic · +3 variants—82.3———
74Qwen3.5-FlashAlibaba (Qwen)—82.3—1M$0.11
75o3OpenAI · +2 variants146.981.8—200K$3.50
76Gemini 3.1 Flash LiteGoogle144.481.8—1.05M$0.56
77Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba (Qwen)143.980.1———
78Claude 3.7 Sonnet64k thinkingAnthropic · +3 variants—79.7———
79o4 MiniOpenAI145.679.6—200K$1.93
80Claude Sonnet 4Anthropic141.779.2—200K$6.00
81Qwen3.5-9BAlibaba (Qwen)139.479.0—262K$0.11
82GPT-5.4 NanoOpenAI · +2 variants145.878.5—400K$0.46
83o4-minimediumOpenAI · +1 variant—77.8———
84Claude Opus 4.1Anthropic144.177.3—200K$30.00
85o3 MiniOpenAI140.377.0—200K$1.93
86o1OpenAI · +2 variants141.976.8—200K$26.25
87DeepSeek-R1 (May 2025)DeepSeek141.376.3———
88Claude Opus 4Anthropic142.776.3———
89Grok-3 minixAI140.376.3———
90Gemma 4 31BGoogle142.775.8—262K$0.15
91gpt-oss-120bOpenAI139.975.8—131K$0.070
92Grok 3xAI138.375.8———
93GPT-5 MiniOpenAI · +2 variants145.575.0—400K$0.69
94o3-minimediumOpenAI—74.3———
95Gemma 4 26B A4BGoogle141.873.2—262K$0.14
96Qwen3-Max-InstructAlibaba (Qwen)—72.6———
97R1DeepSeek139.071.7—64K$1.15
98seed-oss-36b-instruct—71.5———
99Claude Haiku 4.5Anthropic142.471.2—200K$2.00
100Qwen3 235B A22BAlibaba (Qwen)139.470.7—131K$0.80
— means no published score from that source yet · click a model for every benchmark with its source

New - awaiting independent evaluation

All new models →

Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.

Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research