Skip to content

Best for math

Ranked by Epoch's mock AIME 2024-2025 (competition mathematics).

Ranked by Epoch's mock AIME 2024-2025 (competition mathematics). Source: Epoch AI. Variants (reasoning effort, batch) are folded into one row.

#ModelCapabilityReasoningCodingContext$/M
51gpt-oss-120bOpenAI139.975.8—131K$0.070
52GPT-5.4 minixhighOpenAI · +2 variants—86.9———
53InklingxhighThinking Machines Lab—88.3———
54GPT-5.1OpenAI · +3 variants149.787.6—400K$3.44
55DeepSeek V3.2DeepSeek146.383.4—164K$0.32
56GPT-5.4 NanoOpenAI · +2 variants145.878.5—400K$0.46
57Nemotron 3 UltraNVIDIA146.285.4—262K$1.05
58GPT-5 MiniOpenAI · +2 variants145.575.0—400K$0.69
59Qwen3.7 FlashAlibaba (Qwen)144.682.3—1M$0.055
60Qwen3-235B-A22B-Thinking (Jul 2025)Alibaba (Qwen)143.980.1———
61Qwen3.5 Plus 2026-02-15Alibaba (Qwen)—84.8—1M$0.58
62Qwen3.6 35B A3BAlibaba (Qwen)—84.8—262K$0.36
63GLM 5.2Z.ai (Zhipu AI)151.891.943.81.05M$1.30
64Claude Opus 4.532k thinkingAnthropic · +2 variants—86.0———
65Claude Sonnet 4.632k thinkingAnthropic · +2 variants—87.4———
66Gemini 2.5 Pro (Jun 2025)Google145.385.3———
67o3mediumOpenAI · +2 variants—80.8———
68Qwen 3.6 Flash (2026-04-16)Alibaba (Qwen)—83.3———
69Qwen3.5-FlashAlibaba (Qwen)—82.3—1M$0.11
70Grok 4xAI146.587.0———
71GLM 4.7Z.ai (Zhipu AI)143.583.3—205K$1.00
72Kimi K2 Thinking TurboMoonshot AI—84.2———
73Gemma 4 26B A4BGoogle141.873.2—262K$0.14
74o4 MiniOpenAI145.679.6—200K$1.93
75GPT-5 NanoOpenAI · +3 variants139.469.4—400K$0.14
76GLM 5Z.ai (Zhipu AI)145.887.8—205K$0.93
77Gemini 3.1 Flash LiteGoogle144.481.8—1.05M$0.56
78Grok-3 minixAI140.376.3———
79Claude Sonnet 4.559k thinkingAnthropic · +3 variants—82.3———
80o3 MiniOpenAI140.377.0—200K$1.93
81Gemma 4 31BGoogle142.775.8—262K$0.15
82o1OpenAI · +2 variants141.976.8—200K$26.25
83o4-minimediumOpenAI · +1 variant—77.8———
84Qwen3-Max-InstructAlibaba (Qwen)—72.6———
85Gemini 2.5 Flash Preview (Apr 2025)Google—————
86MiniMax M3MiniMax147.090.9—1.05M$0.53
87Gemini 3.5 Flash LiteGoogle145.183.3—1.05M$0.85
88Claude Sonnet 4Anthropic141.779.2—200K$6.00
89Gemini 2.5 Flash (May 2025)Google141.5————
90Qwen3-30B-A3B-Thinking (Jul 2025)Alibaba (Qwen)139.670.1———
91Qwen3.5-35B-A3BAlibaba (Qwen)142.583.5—262K$0.45
92Claude Opus 4.1Anthropic144.177.3—200K$30.00
93GPT-5.5 InstantOpenAI142.582.5———
94seed-oss-36b-instruct—71.5———
95Qwen3 32BAlibaba (Qwen)138.565.7—131K$0.13
96Claude Haiku 4.5Anthropic142.471.2—200K$2.00
97DeepSeek-R1 (May 2025)DeepSeek141.376.3———
98Qwen3 14BAlibaba (Qwen)138.263.8—131K$0.15
99gpt-oss-20bOpenAI137.860.8—131K$0.036
100Claude Opus 4Anthropic142.776.3———
— means no published score from that source yet · click a model for every benchmark with its source

New - awaiting independent evaluation

All new models →

Not ranked until an independent evaluator (Epoch AI) publishes scores. We don't use vendor-reported benchmark claims for rankings.

Best AI for coding →
Models ranked on DeepSWE
Best AI for reasoning →
Ranked on GPQA Diamond
Best AI for math →
Ranked on competition math
Best open-weight models →
Weights you can run yourself
Cheapest capable models →
Lowest blended API price
Best AI coding tools →
Apps & agents by popularity
Best AI image generators →
Apps & models
Best AI for research →
Answer engines & deep research