| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | GPT-5 (medium) OpenAI | 97.2% | medium | 7 Aug 2025 | — | Source ↗ | |
| 2 | o3 Pro OpenAI | 97.2% | medium | 10 Jun 2025 | — | Source ↗ | |
| 3 | Grok 4 Fast xAI | 94.4% | — | 19 Sep 2025 | — | Source ↗ | |
| 4 | Grok 4 xAI | 94.4% | — | 9 Jul 2025 | — | Source ↗ | |
| 5 | Gemini 2.5 Pro Preview (Jun 2025) Google DeepMind | 91.7% | — | 5 Jun 2025 | — | Source ↗ | |
| 6 | o3 (medium) OpenAI | 88.9% | medium | 16 Apr 2025 | — | Source ↗ | |
| 7 | Kimi K2.5 Open source MoonshotAI | 86.1% | — | 27 Jan 2026 | — | Source ↗ | |
| 8 | DeepSeek V3.2 Exp Open source DeepSeek | 83.3% | high | 29 Sep 2025 | — | Source ↗ | |
| 9 | QwQ-32B Open source Alibaba | 83.3% | — | 5 Mar 2025 | — | Source ↗ | |
| 10 | Claude 3.7 Sonnet (8k thinking) Anthropic | 83.3% | 8K | 24 Feb 2025 | — | Source ↗ | |
| 11 | o1 (medium) OpenAI | 83.3% | medium | 17 Dec 2024 | — | Source ↗ | |
| 12 | Gemini 2.5 Flash (May 2025) Google DeepMind | 77.8% | — | 20 May 2025 | — | Source ↗ | |
| 13 | o4-mini (medium) OpenAI | 77.8% | medium | 16 Apr 2025 | — | Source ↗ | |
| 14 | Qwen3-235B-A22B-Thinking (Jul 2025) Open source Alibaba | 75.0% | — | 25 Jul 2025 | — | Source ↗ | |
| 15 | DeepSeek-R1 (May 2025) Open source DeepSeek | 75.0% | — | 28 May 2025 | — | Source ↗ | |
| 16 | Qwen3 32B Open source Qwen | 74.2% | — | 29 Apr 2025 | — | Source ↗ | |
| 17 | GPT-5 mini (medium) OpenAI | 69.4% | medium | 7 Aug 2025 | — | Source ↗ | |
| 18 | MiniMax-M1-80k Open source MiniMax | 69.4% | — | 13 Jun 2025 | — | Source ↗ | |
| 19 | R1 Open source DeepSeek | 69.4% | — | 20 Jan 2025 | — | Source ↗ | |
| 20 | Qwen3 235B A22B Open source Qwen | 67.7% | — | 28 Apr 2025 | — | Source ↗ | |
| 21 | Qwen3-Max-Instruct Alibaba | 66.7% | — | 24 Sep 2025 | — | Source ↗ | |
| 22 | Kimi K2 Instruct (0905) Open source Moonshot | 66.7% | — | 5 Sep 2025 | — | Source ↗ | |
| 23 | Grok-3 mini xAI | 66.7% | medium | 24 Jun 2025 | — | Source ↗ | |
| 24 | Gemini 2.5 Pro Preview (Mar 2025) Google DeepMind | 66.7% | — | 31 Mar 2025 | — | Source ↗ | |
| 25 | Gemini 2.5 Pro Exp (Mar 2025) Google DeepMind | 66.7% | — | 25 Mar 2025 | — | Source ↗ | |
| 26 | GPT-4o (Jan 2025) OpenAI | 66.7% | — | 29 Jan 2025 | — | Source ↗ | |
| 27 | Qwen2.5-Max Alibaba | 66.7% | — | 25 Jan 2025 | — | Source ↗ | |
| 28 | GPT-4.1 OpenAI | 63.9% | — | 14 Apr 2025 | — | Source ↗ | |
| 29 | GPT-4.5 Preview (Feb 2025) OpenAI | 63.9% | — | 27 Feb 2025 | — | Source ↗ | |
| 30 | Qwen3 14B Open source Qwen | 62.5% | — | 29 Apr 2025 | — | Source ↗ | |
| 31 | Qwen3 8B Open source Qwen | 62.1% | — | 28 Apr 2025 | — | Source ↗ | |
| 32 | Kimi K2 Instruct Open source Moonshot | 61.1% | — | 12 Jul 2025 | — | Source ↗ | |
| 33 | Claude Opus 4 Anthropic | 61.1% | — | 22 May 2025 | — | Source ↗ | |
| 34 | Gemini 2.0 Flash (Feb 2025) Google DeepMind,Google | 61.1% | — | 5 Feb 2025 | — | Source ↗ | |
| 35 | chutes/GLM-4.5-FP8 | 58.3% | — | 27 Jul 2025 | — | Source ↗ | |
| 36 | Grok 3 xAI | 58.3% | — | 9 Apr 2025 | — | Source ↗ | |
| 37 | Qwen3 Next 80B A3B Instruct Open source Qwen | 55.6% | — | 11 Sep 2025 | — | Source ↗ | |
| 38 | Qwen3-235B-A22B-Instruct (Jul 2025) Open source Alibaba | 52.9% | — | 25 Jul 2025 | — | Source ↗ | |
| 39 | DeepSeek V3.1 Open source DeepSeek | 52.8% | — | 21 Aug 2025 | — | Source ↗ | |
| 40 | Gemini 2.0 Flash Thinking Exp Google DeepMind,Google | 52.8% | — | 21 Jan 2025 | — | Source ↗ | |
| 41 | DeepSeek-V3 (Mar 2025) Open source DeepSeek | 50.0% | — | 24 Mar 2025 | — | Source ↗ | |
| 42 | Claude 3.7 Sonnet Anthropic | 50.0% | — | 24 Feb 2025 | — | Source ↗ | |
| 43 | o3-mini (medium) OpenAI | 50.0% | medium | 31 Jan 2025 | — | Source ↗ | |
| 44 | gemini-2.5-flash-lite-preview-06-17 (Default thinking length) Google DeepMind | 47.2% | — | 17 Jun 2025 | — | Source ↗ | |
| 45 | Gemini 2.5 Flash Preview (Apr 2025) Google DeepMind | 47.2% | — | 17 Apr 2025 | — | Source ↗ | |
| 46 | Claude Sonnet 4 Anthropic | 46.9% | — | 22 May 2025 | — | Source ↗ | |
| 47 | Llama 4 Maverick Open source Meta | 46.2% | — | 6 Apr 2025 | — | Source ↗ | |
| 48 | GPT-5 nano (medium) OpenAI | 44.4% | medium | 7 Aug 2025 | — | Source ↗ | |
| 49 | gpt-oss-120b Open source OpenAI | 44.4% | high | 5 Aug 2025 | — | Source ↗ | |
| 50 | GPT-4.1 Mini OpenAI | 44.4% | — | 14 Apr 2025 | — | Source ↗ | |
| 51 | Gemini 2.0 Pro Exp (Feb 2025) Google DeepMind | 41.7% | — | 5 Feb 2025 | — | Source ↗ | |
| 52 | Qwen3 30B A3B Open source Qwen | 40.6% | — | 29 Apr 2025 | — | Source ↗ | |
| 53 | Llama 4 Scout Open source Meta | 36.0% | — | 5 Apr 2025 | — | Source ↗ | |
| 54 | Gemma 3 27B Open source Google | 33.3% | — | 12 Mar 2025 | — | Source ↗ | |
| 55 | Llama 3.3 70B Open source Meta AI | 33.3% | — | 6 Dec 2024 | — | Source ↗ | |
| 56 | nvidia-nemotron-nano-9b-v2 | 25.0% | — | 18 Aug 2025 | — | Source ↗ | |
| 57 | GPT-4.1 Nano OpenAI | 25.0% | — | 14 Apr 2025 | — | Source ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.