Skip to content
knowledge benchmark · included in ECI

MMLU

MMLU benchmark (score column: EM).
Results
119
Random baseline
25.0%
Score ceiling
100%
Released
7 Sep 2020

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-4o (Nov 2024)
OpenAI
88.1%Source ↗
2Claude 3.5 Sonnet (Oct 2024)
Anthropic
87.3%Source ↗
3DeepSeek V3 Open source
DeepSeek
87.2%Source ↗
4Gemini 1.5 Pro (Sept 2024)
Google DeepMind
86.9%Source ↗
5Claude 3.5 Sonnet (Jun 2024)
Anthropic
86.5%Source ↗
6GPT-4 (Mar 2023)
OpenAI
86.4%Source ↗
7Llama 3.3 70B Open source
Meta AI
86.3%Source ↗
8Gemini 1.5 Pro (May 2024)
Google DeepMind
85.9%Source ↗
9Qwen2.5-72B Open source
Alibaba
85.3%Source ↗
10Phi 4 Open source
Microsoft
84.8%Source ↗
11Claude 3 Opus
Anthropic
84.6%Source ↗
12Llama 3.1-405B Open source
Meta AI
84.5%Source ↗
13GPT-4o (Aug 2024)
OpenAI
84.3%Source ↗
14GPT-4o (May 2024)
OpenAI
84.2%Source ↗
15Gemini 1.5 Pro (Feb 2024)
Google DeepMind
82.7%Source ↗
16Qwen2-72B Open source
Alibaba
82.4%Source ↗
17GPT-4 (Jun 2023)
OpenAI
82.4%Source ↗
18Amazon Nova Pro
Amazon
82.0%Source ↗
19GPT-4o-mini
OpenAI
81.8%Source ↗
20GPT-4 Turbo (Apr 2024)
OpenAI
81.3%Source ↗
21Llama 3.2 90B Open source
Meta AI
80.3%Source ↗
22Llama 3.1-70B Open source
Meta AI
80.1%Source ↗
23Mistral Large 2 (Jul 2024) Open source
Mistral AI
80.0%Source ↗
24Qwen2.5-14B Open source
Alibaba
79.9%Source ↗
25Gemini 2.0 Flash (Dec 2024)
Google DeepMind,Google
79.7%Source ↗
26GPT-4 Turbo (Nov 2023)
OpenAI
79.6%Source ↗
27Yi-Large
01.AI
79.3%Source ↗
28Llama 3-70B Open source
Meta AI
79.3%Source ↗
29Qwen2.5-Coder-32B Open source
Alibaba
79.1%Source ↗
30Claude 2
Anthropic
78.5%Source ↗
31DeepSeek-V2 (MoE-236B, May 2024) Open source
DeepSeek
78.4%Source ↗
32phi-3-medium 14B Open source
Microsoft
78.0%Source ↗
33Gemini 1.5 Flash (May 2024)
Google DeepMind
77.9%Source ↗
34Mixtral 8x22B Open source
Mistral AI
77.8%Source ↗
35Amazon Nova Lite
Amazon
77.0%Source ↗
36Claude 1.3
Anthropic
77.0%Source ↗
37Yi-34B Open source
01.AI
76.3%Source ↗
38Claude 3 Sonnet
Anthropic
75.9%Source ↗
39Gemma 2 27B Open source
Google
75.7%Source ↗
40phi-3-small 7.4B Open source
Microsoft
75.7%Source ↗
41Qwen2.5-Coder-14B
75.2%Source ↗
42Qwen1.5-32B Open source
Alibaba
74.4%Source ↗
43Claude 3.5 Haiku (Oct 2024)
Anthropic
74.3%Source ↗
44Gemini 1.5 Flash (Sep 2024)
Google DeepMind
73.9%Source ↗
45Claude 3 Haiku
Anthropic
73.8%Source ↗
46Claude 2.1
Anthropic
73.5%Source ↗
47Claude Instant
Anthropic
73.4%Source ↗
48Qwen2.5-7B Open source
Alibaba
72.9%Source ↗
49Inflection-1
Inflection AI
72.7%Source ↗
50Gemma 2 9B Open source
Google DeepMind
72.1%Source ↗
51GPT-3.5 Turbo (Nov 2023)
OpenAI
71.4%Source ↗
52Amazon Nova Micro
Amazon
70.8%Source ↗
53Mixtral 8x7B Open source
Mistral AI
70.6%Source ↗
54Falcon-180B Open source
Technology Innovation Institute
70.6%Source ↗
55Gemini 1.0 Pro
Google DeepMind
70.0%Source ↗
56Llama 2-70B Open source
Meta AI
69.9%Source ↗
57Command R+ Open source
Cohere,Cohere Labs (formerly Cohere for AI)
69.4%Source ↗
58GPT-3.5 Turbo (June 2023)
OpenAI
68.9%Source ↗
59phi-3-mini 3.8B Open source
Microsoft
68.8%Source ↗
60Llama 3-8B Open source
Meta AI
68.8%Source ↗
61Mistral Large
mistralai
68.8%Source ↗
62mistral-small-2402
68.7%Source ↗
63Qwen1.5-14B Open source
Alibaba
68.6%Source ↗
64Stable Beluga 2 Open source
Stability AI
68.6%Source ↗
65Yi-9B
68.4%Source ↗
66Qwen2.5-Coder (7B) Open source
Alibaba
68.0%Source ↗
67GPT-3.5 Turbo (Jan 2024)
OpenAI
67.3%Source ↗
68Qwen-14B Open source
Alibaba
66.3%Source ↗
69Gemma 7B Open source
Google DeepMind
66.1%Source ↗
70c4ai-command-r-08-2024
65.2%Source ↗
71StarCoder 2 15B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
64.1%Source ↗
72Yi 6B Open source
01.AI
64.0%Source ↗
73LLaMA-65B Open source
Meta AI
63.4%Source ↗
74Qwen1.5-7B Open source
Alibaba
62.6%Source ↗
75Llama 2-34B
Meta AI
62.6%Source ↗
76Mistral 7B v0.2 Open source
Mistral AI
62.5%Source ↗
77Mistral 7B v0.1 Open source
Mistral AI
62.5%Source ↗
78DeepSeek-Coder-V2-Lite-Base
60.5%Source ↗
79Mistral 7B v0.3 Open source
Mistral AI
59.9%Source ↗
80Baichuan2-13B Open source
Baichuan
59.2%Source ↗
81Nemotron-4 15B
NVIDIA
58.7%Source ↗
82LLaMA-33B Open source
Meta AI
58.7%Source ↗
83Falcon 2 11B Open source
Technology Innovation Institute
58.4%Source ↗
84Phi-2 Open source
Microsoft
58.4%Source ↗
85internlm-chat-20b
57.4%Source ↗
86Falcon-40B Open source
Technology Innovation Institute
56.9%Source ↗
87Llama 3.2 11B Open source
Meta AI
56.5%Source ↗
88Llama 3.1-8B Open source
Meta AI
56.1%Source ↗
89Llama 2-13B Open source
Meta AI
55.6%Source ↗
90Baichuan2-13B-Chat
55.1%Source ↗
91Baichuan 2-7B Open source
Baichuan
54.2%Source ↗
92Qwen2.5-Coder (1.5B) Open source
Alibaba
53.6%Source ↗
93Baichuan 1-13B Open source
Baichuan
51.6%Source ↗
94internlm-7b
51.0%Source ↗
95INTELLECT-1
Prime Intellect,Hugging Face,Arcee AI
49.9%Source ↗
96chatglm2-6b
47.9%Source ↗
97MPT-30B Open source
MosaicML
47.9%Source ↗
98LLaMA-13B Open source
Meta AI
47.7%Source ↗
99Llama 2-7B Open source
Meta AI
45.8%Source ↗
100Qwen-7B Open source
Alibaba
45.0%Source ↗
101Gemma 2B Open source
Google DeepMind
42.3%Source ↗
102Baichuan1-7B Open source
Baichuan
42.3%Source ↗
103Qwen2.5-Coder-0.5B
42.0%Source ↗
104CodeQwen1.5-7B
40.5%Source ↗
105DeepSeek Coder 33B Open source
DeepSeek,Peking University
39.4%Source ↗
106StarCoder 2 7B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
38.8%Source ↗
107Phi-1.5 Open source
Microsoft
37.6%Source ↗
108StarCoder 2 3B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
36.6%Source ↗
109DeepSeek Coder 6.7B Open source
DeepSeek,Peking University
36.4%Source ↗
110XGen-7B Open source
Salesforce
36.3%Source ↗
111LLaMA-7B Open source
Meta AI
35.6%Source ↗
112Falcon-7B Open source
Technology Innovation Institute
35.0%Source ↗
113MPT-7B Open source
MosaicML
30.8%Source ↗
114open_llama_7b
29.9%Source ↗
115Qwen-1_8B
28.2%Source ↗
116RedPajama-INCITE-7B-Base
26.3%Source ↗
117Dolly 2.0-12b Open source
Databricks
26.2%Source ↗
118Cerebras-GPT-13B Open source
Cerebras Systems
26.2%Source ↗
119DeepSeek Coder 1.3B Open source
DeepSeek,Peking University
25.8%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.