Skip to content
knowledge benchmark · included in ECI

MMLU

MMLU benchmark (score column: EM).
Results
68
Random baseline
25.0%
Score ceiling
100%
Released
7 Sep 2020

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek V3 Open source
DeepSeek
87.2%Stanford CRFM Leaderboard ↗
2Llama 3.3 70B Open source
Meta AI
86.3%Phi-4 Technical Report ↗
3Qwen2.5-72B Open source
Alibaba
85.3%Phi-4 Technical Report ↗
4Phi 4 Open source
Microsoft
84.8%Phi-4 Technical Report ↗
5Llama 3.1-405B Open source
Meta AI
84.5%Stanford CRFM Leaderboard ↗
6Qwen2-72B Open source
Alibaba
82.4%Stanford CRFM Leaderboard ↗
7Llama 3.2 90B Open source
Meta AI
80.3%Stanford CRFM Leaderboard ↗
8Llama 3.1-70B Open source
Meta AI
80.1%Stanford CRFM Leaderboard ↗
9Mistral Large 2 (Jul 2024) Open source
Mistral AI
80.0%Stanford CRFM Leaderboard ↗
10Qwen2.5-14B Open source
Alibaba
79.9%Phi-4 Technical Report ↗
11Llama 3-70B Open source
Meta AI
79.3%Stanford CRFM Leaderboard ↗
12Qwen2.5-Coder-32B Open source
Alibaba
79.1%Qwen2.5-Coder Technical Rep… ↗
13DeepSeek-V2 (MoE-236B, May 2024) Open source
DeepSeek
78.4%DeepSeek-V3 Technical Report ↗
14phi-3-medium 14B Open source
Microsoft
78.0%Phi-3 Technical Report: A H… ↗
15Mixtral 8x22B Open source
Mistral AI
77.8%Stanford CRFM Leaderboard ↗
16Yi-34B Open source
01.AI
76.3%Yi: Open Foundation Models … ↗
17Gemma 2 27B Open source
Google
75.7%Stanford CRFM Leaderboard ↗
18phi-3-small 7.4B Open source
Microsoft
75.7%Phi-3 Technical Report: A H… ↗
19Qwen1.5-32B Open source
Alibaba
74.4%Stanford CRFM Leaderboard ↗
20Qwen2.5-7B Open source
Alibaba
72.9%Stanford CRFM Leaderboard ↗
21Gemma 2 9B Open source
Google DeepMind
72.1%Stanford CRFM Leaderboard ↗
22Mixtral 8x7B Open source
Mistral AI
70.6%Mixtral of Experts ↗
23Falcon-180B Open source
Technology Innovation Institute
70.6%The Falcon Series of Open L… ↗
24Llama 2-70B Open source
Meta AI
69.9%Mixtral of Experts ↗
25Command R+ Open source
Cohere,Cohere Labs (formerly Cohere for AI)
69.4%Stanford CRFM Leaderboard ↗
26phi-3-mini 3.8B Open source
Microsoft
68.8%Phi-3 Technical Report: A H… ↗
27Llama 3-8B Open source
Meta AI
68.8%Stanford CRFM Leaderboard ↗
28Qwen1.5-14B Open source
Alibaba
68.6%Stanford CRFM Leaderboard ↗
29Stable Beluga 2 Open source
Stability AI
68.6%Qwen Technical Report ↗
30Qwen2.5-Coder (7B) Open source
Alibaba
68.0%Qwen2.5-Coder Technical Rep… ↗
31Qwen-14B Open source
Alibaba
66.3%Nemotron-4 15B Technical Re… ↗
32Gemma 7B Open source
Google DeepMind
66.1%Stanford CRFM Leaderboard ↗
33StarCoder 2 15B Open source
Hugging Face,ServiceNow,Nvidia,BigCode
64.1%Qwen2.5-Coder Technical Rep… ↗
34Yi 6B Open source
01.AI
64.0%Stanford CRFM Leaderboard ↗
35LLaMA-65B Open source
Meta AI
63.4%Llama 2: Open Foundation an… ↗
36Qwen1.5-7B Open source
Alibaba
62.6%Stanford CRFM Leaderboard ↗
37Mistral 7B v0.2 Open source
Mistral AI
62.5%Gemma: Open Models Based on… ↗
38Mistral 7B v0.1 Open source
Mistral AI
62.5%Mixtral of Experts ↗
39Mistral 7B v0.3 Open source
Mistral AI
59.9%Stanford CRFM Leaderboard ↗
40Baichuan2-13B Open source
Baichuan
59.2%Nemotron-4 15B Technical Re… ↗
41LLaMA-33B Open source
Meta AI
58.7%Qwen Technical Report ↗
42Falcon 2 11B Open source
Technology Innovation Institute
58.4%Falcon2-11B Technical Report ↗
43Phi-2 Open source
Microsoft
58.4%Stanford CRFM Leaderboard ↗
44Falcon-40B Open source
Technology Innovation Institute
56.9%Falcon2-11B Technical Repor… ↗
45Llama 3.2 11B Open source
Meta AI
56.5%Stanford CRFM Leaderboard ↗
46Llama 3.1-8B Open source
Meta AI
56.1%Stanford CRFM Leaderboard ↗
47Llama 2-13B Open source
Meta AI
55.6%Mixtral of Experts ↗
48Baichuan 2-7B Open source
Baichuan
54.2%Baichuan 2: Open Large-scal… ↗
49Qwen2.5-Coder (1.5B) Open source
Alibaba
53.6%Qwen2.5-Coder Technical Rep… ↗
50Baichuan 1-13B Open source
Baichuan
51.6%Baichuan 2: Open Large-scal… ↗
51MPT-30B Open source
MosaicML
47.9%Qwen Technical Report ↗
52LLaMA-13B Open source
Meta AI
47.7%Qwen Technical Report ↗
53Llama 2-7B Open source
Meta AI
45.8%Stanford CRFM Leaderboard ↗
54Qwen-7B Open source
Alibaba
45.0%Qwen Technical Report ↗
55Gemma 2B Open source
Google DeepMind
42.3%Gemma: Open Models Based on… ↗
56Baichuan1-7B Open source
Baichuan
42.3%Baichuan 2: Open Large-scal… ↗
57DeepSeek Coder 33B Open source
DeepSeek,Peking University
39.4%Qwen2.5-Coder Technical Rep… ↗
58StarCoder 2 7B Open source
Hugging Face,ServiceNow,Nvidia,BigCode
38.8%Qwen2.5-Coder Technical Rep… ↗
59Phi-1.5 Open source
Microsoft
37.6%Textbooks Are All You Need … ↗
60StarCoder 2 3B Open source
Hugging Face,ServiceNow,Nvidia,BigCode
36.6%Qwen2.5-Coder Technical Rep… ↗
61DeepSeek Coder 6.7B Open source
DeepSeek,Peking University
36.4%Qwen2.5-Coder Technical Rep… ↗
62XGen-7B Open source
Salesforce
36.3%XGen-7B Technical Report ↗
63LLaMA-7B Open source
Meta AI
35.6%Qwen Technical Report ↗
64Falcon-7B Open source
Technology Innovation Institute
35.0%Falcon2-11B Technical Report ↗
65MPT-7B Open source
MosaicML
30.8%Qwen Technical Report ↗
66Dolly 2.0-12b Open source
Databricks
26.2%XGen-7B Technical Report ↗
67Cerebras-GPT-13B Open source
Cerebras Systems
26.2%XGen-7B Technical Report ↗
68DeepSeek Coder 1.3B Open source
DeepSeek,Peking University
25.8%Qwen2.5-Coder Technical Rep… ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.