Skip to content
reasoning benchmark · included in ECI

HellaSwag

HellaSwag benchmark (score column: Overall accuracy).
Results
52
Random baseline
25.0%
Score ceiling
100%
Released
19 May 2019

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-4 (Mar 2023)
OpenAI
95.3%Source ↗
2Llama 3.1-405B Open source
Meta AI
89.2%Source ↗
3Falcon-180B Open source
Technology Innovation Institute
89.0%Source ↗
4DeepSeek V3 Open source
DeepSeek
88.9%Source ↗
5DeepSeek-V2 (MoE-236B, May 2024) Open source
DeepSeek
87.1%Source ↗
6PaLM 2-L
86.8%Source ↗
7Mixtral 8x7B Open source
Mistral AI
86.7%Source ↗
8Llama 2-70B Open source
Meta AI
85.3%Source ↗
9Falcon-40B Open source
Technology Innovation Institute
85.3%Source ↗
10Qwen2.5-72B Open source
Alibaba
84.8%Source ↗
11LLaMA-65B Open source
Meta AI
84.2%Source ↗
12Stable Beluga 2 Open source
Stability AI
84.1%Source ↗
13PaLM 2-M
84.0%Source ↗
14Qwen2.5-Coder-32B Open source
Alibaba
83.0%Source ↗
15Falcon 2 11B Open source
Technology Innovation Institute
82.9%Source ↗
16LLaMA-33B Open source
Meta AI
82.8%Source ↗
17phi-3-medium 14B Open source
Microsoft
82.4%Source ↗
18Nemotron-4 15B
NVIDIA
82.4%Source ↗
19Gemma 7B Open source
Google DeepMind
82.2%Source ↗
20PaLM 2-S
82.0%Source ↗
21Mistral 7B v0.1 Open source
Mistral AI
81.0%Source ↗
22Llama 2-13B Open source
Meta AI
80.7%Source ↗
23Qwen2.5-Coder-14B
80.2%Source ↗
24LLaMA-13B Open source
Meta AI
79.2%Source ↗
25internlm-20b
78.1%Source ↗
26Falcon-7B Open source
Technology Innovation Institute
78.1%Source ↗
27Llama 2-7B Open source
Meta AI
77.2%Source ↗
28phi-3-small 7.4B Open source
Microsoft
77.0%Source ↗
29Qwen2.5-Coder (7B) Open source
Alibaba
76.8%Source ↗
30phi-3-mini 3.8B Open source
Microsoft
76.7%Source ↗
31Yi-9B
76.4%Source ↗
32MPT-7B Open source
MosaicML
76.4%Source ↗
33LLaMA-7B Open source
Meta AI
76.2%Source ↗
34Yi 6B Open source
01.AI
74.4%Source ↗
35XGen-7B Open source
Salesforce
74.2%Source ↗
36open_llama_7b
71.8%Source ↗
37INTELLECT-1
Prime Intellect,Hugging Face,Arcee AI
71.4%Source ↗
38Gemma 2B Open source
Google DeepMind
71.4%Source ↗
39Qwen2.5-Coder-3B
70.9%Source ↗
40Baichuan2-13B Open source
Baichuan
70.8%Source ↗
41Dolly 2.0-12b Open source
Databricks
70.8%Source ↗
42internlm-7b
70.6%Source ↗
43RedPajama-INCITE-7B-Base
70.3%Source ↗
44Baichuan 2-7B Open source
Baichuan
68.0%Source ↗
45Qwen2.5-Coder (1.5B) Open source
Alibaba
61.8%Source ↗
46Cerebras-GPT-13B Open source
Cerebras Systems
59.4%Source ↗
47vicuna-13b-v1.1
57.8%Source ↗
48chatglm2-6b
57.0%Source ↗
49Phi-2 Open source
Microsoft
53.6%Source ↗
50Qwen2.5-Coder-0.5B
48.4%Source ↗
51Phi-1.5 Open source
Microsoft
47.6%Source ↗
52stablelm-tuned-alpha-7b
40.7%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.