Skip to content
other benchmark · included in ECI

PIQA

PIQA benchmark (score column: Score).
Results
47
Random baseline
50.0%
Score ceiling
100%
Released
26 Nov 2019

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GPT-4o-mini
OpenAI
88.7%Source ↗
2Phi-3.5-MoE Open source
Microsoft
88.6%Source ↗
3Gemini 1.5 Flash (Sep 2024)
Google DeepMind
87.5%Source ↗
4Llama 3.1-405B Open source
Meta AI
85.9%Source ↗
5Falcon-180B Open source
Technology Innovation Institute
84.9%Source ↗
6DeepSeek V3 Open source
DeepSeek
84.7%Source ↗
7Inflection-1
Inflection AI
84.2%Source ↗
8DeepSeek-V2 (MoE-236B, May 2024) Open source
DeepSeek
83.9%Source ↗
9Gemma 2 9B Open source
Google DeepMind
83.7%Source ↗
10Mixtral 8x7B Open source
Mistral AI
83.6%Source ↗
11Mistral Nemo Open source
Mistral
83.5%Source ↗
12Stable Beluga 2 Open source
Stability AI
83.3%Source ↗
13Mistral 7B v0.1 Open source
Mistral AI
83.0%Source ↗
14Falcon-40B Open source
Technology Innovation Institute
83.0%Source ↗
15Llama 2-70B Open source
Meta AI
82.8%Source ↗
16LLaMA-65B Open source
Meta AI
82.8%Source ↗
17Qwen2.5-72B Open source
Alibaba
82.6%Source ↗
18Nemotron-4 15B
NVIDIA
82.4%Source ↗
19LLaMA-33B Open source
Meta AI
82.3%Source ↗
20Mistral 7B v0.2 Open source
Mistral AI
82.2%Source ↗
21Llama 2-34B
Meta AI
81.9%Source ↗
22MPT-30B Open source
MosaicML
81.9%Source ↗
23Llama 3.1-8B Open source
Meta AI
81.2%Source ↗
24Gemma 7B Open source
Google DeepMind
81.2%Source ↗
25Phi-3.5-mini Open source
Microsoft
81.0%Source ↗
26Llama 2-13B Open source
Meta AI
80.8%Source ↗
27MPT-7B Open source
MosaicML
80.6%Source ↗
28internlm-20b
80.3%Source ↗
29Falcon-7B Open source
Technology Innovation Institute
80.3%Source ↗
30LLaMA-13B Open source
Meta AI
80.1%Source ↗
31Qwen-14B Open source
Alibaba
79.9%Source ↗
32LLaMA-7B Open source
Meta AI
79.8%Source ↗
33Llama 2-7B Open source
Meta AI
78.8%Source ↗
34Baichuan2-13B Open source
Baichuan
78.1%Source ↗
35Qwen-7B Open source
Alibaba
77.9%Source ↗
36internlm-7b
77.9%Source ↗
37vicuna-13b-v1.1
77.4%Source ↗
38Gemma 2B Open source
Google DeepMind
77.3%Source ↗
39RedPajama-INCITE-7B-Base
76.9%Source ↗
40Baichuan1-7B Open source
Baichuan
76.2%Source ↗
41open_llama_7b
76.0%Source ↗
42XGen-7B Open source
Salesforce
75.5%Source ↗
43Dolly 2.0-12b Open source
Databricks
75.4%Source ↗
44Cerebras-GPT-13B Open source
Cerebras Systems
73.5%Source ↗
45Qwen-1_8B
73.3%Source ↗
46chatglm2-6b
69.6%Source ↗
47stablelm-tuned-alpha-7b
65.8%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.