Skip to content
reasoning benchmark · included in ECI

BBH

BBH benchmark (score column: Average).
Results
45
Random baseline
25.0%
Score ceiling
100%
Released
17 Oct 2022

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Gemini 1.5 Pro (May 2024)
Google DeepMind
89.2%Source ↗
2DeepSeek V3 Open source
DeepSeek
87.5%Source ↗
3Gemini 1.5 Pro (Feb 2024)
Google DeepMind
84.0%Source ↗
4Llama 3.1-405B Open source
Meta AI
82.9%Source ↗
5phi-3-medium 14B Open source
Microsoft
81.4%Source ↗
6Qwen2.5-72B Open source
Alibaba
79.8%Source ↗
7phi-3-small 7.4B Open source
Microsoft
79.1%Source ↗
8DeepSeek-V2 (MoE-236B, May 2024) Open source
DeepSeek
78.8%Source ↗
9GPT-4 (Jun 2023)
OpenAI
75.1%Source ↗
10phi-3-mini 3.8B Open source
Microsoft
71.7%Source ↗
11Yi-34B Open source
01.AI
71.7%Source ↗
12Stable Beluga 2 Open source
Stability AI
69.3%Source ↗
13Llama 2-70B Open source
Meta AI
64.9%Source ↗
14GPT-3.5 Turbo (June 2023)
OpenAI
61.6%Source ↗
15Phi-2 Open source
Microsoft
59.4%Source ↗
16Nemotron-4 15B
NVIDIA
58.7%Source ↗
17LLaMA-65B Open source
Meta AI
58.4%Source ↗
18Llama 2-13B Open source
Meta AI
58.2%Source ↗
19Mistral 7B v0.1 Open source
Mistral AI
56.1%Source ↗
20Gemma 7B Open source
Google DeepMind
55.1%Source ↗
21Qwen-14B Open source
Alibaba
55.0%Source ↗
22internlm-20b
52.5%Source ↗
23LLaMA-33B Open source
Meta AI
50.0%Source ↗
24Baichuan2-13B Open source
Baichuan
49.0%Source ↗
25Yi 6B Open source
01.AI
47.2%Source ↗
26Baichuan2-13B-Chat
47.2%Source ↗
27Qwen-7B Open source
Alibaba
45.0%Source ↗
28Llama 2-34B
Meta AI
44.1%Source ↗
29vicuna-13b-v1.1
43.0%Source ↗
30Baichuan 1-13B Open source
Baichuan
43.0%Source ↗
31internlm-chat-20b
42.4%Source ↗
32Baichuan 2-7B Open source
Baichuan
41.6%Source ↗
33Llama 2-7B Open source
Meta AI
39.2%Source ↗
34MPT-30B Open source
MosaicML
38.0%Source ↗
35LLaMA-13B Open source
Meta AI
37.9%Source ↗
36Falcon-40B Open source
Technology Innovation Institute
37.1%Source ↗
37internlm-7b
37.0%Source ↗
38MPT-7B Open source
MosaicML
35.6%Source ↗
39Gemma 2B Open source
Google DeepMind
35.2%Source ↗
40INTELLECT-1
Prime Intellect,Hugging Face,Arcee AI
34.8%Source ↗
41chatglm2-6b
33.7%Source ↗
42LLaMA-7B Open source
Meta AI
33.5%Source ↗
43Baichuan1-7B Open source
Baichuan
32.5%Source ↗
44Falcon-7B Open source
Technology Innovation Institute
28.8%Source ↗
45Qwen-1_8B
28.2%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.