Skip to content
other benchmark · included in ECI

ARC AI2

ARC AI2 benchmark (score column: Challenge score).
Results
67
Random baseline
25.0%
Score ceiling
100%
Released
14 Mar 2018

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1DeepSeek V3 Open source
DeepSeek
95.3%Source ↗
2Llama 3.1-405B Open source
Meta AI
95.3%Source ↗
3Qwen2.5-72B Open source
Alibaba
94.5%Source ↗
4DeepSeek-V2 (MoE-236B, May 2024) Open source
DeepSeek
92.2%Source ↗
5phi-3-medium 14B Open source
Microsoft
91.6%Source ↗
6phi-3-small 7.4B Open source
Microsoft
90.7%Source ↗
7GPT-3.5 Turbo (Nov 2023)
OpenAI
87.4%Source ↗
8Mixtral 8x7B Open source
Mistral AI
87.3%Source ↗
9Claude Instant
Anthropic
86.3%Source ↗
10Stable Beluga 2 Open source
Stability AI
86.1%Source ↗
11phi-3-mini 3.8B Open source
Microsoft
84.9%Source ↗
12Qwen-14B Open source
Alibaba
84.4%Source ↗
13Llama 3-8B Open source
Meta AI
82.8%Source ↗
14internlm-20b
81.7%Source ↗
15Mistral 7B v0.1 Open source
Mistral AI
78.6%Source ↗
16Gemma 7B Open source
Google DeepMind
78.3%Source ↗
17Llama 2-70B Open source
Meta AI
78.3%Source ↗
18Phi-2 Open source
Microsoft
75.9%Source ↗
19Qwen-7B Open source
Alibaba
75.3%Source ↗
20Qwen2.5-Coder-32B Open source
Alibaba
70.5%Source ↗
21internlm-7b
69.5%Source ↗
22LLaMA-65B Open source
Meta AI
69.5%Source ↗
23PaLM 2-L
69.2%Source ↗
24Falcon-180B Open source
Technology Innovation Institute
67.8%Source ↗
25LLaMA-33B Open source
Meta AI
67.5%Source ↗
26Qwen2.5-Coder-14B
66.0%Source ↗
27PaLM 2-M
64.9%Source ↗
28DeepSeek-Coder-V2 236B Open source
DeepSeek
64.3%Source ↗
29Falcon-40B Open source
Technology Innovation Institute
61.9%Source ↗
30chatglm2-6b
61.0%Source ↗
31Qwen2.5-Coder (7B) Open source
Alibaba
60.9%Source ↗
32Llama 2-13B Open source
Meta AI
60.3%Source ↗
33PaLM 2-S
59.6%Source ↗
34DeepSeek-Coder-V2-Lite-Base
57.3%Source ↗
35Yi-9B
55.6%Source ↗
36Nemotron-4 15B
NVIDIA
55.5%Source ↗
37INTELLECT-1
Prime Intellect,Hugging Face,Arcee AI
54.5%Source ↗
38Llama 2-34B
Meta AI
54.5%Source ↗
39Qwen-1_8B
53.2%Source ↗
40Qwen2.5-Coder-3B
52.9%Source ↗
41LLaMA-13B Open source
Meta AI
52.7%Source ↗
42MPT-30B Open source
MosaicML
50.6%Source ↗
43Yi 6B Open source
01.AI
50.3%Source ↗
44Falcon-7B Open source
Technology Innovation Institute
47.9%Source ↗
45LLaMA-7B Open source
Meta AI
47.6%Source ↗
46StarCoder 2 15B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
47.2%Source ↗
47Llama 2-7B Open source
Meta AI
45.9%Source ↗
48Qwen2.5-Coder (1.5B) Open source
Alibaba
45.2%Source ↗
49Phi-1.5 Open source
Microsoft
44.4%Source ↗
50vicuna-13b-v1.1
43.2%Source ↗
51MPT-7B Open source
MosaicML
42.6%Source ↗
52DeepSeek Coder 33B Open source
DeepSeek,Peking University
42.2%Source ↗
53Gemma 2B Open source
Google DeepMind
42.1%Source ↗
54XGen-7B Open source
Salesforce
41.2%Source ↗
55Dolly 2.0-12b Open source
Databricks
39.6%Source ↗
56RedPajama-INCITE-7B-Base
39.1%Source ↗
57StarCoder 2 7B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
38.7%Source ↗
58open_llama_7b
38.7%Source ↗
59Baichuan2-13B Open source
Baichuan
38.0%Source ↗
60DeepSeek Coder 6.7B Open source
DeepSeek,Peking University
36.4%Source ↗
61CodeQwen1.5-7B
35.7%Source ↗
62Qwen2.5-Coder-0.5B
34.4%Source ↗
63StarCoder 2 3B Open source
Hugging Face,ServiceNow,NVIDIA,BigCode
34.2%Source ↗
64Baichuan 2-7B Open source
Baichuan
32.5%Source ↗
65Cerebras-GPT-13B Open source
Cerebras Systems
32.4%Source ↗
66stablelm-tuned-alpha-7b
27.0%Source ↗
67DeepSeek Coder 1.3B Open source
DeepSeek,Peking University
25.4%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.