Skip to content
games benchmark · included in ECI

Balrog

Balrog benchmark (score column: Average progress).
Results
14
Random baseline
0.0%
Score ceiling
100%
Released
20 Nov 2024

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1R1 Open source
DeepSeek
34.9%Source ↗
2Reka Flash 3 Open source
rekaai
29.2%Source ↗
3Llama 3.1-70B Open source
Meta AI
27.9%Source ↗
4Llama 3.2 90B Open source
Meta AI
27.3%Source ↗
5Llama 3.3 70B Open source
Meta AI
23.0%Source ↗
6DeepSeek-R1-Distill-Qwen-32B Open source
DeepSeek
19.5%Source ↗
7Mistral Nemo Open source
Mistral
17.6%Source ↗
8Llama 3.2 11B Open source
Meta AI
16.8%Source ↗
9Qwen2.5-72B Open source
Alibaba
16.2%Source ↗
10Llama 3.1-8B Open source
Meta AI
15.1%Source ↗
11Phi 4 Open source
Microsoft
11.6%Source ↗
12Llama 3.2 3B Open source
Meta AI
10.1%Source ↗
13Qwen2.5-7B Open source
Alibaba
7.8%Source ↗
14Llama 3.2 1B Open source
Meta AI
6.6%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.