other benchmark · included in ECI
LAMBADA
LAMBADA benchmark (score column: Score).
Results
21
Random baseline
0.0%
Score ceiling
100%
Released
20 Jun 2016
Score by model release date
Best score by organisation
Leaderboard
| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | Falcon-180B Open source Technology Innovation Institute | 79.8% | — | 6 Sep 2023 | — | Source ↗ | |
| 2 | Llama 2-70B Open source Meta AI | 78.9% | — | 18 Jul 2023 | — | Source ↗ | |
| 3 | Inflection-1 Inflection AI | 78.5% | — | 22 Jun 2023 | — | Source ↗ | |
| 4 | LLaMA-65B Open source Meta AI | 77.7% | — | 24 Feb 2023 | — | Source ↗ | |
| 5 | Falcon-40B Open source Technology Innovation Institute | 77.3% | — | 25 May 2023 | — | Source ↗ | |
| 6 | LLaMA-33B Open source Meta AI | 77.2% | — | 24 Feb 2023 | — | Source ↗ | |
| 7 | Llama 2-13B Open source Meta AI | 76.5% | — | 18 Jul 2023 | — | Source ↗ | |
| 8 | LLaMA-13B Open source Meta AI | 75.2% | — | 24 Feb 2023 | — | Source ↗ | |
| 9 | Falcon-7B Open source Technology Innovation Institute | 74.9% | — | 24 Apr 2023 | — | Source ↗ | |
| 10 | Baichuan2-13B Open source Baichuan | 74.0% | — | 6 Sep 2023 | — | Source ↗ | |
| 11 | Baichuan 2-7B Open source Baichuan | 73.3% | — | 20 Sep 2023 | — | Source ↗ | |
| 12 | Llama 2-7B Open source Meta AI | 73.3% | — | 18 Jul 2023 | — | Source ↗ | |
| 13 | LLaMA-7B Open source Meta AI | 73.3% | — | 24 Feb 2023 | — | Source ↗ | |
| 14 | internlm-20b | 71.8% | — | 18 Sep 2023 | — | Source ↗ | |
| 15 | Stable Beluga 2 Open source Stability AI | 71.3% | — | 20 Jul 2023 | — | Source ↗ | |
| 16 | Qwen-14B Open source Alibaba | 71.1% | — | 24 Sep 2023 | — | Source ↗ | |
| 17 | MPT-7B Open source MosaicML | 70.0% | — | 5 May 2023 | — | Source ↗ | |
| 18 | Qwen-7B Open source Alibaba | 67.9% | — | 28 Sep 2023 | — | Source ↗ | |
| 19 | internlm-7b | 67.0% | — | 5 Jul 2023 | — | Source ↗ | |
| 20 | Qwen-1_8B | 58.4% | 8B | 30 Nov 2023 | — | Source ↗ | |
| 21 | chatglm2-6b | 54.3% | — | 24 Jun 2023 | — | Source ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.