other benchmark · included in ECI
ScienceQA
ScienceQA benchmark (score column: Score).
Results
5
Random baseline
25.0%
Score ceiling
100%
Released
20 Sep 2022
Score by model release date
Best score by organisation
Leaderboard
| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | BLIP-2 (Q-Former) Open source Salesforce Research | 74.2% | — | 6 Feb 2023 | — | ScienceQA leaderboard ↗ | |
| 2 | Llama 2-13B Open source Meta AI | 55.8% | — | 18 Jul 2023 | — | ScienceQA leaderboard ↗ | |
| 3 | LLaMA-13B Open source Meta AI | 43.3% | — | 24 Feb 2023 | — | ScienceQA leaderboard ↗ | |
| 4 | Llama 2-7B Open source Meta AI | 43.1% | — | 18 Jul 2023 | — | ScienceQA leaderboard ↗ | |
| 5 | LLaMA-7B Open source Meta AI | 36.2% | — | 24 Feb 2023 | — | ScienceQA leaderboard ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.