Skip to content
other benchmark · included in ECI

ScienceQA

ScienceQA benchmark (score column: Score).
Results
5
Random baseline
25.0%
Score ceiling
100%
Released
20 Sep 2022

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1BLIP-2 (Q-Former) Open source
Salesforce Research
74.2%ScienceQA leaderboard ↗
2Llama 2-13B Open source
Meta AI
55.8%ScienceQA leaderboard ↗
3LLaMA-13B Open source
Meta AI
43.3%ScienceQA leaderboard ↗
4Llama 2-7B Open source
Meta AI
43.1%ScienceQA leaderboard ↗
5LLaMA-7B Open source
Meta AI
36.2%ScienceQA leaderboard ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.