Skip to content
multimodal benchmark · included in ECI

VPCT

VPCT benchmark (score column: Correct).
Results
34
Random baseline
33.3%
Score ceiling
100%
Released
30 Jan 2025

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Gemini 3 Pro Preview
Google DeepMind
91.0%Source ↗
2GPT-5.2 (xhigh)
OpenAI
84.0%Source ↗
3Gemini 3 Flash Preview
Google
72.6%Source ↗
4GPT-5.2
OpenAI
67.0%Source ↗
5GPT-5
OpenAI
66.0%Source ↗
6GPT-5 (medium)
OpenAI
63.2%Source ↗
7GPT-5.1
OpenAI
58.7%Source ↗
8o4-mini (medium)
OpenAI
57.5%Source ↗
9GPT-5.1 (medium)
OpenAI
53.3%Source ↗
10o3 (medium)
OpenAI
52.0%Source ↗
11Gemini 2.5 Pro Preview (Mar 2025)
Google DeepMind
48.0%Source ↗
12Gemini 2.5 Pro Preview (Jun 2025)
Google DeepMind
46.4%Source ↗
13Gemini 2.5 Flash (Sep 2025)
Google DeepMind
46.2%Source ↗
14GPT-4.5 Preview (Feb 2025)
OpenAI
45.0%Source ↗
15gemini-robotics-er-1.5-preview
40.8%Source ↗
16GPT-5 mini (medium)
OpenAI
40.2%Source ↗
17Claude Opus 4.5 (32k thinking)
Anthropic
40.0%Source ↗
18GPT-4o (Nov 2024)
OpenAI
40.0%Source ↗
19Claude Sonnet 4.5 (32k thinking)
Anthropic
39.8%Source ↗
20GPT-5 Mini
OpenAI
39.0%Source ↗
21Claude 3.7 Sonnet
Anthropic
39.0%Source ↗
22Claude Sonnet 4.5 (no thinking)
Anthropic
38.0%Source ↗
23Claude Opus 4
Anthropic
38.0%Source ↗
24Gemini 2.5 Flash Preview (Apr 2025)
Google DeepMind
38.0%Source ↗
25GPT-5 Nano
OpenAI
37.2%Source ↗
26o1 (medium)
OpenAI
37.0%Source ↗
27GPT-5 nano (medium)
OpenAI
35.4%Source ↗
28Claude Opus 4.1
Anthropic
35.0%Source ↗
29Claude 3.7 Sonnet (64k thinking)
Anthropic
35.0%Source ↗
30Claude Sonnet 4
Anthropic
34.0%Source ↗
31GPT-4o-mini
OpenAI
34.0%Source ↗
32Claude 3.5 Sonnet (Oct 2024)
Anthropic
33.0%Source ↗
33Claude 3.5 Sonnet (Jun 2024)
Anthropic
33.0%Source ↗
34Gemini 2.5 Flash-Lite (Sep 2025)
Google DeepMind
30.0%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.