Skip to content
multimodal benchmark · included in ECI

Furniture Assembly

Furniture Assembly benchmark (score column: Best score (across scorers)).
Results
27
Random baseline
30.0%
Score ceiling
100%
Released
23 Sep 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Claude Opus 5.5
Anthropic
83.3% ±4.7Source ↗
2GPT-6 Astra
OpenAI
80.0% ±4.9Source ↗
3Claude Fable 5.1
Anthropic
70.0% ±5.7Source ↗
4Claude Opus 5
Anthropic
60.8% ±6.2Source ↗
5GPT-6 Sol
OpenAI
58.3% ±6.4Source ↗
6GPT-5.6 Sol
OpenAI
56.7% ±6.3Source ↗
7GPT-5.6 Terra
OpenAI
54.2% ±6.4Source ↗
8GPT-6 Luna
OpenAI
44.2% ±6.4Source ↗
9GPT-5.5 (xhigh)
OpenAI
44.2% ±6.4Source ↗
10GPT-5.6 Luna
OpenAI
42.5% ±6.4Source ↗
11Claude Opus 4.8
Anthropic
42.5% ±6.4Source ↗
12Grok 4.6 (xhigh)
xAI
40.0% ±6.3Source ↗
13GPT-5.2 (xhigh)
OpenAI
38.3% ±6.3Source ↗
14GPT-5.4 (xhigh)
OpenAI
37.5% ±6.2Source ↗
15Claude Fable 5
Anthropic
35.8% ±6.2Source ↗
16Kimi K3 Open source
MoonshotAI
34.2% ±6.1Source ↗
17Claude Opus 4.7
Anthropic
33.3% ±6.1Source ↗
18Gemini 3.8 Flash
Google
31.7% ±5.9Source ↗
19Claude Opus 4.6
Anthropic
28.3% ±5.9Source ↗
20Claude Opus 4.5 (64k thinking)
Anthropic
28.3% ±5.9Source ↗
21Gemini 3.7 Flash
Google
26.7% ±5.6Source ↗
22Gemini 3.1 Pro Preview
Google
26.7% ±5.6Source ↗
23Gemini 3.6 Flash
Google
23.3% ±5.4Source ↗
24Grok 4.5
SpaceXAI
22.5% ±5.4Source ↗
25Kimi K2.6 Open source
MoonshotAI
21.7% ±5.2Source ↗
26Grok 4.7 (xhigh)
xAI
20.8% ±5.2Source ↗
27Qwen3.8 Max (0902) (xhigh)
Alibaba
20.0% ±5.2Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.