multimodal benchmark · included in ECI
Furniture Assembly
Furniture Assembly benchmark (score column: Best score (across scorers)).
Results
27
Random baseline
30.0%
Score ceiling
100%
Released
23 Sep 2026
Score by model release date
Best score by organisation
Leaderboard
| # | Model | Score | Relative | Setting | Released | Run | Evidence |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 83.3% ±4.7 | max | 22 Sep 2026 | 22 Sep 2026 | Source ↗ | |
| 2 | GPT-6 Astra OpenAI | 80.0% ±4.9 | max | 3 Sep 2026 | 10 Sep 2026 | Source ↗ | |
| 3 | Claude Fable 5.1 Anthropic | 70.0% ±5.7 | max | 1 Sep 2026 | 10 Sep 2026 | Source ↗ | |
| 4 | Claude Opus 5 Anthropic | 60.8% ±6.2 | max | 24 Jul 2026 | 10 Sep 2026 | Source ↗ | |
| 5 | GPT-6 Sol OpenAI | 58.3% ±6.4 | max | 22 Sep 2026 | 23 Sep 2026 | Source ↗ | |
| 6 | GPT-5.6 Sol OpenAI | 56.7% ±6.3 | max | 9 Jul 2026 | 10 Sep 2026 | Source ↗ | |
| 7 | GPT-5.6 Terra OpenAI | 54.2% ±6.4 | max | 9 Jul 2026 | 10 Sep 2026 | Source ↗ | |
| 8 | GPT-6 Luna OpenAI | 44.2% ±6.4 | max | 22 Sep 2026 | 28 Sep 2026 | Source ↗ | |
| 9 | GPT-5.5 (xhigh) OpenAI | 44.2% ±6.4 | xhigh | 23 Apr 2026 | 10 Sep 2026 | Source ↗ | |
| 10 | GPT-5.6 Luna OpenAI | 42.5% ±6.4 | max | 9 Jul 2026 | 10 Sep 2026 | Source ↗ | |
| 11 | Claude Opus 4.8 Anthropic | 42.5% ±6.4 | max | 28 May 2026 | 10 Sep 2026 | Source ↗ | |
| 12 | Grok 4.6 (xhigh) xAI | 40.0% ±6.3 | xhigh | 12 Aug 2026 | 24 Sep 2026 | Source ↗ | |
| 13 | GPT-5.2 (xhigh) OpenAI | 38.3% ±6.3 | xhigh | 11 Dec 2025 | 10 Sep 2026 | Source ↗ | |
| 14 | GPT-5.4 (xhigh) OpenAI | 37.5% ±6.2 | xhigh | 5 Mar 2026 | 10 Sep 2026 | Source ↗ | |
| 15 | Claude Fable 5 Anthropic | 35.8% ±6.2 | max | 9 Jun 2026 | 10 Sep 2026 | Source ↗ | |
| 16 | Kimi K3 Open source MoonshotAI | 34.2% ±6.1 | max | 16 Jul 2026 | 11 Sep 2026 | Source ↗ | |
| 17 | Claude Opus 4.7 Anthropic | 33.3% ±6.1 | max | 16 Apr 2026 | 10 Sep 2026 | Source ↗ | |
| 18 | Gemini 3.8 Flash Google | 31.7% ±5.9 | high | 2 Sep 2026 | 10 Sep 2026 | Source ↗ | |
| 19 | Claude Opus 4.6 Anthropic | 28.3% ±5.9 | max | 5 Feb 2026 | 10 Sep 2026 | Source ↗ | |
| 20 | Claude Opus 4.5 (64k thinking) Anthropic | 28.3% ±5.9 | 64K | 24 Nov 2025 | 10 Sep 2026 | Source ↗ | |
| 21 | Gemini 3.7 Flash Google | 26.7% ±5.6 | high | 13 Aug 2026 | 10 Sep 2026 | Source ↗ | |
| 22 | Gemini 3.1 Pro Preview Google | 26.7% ±5.6 | high | 19 Feb 2026 | 10 Sep 2026 | Source ↗ | |
| 23 | Gemini 3.6 Flash Google | 23.3% ±5.4 | high | 21 Jul 2026 | 10 Sep 2026 | Source ↗ | |
| 24 | Grok 4.5 SpaceXAI | 22.5% ±5.4 | high | 8 Jul 2026 | 24 Sep 2026 | Source ↗ | |
| 25 | Kimi K2.6 Open source MoonshotAI | 21.7% ±5.2 | — | 20 Apr 2026 | 11 Sep 2026 | Source ↗ | |
| 26 | Grok 4.7 (xhigh) xAI | 20.8% ±5.2 | xhigh | 21 Sep 2026 | 24 Sep 2026 | Source ↗ | |
| 27 | Qwen3.8 Max (0902) (xhigh) Alibaba | 20.0% ±5.2 | xhigh | 1 Sep 2026 | 10 Sep 2026 | Source ↗ |
Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.