Skip to content
agents benchmark · included in ECI

LMCA

LMCA benchmark (score column: Score).
Results
55
Random baseline
0.0%
Score ceiling
85%
Released
12 Aug 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Kimi K3 Open source
MoonshotAI
52.7%Source ↗
2DeepSeek V4.1 Flash (unknown) Open source
DeepSeek
47.0%Source ↗
3GLM 5.2 Open source
Z.ai
45.8%Source ↗
4DeepSeek V4 Pro 0813 (unknown) Open source
DeepSeek
45.5%Source ↗
5DeepSeek V4 Flash 0731 Open source
DeepSeek
41.7%Source ↗
6Qwen3.8 27B Open source
Qwen
41.4%Source ↗
7DeepSeek v4 Pro (high) Open source
DeepSeek
41.2%Source ↗
8Gemma 4 31B Open source
Google
39.3%Source ↗
9Qwen3.5 397B A17B Open source
Qwen
37.9%Source ↗
10Inkling (xhigh) Open source
Thinking Machines
37.6%Source ↗
11Kimi K2.6 Open source
MoonshotAI
37.3%Source ↗
12Nemotron 3 Ultra Open source
NVIDIA
36.9%Source ↗
13DeepSeek v4 Flash (max) Open source
DeepSeek
35.9%Source ↗
14Qwen3.6 27B Open source
Qwen
34.5%Source ↗
15Qwen3.5-27B Open source
Qwen
34.0%Source ↗
16MiniMax M3 Open source
MiniMax
33.7%Source ↗
17Qwen3.5-122B-A10B Open source
Qwen
32.2%Source ↗
18Qwen3.6 35B A3B Open source
Qwen
29.7%Source ↗
19Gemma 4 26B A4B Open source
Google
29.7%Source ↗
20MiMo-V2.5-Pro Open source
Xiaomi
29.5%Source ↗
21Qwen3.5-35B-A3B Open source
Qwen
29.5%Source ↗
22Qwen3-235B-A22B-Thinking (Jul 2025) Open source
Alibaba
29.3%Source ↗
23DeepSeek V3.2 Exp Open source
DeepSeek
29.1%Source ↗
24DeepSeek-V3.2 (Thinking; Novita) Open source
DeepSeek
28.8%Source ↗
25DeepSeek V3.1 Terminus Open source
DeepSeek
28.6%Source ↗
26Mistral Medium 3.5 Open source
Mistral
26.1%Source ↗
27Qwen3 235B A22B Open source
Qwen
25.0%Source ↗
28Qwen3.5-9B Open source
Qwen
24.5%Source ↗
29DeepSeek V3.1 Open source
DeepSeek
24.3%Source ↗
30Qwen3-235B-A22B-Instruct (Jul 2025) Open source
Alibaba
23.5%Source ↗
31Qwen3-30B-A3B-Instruct (Jul 2025) Open source
Alibaba
22.4%Source ↗
32gpt-oss-120b Open source
OpenAI
22.1%Source ↗
33Mistral Small 4 Open source
Mistral
20.6%Source ↗
34Qwen3-30B-A3B-Thinking (Jul 2025) Open source
Alibaba
19.5%Source ↗
35Qwen3 14B Open source
Qwen
18.2%Source ↗
36Llama 3.3 70B Open source
Meta AI
17.5%Source ↗
37Qwen3 32B Open source
Qwen
17.3%Source ↗
38Mistral Large 3 Open source
Mistral AI
16.7%Source ↗
39Llama 4 Maverick Open source
Meta
15.9%Source ↗
40Qwen3 30B A3B Open source
Qwen
15.8%Source ↗
41DeepSeek-V3 (Mar 2025) Open source
DeepSeek
15.5%Source ↗
42DeepSeek V3.2 Open source
DeepSeek
15.2%Source ↗
43Llama 3.1-70B Open source
Meta AI
14.8%Source ↗
44gpt-oss-20b Open source
OpenAI
14.5%Source ↗
45Qwen2.5-72B Open source
Alibaba
13.4%Source ↗
46Gemma 3 27B Open source
Google
12.3%Source ↗
47Llama 4 Scout Open source
Meta
12.0%Source ↗
48Cohere Command A Open source
Cohere
10.3%Source ↗
49Qwen3 8B Open source
Qwen
8.8%Source ↗
50Gemma 2 27B Open source
Google
7.1%Source ↗
51Qwen2.5-7B Open source
Alibaba
6.4%Source ↗
52Llama 3.1-8B Open source
Meta AI
5.4%Source ↗
53Command R+ Open source
Cohere,Cohere Labs (formerly Cohere for AI)
5.0%Source ↗
54Gemma 3 12B Open source
Google
4.5%Source ↗
55Gemma 3 4B Open source
Google
2.8%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.