Skip to content
agents benchmark · included in ECI

APEX-Agents

APEX-Agents benchmark (score column: Pass@1 score).
Results
9
Random baseline
0.0%
Score ceiling
100%
Released
21 Jan 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1GLM-5.3-Flash (unknown) Open source
Z.ai (Zhipu AI)
52.8%Source ↗
2Kimi K3 (unknown) Open source
Moonshot
50.6%Source ↗
3DeepSeek V4 Pro 0813 (unknown) Open source
DeepSeek
47.3%Source ↗
4GLM 5.1 Open source
Z.ai
40.9%Source ↗
5MiniMax M3 Open source
MiniMax
37.7%Source ↗
6Kimi K2.7 Code Open source
MoonshotAI
37.6%Source ↗
7Inkling Open source
Thinking Machines
33.8%Source ↗
8Qwen3.5 397B A17B Open source
Qwen
24.9%Source ↗
9gpt-oss-120b Open source
OpenAI
4.4%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.