Skip to content
science benchmark · included in ECI

Surface Evolver Bench

Surface Evolver Bench benchmark (score column: Mean score).
Results
14
Random baseline
0.0%
Score ceiling
100%
Released
19 Jun 2026

Score by model release date

Best score by organisation

#ModelScoreRelativeEvidence
1Kimi K3 (unknown) Open source
Moonshot
95.0%Source ↗
2Kimi K3 Open source
MoonshotAI
93.0%Source ↗
3GLM 5.2 Open source
Z.ai
55.6%Source ↗
4MiniMax M3 Open source
MiniMax
55.0%Source ↗
5GLM 5.3 Flash Open source
Z.ai
52.5%Source ↗
6Kimi K2.7 Code Open source
MoonshotAI
48.8%Source ↗
7DeepSeek V4.1 Flash Open source
DeepSeek
46.3%Source ↗
8Qwen3.8 27B (xhigh) Open source
Alibaba
45.0%Source ↗
9Qwen3.6 35B A3B Open source
Qwen
44.4%Source ↗
10DeepSeek v4 Pro (high) Open source
DeepSeek
40.0%Source ↗
11Gemma 4 31B Open source
Google
30.6%Source ↗
12Mistral Medium 3.5 Open source
Mistral
26.9%Source ↗
13gpt-oss-120b Open source
OpenAI
25.0%Source ↗
14Trinity Large Thinking Open source
Arcee AI
15.6%Source ↗

Caveats: settings (reasoning effort, agent scaffold) differ between rows and materially affect scores; the best reported setting per model is shown. Source: Epoch AI, CC BY 4.0.