AI news & updates
260 events
- BenchmarkEpoch AI evaluates GPT-5 (minimal)
FrontierMath-Tiers-1-3-v2-Private 18.2% · Mystery Game Puzzles 14.0%
- BenchmarkEpoch AI evaluates GPT-5 mini (low)
FrontierMath-Tiers-1-3-v2-Private 18.2%
- BenchmarkEpoch AI evaluates GPT-5 nano (minimal)
FrontierMath-Tiers-1-3-v2-Private 1.8% · Mystery Game Puzzles 5.0%
- BenchmarkEpoch AI evaluates o3 Mini
FrontierMath-Tiers-1-3-v2-Private 3.9% · Mystery Game Puzzles 7.0%
- BenchmarkEpoch AI evaluates GPT-5 nano (low)
FrontierMath-Tiers-1-3-v2-Private 6.0% · Mystery Game Puzzles 9.0%
- BenchmarkEpoch AI evaluates GLM 5.3 Flash
FrontierMath-Tiers-1-3-v2-Private 55.8% · FrontierMath-Tier-4-v2-Private 17.1%
- BenchmarkEpoch AI evaluates Qwen3.5 Plus 2026-02-15
SimpleQA Verified 25.4% · Mystery Game Puzzles 17.0%
- BenchmarkEpoch AI evaluates Muse Spark 1.2 (xhigh)
SimpleQA Verified 60.3%
- BenchmarkEpoch AI evaluates Inkling (xhigh)
SimpleQA Verified 40.3%
- BenchmarkEpoch AI evaluates Qwen3-235B-A22B-Thinking (Jul 2025)
SimpleQA Verified 40.4% · Mystery Game Puzzles 9.0%
- BenchmarkEpoch AI evaluates GLM 5.1
SimpleQA Verified 34.0%
- BenchmarkEpoch AI evaluates Inkling Small (xhigh)
SimpleQA Verified 19.1%
- BenchmarkEpoch AI evaluates Kimi K3
SimpleQA Verified 50.6%
- BenchmarkEpoch AI evaluates GLM 5.2
SimpleQA Verified 34.2% · Mystery Game Puzzles 15.0% · Mystery Game Puzzles 19.0% · Mystery Game Puzzles 18.0%
- BenchmarkEpoch AI evaluates Kimi K2.7 Code
SimpleQA Verified 36.5%
- BenchmarkEpoch AI evaluates GLM 4.7
SimpleQA Verified 32.2%
- BenchmarkEpoch AI evaluates Kimi K2.5
SimpleQA Verified 34.3%
- BenchmarkEpoch AI evaluates Qwen3.7 Max
SimpleQA Verified 55.8% · Mystery Game Puzzles 26.0%
- BenchmarkEpoch AI evaluates Qwen 3.6 Plus (2026-04-02)
SimpleQA Verified 44.1% · Mystery Game Puzzles 12.0%
- BenchmarkEpoch AI evaluates Qwen 3.6 Max (Preview)
SimpleQA Verified 52.0% · Mystery Game Puzzles 19.0%
- BenchmarkEpoch AI evaluates Qwen 3.6 Flash (2026-04-16)
SimpleQA Verified 15.9% · Mystery Game Puzzles 12.0% · Mystery Game Puzzles 18.0%
- BenchmarkEpoch AI evaluates Qwen3.5-Flash
SimpleQA Verified 20.3% · Mystery Game Puzzles 20.0% · Mystery Game Puzzles 16.0%
- BenchmarkEpoch AI evaluates Qwen3-Max-Instruct
SimpleQA Verified 48.7% · Mystery Game Puzzles 5.0%
- BenchmarkEpoch AI evaluates Qwen3.8 Max (xhigh)
SimpleQA Verified 45.8%
- BenchmarkEpoch AI evaluates Gemini 3.5 Flash
SimpleQA Verified 66.2%
- BenchmarkEpoch AI evaluates DeepSeek v4 Pro (high)
SimpleQA Verified 47.0%
- BenchmarkEpoch AI evaluates Gemini 3.7 Flash
SimpleQA Verified 69.2%
- BenchmarkEpoch AI evaluates DeepSeek V4 Pro 0813
SimpleQA Verified 52.9%
- BenchmarkEpoch AI evaluates DeepSeek V4 Flash 0731
SimpleQA Verified 33.6%
- BenchmarkEpoch AI evaluates Gemini 3.6 Flash
SimpleQA Verified 66.2%
- BenchmarkEpoch AI evaluates Gemini 3 Flash Preview
SimpleQA Verified 66.8%
- BenchmarkEpoch AI evaluates Grok 4.6
SimpleQA Verified 49.3%
- BenchmarkEpoch AI evaluates Grok 4.20
SimpleQA Verified 30.2%
- BenchmarkEpoch AI evaluates Grok 4.3 Beta
SimpleQA Verified 33.2%
- BenchmarkEpoch AI evaluates Grok 4.5
SimpleQA Verified 48.3%
- BenchmarkEpoch AI evaluates Grok 4.6 (xhigh)
SimpleQA Verified 48.9%
- BenchmarkEpoch AI evaluates GPT-5.2 (low)
SimpleQA Verified 32.8% · Mystery Game Puzzles 10.0%
- BenchmarkEpoch AI evaluates GPT-5.2 (medium)
SimpleQA Verified 32.7%
- BenchmarkEpoch AI evaluates GPT-5.4 Nano
SimpleQA Verified 11.7% · Mystery Game Puzzles 5.0%
- BenchmarkEpoch AI evaluates o4 Mini
SimpleQA Verified 18.8% · Mystery Game Puzzles 5.0%