AI news & updates
1,068 events
- BenchmarkEpoch AI evaluates Kimi K2.5
SimpleQA Verified 34.3%
- BenchmarkEpoch AI evaluates Qwen3.7 Max
SimpleQA Verified 55.8% · Mystery Game Puzzles 26.0%
- BenchmarkEpoch AI evaluates Qwen 3.6 Plus (2026-04-02)
SimpleQA Verified 44.1% · Mystery Game Puzzles 12.0%
- BenchmarkEpoch AI evaluates Qwen 3.6 Max (Preview)
SimpleQA Verified 52.0% · Mystery Game Puzzles 19.0%
- BenchmarkEpoch AI evaluates Qwen 3.6 Flash (2026-04-16)
SimpleQA Verified 15.9% · Mystery Game Puzzles 12.0% · Mystery Game Puzzles 18.0%
- BenchmarkEpoch AI evaluates Qwen3.5-Flash
SimpleQA Verified 20.3% · Mystery Game Puzzles 20.0% · Mystery Game Puzzles 16.0%
- BenchmarkEpoch AI evaluates Qwen3-Max-Instruct
SimpleQA Verified 48.7% · Mystery Game Puzzles 5.0%
- BenchmarkEpoch AI evaluates Qwen3.8 Max (xhigh)
SimpleQA Verified 45.8%
- BenchmarkEpoch AI evaluates Gemini 3.5 Flash
SimpleQA Verified 66.2%
- BenchmarkEpoch AI evaluates DeepSeek v4 Pro (high)
SimpleQA Verified 47.0%
- BenchmarkEpoch AI evaluates Gemini 3.7 Flash
SimpleQA Verified 69.2%
- BenchmarkEpoch AI evaluates DeepSeek V4 Pro 0813
SimpleQA Verified 52.9%
- BenchmarkEpoch AI evaluates DeepSeek V4 Flash 0731
SimpleQA Verified 33.6%
- BenchmarkEpoch AI evaluates Gemini 3.6 Flash
SimpleQA Verified 66.2%
- BenchmarkEpoch AI evaluates Gemini 3 Flash Preview
SimpleQA Verified 66.8%
- BenchmarkEpoch AI evaluates Grok 4.6
SimpleQA Verified 49.3%
- BenchmarkEpoch AI evaluates Grok 4.20
SimpleQA Verified 30.2%
- BenchmarkEpoch AI evaluates Grok 4.3 Beta
SimpleQA Verified 33.2%
- BenchmarkEpoch AI evaluates Grok 4.5
SimpleQA Verified 48.3%
- BenchmarkEpoch AI evaluates Grok 4.6 (xhigh)
SimpleQA Verified 48.9%
- BenchmarkEpoch AI evaluates GPT-5.2 (low)
SimpleQA Verified 32.8% · Mystery Game Puzzles 10.0%
- BenchmarkEpoch AI evaluates GPT-5.2 (medium)
SimpleQA Verified 32.7%
- BenchmarkEpoch AI evaluates GPT-5.4 Nano
SimpleQA Verified 11.7% · Mystery Game Puzzles 5.0%
- BenchmarkEpoch AI evaluates o4 Mini
SimpleQA Verified 18.8% · Mystery Game Puzzles 5.0%
- BenchmarkEpoch AI evaluates GPT-5
SimpleQA Verified 50.1%
- BenchmarkEpoch AI evaluates GPT-5.4 Mini
SimpleQA Verified 29.4%
- BenchmarkEpoch AI evaluates GPT-5.2
SimpleQA Verified 34.3%
- BenchmarkEpoch AI evaluates GPT-5.5 (xhigh)
SimpleQA Verified 63.0%
- BenchmarkEpoch AI evaluates GPT-5.4 Pro (xhigh)
SimpleQA Verified 46.3%
- BenchmarkEpoch AI evaluates GPT-5.1
SimpleQA Verified 48.0%
- BenchmarkEpoch AI evaluates Claude Sonnet 4.5 (59k thinking)
SimpleQA Verified 30.7%
- BenchmarkEpoch AI evaluates GPT-5.4 (xhigh)
SimpleQA Verified 45.1%
- BenchmarkEpoch AI evaluates Claude Sonnet 5 (xhigh)
SimpleQA Verified 32.9%
- BenchmarkEpoch AI evaluates Claude Opus 4.5 (32k thinking)
SimpleQA Verified 45.7%
- BenchmarkEpoch AI evaluates Claude Haiku 4.5
SimpleQA Verified 12.6%
- BenchmarkEpoch AI evaluates GPT-5.2 (xhigh)
SimpleQA Verified 37.1%
- BenchmarkEpoch AI evaluates Claude Opus 4.6
SimpleQA Verified 47.0%
- BenchmarkEpoch AI evaluates Claude Sonnet 5
SimpleQA Verified 33.7%
- BenchmarkEpoch AI evaluates Claude Sonnet 4.6
SimpleQA Verified 32.8%
- BenchmarkEpoch AI evaluates Claude Opus 4.7 (xhigh)
SimpleQA Verified 51.7%