AI news & updates
1,068 events
- BenchmarkEpoch AI evaluates Qwen3.5 397B A17B
FrontierMath-Tiers-1-3-v2-Private 31.2%
- BenchmarkEpoch AI evaluates Qwen3-Max-Instruct
FrontierMath-Tiers-1-3-v2-Private 18.9%
- BenchmarkEpoch AI evaluates GPT-6 Astra (none)
FrontierMath-Tier-4-v2-Private 82.9%
- BenchmarkEpoch AI evaluates GPT-6 Astra (low)
FrontierMath-Tier-4-v2-Private 87.8%
- BenchmarkEpoch AI evaluates GPT-6 Astra (medium)
FrontierMath-Tier-4-v2-Private 97.6%
- BenchmarkEpoch AI evaluates GPT-6 Astra (xhigh)
FrontierMath-Tier-4-v2-Private 97.6%
- BenchmarkEpoch AI evaluates granite-4.0-1b
OTIS Mock AIME 2024-2025 0.8% · Chess Puzzles 0.0%
Epoch AI Benchmarking Hubgranite-4.0-1b - BenchmarkEpoch AI evaluates Qwen3.5-35B-A3B
OTIS Mock AIME 2024-2025 70.0% · OTIS Mock AIME 2024-2025 54.4% · Chess Puzzles 10.0%
- BenchmarkEpoch AI evaluates Qwen3 14B
OTIS Mock AIME 2024-2025 25.8% · Chess Puzzles 0.0% · Chess Puzzles 4.0%
- BenchmarkEpoch AI evaluates Mistral Small 3.2
OTIS Mock AIME 2024-2025 30.3% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Mistral 7B v0.3
OTIS Mock AIME 2024-2025 0.3% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Llama 3-8B
OTIS Mock AIME 2024-2025 1.9%
- BenchmarkEpoch AI evaluates Qwen2.5-32B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates phi-3-mini 3.8B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Llama 2-7B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates GLM 5.3
Mystery Game Puzzles 33.0%
- BenchmarkEpoch AI evaluates GPT-5.4 (none)
Mystery Game Puzzles 16.0%
- BenchmarkEpoch AI evaluates GPT-5.6 Luna (none)
Mystery Game Puzzles 20.0%
- BenchmarkEpoch AI evaluates GLM 5.2
FrontierMath-Tiers-1-3-v2-Private 42.5% · FrontierMath-Tiers-1-3-v2-Private 54.7%
- BenchmarkEpoch AI evaluates Qwen3.7 Flash
FrontierMath-Tiers-1-3-v2-Private 19.3%
- BenchmarkEpoch AI evaluates GPT-5.6 Luna (none)
FrontierMath-Tiers-1-3-v2-Private 39.6%
- BenchmarkEpoch AI evaluates Qwen3.7 Plus
FrontierMath-Tiers-1-3-v2-Private 34.4%
- BenchmarkEpoch AI evaluates GPT-5.6 Luna (low)
FrontierMath-Tiers-1-3-v2-Private 41.4%
- BenchmarkEpoch AI evaluates Qwen 3.6 Flash (2026-04-16)
FrontierMath-Tiers-1-3-v2-Private 17.2% · FrontierMath-Tiers-1-3-v2-Private 22.5%
- BenchmarkEpoch AI evaluates Qwen 3.6 Plus (2026-04-02)
FrontierMath-Tiers-1-3-v2-Private 32.3%
- BenchmarkEpoch AI evaluates Qwen3.6 35B A3B
FrontierMath-Tiers-1-3-v2-Private 17.5%
- BenchmarkEpoch AI evaluates Qwen3.6 27B
FrontierMath-Tiers-1-3-v2-Private 34.0%
- BenchmarkEpoch AI evaluates GLM 5.1
FrontierMath-Tiers-1-3-v2-Private 36.8%
- BenchmarkEpoch AI evaluates Kimi K3 (low)
Mystery Game Puzzles 12.0%
- BenchmarkEpoch AI evaluates Kimi K2.6
Mystery Game Puzzles 12.0%
- Open releaseTencent releases Hy4 preview
Tencent: Hy4 preview is a mixture-of-experts model from Tencent, with 49B active parameters out of 770B total. It is designed for coding agents, complex tool-use workflows, and productivity tasks that...
- Open releaseTencent releases Tencent Hy4 preview (unknown)
- BenchmarkEpoch AI evaluates granite-4.0-1b
GPQA diamond 24.0%
Epoch AI Benchmarking Hubgranite-4.0-1b - BenchmarkEpoch AI evaluates Qwen3.5-35B-A3B
GPQA diamond 81.2% · GPQA diamond 83.5% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates qwen3-4b-instruct-2507
GPQA diamond 45.8% · OTIS Mock AIME 2024-2025 52.2% · Chess Puzzles 4.0%
Epoch AI Benchmarking Hubqwen3-4b-instruct-2507 - BenchmarkEpoch AI evaluates Qwen3-4B
GPQA diamond 43.6% · GPQA diamond 52.3% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Qwen3 32B
GPQA diamond 65.7% · Chess Puzzles 1.0% · Chess Puzzles 5.0%
- BenchmarkEpoch AI evaluates Qwen3 14B
GPQA diamond 53.4% · GPQA diamond 63.8% · OTIS Mock AIME 2024-2025 66.4%
- BenchmarkEpoch AI evaluates Qwen3-1.7B
GPQA diamond 30.6% · GPQA diamond 38.0% · OTIS Mock AIME 2024-2025 8.1% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Mistral Small 3.2
GPQA diamond 49.1%