AI news & updates
803 events
- BenchmarkEpoch AI evaluates GPT-5.6 Luna (low)
FrontierMath-Tiers-1-3-v2-Private 41.4%
- BenchmarkEpoch AI evaluates Qwen 3.6 Flash (2026-04-16)
FrontierMath-Tiers-1-3-v2-Private 17.2% · FrontierMath-Tiers-1-3-v2-Private 22.5%
- BenchmarkEpoch AI evaluates Qwen 3.6 Plus (2026-04-02)
FrontierMath-Tiers-1-3-v2-Private 32.3%
- BenchmarkEpoch AI evaluates Qwen3.6 35B A3B
FrontierMath-Tiers-1-3-v2-Private 17.5%
- BenchmarkEpoch AI evaluates Qwen3.6 27B
FrontierMath-Tiers-1-3-v2-Private 34.0%
- BenchmarkEpoch AI evaluates GLM 5.1
FrontierMath-Tiers-1-3-v2-Private 36.8%
- BenchmarkEpoch AI evaluates Kimi K3 (low)
Mystery Game Puzzles 12.0%
- BenchmarkEpoch AI evaluates Kimi K2.6
Mystery Game Puzzles 12.0%
- Open releaseTencent releases Hy4 preview
Tencent: Hy4 preview is a mixture-of-experts model from Tencent, with 49B active parameters out of 770B total. It is designed for coding agents, complex tool-use workflows, and productivity tasks that...
- Open releaseTencent releases Tencent Hy4 preview (unknown)
- BenchmarkEpoch AI evaluates granite-4.0-1b
GPQA diamond 24.0%
Epoch AI Benchmarking Hubgranite-4.0-1b - BenchmarkEpoch AI evaluates Qwen3.5-35B-A3B
GPQA diamond 81.2% · GPQA diamond 83.5% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates qwen3-4b-instruct-2507
GPQA diamond 45.8% · OTIS Mock AIME 2024-2025 52.2% · Chess Puzzles 4.0%
Epoch AI Benchmarking Hubqwen3-4b-instruct-2507 - BenchmarkEpoch AI evaluates Qwen3-4B
GPQA diamond 43.6% · GPQA diamond 52.3% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Qwen3 32B
GPQA diamond 65.7% · Chess Puzzles 1.0% · Chess Puzzles 5.0%
- BenchmarkEpoch AI evaluates Qwen3 14B
GPQA diamond 53.4% · GPQA diamond 63.8% · OTIS Mock AIME 2024-2025 66.4%
- BenchmarkEpoch AI evaluates Qwen3-1.7B
GPQA diamond 30.6% · GPQA diamond 38.0% · OTIS Mock AIME 2024-2025 8.1% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Mistral Small 3.2
GPQA diamond 49.1%
- BenchmarkEpoch AI evaluates granite-4.0-350m
GPQA diamond 11.2% · OTIS Mock AIME 2024-2025 0.3% · Chess Puzzles 0.0%
Epoch AI Benchmarking Hubgranite-4.0-350m - BenchmarkEpoch AI evaluates Gemma 3 4B
GPQA diamond 23.2% · OTIS Mock AIME 2024-2025 7.5% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Gemma 3 1B
GPQA diamond 19.9% · OTIS Mock AIME 2024-2025 1.1% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Gemma 3 12B
GPQA diamond 39.5% · OTIS Mock AIME 2024-2025 16.7% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates DeepSeek-R1-Distill-Qwen-32B
GPQA diamond 64.1% · OTIS Mock AIME 2024-2025 55.6% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates DeepSeek-R1-Distill-Qwen-1.5B
GPQA diamond 33.6% · OTIS Mock AIME 2024-2025 21.4% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates deepseek-r1-0528-qwen3-8b
GPQA diamond 9.3% · OTIS Mock AIME 2024-2025 43.9% · Chess Puzzles 3.0%
Epoch AI Benchmarking Hubdeepseek-r1-0528-qwen3-8b - BenchmarkEpoch AI evaluates QwQ-32B
GPQA diamond 65.3% · OTIS Mock AIME 2024-2025 59.2% · Chess Puzzles 5.0%
- BenchmarkEpoch AI evaluates Gemini 3.1 Flash Lite
FrontierMath-Tiers-1-3-v2-Private 21.4%
- BenchmarkEpoch AI evaluates Qwen3.6 27B
FrontierMath-Tiers-1-3-v2-Private 35.1%
- BenchmarkEpoch AI evaluates GLM 5.1
FrontierMath-Tiers-1-3-v2-Private 24.9%
- BenchmarkEpoch AI evaluates GPT-5.4 nano (no thinking)
FrontierMath-Tiers-1-3-v2-Private 4.6%
- BenchmarkEpoch AI evaluates GPT-5.4 mini (none)
FrontierMath-Tiers-1-3-v2-Private 17.2%
- BenchmarkEpoch AI evaluates GPT-5.4 nano (low)
FrontierMath-Tiers-1-3-v2-Private 20.4%
- BenchmarkEpoch AI evaluates GPT-5.4 mini (low)
FrontierMath-Tiers-1-3-v2-Private 24.6%
- BenchmarkEpoch AI evaluates Qwen3.5-Flash
FrontierMath-Tiers-1-3-v2-Private 18.2% · FrontierMath-Tiers-1-3-v2-Private 9.5%
- BenchmarkEpoch AI evaluates Qwen3.5 397B A17B
FrontierMath-Tiers-1-3-v2-Private 29.5%
- BenchmarkEpoch AI evaluates o1
FrontierMath-Tiers-1-3-v2-Private 14.7%
- BenchmarkEpoch AI evaluates DeepSeek LLM 67B
OTIS Mock AIME 2024-2025 0.8% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates seed-oss-36b-instruct
OTIS Mock AIME 2024-2025 67.5% · Chess Puzzles 13.0%
Epoch AI Benchmarking Hubseed-oss-36b-instruct - BenchmarkEpoch AI evaluates Qwen3.5-4B
OTIS Mock AIME 2024-2025 55.8%
- BenchmarkEpoch AI evaluates Qwen3 30B A3B
OTIS Mock AIME 2024-2025 62.8%