AI news & updates
803 events
- BenchmarkEpoch AI evaluates Gemma 4 26B A4B
OTIS Mock AIME 2024-2025 82.2%
- BenchmarkEpoch AI evaluates GLM 4.7 Flash
OTIS Mock AIME 2024-2025 25.0% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates DeepSeek-R1-Distill-Qwen-14B
OTIS Mock AIME 2024-2025 50.6% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates GLM 5.3
SimpleQA Verified 41.0%
- BenchmarkEpoch AI evaluates Qwen3.5-2B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Phi 4
Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Llama 3-8B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Llama 2-13B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates GLM 5.3 Flash
Mystery Game Puzzles 8.0%
- BenchmarkEpoch AI evaluates Qwen3.7 Flash
Mystery Game Puzzles 15.0%
- BenchmarkEpoch AI evaluates GPT-5.6 Terra (medium)
Mystery Game Puzzles 10.0%
- BenchmarkEpoch AI evaluates GPT-5.2 (medium)
Mystery Game Puzzles 22.0%
- BenchmarkEpoch AI evaluates GPT-5.5 (low)
Mystery Game Puzzles 28.0%
- BenchmarkEpoch AI evaluates Qwen3.7 Plus
Mystery Game Puzzles 17.0%
- BenchmarkEpoch AI evaluates GPT-5.4 (medium)
Mystery Game Puzzles 28.0%
- BenchmarkEpoch AI evaluates GPT-4 (Jun 2023)
Mystery Game Puzzles 12.0%
- Model launchinclusionAI releases Ling 3.0 Flash Fin
Ling 3.0 Flash Fin is a finance-focused mixture-of-experts model from InclusionAI, built on Ling 3.0 Flash with 5.1B active parameters out of 124B total. It is designed for real-world investment...
- BenchmarkEpoch AI evaluates Llama 3.1-8B
GPQA diamond 27.0% · OTIS Mock AIME 2024-2025 1.7% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Qwen3.5-9B
GPQA diamond 78.9% · GPQA diamond 79.0% · OTIS Mock AIME 2024-2025 61.7% · OTIS Mock AIME 2024-2025 42.8%
- BenchmarkEpoch AI evaluates Qwen3 8B
GPQA diamond 47.5% · GPQA diamond 56.8% · OTIS Mock AIME 2024-2025 22.2% · OTIS Mock AIME 2024-2025 56.1%
- BenchmarkEpoch AI evaluates Gemma 3 27B
GPQA diamond 47.7% · OTIS Mock AIME 2024-2025 22.5% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates gpt-oss-20b
GPQA diamond 60.8% · GPQA diamond 53.2% · OTIS Mock AIME 2024-2025 50.8% · OTIS Mock AIME 2024-2025 65.3%
- BenchmarkEpoch AI evaluates o1 (low)
FrontierMath-Tiers-1-3-v2-Private 8.4%
- BenchmarkEpoch AI evaluates o1 (medium)
FrontierMath-Tiers-1-3-v2-Private 10.2%
- BenchmarkEpoch AI evaluates o3
FrontierMath-Tiers-1-3-v2-Private 33.3% · SimpleQA Verified 49.4% · Mystery Game Puzzles 29.0%
- BenchmarkEpoch AI evaluates o3 (medium)
FrontierMath-Tiers-1-3-v2-Private 29.8% · Mystery Game Puzzles 23.0%
- BenchmarkEpoch AI evaluates GPT-5 (low)
FrontierMath-Tiers-1-3-v2-Private 37.2% · Mystery Game Puzzles 16.0%
- BenchmarkEpoch AI evaluates GPT-4.1 Mini
FrontierMath-Tiers-1-3-v2-Private 6.7% · Mystery Game Puzzles 7.0%
- BenchmarkEpoch AI evaluates GPT-3.5 Turbo (Jan 2024)
FrontierMath-Tiers-1-3-v2-Private 0.0% · Mystery Game Puzzles 3.0%
- BenchmarkEpoch AI evaluates GPT-4o-mini
FrontierMath-Tiers-1-3-v2-Private 0.7% · Mystery Game Puzzles 12.0%
- BenchmarkEpoch AI evaluates o3 (low)
FrontierMath-Tiers-1-3-v2-Private 19.3%
- BenchmarkEpoch AI evaluates GPT-4.1
FrontierMath-Tiers-1-3-v2-Private 6.0%
- BenchmarkEpoch AI evaluates GPT-4 Turbo (Apr 2024)
FrontierMath-Tiers-1-3-v2-Private 0.7%
- BenchmarkEpoch AI evaluates GPT-4o (Aug 2024)
FrontierMath-Tiers-1-3-v2-Private 0.4%
- BenchmarkEpoch AI evaluates o4-mini (low)
FrontierMath-Tiers-1-3-v2-Private 16.1% · SimpleQA Verified 19.6%
- BenchmarkEpoch AI evaluates o4-mini (medium)
FrontierMath-Tiers-1-3-v2-Private 28.8%
- BenchmarkEpoch AI evaluates o3-mini (medium)
FrontierMath-Tiers-1-3-v2-Private 10.5%
- BenchmarkEpoch AI evaluates GPT-5 mini (minimal)
FrontierMath-Tiers-1-3-v2-Private 6.0% · Mystery Game Puzzles 10.0%
- BenchmarkEpoch AI evaluates GPT-5 (minimal)
FrontierMath-Tiers-1-3-v2-Private 18.2% · Mystery Game Puzzles 14.0%
- BenchmarkEpoch AI evaluates GPT-5 mini (low)
FrontierMath-Tiers-1-3-v2-Private 18.2%