AI news & updates
1,068 events
- Announcement3 new ways to plan and book travel in Search
Book hotels and track airfares, plus view miles and rewards with AI Mode in Google Search.
Google (The Keyword)✓ primaryGoogle - AnnouncementPiloting the world's first double-blind AI evaluations
Piloting the world's first double-blind AI evaluations
Google DeepMind✓ primaryGoogle - Model launchinclusionAI releases Ling 3.0 Flash Fin
Ling 3.0 Flash Fin is a finance-focused mixture-of-experts model from InclusionAI, built on Ling 3.0 Flash with 5.1B active parameters out of 124B total. It is designed for real-world investment...
- BenchmarkEpoch AI evaluates Llama 3.1-8B
GPQA diamond 27.0% · OTIS Mock AIME 2024-2025 1.7% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Qwen3.5-9B
GPQA diamond 78.9% · GPQA diamond 79.0% · OTIS Mock AIME 2024-2025 61.7% · OTIS Mock AIME 2024-2025 42.8%
- BenchmarkEpoch AI evaluates Qwen3 8B
GPQA diamond 47.5% · GPQA diamond 56.8% · OTIS Mock AIME 2024-2025 22.2% · OTIS Mock AIME 2024-2025 56.1%
- BenchmarkEpoch AI evaluates Gemma 3 27B
GPQA diamond 47.7% · OTIS Mock AIME 2024-2025 22.5% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates gpt-oss-20b
GPQA diamond 60.8% · GPQA diamond 53.2% · OTIS Mock AIME 2024-2025 50.8% · OTIS Mock AIME 2024-2025 65.3%
- BenchmarkEpoch AI evaluates o1 (low)
FrontierMath-Tiers-1-3-v2-Private 8.4%
- BenchmarkEpoch AI evaluates o1 (medium)
FrontierMath-Tiers-1-3-v2-Private 10.2%
- BenchmarkEpoch AI evaluates o3
FrontierMath-Tiers-1-3-v2-Private 33.3% · SimpleQA Verified 49.4% · Mystery Game Puzzles 29.0%
- BenchmarkEpoch AI evaluates o3 (medium)
FrontierMath-Tiers-1-3-v2-Private 29.8% · Mystery Game Puzzles 23.0%
- BenchmarkEpoch AI evaluates GPT-5 (low)
FrontierMath-Tiers-1-3-v2-Private 37.2% · Mystery Game Puzzles 16.0%
- BenchmarkEpoch AI evaluates GPT-4.1 Mini
FrontierMath-Tiers-1-3-v2-Private 6.7% · Mystery Game Puzzles 7.0%
- BenchmarkEpoch AI evaluates GPT-3.5 Turbo (Jan 2024)
FrontierMath-Tiers-1-3-v2-Private 0.0% · Mystery Game Puzzles 3.0%
- BenchmarkEpoch AI evaluates GPT-4o-mini
FrontierMath-Tiers-1-3-v2-Private 0.7% · Mystery Game Puzzles 12.0%
- BenchmarkEpoch AI evaluates o3 (low)
FrontierMath-Tiers-1-3-v2-Private 19.3%
- BenchmarkEpoch AI evaluates GPT-4.1
FrontierMath-Tiers-1-3-v2-Private 6.0%
- BenchmarkEpoch AI evaluates GPT-4 Turbo (Apr 2024)
FrontierMath-Tiers-1-3-v2-Private 0.7%
- BenchmarkEpoch AI evaluates GPT-4o (Aug 2024)
FrontierMath-Tiers-1-3-v2-Private 0.4%
- BenchmarkEpoch AI evaluates o4-mini (low)
FrontierMath-Tiers-1-3-v2-Private 16.1% · SimpleQA Verified 19.6%
- BenchmarkEpoch AI evaluates o4-mini (medium)
FrontierMath-Tiers-1-3-v2-Private 28.8%
- BenchmarkEpoch AI evaluates o3-mini (medium)
FrontierMath-Tiers-1-3-v2-Private 10.5%
- BenchmarkEpoch AI evaluates GPT-5 mini (minimal)
FrontierMath-Tiers-1-3-v2-Private 6.0% · Mystery Game Puzzles 10.0%
- BenchmarkEpoch AI evaluates GPT-5 (minimal)
FrontierMath-Tiers-1-3-v2-Private 18.2% · Mystery Game Puzzles 14.0%
- BenchmarkEpoch AI evaluates GPT-5 mini (low)
FrontierMath-Tiers-1-3-v2-Private 18.2%
- BenchmarkEpoch AI evaluates GPT-5 nano (minimal)
FrontierMath-Tiers-1-3-v2-Private 1.8% · Mystery Game Puzzles 5.0%
- BenchmarkEpoch AI evaluates o3 Mini
FrontierMath-Tiers-1-3-v2-Private 3.9% · Mystery Game Puzzles 7.0%
- BenchmarkEpoch AI evaluates GPT-5 nano (low)
FrontierMath-Tiers-1-3-v2-Private 6.0% · Mystery Game Puzzles 9.0%
- BenchmarkEpoch AI evaluates GLM 5.3 Flash
FrontierMath-Tiers-1-3-v2-Private 55.8% · FrontierMath-Tier-4-v2-Private 17.1%
- BenchmarkEpoch AI evaluates Qwen3.5 Plus 2026-02-15
SimpleQA Verified 25.4% · Mystery Game Puzzles 17.0%
- BenchmarkEpoch AI evaluates Muse Spark 1.2 (xhigh)
SimpleQA Verified 60.3%
- BenchmarkEpoch AI evaluates Inkling (xhigh)
SimpleQA Verified 40.3%
- BenchmarkEpoch AI evaluates Qwen3-235B-A22B-Thinking (Jul 2025)
SimpleQA Verified 40.4% · Mystery Game Puzzles 9.0%
- BenchmarkEpoch AI evaluates GLM 5.1
SimpleQA Verified 34.0%
- BenchmarkEpoch AI evaluates Inkling Small (xhigh)
SimpleQA Verified 19.1%
- BenchmarkEpoch AI evaluates Kimi K3
SimpleQA Verified 50.6%
- BenchmarkEpoch AI evaluates GLM 5.2
SimpleQA Verified 34.2% · Mystery Game Puzzles 15.0% · Mystery Game Puzzles 19.0% · Mystery Game Puzzles 18.0%
- BenchmarkEpoch AI evaluates Kimi K2.7 Code
SimpleQA Verified 36.5%
- BenchmarkEpoch AI evaluates GLM 4.7
SimpleQA Verified 32.2%