AI news & updates
803 events
- BenchmarkEpoch AI evaluates Muse Spark 1.1
SimpleQA Verified 57.8%
- BenchmarkEpoch AI evaluates Claude 3 Opus
SimpleQA Verified 12.6%
- BenchmarkEpoch AI evaluates Granite 4.0 Micro
GPQA diamond 28.3% · OTIS Mock AIME 2024-2025 2.8% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates seed-oss-36b-instruct
GPQA diamond 71.5%
Epoch AI Benchmarking Hubseed-oss-36b-instruct - BenchmarkEpoch AI evaluates Qwen3 32B
GPQA diamond 54.1% · OTIS Mock AIME 2024-2025 23.1% · OTIS Mock AIME 2024-2025 66.9%
- BenchmarkEpoch AI evaluates Qwen3-30B-A3B-Thinking (Jul 2025)
GPQA diamond 70.1% · OTIS Mock AIME 2024-2025 70.3% · Chess Puzzles 8.0%
- BenchmarkEpoch AI evaluates Qwen3-30B-A3B-Instruct (Jul 2025)
GPQA diamond 55.6% · OTIS Mock AIME 2024-2025 62.2% · Chess Puzzles 2.0%
- BenchmarkEpoch AI evaluates Qwen3 30B A3B
GPQA diamond 50.4% · GPQA diamond 61.7% · OTIS Mock AIME 2024-2025 25.6% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Qwen2.5-7B
GPQA diamond 35.5% · OTIS Mock AIME 2024-2025 2.5% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Mistral Small 3.1
GPQA diamond 41.9% · OTIS Mock AIME 2024-2025 3.9% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Mistral Small 3
GPQA diamond 47.3% · OTIS Mock AIME 2024-2025 6.7% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Magistral Small 1.2
GPQA diamond 47.6% · OTIS Mock AIME 2024-2025 28.1% · Chess Puzzles 3.0%
- BenchmarkEpoch AI evaluates Llama 3.2 1B
GPQA diamond 23.9% · OTIS Mock AIME 2024-2025 0.6% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates GLM 4.7 Flash
GPQA diamond 45.1% · GPQA diamond 60.5% · OTIS Mock AIME 2024-2025 58.3%
- BenchmarkEpoch AI evaluates GPT-6 Astra
GPQA diamond 95.8% · FrontierMath-Tiers-1-3-v2-Private 93.7% · FrontierMath-Tier-4-v2-Private 97.6% · OTIS Mock AIME 2024-2025 100.0%
- BenchmarkEpoch AI evaluates Gemini 3.1 Flash Lite
FrontierMath-Tiers-1-3-v2-Private 22.5% · FrontierMath-Tiers-1-3-v2-Private 27.7%
- BenchmarkEpoch AI evaluates Qwen3.6 35B A3B
FrontierMath-Tiers-1-3-v2-Private 20.4%
- BenchmarkEpoch AI evaluates Qwen 3.6 Plus (2026-04-02)
FrontierMath-Tiers-1-3-v2-Private 38.2%
- BenchmarkEpoch AI evaluates Qwen3.5 397B A17B
FrontierMath-Tiers-1-3-v2-Private 31.2%
- BenchmarkEpoch AI evaluates Qwen3-Max-Instruct
FrontierMath-Tiers-1-3-v2-Private 18.9%
- BenchmarkEpoch AI evaluates GPT-6 Astra (none)
FrontierMath-Tier-4-v2-Private 82.9%
- BenchmarkEpoch AI evaluates GPT-6 Astra (low)
FrontierMath-Tier-4-v2-Private 87.8%
- BenchmarkEpoch AI evaluates GPT-6 Astra (medium)
FrontierMath-Tier-4-v2-Private 97.6%
- BenchmarkEpoch AI evaluates GPT-6 Astra (xhigh)
FrontierMath-Tier-4-v2-Private 97.6%
- BenchmarkEpoch AI evaluates granite-4.0-1b
OTIS Mock AIME 2024-2025 0.8% · Chess Puzzles 0.0%
Epoch AI Benchmarking Hubgranite-4.0-1b - BenchmarkEpoch AI evaluates Qwen3.5-35B-A3B
OTIS Mock AIME 2024-2025 70.0% · OTIS Mock AIME 2024-2025 54.4% · Chess Puzzles 10.0%
- BenchmarkEpoch AI evaluates Qwen3 14B
OTIS Mock AIME 2024-2025 25.8% · Chess Puzzles 0.0% · Chess Puzzles 4.0%
- BenchmarkEpoch AI evaluates Mistral Small 3.2
OTIS Mock AIME 2024-2025 30.3% · Chess Puzzles 1.0%
- BenchmarkEpoch AI evaluates Mistral 7B v0.3
OTIS Mock AIME 2024-2025 0.3% · Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Llama 3-8B
OTIS Mock AIME 2024-2025 1.9%
- BenchmarkEpoch AI evaluates Qwen2.5-32B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates phi-3-mini 3.8B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates Llama 2-7B
Chess Puzzles 0.0%
- BenchmarkEpoch AI evaluates GLM 5.3
Mystery Game Puzzles 33.0%
- BenchmarkEpoch AI evaluates GPT-5.4 (none)
Mystery Game Puzzles 16.0%
- BenchmarkEpoch AI evaluates GPT-5.6 Luna (none)
Mystery Game Puzzles 20.0%
- BenchmarkEpoch AI evaluates GLM 5.2
FrontierMath-Tiers-1-3-v2-Private 42.5% · FrontierMath-Tiers-1-3-v2-Private 54.7%
- BenchmarkEpoch AI evaluates Qwen3.7 Flash
FrontierMath-Tiers-1-3-v2-Private 19.3%
- BenchmarkEpoch AI evaluates GPT-5.6 Luna (none)
FrontierMath-Tiers-1-3-v2-Private 39.6%
- BenchmarkEpoch AI evaluates Qwen3.7 Plus
FrontierMath-Tiers-1-3-v2-Private 34.4%