AI news & updates
260 events
- BenchmarkEpoch AI evaluates gpt-oss-120b
Mystery Game Puzzles 0.0% · Mystery Game Puzzles 2.0%
- BenchmarkEpoch AI evaluates GPT-5.2 (none)
Mystery Game Puzzles 14.0%
- BenchmarkEpoch AI evaluates DeepSeek v4 Pro (unknown thinking)
Mystery Game Puzzles 17.0%
- BenchmarkEpoch AI evaluates GPT-5.4 nano (low)
Mystery Game Puzzles 3.0%
- BenchmarkEpoch AI evaluates Nemotron 3 Ultra
Mystery Game Puzzles 20.0%
- BenchmarkEpoch AI evaluates GPT-5.6 Terra (none)
Mystery Game Puzzles 14.0%
- BenchmarkEpoch AI evaluates GPT-5 nano (medium)
Mystery Game Puzzles 9.0%
- BenchmarkEpoch AI evaluates GPT-5.1 (no thinking)
Mystery Game Puzzles 15.0%
- BenchmarkEpoch AI evaluates GPT-5.4 mini (none)
Mystery Game Puzzles 11.0%
- BenchmarkEpoch AI evaluates GPT-5.4 nano (no thinking)
Mystery Game Puzzles 9.0%
- BenchmarkEpoch AI evaluates GLM 5.3 Flash
GPQA diamond 90.2% · OTIS Mock AIME 2024-2025 93.9% · Chess Puzzles 14.0%
- BenchmarkEpoch AI evaluates GLM 5.3
FrontierMath-Tiers-1-3-v2-Private 68.8% · FrontierMath-Tier-4-v2-Private 29.3%
- BenchmarkEpoch AI evaluates GLM 5.3
GPQA diamond 90.9% · OTIS Mock AIME 2024-2025 91.1% · Chess Puzzles 21.0%
- BenchmarkEpoch AI evaluates DeepSeek V4 Pro 0813
FrontierMath-Tiers-1-3-v2-Private 64.6% · FrontierMath-Tier-4-v2-Private 26.8% · Mystery Game Puzzles 43.0%
- BenchmarkEpoch AI evaluates DeepSeek V4 Pro 0813
GPQA diamond 91.7% · OTIS Mock AIME 2024-2025 98.6% · Chess Puzzles 47.0%
- BenchmarkEpoch AI evaluates Grok 4.6 (xhigh)
EBR-bench 30.5%
- BenchmarkEpoch AI evaluates Inkling Small (xhigh)
Mystery Game Puzzles 6.0%
- BenchmarkEpoch AI evaluates Gemini 3.7 Flash
GPQA diamond 94.8% · FrontierMath-Tiers-1-3-v2-Private 71.6% · FrontierMath-Tier-4-v2-Private 36.6% · OTIS Mock AIME 2024-2025 97.2%
- BenchmarkEpoch AI evaluates Inkling Small (xhigh)
GPQA diamond 88.5% · FrontierMath-Tiers-1-3-v2-Private 46.3% · FrontierMath-Tier-4-v2-Private 17.1% · OTIS Mock AIME 2024-2025 90.0%
- BenchmarkEpoch AI evaluates Grok 4.6 (xhigh)
GPQA diamond 93.2% · FrontierMath-Tiers-1-3-v2-Private 66.0% · FrontierMath-Tier-4-v2-Private 31.7% · OTIS Mock AIME 2024-2025 99.2%