ANALYSIS Meta’s Wang Says ‘Watermelon’ Model Matches GPT-5.5 Mid-Training 7/10 3 min read 3 weeks ago
BENCHMARKS ITBench-AA: Frontier Models Score Below 50% on Agentic SRE Tasks 8/10 3 min read 2 months ago