AnalysisAI ModelsSeptember 3, 2026

FrontierSWE v2 benchmark adds 21 ultra-long-horizon tasks

FrontierSWE v2 expands to 34 tasks, adding 21 ultra-long-horizon challenges across new domains like decoding speech from MEG brain recordings and predicting ball trajectories. Claude Fable 5.1 leads, followed by GPT-5.6 and GLM-5.3.

1 source

More stories today

Open the live feed