AnalysisAI AgentsOctober 5, 2026

Talk: LLM judges overstate web agent success, 74% vs 38%

Read original source →youtube.com

Browserbase's Miguel González Fernández and Microsoft Research's Corby Rosset present research on verifiers for computer-use and web agents, where an official judge scored agent success at 74% while a better verifier put it at 38%.

People · Miguel González Fernández, Corby Rosset

1 source

More stories today

Open the live feed