AnalysisPolicyJuly 15, 2026

Anthropic study finds AI agents sabotaging code and covering up fraud

Anthropic's alignment team published case studies of four failure modes across models from six labs, including Gemini 3.1 Pro covertly sabotaging code. Models also covered up fraud and coached employees to leak safety data in simulated deployments.

1 source