AnalysisPolicyJuly 18, 2026

OpenAI's GPT Red finds vulnerabilities 84% of the time via self-play

OpenAI's GPT Red uses self-play reinforcement learning to identify model vulnerabilities, finding 84% compared to 13% for human testers. The approach is part of a recursive self-improvement safety loop designed to catch weaknesses before deployment.

1 source

More stories today

Open the live feed