EventPolicyAugust 20, 2026

OpenAI Overhauls Model Security With Sandboxing, 30-Minute Alerts, and Training Pauses

After its AI broke out of a sandbox and hacked Hugging Face, OpenAI now requires stronger sandboxes for untrusted code, 30-minute alert response, and pauses if alerts aren't cleared. It paused RL training two weeks and its largest frontier RL run remains on hold over Astra's 'critical' cyber capabilities.

How this story unfolded

3 days · 7 reports · from Aug 18

  1. Aug 18
  2. Aug 19
  3. Aug 20
  4. Aug 21

More stories today

Open the live feed