AnalysisPolicyOctober 9, 2026

MIT Technology Review: AI refusal is far from foolproof

Read original source →technologyreview.com

MIT Technology Review argues LLM refusal training, rooted in Anthropic's 2021 "helpful, honest, harmless" framing, could become an instrument of repression. Former OpenAI safety staffer Steven Adler says early models would "blab on about anything."

1 source

More stories today

Open the live feed