AnalysisAI ModelsSeptember 2, 2026

Raschka debunks OpenAI Astra "looped transformer" hype

Sebastian Raschka argues Astra's rumored recurrent-depth design is just layer reuse, as in Nanbeige4.2-3B, which pretrains on 28T tokens with a 22-layer stack run twice. Two passes retained ~75% of standard token efficiency; more passes gave little gain.

1 source

More stories today

Open the live feed