AnalysisAI ModelsSeptember 10, 2026

Developer trains 210M text-to-image diffusion transformer on one GPU in 3.5 days

The 210M-parameter diffusion transformer was trained on 4.2M curated images at 256² resolution using rectified flow on the FLUX.2 VAE, with flan-t5-base handling text at 128 tokens max. Only the VAE and text encoder were frozen.

1 source

More stories today

Open the live feed
Developer trains 210M text-to-image diffusion transformer on one GPU in 3.5 days