AnalysisAI ModelsSeptember 1, 2026

Qwen3.8-27B hits 2,000 prefill tok/s on RTX 3090

A hyper-optimized inference engine for Qwen3.8-27B on an RTX 3090 reaches 2,000 prefill tokens per second and 132 decode tokens per second. Earlier iterations hit 381 tps single-request decode and 672 tps peak.

How this story unfolded

2 weeks · 0 reports · 5 community posts · from Aug 16

  1. Aug 16
  2. Aug 18
  3. Aug 19
  4. Aug 21
  5. Sep 1

More stories today

Open the live feed