AnalysisAI ModelsAugust 21, 2026

Qwen3.8-27B hits 153 tok/s on Strix Halo + RTX 3090 Ti

A Reddit user reports running Qwen3.8-27B at 262K context on an AMD Strix Halo (128 GB unified) plus RTX 3090 Ti, achieving 9.5 to 153 tok/s after 159 logged experiments. The setup also beats a dual-3090 vLLM box on HumanEval.

1 source

More stories today

Open the live feed