AnalysisAI ModelsSeptember 13, 2026

Qwen3.8 27B draft model hits 60 tok/s on 16 GB RX 9070 XT

A Reddit user reports pairing the HermiHg Qwen3.8-27B-DFlash2-Q2_K_S-MIX draft GGUF with ISTA-DASLab's Qwen3.8-27B-GSQ-RCO-GGUF at IQ3_XXS and 128k context, averaging about 60 tokens/sec generation on a 16 GB RX 9070 XT.

1 source

More stories today

Open the live feed