AnalysisAI ModelsOctober 9, 2026

Qwen3.8-Flash-Next-GSQ-RCO runs at 20-30 tok/sec on 12GB VRAM

Read original source →reddit.com

A custom Strata fork runs the IQ3_S quant of Qwen3.8-Flash-Next-GSQ-RCO-Abliterated at 20-30 tok/sec decode and 300 to ~90k tok/sec prefill at 131k context on 12GB VRAM plus 32GB RAM. The Q2 quant reaches 39-45 tok/sec decode.

1 source

More stories today

Open the live feed