AnalysisDevelopersJuly 7, 2026
DFlash speculative decoding merged into llama.cpp, achieves 4.44x speedup on Qwen 3.6 27B

Reddit user tests newly merged DFlash in llama.cpp on Qwen 3.6 27B, achieving 4.44x faster inference at 36K context on RTX 6000 PRO. The technique uses block diffusion drafter, outperforming previous MTP benchmarks.