How-ToDevelopersJuly 22, 2026

VRAM cache achieves 340 pp/s for Kimi 2.7 MoE on single DGX Spark

A VRAM disk caching strategy for MoE models achieves 340 pp/s prefill and 9.6 tg/s generation for Kimi K2.7 Code (204GB GGUF) on a single DGX Spark. The technique keeps MoE experts on CUDA compute path in llama.cpp by using VRAM as cache over disk.

1 source