LaunchDevelopersAugust 27, 2026

llama.cpp adds --n-cpu-ffn option for faster dense models

New PR #26622 adds a --n-cpu-ffn option to llama.cpp, similar to --n-cpu-moe, letting users offload FFN sublayers to CPU for dense models. Aims to speed up dense models for low-VRAM users.

1 source

Daily brief

Get tomorrow's AI brief in your inbox

More stories today

Open the live feed
llama.cpp adds --n-cpu-ffn option for faster dense models — AIBriefs