llama.cpp adds --n-cpu-ffn option for faster dense models

New PR #26622 adds a --n-cpu-ffn option to llama.cpp, similar to --n-cpu-moe, letting users offload FFN sublayers to CPU for dense models. Aims to speed up dense models for low-VRAM users.
1 source
Daily brief
Get tomorrow's AI brief in your inbox
More stories today
- Agentic Cloud concept introduced
- OpenAI's Codex client reveals GenUI interface platform
- Weaviate 1.39 adds Boost API, MMR, 4-bit quantization
- JPMorgan leads $5B debt package for Volta AI data centers
- Vercel Chat SDK adds Claude Managed Agents and Notion adapter