LaunchDevelopersAugust 23, 2026

llama.cpp adds MTP support for GLM-4.5-Air

llama.cpp PR #26534 enables Multi-Token Prediction (MTP) for GLM-4.5-Air, a 106B MoE with 12B active parameters, offering speedups on memory-rich, compute-limited hardware like Strix Halo or DGX Spark.

1 source

Daily brief

Get tomorrow's AI brief in your inbox

More stories today

Open the live feed