AnalysisAI ModelsJuly 22, 2026

GLM 5.2 open-weight model runs 744B parameters on consumer hardware

GLM 5.2 has 744B total parameters but only 40B active per token via Mixture-of-Experts routing. Techniques like Colibri's three-tier memory streaming and llama.cpp RPC enable local inference on consumer laptops and multi-GPU setups.

4 sources

More stories today

Open the live feed