LaunchAI ModelsJuly 7, 2026
NVIDIA releases Nemotron-Labs-3-Puzzle-75B, a compressed LLM

The model uses Iterative Puzzle compression to reduce from 120B to 75B active parameters, aiming for better inference efficiency. It's deployment-optimized and available on Hugging Face.