LaunchDevelopersJuly 20, 2026
NInfer inference engine achieves 543 tok/s on Qwen3.6 with RTX 5090
NInfer, a new open-source C++/CUDA inference engine, reaches 543 tokens per second single-request for Qwen3.6-35B-A3B on one RTX 5090 over a 65K-token decode. The engine is specialized for two exact Qwen3.6 checkpoints and is available on GitHub.