AnalysisDevelopersAugust 28, 2026

Ninfer on RTX 5090 hits 220 tokens/s with 27B model

A user reports 220 tokens per second (averaging 170s) running a 27B model with Ninfer on an RTX 5090, roughly doubling throughput over llama.cpp.

1 source

More stories today

Open the live feed