AnalysisAI ModelsAugust 16, 2026

Qwen3.8-27B hits 82 tps on a single RTX 3090

A community-tuned inference setup runs Qwen3.8-27B at 82 tps single-request and 417 tps sustained across 64 concurrent requests on one RTX 3090, capped at 250W. Context reaches up to 195k tokens, though it ships with 150k for safety.

1 source

More stories today

Open the live feed