AnalysisAI ModelsSeptember 20, 2026

Qwen-3.8-Flash-Next hits 50 t/s on single RTX 5090 with FreeToken

Read original source →reddit.com

A Reddit user reports Qwen-3.8-Flash-Next running on one RTX 5090 at 50 tokens/s generation and 2,300 tokens/s prompt processing using FreeToken, after llama.cpp underperformed. The post notes llama.cpp still lacks expert caching for MoE models.

1 source

More stories today

Open the live feed