AnalysisAI ModelsSeptember 20, 2026

Qwen-3.8-Flash-Next hits 50 t/s on single RTX 5090 with FreeToken

A single RTX 5090 running Qwen-3.8-Flash-Next via FreeToken reached 50 tokens/s generation and 2,300 tokens/s prompt processing. The poster says llama.cpp was disappointing because it still lacks expert caching for MoE models.

1 source

More stories today

Open the live feed