Un utilisateur de Reddit a partagé des chiffres de production précoces pour Qwen3.8-Flash-Next sur une station Dell Precision 7960 Rack équipée de deux Xeon Platinum 8562Y+, 512 Go de DDR5 ECC et deux GPU RTX PRO 6000 Blackwell Max-Q de 96 Go chacun. Le modèle FP8 tourne sous vLLM avec un parallélisme tensoriel de 2 et une fenêtre de contexte de 262K.

terminal
VLLM_PLE_CPU_OFFLOAD=1 vllm serve Qwen/Qwen3.8-Flash-Next-FP8 --tensor-parallel-size 2

Le modèle comprend une table d'embeddings PLE/n-gram de 51B paramètres, déchargée en RAM système via VLLM_PLE_CPU_OFFLOAD=1. La charge GPU s'établit autour de 67,5 Gio par GPU, laissant de la place pour le cache KV.

La configuration du décodage spéculatif s'est révélée déterminante. Avec MTP3, la génération tombait à 40-48 tok/s et les taux d'acceptation chutaient sur toutes les positions. Le passage à MTP1 a produit environ 123-126 tok/s en génération soutenue, avec des pointes à 2 185 tok/s en traitement de prompt. L'acceptation a atteint 99-100%, avec une longueur d'acceptation moyenne d'environ 2,0.

L'auteur note que la vitesse est proche de celle de Qwen3.5-122B-A10B sur le même matériel, malgré une architecture différente. D'autres tests sont prévus : MTP1 contre absence de décodage spéculatif, réglage de la configuration kernel MoE manquante pour E=512 / N=320 / FP8, utilisation mémoire GPU plus élevée, effets NUMA liés à la table PLE résidente en RAM, performance en contexte long, débit multi-utilisateurs et comparaison de qualité avec Qwen3.5-122B-A10B.