Un usuario de Reddit ha compartido cifras tempranas de producción de Qwen3.8-Flash-Next en una estación Dell Precision 7960 Rack con dos Xeon Platinum 8562Y+, 512 GB de DDR5 ECC y dos GPU RTX PRO 6000 Blackwell Max-Q de 96 GB cada una. El modelo FP8 corre bajo vLLM con paralelismo de tensores 2 y una ventana de contexto de 262K.

terminal
VLLM_PLE_CPU_OFFLOAD=1 vllm serve Qwen/Qwen3.8-Flash-Next-FP8 --tensor-parallel-size 2

El modelo incluye una tabla de embeddings PLE/n-gram de 51B parámetros, descargada a la RAM del sistema mediante VLLM_PLE_CPU_OFFLOAD=1. La carga del modelo en GPU quedó en torno a 67,5 GiB por GPU, dejando espacio para la caché KV.

La configuración de la decodificación especulativa resultó crítica. Con MTP3, la generación caía a 40-48 tok/s y las tasas de aceptación se desplomaban en todas las posiciones. Al cambiar a MTP1 se lograron unos 123-126 tok/s sostenidos, con picos de 2.185 tok/s en procesamiento de prompt. La aceptación alcanzó el 99-100%, con una longitud media de aceptación de aproximadamente 2,0.

El autor señala que la velocidad se acerca a la de Qwen3.5-122B-A10B en el mismo hardware, pese a la arquitectura diferente. Tiene previstas más pruebas: MTP1 frente a ausencia de decodificación especulativa, ajuste de la configuración del kernel MoE para E=512 / N=320 / FP8, mayor utilización de memoria GPU, efectos NUMA por la tabla PLE residente en CPU, rendimiento con contextos largos, rendimiento con usuarios concurrentes y una comparación de calidad con Qwen3.5-122B-A10B.