Un usuario de Reddit ha compartido cifras tempranas de producción de Qwen3.8-Flash-Next en una estación Dell Precision 7960 Rack con dos Xeon Platinum 8562Y+, 512 GB de DDR5 ECC y dos GPU RTX PRO 6000 Blackwell Max-Q de 96 GB cada una. El modelo FP8 corre bajo vLLM con paralelismo de tensores 2 y una ventana de contexto de 262K.
VLLM_PLE_CPU_OFFLOAD=1 vllm serve Qwen/Qwen3.8-Flash-Next-FP8 --tensor-parallel-size 2El modelo incluye una tabla de embeddings PLE/n-gram de 51B parámetros, descargada a la RAM del sistema mediante VLLM_PLE_CPU_OFFLOAD=1. La carga del modelo en GPU quedó en torno a 67,5 GiB por GPU, dejando espacio para la caché KV.
La configuración de la decodificación especulativa resultó crítica. Con MTP3, la generación caía a 40-48 tok/s y las tasas de aceptación se desplomaban en todas las posiciones. Al cambiar a MTP1 se lograron unos 123-126 tok/s sostenidos, con picos de 2.185 tok/s en procesamiento de prompt. La aceptación alcanzó el 99-100%, con una longitud media de aceptación de aproximadamente 2,0.
El autor señala que la velocidad se acerca a la de Qwen3.5-122B-A10B en el mismo hardware, pese a la arquitectura diferente. Tiene previstas más pruebas: MTP1 frente a ausencia de decodificación especulativa, ajuste de la configuración del kernel MoE para E=512 / N=320 / FP8, mayor utilización de memoria GPU, efectos NUMA por la tabla PLE residente en CPU, rendimiento con contextos largos, rendimiento con usuarios concurrentes y una comparación de calidad con Qwen3.5-122B-A10B.
Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
¿No llega nada? Mira en la carpeta de spam — y marca el correo como «No es spam» para que la próxima vez llegue directo.