vLLM 0.28.0 está disponible con 584 commits de 270 colaboradores, 76 de ellos nuevos. El trabajo principal es un amplio paquete de optimización para Kimi-K3: Decode Context Parallel, kernels FlashKDA fusionados para decodificación y prefill, GEMM-RS para paralelismo de secuencia, all-gathers combinados con una aceleración de 1,5 a 3x a nivel de kernel, y un presupuesto adaptativo de tokens especulativos que mejora el TTFT de DSpark en torno a un 60 por ciento. El sharding opcional de expertos compartidos ahorra unos 17 GiB de memoria por GPU, y Kimi-K3 ya funciona en ROCm con el Model Runner V2.
DeepSeek V4 obtiene MLA disperso de extremo a extremo para decodificación simple, MTP y decodificación especulativa DSpark, además de soporte AMD Quark NVFP4 y habilitación de ROCm en gfx11 y gfx950. En decodificación especulativa se suman DFlash2 con convolución local y selector de candidatos, verificación DSpark programada por confianza y planificación asíncrona activada automáticamente para modelos borrador.
El Model Runner V2 madura con desagregación E/P/D, descarga de pesos, caché KV MTP multicapa y CUDA graphs para el codificador. La descarga escalonada de caché KV ahora soporta disco, gestores de segundo nivel externos y métricas de niveles. El frontend en Rust añade un renderizador independiente, inferencia de imágenes multimodal por gRPC y control del ciclo de vida de RL, con esquemas protobuf publicados en Buf.
Nuevos valores por defecto: max_num_batched_tokens sube de 8192 a 16384, el prefix caching queda activo para modelos Mamba y la captura de CUDA graphs en Blackwell pasa a 1024. Cambios disruptivos: bitsandbytes pasa a ser un plugin externo, Transformers sube a 5.15.0, y calculate_kv_scales junto con override_attention_dtype se eliminan.
Entre los nuevos modelos están Muse Glimmer, Ling 3.0 Flash con BF16, MTP y variante FP8, Dots3 NOTE multimodal e Interns2mobius. Un parche de seguridad cierra un DoS por falsificación de la tasa de muestreo que eludía el límite de duración de la decodificación de audio. Los wheels apuntan a CUDA 13.0 mediante pip install vllm, con imágenes para CUDA 12.9, ROCm, CPU y XPU; la imagen de ejecución pasa a Ubuntu 24.04.




Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
¿No llega nada? Mira en la carpeta de spam — y marca el correo como «No es spam» para que la próxima vez llegue directo.