vLLM 0.28.0 está disponible con 584 commits de 270 colaboradores, 76 de ellos nuevos. El trabajo principal es un amplio paquete de optimización para Kimi-K3: Decode Context Parallel, kernels FlashKDA fusionados para decodificación y prefill, GEMM-RS para paralelismo de secuencia, all-gathers combinados con una aceleración de 1,5 a 3x a nivel de kernel, y un presupuesto adaptativo de tokens especulativos que mejora el TTFT de DSpark en torno a un 60 por ciento. El sharding opcional de expertos compartidos ahorra unos 17 GiB de memoria por GPU, y Kimi-K3 ya funciona en ROCm con el Model Runner V2.

DeepSeek V4 obtiene MLA disperso de extremo a extremo para decodificación simple, MTP y decodificación especulativa DSpark, además de soporte AMD Quark NVFP4 y habilitación de ROCm en gfx11 y gfx950. En decodificación especulativa se suman DFlash2 con convolución local y selector de candidatos, verificación DSpark programada por confianza y planificación asíncrona activada automáticamente para modelos borrador.

El Model Runner V2 madura con desagregación E/P/D, descarga de pesos, caché KV MTP multicapa y CUDA graphs para el codificador. La descarga escalonada de caché KV ahora soporta disco, gestores de segundo nivel externos y métricas de niveles. El frontend en Rust añade un renderizador independiente, inferencia de imágenes multimodal por gRPC y control del ciclo de vida de RL, con esquemas protobuf publicados en Buf.

Nuevos valores por defecto: max_num_batched_tokens sube de 8192 a 16384, el prefix caching queda activo para modelos Mamba y la captura de CUDA graphs en Blackwell pasa a 1024. Cambios disruptivos: bitsandbytes pasa a ser un plugin externo, Transformers sube a 5.15.0, y calculate_kv_scales junto con override_attention_dtype se eliminan.

Entre los nuevos modelos están Muse Glimmer, Ling 3.0 Flash con BF16, MTP y variante FP8, Dots3 NOTE multimodal e Interns2mobius. Un parche de seguridad cierra un DoS por falsificación de la tasa de muestreo que eludía el límite de duración de la decodificación de audio. Los wheels apuntan a CUDA 13.0 mediante pip install vllm, con imágenes para CUDA 12.9, ROCm, CPU y XPU; la imagen de ejecución pasa a Ubuntu 24.04.