The Daily Commit · Edición de sección Portada PHP AI Dev EN DE FR ES

TheModelDesk

29 de agosto de 2026
modelos, agentes e inferencia local

Lanzamientos

vLLM 0.28.0 llega con optimizaciones para Kimi-K3 y descarga escalonada de caché KV

vLLM 0.28.0 llega con 584 commits de 270 colaboradores. La versión se centra en el rendimiento de Kimi-K3 y DeepSeek V4, mejora la decodificación especulativa, añade descarga de caché KV a disco y eleva max_num_batched_tokens a 16384. Hay cambios disruptivos en bitsandbytes y Transformers 5.15.0.

vLLM 0.28.0 llega con optimizaciones para Kimi-K3 y descarga escalonada de caché KV
Captura: Hacker News (AI, ≥100 P.) ↗

vLLM 0.28.0 está disponible con 584 commits de 270 colaboradores, 76 de ellos nuevos. El trabajo principal es un amplio paquete de optimización para Kimi-K3: Decode Context Parallel, kernels FlashKDA fusionados para decodificación y prefill, GEMM-RS para paralelismo de secuencia, all-gathers combinados con una aceleración de 1,5 a 3x a nivel de kernel, y un presupuesto adaptativo de tokens especulativos que mejora el TTFT de DSpark en torno a un 60 por ciento. El sharding opcional de expertos compartidos ahorra unos 17 GiB de memoria por GPU, y Kimi-K3 ya funciona en ROCm con el Model Runner V2.

DeepSeek V4 obtiene MLA disperso de extremo a extremo para decodificación simple, MTP y decodificación especulativa DSpark, además de soporte AMD Quark NVFP4 y habilitación de ROCm en gfx11 y gfx950. En decodificación especulativa se suman DFlash2 con convolución local y selector de candidatos, verificación DSpark programada por confianza y planificación asíncrona activada automáticamente para modelos borrador.

El Model Runner V2 madura con desagregación E/P/D, descarga de pesos, caché KV MTP multicapa y CUDA graphs para el codificador. La descarga escalonada de caché KV ahora soporta disco, gestores de segundo nivel externos y métricas de niveles. El frontend en Rust añade un renderizador independiente, inferencia de imágenes multimodal por gRPC y control del ciclo de vida de RL, con esquemas protobuf publicados en Buf.

Nuevos valores por defecto: max_num_batched_tokens sube de 8192 a 16384, el prefix caching queda activo para modelos Mamba y la captura de CUDA graphs en Blackwell pasa a 1024. Cambios disruptivos: bitsandbytes pasa a ser un plugin externo, Transformers sube a 5.15.0, y calculate_kv_scales junto con override_attention_dtype se eliminan.

Entre los nuevos modelos están Muse Glimmer, Ling 3.0 Flash con BF16, MTP y variante FP8, Dots3 NOTE multimodal e Interns2mobius. Un parche de seguridad cierra un DoS por falsificación de la tasa de muestreo que eludía el límite de duración de la decodificación de audio. Los wheels apuntan a CUDA 13.0 mediante pip install vllm, con imágenes para CUDA 12.9, ROCm, CPU y XPU; la imagen de ejecución pasa a Ubuntu 24.04.

Leer la fuente original (en inglés) ↗

Valora este artículo: 0

Tribuna de lectores

Aún no hay aportaciones — abre el debate.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Edición de pantalla · Información legal · Política de privacidad