vLLM 0.28.0 est disponible avec 584 commits de 270 contributeurs, dont 76 nouveaux. Le point fort est un vaste effort d'optimisation pour Kimi-K3 : Decode Context Parallel, kernels FlashKDA fusionnés pour le décodage et le préremplissage, GEMM-RS pour le parallélisme de séquence, all-gathers combinés avec un gain de 1,5 à 3x au niveau kernel, et un budget de tokens spéculatifs adaptatif qui améliore le TTFT DSpark d'environ 60 %. Le sharding optionnel des experts partagés économise environ 17 Gio de mémoire par GPU, et Kimi-K3 fonctionne désormais sur ROCm avec le Model Runner V2.
DeepSeek V4 bénéficie d'un MLA sparse de bout en bout pour le décodage simple, MTP et le décodage spéculatif DSpark, ainsi que du support AMD Quark NVFP4 et de ROCm sur gfx11 et gfx950. Côté décodage spéculatif, on note DFlash2 avec convolution locale et sélecteur de candidats, la vérification planifiée par confiance DSpark, et l'ordonnancement asynchrone activé automatiquement pour les modèles brouillons.
Le Model Runner V2 gagne la désagrégation E/P/D, le déchargement des poids, le cache KV MTP multicouche et les CUDA graphs pour l'encodeur. Le déchargement hiérarchisé du cache KV prend en charge le disque, les gestionnaires de second niveau externes et des métriques de tiering. Le frontend Rust ajoute un renderer autonome, l'inférence d'images multimodales via gRPC et le contrôle du cycle de vie RL, avec des schémas protobuf publiés sur Buf.
Nouvelles valeurs par défaut : max_num_batched_tokens passe de 8192 à 16384, le prefix caching est activé pour les modèles Mamba, et la capture de CUDA graphs sur Blackwell monte à 1024. Changements cassants : bitsandbytes devient un plugin externe, Transformers passe à 5.15.0, et calculate_kv_scales ainsi que override_attention_dtype sont supprimés.
Nouveaux modèles : Muse Glimmer, Ling 3.0 Flash en BF16 avec MTP et variante FP8, Dots3 NOTE multimodal et Interns2mobius. Un correctif de sécurité bouche un DoS par falsification du taux d'échantillonnage qui contournait la limite de durée du décodage audio. Les wheels ciblent CUDA 13.0 via pip install vllm, avec des images pour CUDA 12.9, ROCm, CPU et XPU ; l'image runtime passe à Ubuntu 24.04.




Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
Rien reçu ? Vérifiez le dossier spam — et marquez le message « Non spam » pour qu'il arrive directement la prochaine fois.