The Daily Commit · Édition de rubrique La une PHP AI Dev EN DE FR ES

TheModelDesk

29 août 2026
modèles, agents & inférence locale

Versions

vLLM 0.28.0 : optimisations Kimi-K3 et déchargement hiérarchisé du cache KV

vLLM 0.28.0 arrive avec 584 commits de 270 contributeurs. La version mise sur les performances de Kimi-K3 et DeepSeek V4, progresse sur le décodage spéculatif, ajoute le déchargement du cache KV sur disque et porte max_num_batched_tokens à 16384. Des changements cassants touchent bitsandbytes et Transformers 5.15.0.

vLLM 0.28.0 : optimisations Kimi-K3 et déchargement hiérarchisé du cache KV
Capture d’écran : Hacker News (AI, ≥100 P.) ↗

vLLM 0.28.0 est disponible avec 584 commits de 270 contributeurs, dont 76 nouveaux. Le point fort est un vaste effort d'optimisation pour Kimi-K3 : Decode Context Parallel, kernels FlashKDA fusionnés pour le décodage et le préremplissage, GEMM-RS pour le parallélisme de séquence, all-gathers combinés avec un gain de 1,5 à 3x au niveau kernel, et un budget de tokens spéculatifs adaptatif qui améliore le TTFT DSpark d'environ 60 %. Le sharding optionnel des experts partagés économise environ 17 Gio de mémoire par GPU, et Kimi-K3 fonctionne désormais sur ROCm avec le Model Runner V2.

DeepSeek V4 bénéficie d'un MLA sparse de bout en bout pour le décodage simple, MTP et le décodage spéculatif DSpark, ainsi que du support AMD Quark NVFP4 et de ROCm sur gfx11 et gfx950. Côté décodage spéculatif, on note DFlash2 avec convolution locale et sélecteur de candidats, la vérification planifiée par confiance DSpark, et l'ordonnancement asynchrone activé automatiquement pour les modèles brouillons.

Le Model Runner V2 gagne la désagrégation E/P/D, le déchargement des poids, le cache KV MTP multicouche et les CUDA graphs pour l'encodeur. Le déchargement hiérarchisé du cache KV prend en charge le disque, les gestionnaires de second niveau externes et des métriques de tiering. Le frontend Rust ajoute un renderer autonome, l'inférence d'images multimodales via gRPC et le contrôle du cycle de vie RL, avec des schémas protobuf publiés sur Buf.

Nouvelles valeurs par défaut : max_num_batched_tokens passe de 8192 à 16384, le prefix caching est activé pour les modèles Mamba, et la capture de CUDA graphs sur Blackwell monte à 1024. Changements cassants : bitsandbytes devient un plugin externe, Transformers passe à 5.15.0, et calculate_kv_scales ainsi que override_attention_dtype sont supprimés.

Nouveaux modèles : Muse Glimmer, Ling 3.0 Flash en BF16 avec MTP et variante FP8, Dots3 NOTE multimodal et Interns2mobius. Un correctif de sécurité bouche un DoS par falsification du taux d'échantillonnage qui contournait la limite de durée du décodage audio. Les wheels ciblent CUDA 13.0 via pip install vllm, avec des images pour CUDA 12.9, ROCm, CPU et XPU ; l'image runtime passe à Ubuntu 24.04.

Lire la source originale (en anglais) ↗

Évaluer cet article : 0

Tribune des lecteurs

Pas encore de contributions — lance le débat.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Édition écran · Mentions légales · Politique de confidentialité