Releases
vLLM 0.28.0 mit Kimi-K3-Optimierungen und gestuftem KV-Cache-Offloading
vLLM 0.28.0 erscheint mit 584 Commits von 270 Mitwirkenden. Der Schwerpunkt liegt auf Kimi-K3- und DeepSeek-V4-Performance, dazu kommen Fortschritte bei Speculative Decoding, KV-Cache-Offloading auf Platte und ein max_num_batched_tokens-Standard von 16384. Breaking Changes betreffen bitsandbytes und Transformers 5.15.0.
vLLM 0.28.0 ist erschienen, mit 584 Commits von 270 Mitwirkenden, davon 76 zum ersten Mal. Im Zentrum steht ein breites Optimierungspaket für Kimi-K3: Decode Context Parallel, fusionierte FlashKDA-Decode- und Prefill-Kernels, GEMM-RS für Sequenzparallelität, kombinierte All-Gathers mit 1,5- bis 3-fachem Kernel-Speedup sowie ein adaptives spekulatives Token-Budget, das die DSpark-TTFT um rund 60 Prozent verbessert. Optionales Shared-Expert-Sharding spart etwa 17 GiB Speicher pro GPU, und Kimi-K3 läuft nun auf ROCm mit dem V2 Model Runner.
DeepSeek V4 erhält durchgehendes Sparse MLA für Plain Decode, MTP und DSpark Speculative Decoding, dazu AMD-Quark-NVFP4-Support und ROCm-Aktivierung auf gfx11 und gfx950. Neu beim Speculative Decoding sind DFlash2 mit lokaler Faltung und Kandidatenselektor, DSpark Confidence-Scheduled Verification sowie automatisch aktiviertes Async Scheduling für Draft-Modelle.
Model Runner V2 reift mit E/P/D-Disaggregation, Weight Offloading, Multi-Layer-MTP-KV-Cache und Encoder-CUDA-Graphs. Das gestufte KV-Cache-Offloading unterstützt jetzt Disk-Offload, externe Secondary-Tier-Manager und Tiering-Metriken. Das Rust-Frontend bekommt einen eigenständigen Renderer, multimodale Bildinferenz über gRPC und RL-Lifecycle-Control; die Protobuf-Schemas werden auf Buf veröffentlicht.
Neue Standardwerte: max_num_batched_tokens steigt von 8192 auf 16384, Prefix Caching ist für Mamba-Modelle standardmäßig aktiv, und der Blackwell-CUDA-Graph-Capture-Standard liegt bei 1024. Breaking Changes: bitsandbytes wird zu einem Out-of-Tree-Plugin, Transformers wird auf 5.15.0 angehoben, calculate_kv_scales und override_attention_dtype wurden entfernt.
Neue Modelle sind Muse Glimmer, Ling 3.0 Flash mit BF16, MTP und FP8-Variante, Dots3 NOTE Multimodal und Interns2mobius. Ein Security-Fix schließt einen DoS über Sample-Rate-Fälschung, der die Audio-Decode-Dauerbegrenzung umging. Wheels gibt es für CUDA 13.0 per pip install vllm, außerdem Images für CUDA 12.9, ROCm, CPU und XPU; das Runtime-Image basiert jetzt auf Ubuntu 24.04.
Leserforum
Noch keine Beiträge — eröffne die Debatte.
Starte die Diskussion
Kein Konto, kein Passwort nötig — gib einfach deine E-Mail-Adresse ein, wir senden dir einen einmaligen Anmelde-Link. Beim ersten Mal bist du damit automatisch angemeldet.
Deine Bewertung wird nach der Anmeldung automatisch übernommen.
Schau in dein Postfach
Wir haben einen Anmelde-Link an … gesendet. Öffne ihn auf diesem Gerät — dieser Tab meldet dich automatisch an.
Nichts angekommen? Wirf einen Blick in den Spam-Ordner — und markiere die Mail dort als „Kein Spam“, dann landet sie künftig direkt im Postfach.