The Daily Commit · Ressort-Ausgabe Titelseite PHP AI Dev EN DE FR ES

TheModelDesk

29. August 2026
Modelle, Agenten & lokale Inferenz

Releases

vLLM 0.28.0 mit Kimi-K3-Optimierungen und gestuftem KV-Cache-Offloading

vLLM 0.28.0 erscheint mit 584 Commits von 270 Mitwirkenden. Der Schwerpunkt liegt auf Kimi-K3- und DeepSeek-V4-Performance, dazu kommen Fortschritte bei Speculative Decoding, KV-Cache-Offloading auf Platte und ein max_num_batched_tokens-Standard von 16384. Breaking Changes betreffen bitsandbytes und Transformers 5.15.0.

vLLM 0.28.0 mit Kimi-K3-Optimierungen und gestuftem KV-Cache-Offloading
Screenshot: Hacker News (AI, ≥100 P.) ↗

vLLM 0.28.0 ist erschienen, mit 584 Commits von 270 Mitwirkenden, davon 76 zum ersten Mal. Im Zentrum steht ein breites Optimierungspaket für Kimi-K3: Decode Context Parallel, fusionierte FlashKDA-Decode- und Prefill-Kernels, GEMM-RS für Sequenzparallelität, kombinierte All-Gathers mit 1,5- bis 3-fachem Kernel-Speedup sowie ein adaptives spekulatives Token-Budget, das die DSpark-TTFT um rund 60 Prozent verbessert. Optionales Shared-Expert-Sharding spart etwa 17 GiB Speicher pro GPU, und Kimi-K3 läuft nun auf ROCm mit dem V2 Model Runner.

DeepSeek V4 erhält durchgehendes Sparse MLA für Plain Decode, MTP und DSpark Speculative Decoding, dazu AMD-Quark-NVFP4-Support und ROCm-Aktivierung auf gfx11 und gfx950. Neu beim Speculative Decoding sind DFlash2 mit lokaler Faltung und Kandidatenselektor, DSpark Confidence-Scheduled Verification sowie automatisch aktiviertes Async Scheduling für Draft-Modelle.

Model Runner V2 reift mit E/P/D-Disaggregation, Weight Offloading, Multi-Layer-MTP-KV-Cache und Encoder-CUDA-Graphs. Das gestufte KV-Cache-Offloading unterstützt jetzt Disk-Offload, externe Secondary-Tier-Manager und Tiering-Metriken. Das Rust-Frontend bekommt einen eigenständigen Renderer, multimodale Bildinferenz über gRPC und RL-Lifecycle-Control; die Protobuf-Schemas werden auf Buf veröffentlicht.

Neue Standardwerte: max_num_batched_tokens steigt von 8192 auf 16384, Prefix Caching ist für Mamba-Modelle standardmäßig aktiv, und der Blackwell-CUDA-Graph-Capture-Standard liegt bei 1024. Breaking Changes: bitsandbytes wird zu einem Out-of-Tree-Plugin, Transformers wird auf 5.15.0 angehoben, calculate_kv_scales und override_attention_dtype wurden entfernt.

Neue Modelle sind Muse Glimmer, Ling 3.0 Flash mit BF16, MTP und FP8-Variante, Dots3 NOTE Multimodal und Interns2mobius. Ein Security-Fix schließt einen DoS über Sample-Rate-Fälschung, der die Audio-Decode-Dauerbegrenzung umging. Wheels gibt es für CUDA 13.0 per pip install vllm, außerdem Images für CUDA 12.9, ROCm, CPU und XPU; das Runtime-Image basiert jetzt auf Ubuntu 24.04.

Originalquelle lesen (Englisch) ↗

Artikel bewerten: 0

Leserforum

Noch keine Beiträge — eröffne die Debatte.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Bildschirm-Ausgabe · Impressum · Datenschutz