Lesestoff
Native-Speed-vLLM-Transformers-Modellierungs-Backend
Der Blog-Beitrag von Hugging Face stellt ein Native-Speed-Backend für vLLM mit Transformers vor. Entwickler, die an LLM-Inferenz arbeiten, erhalten konkrete Hinweise zu Performance-Gewinnen und Integrationswegen. Der Artikel lohnt sich für alle, die praxisnahe Updates zu produktionsreifen KI-Tools suchen.
Hugging Face hat das Transformers-Modeling-Backend für vLLM aktualisiert. Die Performance erreicht nun das Niveau handgeschriebener nativer vLLM-Implementierungen oder übertrifft dieses sogar. Dadurch können Modell-Autoren ihre bestehenden Transformers-Implementierungen nutzen, um eine ultraschnelle vLLM-Inferenz zu erhalten, ohne separate Optimierungen schreiben zu müssen.
In Benchmarks mit Qwen3-Modellen – darunter ein 4B-Dense-Modell, ein 32B-Dense-Modell mit Tensor-Parallelität sowie ein 235B-Parameter FP8 Mixture-of-Experts (MoE)-Modell mit Daten- und Experten-Parallelität – erreichte das Transformers-Backend überall die native Durchsatzrate oder lag darüber. Die Funktion wird über das Flag `--model-impl transformers` aktiviert.
Technisch setzt das Backend nun torch.fx für die statische Analyse des Modellgraphen sowie AST (Abstract Syntax Tree) zur Manipulation des Quellcodes ein. Dies ermöglicht es, inferenzspezifische Layer-Fusionen zur Laufzeit dynamisch anzuwenden. So werden Operationen auf hochoptimierte vLLM-Kernel abgebildet, wie etwa MergedColumnParallelLinear, QKVParallelLinear oder spezialisierte Kernel für die Experten-Parallelisierung bei MoE-Modellen.
Die Aktualisierung erfolgt über `uv pip install --upgrade vllm --torch-backend auto`. Während die meisten Modelle von Hugging Face unterstützt werden, sind Modelle mit Linear Attention derzeit noch nicht kompatibel; zudem funktionieren benutzerdefinierte Hub-Modelle nur, wenn sie den Standard-Implementierungsrichtlinien entsprechen.
Leserforum
Noch keine Beiträge — eröffne die Debatte.
Starte die Diskussion
Kein Konto, kein Passwort nötig — gib einfach deine E-Mail-Adresse ein, wir senden dir einen einmaligen Anmelde-Link. Beim ersten Mal bist du damit automatisch angemeldet.
Deine Bewertung wird nach der Anmeldung automatisch übernommen.
Schau in dein Postfach
Wir haben einen Anmelde-Link an … gesendet. Öffne ihn auf diesem Gerät — dieser Tab meldet dich automatisch an.
Warte auf deinen Klick …
·