The Daily Commit · Ressort-Ausgabe Titelseite PHP AI Dev EN DE FR ES

TheModelDesk

8. Juli 2026
Modelle, Agenten & lokale Inferenz

Lesestoff

Native-Speed-vLLM-Transformers-Modellierungs-Backend

Der Blog-Beitrag von Hugging Face stellt ein Native-Speed-Backend für vLLM mit Transformers vor. Entwickler, die an LLM-Inferenz arbeiten, erhalten konkrete Hinweise zu Performance-Gewinnen und Integrationswegen. Der Artikel lohnt sich für alle, die praxisnahe Updates zu produktionsreifen KI-Tools suchen.

Hugging Face hat das Transformers-Modeling-Backend für vLLM aktualisiert. Die Performance erreicht nun das Niveau handgeschriebener nativer vLLM-Implementierungen oder übertrifft dieses sogar. Dadurch können Modell-Autoren ihre bestehenden Transformers-Implementierungen nutzen, um eine ultraschnelle vLLM-Inferenz zu erhalten, ohne separate Optimierungen schreiben zu müssen.

In Benchmarks mit Qwen3-Modellen – darunter ein 4B-Dense-Modell, ein 32B-Dense-Modell mit Tensor-Parallelität sowie ein 235B-Parameter FP8 Mixture-of-Experts (MoE)-Modell mit Daten- und Experten-Parallelität – erreichte das Transformers-Backend überall die native Durchsatzrate oder lag darüber. Die Funktion wird über das Flag `--model-impl transformers` aktiviert.

Technisch setzt das Backend nun torch.fx für die statische Analyse des Modellgraphen sowie AST (Abstract Syntax Tree) zur Manipulation des Quellcodes ein. Dies ermöglicht es, inferenzspezifische Layer-Fusionen zur Laufzeit dynamisch anzuwenden. So werden Operationen auf hochoptimierte vLLM-Kernel abgebildet, wie etwa MergedColumnParallelLinear, QKVParallelLinear oder spezialisierte Kernel für die Experten-Parallelisierung bei MoE-Modellen.

Die Aktualisierung erfolgt über `uv pip install --upgrade vllm --torch-backend auto`. Während die meisten Modelle von Hugging Face unterstützt werden, sind Modelle mit Linear Attention derzeit noch nicht kompatibel; zudem funktionieren benutzerdefinierte Hub-Modelle nur, wenn sie den Standard-Implementierungsrichtlinien entsprechen.

Originalquelle lesen (Englisch) ↗

Artikel bewerten: 0

Leserforum

Noch keine Beiträge — eröffne die Debatte.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Bildschirm-Ausgabe · Impressum · Datenschutz