Lectures
Backend de modélisation vLLM transformers à vitesse native
Le billet de blog Hugging Face présente un backend de modélisation à vitesse native pour vLLM associé à transformers. Les lecteurs travaillant sur l’inférence LLM y trouveront des détails concrets sur les gains de performance et les modes d’intégration. L’article mérite d’être lu pour ses informations pratiques sur les outils IA en production.
Hugging Face a mis à jour son backend de modélisation transformers pour vLLM, atteignant désormais des performances égales ou supérieures aux implémentations natives de vLLM pour diverses architectures de LLM. Cette avancée permet aux auteurs de modèles de bénéficier d'une inférence vLLM ultra-rapide en utilisant simplement leurs implémentations transformers, sans avoir à porter manuellement le code.
Des tests réalisés sur des modèles Qwen3 — notamment un modèle dense de 4B, un modèle dense de 32B avec parallélisme de tenseurs, et un modèle Mixture-of-Experts (MoE) FP8 de 235B avec parallélisme de données et d'experts — montrent que le backend transformers égale ou dépasse le débit natif. L'activation se fait via l'argument `--model-impl transformers`.
Sur le plan technique, le backend utilise désormais torch.fx pour l'analyse statique du graphe du modèle, ainsi que l'AST (Abstract Syntax Tree) pour modifier le code source. Ce mécanisme permet d'appliquer dynamiquement des fusions de couches spécifiques à l'inférence lors de l'exécution. Il mappe ainsi les opérations vers des kernels vLLM optimisés, tels que MergedColumnParallelLinear, QKVParallelLinear et les kernels dédiés au parallélisme d'experts pour les modèles MoE.
Pour profiter de ces gains, les développeurs doivent mettre à jour le package vllm via `uv pip install --upgrade vllm --torch-backend auto`. La plupart des modèles Hugging Face sont compatibles, à l'exception de ceux utilisant l'attention linéaire, ainsi que certains modèles personnalisés du Hub qui ne respecteraient pas les standards d'implémentation.
Tribune des lecteurs
Pas encore de contributions — lance le débat.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
En attente de ton clic …
·