Hugging Face ha actualizado el backend de modelado de transformers para vLLM, logrando un rendimiento que ahora iguala o supera las implementaciones nativas personalizadas de vLLM en diversas arquitecturas de LLM. Esto permite que los creadores de modelos aprovechen sus implementaciones de transformers existentes para obtener una inferencia vLLM ultrarrápida sin necesidad de programar un puerto optimizado manualmente.

Pruebas realizadas con modelos Qwen3 —incluyendo un modelo denso de 4B, uno de 32B con paralelismo de tensores y un modelo Mixture-of-Experts (MoE) FP8 de 235B con paralelismo de datos y de expertos— demuestran que el backend de transformers alcanza o supera el rendimiento nativo. Esta funcionalidad se activa mediante la bandera `--model-impl transformers`.

Técnicamente, el backend emplea ahora torch.fx para el análisis estático del grafo del modelo y AST (Abstract Syntax Tree) para manipular el código fuente. Este proceso permite aplicar dinámicamente fusiones de capas específicas para la inferencia en tiempo de ejecución, mapeando operaciones a kernels optimizados de vLLM, como MergedColumnParallelLinear, QKVParallelLinear y kernels de paralelismo de expertos para modelos MoE.

Para implementar estas mejoras, los desarrolladores deben actualizar el paquete vllm mediante `uv pip install --upgrade vllm --torch-backend auto`. La mayoría de los modelos de Hugging Face son compatibles, excepto aquellos que utilizan atención lineal y ciertos modelos personalizados del Hub que no sigan los patrones de implementación estándar.