Lecturas
Backend de modelado vLLM transformers a velocidad nativa
La entrada del blog de Hugging Face describe un backend de modelado a velocidad nativa para vLLM con transformers. Quienes trabajan en inferencia de LLM encontrarán detalles concretos sobre mejoras de rendimiento y rutas de integración. Vale la pena leerla por su enfoque práctico en herramientas de IA para producción.
Hugging Face ha actualizado el backend de modelado de transformers para vLLM, logrando un rendimiento que ahora iguala o supera las implementaciones nativas personalizadas de vLLM en diversas arquitecturas de LLM. Esto permite que los creadores de modelos aprovechen sus implementaciones de transformers existentes para obtener una inferencia vLLM ultrarrápida sin necesidad de programar un puerto optimizado manualmente.
Pruebas realizadas con modelos Qwen3 —incluyendo un modelo denso de 4B, uno de 32B con paralelismo de tensores y un modelo Mixture-of-Experts (MoE) FP8 de 235B con paralelismo de datos y de expertos— demuestran que el backend de transformers alcanza o supera el rendimiento nativo. Esta funcionalidad se activa mediante la bandera `--model-impl transformers`.
Técnicamente, el backend emplea ahora torch.fx para el análisis estático del grafo del modelo y AST (Abstract Syntax Tree) para manipular el código fuente. Este proceso permite aplicar dinámicamente fusiones de capas específicas para la inferencia en tiempo de ejecución, mapeando operaciones a kernels optimizados de vLLM, como MergedColumnParallelLinear, QKVParallelLinear y kernels de paralelismo de expertos para modelos MoE.
Para implementar estas mejoras, los desarrolladores deben actualizar el paquete vllm mediante `uv pip install --upgrade vllm --torch-backend auto`. La mayoría de los modelos de Hugging Face son compatibles, excepto aquellos que utilizan atención lineal y ciertos modelos personalizados del Hub que no sigan los patrones de implementación estándar.
Tribuna de lectores
Aún no hay aportaciones — abre el debate.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
Esperando tu clic …
·