The Daily Commit · Edición de sección Portada PHP AI Dev EN DE FR ES

TheModelDesk

8 de julio de 2026
modelos, agentes e inferencia local

Lecturas

Backend de modelado vLLM transformers a velocidad nativa

La entrada del blog de Hugging Face describe un backend de modelado a velocidad nativa para vLLM con transformers. Quienes trabajan en inferencia de LLM encontrarán detalles concretos sobre mejoras de rendimiento y rutas de integración. Vale la pena leerla por su enfoque práctico en herramientas de IA para producción.

Hugging Face ha actualizado el backend de modelado de transformers para vLLM, logrando un rendimiento que ahora iguala o supera las implementaciones nativas personalizadas de vLLM en diversas arquitecturas de LLM. Esto permite que los creadores de modelos aprovechen sus implementaciones de transformers existentes para obtener una inferencia vLLM ultrarrápida sin necesidad de programar un puerto optimizado manualmente.

Pruebas realizadas con modelos Qwen3 —incluyendo un modelo denso de 4B, uno de 32B con paralelismo de tensores y un modelo Mixture-of-Experts (MoE) FP8 de 235B con paralelismo de datos y de expertos— demuestran que el backend de transformers alcanza o supera el rendimiento nativo. Esta funcionalidad se activa mediante la bandera `--model-impl transformers`.

Técnicamente, el backend emplea ahora torch.fx para el análisis estático del grafo del modelo y AST (Abstract Syntax Tree) para manipular el código fuente. Este proceso permite aplicar dinámicamente fusiones de capas específicas para la inferencia en tiempo de ejecución, mapeando operaciones a kernels optimizados de vLLM, como MergedColumnParallelLinear, QKVParallelLinear y kernels de paralelismo de expertos para modelos MoE.

Para implementar estas mejoras, los desarrolladores deben actualizar el paquete vllm mediante `uv pip install --upgrade vllm --torch-backend auto`. La mayoría de los modelos de Hugging Face son compatibles, excepto aquellos que utilizan atención lineal y ciertos modelos personalizados del Hub que no sigan los patrones de implementación estándar.

Leer la fuente original (en inglés) ↗

Valora este artículo: 0

Tribuna de lectores

Aún no hay aportaciones — abre el debate.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Edición de pantalla · Información legal · Política de privacidad