The Daily Commit · Edición de sección Portada PHP AI Dev EN DE FR ES

TheModelDesk

17 de agosto de 2026
modelos, agentes e inferencia local

Lecturas

Simon Willison prueba Qwen 3.8 27B: el modo de razonamiento por defecto se pasa de rosca

Vale la pena leerlo por el análisis práctico de Simon Willison sobre el nuevo Qwen 3.8 27B de Alibaba, con licencia Apache 2, ejecutado en local en un MacBook Pro y un NVIDIA DGX Spark. Muestra un buen rendimiento como agente de código y en detección de cajas delimitadoras, pero también cómo el ajuste xhigh por defecto convierte prompts simples en rodeos de varios minutos, y cómo trucos como la predicción multi-token de llama.cpp recuperan velocidad real.

Simon Willison analiza Qwen 3.8 27B, un modelo de 27.000 millones de parámetros con capacidad de visión, licenciado bajo Apache 2, del laboratorio Qwen de Alibaba y sucesor del bien valorado Qwen 3.6 27B. Los propios benchmarks de Qwen afirman que supera tanto a Qwen 3.6 27B como al modelo cerrado Qwen 3.7-Plus, aunque Willison señala que aún falta una verificación independiente.

Probó la versión cuantizada Q4_K_M de 17 GB en LM Studio, tanto en un MacBook Pro M5 Max con 128 GB de RAM como en un NVIDIA DGX Spark, además de llama-server directamente en el Spark. El modelo usa por defecto un esfuerzo de razonamiento "xhigh", algo que Willison considera un mal punto de partida para hardware de consumo. Generar un SVG de un pelícano en bicicleta tardó 21 minutos y consumió 22.276 tokens de razonamiento para producir solo 3.223 tokens de salida; con el razonamiento desactivado, el mismo prompt se completó en 137 segundos. Un prompt sencillo pidiendo un círculo en SVG derivó en una reflexión de varios minutos sobre paletas de colores Bauhaus y anillos animados.

En tareas de visión el modelo brilló: al pedirle cajas delimitadoras en escala 0-1000 para pelícanos en una foto, acertó las coordenadas con precisión. Willison hizo entonces que el modelo construyera, con un solo prompt, una herramienta HTML completa para visualizar esas cajas delimitadoras, aunque con el razonamiento activo el resultado quedó sobrediseñado, añadiendo una escena de demostración no solicitada con siluetas de pelícanos dibujadas a mano.

Como agente de código, combinado con la herramienta ligera Pi y servido mediante LM Studio a través de Tailscale, Qwen 3.8 27B logró explicar correctamente la lógica de autenticación en el código base de Datasette de Willison y escribió un script de Python funcional para convertir una transcripción de sesión JSONL a Markdown.

La velocidad sigue siendo el principal punto débil: entre 15 y 30 tokens por segundo en su hardware, muy por detrás de modelos alojados como OpenAI 5.6 Sol (74 tokens/segundo) y 5.6 Luna (184 tokens/segundo), según cifras de Artificial Analysis. Siguiendo un consejo de Georgi Gerganov, creador de llama.cpp, Willison probó el modelo con predicción multi-token activada mediante el modo draft-mtp de llama.cpp, lo que aportó una mejora de velocidad de aproximadamente un 72% frente a la configuración por defecto de LM Studio, en un benchmark ejecutado con GPT-5.6.

Su conclusión: un archivo de 17 GB ofrece ahora capacidades de codificación, visión y llamada a herramientas que hace un año habrían requerido costoso hardware de centro de datos, y el principal obstáculo para el uso diario es el mal ajuste de razonamiento por defecto, no las capacidades del propio modelo.

Leer la fuente original (en inglés) ↗

Valora este artículo: 0

Tribuna de lectores

Aún no hay aportaciones — abre el debate.

← The Model Desk — Page C1

Models, agents & local inference · The Daily Commit · Edición de pantalla · Información legal · Política de privacidad