Simon Willison analiza Qwen 3.8 27B, un modelo de 27.000 millones de parámetros con capacidad de visión, licenciado bajo Apache 2, del laboratorio Qwen de Alibaba y sucesor del bien valorado Qwen 3.6 27B. Los propios benchmarks de Qwen afirman que supera tanto a Qwen 3.6 27B como al modelo cerrado Qwen 3.7-Plus, aunque Willison señala que aún falta una verificación independiente.
Probó la versión cuantizada Q4_K_M de 17 GB en LM Studio, tanto en un MacBook Pro M5 Max con 128 GB de RAM como en un NVIDIA DGX Spark, además de llama-server directamente en el Spark. El modelo usa por defecto un esfuerzo de razonamiento "xhigh", algo que Willison considera un mal punto de partida para hardware de consumo. Generar un SVG de un pelícano en bicicleta tardó 21 minutos y consumió 22.276 tokens de razonamiento para producir solo 3.223 tokens de salida; con el razonamiento desactivado, el mismo prompt se completó en 137 segundos. Un prompt sencillo pidiendo un círculo en SVG derivó en una reflexión de varios minutos sobre paletas de colores Bauhaus y anillos animados.
En tareas de visión el modelo brilló: al pedirle cajas delimitadoras en escala 0-1000 para pelícanos en una foto, acertó las coordenadas con precisión. Willison hizo entonces que el modelo construyera, con un solo prompt, una herramienta HTML completa para visualizar esas cajas delimitadoras, aunque con el razonamiento activo el resultado quedó sobrediseñado, añadiendo una escena de demostración no solicitada con siluetas de pelícanos dibujadas a mano.
Como agente de código, combinado con la herramienta ligera Pi y servido mediante LM Studio a través de Tailscale, Qwen 3.8 27B logró explicar correctamente la lógica de autenticación en el código base de Datasette de Willison y escribió un script de Python funcional para convertir una transcripción de sesión JSONL a Markdown.
La velocidad sigue siendo el principal punto débil: entre 15 y 30 tokens por segundo en su hardware, muy por detrás de modelos alojados como OpenAI 5.6 Sol (74 tokens/segundo) y 5.6 Luna (184 tokens/segundo), según cifras de Artificial Analysis. Siguiendo un consejo de Georgi Gerganov, creador de llama.cpp, Willison probó el modelo con predicción multi-token activada mediante el modo draft-mtp de llama.cpp, lo que aportó una mejora de velocidad de aproximadamente un 72% frente a la configuración por defecto de LM Studio, en un benchmark ejecutado con GPT-5.6.
Su conclusión: un archivo de 17 GB ofrece ahora capacidades de codificación, visión y llamada a herramientas que hace un año habrían requerido costoso hardware de centro de datos, y el principal obstáculo para el uso diario es el mal ajuste de razonamiento por defecto, no las capacidades del propio modelo.
Comentarios
Aún no hay comentarios — escribe el primero.
Inicia la conversación
Sin cuenta ni contraseña — introduce tu correo y te enviamos un enlace de acceso de un solo uso. ¿Primera vez? Todo se configura automáticamente.
Tu valoración se aplicará automáticamente al iniciar sesión.
Revisa tu bandeja de entrada
Hemos enviado un enlace de acceso a …. Ábrelo en este dispositivo — esta pestaña te conectará automáticamente.
¿No llega nada? Mira en la carpeta de spam — y marca el correo como «No es spam» para que la próxima vez llegue directo.