Simon Willison passe en revue Qwen 3.8 27B, un modèle de 27 milliards de paramètres, capable de vision, sous licence Apache 2, issu du laboratoire Qwen d'Alibaba et successeur du très apprécié Qwen 3.6 27B. Les propres benchmarks de Qwen affirment qu'il surpasse à la fois Qwen 3.6 27B et le modèle propriétaire Qwen 3.7-Plus, mais Willison souligne qu'une vérification indépendante reste attendue.

Il a fait tourner la version quantifiée Q4_K_M de 17 Go dans LM Studio sur un MacBook Pro M5 Max de 128 Go et sur un NVIDIA DGX Spark, ainsi que llama-server directement sur le Spark. Le modèle utilise par défaut un effort de raisonnement "xhigh", que Willison juge mal adapté au matériel grand public. Générer un SVG d'un pélican à vélo a pris 21 minutes et 22 276 tokens de raisonnement pour seulement 3 223 tokens de sortie ; sans raisonnement, le même prompt a été traité en 137 secondes. Un simple prompt demandant un cercle en SVG s'est transformé en une méditation de plusieurs minutes sur des palettes de couleurs Bauhaus et des anneaux animés.

Sur les tâches de vision, le modèle a excellé : chargé de fournir des boîtes englobantes sur une échelle de 0 à 1000 pour des pélicans sur une photo, il a trouvé les coordonnées avec précision. Willison a ensuite demandé au modèle, en un seul prompt, de construire un outil HTML complet pour visualiser ces boîtes englobantes ; avec le raisonnement activé, le résultat était toutefois sur-conçu, ajoutant une scène de démonstration non demandée avec des silhouettes de pélicans dessinées à la main.

En tant qu'agent de code, associé à l'outil léger Pi et servi via LM Studio par Tailscale, Qwen 3.8 27B a réussi à expliquer la logique d'authentification dans la base de code Datasette de Willison et a écrit un script Python fonctionnel pour convertir une transcription de session JSONL en Markdown.

La vitesse reste le principal point faible : 15 à 30 tokens par seconde sur son matériel, bien en deçà de modèles hébergés comme OpenAI 5.6 Sol (74 tokens/seconde) et 5.6 Luna (184 tokens/seconde) selon les chiffres d'Artificial Analysis. Suivant un conseil de Georgi Gerganov, créateur de llama.cpp, Willison a testé le modèle avec la prédiction multi-tokens activée via le mode draft-mtp de llama.cpp, ce qui a apporté environ 72 % de gain de vitesse par rapport à la configuration par défaut de LM Studio, dans un benchmark réalisé avec GPT-5.6.

Sa conclusion : un fichier de 17 Go offre désormais des capacités de codage, de vision et d'appel d'outils qui auraient nécessité, il y a un an, du matériel de datacenter coûteux, et le principal obstacle à un usage quotidien est le réglage de raisonnement par défaut mal choisi, pas les capacités du modèle.