Lectures
Simon Willison teste Qwen 3.8 27B: le mode de raisonnement par défaut en fait des tonnes
À lire pour le compte-rendu pratique de Simon Willison sur le nouveau Qwen 3.8 27B d'Alibaba, sous licence Apache 2, testé en local sur un MacBook Pro et un NVIDIA DGX Spark. Il montre de solides performances en agent de code et en détection de boîtes englobantes, mais aussi comment le réglage par défaut xhigh transforme des prompts simples en détours de plusieurs minutes, et comment des astuces comme le multi-token prediction de llama.cpp restaurent une vraie vitesse.
Simon Willison passe en revue Qwen 3.8 27B, un modèle de 27 milliards de paramètres, capable de vision, sous licence Apache 2, issu du laboratoire Qwen d'Alibaba et successeur du très apprécié Qwen 3.6 27B. Les propres benchmarks de Qwen affirment qu'il surpasse à la fois Qwen 3.6 27B et le modèle propriétaire Qwen 3.7-Plus, mais Willison souligne qu'une vérification indépendante reste attendue.
Il a fait tourner la version quantifiée Q4_K_M de 17 Go dans LM Studio sur un MacBook Pro M5 Max de 128 Go et sur un NVIDIA DGX Spark, ainsi que llama-server directement sur le Spark. Le modèle utilise par défaut un effort de raisonnement "xhigh", que Willison juge mal adapté au matériel grand public. Générer un SVG d'un pélican à vélo a pris 21 minutes et 22 276 tokens de raisonnement pour seulement 3 223 tokens de sortie ; sans raisonnement, le même prompt a été traité en 137 secondes. Un simple prompt demandant un cercle en SVG s'est transformé en une méditation de plusieurs minutes sur des palettes de couleurs Bauhaus et des anneaux animés.
Sur les tâches de vision, le modèle a excellé : chargé de fournir des boîtes englobantes sur une échelle de 0 à 1000 pour des pélicans sur une photo, il a trouvé les coordonnées avec précision. Willison a ensuite demandé au modèle, en un seul prompt, de construire un outil HTML complet pour visualiser ces boîtes englobantes ; avec le raisonnement activé, le résultat était toutefois sur-conçu, ajoutant une scène de démonstration non demandée avec des silhouettes de pélicans dessinées à la main.
En tant qu'agent de code, associé à l'outil léger Pi et servi via LM Studio par Tailscale, Qwen 3.8 27B a réussi à expliquer la logique d'authentification dans la base de code Datasette de Willison et a écrit un script Python fonctionnel pour convertir une transcription de session JSONL en Markdown.
La vitesse reste le principal point faible : 15 à 30 tokens par seconde sur son matériel, bien en deçà de modèles hébergés comme OpenAI 5.6 Sol (74 tokens/seconde) et 5.6 Luna (184 tokens/seconde) selon les chiffres d'Artificial Analysis. Suivant un conseil de Georgi Gerganov, créateur de llama.cpp, Willison a testé le modèle avec la prédiction multi-tokens activée via le mode draft-mtp de llama.cpp, ce qui a apporté environ 72 % de gain de vitesse par rapport à la configuration par défaut de LM Studio, dans un benchmark réalisé avec GPT-5.6.
Sa conclusion : un fichier de 17 Go offre désormais des capacités de codage, de vision et d'appel d'outils qui auraient nécessité, il y a un an, du matériel de datacenter coûteux, et le principal obstacle à un usage quotidien est le réglage de raisonnement par défaut mal choisi, pas les capacités du modèle.
Tribune des lecteurs
Pas encore de contributions — lance le débat.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
Rien reçu ? Vérifiez le dossier spam — et marquez le message « Non spam » pour qu'il arrive directement la prochaine fois.