Qwen 3.8 27B : excellent mais sur-réfléchi par défaut
Original : Qwen 3.8 27B is excellent, but it defaults to overthinking things
Pourquoi c'est important
Un LLM local performant de 27B paramètres, mais dont les paramètres par défaut freinent son usage pratique.
Alibaba Qwen Lab a publié Qwen 3.8 27B, un LLM vision de 27 milliards de paramètres sous licence Apache 2. Testé par Simon Willison sur MacBook Pro M5 Max et NVIDIA DGX Spark, le modèle se distingue par ses performances, mais son mode de raisonnement par défaut « xhigh » génère une surconsommation de tokens, même pour des tâches simples.
Alibaba Qwen Lab a lancé vendredi 15 août 2026 le modèle Qwen 3.8 27B, un LLM vision open source de 27 milliards de paramètres sous licence Apache 2. Simon Willison l'a testé sur un MacBook Pro M5 Max 128 Go et un NVIDIA DGX Spark via LM Studio, avec la version quantisée Q4_K_M de 17 Go.
Le principal problème signalé est le réglage par défaut du paramètre reasoning_effort fixé à « xhigh ». Ce mode est prévu pour des tâches complexes nécessitant une analyse approfondie, mais il provoque une sur-réflexion même pour des requêtes triviales. Exemple concret : la génération d'un SVG représentant un pélican à vélo a mobilisé 22 276 tokens de raisonnement pour produire 3 223 tokens de sortie, avec un temps de génération de 21 minutes. La même requête sans raisonnement (mode off) a produit 3 715 tokens en seulement 137 secondes.
Pour une requête encore plus simple — dessiner un cercle — le modèle en mode xhigh a entrepris de créer une « étude géométrique » animée avec dégradés et anneaux concentriques, bien au-delà de ce qui était demandé. LM Studio limite par défaut le contexte à 8 192 tokens, ce qui posait problème ; Willison a étendu la fenêtre au maximum de 262 144 tokens pour contourner cette contrainte.
Malgré ces excès, Willison souligne la qualité du rendu SVG obtenu et les benchmarks publiés par Qwen eux-mêmes, qui montrent une amélioration par rapport à Qwen 3.6 27B et au modèle propriétaire Qwen 3.7-Plus.