Piloter Qwen : le mode réflexion et les techniques de prompt
Beaucoup de guides conseillent encore d’ajouter /think ou /no_think à la fin d’un prompt pour régler le raisonnement de Qwen. Cette astuce ne fonctionne plus sur Qwen3.5, Qwen3.6 et Qwen3.8 : la réflexion se pilote désormais par un paramètre, et elle est active par défaut. Ce guide explique comment la régler dans Qwen Studio, par l’API et en local, quand la couper, puis les techniques de prompt qui donnent de bons résultats avec Qwen.
Un modèle qui réfléchit rédige d’abord un raisonnement, invisible ou replié, avant de donner sa réponse. Cette étape améliore nettement les résultats en mathématiques, en code et en analyse. Elle coûte en revanche du temps et des tokens, et elle n’apporte rien quand vous demandez une traduction ou un résumé.
Le premier article de la série présentait la gamme Qwen et ses trois modes d’accès. Celui-ci montre comment doser la réflexion dans chacun de ces modes, puis comment écrire des prompts qui tirent le meilleur de Qwen.
Comment Qwen réfléchit aujourd’hui
La gestion du raisonnement a changé trois fois en un an. Avec Qwen3, sorti en avril 2025, un même modèle savait réfléchir ou répondre directement, et les commandes /think et /no_think permettaient de basculer d’un tour à l’autre. En juillet 2025, les versions 2507 ont séparé les deux usages en deux modèles distincts, l’un « Instruct » et l’autre « Thinking ».
Depuis Qwen3.5, Alibaba est revenu à un modèle unique qui réfléchit par défaut. Les fiches officielles de Qwen3.5 et de Qwen3.6 précisent que les commandes /think et /no_think ne sont plus prises en charge. La réflexion s’active ou se coupe désormais par un paramètre, et les modèles Qwen3.8 ajoutent un réglage d’intensité à plusieurs niveaux.
Les commandes /think et /no_think fonctionnent encore sur les modèles ouverts Qwen3 d’origine et sur certaines versions de qwen-plus. Si vous utilisez un modèle de 2025, elles gardent leur utilité. Sur tout modèle Qwen3.5 ou plus récent, le modèle les ignore.
Régler la réflexion selon votre outil
Dans Qwen Studio
Qwen Studio propose la réflexion approfondie comme une option à activer ou à couper avant d’envoyer votre message. Coupez-la pour les échanges rapides, et activez-la pour une analyse, un calcul ou un problème de code.
Par l’API Model Studio
Sur l’API, les modèles Qwen3.5, Qwen3.7 et Qwen3.8 réfléchissent par défaut. Les anciens modèles commerciaux qwen-plus et qwen-flash, eux, répondent directement. Quatre paramètres pilotent ce comportement.
- enable_thinking — il active ou coupe la réflexion, requête par requête.
- thinking_budget — il plafonne le nombre de tokens consacrés au raisonnement, de 1 à 32 768.
- reasoning_effort — il règle l’intensité sur les modèles Qwen3.8 : xhigh par défaut sur les modèles ouverts, puis medium et low.
- preserve_thinking — il renvoie le raisonnement des tours précédents au modèle, ce qui l’aide à garder le fil d’une longue tâche.
# Python, SDK OpenAI, région Singapour
from openai import OpenAI
client = OpenAI(
api_key="VOTRE_CLE",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
reponse = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Analyse ce contrat..."}],
extra_body={"enable_thinking": True, "thinking_budget": 4000},
stream=True,
)
Sur qwen3.8-max, le prix au token reste le même avec ou sans réflexion. Les tokens de raisonnement sont pourtant facturés comme des tokens de sortie, si bien qu’une réflexion longue alourdit la facture. Le paramètre thinking_budget sert précisément à la contenir.
En local
Avec Ollama, la commande /set nothink coupe la réflexion en cours de conversation, et l’option --think=false la désactive dès le lancement. Avec llama.cpp, le niveau se règle par reasoning_effort. Le guide pour installer Qwen en local détaille ces commandes.
Quel réglage pour quelle tâche
| Tâche | Réglage conseillé | Pourquoi |
|---|---|---|
| Traduction, reformulation, résumé | Réflexion coupée | Le raisonnement n’améliore pas le résultat et ralentit la réponse. |
| Extraction de données, classement | Réflexion coupée | Un format de sortie précis compte davantage que le raisonnement. |
| Rédaction d’un article ou d’un e-mail | Réflexion faible ou coupée | Le plan gagne un peu à la réflexion, le style beaucoup moins. |
| Analyse d’un document long | Réflexion moyenne | Le modèle doit croiser des informations dispersées. |
| Code, débogage, architecture | Réflexion active | Les écarts de qualité sont les plus nets sur ces tâches. |
| Mathématiques, logique, planification | Réflexion maximale | Ce sont les tâches pour lesquelles le raisonnement a été conçu. |
Le piège du sur-raisonnement
Un modèle réglé au maximum réfléchit parfois des milliers de tokens sur une question simple. Le développeur Simon Willison a ainsi attendu 21 minutes un dessin SVG avec Qwen3.8-27B, pour plus de 22 000 tokens de raisonnement, alors que la même demande aboutissait en un peu plus de deux minutes une fois la réflexion coupée. Le dessin obtenu avec réflexion était certes plus réussi, mais l’écart ne justifiait pas un tel délai pour un usage courant.
La bonne méthode consiste à partir d’une réflexion faible ou coupée, puis à monter d’un cran seulement si la réponse déçoit. Sur l’API, un plafond thinking_budget de quelques milliers de tokens évite les dérapages sans brider les tâches difficiles.
Les techniques de prompt qui marchent avec Qwen
Les principes généraux de l’art du prompt s’appliquent à Qwen comme aux autres modèles. Cinq techniques font toutefois une différence nette avec lui.
Donner un rôle motivé
Écrire « tu es un expert SEO » n’apporte presque rien. Donnez plutôt un contexte métier, un objectif précis et le format attendu. Le modèle comprend alors ce que vous attendez de cet expert.
Tu es consultant SEO pour un site e-commerce B2B. Ton objectif : trouver les 5 problèmes qui freinent le plus le classement de cette page, classés par impact et par effort. Pour chacun, donne le diagnostic, la correction et l'effet attendu. Page à auditer : [contenu]
Baliser les différentes parties du prompt
Quand vous envoyez un long texte, séparez nettement le contexte, le document et la consigne. Des balises de type XML suffisent, et le modèle sait alors ce qu’il doit analyser et ce qu’il doit faire.
<contexte>Blog B2B pour des DRH de PME.</contexte> <article>[texte complet]</article> <tache>Propose 3 améliorations pour générer plus de contacts.</tache>
Imposer le format de sortie
Qwen produit un JSON valide de façon fiable à condition de recevoir le schéma exact et la consigne de ne rien écrire autour. Par l’API, le mode de sortie structurée renforce encore cette fiabilité.
Extrais les informations de ce CV et renvoie uniquement un objet
JSON valide, sans texte avant ni après, au format suivant :
{"nom": "string", "email": "string", "annees_experience": "number",
"competences": ["string"]}
Si une information manque, mets null. N'invente rien.
CV : [texte]
Ancrer la langue française
Qwen maîtrise plus de 200 langues et dialectes. Sur une longue conversation, il lui arrive pourtant de glisser des anglicismes ou de basculer en anglais. Une consigne claire dans le message système stabilise la langue.
Réponds exclusivement en français de France, registre professionnel. Traduis les termes anglais courants (réunion, retour, livraison) et ne garde en anglais que les noms propres et les marques.
Montrer ce que vous voulez et ce que vous refusez
Pour une tâche de style, donnez deux exemples de ce que vous attendez et deux exemples de ce que vous rejetez. Le contraste cadre le modèle bien mieux qu’une longue description du ton souhaité.
Réécris cette accroche produit pour une boutique de lunettes. Ce que je veux : - « Monture en acétate italien, fabriquée à la main. Essai gratuit 15 jours. » Ce que je ne veux pas : - « Découvrez nos magnifiques montures qui subliment votre style ! » Accroche à réécrire : [texte]
Deux modèles de prompts à copier
Le premier modèle sert à l’analyse critique d’un texte, avec la réflexion active.
<texte>[document]</texte> Analyse ce texte en trois parties : 1. Les trois idées principales, en une phrase chacune. 2. Les affirmations qui manquent de preuves, citées mot pour mot. 3. Les deux questions qu'un lecteur exigeant poserait à l'auteur.
Le second modèle construit un plan d’action en deux temps. Demandez d’abord le plan, puis faites-le critiquer par le modèle lui-même dans un second message.
# Message 1 Propose un plan en 5 étapes pour [objectif], avec pour chaque étape le délai, le coût estimé et le risque principal. # Message 2 Relis ton plan comme un investisseur sceptique. Quelles sont les deux étapes les plus fragiles, et comment les renforcer ?
Pour aller plus loin, notre article sur les raisons pour lesquelles un prompt ne marche pas recense les erreurs les plus fréquentes, quel que soit le modèle.
Ce qu’il faut retenir
Oubliez /think et /no_think sur les modèles récents. Dans Qwen Studio, la réflexion s’active d’un clic. Par l’API, enable_thinking et thinking_budget la dosent requête par requête, et reasoning_effort règle son intensité sur Qwen3.8. En local, elle se coupe par une commande. Partez d’une réflexion faible, montez si nécessaire, et soignez la structure du prompt : c’est elle qui fait la plus grande différence au quotidien.
Quel modèle Qwen choisir selon votre machine, les commandes Ollama et LM Studio, les deux réglages à faire dès le départ et le branchement de Qwen Code sur un modèle local.