Aller au contenu
    LOCAL
    Guide IA · Série Qwen 3/7

    Installer Qwen en local : Ollama, LM Studio et Qwen Code

    Depuis le 14 août, Qwen3.8-27B est téléchargeable sous licence Apache 2.0. Le modèle pèse 18 Go dans Ollama et tourne sur une carte graphique de 24 Go ou sur un Mac doté de 32 Go de mémoire. Une seule commande suffit pour le lancer, et vos données ne quittent plus votre machine. Ce guide vous aide à choisir le bon modèle Qwen selon votre matériel, à éviter les deux réglages qui gâchent l’expérience, puis à brancher Qwen Code ou Claude Code sur votre modèle local.

    Faire tourner Qwen chez soi est devenu la voie gratuite pour coder avec cet écosystème. Qwen Code a fermé son accès gratuit le 15 avril, et sa documentation officielle renvoie désormais vers Ollama ou vLLM pour qui veut continuer sans abonnement. Pour tous les autres usages, le local garde ses atouts habituels : la confidentialité, l’absence de quota et le fonctionnement hors ligne.

    Le précédent article de la série expliquait comment régler le raisonnement de Qwen. Ce réglage compte encore davantage sur votre ordinateur, car un modèle qui réfléchit trop longtemps peut bloquer une machine grand public pendant de longues minutes. Cet article couvre le choix du modèle, l’installation avec Ollama et LM Studio, la quantification, puis le branchement des agents de code.

    Pourquoi faire tourner Qwen sur votre machine

    Vos données restent chez vous. Vos prompts et vos documents ne transitent par aucun serveur, ni en Chine ni ailleurs. Un avocat, un médecin ou un service RH peut ainsi travailler sur des pièces confidentielles sans se poser la question du transfert de données, un point que détaille notre article sur l’IA et le RGPD.

    Vous ne payez plus à la requête. Une fois le modèle téléchargé, chaque réponse est gratuite, sans quota journalier ni facture qui grimpe. Le coût se limite à la machine et à l’électricité.

    Le modèle fonctionne hors ligne. Dans un train sans réseau ou sur un site isolé, votre assistant répond toujours. Il reste aussi identique tant que vous le gardez, alors qu’un service en ligne peut changer de modèle, de prix ou de conditions du jour au lendemain.

    La licence le permet. Les modèles Qwen3.5, Qwen3.6 et Qwen3.8-27B sont publiés sous Apache 2.0, qui autorise l’usage commercial. Les poids ouverts de Qwen3.8-Max et de Qwen3.8-Flash-Next ont en revanche leurs propres licences, plus restrictives pour les très grosses entreprises.

    Le compromis à accepter

    Le modèle que vous installez chez vous reste bien plus petit que celui qui répond sur Qwen Studio ou par l’API. Qwen3.8-Max compte 2 400 milliards de paramètres, et sa version téléchargeable demande environ 400 Go de mémoire même dans sa compression la plus poussée. Chez vous, vous ferez tourner un modèle de 4 à 35 milliards de paramètres. Il suffit pour la rédaction, le résumé, la traduction ou le code courant, et vous gardez l’accès en ligne pour les tâches les plus lourdes.

    Quel modèle Qwen choisir selon votre machine

    Sur un PC, c’est la mémoire de la carte graphique (VRAM) qui décide. Sur un Mac Apple Silicon, la mémoire unifiée joue ce rôle, ce qui permet à un MacBook de 32 Go de charger des modèles réservés ailleurs aux grosses cartes graphiques. Les tailles ci-dessous correspondent aux téléchargements Ollama, compressés en 4 bits par défaut.

    Votre machine Modèle conseillé Commande Ollama Téléchargement
    PC portable ou Mac 8 Go Qwen3.5 4B qwen3.5:4b 3,4 Go
    Mac 16 Go, carte graphique 8 à 12 Go Qwen3.5 9B qwen3.5:9b 6,6 Go
    Carte 24 Go (RTX 3090, 4090) ou Mac 32 Go Qwen3.8 27B qwen3.8:27b 18 Go
    Carte 24 Go ou Mac 32 à 48 Go, priorité à la vitesse Qwen3.6 35B-A3B qwen3.6:35b 23 Go
    Mac 64 Go et plus, pour le code Qwen3-Coder-Next qwen3-coder-next 52 Go
    Mac 128 Go Qwen3.5 122B-A10B qwen3.5:122b 81 Go

    Le choix entre 27B et 35B-A3B mérite une explication. Qwen3.8-27B est un modèle dense : tous ses paramètres travaillent à chaque mot, ce qui le rend plus précis mais plus lent. Qwen3.6-35B-A3B est un modèle à experts, qui n’active que 3 milliards de paramètres par mot et répond donc bien plus vite. Sur le benchmark de code SWE-bench Verified, Alibaba annonce 77,2 pour Qwen3.6-27B contre 73,4 pour la version 35B-A3B.

    Côté vitesse, le développeur Simon Willison mesure 15 à 30 tokens par seconde avec Qwen3.8-27B sur un MacBook Pro M5 Max. Le site LLMCheck relève environ 44 tokens par seconde pour Qwen3.6-35B-A3B sur un Mac M4 Max de 48 Go. Sachez enfin qu’Alibaba n’a publié aucun modèle Qwen3.6 ou Qwen3.8 sous les 27 milliards de paramètres : sur une petite machine, la génération Qwen3.5 reste la bonne. Tous ces modèles lisent aussi les images, puisque la vision est intégrée aux modèles principaux depuis Qwen3.5.

    Installer Ollama et lancer Qwen

    Ollama télécharge les modèles par leur nom, les lance en une commande et les expose à vos autres logiciels sur localhost:11434, dans un format compatible avec l’API d’OpenAI. Notre guide pour installer Ollama et lancer un premier modèle détaille la prise en main pas à pas.

    # macOS et Linux
    curl -fsSL https://ollama.com/install.sh | sh
    
    # Windows : installeur à télécharger sur ollama.com
    
    # Télécharger et lancer le modèle adapté à votre machine
    ollama run qwen3.8:27b
    ollama run qwen3.5:9b
    
    # Vérifier ce qui tourne, et sur quel processeur
    ollama ps

    Sur Mac, Ollama propose aussi des versions MLX, le format optimisé pour Apple Silicon, comme qwen3.8:27b-mlx. Ce moteur est encore en préversion depuis le 30 mars et demande un Mac de plus de 32 Go de mémoire unifiée.

    Doser la réflexion du modèle

    Qwen3.8 réfléchit par défaut, et au niveau le plus élevé. Sur un ordinateur personnel, ce réglage produit des milliers de tokens de réflexion avant la moindre réponse. Simon Willison a ainsi attendu 21 minutes un simple dessin SVG, pour 22 276 tokens de raisonnement, alors que le même dessin sortait en un peu plus de deux minutes une fois la réflexion coupée.

    It’s absolutely not a good way to run the model, especially on consumer hardware.
    Ce n’est absolument pas une bonne façon de faire tourner le modèle, surtout sur du matériel grand public. Simon Willison — à propos du réglage par défaut de Qwen3.8-27B, août 2026

    Coupez donc la réflexion pour les tâches courantes, et réactivez-la quand la question le justifie.

    # Au lancement
    ollama run qwen3.8:27b --think=false
    
    # Pendant une conversation
    /set nothink
    /set think
    
    # Avec llama.cpp : choisir le niveau (none, low, medium, xhigh)
    --chat-template-kwargs '{"reasoning_effort":"low"}'

    Régler la longueur de contexte

    Le second piège est moins visible. Ollama fixe la mémoire de conversation selon votre carte graphique : 4 000 tokens sous 24 Go de VRAM, 32 000 entre 24 et 48 Go, et 256 000 au-delà. Avec 4 000 tokens, le modèle oublie le début d’un long document sans le signaler. Augmentez cette valeur dans les réglages de l’application Ollama, ou au lancement du serveur.

    OLLAMA_CONTEXT_LENGTH=32768 ollama serve

    Chaque palier supplémentaire consomme de la mémoire. Montez progressivement, et vérifiez avec ollama ps que le modèle tourne toujours entièrement sur la carte graphique.

    LM Studio : la même chose avec une interface

    LM Studio offre les mêmes modèles dans une application graphique, sans ligne de commande. Il gère les formats GGUF et MLX, et son catalogue propose Qwen3.8 27B, Qwen3.6 27B et 35B, la gamme Qwen3.5 ainsi que Qwen3-Coder-Next. Notre article consacré à LM Studio pour l’IA locale présente l’outil en détail.

    Étape 01
    Installer LM Studio

    Téléchargez l’application sur lmstudio.ai pour macOS, Windows ou Linux. L’usage personnel comme professionnel est gratuit.

    Étape 02
    Télécharger un modèle Qwen

    Tapez « qwen3.8 » dans la recherche de modèles, puis choisissez une version en 4 bits. LM Studio indique si elle tient dans la mémoire de votre machine.

    Étape 03
    Régler et discuter

    Chargez le modèle dans l’onglet Chat, baissez ou coupez la réflexion dans les réglages, puis ajustez la longueur de contexte avant votre premier prompt.

    LM Studio peut aussi servir de serveur local. Il expose alors une API compatible OpenAI sur localhost:1234, que vos autres outils utilisent comme ils utiliseraient Ollama.

    Choisir la bonne quantification

    La quantification réduit la place du modèle en mémoire en codant ses paramètres sur moins de bits. Plus elle est forte, plus le modèle est léger, mais plus ses réponses perdent en qualité. Le tableau ci-dessous reprend les besoins en mémoire de Qwen3.8-27B relevés par Unsloth, qui publie les versions compressées les plus utilisées.

    Quantification Mémoire pour Qwen3.8-27B Qualité
    BF16 (non compressé) 56 Go Maximale
    8 bits (Q8_0) 31 Go Quasi identique
    6 bits (Q6_K) 23 à 26 Go Très bonne
    4 bits (Q4_K_M, UD-Q4_K_XL) 16 à 19 Go Bonne, le meilleur compromis
    3 bits 12 à 14 Go Perte visible
    2 bits 9 à 11 Go À réserver aux cas extrêmes

    Restez en 4 bits dans la grande majorité des cas. Si la mémoire vous manque, préférez un modèle plus petit bien compressé à un gros modèle compressé en 2 bits. Unsloth recommande aussi des réglages précis pour Qwen3.8 : une température de 1,0 avec top_p à 0,95 quand la réflexion est active, puis 0,7 et 0,8 quand elle est coupée.

    Coder avec Qwen en local : Qwen Code, Claude Code et Codex

    Qwen Code, l’agent en ligne de commande d’Alibaba, accepte n’importe quel serveur compatible OpenAI. Déclarez votre modèle local dans le fichier ~/.qwen/settings.json, en indiquant l’adresse d’Ollama ou de LM Studio.

    {
      "modelProviders": {
        "openai": [
          { "id": "qwen3.6:27b", "baseUrl": "http://localhost:11434/v1", "envKey": "OLLAMA_KEY" }
        ]
      },
      "env": { "OLLAMA_KEY": "ollama" },
      "security": { "auth": { "selectedType": "openai" } },
      "model": { "name": "qwen3.6:27b" }
    }

    Ollama sait aussi lancer directement d’autres agents avec un modèle local. Depuis sa version 0.15, la commande ollama launch claude démarre Claude Code et vous laisse choisir le modèle, et elle fonctionne de la même façon avec Codex, OpenCode et Droid.

    Un agent de code lit beaucoup de fichiers, donc le contexte devient décisif. Réglez-le au minimum à 32 000 tokens, et idéalement à 64 000, faute de quoi l’agent oublie les fichiers qu’il vient d’ouvrir. Sur une carte de 24 Go, Qwen3.6-27B et Qwen3.6-35B-A3B existent en variantes « coding » dans Ollama. Au-delà de 64 Go de mémoire, Qwen3-Coder-Next devient la meilleure option.

    Dépannage des problèmes fréquents

    La génération est très lente. La commande ollama ps indique si une partie du modèle a basculé sur le processeur. Quand c’est le cas, passez à un modèle plus petit ou baissez la longueur de contexte.

    Le modèle réfléchit sans fin. La réflexion est active par défaut sur Qwen3.8. Coupez-la avec /set nothink ou dans les réglages de LM Studio.

    Le modèle oublie le début de la conversation. Le contexte est trop court pour votre usage. Augmentez OLLAMA_CONTEXT_LENGTH ou le curseur de l’application.

    Les images ne sont pas lues. Mettez Ollama à jour. Les modèles Qwen3.5, Qwen3.6 et Qwen3.8 acceptent les images, mais seules les versions récentes de l’outil les prennent en charge.

    Notre avis

    Qwen3.8-27B est aujourd’hui le meilleur point d’entrée pour faire tourner Qwen chez soi, à condition de posséder 24 Go de VRAM ou un Mac de 32 Go. Sous licence Apache 2.0, multimodal et solide en code, il couvre l’essentiel des usages quotidiens. Son réglage par défaut dessert pourtant les débutants, qui risquent de le juger lent alors qu’il réfléchit simplement trop.

    Sur une machine plus modeste, Qwen3.5-9B reste un très bon compagnon. Pour le code, le local a pris de la valeur depuis la fin de l’accès gratuit à Qwen Code : un Mac bien doté ou une carte de 24 Go remplace désormais un abonnement pour une bonne partie du travail courant.

    Ce qu’il faut retenir

    Choisissez votre modèle d’après votre mémoire : Qwen3.5-9B avec 16 Go, Qwen3.8-27B avec 24 Go de VRAM ou 32 Go sur Mac. Installez Ollama ou LM Studio, puis réglez deux paramètres dès le départ : coupez la réflexion pour les tâches simples, et allongez le contexte. Pour aller plus loin, notre guide de l’auto-hébergement des modèles Mistral applique la même méthode à l’autre grande famille de modèles ouverts.

    Article suivant — 4/7
    Coder avec Qwen : l’alternative à Claude Code

    Qwen Code, les modèles Qwen pour le code et leurs résultats face à Claude Code et Codex, avec les formules payantes qui ont remplacé l’accès gratuit.

    Coder avec Qwen ↗
    Mise à jour : 23 septembre 2026
    Étiquettes: