Aller au contenu
    LOCAL
    Guide IA – Série Mistral 8/10

    Auto-hébergement Mistral : faire tourner les modèles sur vos machines

    Certains cas d’usage exigent que rien ne sorte du réseau, pas même vers des serveurs européens. Code propriétaire, données de santé, documents classifiés. Mistral publie ses modèles en téléchargement libre. L’été 2026 en a d’ailleurs ajouté trois de plus, dont un classificateur de modération qui tient sur une seule carte graphique. Ce guide couvre les licences, Ollama, vLLM, les modèles spécialisés et la voie médiane que beaucoup ignorent.

    Parmi les grands laboratoires, Mistral fait figure d’exception. Il publie ses modèles les plus performants en téléchargement libre, le plus souvent sous licence Apache 2.0. Large 3 et Small 4 sont ainsi modifiables et déployables commercialement sans restriction. Depuis avril 2026, son modèle par défaut lui-même s’auto-héberge.

    Ce huitième volet de la série « Maîtriser Mistral de A à Z » est technique. Il fait suite à l’article sur l’API et Studio, et s’adresse cette fois aux équipes qui veulent déployer en interne.

    Ce que l’été 2026 a ajouté au catalogue ouvert

    Commençons par les nouveautés, car elles élargissent nettement le périmètre de ce qu’on peut faire tourner chez soi. Trois modèles spécialisés sont ainsi sortis en poids ouverts entre juin et août.

    • Mistral OCR 4, le 23 juin — l’extraction documentaire, avec boîtes englobantes, classification des blocs et scores de confiance. Elle s’auto-héberge dans un conteneur unique.
    • Leanstral 1.5, le 2 juillet — les preuves formelles en Lean 4, sous Apache 2.0, avec un endpoint gratuit pendant la phase de retours.
    • Shieldstral, le 4 août — la modération de contenus, texte et image, sur une seule carte de 16 Go. Une section lui est consacrée plus bas.

    Une quatrième évolution mérite votre attention, même si elle ne relève pas de l’auto-hébergement. Depuis août, vous pouvez choisir la région où s’exécute votre inférence sur l’API. Cette voie médiane répond à une partie des besoins qui poussaient autrefois vers le déploiement interne, et nous y revenons en fin d’article.

    Les licences : ce que vous pouvez faire, et ce qui demande un accord

    Tous les modèles Mistral ne partagent pas le même régime. Vérifiez le statut exact avant tout déploiement.

    Modèle Licence Usage commercial
    Mistral Large 3 Apache 2.0 Oui, sans restriction
    Mistral Small 4 Apache 2.0 Oui, sans restriction
    Ministral 3 Apache 2.0 Oui, sans restriction
    Shieldstral Apache 2.0 Oui, sans restriction
    Leanstral 1.5 Apache 2.0 Oui, sans restriction
    Devstral Small Apache 2.0 Oui, sans restriction
    Mistral Medium 3.5 MIT modifiée Oui, sous seuil de revenus
    Devstral 2 MIT modifiée Oui, sous seuil de revenus
    Voxtral TTS CC BY-NC 4.0 Non, accord requis

    Apache 2.0 reste la licence la plus permissive : vous utilisez, modifiez et redistribuez sans rien demander. La licence MIT modifiée de Medium 3.5 et Devstral 2 est libre pour l’immense majorité des usages. Elle comporte toutefois une clause de revenus : au-delà d’un certain chiffre d’affaires mondial, une organisation doit négocier une licence commerciale. CC BY-NC 4.0 interdit enfin l’usage commercial sans accord séparé.

    Un réflexe s’impose donc avant toute mise en production. Ouvrez la fiche Hugging Face du modèle, puis lisez la licence qui y figure. Ne vous fiez jamais à un tableau récapitulatif, celui-ci compris.

    Palier 1 : sur un poste de travail, avec Ollama

    Voici le point d’entrée le plus simple. Ollama transforme le déploiement local en une commande unique. Il gère ensuite le téléchargement, la quantification et le service, en s’appuyant sur llama.cpp.

    # Installation
    brew install ollama                              # macOS
    curl -fsSL https://ollama.com/install.sh | sh    # Linux
    
    # Récupérer un modèle, puis converser
    ollama pull ministral
    ollama run ministral

    Quel modèle pour quelle machine

    Machine Modèle conseillé Ce que vous pouvez en attendre
    Portable 8 Go Ministral 3B quantifié Basique mais fonctionnel, sur processeur
    Portable 16 Go Ministral 8B Confortable pour les tâches quotidiennes
    Mac Apple Silicon 32 Go Ministral 14B ou Codestral Bon pour le code et la rédaction
    Carte 24 Go Devstral Small Agent de code local à pleine vitesse
    Mac Apple Silicon 192 Go Small 4 quantifié Le meilleur niveau atteignable en local

    L’atout d’Ollama tient à son serveur local compatible avec l’API OpenAI. Vous branchez ainsi n’importe quel outil qui parle ce format vers votre modèle, sans toucher une ligne de code applicatif.

    La quantification, en deux phrases

    Les modèles sont publiés en pleine précision, mais la compression divise leur taille par environ quatre pour une perte de qualité minime. Un modèle de 14 milliards de paramètres passe ainsi d’une trentaine de gigaoctets à moins de dix, et Ollama s’en charge tout seul. Sur GPU NVIDIA, Mistral publie par ailleurs des versions déjà optimisées qui compressent davantage encore.

    Palier 2 : en production, avec vLLM

    Pour du service en production, vLLM reste le moteur d’inférence recommandé. Le projet est optimisé pour le débit. On y trouve notamment le regroupement automatique des requêtes, la gestion paginée de l’attention et le parallélisme sur plusieurs cartes.

    # Servir un modèle Mistral avec vLLM
    pip install vllm
    
    vllm serve <identifiant-du-modele-sur-hugging-face> \
      --tensor-parallel-size 4 \
      --max-model-len 262144 \
      --tool-call-parser mistral \
      --enable-auto-tool-choice \
      --reasoning-parser mistral
    
    # L'identifiant exact figure sur la fiche Hugging Face du modèle.
    # Les versions quantifiées tournent souvent sur deux fois moins de cartes.

    Small 4, le choix pragmatique

    Small 4 reste l’option la plus raisonnable pour un premier déploiement sérieux. Son architecture à experts n’active en effet que 6 milliards de paramètres par token, sur 119 au total. Le coût d’inférence par requête se rapproche donc d’un modèle dense bien plus petit, alors que les capacités restent celles d’un grand modèle.

    Medium 3.5, le modèle par défaut chez vous

    C’est la nouveauté qui change la donne pour les équipes techniques. Le modèle par défaut de l’écosystème, celui qui motorise l’agent de code, est publié en poids ouverts. Dense, 128 milliards de paramètres, il tient pourtant sur quatre cartes serveur, tout en conservant son niveau. Pour une équipe qui veut l’agentique et le code en interne sans rien envoyer dehors, c’est aujourd’hui l’option la plus aboutie.

    Large 3, pour les volumes lourds

    Déployer Large 3 en interne reste faisable, mais coûteux en matériel. Deux cas le justifient. Des volumes assez importants pour amortir le matériel face à l’API, d’une part. Une exigence de souveraineté absolue, où même l’API européenne ne suffit pas, d’autre part. SGLang, les conteneurs NVIDIA et Transformers complètent par ailleurs la liste des moteurs supportés.

    Shieldstral : la modération qui ne sort plus de chez vous

    Voici l’ajout le plus intéressant de l’été pour qui exploite une plateforme. Publié le 4 août 2026, Shieldstral est un classificateur de sécurité de 3 milliards de paramètres, sous Apache 2.0. Il juge du texte comme des images, et il tient sur une seule carte de 16 Go.

    Le principe : une question, pas une taxonomie

    La plupart des modèles de garde s’entraînent en effet sur une liste figée de catégories. Si vos règles n’y correspondent pas, vous devez réentraîner ou vivre avec l’écart. Shieldstral inverse la logique : vous posez votre politique sous forme de question fermée, en langage naturel, au moment de l’appel.

    Les politiques vivent entièrement dans le prompt
    Mistral AI — présentation de Shieldstral, 4 août 2026

    Le modèle renvoie ensuite un score de confiance calibré, à partir des probabilités de réponse. Une nouvelle obligation réglementaire arrive ? Vous écrivez une question de plus. Aucun réentraînement, aucun ticket chez un fournisseur.

    Pourquoi ça compte pour une plateforme européenne

    L’intérêt dépasse la performance brute. Un opérateur soumis au règlement sur les services numériques peut désormais garder la modération sur ses propres serveurs. Les messages et les images de ses utilisateurs ne partent plus vers une API de classification étrangère. Toute la chaîne de gouvernance — définition de la politique, validation, tests adverses, maintenance — reste chez lui.

    Trois réserves avant de basculer

    • Le multilingue est inégal — le rapport technique de Mistral signale lui-même un retrait sur l’arabe et l’indonésien, et annonce l’élargissement linguistique comme priorité.
    • Les documents longs ne sont pas caractérisés — le comportement sur des entrées de plusieurs milliers de tokens reste mal documenté.
    • Vos questions deviennent du code — la souplesse a un prix. Si vous ne versionnez pas vos formulations de politique comme vous versionnez votre code, la flexibilité se retourne contre vous.

    Un point d’attention pour finir. Mistral n’a pas annoncé de tarif hébergé pour Shieldstral : l’utiliser signifie l’auto-héberger. L’endpoint de modération texte gratuit qui figure au catalogue est un autre produit, à ne pas confondre.

    Les autres modèles spécialisés à faire tourner chez soi

    Mistral OCR 4 pour le document

    Publié le 23 juin, OCR 4 s’auto-héberge quant à lui dans un conteneur unique. Il apporte les boîtes englobantes, la classification des blocs et des scores de confiance ligne à ligne, sur 170 langues. Pour un flux de traitement documentaire qui ne doit rien envoyer à l’extérieur, c’est la brique à retenir.

    Leanstral 1.5 pour la preuve formelle

    Sorti le 2 juillet, ce modèle vise le langage Lean 4. Architecture éparse, 119 milliards de paramètres dont 6 actifs, licence Apache 2.0. Un endpoint gratuit permet toutefois de l’essayer avant d’engager du matériel. Pour la cryptographie, les logiciels critiques ou les mathématiques formalisées, aucune option ouverte n’atteint ce niveau de spécialisation.

    Voxtral pour la voix

    Voxtral TTS produit de la synthèse dans neuf langues, avec clonage vocal à partir de quelques secondes de référence. Il reste par ailleurs assez léger pour une carte grand public. Attention toutefois à la licence : CC BY-NC 4.0 exclut l’usage commercial sans accord séparé. La recherche, le prototypage et l’usage interne non commercial restent libres.

    La voie médiane que beaucoup ignorent

    L’auto-hébergement n’est plus la seule réponse à une exigence de souveraineté. Depuis août 2026, les endpoints régionaux de Mistral sont en disponibilité générale. Vous choisissez désormais la région où s’exécute votre inférence. Un palier de service engagé complète également l’offre, en préversion.

    Le contrôle de l’endroit où tourne l’IA n’est qu’une partie de la souveraineté
    Mistral AI — annonce du 11 août 2026

    Cette voie change ainsi l’arbitrage pour beaucoup d’organisations. Votre contrainte porte sur la résidence des données et la juridiction applicable ? L’endpoint régional y répond, sans que vous ayez à exploiter des GPU. Si elle porte sur le fait qu’aucune donnée ne sorte du réseau, alors seul l’auto-hébergement convient.

    GLM-5.2 et les modèles tiers, sous contrôle européen

    Un élargissement récent renforce encore cette option. La plateforme accueille désormais des modèles ouverts tiers, à commencer par GLM-5.2, développé par le laboratoire chinois Z.ai. Ils tournent sous les mêmes contrôles régionaux que les modèles maison. Autrement dit, vous pouvez servir un modèle ouvert non-Mistral avec une garantie de traitement en Europe, sans l’héberger vous-même.

    Posez-vous donc la question dans cet ordre. Ce qui vous est interdit, est-ce la sortie du territoire, ou la sortie du réseau ? La réponse détermine à elle seule quelle moitié de cet article vous concerne.

    Trois stratégies selon le profil

    Profil 01
    Développeur seul

    Ollama plus Ministral ou Devstral Small, sur un Mac 32 Go ou une carte 24 Go. Branchement à l’IDE via un client compatible. Aucun coût de tokens, installation en dix minutes.

    Profil 02
    Équipe ou PME

    vLLM plus Small 4 en version quantifiée, ou Medium 3.5 sur quatre cartes pour l’agentique. Une API interne compatible, partagée entre cinq et vingt développeurs.

    Profil 03
    Organisation réglementée

    Large 3 sur cluster, ajustement sur données internes, Shieldstral pour la modération et OCR 4 pour les documents. Rien ne sort, et la gouvernance reste entière.

    Ce que l’auto-hébergement change vraiment

    • Aucun coût de tokens — un modèle local ne facture rien à l’usage. Pour une équipe qui envoie des milliers de requêtes par jour, le matériel s’amortit vite.
    • Aucune donnée qui sort — prompts, documents et code restent chez vous. C’est souvent le facteur décisif dans les secteurs réglementés.
    • Adaptation totale — vous ajustez les modèles ouverts sur vos données. Un petit modèle spécialisé remplace alors souvent un grand modèle généraliste.
    • Aucune limite de débit — ni quota, ni file d’attente, ni dépendance à la disponibilité d’un service externe.
    • Maîtrise des versions — vous décidez quand mettre à jour. Fini le comportement qui change du jour au lendemain sans prévenir.

    La réversibilité mérite d’être soulignée, car elle est le bénéfice le plus sous-estimé. Vous prototypez d’abord sur l’API, puis vous basculez sur des poids auto-hébergés. Ce sont les mêmes modèles, sans migration ni réécriture. Cette continuité élimine la dépendance à un fournisseur unique.

    Par où commencer

    Installez Ollama, récupérez un Ministral, et testez-le sur une tâche que vous confiez d’habitude à l’API. Si la qualité suffit, et ce sera le cas pour beaucoup de tâches courantes, vous venez de supprimer une ligne de coût récurrent. Montez ensuite en gamme, si le besoin s’en fait sentir.

    L’auto-hébergement ne convient pourtant pas à tout le monde. Sans matériel, sans compétence système et sans cas d’usage, l’API reste la meilleure option. L’endpoint régional couvre d’ailleurs désormais une bonne partie des besoins de conformité.

    L’article suivant sort du terrain technique pour regarder l’offre entreprise : déploiement privé, entraînement sur données propriétaires et engagements de calcul européens.

    Suite de la série Mistral
    Mistral en entreprise : Forge et déploiement souverain

    L’offre pour les organisations — Vibe Enterprise, Forge, conformité européenne, unités de calcul et déploiement privé.

    Mistral en entreprise
    Mise à jour : 26 août 2026
    Étiquettes: