L’API Mistral et Studio : le guide pour les développeurs
Deux remises divisent votre facture par deux ou par dix, et elles n’apparaissent dans aucun tableau de prix. Le plus gros modèle de la gamme coûte moins cher que le modèle par défaut. Vous choisissez désormais la région où tourne votre inférence. Ce guide couvre les tarifs réels et le premier appel. Il traite ensuite la gouvernance des prompts en production, puis la méthode pour router chaque requête vers le bon modèle.
Mistral Studio est la console développeur de l’écosystème, anciennement La Plateforme puis AI Studio. Clés API, playground, suivi de consommation, fine-tuning, agents, connecteurs et déploiement : tout y passe. L’API elle-même reste un endpoint REST classique, compatible avec les SDK officiels et avec le SDK OpenAI moyennant un changement d’adresse de base.
Ce septième volet de la série « Maîtriser Mistral de A à Z » s’adresse aux développeurs et aux responsables techniques. Il fait suite à l’article sur Vibe Code, et il descend cette fois dans la couche que vous appelez depuis vos propres applications.
Studio en 2026 : quatre changements qui comptent
Commençons par ce qui rend obsolètes les guides publiés au printemps. Studio a gagné cette année quatre briques qui changent la façon de bâtir dessus.
- La gouvernance des prompts et des skills — depuis juillet, ce sont des actifs versionnés, avec retour arrière et journaux d’audit.
- Les endpoints régionaux — vous choisissez désormais où s’exécute votre inférence, en Europe ou aux États-Unis.
- Le Priority Tier — des niveaux de service engagés, en préversion publique.
- Les modèles ouverts tiers — la plateforme ne sert plus uniquement les modèles maison.
Chacune de ces briques est détaillée plus bas. Notez déjà qu’elles déplacent le centre de gravité de l’offre. Studio ne se vend plus comme un accès aux modèles Mistral, mais comme une couche d’exécution que vous contrôlez.
Premier appel en cinq minutes
Rendez-vous sur console.mistral.ai. Vous accédez ensuite au tableau de bord, au playground, à la gestion des clés et au suivi de consommation.
Créez la clé depuis la section dédiée, puis copiez-la immédiatement : elle ne sera plus affichée. Stockez-la dans une variable d’environnement, jamais en dur dans le code.
En Python, pip install mistralai. En TypeScript, npm add @mistralai/mistralai. Des SDK Java et Go existent également. À défaut, le SDK OpenAI fonctionne avec un simple changement d’adresse de base.
Un appel basique tient en cinq lignes. Le modèle répond ensuite en flux continu ou en bloc, selon votre paramétrage.
# Python — SDK officiel
import os
from mistralai import Mistral
client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])
response = client.chat.complete(
model="mistral-small-latest",
messages=[
{"role": "system", "content": "Tu es un assistant technique concis."},
{"role": "user", "content": "Explique le RAG en trois phrases."}
]
)
print(response.choices[0].message.content)
# Migration depuis le SDK OpenAI — une seule ligne change
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MISTRAL_API_KEY"],
base_url="https://api.mistral.ai/v1"
)
Les tarifs, et les deux remises que personne ne calcule
Mistral facture au token, entrée et sortie séparément. Voici les modèles principaux, en dollars par million de tokens.
| Modèle | Entrée | Sortie | Terrain de jeu |
|---|---|---|---|
| Mistral Medium 3.5 | 1,50 $ | 7,50 $ | Agentique, appels d’outils, code |
| Mistral Large 3 | 0,50 $ | 1,50 $ | Raisonnement, documents longs, multilingue |
| Mistral Small 4 | 0,15 $ | 0,60 $ | Tout-en-un au meilleur rapport capacité-prix |
| Ministral 3 | à partir de 0,10 $ | Volumes massifs, tâches simples, edge | |
S’y ajoutent des grilles à part. L’OCR se facture par tranche de mille pages, l’audio à la minute, et les API d’outils à l’appel.
L’anomalie de la grille
Un chiffre saute aux yeux : Large 3 sort cinq fois moins cher que Medium 3.5. Le plus gros modèle de la gamme est donc le moins coûteux des deux. L’explication tient à l’architecture. Large 3 est un modèle à experts, économique par token servi. Medium 3.5 est dense et se paie sur ce qu’il fait le mieux, c’est-à-dire l’agentique et le code.
La conséquence pratique est directe. Si votre charge consiste à produire du texte long ou à raisonner sans appeler d’outils, essayez Large 3 avant Medium 3.5. Beaucoup d’équipes paient le modèle par défaut pour des tâches qui n’en ont pas besoin.
Les deux remises
Voici le point qui change réellement une facture, et qui n’apparaît dans aucun tableau comparatif.
- Le traitement par lots — les requêtes asynchrones bénéficient d’une remise de 50 %, sur l’entrée comme sur la sortie. Résumé, classification, évaluation : tout ce qui n’exige pas de réponse immédiate devrait passer par là.
- Le cache de prompt — les tokens d’entrée déjà vus tombent à 10 % du tarif normal, soit 90 % de remise. Vous l’activez en passant une clé de cache stable, puis en gardant le préfixe identique d’un appel à l’autre.
Deux mécaniques conditionnent la seconde remise. Le cache travaille par blocs de 64 tokens, donc un prompt plus court ne le déclenchera jamais. Le préfixe doit par ailleurs rester rigoureusement identique : un horodatage glissant en tête de system prompt suffit à tout invalider.
Les tarifs Mistral ont beaucoup bougé en 2026, et les agrégateurs suivent mal. Des comparateurs affichaient encore récemment Large 3 au quadruple de son prix, plusieurs mois après la baisse. Contrôlez donc systématiquement la date, si vous bâtissez un modèle de coûts sur un billet de blog plutôt que sur la page officielle. Un chiffre vieux de quatre mois peut se tromper d’un facteur quatre.
Les fonctionnalités de l’API
Appel de fonctions et sorties structurées
L’API prend en charge l’appel de fonctions sur les modèles commerciaux, y compris en parallèle. Vous décrivez vos fonctions en JSON Schema, puis le modèle décide quand les appeler et fournit les arguments.
Côté format de réponse, deux modes coexistent. Le mode JSON simple force une sortie valide. Les sorties structurées vont plus loin : vous fournissez un schéma complet, et le modèle respecte exactement vos types et vos clés. C’est le second qu’il faut retenir en production.
Le raisonnement configurable
Le paramètre reasoning_effort reste disponible côté API, alors qu’il a disparu de l’interface Work. Deux valeurs seulement : none et high. Le détail des réglages associés figure dans l’article sur les prompts. Il est également accessible sur les endpoints Agents et Conversations.
Vision et traitement documentaire
Small 4, Medium 3.5 et Large 3 acceptent des images en entrée, en base64 ou par URL. Pour le document lui-même, un endpoint dédié fait mieux.
Mistral OCR 4, publié le 23 juin 2026, ajoute trois choses. Les boîtes englobantes, la classification des blocs, et des scores de confiance ligne à ligne. La couverture atteint 170 langues, et le modèle s’auto-héberge dans un conteneur unique. C’est la brique à privilégier dès qu’un pipeline traite des documents scannés.
Embeddings, audio et lots
Mistral Embed alimente la recherche sémantique et le clustering, avec compatibilité des bases vectorielles courantes. Côté audio, Voxtral couvre la transcription, y compris en temps réel, et Voxtral TTS la synthèse dans neuf langues. Le traitement par lots s’organise enfin en jobs, sans passer par un envoi de fichier préalable.
Fine-tuning
L’ajustement est disponible sur les modèles Small et Medium. Vous envoyez vos données au format JSONL, puis vous lancez un job. Vous appelez ensuite le modèle obtenu par la même API. Un Small ajusté sur vos données métier remplace souvent un modèle généraliste bien plus gros, pour une fraction du prix.
Agentic Search : la recherche documentaire change de méthode
Depuis le 20 août 2026, Mistral remplace la récupération en un seul passage par une boucle en plusieurs étapes. Le modèle dispose de cinq gestes : chercher, ouvrir, naviguer, lire et filtrer. Il traverse ainsi un document dense jusqu’à la bonne ligne, au lieu de travailler sur des extraits découpés à l’avance.
La brique s’appelle le Search Toolkit côté API, et elle alimente les bibliothèques dans Studio comme dans Vibe. Les gains annoncés sur des documents financiers denses sont considérables, en justesse comme en latence.
Pour vos pipelines, la conséquence inverse un réflexe bien installé. Vous n’avez plus à optimiser votre stratégie de découpage. Déposez le document entier, puis laissez le modèle naviguer dedans.
Prompts et Skills : la gouvernance de production
Voici l’ajout le plus utile aux équipes qui exploitent déjà en production. Depuis juillet 2026, Studio traite les prompts et les skills comme des actifs versionnés. Fini, donc, les chaînes de caractères perdues dans un dépôt.
Peu d’entreprises savent quelle version de prompt tourne aujourd’hui dans leur IA
Le dispositif apporte quatre choses. D’abord des versions immuables, ce qui rend le retour arrière fiable. Chaque actif porte un propriétaire identifié. Des étiquettes de classification permettent de séparer ce qui est sensible de ce qui ne l’est pas. Les journaux d’audit tracent enfin qui a modifié quoi, et à quel moment.
Un détail intéressera les architectes : une skill peut être exposée comme serveur MCP. Vous distribuez donc une méthode maison à vos agents sans dupliquer son contenu à chaque intégration.
Région, service et modèles tiers
Les endpoints régionaux
Les Mistral Regional Endpoints sont passés en disponibilité générale en août 2026. Un client de l’API choisit désormais où s’exécute son inférence, en Europe ou aux États-Unis. Le réglage s’aligne ensuite sur vos obligations de résidence des données et sur vos contraintes de latence.
Le Priority Tier
En préversion publique, ce palier apporte des niveaux de service engagés sur la disponibilité, des limites de débit personnalisées et une capacité réservée. Il vise les charges de production qui ne tolèrent pas la file d’attente partagée.
Les modèles ouverts tiers
La plateforme ne sert plus seulement les modèles Mistral. Elle accueille désormais des modèles ouverts tiers, à commencer par GLM-5.2, développé par le laboratoire chinois Z.ai. Ces modèles tournent sur la même infrastructure, sous les mêmes contrôles régionaux et avec les mêmes engagements de service.
Des charges différentes appellent des modèles différents
Le raisonnement se tient. Un système sérieux combine plusieurs modèles selon la charge. Mistral choisit donc d’être la couche qui les fait tourner proprement, plutôt que le fournisseur exclusif. Pour vous, cela signifie une chose concrète : vous pouvez router vers un modèle non-Mistral sans sortir du périmètre européen que vous avez choisi.
Quel modèle pour quel usage
La bonne question n’est pas de savoir quel modèle est le meilleur, mais lequel convient à chaque tâche. La gamme est conçue pour le routage. Le format compatible OpenAI le rend d’ailleurs trivial : seul le nom du modèle change dans l’appel.
Pour la plupart des tâches et pour le code : Mistral Medium
| Besoin | Modèle | Pourquoi |
|---|---|---|
| Classification, extraction, résumé, vision | Small 4 | Le meilleur rapport capacité-prix de la gamme |
| Agents, appels d’outils, code | Medium 3.5 | Le plus fiable sur les enchaînements d’outils |
| Raisonnement, documents longs, sorties longues | Large 3 | Très économique en sortie pour ce niveau |
| Volumes massifs, tâches simples, edge | Ministral 3 | Coût plancher, déployable en local |
| Recherche sémantique | Mistral Embed | Compatible avec les bases vectorielles courantes |
| Documents scannés | Mistral OCR 4 | Boîtes englobantes et scores de confiance |
La stratégie qui en découle tient en une phrase. Envoyez les requêtes simples vers Small 4, l’agentique et le code vers Medium 3.5, le raisonnement et les sorties longues vers Large 3. Combinée aux deux remises, cette approche par paliers réduit fortement la facture face à un usage qui enverrait tout vers un seul modèle.
Les limites à connaître
- Le contexte plafonne à 256K tokens — suffisant dans la plupart des cas, insuffisant pour avaler un corpus entier. Agentic Search compense toutefois en partie.
- Le cache exige de la discipline — préfixe stable, blocs de 64 tokens, clé constante. Une variable dynamique en tête de prompt annule d’ailleurs la remise sans prévenir.
- Le Priority Tier reste en préversion — ses garanties peuvent évoluer avant la disponibilité générale.
- Le raisonnement de pointe n’est pas toujours en tête — sur les tâches les plus exigeantes, mesurez plutôt sur vos propres cas avant de trancher.
Par où commencer
Ouvrez un compte Studio, générez une clé, lancez l’appel donné plus haut. Démarrez sur Small 4, qui couvre la majorité des besoins. Montez vers Medium 3.5 quand la tâche appelle des outils, vers Large 3 quand elle produit du texte long.
Faites ensuite les deux gestes qui rapportent le plus. Basculez en traitement par lots tout ce qui n’exige pas de réponse immédiate. Stabilisez votre préfixe de prompt et passez une clé de cache. Ces deux réglages, à eux seuls, valent plus que n’importe quel arbitrage de modèle.
L’étape suivante consiste à sortir du cloud. Les poids sont ouverts, et l’article 8 montre comment faire tourner ces mêmes modèles sur vos propres machines.
Faire tourner Mistral sur vos propres GPU — d’Ollama à vLLM, sans qu’un seul token ne quitte votre réseau.