L’API Qwen et Model Studio : prix, régions et mise en production
Qwen3.8-Max coûte 2 $ le million de tokens en entrée et 6 $ en sortie, avec un million de tokens de contexte au même tarif. Depuis le 27 mars, Alibaba Cloud propose aussi une région à Francfort, où les données restent stockées en Europe. Encore faut-il s’y retrouver entre les régions, qui ont chacune leurs clés, leurs modèles et leurs prix. Ce dernier guide de la série couvre le choix de la région, les tarifs, le premier appel, les leviers pour réduire la facture et l’hébergement sur vos propres serveurs.
Model Studio est la plateforme d’Alibaba Cloud qui donne accès aux modèles Qwen par API, ainsi qu’à des modèles tiers comme DeepSeek, GLM, Kimi ou MiniMax. Elle parle le format d’OpenAI, si bien que la plupart des outils et des bibliothèques existants s’y branchent en changeant deux lignes. Qwen3.8-Max comprend aussi le protocole d’Anthropic.
Le précédent article de la série présentait les agents de l’écosystème Qwen. Celui-ci s’adresse aux développeurs et aux entreprises qui veulent intégrer Qwen dans leurs propres applications.
Choisir sa région
Model Studio fonctionne par régions, et ce choix compte davantage que chez la plupart des fournisseurs. Chaque région a ses propres clés d’API, sa propre liste de modèles et ses propres tarifs, et les données de vos requêtes y restent stockées.
| Région | Intérêt |
|---|---|
| Allemagne (Francfort) | Les données restent dans l’Union européenne. La région est ouverte depuis le 27 mars et s’utilise par un point d’accès propre à votre espace de travail. |
| Singapour | C’est la région internationale historique, qui offre le catalogue le plus large et le quota gratuit pour les nouveaux comptes. |
| États-Unis (Virginie) | Elle convient aux applications servies depuis l’Amérique du Nord. |
| Japon, Hong Kong, Pékin | Elles visent les marchés asiatiques, et Pékin propose souvent les prix les plus bas. |
Pour traiter des données personnelles depuis la France, Francfort s’impose. Vérifiez toutefois dans la console que le modèle voulu y est proposé, car toutes les régions n’offrent pas le même catalogue. Notre article sur l’IA et le RGPD pour les PME détaille les obligations qui s’appliquent.
Les modèles et leurs prix
Alibaba recommande trois modèles de texte : qwen3.8-max pour la qualité, qwen3.7-plus pour l’équilibre et qwen3.8-flash pour le volume. Les anciens qwen-flash et qwen-turbo sont désormais classés comme hérités. Les tarifs ci-dessous sont ceux de la région de Singapour, en dollars par million de tokens.
| Modèle | Entrée | Sortie | Remarque |
|---|---|---|---|
| qwen3.8-max | 2 $ | 6 $ | Tarif unique jusqu’à un million de tokens |
| qwen3.7-max | 2,50 $ | 7,50 $ | La génération précédente, plus chère que la 3.8 |
| qwen3.7-plus | 0,40 $ | 1,60 $ | Jusqu’à 256 000 tokens, puis 1,20 $ et 4,80 $ |
| qwen3.6-plus | 0,50 $ | 3 $ | Jusqu’à 256 000 tokens, puis 2 $ et 6 $ |
| qwen3.8-flash | environ 0,15 $ | environ 0,47 $ | Tarif relevé sur OpenRouter |
Qwen3.8-Max coûte donc moins cher que la génération qu’il remplace. Les nouveaux comptes de la région de Singapour reçoivent en général un million de tokens gratuits par modèle, valables 90 jours, pour les appels en temps réel uniquement.
Faire un premier appel
Créez une clé d’API dans la console Model Studio, pour la région choisie, puis utilisez le SDK d’OpenAI en changeant l’adresse du serveur.
# pip install openai
from openai import OpenAI
client = OpenAI(
api_key="VOTRE_CLE",
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
reponse = client.chat.completions.create(
model="qwen3.7-plus",
messages=[
{"role": "system", "content": "Réponds en français."},
{"role": "user", "content": "Résume ce texte en trois points : ..."},
],
extra_body={"enable_thinking": False},
)
print(reponse.choices[0].message.content)
Pour Francfort, remplacez l’adresse par le point d’accès de votre espace de travail indiqué dans la console. Le paramètre enable_thinking coupe ici la réflexion, activée par défaut sur les modèles récents. Le guide Piloter Qwen détaille les réglages du raisonnement.
Réduire la facture
Le cache de contexte
Quand vos requêtes répètent le même long début, comme une documentation ou des consignes système, le cache évite de repayer ce texte à chaque appel. Le cache implicite est automatique et facture les tokens retrouvés à 20 % du prix normal. Le cache explicite, que vous déclarez vous-même, coûte 125 % à la création, mais seulement 10 % ensuite, pendant cinq minutes. Il s’applique à partir de 1 024 tokens.
Le traitement par lot
Pour les tâches qui peuvent attendre, comme la classification de milliers de documents ou la génération de fiches produits, l’interface Batch divise le prix par deux en entrée comme en sortie. Vous déposez un fichier de requêtes, et les résultats arrivent dans un délai que vous fixez entre 24 heures et 14 jours.
La réflexion
Les tokens de raisonnement sont facturés comme des tokens de sortie. Coupez la réflexion pour les tâches simples, ou plafonnez-la avec thinking_budget : c’est souvent le levier le plus rentable.
Appel d’outils, sortie structurée et réentraînement
Les modèles recommandés gèrent l’appel de fonctions, qui permet au modèle de consulter votre base de données ou une API externe, ainsi que la sortie structurée en JSON. Model Studio propose aussi le réentraînement de modèles sur vos données, par apprentissage supervisé, préentraînement continu ou optimisation par préférences, avec la technique LoRA. Il est facturé au token d’entraînement. La liste des modèles concernés varie selon la région, et elle se consulte dans la console.
Héberger Qwen sur vos serveurs
Les modèles ouverts sous Apache 2.0, comme Qwen3.8-27B et la gamme Qwen3.6, peuvent tourner sur vos propres serveurs ou chez un hébergeur européen. vLLM et SGLang sont les deux moteurs recommandés par Alibaba pour la production, et vLLM doit être en version 0.19 ou plus récente pour Qwen3.6.
# Serveur compatible OpenAI sur le port 8000
pip install vllm
vllm serve Qwen/Qwen3.8-27B --max-model-len 131072
Les poids ouverts de Qwen3.8-Max relèvent en revanche d’une licence propre à Alibaba. Au-delà de 100 millions d’utilisateurs mensuels ou de 20 millions de dollars de revenus mensuels, un produit doit afficher le nom du modèle, et les services qui revendent l’accès au modèle doivent signer un accord commercial au-delà de 50 millions de dollars de revenus annuels. Pour une PME, ces seuils restent lointains. Le guide pour installer Qwen en local couvre l’usage sur un poste de travail.
Les pièges de la mise en production
- Les clés sont liées à une région — une clé de Singapour ne fonctionne pas à Francfort, et inversement.
- Les catalogues diffèrent — un modèle disponible à Singapour peut manquer dans une autre région, alors testez avant de migrer.
- La réflexion est active par défaut — sur les modèles récents, elle ajoute de la latence et des tokens si vous ne la coupez pas.
- Les modèles changent souvent — épinglez une version datée, comme
qwen3.8-max-0902, plutôt qu’un alias qui peut changer de modèle. - Le quota gratuit est limité — il ne couvre que Singapour et les appels en temps réel, sans le traitement par lot.
Notre avis
L’API Qwen offre aujourd’hui l’un des meilleurs rapports qualité-prix du marché, surtout depuis que Qwen3.8-Max coûte moins cher que la génération précédente. L’ouverture de Francfort lève aussi le principal frein pour les entreprises françaises. La multiplication des régions, des catalogues et des noms de modèles demande en revanche de la rigueur : un projet mal configuré peut facilement appeler le mauvais modèle dans la mauvaise région.
Ce qu’il faut retenir
Choisissez Francfort pour les données européennes, et vérifiez que le modèle y est disponible. Prenez qwen3.7-plus pour l’essentiel des usages, qwen3.8-max pour les tâches exigeantes et qwen3.8-flash pour le volume. Activez le cache, passez par le traitement par lot quand vous le pouvez, et coupez la réflexion là où elle ne sert pas.
Retrouvez les sept guides de la série, les points à connaître avant de vous lancer et ce qui fonctionne depuis la France.