Le GLM Coding Plan : brancher GLM dans Claude Code, Cline et OpenCode
Dix-huit dollars par mois, un modèle à un million de tokens de contexte, et l’outil de développement que vous utilisez déjà. C’est la promesse du GLM Coding Plan, et la raison pour laquelle beaucoup de développeurs français arrivent sur Z.ai. Voici la configuration exacte, le fonctionnement réel des quotas et le calcul honnête face à un abonnement Claude.
Quelques variables d’environnement, un redémarrage de terminal, et Claude Code se met à parler à GLM-5.3. L’opération prend deux minutes et ne demande de rien désinstaller.
Cette compatibilité explique le succès du Coding Plan. Z.ai n’impose pas son outil : l’entreprise expose un point d’accès compatible avec le protocole d’Anthropic et laisse les développeurs garder leurs habitudes. Après le mode Agent du chat gratuit, ce troisième volet passe à la porte payante, celle qui présente un vrai intérêt économique.
Ce que le Coding Plan est, et ce qu’il n’est pas
La confusion la plus fréquente coûte de l’argent. Le GLM Coding Plan est un abonnement forfaitaire qui ne fonctionne que dans des outils de développement reconnus par Z.ai, avec son propre point d’accès. Il ne donne aucun droit sur l’API générale.
The GLM Coding Plan is strictly limited to use within officially supported tools and products
Documentation Z.ai, foire aux questions du Coding Plan
Si vous pointez une application maison ou un script personnel vers ce forfait, vous obtenez l’erreur 1113, « solde insuffisant ». Cette erreur ne signale pas un bug : elle indique que la requête sort des conditions de l’abonnement, par exemple avec une mauvaise adresse ou un modèle non couvert. Pour une intégration dans votre propre produit, il faut donc l’API à l’usage. Ces deux accès se cumulent très bien, sans se remplacer.
Les trois paliers et ce qu’ils achètent
Tous les paliers donnent accès aux mêmes modèles, GLM-5.3 et GLM-5.3-Flash. Les requêtes adressées à GLM-5.2 ou GLM-5.1 sont redirigées automatiquement vers GLM-5.3, et celles adressées à GLM-4.7 vers GLM-5.3-Flash. Seul le quota varie.
| Palier | Prix mensuel | Crédits par fenêtre de 5 h / par semaine |
|---|---|---|
| Lite | 18 $ | 2 000 / 10 000 |
| Pro | 80 $ ou 72 $ selon les sources | 12 000 / 60 000 |
| Max | 168 $ ou 160 $ selon les sources | 28 000 / 140 000 |
Les sources divergent sur les paliers supérieurs. Codingplan.org affiche 80 $ et 168 $ par mois, alors qu’AI Pricing Guru relève 72 $ et 160 $. La documentation de Z.ai confirme uniquement le palier Lite à partir de 18 $, avec 20 % de remise au trimestre et 30 % à l’année. Vérifiez donc la page d’abonnement le jour de votre achat.
Commencez au mois sur le palier Lite, mesurez votre consommation pendant trois semaines, puis passez à l’année si le rythme se confirme. Attention : Z.ai précise que l’abonnement n’est pas remboursable une fois acheté, même s’il n’a pas été utilisé.
Le système de crédits : double fenêtre et heures de pointe
Depuis le 30 juillet 2026, Z.ai ne compte plus en prompts mais en crédits. Ces crédits sont calculés à partir des tokens d’entrée, de cache et de sortie, chacun pondéré par un coefficient propre au modèle.
| Modèle | Entrée | Cache | Sortie |
|---|---|---|---|
| GLM-5.3 | 6,9 | 1,7 | 24 |
| GLM-5.3-Flash | 2,3 | 0,56 | 8 |
Les coefficients de GLM-5.3-Flash valent exactement le tiers de ceux de GLM-5.3. À travail égal, Flash consomme donc trois fois moins de crédits. Le calcul additionne les tokens multipliés par leurs coefficients, puis divise le total par 10 000.
Deux compteurs tournent en parallèle. Le premier se recharge cinq heures après la consommation et limite les rafales. Le second se recharge tous les sept jours et plafonne le volume global. Quand un compteur tombe à zéro, vous attendez le renouvellement, sans facturation de dépassement.
Z.ai fixe ses heures de pointe du lundi au vendredi, de 14 h à 18 h en heure de Singapour, soit de 8 h à 12 h à Paris. En dehors de ces créneaux, l’usage ne coûte que 50 % du tarif normal en crédits. Décaler les tâches lourdes après le déjeuner double donc presque votre capacité de travail.
Deux réflexes en découlent. Réservez GLM-5.3 aux tâches qui traversent plusieurs fichiers et confiez le reste à GLM-5.3-Flash. Lancez aussi les gros chantiers agentiques l’après-midi. Z.ai organise par ailleurs régulièrement des campagnes temporaires, comme l’usage illimité de Flash la nuit pour les abonnés, du 3 septembre au 7 octobre 2026.
Brancher GLM dans Claude Code
C’est le cas le plus fréquent, et le plus simple. Créez d’abord une clé sur la plateforme Z.ai, puis souscrivez au Coding Plan. Ouvrez ensuite le fichier de configuration de Claude Code, ~/.claude/settings.json, et renseignez le bloc suivant.
# ~/.claude/settings.json
{
"env": {
"ANTHROPIC_AUTH_TOKEN": "votre_cle_z_ai",
"ANTHROPIC_BASE_URL": "https://api.z.ai/api/anthropic",
"ANTHROPIC_DEFAULT_HAIKU_MODEL": "glm-5.3-flash",
"ANTHROPIC_DEFAULT_SONNET_MODEL": "glm-5.3",
"ANTHROPIC_DEFAULT_OPUS_MODEL": "glm-5.3",
"API_TIMEOUT_MS": "3000000"
}
}
Fermez toutes les fenêtres de Claude Code et rouvrez un terminal, car la configuration n’est lue qu’au démarrage. Claude Code raisonne en trois niveaux de modèle, et ce bloc décide quel modèle GLM répond à chacun. Envoyer le niveau intermédiaire vers GLM-5.3-Flash plutôt que vers GLM-5.3 divise la consommation par trois, au prix d’un peu de profondeur sur les tâches complexes. Enfin, le délai d’expiration élevé évite qu’une tâche agentique longue soit coupée en plein travail.
Les autres outils pris en charge
Le même abonnement sert plusieurs outils, dont Cline, OpenCode, Kilo Code, Roo Code, Goose, OpenClaw et ZCode, l’application de Z.ai. La liste complète figure sur une page dédiée de la documentation. Le principe reste identique partout : remplacer l’adresse du fournisseur par celle de Z.ai et coller la clé.
Deux adresses existent selon l’outil. Claude Code et Goose utilisent https://api.z.ai/api/anthropic, alors que les autres outils passent par https://api.z.ai/api/coding/paas/v4. Une erreur d’adresse suffit à déclencher l’erreur 1113. La documentation précise aussi que les tâches OpenClaw passent après celles des agents de code en cas de forte charge.
Les serveurs MCP inclus dans l’abonnement
Voilà l’avantage le moins connu du Coding Plan. Z.ai fournit ses propres serveurs MCP distants, sans installation locale, utilisables depuis les clients compatibles.
- Web Search effectue des recherches web. Il renvoie titres, adresses, résumés et sources.
- Web Reader lit une page entière. Il prend le relais quand le résumé de recherche ne suffit pas.
- Vision analyse des images. Il apporte cette capacité à un outil qui ne l’a pas nativement.
- Zread explore les dépôts de code. Il aide à comprendre un projet open source sans le cloner.
Le nombre d’appels inclus dépend du palier. Pour un développeur qui payait jusqu’ici un service de recherche à part, l’économie n’est pas anecdotique.
Coding Plan ou API : où est le point de bascule
La règle tient en une question : est-ce vous qui tapez, ou est-ce votre code ? Si un humain travaille dans un outil pris en charge, le forfait l’emporte presque toujours dès une heure de travail agentique par jour. À l’inverse, si c’est votre application qui appelle le modèle en continu, le forfait ne s’applique pas. L’API reste alors votre seule option, à 1,40 $ et 4,40 $ le million de tokens pour GLM-5.3, ou 0,15 $ et 0,50 $ pour GLM-5.3-Flash. Les deux se combinent sans difficulté : un forfait pour votre travail quotidien, une clé API séparée pour vos intégrations.
GLM remplace-t-il Claude ? Le calcul honnête
Les chiffres disponibles donnent une image nuancée. Le tableau suivant compare GLM-5.3 à Claude Opus 5, la référence au moment de sa sortie.
| Test | GLM-5.3 | Claude Opus 5 |
|---|---|---|
| DeepSWE v1.1, génie logiciel long | 66,9 % | 74,0 % |
| Terminal-Bench 3.0, agents en conteneur | 28,3 % | 42,7 % |
| Terminal-Bench 2.1, ligne de commande | 88,2 % | 89,1 % |
| CyberGym, chiffre déclaré par Z.ai | 84,5 % | 78,2 % |
| Prix par million de tokens, entrée et sortie | 1,40 $ et 4,40 $ | 5 $ et 25 $ |
Sur les tâches agentiques les plus exigeantes, l’écart reste net. En revanche, sur le développement courant, il devient faible alors que le prix est bien plus bas. Le score CyberGym, lui, est déclaré par Z.ai. Le 17 septembre 2026, le CAISI, rattaché au NIST américain, a qualifié GLM-5.3 de modèle à poids ouverts le plus capable en cybersécurité à ce jour. Il le situe toutefois à environ quatre mois des meilleurs modèles américains.
Depuis le 22 septembre 2026, Claude Opus 5.5 est facturé 4 $ et 20 $ le million de tokens. Sur les tests compilés par Vals AI, il devance GLM-5.3 sur douze épreuves, dont Terminal-Bench, alors que GLM-5.3 l’emporte sur quatre, dont un test de cybersécurité. La conclusion pratique reste une répartition plutôt qu’un remplacement. Le travail de volume, comme les tests, les refactorisations et les correctifs, part chez GLM. Les chantiers d’architecture et les problèmes qui résistent restent chez le modèle le plus capable.
Ce que cela change pour vous
Pour un développeur qui code plusieurs heures par semaine, le palier Lite au mois est un pari à faible risque, et trois semaines suffisent à savoir si le rythme tient. Deux réglages décident de la rentabilité : envoyer le maximum de travail vers GLM-5.3-Flash, et sortir des heures de pointe en décalant les tâches lourdes après midi.
Notre avis : c’est l’une des offres les plus intéressantes du marché sur le rapport capacité-prix, à condition de ne pas en attendre ce qu’elle ne promet pas. Deux réserves s’imposent. La disponibilité en période de charge reste le point faible, donc ne bâtissez pas une échéance client sur ce seul accès. De plus, l’abonnement ne couvre pas vos intégrations maison, ce qui déçoit souvent ceux qui ont acheté sans lire les conditions.
Le volet suivant pousse la logique plus loin : faire travailler GLM en autonomie avec ZCode, OpenClaw et les agents de Z.ai.