Qu’est-ce qu’un LLM en intelligence artificielle ?
Un million de tokens de contexte, cinq niveaux d’effort de raisonnement, 552 milliards de paramètres dont 8 seulement actifs : les fiches techniques des grands modèles de langage sont devenues illisibles. Derrière ce vocabulaire, les mêmes quatre ou cinq mécanismes expliquent tout, du prix d’une requête à la qualité d’une réponse. Ce guide les démonte un par un, puis fait le point sur les modèles réellement en service.
Posez la même question à un assistant d’IA deux fois de suite, en changeant un seul réglage, et vous obtiendrez une réponse en trois secondes ou une réponse en trois minutes, pour un coût vingt fois différent. Ce réglage porte un nom, l’effort de raisonnement, et il n’existait pas dans les modèles de 2023. Comprendre un LLM demande donc autre chose qu’une définition : il faut savoir quels leviers existent, ce qu’ils coûtent et où ils cassent.
Un LLM, pour large language model, est un grand modèle de langage. C’est la brique qui fait tourner ChatGPT, Claude, Gemini, Vibe de Mistral, Qwen ou DeepSeek. Ce guide explique son fonctionnement, ses limites réelles et le paysage actuel des modèles, avec les licences et les tarifs exacts. Si vous cherchez ensuite à tirer le maximum d’un outil précis, nos séries Maîtriser votre LLM prennent le relais outil par outil.
LLM : une définition claire
Un LLM est un réseau de neurones entraîné sur d’immenses volumes de texte pour prédire la suite d’une séquence. Livres, articles, pages web, documentation technique, code source : le modèle en tire une représentation statistique des régularités d’une langue, sans jamais qu’on lui ait enseigné la grammaire.
Son principe tient en une phrase : à partir d’une séquence donnée, il calcule la probabilité de chaque continuation possible et en choisit une. Répétée des milliers de fois, cette opération produit des textes fluides et souvent justes. Elle produit aussi, exactement par le même mécanisme, des erreurs présentées avec le même aplomb.
La taille d’un LLM se mesure en paramètres, les coefficients ajustés pendant l’entraînement. Les modèles ouverts affichent des chiffres qui vont de quelques milliards à plusieurs milliers de milliards. Les laboratoires qui gardent leurs modèles fermés, OpenAI, Anthropic et Google en tête, ne publient plus aucun nombre de paramètres depuis plusieurs générations, ce qui rend impossible toute comparaison de taille entre modèles propriétaires.
Un LLM ne comprend pas le langage au sens où une personne le comprend. Il calcule des probabilités à très grande échelle, sur des milliards de paramètres. Cette mécanique explique à la fois la qualité de ses réponses et la nature de ses erreurs, appelées hallucinations.
Comment fonctionne un LLM : les briques techniques
L’architecture Transformer
Presque tous les LLM en service reposent sur le Transformer, une architecture présentée en 2017 par une équipe de recherche de Google. Les modèles antérieurs traitaient les mots un par un, ce qui limitait leur capacité à saisir le contexte global d’un texte et rendait l’entraînement lent.
Le Transformer résout le problème avec un mécanisme d’attention. Le modèle évalue simultanément les relations entre tous les mots d’un passage. Dans « le chat dort sur le canapé parce qu’il est fatigué », il rattache « il » à « chat » et non à « canapé ». Cette capacité à relier des éléments distants explique la cohérence des textes produits, et sa parallélisation a rendu économiquement possible l’entraînement sur des milliers de milliards de mots.
La tokenisation : du texte aux chiffres
Un LLM ne manipule pas des mots mais des tokens, des fragments de texte convertis en nombres. Un mot courant vaut un token, un mot rare se découpe en plusieurs morceaux. Cette approche permet de traiter n’importe quel texte, y compris des termes jamais rencontrés, en les décomposant en fragments connus.
Le découpage a une conséquence économique directe. Les tokenizers des grands modèles ont été optimisés sur l’anglais, donc un même contenu consomme davantage de tokens en français. À tarif identique, une application francophone coûte mécaniquement plus cher qu’une application anglophone, ce qui pèse sur les volumes importants.
Le pré-entraînement : apprendre la langue
La première phase s’appelle le pré-entraînement. Le modèle parcourt des milliers de milliards de tokens et apprend à prédire la suite de chaque séquence. Il acquiert au passage la grammaire, du vocabulaire, des structures de raisonnement et des connaissances factuelles encodées dans les textes.
Cette phase mobilise des milliers de processeurs graphiques pendant des semaines. Un seul chiffre de coût a été publié par un laboratoire, dans le rapport technique de DeepSeek-V3 : 2 788 000 heures de GPU H800, valorisées à 2 dollars l’heure, soit 5,576 millions de dollars. Le rapport précise que ce total couvre uniquement l’entraînement officiel, à l’exclusion de la recherche préalable et des expériences abandonnées, donc il ne représente pas le coût complet d’un projet. Pour GPT-6 Astra, le vice-président recherche d’OpenAI a évoqué plus de 100 000 cartes graphiques sur le site texan de Stargate, sans jamais publier de montant.
Le post-entraînement : rendre le modèle utilisable
À la sortie du pré-entraînement, le modèle complète du texte mais ne sait ni suivre une consigne ni refuser une demande dangereuse. Le fine-tuning supervisé lui apprend le format question-réponse sur des exemples rédigés à la main. Il sert aussi à spécialiser un modèle sur un domaine, en droit, en santé ou sur une base de code interne.
Vient ensuite le RLHF, l’apprentissage par renforcement à partir de retours humains. Des évaluateurs comparent des réponses deux à deux, ces préférences entraînent un modèle de récompense, et l’apprentissage par renforcement pousse le modèle vers les réponses les mieux notées. C’est en grande partie ce qui a fait le succès de ChatGPT fin 2022 : le modèle sous-jacent n’était pas révolutionnaire, son ajustement l’était. La méthode a aussi un défaut connu, la complaisance, parce que les évaluateurs humains préfèrent spontanément les réponses agréables.
La distillation : transmettre ce qu’un gros modèle sait faire
La distillation est devenue une brique standard du post-entraînement. Un grand modèle joue le rôle de professeur et un modèle plus petit apprend à reproduire ses sorties, ce qui transfère une partie de ses capacités à une fraction du coût de calcul. Gemma 4 repose sur une distillation depuis un grand modèle enseignant, DeepSeek a distillé les traces de raisonnement de R1 dans des variantes compactes de Qwen et de Llama, et Nemotron 3 Ultra de Nvidia combine plus de dix enseignants spécialisés.
Cette technique explique en bonne partie pourquoi de petits modèles ouverts tiennent aujourd’hui la comparaison avec des modèles fermés bien plus gros sur des tâches précises. Le meilleur professeur n’est d’ailleurs pas forcément le plus grand modèle, mais celui qui maîtrise le mieux le domaine visé.
Le mélange d’experts : pourquoi un modèle de 552 milliards de paramètres peut être rapide
Les fiches techniques affichent désormais deux chiffres de paramètres au lieu d’un. La raison tient à une architecture appelée mélange d’experts, ou mixture of experts. Le modèle découpe ses couches en sous-réseaux spécialisés et n’en active qu’une poignée pour chaque token, au lieu de faire travailler tout le réseau à chaque fois.
L’écart peut être spectaculaire. DeepSeek-V4.1-Flash annonce 552 milliards de paramètres au total, dont 8 milliards seulement sont actifs en entrée et 16 milliards en sortie. Les poids ouverts de Qwen3.8 affichent 2 400 milliards de paramètres pour 95 milliards actifs. Mistral Large 3 combine 675 milliards au total et 41 milliards actifs.
Deux conséquences pratiques en découlent. Le total détermine la mémoire nécessaire pour héberger le modèle, donc le nombre de cartes graphiques à acheter. Le nombre de paramètres actifs détermine la vitesse et le coût de calcul par token. Un modèle en mélange d’experts se comporte ainsi comme un très gros modèle qui coûterait le prix d’un petit à faire tourner, ce qui explique pourquoi presque tous les modèles ouverts récents ont adopté cette architecture. Les modèles denses n’ont pas disparu pour autant : Mistral Medium 3.5, avec ses 128 milliards de paramètres activés en totalité, se déploie sur quatre cartes graphiques seulement.
Les modes de raisonnement : le levier qui change tout
Le changement technique le plus visible des dernières générations tient à l’apparition des modes de raisonnement. Au lieu de répondre directement, le modèle produit d’abord une suite d’étapes intermédiaires, qu’il garde pour lui ou dont il livre un résumé. Cette délibération améliore nettement les résultats en mathématiques, en code et sur les tâches à plusieurs étapes.
La fonction ne constitue plus une gamme séparée. Elle est intégrée aux modèles phares et se règle par requête. OpenAI propose cinq niveaux pour GPT-6 Astra, de low à max. Anthropic applique la même échelle à Claude Fable 5.1, et une réflexion adaptative sur Claude Opus 5.5, Claude Opus 5 et Claude Sonnet 5, où le modèle décide seul quand et combien réfléchir. Gemini 3.8 Flash offre trois niveaux, avec medium par défaut. GLM-5.3 en propose trois aussi, et ne permet pas de désactiver le raisonnement.
Ces étapes intermédiaires se paient. Les tokens de raisonnement sont facturés au tarif de sortie, le plus élevé, alors que vous ne les lisez pas. Qwen3.8-Max accepte un budget de réflexion allant jusqu’à 262 000 tokens, ce qui donne l’ordre de grandeur de l’écart possible entre une question anodine et une question difficile. Sur un usage en volume, choisir le bon niveau d’effort pèse davantage sur la facture que le choix du modèle.
En pratique, une question factuelle simple se traite très bien avec un effort bas, ce qui divise le coût comme le délai. Réservez les niveaux hauts aux problèmes à plusieurs étapes, aux démonstrations et au débogage. Un modèle en réflexion maximale sur une reformulation de mail gaspille simplement de l’argent.
La fenêtre de contexte : ce que vaut vraiment un million de tokens
La fenêtre de contexte est la quantité maximale de tokens qu’un modèle prend en compte en une fois, instructions, documents et historique compris. C’est sa mémoire de travail. En 2024, les fenêtres courantes allaient de 8 000 à 128 000 tokens. Le million est devenu la norme des modèles phares, avec 1 050 000 tokens chez OpenAI, 1 million chez Anthropic, Google, DeepSeek et Z.ai, 1 048 576 chez Kimi K3.
Cette généralisation connaît des exceptions qu’il faut connaître avant de dimensionner un projet. Grok 4.6 plafonne à 500 000 tokens et Mistral Medium 3.5 à 256 000. Claude Haiku 4.5 s’arrête à 200 000 tokens, et Command A+ de Cohere à 128 000. La sortie maximale suit une autre logique : 128 000 tokens chez OpenAI, Anthropic et Z.ai, 64 000 seulement pour Gemini 3.8 Flash, mais 384 000 chez DeepSeek.
Deux réserves accompagnent ces chiffres. La première porte sur la qualité. La capacité annoncée n’est pas une garantie d’exploitation uniforme : les travaux de Chroma sur ce qu’ils nomment le context rot ont montré sur dix-huit modèles que la fiabilité se dégrade progressivement à mesure que l’entrée s’allonge, même sur des tâches très simples. OpenAI publie d’ailleurs pour GPT-6 Astra un score de 100 % sur le test MRCR v2 entre 256 000 et 512 000 tokens, et de 96,3 % au-delà, ce qui reste excellent tout en montrant la pente.
La seconde réserve porte sur le prix. Les longues requêtes ne coûtent pas proportionnellement plus cher, elles coûtent davantage que proportionnellement. GPT-6 Astra double son tarif d’entrée et de cache au-delà de 272 000 tokens dans une même requête, avec une majoration de 1,5 fois sur la sortie. Charger un dossier entier dans le contexte à chaque appel est donc rarement la bonne décision économique.
Si vous travaillez ponctuellement sur un gros document précis, le contexte long convient. Si vous interrogez régulièrement un corpus qui change, le RAG reste plus économique et plus fiable, parce qu’il n’envoie au modèle que les passages utiles. Beaucoup d’équipes combinent les deux : une recherche cible les bons documents, puis le contexte long les tient tous ensemble.
Le multimodal natif, et ce que le mot cache
Un modèle multimodal traite plusieurs types de données dans la même interaction. Le mot est devenu un argument commercial systématique, alors qu’il recouvre des réalités très inégales selon les modèles.
GPT-6 Astra accepte du texte et des images en entrée, et produit du texte. Muse Spark 1.1 de Meta y ajoute la vidéo et les PDF, avec des capacités de description d’image et de conversion d’un visuel en code. Gemini traite plusieurs modalités et Google a séparé le temps réel dans des modèles dédiés, Gemini 3.8 Live et sa variante à réflexion étendue, sortis le 15 septembre 2026. Qwen3.8-27B comprend images et vidéos nativement. DeepSeek-V4.1-Flash intègre la compréhension visuelle dans son architecture. GLM-5.3, en revanche, reste un modèle purement textuel qui n’accepte pas d’images du tout.
La leçon pratique est simple : vérifiez les modalités modèle par modèle sur la documentation de l’éditeur, jamais sur la page marketing de la gamme. Et gardez en tête que la génération d’images et de vidéos passe presque toujours par des modèles séparés, distincts du LLM, qui reposent sur d’autres architectures que la prédiction de tokens.
Les principaux LLM en service
Le paysage a beaucoup bougé en un an, y compris sur des points que l’on croyait acquis. Google n’a plus de modèle texte Gemini Pro en disponibilité générale, Meta a renoncé à Llama comme modèle phare, xAI a été absorbé par SpaceX, et Z.ai a quitté la licence MIT. Le tableau ci-dessous donne l’état des modèles phares, avec leurs tarifs par million de tokens.
| Éditeur | Modèle phare | Contexte | Entrée / sortie |
|---|---|---|---|
| OpenAI | GPT-6 Astra (3 sept. 2026) | 1 050 000 | 10 $ / 50 $ |
| Anthropic | Claude Fable 5.1 (1er sept. 2026) | 1 M | 10 $ / 50 $ |
| Anthropic | Claude Opus 5.5 (22 sept. 2026) | 1 M | 4 $ / 20 $ |
| Anthropic | Claude Opus 5 (24 juil. 2026) | 1 M | 5 $ / 25 $ |
| Google DeepMind | Gemini 3.8 Flash (2 sept. 2026) | 1 M | 0,75 $ / 3,75 $ |
| Mistral AI | Mistral Medium 3.5 (22 mai 2026) | 256 K | 1,50 $ / 7,50 $ |
| SpaceXAI | Grok 4.6 (12 août 2026) | 500 K | 2 $ / 6 $ |
| Alibaba | Qwen3.8-Max (3 août 2026) | 1 M | 2 $ / 6 $ |
| Moonshot AI | Kimi K3 (16 juil. 2026) | 1 048 576 | 3 $ / 15 $ |
| Z.ai | GLM-5.3 (août 2026) | 1 M | 1,40 $ / 4,40 $ |
| DeepSeek | DeepSeek-V4.1-Flash (10 sept. 2026) | 1 M | 0,15 $ à 0,30 $ / 0,60 $ à 1,20 $ |
Les modèles occidentaux
OpenAI a mis GPT-6 Astra en déploiement le 3 septembre 2026, en le présentant comme son modèle le plus intelligent et le mieux aligné, avec un accent marqué sur le pilotage d’ordinateur. L’entreprise revendique sur le banc OSWorld 2.0 des tâches accomplies environ 47 % plus vite que la génération précédente. La gamme précédente reste disponible et beaucoup moins chère, avec GPT-5.6 Sol à 4 et 20 dollars, GPT-5.6 Terra à 2 et 12 dollars, GPT-5.6 Luna à 0,20 et 1,20 dollar. Les anciens modèles ont en revanche disparu de ChatGPT : GPT-4o, GPT-4.1 et o4-mini ont été retirés le 13 février 2026, et la famille GPT-5.1 a suivi le 11 mars 2026. Notre série Maîtriser ChatGPT couvre l’usage au quotidien.
Anthropic a trois modèles en haut de gamme, ce qui prête à confusion. Claude Fable 5.1, annoncé le 1er septembre 2026, occupe le sommet à 10 et 50 dollars. Claude Opus 5, sorti le 24 juillet 2026, est décrit par l’éditeur lui-même comme proche de cette intelligence de frontière pour la moitié du prix, à 5 et 25 dollars. Claude Opus 5.5, sorti le 22 septembre 2026, atteint selon l’éditeur le niveau de Claude Fable 5.1 sur la plupart des tâches, à 4 et 20 dollars. Claude Sonnet 5 à 2 et 10 dollars et Claude Haiku 4.5 à 1 et 5 dollars complètent la gamme. Un autre modèle, Claude Mythos 5.1, existe en accès de confiance uniquement, réservé à des professionnels vérifiés de la cybersécurité et des sciences du vivant, avec des garde-fous réduits. La série Maîtriser Claude détaille cette gamme.
Google DeepMind a opéré le changement le plus contre-intuitif. Il n’existe plus aucun modèle texte Gemini Pro en disponibilité générale : la préversion Gemini 3 Pro a été arrêtée le 9 mars 2026 et Gemini 3.1 Pro n’a jamais quitté le statut de préversion. Le haut de gamme texte s’appelle donc Gemini 3.8 Flash, que Google décrit comme son modèle le plus intelligent, conçu pour l’ingénierie logicielle de longue haleine et les agents autonomes, et qu’il a fait modèle par défaut de ses agents gérés. Son tarif de 0,75 et 3,75 dollars est un prix d’introduction valable jusqu’au 31 décembre 2026, qui double au 1er janvier 2027. Notre série Maîtriser Gemini suit cet écosystème.
Mistral AI tient la position européenne avec Mistral Medium 3.5, un modèle dense de 128 milliards de paramètres, 256 000 tokens de contexte, à 1,50 et 7,50 dollars, dont les poids sont publiés sous licence MIT modifiée. Il sert de modèle par défaut à Vibe, l’assistant anciennement appelé Le Chat. La société a levé 3 milliards d’euros le 8 septembre 2026 à une valorisation de plus de 21 milliards, dans un tour mené par Samsung Electronics, qu’elle présente comme la plus grosse levée en capital d’une entreprise technologique européenne. Fait notable, Mistral revend sur sa propre plateforme les modèles GLM 5.2 et 5.3 de Z.ai. La série Maîtriser Mistral couvre l’ensemble.
SpaceXAI est le nouveau nom de xAI, que SpaceX a acquis le 2 février 2026. Le modèle en service est Grok 4.6, annoncé le 12 août 2026, avec 500 000 tokens de contexte et des tarifs de 2 et 6 dollars. Aucun Grok 5 n’existe, contrairement à ce qu’annoncent des pages spéculatives bien classées dans les moteurs de recherche.
Les modèles chinois
Quatre laboratoires chinois publient aujourd’hui des modèles comparables aux modèles occidentaux sur beaucoup de tâches, à des tarifs nettement inférieurs. Le tarif d’entrée des modèles phares occidentaux va de 0,75 à 10 dollars le million de tokens, celui des modèles chinois de 0,15 à 3 dollars.
DeepSeek a sorti DeepSeek-V4.1-Flash le 10 septembre 2026, un mélange d’experts de 552 milliards de paramètres dont 8 seulement sont actifs en entrée, avec compréhension visuelle native. Ses tarifs descendent à 0,15 dollar en entrée hors heures de pointe, la réduction hors pointe atteignant 50 %. La rotation de gamme a été rapide : V4-Flash a été retiré et les requêtes vers V4-Pro sont routées vers V4.1-Flash depuis le 14 septembre 2026. La série Maîtriser DeepSeek détaille son usage.
Alibaba propose Qwen3.8-Max depuis le 3 août 2026, un mélange d’experts de 2 400 milliards de paramètres, à 2 et 6 dollars, avec un budget de raisonnement pouvant monter à 262 000 tokens. C’est le laboratoire le plus prolifique en modèles téléchargeables, de Qwen3.8-27B aux variantes spécialisées en code, en vision et en audio, comme le détaille notre panorama de l’écosystème Qwen.
Moonshot AI édite Kimi K3, sorti le 16 juillet 2026, annoncé à environ 2 800 milliards de paramètres répartis sur 896 experts, avec une fenêtre de 1 048 576 tokens, à 3 et 15 dollars.
Z.ai, anciennement Zhipu, propose GLM-5.3, arrivé sur l’API à la mi-août 2026 : 753 milliards de paramètres, raisonnement toujours actif et non désactivable, entrées texte uniquement, à 1,40 et 4,40 dollars. L’éditeur revendique 84,5 % sur le banc de cybersécurité CyberGym et 2 436 vulnérabilités découvertes dans des projets open source, chiffres qui n’ont pas été vérifiés indépendamment. La série Maîtriser Z.ai couvre la gamme GLM.
Les modèles à poids ouverts et leurs licences
Le mot « ouvert » recouvre trois régimes juridiques différents, et la distinction a des conséquences directes pour qui construit un produit. Les licences libres comme Apache 2.0 autorisent l’usage commercial sans contrepartie. Viennent ensuite les licences maison, qui donnent accès aux poids en ajoutant des conditions. Les modèles fermés, enfin, ne s’utilisent que par API.
| Modèle | Paramètres | Licence | Date |
|---|---|---|---|
| Mistral Large 3 | 675 B total / 41 B actifs | Apache 2.0 | 2 déc. 2025 |
| Mistral Small 4 | non publié | Apache 2.0 | 16 mars 2026 |
| Ministral 3 | 3 B, 8 B, 14 B denses | Apache 2.0 | 2 déc. 2025 |
| Mistral Medium 3.5 | 128 B dense | MIT modifiée | 22 mai 2026 |
| Qwen3.8-27B | 27 B dense | Apache 2.0 | août 2026 |
| Qwen3.8-2.4T-A95B | 2,4 T total / 95 B actifs | licence maison Qwen3.8-Max | août 2026 |
| Gemma 4 | de 2,3 B à 30,7 B | Apache 2.0 | 2 avr. 2026 |
| gpt-oss-120b et 20b | 117 B / 5,1 B actifs ; 21 B / 3,6 B actifs | Apache 2.0 | août 2025 |
| GLM-5.3 | 753 B | licence GLM-5.3, seuil de revenus | poids le 28 août 2026 |
| Kimi K3 | 2,8 T, 896 experts | licence maison, partage de revenus | 16 juil. 2026 |
| DeepSeek-V4.1-Flash | 552 B / 8 à 16 B actifs | non précisée | 10 sept. 2026 |
| Nemotron 3 Ultra | 550 B / 55 B actifs | ouverte, à vérifier par modèle | 2026 |
| Llama 4 Scout et Maverick | 17 B actifs / 109 B et 400 B | Llama 4 Community License | 5 avr. 2025 |
Deux mouvements opposés se sont produits en 2026. Meta et Z.ai se sont refermés. Muse Spark est propriétaire et uniquement disponible dans le cloud, et Z.ai a quitté MIT pour une licence qui impose une revue de sécurité de l’éditeur aux entreprises dépassant 10 milliards de dollars de revenus cumulés sur douze mois. Moonshot AI impose de son côté un partage de revenus aux fournisseurs qui dépassent 20 millions de dollars par an avec Kimi K3. À l’inverse, Google a ouvert davantage, en publiant Gemma 4 sous Apache 2.0 alors que les générations précédentes relevaient de conditions maison. OpenAI, enfin, n’a publié aucun modèle à poids ouverts depuis gpt-oss-safeguard en octobre 2025.
Un modèle propriétaire vous donne la performance de pointe sans gérer d’infrastructure, au prix d’une dépendance et d’un envoi de données chez un tiers. Un modèle ouvert vous donne le contrôle, l’auto-hébergement et la maîtrise des données, au prix de compétences et de matériel. Beaucoup d’équipes combinent les deux, avec un modèle propriétaire sur les tâches critiques et un modèle ouvert sur les volumes internes. Vérifiez toujours le nom exact de la licence avant de bâtir dessus.
Des LLM aux agents
L’évolution qui structure les gammes actuelles tient moins au langage qu’à l’action. Un agent IA décompose un objectif, appelle des outils, vérifie ses résultats et recommence quand il échoue. Les laboratoires conçoivent désormais leurs modèles explicitement pour ce rôle, et communiquent sur la durée de travail sans intervention humaine plutôt que sur la qualité d’une réponse isolée.
Trois briques rendent cela possible. L’appel d’outils permet au modèle de demander l’exécution d’une fonction avec des arguments structurés, et de recevoir le résultat. Le Model Context Protocol normalise la connexion à ces outils. Créé par Anthropic fin 2024, il a été donné le 9 décembre 2025 à l’Agentic AI Foundation de la Linux Foundation, dont AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft et OpenAI sont membres fondateurs. Sa spécification en vigueur porte la date du 28 juillet 2026. Le protocole A2A, développé par Google puis confié lui aussi à la Linux Foundation, permet à des agents de plateformes différentes de se déléguer des tâches.
Cette autonomie déplace les risques. L’OWASP classe l’injection d’invite au premier rang des vulnérabilités des applications à base de LLM dans son édition 2026, parce que le modèle traite dans le même contexte les consignes de confiance et les données qu’il lit. L’autonomie excessive, c’est-à-dire un agent doté de plus de droits que sa tâche n’en exige, est passée de la sixième à la troisième place du même classement. Les incidents déjà documentés, de la skill malveillante repérée dans l’écosystème OpenClaw fin janvier 2026 au compte rendu publié par OpenAI le 21 juillet 2026 sur des agents internes ayant contourné des contrôles d’isolement, donnent la mesure du sujet.
À quoi servent les LLM au quotidien
Rédaction et communication
Les LLM produisent des textes de toute nature, des e-mails aux descriptions de produits, et reformulent, résument ou traduisent des documents existants. Le gain de temps est réel sur les tâches répétitives. La vérification des faits, l’apport d’expertise et l’adaptation au ton de la marque restent du côté humain, et c’est là que se joue la différence entre un contenu correct et un contenu qui apporte quelque chose.
Programmation et développement
Les assistants de code suggèrent du code, corrigent des erreurs, écrivent des tests et documentent des fonctions. Le rôle s’est élargi depuis que les agents travaillent sur des dépôts entiers. Google met en avant les résultats de Gemini 3.8 Flash sur le banc DeepSWE, qui mesure la résolution autonome de problèmes d’ingénierie de bout en bout. Mistral, de son côté, fait tourner ses agents Vibe dans des bacs à sable cloud pour des refactorisations menées en parallèle. Cette pratique a même reçu un nom, le vibe coding.
Analyse et synthèse de documents
Les fenêtres étendues permettent de traiter des rapports, des contrats ou des publications scientifiques, d’en extraire les points clés et de les comparer entre eux. Le droit, la finance et la recherche sont les secteurs les plus consommateurs de cet usage. La dégradation en contexte très long impose toutefois une réserve. Sur un corpus volumineux, une recherche documentaire en amont donne souvent de meilleurs résultats qu’un chargement brut.
Assistants et service client
La plupart des assistants d’entreprise déployés aujourd’hui s’appuient sur un LLM associé à une base documentaire. Leur compréhension du langage naturel les rend bien plus efficaces que les anciens chatbots à arbre de décision, qui échouaient dès que la question sortait du script prévu. Leur qualité dépend surtout de la base de connaissances qu’on leur donne, comme le montre notre guide sur le traitement du langage naturel.
Éducation et formation
Un LLM adapte son explication au niveau de la personne qui l’interroge, ce qui en fait un outil de remédiation efficace. Un étudiant peut demander une reformulation, un exemple, puis un contre-exemple, sans limite de patience. L’usage est massif chez les jeunes : une enquête de la CNIL publiée le 5 mai 2026 indique qu’environ 90 % des jeunes Français utilisent une IA conversationnelle.
Les limites des LLM
Les hallucinations
Un LLM peut produire une information fausse avec la même assurance qu’une information juste. Il invente des références, des dates ou des jurisprudences plausibles. Le phénomène découle de sa nature probabiliste, puisqu’il optimise la vraisemblance d’une suite de mots et non sa véracité. Le RAG et les outils de recherche réduisent le problème sans le supprimer, donc la relecture humaine reste nécessaire sur tout ce qui est publié ou engage une décision.
Les biais
Les modèles héritent des biais présents dans leurs données. Si les textes d’entraînement associent majoritairement certains métiers à un genre, le modèle reproduit l’association, parfois en l’accentuant. Les équipes de recherche déploient des techniques de correction, mais le problème est structurel et demande une vigilance continue dans les usages sensibles, au recrutement comme au crédit.
Le coût de l’inférence
L’entraînement concentre l’attention, l’inférence concentre la dépense. Chaque requête coûte peu, mais elle se répète à l’échelle de centaines de millions d’utilisateurs. Les éditeurs ont donc multiplié les mécanismes de réduction : cache d’entrée à moins 90 % chez OpenAI et de moins 90 % à moins 97,5 % chez Anthropic selon le modèle, modes Batch et Flex à la moitié du tarif, tarif hors pointe à moitié prix chez DeepSeek. Ces leviers valent souvent plus qu’un changement de modèle.
L’absence de mémoire persistante
Par défaut, un LLM ne retient rien d’une conversation à l’autre. Les fonctions de mémoire proposées par les produits grand public reposent sur des couches externes qui réinjectent des informations dans le contexte, pas sur un apprentissage du modèle. La gestion de la mémoire à long terme reste un chantier ouvert, et elle a ses propres failles, comme l’ont montré les travaux publiés sur l’injection d’instructions cachées dans la mémoire d’un assistant.
La confidentialité et la conformité
Les données envoyées à une API transitent par les serveurs d’un éditeur, ce qui pose des questions de confidentialité et de conformité au RGPD. L’auto-hébergement d’un modèle ouvert ou le recours à un cloud souverain constituent la réponse habituelle, au prix de ressources matérielles. Notre article sur l’IA et le RGPD détaille les points de vigilance, et la CNIL a publié le 20 juillet 2026 une note exploratoire spécifiquement consacrée aux systèmes agentiques.
Le cadre réglementaire européen
L’AI Act est entré dans sa phase concrète. Les interdictions s’appliquent depuis le 2 février 2025, les obligations de gouvernance et de modèles à usage général depuis le 2 août 2025, et l’article 50 sur la transparence depuis le 2 août 2026. Ce dernier impose d’informer que l’on interagit avec une IA et de rendre identifiable le contenu généré. Le Digital Omnibus IA, en vigueur depuis le 27 juillet 2026, a reporté les obligations sur les systèmes à haut risque au 2 décembre 2027 et au 2 août 2028 selon les annexes, mais il n’a pas touché à l’article 50. Les systèmes mis sur le marché avant le 2 août 2026 disposent d’un délai jusqu’au 2 décembre 2026 pour se conformer au marquage.
Comment bien utiliser un LLM
- Réglez l’effort de raisonnement — un niveau bas suffit pour une reformulation ou une extraction, un niveau haut se justifie sur un problème à plusieurs étapes. C’est le levier qui pèse le plus sur le coût et le délai.
- Choisissez le modèle selon la tâche — un modèle intermédiaire comme Claude Sonnet 5 ou Gemini 3.8 Flash traite l’essentiel du travail courant pour une fraction du prix d’un modèle de frontière.
- Donnez le contexte utile, pas tout le contexte — la qualité se dégrade et la facture grimpe sur les entrées très longues. Sélectionnez les passages pertinents plutôt que de charger un dossier entier.
- Exploitez le cache — si vos requêtes partagent un long préambule, le cache d’entrée divise son coût par dix au moins, et jusqu’à quarante sur Claude Fable 5.1.
- Vérifiez tout ce qui est chiffré ou cité — les hallucinations touchent d’abord les nombres, les références et les noms propres. Aucun contenu généré ne part en publication sans relecture.
- Limitez les droits de vos agents — donnez à un agent le minimum de permissions nécessaires et exigez une confirmation avant toute action irréversible.
- Signalez l’usage de l’IA — informer votre audience relève de la bonne pratique, et le marquage des contenus générés est désormais une obligation dans l’Union européenne.
Ce que cela change pour vous
Les LLM sont intégrés dans les suites bureautiques, les messageries, les CRM et les logiciels métier. Vous en croisez probablement plusieurs par jour, parfois sans le savoir. Les deux principaux assistants revendiquent chacun le milliard d’utilisateurs. Google a annoncé un milliard d’utilisateurs mensuels pour l’application Gemini en août 2026, et OpenAI un milliard d’utilisateurs hebdomadaires pour ChatGPT en juillet 2026. Les périodes de mesure diffèrent, donc la comparaison directe reste trompeuse.
Comprendre le fonctionnement de ces modèles change trois choses très concrètement. Vous formulez des consignes qui tiennent compte de ce que le modèle sait faire, donc vous obtenez de meilleurs résultats du premier coup. Vous repérez les erreurs typiques, parce que vous savez d’où elles viennent. Et vous choisissez un modèle et un niveau d’effort adaptés à la tâche, au lieu de payer le tarif du modèle de frontière pour résumer un compte rendu de réunion.
Reste l’essentiel. Un LLM accélère, structure et reformule, et il le fait bien. Le jugement sur ce qui mérite d’être dit, la connaissance du terrain et la responsabilité de ce qui est publié ne se délèguent pas. Cette répartition n’a pas bougé depuis l’arrivée de ChatGPT, et rien dans les gammes actuelles ne laisse penser qu’elle va bouger bientôt. Pour aller plus loin, notre glossaire de l’intelligence artificielle reprend tous les termes croisés dans ce guide.
ChatGPT, Claude, Gemini, Mistral, DeepSeek, Z.ai : une série de guides pratiques par outil, du premier prompt aux usages avancés.