Aller au contenu
    MOTS
    Référence

    Glossaire de l’intelligence artificielle : les termes clés expliqués

    Une documentation technique parle de contexte de 1 M, de paramètres actifs, d’effort de raisonnement et de poids ouverts sous licence modifiée. Chacun de ces mots cache une décision qui change le prix, la vitesse ou la fiabilité de l’outil que vous utilisez. Ce glossaire définit le vocabulaire courant de l’IA, terme par terme, avec un exemple chiffré quand il éclaire la définition.

    Le vocabulaire de l’IA mélange trois couches : des notions de recherche vieilles de trente ans, des termes commerciaux inventés par les laboratoires, et des mots techniques passés en quelques mois du papier scientifique à la facture d’API. Ce glossaire les traite ensemble, classés par thème, du plus général au plus spécialisé. Chaque entrée se lit seule, et vous pouvez sauter directement à la section qui vous intéresse.

    Les définitions renvoient vers nos articles de fond quand un terme mérite plus que trois phrases. Les chiffres cités correspondent à l’état constaté des modèles et de la réglementation européenne au moment de la mise à jour, indiquée en bas de page.

    Les fondamentaux

    Intelligence artificielle (IA)

    L’intelligence artificielle désigne la discipline informatique qui cherche à faire accomplir par des machines des tâches qui demandent habituellement l’intelligence humaine : comprendre une phrase, reconnaître un objet sur une photo, planifier une suite d’actions. Le terme couvre des méthodes très différentes, du système à règles écrites à la main aux réseaux de neurones entraînés sur des milliards de textes. Dans l’usage courant, on l’emploie surtout pour parler des assistants conversationnels.

    Machine learning (apprentissage automatique)

    Le machine learning regroupe les méthodes où un système apprend à partir d’exemples au lieu de suivre des règles écrites par un développeur. Plutôt que de programmer « si le message contient le mot gratuit, c’est un spam », on montre au système des milliers de messages étiquetés et il repère seul les indices utiles. Toutes les IA génératives actuelles reposent sur cette famille de méthodes.

    Deep learning (apprentissage profond)

    Le deep learning est la branche du machine learning qui empile de nombreuses couches de neurones artificiels. Chaque couche transforme un peu plus la représentation des données, ce qui permet au système de passer des pixels aux formes, puis des formes aux objets. Cette profondeur explique les percées des quinze dernières années en reconnaissance d’images, en traduction et en génération de texte.

    Réseau neuronal artificiel

    Un réseau neuronal est un programme organisé en couches de petites unités de calcul. Chaque unité reçoit des nombres, les combine selon des coefficients, et transmet le résultat à la couche suivante. L’entraînement consiste à ajuster ces coefficients jusqu’à ce que le réseau produise les bonnes sorties sur les exemples d’apprentissage.

    Paramètre

    Un paramètre est l’un de ces coefficients internes, ajusté pendant l’entraînement. On compte les paramètres en milliards pour donner un ordre de grandeur de la taille d’un modèle. Pour les modèles ouverts, le chiffre est public : GLM-5.3 en annonce 753 milliards, Kimi K3 environ 2 800 milliards. Les laboratoires qui gardent leurs modèles fermés, comme OpenAI, Anthropic ou Google, ne publient aucun nombre de paramètres, donc toute comparaison de taille entre modèles fermés relève de la supposition.

    Entraînement

    L’entraînement est la phase de construction du modèle, pendant laquelle les paramètres sont calculés. Elle mobilise des milliers de processeurs graphiques pendant des semaines. Un seul chiffre de coût a été publié par un laboratoire, dans le rapport technique de DeepSeek-V3 : 2 788 000 heures de GPU H800, valorisées à 2 dollars l’heure, soit environ 5,6 millions de dollars. Ce total couvre le seul entraînement final, hors recherche préalable et essais abandonnés.

    Inférence

    L’inférence est l’utilisation du modèle une fois entraîné, c’est-à-dire le calcul effectué chaque fois que vous envoyez une question. Elle coûte beaucoup moins cher qu’un entraînement par requête, mais elle se répète des milliards de fois, ce qui en fait le poste de dépense dominant pour un service à grande échelle. Les tarifs d’API sont exprimés par million de tokens d’inférence, séparément pour ce qui entre et ce qui sort.

    Les modèles de langage

    LLM (large language model)

    Un LLM, ou grand modèle de langage, est un réseau de neurones entraîné sur d’énormes volumes de texte pour prédire la suite d’une séquence. GPT-6 Astra chez OpenAI, Claude Fable 5.1, Claude Opus 5.5 et Claude Opus 5 chez Anthropic, Gemini 3.8 Flash chez Google, Mistral Medium 3.5 chez Mistral, Qwen3.8-Max chez Alibaba appartiennent tous à cette catégorie. Le modèle ne vérifie rien : il calcule quelle continuation est la plus probable au vu de son entraînement.

    Transformer

    Le Transformer est l’architecture de réseau introduite par une équipe de Google en 2017, et sur laquelle reposent encore tous les LLM en service. Sa particularité tient au mécanisme d’attention, qui évalue les relations entre tous les mots d’un texte en parallèle au lieu de les traiter un par un. Cette parallélisation a rendu possible l’entraînement sur des corpus gigantesques.

    Attention

    L’attention est l’opération qui permet à chaque position d’un texte de consulter toutes les autres et de pondérer leur importance. Dans la phrase « le chat dort sur le canapé parce qu’il est fatigué », c’est elle qui rattache « il » à « chat » plutôt qu’à « canapé ». Son coût de calcul augmente rapidement avec la longueur du texte, ce qui explique une bonne partie des limites de contexte.

    Token

    Un token est l’unité que manipule réellement un modèle de langage : un mot court, un fragment de mot long, un signe de ponctuation. En français, un mot courant pèse un à deux tokens. Le découpage s’appelle la tokenisation, et il explique pourquoi un même texte coûte plus cher en français qu’en anglais chez la plupart des fournisseurs.

    Fenêtre de contexte

    La fenêtre de contexte est la quantité maximale de tokens qu’un modèle peut prendre en compte en une fois, instructions et documents compris. Le million de tokens est devenu la norme des modèles phares : 1 050 000 pour GPT-6 Astra, 1 million pour Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, Gemini 3.8 Flash, DeepSeek et GLM-5.3, 1 048 576 pour Kimi K3. Des exceptions notables subsistent, avec 500 000 tokens pour Grok 4.6, 256 000 pour Mistral Medium 3.5, 200 000 pour Claude Haiku 4.5 et 128 000 pour Command A+ de Cohere.

    Contexte long

    On parle de contexte long au-delà de quelques centaines de milliers de tokens. Deux réserves accompagnent ces capacités annoncées. D’abord la qualité se dégrade avec la longueur : OpenAI publie pour GPT-6 Astra un score de 100 % sur le test MRCR v2 entre 256 000 et 512 000 tokens, et de 96,3 % au-delà. Ensuite la facture grimpe, puisque le même modèle double son tarif d’entrée au-delà de 272 000 tokens dans une requête.

    Sortie maximale

    La sortie maximale est le nombre de tokens que le modèle peut produire en une seule réponse, indépendamment de la fenêtre de contexte. Elle plafonne à 128 000 tokens chez OpenAI, Anthropic et Z.ai, à 64 000 chez Gemini 3.8 Flash, et monte à 384 000 chez DeepSeek. C’est cette valeur, et non la taille du contexte, qui limite la longueur d’un document généré d’un seul coup.

    Coupure de connaissances

    La coupure de connaissances est la date au-delà de laquelle le modèle n’a rien appris pendant son entraînement. GPT-6 Astra s’arrête au 30 avril 2026. Claude Fable 5.1 et Claude Opus 5.5 remontent à juin 2026, Claude Opus 5 à mai 2026, et Grok 4.6 s’arrête au 1er février 2026. Un modèle interrogé sur un événement postérieur répond soit qu’il ne sait pas, soit à côté, sauf s’il dispose d’un outil de recherche.

    Prompt

    Le prompt est l’instruction que vous envoyez au modèle. La formulation change beaucoup le résultat, ce qui a donné naissance à une pratique entière, l’art du prompt. Un prompt utile précise le rôle attendu, le contexte, le format de sortie et les contraintes à respecter.

    Température

    La température est le réglage qui contrôle le degré de hasard dans le choix du token suivant. Proche de zéro, le modèle prend systématiquement l’option la plus probable et devient prévisible. Plus haut, il explore des options moins probables, ce qui produit des textes plus variés mais aussi plus d’erreurs factuelles.

    Hallucination

    Une hallucination est une information fausse produite avec le même ton assuré qu’une information juste : une citation inventée, une jurisprudence qui n’existe pas, un chiffre plausible mais faux. Le phénomène découle directement du fonctionnement probabiliste des LLM, qui optimisent la vraisemblance d’une suite de mots et non sa véracité.

    Embedding (plongement vectoriel)

    Un embedding est la traduction d’un texte, d’une image ou d’un son en une liste de nombres qui code son sens. Deux contenus proches par le sens donnent des listes proches, ce qui permet de les comparer par un simple calcul de distance. Les moteurs de recherche sémantique et les systèmes de RAG reposent entièrement sur cette représentation.

    Les architectures et l’efficacité

    Mixture of experts (MoE, mélange d’experts)

    Un modèle en mélange d’experts découpe ses couches en sous-réseaux spécialisés et n’en active qu’une petite partie pour chaque token. Le modèle reste énorme en mémoire mais calcule comme un modèle bien plus petit. DeepSeek-V4.1-Flash illustre l’écart : 552 milliards de paramètres au total, dont 8 milliards seulement sont actifs en entrée et 16 milliards en sortie.

    Paramètres actifs

    Les paramètres actifs sont ceux réellement utilisés à chaque token dans un modèle en mélange d’experts. Ce chiffre détermine la vitesse et le coût de calcul, alors que le total détermine la mémoire nécessaire pour héberger le modèle. Un modèle noté 2,4 T / 95 B, comme les poids ouverts de Qwen3.8, demande la mémoire d’un modèle de 2 400 milliards de paramètres mais la puissance de calcul d’un modèle de 95 milliards.

    Modèle dense

    Un modèle dense active tous ses paramètres pour chaque token, sans aiguillage interne. Mistral Medium 3.5, avec ses 128 milliards de paramètres, ou Qwen3.8-27B avec 27 milliards, appartiennent à cette catégorie. Les modèles denses restent plus simples à déployer et se prêtent mieux à un hébergement sur un petit nombre de cartes graphiques.

    Distillation

    La distillation consiste à entraîner un petit modèle à reproduire les sorties d’un grand, qui joue le rôle de professeur. La technique s’est généralisée en 2026 : Gemma 4 s’appuie sur une distillation depuis un grand modèle enseignant, DeepSeek a distillé les traces de raisonnement de R1 dans des variantes compactes, et Nemotron 3 Ultra de Nvidia combine plus de dix enseignants spécialisés. Le professeur le plus utile n’est pas toujours le plus gros, mais celui qui maîtrise le mieux le domaine visé.

    Quantification

    La quantification réduit la précision numérique des paramètres, par exemple de 16 bits à 4 bits, pour diviser la mémoire nécessaire. Un modèle de 30 milliards de paramètres qui exigeait 60 gigaoctets tient alors sur une carte grand public, au prix d’une perte de qualité généralement modeste. C’est la technique qui rend possible l’exécution d’un modèle ouvert en local, sur un ordinateur personnel.

    Le raisonnement

    Modèle de raisonnement

    Un modèle de raisonnement produit une suite d’étapes intermédiaires avant de répondre, au lieu de générer directement sa réponse. Cette délibération améliore nettement les résultats en mathématiques, en code et sur les tâches à plusieurs étapes. La fonction n’est plus une gamme à part : elle est intégrée aux modèles phares, réglable et parfois non désactivable, comme chez GLM-5.3 dont le raisonnement reste toujours actif.

    Tokens de raisonnement

    Les tokens de raisonnement sont les tokens que le modèle consomme pour réfléchir, avant sa réponse visible. Ils sont facturés comme des tokens de sortie, donc au tarif le plus élevé, alors que vous ne les lisez pas toujours. Qwen3.8-Max accepte un budget de réflexion allant jusqu’à 262 000 tokens, ce qui donne une idée de l’écart de facture possible entre une question simple et une question difficile.

    Effort de raisonnement

    L’effort de raisonnement est le réglage qui dose cette délibération. OpenAI propose cinq niveaux pour GPT-6 Astra, de low à max ; Anthropic utilise la même échelle pour Claude Fable 5.1 et Claude Opus 5.5 ; Gemini 3.8 Flash en offre trois, low, medium et high ; GLM-5.3 en propose trois également, low, high et max. Monter d’un niveau améliore la qualité sur les tâches difficiles et augmente le délai comme le coût.

    Réflexion adaptative

    La réflexion adaptative laisse le modèle décider seul s’il doit réfléchir et combien de temps. Anthropic l’active par défaut sur Claude Opus 5, Claude Sonnet 5 et Claude Fable 5.1, et n’accepte de la désactiver que si l’effort demandé reste à un niveau modéré. Sur Claude Opus 5.5, sorti le 22 septembre 2026, elle reste toujours active et ne peut pas être désactivée. Le principe évite de payer une longue délibération pour une question triviale.

    Chaîne de pensée (chain of thought)

    La chaîne de pensée est la trace écrite du raisonnement intermédiaire d’un modèle. Elle sert autant à la performance qu’à la surveillance, puisque la lire permet de repérer un modèle qui triche ou qui dérive. Les laboratoires en donnent un résumé plutôt que le texte brut, et les experts en sûreté rappellent que cette trace n’est pas une garantie d’observabilité.

    L’entraînement et l’alignement

    Pré-entraînement

    Le pré-entraînement est la première phase, où le modèle avale des milliers de milliards de tokens et apprend à prédire le mot suivant. Il en sort un modèle de base qui complète du texte mais ne sait pas encore tenir une conversation ni refuser une demande dangereuse. Cette phase représente l’essentiel du coût de calcul.

    Fine-tuning (ajustement)

    Le fine-tuning réentraîne un modèle existant sur un jeu de données plus étroit pour le spécialiser. Une entreprise peut ainsi adapter un modèle ouvert à son vocabulaire métier ou à son style de réponse. La méthode coûte une fraction d’un entraînement complet, puisqu’elle part d’un modèle déjà compétent.

    RLHF (apprentissage par renforcement à partir de retours humains)

    Le RLHF transforme un modèle de base en assistant utilisable. Des évaluateurs humains comparent des réponses deux à deux, ces préférences servent à entraîner un modèle de récompense, et l’apprentissage par renforcement oriente ensuite le modèle vers les réponses les mieux notées. C’est cette étape qui donne à chaque assistant son ton reconnaissable.

    RLAIF (retours d’une IA)

    Le RLAIF remplace une partie des évaluateurs humains par un modèle d’IA qui note les réponses selon des principes écrits. La méthode coûte beaucoup moins cher et permet de couvrir bien plus de cas. Anthropic en a fait un pilier de son approche, avec un ensemble de principes que le modèle applique pour s’auto-évaluer.

    Alignement

    L’alignement désigne l’ensemble des travaux qui visent à faire agir un modèle conformément aux intentions de ceux qui le déploient et de ceux qui l’utilisent. Il couvre le refus des demandes nuisibles, l’honnêteté sur ses propres limites et la stabilité du comportement dans la durée. Le problème reste ouvert, et il devient plus difficile à mesure que les modèles gagnent en autonomie.

    Sycophancy (complaisance)

    La complaisance est la tendance d’un modèle à valider ce que dit son interlocuteur plutôt qu’à le contredire. Elle apparaît comme un effet secondaire du RLHF, parce que les évaluateurs humains ont préféré les réponses agréables. Elle rend un assistant peu fiable dès qu’on lui demande de relire une idée d’un œil critique.

    Reward hacking

    Le reward hacking décrit un modèle qui optimise la mesure plutôt que l’objectif : il trouve un raccourci qui satisfait le critère d’évaluation sans accomplir la tâche. Un modèle de code peut par exemple modifier un test au lieu de corriger la fonction qu’il est censé réparer. OpenAI a documenté ce comportement en juillet 2026 dans son compte rendu d’un incident de sécurité interne.

    Les agents et les outils

    Agent IA

    Un agent IA est un système qui ne se contente pas de répondre mais qui agit : il décompose un objectif, appelle des outils, vérifie ses résultats et recommence en cas d’échec. Les modèles phares actuels sont explicitement conçus pour ce rôle, Google présentant Gemini 3.8 Flash comme un modèle pour l’ingénierie logicielle de longue haleine et les agents autonomes. La durée de travail sans intervention humaine est devenue un critère d’évaluation à part entière.

    Appel d’outils (function calling)

    L’appel d’outils est le mécanisme par lequel un modèle demande l’exécution d’une fonction extérieure, avec des arguments structurés, et reçoit le résultat dans sa conversation. Il permet de consulter une base, d’envoyer un message ou de lancer un calcul exact plutôt que de deviner. Sans ce mécanisme, un agent ne pourrait rien faire d’autre que produire du texte.

    MCP (Model Context Protocol)

    Le MCP est un protocole ouvert qui normalise la façon dont une application d’IA se connecte à des outils et à des sources de données. Créé par Anthropic en novembre 2024, il a été donné le 9 décembre 2025 à l’Agentic AI Foundation, un fonds dirigé de la Linux Foundation dont AWS, Anthropic, Block, Bloomberg, Cloudflare, Google, Microsoft et OpenAI sont membres fondateurs. La version de spécification en vigueur porte la date du 28 juillet 2026 et ajoute des extensions pour les tâches longues et les interfaces intégrées.

    A2A (Agent2Agent)

    A2A est un protocole ouvert qui permet à des agents construits sur des plateformes différentes de se découvrir, de se déléguer des tâches et de se transmettre des résultats. Développé à l’origine par Google, il a lui aussi été confié à la Linux Foundation, avec un comité technique où siègent AWS, Cisco, IBM Research, Microsoft, Salesforce, SAP et ServiceNow. Les deux standards se complètent : MCP relie un agent à ses outils, A2A relie les agents entre eux.

    Computer use

    Le computer use est la capacité d’un modèle à piloter une interface graphique comme le ferait une personne, en observant l’écran, en déplaçant le curseur et en tapant au clavier. OpenAI en a fait un argument central de GPT-6 Astra, qu’il présente comme accomplissant les tâches du banc OSWorld 2.0 environ 47 % plus vite que la génération précédente. La fonction reste lente et fragile sur les interfaces inhabituelles.

    RAG (génération augmentée par la recherche)

    Le RAG associe un modèle de langage à une recherche documentaire. Avant de répondre, le système retrouve les passages pertinents dans vos propres documents et les fournit au modèle, qui s’appuie dessus. L’approche réduit les hallucinations, permet de citer ses sources et garde les données à jour sans réentraîner quoi que ce soit.

    Base vectorielle

    Une base vectorielle stocke des embeddings et retrouve rapidement les plus proches d’une requête donnée. Elle constitue le moteur de recherche d’un système de RAG. Sa qualité de découpage des documents pèse souvent plus lourd sur le résultat final que le choix du modèle de langage.

    Few-shot et zero-shot

    En zero-shot, vous demandez une tâche sans montrer d’exemple, avec la seule consigne. En few-shot, vous joignez un à cinq exemples du résultat attendu avant la demande. Les modèles actuels réussissent la plupart des tâches courantes en zero-shot, donc les exemples servent surtout à imposer un format précis ou un ton particulier.

    Les autres familles de modèles

    Multimodal

    Un modèle multimodal traite plusieurs types de données dans une même interaction. Le mot recouvre des réalités inégales : GPT-6 Astra accepte du texte et des images en entrée, Muse Spark 1.1 de Meta y ajoute la vidéo et les PDF, Qwen3.8-27B comprend images et vidéos, tandis que GLM-5.3 reste un modèle purement textuel. Avant de compter sur une modalité, il faut donc la vérifier modèle par modèle, comme pour la vision par ordinateur.

    World model (modèle du monde)

    Un world model apprend une représentation de la dynamique du monde physique pour anticiper ce qui se passe après une action, au lieu de prédire le mot suivant. Yann LeCun a quitté Meta pour fonder AMI Labs en décembre 2025 sur cette conviction, avec un tour de table de 1,03 milliard de dollars et une valorisation de 3,5 milliards annoncée en mars 2026. Aucun produit grand public n’en est encore issu, et l’entreprise annonce elle-même un horizon de plusieurs années.

    Modèle de diffusion

    Un modèle de diffusion apprend à partir d’une image bruitée à retrouver l’image nette, puis génère de nouvelles images en partant de bruit pur. C’est la méthode derrière la plupart des générateurs d’images et de vidéos. Elle diffère complètement de la prédiction de tokens utilisée par les modèles de langage, même si certains produits combinent les deux.

    IA générative

    L’IA générative regroupe les systèmes qui produisent un contenu nouveau, qu’il s’agisse de texte, d’image, de son, de vidéo ou de code. Elle se distingue de l’IA prédictive, qui classe ou estime à partir de données existantes sans rien créer. La confusion entre les deux conduit régulièrement à choisir un outil génératif là où un modèle de prédiction suffirait.

    La sûreté et les garde-fous

    Garde-fous (guardrails)

    Les garde-fous sont les contrôles ajoutés autour d’un modèle pour filtrer ce qui entre et ce qui sort : détection de contenus interdits, limitation des actions autorisées, validation humaine avant une opération sensible. Ils s’appuient souvent sur des modèles dédiés, comme Shieldstral 1.0 chez Mistral ou gpt-oss-safeguard chez OpenAI. Un garde-fou reste une couche externe, donc il se contourne, et il ne remplace pas l’alignement du modèle lui-même.

    Injection d’invite (prompt injection)

    L’injection d’invite consiste à cacher des instructions dans un contenu que le modèle va lire, page web, document ou message, pour détourner son comportement. Le problème vient de ce que le modèle traite les consignes de confiance et les données non fiables dans le même contexte. L’OWASP la classe au premier rang de son Top 10 des risques des applications à base de LLM, dans une édition 2026 publiée le 3 août 2026.

    Autonomie excessive

    L’autonomie excessive décrit un agent auquel on a donné plus de droits que sa tâche n’en exige : accès en écriture à une base alors qu’une lecture suffirait, possibilité d’envoyer des messages sans relecture. Le risque a nettement gagné en importance dans l’édition 2026 du classement OWASP, où il passe de la sixième à la troisième place. La parade consiste à réduire les permissions et à exiger une confirmation pour les actions irréversibles.

    Watermarking (marquage)

    Le watermarking insère dans un contenu généré une signature destinée à le rendre identifiable plus tard. Les techniques existent pour l’image et progressent pour le texte, mais une reformulation ou une recompression suffit souvent à effacer la marque. Le marquage des contenus synthétiques est devenu une obligation dans l’Union européenne, ce qui met la robustesse de ces méthodes au premier plan.

    Deepfake (hypertrucage)

    Un deepfake est un contenu synthétique qui imite une personne réelle de façon crédible, en image, en vidéo ou en voix. Les incidents de l’hiver 2026 autour de la génération d’images par Grok, suivis de blocages en Indonésie, en Malaisie et aux Philippines, ont accéléré la réponse réglementaire. Le droit européen interdit désormais les systèmes conçus pour produire des contenus intimes non consentis de personnes identifiables.

    Ouvert, fermé, et ce qu’il y a entre les deux

    Poids ouverts (open weights)

    Un modèle à poids ouverts est un modèle dont les paramètres entraînés sont téléchargeables, ce qui permet de l’héberger soi-même et de le modifier. L’expression ne dit rien des données d’entraînement, qui restent presque toujours secrètes, ni de la liberté juridique d’usage, qui dépend de la licence. Les poids ouverts et le logiciel libre sont donc deux choses différentes.

    Licence source-available

    Une licence source-available donne accès au modèle tout en imposant des restrictions qu’une licence libre n’aurait pas. Z.ai est ainsi passé de MIT à une licence propriétaire nommée GLM-5.3, qui soumet à une revue de sécurité de l’éditeur les entreprises dépassant 10 milliards de dollars de revenus sur douze mois. Moonshot AI impose de son côté un partage de revenus aux fournisseurs qui dépassent 20 millions de dollars par an avec Kimi K3.

    Apache 2.0

    Apache 2.0 est la licence libre la plus utilisée pour les modèles réellement ouverts, avec un usage commercial autorisé sans contrepartie. Mistral Large 3, Mistral Small 4, Ministral 3, Qwen3.8-27B, la famille gpt-oss d’OpenAI et Gemma 4 en relèvent. Ce dernier cas marque une rupture, puisque les générations précédentes de Gemma étaient publiées sous des conditions maison plus restrictives.

    Auto-hébergement

    L’auto-hébergement consiste à faire tourner un modèle sur ses propres machines ou dans son propre cloud, au lieu d’appeler l’API d’un éditeur. Il répond à des exigences de confidentialité et de conformité, notamment en matière d’IA et de RGPD. Le coût matériel reste l’obstacle principal, même si un modèle comme Mistral Medium 3.5 se déploie sur quatre cartes graphiques seulement.

    Ouvert ne veut pas dire libre

    Trois régimes cohabitent derrière le mot « open ». Les licences libres comme Apache 2.0 laissent faire ce que l’on veut. Viennent ensuite les licences maison, qui autorisent le téléchargement en ajoutant des conditions, du seuil de revenus au partage de recettes. Les modèles fermés ne se consultent que par API. Vérifiez toujours le nom exact de la licence avant de bâtir un produit sur un modèle téléchargé.

    La réglementation européenne

    AI Act

    L’AI Act est le règlement européen sur l’intelligence artificielle, adopté en 2024. Il classe les usages par niveau de risque et fait peser des obligations croissantes sur les fournisseurs comme sur les déployeurs. Son application est échelonnée : interdictions depuis le 2 février 2025, obligations de gouvernance et de modèles à usage général depuis le 2 août 2025, transparence depuis le 2 août 2026.

    Digital Omnibus IA

    Le Digital Omnibus IA est le texte de simplification qui modifie l’AI Act, entré en vigueur le 27 juillet 2026. Il reporte les obligations sur les systèmes à haut risque au 2 décembre 2027 pour ceux de l’annexe III, biométrie, emploi, éducation ou forces de l’ordre, et au 2 août 2028 pour ceux intégrés à des produits déjà réglementés. Il ajoute en revanche une interdiction nouvelle, celle des systèmes générant des contenus sexuels non consentis de personnes identifiables et des contenus d’abus sur mineurs.

    Article 50 (transparence)

    L’article 50 de l’AI Act impose d’informer l’utilisateur qu’il interagit avec une IA et de rendre identifiable le contenu généré par une machine. Il s’applique depuis le 2 août 2026 et n’a pas été reporté par le Digital Omnibus. Les systèmes déjà sur le marché avant cette date disposent d’un délai jusqu’au 2 décembre 2026 pour se conformer au marquage, alors que les systèmes nouveaux devaient l’être immédiatement.

    GPAI (IA à usage général)

    GPAI est le terme employé par l’AI Act pour désigner les modèles polyvalents comme GPT, Claude, Gemini ou Mistral. Leurs fournisseurs doivent documenter leur modèle, publier un résumé des données d’entraînement et respecter le droit d’auteur. Les modèles jugés à risque systémique se voient imposer des obligations supplémentaires d’évaluation et de signalement des incidents.

    Code de bonnes pratiques GPAI

    Le code de bonnes pratiques GPAI est un texte volontaire publié par la Commission européenne en juillet 2025, qui détaille comment respecter les obligations du règlement. Amazon, Anthropic, IBM, Microsoft, OpenAI, Aleph Alpha et Mistral AI l’ont signé, xAI seulement son chapitre sûreté et sécurité, tandis que Meta, Alibaba, Baidu et DeepSeek ne l’ont pas signé. Adhérer au code reste facultatif, respecter l’AI Act ne l’est pas.

    Les acteurs principaux

    OpenAI

    OpenAI édite ChatGPT et la série GPT. Son modèle phare est GPT-6 Astra, déployé à partir du 3 septembre 2026, à 10 dollars le million de tokens en entrée et 50 en sortie. L’entreprise est devenue une public benefit corporation en octobre 2025 et a déposé un dossier d’introduction en bourse en juin 2026. Sam Altman a depuis exclu une cotation en 2026. Les sources divergent sur la suite : Bloomberg annonce une introduction pas avant 2027, alors que dans l’entretien publié par Fortune, Sam Altman ne cite aucune date.

    Anthropic

    Anthropic édite Claude et met la sécurité au centre de sa communication. Sa gamme comprend Claude Fable 5.1 en haut de l’échelle, Claude Opus 5.5, Claude Opus 5, Claude Sonnet 5 et Claude Haiku 4.5. Sorti le 22 septembre 2026, Claude Opus 5.5 atteint le niveau de Fable 5.1 sur la plupart des tâches, pour 4 dollars le million de tokens en entrée et 20 en sortie. Il coûte ainsi moins cher que Claude Opus 5, facturé 5 et 25 dollars. Claude Mythos 5.1 existe en accès restreint, réservé à des professionnels vérifiés de la cybersécurité et des sciences du vivant.

    Google DeepMind

    Google DeepMind édite Gemini. Son modèle texte le plus avancé en disponibilité générale est Gemini 3.8 Flash depuis le 2 septembre 2026, et non un modèle Pro. La préversion Gemini 3 Pro a été arrêtée le 9 mars 2026, et aucun Gemini Pro texte n’est plus proposé en version stable. Son tarif d’introduction de 0,75 dollar en entrée reste valable jusqu’au 31 décembre 2026, puis il double.

    Meta

    Meta a renoncé à Llama comme modèle phare. Muse Spark, présenté le 8 avril 2026 et décliné en version 1.1 le 9 juillet, est un modèle propriétaire accessible uniquement dans le cloud, sans poids téléchargeables. Les Llama existants restent disponibles en open source, le dernier étant Llama 4 d’avril 2025 sous licence Llama 4 Community, et Llama 4 Behemoth n’a jamais été publié.

    Mistral AI

    Mistral AI est le principal laboratoire européen de modèles de fondation. Son modèle phare est Mistral Medium 3.5, dense, 128 milliards de paramètres, 256 000 tokens de contexte, avec des poids ouverts sous licence MIT modifiée. La société a levé 3 milliards d’euros le 8 septembre 2026, à une valorisation de plus de 21 milliards, dans un tour mené par Samsung Electronics.

    DeepSeek

    DeepSeek est le laboratoire chinois qui a popularisé les modèles de raisonnement à bas coût. Son modèle le plus récent, DeepSeek-V4.1-Flash du 10 septembre 2026, atteint 552 milliards de paramètres pour 8 à 16 milliards actifs, avec une compréhension visuelle intégrée. Sa tarification descend à 0,15 dollar le million de tokens en entrée hors heures de pointe, soit le prix le plus bas parmi les modèles cités ici.

    Alibaba (Qwen)

    Alibaba développe la famille Qwen, qui combine un modèle phare fermé et une longue série de modèles téléchargeables. Qwen3.8-Max, disponible depuis le 3 août 2026, est un mélange d’experts de 2 400 milliards de paramètres facturé 2 dollars en entrée et 6 en sortie. Les poids de sa base ont été publiés sous le nom Qwen3.8-2.4T-A95B, sous une licence maison, tandis que Qwen3.8-27B est sous Apache 2.0.

    Moonshot AI (Kimi)

    Moonshot AI édite Kimi. Kimi K3, sorti le 16 juillet 2026, annonce environ 2 800 milliards de paramètres répartis sur 896 experts, une fenêtre de 1 048 576 tokens et des tarifs de 3 et 15 dollars par million. Ses poids sont publiés, sous une licence maison qui impose un partage de revenus aux fournisseurs les plus gros.

    Z.ai (GLM)

    Z.ai, anciennement Zhipu, édite la famille GLM. GLM-5.3, arrivé sur l’API à la mi-août 2026, compte 753 milliards de paramètres, garde son raisonnement toujours actif et se facture 1,40 dollar en entrée pour 4,40 en sortie. Ses poids ont été publiés le 28 août 2026, après deux semaines d’évaluations de sûreté supplémentaires motivées par ses capacités en cybersécurité.

    SpaceXAI (Grok)

    SpaceXAI est la nouvelle identité de xAI, acquise par SpaceX le 2 février 2026, et continue d’éditer Grok. Le modèle en service est Grok 4.6, annoncé le 12 août 2026, avec 500 000 tokens de contexte et des tarifs de 2 et 6 dollars par million. Aucun Grok 5 n’est sorti, et seul Grok-1 avait été publié sous Apache 2.0, en 2024.

    Nvidia

    Nvidia fournit les processeurs graphiques sur lesquels presque tous ces modèles sont entraînés, et publie aussi ses propres modèles ouverts. La famille Nemotron 3 va du Nano de 30 milliards de paramètres à l’Ultra de 550 milliards, dont 55 actifs. Nemotron 3.5 Lightning 30B, sorti le 11 août 2026, cible les agents en fonctionnement permanent.

    Comment se servir de ce glossaire

    Les définitions restent valables longtemps, les chiffres beaucoup moins. Les noms de modèles, les prix et les fenêtres de contexte changent plusieurs fois par an, alors que les notions de token, d’attention, de mélange d’experts ou de RAG sont stables. Quand un chiffre compte pour une décision, allez le relire dans la documentation de l’éditeur concerné.

    Ce que ce vocabulaire vous permet de faire

    Connaître ces mots change concrètement trois choses. Vous lisez une fiche de modèle sans vous arrêter à la première ligne, donc vous repérez qu’un contexte annoncé à 1 million de tokens se facture parfois au double au-delà d’un seuil. Vous distinguez un modèle vraiment libre d’un modèle simplement téléchargeable, ce qui évite de bâtir un produit sur une licence à seuil de revenus. Vous comprenez enfin pourquoi un même assistant répond vite et mal sur une question, lentement et bien sur une autre, selon l’effort de raisonnement appliqué.

    Le vocabulaire de l’IA continuera de bouger, avec des termes commerciaux qui apparaissent et disparaissent au rythme des gammes. Les briques de fond, elles, tiennent depuis 2017 : un Transformer, des tokens, de l’attention, des paramètres ajustés par descente de gradient. Comprendre ces quatre-là suffit à suivre le reste, et le traitement du langage naturel reste le meilleur point d’entrée pour aller plus loin.

    Aller plus loin
    Comprendre les LLM de bout en bout

    Notre guide détaille le fonctionnement des grands modèles de langage, leurs coûts réels et le paysage actuel des éditeurs.

    Lire le guide des LLM ↗
    Mise à jour : 23 septembre 2026