Aller au contenu
    DONNÉES
    Concept IA

    Machine Learning : quand les machines apprennent seules

    Le machine learning est le moteur de l’IA moderne. C’est grâce à lui que votre boîte mail filtre les spams, que votre application de musique devine ce qui vous plaira et que ChatGPT tient une conversation. Voici comment un modèle apprend, ce qu’il coûte à entraîner puis à faire tourner, et pourquoi un petit modèle bien choisi bat souvent un géant.

    On entend « machine learning » partout, mais rares sont ceux qui peuvent l’expliquer simplement. Le concept est pourtant limpide : au lieu de programmer un ordinateur avec des règles précises pour chaque situation, on lui donne des données et on le laisse apprendre les règles tout seul. Imaginez la différence entre donner à quelqu’un un livre de recettes, ce qui correspond à la programmation classique, et l’envoyer en cuisine goûter des centaines de plats pour qu’il découvre par lui-même ce qui fonctionne.

    Machine learning, deep learning, IA : qui est quoi ?

    Ces termes servent souvent de synonymes, à tort. Ils désignent trois périmètres emboîtés.

    L’intelligence artificielle forme le domaine le plus large, qui regroupe toute technique permettant à une machine de simuler un comportement intelligent. Elle couvre des approches très anciennes, comme les systèmes experts et les règles logiques, et d’autres très récentes, comme les grands modèles de langage et les agents autonomes.

    Le machine learning est une branche de l’IA qui rassemble les systèmes apprenant à partir de données. Cette méthode domine depuis 2010 environ, et elle propulse l’essentiel de ce qu’on appelle aujourd’hui « IA ». Notre comparatif entre IA générative, IA prédictive et automatisation détaille les usages qui en découlent.

    Le deep learning est une branche du machine learning qui empile de nombreuses couches dans des réseaux neuronaux. Cette profondeur a rendu possibles les avancées en vision par ordinateur, en traitement du langage naturel et en IA générative.

    En résumé

    Le deep learning est un sous-ensemble du machine learning, lui-même un sous-ensemble de l’intelligence artificielle. Quand vous utilisez ChatGPT ou Claude, vous utilisez un système de deep learning, entraîné par machine learning, dans le domaine de l’intelligence artificielle. Les trois s’emboîtent comme des poupées russes. Notre glossaire de l’intelligence artificielle reprend ces définitions et une trentaine d’autres.

    Les quatre grandes façons d’apprendre

    L’apprentissage supervisé

    C’est le plus courant. On donne au modèle des milliers d’exemples accompagnés de la bonne réponse : des photos de chats étiquetées « chat », des emails étiquetés « spam » ou « pas spam ». Le modèle apprend à reconnaître les motifs qui distinguent chaque catégorie. Quand on lui montre une nouvelle photo ou un nouvel email, il prédit la réponse.

    Cette approche fait tourner la détection de fraude bancaire, le diagnostic médical assisté, la reconnaissance d’images et les systèmes de recommandation. Son talon d’Achille tient à l’étiquetage, qui demande du travail humain et coûte cher dès que les volumes grossissent.

    L’apprentissage non supervisé

    Cette fois, le modèle ne reçoit ni étiquettes ni bonne réponse. Il explore les données et cherche des structures cachées, comme des groupes, des anomalies ou des corrélations. Les entreprises s’en servent pour segmenter leurs clients, repérer un comportement anormal sur un réseau ou dégager des tendances dans de grands volumes de données.

    L’apprentissage auto-supervisé

    C’est la méthode qui a permis les modèles de langage, et celle dont on parle le moins. Le principe consiste à fabriquer la supervision à partir des données elles-mêmes : on masque une partie du texte et on demande au modèle de la reconstituer. Personne n’a étiqueté quoi que ce soit, et pourtant chaque phrase du corpus fournit des milliers d’exercices corrigés.

    Yann LeCun et Ishan Misra ont popularisé l’expression en mars 2021 dans un billet de Meta AI, Self-supervised learning: the dark matter of intelligence, où ils définissent la méthode comme la prédiction d’une partie cachée de l’entrée à partir de la partie visible. Le pré-entraînement d’un LLM fonctionne exactement ainsi, ce qui explique pourquoi ces modèles peuvent avaler des milliards de pages sans annotateur humain. L’étiquetage revient ensuite, mais seulement pour la phase d’alignement.

    L’apprentissage par renforcement

    Le modèle apprend par essai et erreur, guidé par un système de récompenses. Il ne reçoit ni exemples étiquetés ni structure cachée, seulement un objectif et un retour sur ses actions. AlphaGo a suivi cette voie : le programme de DeepMind a battu le professionnel Fan Hui cinq parties à zéro en octobre 2015, puis Lee Sedol quatre parties à une en mars 2016 à Séoul, en combinant deux réseaux neuronaux, une recherche arborescente et des milliers de parties jouées contre lui-même.

    Cette même famille de méthodes a transformé les LLM bruts en assistants utilisables, sous le nom de RLHF, ou apprentissage par renforcement à partir de retours humains. L’article Training language models to follow instructions with human feedback, publié par OpenAI le 4 mars 2022, montre que des évaluateurs humains préféraient les réponses d’un modèle de 1,3 milliard de paramètres entraîné de cette façon à celles de GPT-3 et ses 175 milliards de paramètres. Notre article dédié à l’apprentissage par renforcement détaille ce mécanisme.

    Comment ça marche concrètement : un exemple pas à pas

    Prenons un cas simple, l’entraînement d’un modèle qui prédit le prix d’un appartement.

    01
    Collecter les données

    On rassemble des milliers d’annonces immobilières avec les caractéristiques de chaque appartement, comme la surface, le nombre de pièces, le quartier et l’étage, puis le prix de vente réel.

    02
    Entraîner le modèle

    On donne ces données au modèle, qui cherche la relation entre les caractéristiques et le prix. Ses premières prédictions sont aléatoires. Itération après itération, il ajuste ses paramètres pour réduire l’écart entre ses prédictions et les vrais prix.

    03
    Évaluer la performance

    On teste le modèle sur des appartements qu’il n’a jamais vus, ce qu’on appelle le jeu de test. Si ses prédictions approchent les vrais prix, le modèle tient la route. Sinon, on ajuste l’architecture, les données ou les paramètres d’entraînement.

    04
    Mettre en production

    Le modèle est déployé derrière une interface. Quand quelqu’un saisit les caractéristiques d’un appartement, le modèle estime le prix, exactement comme les outils d’estimation immobilière en ligne.

    05
    Surveiller et réentraîner

    Le marché bouge, les prix dérivent et le modèle se démode. On mesure donc en continu l’écart entre ses prédictions et la réalité, et on le réentraîne quand cet écart se creuse.

    Le même principe s’applique aux modèles de langage, à une échelle sans rapport. Les données deviennent des milliards de pages de texte, les caractéristiques deviennent les relations entre les mots, et la prédiction porte sur le mot suivant dans une séquence.

    Entraînement et inférence : deux coûts très différents

    Voilà la distinction qui explique la structure de prix de tous les outils d’IA. L’entraînement se paie une fois, en un bloc énorme. L’inférence, c’est-à-dire l’utilisation du modèle une fois entraîné, se paie à chaque requête, indéfiniment.

    Ce que coûte un entraînement

    Très peu de laboratoires publient ce chiffre. Le seul montant réellement documenté par un éditeur figure dans le rapport technique de DeepSeek-V3 : 2 788 000 heures de GPU H800 au total, valorisées à 2 dollars l’heure, soit environ 5,6 millions de dollars. Le rapport précise lui-même que ce total couvre uniquement l’entraînement officiel du modèle, à l’exclusion de la recherche préalable et des expériences abandonnées. Retenez donc le chiffre sans en tirer une règle générale, car il ne représente pas le coût complet d’un programme de recherche.

    Les autres indices sont indirects. Mistral indique avoir entraîné Mistral Large 3 sur 3 000 GPU NVIDIA H200. Ni OpenAI, ni Anthropic, ni Google, ni Meta ne publient de montant ou de nombre de paramètres pour leurs modèles phares. L’institut de recherche Epoch AI estimait en juin 2024 que le coût matériel et énergétique du seul entraînement final des modèles de pointe augmentait d’un facteur 2,4 par an depuis 2016, et projetait des entraînements à plus d’un milliard de dollars à l’horizon 2027. Cette estimation vient d’un tiers, pas des laboratoires concernés.

    Ce que coûte l’inférence

    L’inférence se facture au token, l’unité de découpage du texte. Voici les tarifs publics de quelques modèles phares, par million de tokens.

    Modèle Entrée Sortie
    GPT-6 Astra (OpenAI) 10 $ 50 $
    Claude Fable 5.1 (Anthropic) 10 $ 50 $
    Claude Opus 5.5 (Anthropic) 4 $ 20 $
    Claude Haiku 4.5 (Anthropic) 1 $ 5 $
    Gemini 3.8 Flash (Google) 0,75 $ 3,75 $
    Mistral Medium 3.5 1,50 $ 7,50 $
    DeepSeek-V4.1-Flash 0,15 $ hors pointe 0,60 $ hors pointe

    L’entrée la moins chère du tableau coûte environ 66 fois moins que la plus chère. Le tarif d’introduction de Gemini 3.8 Flash court jusqu’au 31 décembre 2026, puis double. Plusieurs mécanismes réduisent encore la facture : la lecture en cache coûte 90 % de moins chez OpenAI et de 90 à 97,5 % de moins chez Anthropic selon le modèle, les traitements par lots tombent à la moitié du tarif chez OpenAI, et DeepSeek applique une remise de 50 % en dehors de ses heures de pointe.

    Cette bascule vers l’inférence se lit dans le matériel. Google a présenté son processeur Ironwood comme le premier TPU conçu pour « l’ère de l’inférence », et Nvidia revendique pour sa plateforme Rubin une division par dix du coût du token en inférence par rapport à la génération précédente. Les puces ne cherchent plus seulement à entraîner vite, elles cherchent à répondre à bas prix.

    La règle à retenir

    Un modèle plus gros améliore rarement une tâche simple, mais il en multiplie le coût à chaque appel. Avant de choisir un modèle phare pour classer des emails ou extraire des champs d’un document, testez le modèle le plus léger de la gamme. La différence de prix se compte en facteur, pas en pourcentage.

    Les données synthétiques : quand le modèle fabrique les exemples

    Les données annotées par des humains coûtent cher, et le texte public de qualité n’est pas inépuisable. Les données synthétiques répondent à ce double problème, puisqu’un modèle les produit pour en entraîner un autre. Trois raisons poussent dans cette direction : le volume, la confidentialité, puisqu’un jeu synthétique ne contient pas de données personnelles réelles, et la couverture des cas rares, difficiles à collecter dans la nature.

    Ce n’est plus une hypothèse de laboratoire. Nvidia publie sur Hugging Face le jeu de données de post-entraînement Llama-Nemotron, dont la fiche indique que toutes les réponses ont été générées synthétiquement par des modèles ouverts, notamment DeepSeek-R1, plusieurs Qwen 2.5 et Llama 3.3, sous licence essentiellement CC-BY-4.0. Des millions d’exemples de mathématiques, de code et de raisonnement ont donc été écrits par des machines, puis réutilisés pour en entraîner d’autres.

    La méthode a une limite documentée. Dans un article publié par Nature le 24 juillet 2024, AI models collapse when trained on recursively generated data, Ilia Shumailov et ses coauteurs décrivent l’effondrement de modèle : à force d’être entraînés sur leurs propres productions, les modèles perdent les queues de distribution, c’est-à-dire les événements rares, et la dégradation devient irréversible. Les auteurs en concluent que l’accès à des données humaines authentiques reste indispensable. Notre article sur l’ouroboros linguistique creuse cette boucle et ses effets sur le web.

    La bonne pratique consiste donc à mélanger : des données réelles pour ancrer le modèle, des données synthétiques ciblées pour renforcer une compétence précise, et un filtrage sérieux entre les deux. Avant d’y penser, assurez-vous que vos propres données sont exploitables, sujet que traite notre checklist de préparation des données.

    Petits modèles spécialisés ou grands modèles généralistes ?

    La course aux paramètres a occupé toute l’attention pendant des années. Une contre-tendance s’est installée depuis, et elle repose sur un constat mesuré plutôt que sur une intuition.

    Le résultat fondateur vient de l’article d’OpenAI sur le RLHF cité plus haut : un modèle de 1,3 milliard de paramètres correctement aligné était préféré à un modèle 100 fois plus gros. Des chercheurs de Nvidia ont prolongé l’argument dans Small Language Models are the Future of Agentic AI, déposé le 2 juin 2025 : dans un système d’agents, la plupart des appels correspondent à des tâches répétitives et bien cadrées, pour lesquelles un petit modèle suffit et coûte beaucoup moins cher.

    Côté outils, l’offre de petits modèles ouverts s’est étoffée. Google a publié Gemma 4 le 2 avril 2026 sous licence Apache 2.0, avec des variantes qui descendent à quelques milliards de paramètres effectifs. Mistral propose Ministral 3 en versions denses de 3, 8 et 14 milliards de paramètres, également sous Apache 2.0. Alibaba a publié Qwen3.8-27B, un modèle dense de 27 milliards de paramètres sous Apache 2.0, avec 262 144 tokens de contexte. Ces modèles tournent sur une machine que l’on peut posséder, et vous pouvez même tester un modèle ouvert dans votre navigateur pour vous en convaincre.

    Réglage fin et distillation

    Deux techniques rendent ces petits modèles compétitifs sur un métier donné. Le réglage fin, ou fine-tuning, poursuit l’entraînement d’un modèle existant sur vos propres exemples, afin qu’il adopte votre vocabulaire et vos formats. La distillation fait apprendre à un petit modèle les réponses d’un grand modèle, ce qui transfère une partie de sa compétence dans une enveloppe bien plus légère. Le jeu de données Nemotron évoqué plus haut relève exactement de cette logique.

    Une troisième voie évite souvent l’entraînement : brancher le modèle sur vos documents plutôt que de lui faire ingérer vos données. C’est le principe du RAG, qui va chercher les passages pertinents au moment de la question. Quand votre besoin tient à la connaissance et non au style, cette solution coûte moins cher et se met à jour instantanément.

    Mettre un modèle en production : ce que recouvre le MLOps

    Un modèle qui marche dans un carnet de notes n’est pas un produit. L’écart entre les deux porte un nom, le MLOps, que Google définit comme une culture et une pratique d’ingénierie visant à réunir le développement et l’exploitation des systèmes d’apprentissage, avec de l’automatisation et de la surveillance à chaque étape.

    L’ampleur de cet écart avait été décrite dès 2015 par une équipe de Google dans Hidden Technical Debt in Machine Learning Systems : seule une fraction minime du code d’un système d’apprentissage réel sert effectivement à apprendre ou à prédire. Tout le reste tient à la collecte des données, à la validation, à la configuration, à la surveillance et aux tuyaux entre les composants. Les auteurs recensent aussi les pièges classiques, du code de raccordement aux boucles de rétroaction cachées.

    Trois chantiers concentrent l’essentiel du travail.

    • La dérive — Un modèle se dégrade parce que le monde change, et pas parce que son code se casse. Google parle de modèles qui déclinent de plus de façons que les logiciels classiques, faute de s’adapter aux évolutions de leur environnement. On surveille donc en continu la distribution des données entrantes et la qualité des prédictions.
    • Le réentraînement — Une fois la dérive détectée, il faut pouvoir relancer tout le processus sans intervention manuelle. Google décrit trois niveaux de maturité, du processus entièrement manuel à l’automatisation complète de la chaîne d’intégration et de déploiement.
    • La traçabilité — Vous devez savoir quelle version du modèle a produit quelle décision, avec quelles données et quels paramètres. Cette exigence devient réglementaire dès qu’un système entre dans le champ de l’AI Act européen.

    Le machine learning dans votre quotidien

    Vous utilisez du machine learning des dizaines de fois par jour sans y penser.

    • Fil d’actualité — Les algorithmes de Facebook, Instagram, TikTok et YouTube prédisent quel contenu vous retiendra le plus longtemps. Chaque like, chaque défilement et chaque pause sur une vidéo nourrit le modèle.
    • Filtre anti-spam — Gmail classe vos emails grâce à un modèle qui a appris sur des milliards de messages ce qui distingue un courrier légitime d’un spam.
    • Recommandations — Netflix, Spotify et Amazon appliquent le machine learning au commerce, et la phrase « les clients qui ont acheté ceci ont aussi acheté cela » en résume le principe.
    • Navigation — Google Maps prédit votre temps de trajet et les embouteillages à partir des données de millions de trajets passés.
    • Reconnaissance faciale — Le déverrouillage de votre téléphone repose sur un modèle de deep learning entraîné à reconnaître votre visage sous différents angles et éclairages.
    • Assistants IA — Derrière chaque conversation avec ChatGPT, Claude, Gemini ou Vibe, un modèle prédit le token le plus probable, un token à la fois.

    Les concepts clés à retenir

    Données d’entraînement

    Elles constituent la matière première du machine learning. La qualité du modèle dépend directement de leur qualité et de leur diversité. Un modèle entraîné principalement sur des données anglophones sera moins bon en français, et un modèle entraîné sur des données biaisées reproduira ces biais.

    Surapprentissage

    On parle de surapprentissage, ou overfitting, quand un modèle apprend trop bien ses données d’entraînement, bruit et particularités compris, et ne généralise plus à de nouvelles données. Pensez à un étudiant qui mémorise le corrigé sans comprendre le cours : il obtient 20 sur 20 à l’examen de l’année dernière et échoue sur de nouvelles questions.

    Biais

    Un modèle reproduit les biais présents dans ses données. Si celles-ci contiennent des stéréotypes, par exemple l’association de certains métiers à certains genres, le modèle les reproduira. Le sujet fait l’objet de recherches actives et figure explicitement dans les obligations européennes pour les systèmes à haut risque.

    Inférence

    L’inférence désigne le moment où le modèle travaille, quand il génère une réponse, fait une prédiction ou prend une décision. L’entraînement a lieu une fois, ou périodiquement, alors que l’inférence a lieu à chaque utilisation. Quand vous parlez à Claude, chaque réponse est une inférence, et elle se facture.

    Ce que le machine learning ne fait pas encore

    Il ne comprend pas. Un modèle reconnaît des motifs statistiques dans les données, sans accéder au sens de ce qu’il traite. Un modèle qui traduit parfaitement du français vers l’anglais ne parle aucune des deux langues, il a appris des correspondances.

    Il ne raisonne pas comme un humain. Les modèles de raisonnement actuels, de Claude Opus 5.5 à GPT-6 Astra en passant par Gemini 3.8 Flash, décomposent les problèmes en étapes et règlent leur effort de réflexion selon la difficulté. Anthropic parle d’une réflexion adaptative activée par défaut, OpenAI expose cinq niveaux d’effort. Le résultat impressionne, mais il repose toujours sur de la prédiction de séquences très sophistiquée.

    Il dépend entièrement de ses données. Un modèle ignore ce qu’il n’a jamais vu, et chaque modèle porte une date de coupure de connaissances. Celle de Claude Opus 5 se situe en mai 2026, celle de GPT-6 Astra au 30 avril 2026. La recherche web intégrée et le RAG existent précisément pour combler ce trou, et les hallucinations surviennent souvent quand on l’oublie.

    Ce qu’il faut retenir

    Le machine learning relève des mathématiques appliquées à des données, à grande échelle. Comprendre cela change votre rapport aux outils d’IA : vous savez pourquoi ils réussissent, grâce au volume de données et de calcul, pourquoi ils se trompent, à cause de données incomplètes ou biaisées, et comment en tirer le meilleur parti en donnant du contexte, en restant précis et en vérifiant les faits. Vous savez aussi que le modèle le plus gros n’est presque jamais le plus rentable.

    Aller plus loin
    Le vocabulaire de l’IA, au clair

    Tokens, paramètres, fenêtre de contexte, RAG, agents : notre glossaire réunit les termes que vous croiserez partout.

    Consulter le glossaire ↗
    Mise à jour : 23 septembre 2026