Aller au contenu
    NEURONE
    Concept IA

    Réseaux neuronaux : le moteur de l’IA moderne

    ChatGPT, Claude, Gemini, les générateurs d’images et les voitures autonomes reposent sur la même technologie de base. Les réseaux neuronaux artificiels forment le cœur de l’intelligence artificielle. Voici comment ils fonctionnent, d’où ils viennent réellement, sur quelles puces ils tournent et ce qu’ils consomment.

    Si l’intelligence artificielle a un moteur, ce sont les réseaux neuronaux artificiels. Ils permettent à une IA de reconnaître un visage, de traduire une phrase, de générer une image ou de tenir une conversation. Le nom fait penser au cerveau humain, et l’inspiration vient bien de là. Un réseau neuronal artificiel emprunte pourtant une seule idée à la biologie, celle d’unités connectées qui se transmettent des signaux, puis la traduit en mathématiques. Comprendre cette mécanique éclaire à la fois la puissance de l’IA et ses limites.

    Un réseau neuronal, c’est quoi ?

    Imaginez un système de vote. Vous posez une question à des milliers de personnes, chacune donne un avis, et ces avis sont pondérés parce que certaines voix comptent plus que d’autres. Le résultat final synthétise tous ces avis pondérés. Un réseau neuronal fonctionne sur le même principe, avec des chiffres.

    Concrètement, un réseau neuronal est un programme composé de neurones artificiels organisés en couches. Chaque neurone reçoit des nombres en entrée, les multiplie par un poids, ajoute un biais, applique une fonction d’activation, puis transmet le résultat à la couche suivante. La première couche reçoit les données brutes, qu’il s’agisse d’une image, d’un texte ou d’un son. La dernière couche produit le résultat, une prédiction, une catégorie ou un mot.

    Ce qui rend le réseau capable d’apprendre, ce sont les poids, autrement dit la force de chaque connexion. Au départ, ces poids sont tirés au hasard et le réseau produit n’importe quoi. Pendant l’entraînement, il les ajuste progressivement pour réduire ses erreurs. Le geste ressemble à l’accordage d’un instrument, où l’on tourne les clés petit à petit jusqu’à ce que le son soit juste. Quand vous lisez qu’un modèle compte des centaines de milliards de paramètres, ce sont ces poids que l’on dénombre.

    L’ordre de grandeur, et ce qu’on n’en sait pas

    Les laboratoires qui publient leurs poids donnent des chiffres vérifiables : Kimi K3 de Moonshot atteint 2 800 milliards de paramètres, Qwen3.8-Max d’Alibaba 2 400 milliards, DeepSeek-V4-Pro 1 600 milliards dont 49 milliards actifs par token, GLM-5.3 de Z.ai 753 milliards et Mistral Large 3 675 milliards dont 41 milliards actifs. En face, OpenAI, Anthropic, Google, Meta et SpaceXAI ne publient aucun nombre de paramètres pour leurs modèles phares. Toute comparaison de taille entre modèles fermés relève donc de la spéculation.

    Les grandes familles de réseaux neuronaux

    Les réseaux à propagation avant

    Ce sont les plus simples. Les données entrent d’un côté, traversent les couches et sortent de l’autre, sans boucle et sans mémoire. On les emploie pour la classification, par exemple pour distinguer un chat d’un chien, et pour la régression, par exemple pour estimer le prix d’un appartement. Ils constituent la brique de base de tout le reste.

    Les réseaux convolutifs

    Les réseaux convolutifs, ou CNN, se spécialisent dans les images. Plutôt que de traiter chaque pixel isolément, ils font glisser des filtres sur l’image pour détecter des motifs, d’abord des bords et des textures, puis des formes, puis des objets complets. Cette famille permet à votre téléphone de reconnaître votre visage et à un système médical de repérer une anomalie sur une radio. Notre article sur la vision par ordinateur détaille ces usages.

    L’idée remonte au néocognitron de Kunihiko Fukushima, en 1980. Yann LeCun l’a transformée en méthode entraînable aux Bell Labs en 1989, travail que l’IEEE a reconnu par un Milestone officiel dédié le 21 octobre 2025.

    Les réseaux récurrents et les LSTM

    Ces réseaux traitent des séquences, qu’il s’agisse de texte, de son ou de séries temporelles. Ils possèdent une forme de mémoire, puisque le résultat de chaque étape influence la suivante. Les LSTM, pour Long Short-Term Memory, ont servi de référence au traitement du langage pendant près de vingt ans. Leur défaut tient à leur fonctionnement séquentiel, mot après mot, qui les rend lents et fragiles sur les textes longs.

    Les Transformers

    Cette architecture propulse tous les modèles de langage actuels. Huit chercheurs de Google l’ont présentée dans Attention Is All You Need, déposé le 12 juin 2017 et publié à la conférence NeurIPS la même année. Le Transformer règle le problème principal des réseaux récurrents : au lieu de traiter les mots un par un, il les traite tous en parallèle grâce au mécanisme d’attention. Chaque mot regarde tous les autres mots de la séquence pour situer son contexte. Nos articles sur les grands modèles de langage et le traitement du langage naturel prolongent le sujet.

    Pourquoi parle-t-on d’attention ?

    Quand vous lisez « la banque du fleuve était couverte de mousse », votre cerveau relie « banque » à « fleuve » pour comprendre qu’il s’agit d’une berge et non d’un établissement financier. Le mécanisme d’attention procède de la même façon : il calcule les relations entre tous les mots pour lever les ambiguïtés. L’idée paraît simple, et elle a rendu possible tout ce que vous utilisez.

    Le mélange d’experts

    C’est l’évolution majeure de l’architecture depuis le Transformer, et celle qui explique les nombres de paramètres vertigineux annoncés aujourd’hui. Dans un mélange d’experts, ou mixture of experts, la couche de calcul se divise en plusieurs sous-réseaux spécialisés. Un routeur choisit, pour chaque token, les deux ou trois experts les plus pertinents et laisse les autres au repos.

    Le modèle possède donc deux tailles. Les paramètres totaux mesurent tout ce qu’il a appris, les paramètres actifs mesurent ce qu’il mobilise réellement pour produire chaque token. DeepSeek-V4.1-Flash illustre l’écart : 552 milliards de paramètres au total, mais 8 milliards actifs en entrée et 16 milliards en sortie, d’après la documentation de l’éditeur. Kimi K3 répartit ses 2 800 milliards de paramètres sur 896 experts. Un modèle devient ainsi beaucoup plus savant sans devenir proportionnellement plus coûteux à interroger.

    L’idée n’est pas neuve. Robert Jacobs, Michael Jordan, Steven Nowlan et Geoffrey Hinton l’avaient formulée en 1991 dans Adaptive Mixtures of Local Experts. Noam Shazeer et ses coauteurs l’ont adaptée aux réseaux profonds en 2017 avec la couche de mélange d’experts à activation parcimonieuse, puis le Switch Transformer l’a simplifiée en ne retenant qu’un seul expert par token. La difficulté pratique tient à l’équilibrage : sans précaution, le routeur sollicite toujours les mêmes experts et laisse les autres inutilisés, ce que les fonctions de perte auxiliaires corrigent.

    Du neurone au mélange d’experts : la frise chronologique

    Les dates qui suivent renvoient aux publications d’origine, et non aux vulgarisations qui ont suivi.

    • 1943 — Warren McCulloch et Walter Pitts proposent le premier modèle mathématique de neurone artificiel, dans le Bulletin of Mathematical Biophysics. Tout part de là.
    • 1957 et 1958 — Frank Rosenblatt conçoit le perceptron, simulé d’abord sur un IBM 704 au Cornell Aeronautical Laboratory. Il en publie la théorie dans Psychological Review en 1958, et la machine Mark I Perceptron est construite en 1960.
    • 1969 — Marvin Minsky et Seymour Papert publient Perceptrons et démontrent les limites d’un perceptron à une seule couche. La recherche sur le sujet s’arrête presque partout.
    • 1974-1980 — Le premier hiver de l’IA s’installe. Le rapport Lighthill de 1973 démonte les promesses du domaine au Royaume-Uni, et la DARPA réoriente ses financements aux États-Unis.
    • 1980 — Kunihiko Fukushima présente le néocognitron, ancêtre direct des réseaux convolutifs.
    • Années 1980 — John Hopfield introduit son réseau à mémoire associative, puis Geoffrey Hinton la machine de Boltzmann. Ces travaux leur ont valu le prix Nobel de physique le 8 octobre 2024, pour des découvertes et des inventions fondamentales rendant possible l’apprentissage automatique avec des réseaux de neurones artificiels.
    • 9 octobre 1986 — David Rumelhart, Geoffrey Hinton et Ronald Williams publient la rétropropagation dans Nature, volume 323, pages 533 à 536. C’est la technique d’apprentissage encore employée aujourd’hui.
    • 1987-2000 — Le second hiver de l’IA suit l’effondrement du marché des machines LISP en 1987 et l’abandon des systèmes experts, trop coûteux à maintenir.
    • 1989 — Yann LeCun met au point aux Bell Labs la théorie et la pratique des réseaux convolutifs, appliquées à la reconnaissance de chiffres manuscrits.
    • 1991 — Robert Jacobs, Michael Jordan, Steven Nowlan et Geoffrey Hinton posent le principe du mélange d’experts.
    • 1997 — Sepp Hochreiter et Jürgen Schmidhuber publient les LSTM dans Neural Computation, volume 9, numéro 8. Un rapport technique daté du 21 août 1995 les avait précédés, ce qui explique la date de 1995 que l’on rencontre parfois.
    • 30 septembre 2012 — AlexNet, un réseau convolutif signé Alex Krizhevsky, Ilya Sutskever et Geoffrey Hinton, remporte le concours ImageNet avec 15,3 % d’erreur sur le top 5, loin devant le second. Ses 60 millions de paramètres ont été entraînés sur deux cartes Nvidia GTX 580 grand public, et l’ère du deep learning commence.
    • 12 juin 2017 — Huit chercheurs de Google déposent Attention Is All You Need et introduisent le Transformer.
    • 11 octobre 2018 — Google publie BERT, qui applique le Transformer à la compréhension de texte.
    • Février 2019 — OpenAI présente GPT-2 et ses 1,5 milliard de paramètres, entraîné sur huit millions de pages web.
    • 27 mars 2019 — L’ACM décerne le prix Turing 2018 à Yoshua Bengio, Geoffrey Hinton et Yann LeCun, pour les percées conceptuelles et techniques qui ont fait des réseaux de neurones profonds un composant essentiel de l’informatique.
    • 28 mai 2020 — OpenAI publie GPT-3, 175 milliards de paramètres répartis sur 96 couches. L’échelle devient un argument de recherche.
    • 30 novembre 2022 — ChatGPT ouvre l’IA générative au grand public.
    • Depuis 2024 — Le mélange d’experts, l’attention optimisée et les encodages positionnels rotatifs sont devenus la norme. Les modèles phares atteignent un million de tokens de contexte et règlent eux-mêmes leur effort de réflexion, de Claude Opus 5.5 à GPT-6 Astra en passant par Gemini 3.8 Flash. L’architecture de base reste le Transformer.

    Le deep learning : des réseaux neuronaux en profondeur

    Quand on empile beaucoup de couches dans un réseau neuronal, on parle de deep learning, ou apprentissage profond. Le mot « profond » renvoie à l’architecture, pas à une quelconque profondeur de pensée. Plus les couches s’accumulent, plus le réseau capte des motifs abstraits, chaque niveau combinant les représentations du niveau précédent.

    Un réseau de deux ou trois couches reconnaît des formes simples. GPT-3, dont l’architecture a été publiée, en comptait 96 pour 175 milliards de paramètres. Les laboratoires ne documentent plus ce détail sur leurs modèles phares, si bien que le nombre exact de couches de Claude Opus 5.5 ou de GPT-6 Astra reste inconnu. Cette profondeur a en tout cas un prix, en calcul comme en électricité, et les deux sections suivantes le chiffrent.

    Le matériel qui fait tourner les réseaux neuronaux

    Un réseau neuronal passe l’essentiel de son temps à multiplier des matrices. Cette opération se découpe en milliers de calculs indépendants, ce qui convient mal à un processeur classique conçu pour enchaîner les instructions, et très bien à un processeur graphique conçu pour les traiter en parallèle. Le déclic de 2012 tient autant à cette observation qu’à l’architecture d’AlexNet, entraîné sur deux cartes de jeu vidéo.

    Les GPU de Nvidia

    Nvidia a bâti sa position sur ce constat. L’entreprise a présenté sa plateforme Rubin le 5 janvier 2026, avec six puces conçues ensemble : le processeur Vera et ses 88 cœurs, le GPU Rubin et son moteur Transformer de troisième génération, un commutateur NVLink 6, une carte réseau ConnectX-9, un processeur de données BlueField-4 et un commutateur Ethernet Spectrum-6. Nvidia revendique 50 pétaflops de calcul par GPU en format NVFP4, une division par dix du coût du token en inférence par rapport à Blackwell, et quatre fois moins de GPU nécessaires pour entraîner un modèle en mélange d’experts. La production en série a été annoncée le 31 mai 2026, pour des livraisons à partir de l’automne. Notre portrait de Jensen Huang raconte comment le fabricant en est arrivé là.

    Les TPU de Google

    Google conçoit ses propres puces depuis le milieu des années 2010. La septième génération, nommée Ironwood, a été annoncée le 9 avril 2025. Google l’a ouverte en préversion à ses clients cloud le 24 novembre 2025, sous la référence TPU7x. Les sources divergent sur la date de disponibilité générale : les notes de version de Google Cloud la fixent au 31 mars 2026, alors que The Next Web la situe au salon Cloud Next du 22 avril 2026. Chaque puce embarque 192 Go de mémoire à haut débit, six fois plus que la génération précédente, et se regroupe en grappes de 256 ou 9 216 puces atteignant 42,5 exaflops. Google la présente comme son premier TPU conçu pour « l’ère de l’inférence », c’est-à-dire pour faire tourner des modèles qui réfléchissent longtemps plutôt que pour les entraîner. Anthropic a annoncé le 6 avril 2026 un accord avec Google et Broadcom portant sur plusieurs gigawatts de capacité TPU de nouvelle génération, attendue en 2027.

    Les puces dédiées

    Chaque grand acteur développe désormais son silicium. Amazon a mis sur le marché Trainium3 le 2 décembre 2025, sa première puce d’IA en 3 nanomètres, avec des serveurs réunissant jusqu’à 144 puces. AWS annonce 4,4 fois plus de puissance de calcul et une efficacité énergétique quatre fois meilleure que Trainium2, génération avec laquelle l’entreprise avait assemblé pour Anthropic une grappe de plus de 500 000 puces. OpenAI a présenté le 24 juin 2026 sa première puce maison, Jalapeño, conçue avec Broadcom et dédiée à l’inférence des modèles de langage, avec un premier déploiement annoncé pour la fin 2026, dans le cadre d’une collaboration portant sur dix gigawatts.

    Deux enseignements se dégagent de cette course. D’abord, le matériel se spécialise pour l’inférence, parce que c’est là que se joue désormais l’essentiel de la dépense. Ensuite, très peu d’acteurs peuvent entraîner un modèle de pointe : Mistral indique avoir entraîné Mistral Large 3 sur 3 000 GPU NVIDIA H200, ce qui donne une idée du ticket d’entrée.

    Ce que consomme un réseau neuronal

    Le sujet a longtemps circulé sous forme d’estimations approximatives. Deux éditeurs publient maintenant des chiffres mesurés, avec leur méthode.

    Google a publié en août 2025 une étude intitulée Measuring the environmental impact of delivering AI at Google Scale. Elle chiffre une requête texte médiane dans les applications Gemini, en mai 2025, à 0,24 wattheure d’énergie, 0,03 gramme d’équivalent CO2 et 0,26 millilitre d’eau. L’entreprise revendique une division par 44 des émissions par requête entre mai 2024 et mai 2025, dont une division par 33 de l’énergie consommée, obtenue par optimisation logicielle.

    Mistral a publié le 22 juillet 2025 une analyse de cycle de vie de Mistral Large 2, menée avec le cabinet Carbone 4 et l’ADEME, selon la méthodologie Frugal AI de l’AFNOR. Après dix-huit mois d’exploitation, le modèle totalisait 20,4 kilotonnes d’équivalent CO2 et 281 000 mètres cubes d’eau. Une réponse de 400 tokens y représente 1,14 gramme d’équivalent CO2 et 45 millilitres d’eau.

    Comparez ces chiffres avec prudence

    Les deux publications ne mesurent pas la même chose. Google chiffre l’inférence seule pour une requête médiane, Mistral additionne l’entraînement et l’exploitation sur la durée de vie d’un modèle. Les périmètres, les modèles et les mix électriques diffèrent. Ces données viennent par ailleurs des éditeurs eux-mêmes, même lorsqu’un tiers a revu la méthode. Elles valent comme ordre de grandeur, pas comme classement.

    À l’échelle du secteur, l’Agence internationale de l’énergie chiffre dans son rapport Energy and AI la consommation électrique des centres de données à 415 térawattheures en 2024, soit environ 1,5 % de l’électricité mondiale, et projette environ 945 térawattheures en 2030. Côté entreprise, Google indique dans son rapport environnemental publié le 30 juin 2026 une demande d’électricité en hausse de 37 % sur un an, pour des émissions opérationnelles en baisse de 2 % et des émissions de chaîne d’approvisionnement en hausse de 25 %.

    Cette transparence progresse aussi sous l’effet du droit. L’annexe XI de l’AI Act européen impose aux fournisseurs de modèles à usage général de documenter la consommation énergétique connue ou estimée de leur modèle, ainsi que les ressources de calcul mobilisées, exprimées par exemple en opérations en virgule flottante, et la durée d’entraînement. Le texte prévoit explicitement le cas où la consommation reste inconnue, en autorisant une estimation à partir des ressources de calcul utilisées.

    Pourquoi c’est important pour vous

    Vous n’avez pas besoin de savoir construire un réseau neuronal pour utiliser l’IA. Connaître le principe vous aide en revanche sur trois plans.

    Vous repérez leurs forces. Les réseaux neuronaux excellent dans la reconnaissance de motifs, sur du texte, des images, du son ou des données tabulaires. Confiez-leur une tâche qui relève de la mise en correspondance, comme rédiger dans un style donné, classer des documents ou détecter une anomalie, et le résultat sera souvent remarquable. Notre guide sur l’art du prompt explique comment formuler ces demandes.

    Vous comprenez leurs limites. Un réseau neuronal calcule des probabilités, il n’accède pas au sens. De là vient sa capacité à produire une réponse parfaitement tournée et factuellement fausse, ce qu’on appelle une hallucination. La notion de vrai ou faux lui échappe, il ne connaît que probable ou improbable.

    Vous savez d’où viennent les coûts. Chaque requête mobilise des milliards d’opérations dans un centre de données, sur des puces qui coûtent cher et consomment de l’électricité. Les abonnements payants, les quotas et les débats environnementaux découlent directement de cette réalité physique. Notre article sur le machine learning détaille l’écart entre le coût d’un entraînement et celui d’une utilisation.

    Ce qu’il faut retenir

    Les réseaux neuronaux forment le socle technique de tout ce que vous utilisez en IA. L’architecture Transformer de 2017 a servi de déclic, et le mélange d’experts l’a rendue économiquement tenable à très grande échelle. Le principe de base n’a pourtant pas changé depuis 1986 : des couches de neurones connectés qui ajustent leurs poids par rétropropagation pour réduire leurs erreurs. La puissance vient de l’échelle, du matériel et des données, pas d’un secret.

    Aller plus loin
    Comprendre les modèles de langage

    Notre guide reprend le chemin des réseaux neuronaux aux LLM : tokens, fenêtre de contexte, entraînement et usages concrets.

    Lire notre guide LLM ↗
    Mise à jour : 23 septembre 2026