Aller au contenu
    BOUCLE
    Concept IA

    Ouroboros linguistique : la boucle qui menace l’IA

    Les modèles d’IA s’entraînent sur des textes produits par d’autres modèles, et la moitié des articles publiés en ligne sortent désormais d’une machine. Les chercheurs ont donné un nom à ce risque, l’effondrement des modèles, et l’ont mesuré en laboratoire. Voici ce que dit la recherche, ce qui relève de l’alarme excessive, et ce que la boucle change pour qui publie du contenu.

    L’ouroboros est ce serpent antique qui se mord la queue, un cycle sans fin et sans apport extérieur. Les chercheurs ont emprunté ce symbole pour décrire ce qui se joue sur le web depuis trois ans. Les modèles d’IA apprennent sur des textes que d’autres modèles ont écrits, et ces textes nourriront à leur tour les générations suivantes. La boucle se referme, et ses effets se mesurent déjà.

    Le sujet a quitté le registre de l’intuition. Un article publié dans Nature en 2024 a démontré le mécanisme, plusieurs équipes l’ont contredit ou nuancé depuis, et des études de terrain chiffrent aujourd’hui la part de contenu synthétique en circulation. Les termes techniques employés ici sont repris dans notre glossaire de l’intelligence artificielle.

    Le symbole de l’ouroboros appliqué à l’IA

    Les IA génératives produisent des volumes massifs de textes : articles, fiches produits, publications sur les réseaux sociaux, résumés. Ces textes sont indexés, archivés, puis réintégrés dans les corpus qui servent à entraîner les modèles suivants, parce que la matière première de l’entraînement reste un moissonnage du web.

    Un modèle n’apprend plus seulement du langage humain vivant. Il apprend aussi sur des versions déjà normalisées et lissées par un algorithme. Chaque génération hérite des tics et des angles morts de la précédente, avec le risque de les accentuer. La recherche a baptisé cette dynamique l’effondrement des modèles.

    L’effondrement des modèles : ce que dit la recherche

    Ilia Shumailov, Zakhar Shumaylov, Yiren Zhao, Nicolas Papernot, Ross Anderson et Yarin Gal ont publié le 24 juillet 2024 dans Nature un article intitulé AI models collapse when trained on recursively generated data. Ils y décrivent un processus dégénératif au terme duquel le modèle oublie la distribution réelle des données, et ils le démontrent sur trois familles de modèles : les grands modèles de langage, les auto-encodeurs variationnels et les mélanges gaussiens.

    Model collapse: a degenerative process whereby, over time, models forget the true underlying data distribution.
    Ilia Shumailov et ses coauteurs — Nature, volume 631, pages 755 à 759, 24 juillet 2024. Effondrement du modèle : un processus dégénératif au terme duquel les modèles oublient, avec le temps, la véritable distribution des données sous-jacentes.

    Leur expérience sur le langage reste la plus parlante. L’équipe a réentraîné OPT-125m, un petit modèle de Meta, sur le corpus WikiText2, chaque génération apprenant sur les textes produits par la précédente. Sans aucune donnée d’origine conservée, la perplexité se dégrade de 20 à 28 points en cinq cycles. En gardant 10 % des données réelles dans le mélange, le modèle tient bien plus longtemps. Les auteurs attribuent la dérive à trois erreurs qui se cumulent : l’approximation statistique, les limites d’expressivité de l’architecture et l’approximation de l’apprentissage.

    Cet article a trouvé ses contradicteurs très vite, et leur argument est solide. Matthias Gerstgrasser, Rylan Schaeffer et leurs coauteurs ont montré dès avril 2024 que le résultat dépend d’une hypothèse discutable, celle où les nouvelles données remplacent les anciennes. Si l’on accumule les générations de données synthétiques à côté des données réelles, ce qui correspond à la pratique effective des laboratoires, l’erreur de test reste bornée et l’effondrement ne se produit plus.

    D’autres travaux tirent dans le sens inverse. Une équipe réunie autour d’Elvis Dohmatob et de Julia Kempe a publié en octobre 2024 une analyse dans le cadre des lois d’échelle, où 1 % de données synthétiques suffit à dégrader nettement les performances : agrandir le jeu d’entraînement n’améliore plus le résultat. Les auteurs observent aussi qu’un modèle plus grand accentue d’abord le phénomène avant de l’atténuer en partie au-delà d’un certain seuil.

    La lecture honnête tient entre ces deux bornes. L’effondrement total décrit dans Nature suppose un scénario que personne n’applique, puisque les laboratoires accumulent, filtrent et pondèrent leurs données. La dégradation partielle, elle, se mesure sans avoir besoin d’un scénario extrême.

    En résumé

    Trois effets se distinguent. L’homogénéisation du style rend les textes plus uniformes et moins nuancés. L’amplification des biais fait qu’une génération de modèles accentue les défauts de la précédente. La perte de diversité lexicale efface progressivement les expressions rares et les registres créatifs. Le premier et le troisième sont documentés par des travaux publiés, le second dépend entièrement de la façon dont les données d’entraînement sont assemblées.

    Quelle part du web est réellement générée par une IA

    L’intuition d’un web saturé de contenus synthétiques se vérifie maintenant avec des chiffres. Le cabinet Graphite a tiré 55 400 URL au hasard de Common Crawl, en retenant les articles en anglais d’au moins cent mots publiés entre janvier 2020 et mars 2026. Chaque article est passé par trois détecteurs, Pangram, Copyleaks et GPTZero, dont les verdicts ont été moyennés.

    La progression est nette. Douze mois après la sortie de ChatGPT, 36 % des articles étaient principalement écrits par une machine. À vingt-quatre mois, la part atteignait 48 %. Depuis le premier trimestre 2025, elle se stabilise autour de 50 %, à égalité avec les articles humains, d’après les mesures de Graphite. Les taux de faux positifs des détecteurs, compris entre 1,36 % et 1,84 %, ne suffisent pas à expliquer un niveau pareil.

    Le résultat le plus utile pour un éditeur arrive ensuite. Ces articles n’apparaissent presque pas dans les résultats de Google ni dans les réponses de ChatGPT. La production de masse remplit le web sans gagner de visibilité, et ces deux phénomènes se mesurent séparément.

    Un second mouvement mérite d’être placé à côté du premier. Shayne Longpre, Robert Mahari et une trentaine de chercheurs ont audité les protocoles de consentement de 14 000 domaines présents dans les corpus d’entraînement C4, RefinedWeb et Dolma. Entre 2023 et 2024, environ 5 % de tous les tokens de C4 sont devenus entièrement interdits par un fichier robots.txt, et 28 % des sources les plus activement maintenues. En s’appuyant sur les conditions d’utilisation, la proportion restreinte grimpe à 45 % de C4. La matière humaine se ferme pendant que la matière synthétique s’accumule.

    La boucle se referme aussi dans la recherche par IA

    Un moteur de réponse ne s’entraîne pas sur le web, il le consulte au moment de répondre, par un mécanisme de recherche augmentée dont nous avons détaillé le fonctionnement dans notre article sur le RAG. La boucle peut donc se refermer sans passer par l’entraînement.

    Graphite a simulé ce cas de figure. L’équipe a mené 1 528 simulations avec trois modèles, sur 1 019 questions d’information, pour plus d’un million d’appels d’API, en repartant des références réellement citées par ChatGPT et par les AI Overviews de Google. À chaque tour, les réponses produites entraient dans le vivier de sources du tour suivant.

    79,6 % des simulations finissent par s’effondrer, soit 1 216 sur 1 528. Dans la variante la plus réaliste, où les contenus produits rejoignent un vivier dans lequel le système va chercher les passages les plus pertinents, le taux se situe entre 75 % et 77 %. La proportion de réponses qui ne sont que des paraphrases les unes des autres passe de 22 % à 89 % dans les expériences les plus longues.

    Un biais mesuré explique la mécanique. Les modèles citent leurs propres productions dans 38,9 % des cas, contre 7,4 % pour les textes humains d’origine et 9,4 % pour les autres textes générés. À qualité contrôlée, le simple fait d’avoir écrit un passage lui ajoute environ 26 points de taux de citation. Le système se préfère lui-même, et cette préférence se chiffre.

    L’appauvrissement de la langue, mesuré

    L’idée que l’IA appauvrit la langue circule beaucoup et se vérifie rarement. Deux travaux publiés apportent des mesures plutôt que des impressions.

    Dmitry Kobak, Rita González-Márquez, Emőke-Ágnes Horvát et Jan Lause ont analysé le vocabulaire de plus de 15 millions de résumés d’articles biomédicaux, et publié leurs résultats dans Science Advances le 2 juillet 2025. Ils constatent une hausse brutale de la fréquence de certains mots de style à partir de l’arrivée des grands modèles. Leur estimation porte sur 13,5 % des résumés de 2024 au minimum, une proportion qui atteint 40 % sur certains sous-corpus. Les auteurs relèvent que l’effet dépasse celui de la pandémie de Covid sur l’écriture scientifique.

    Le second travail sort du texte écrit. Hiromu Yakura et une équipe de l’institut Max Planck pour le développement humain ont examiné 737 083 heures de conversation issues de 824 634 épisodes de podcasts non scriptés. Des mots que ChatGPT emploie volontiers, comme delve, showcase, boast, intricacies ou meticulous, augmentent brutalement dans la parole spontanée après la sortie du modèle. Une expérience complémentaire auprès de 496 participants montre que l’exposition au robot conversationnel suffit à faire adopter son vocabulaire, et que l’effet persiste après une tâche de diversion.

    Le traitement du langage naturel se retrouve à influencer le langage qu’il était censé décrire, et l’effet se propage jusqu’à la conversation orale.

    Les tics repérables, et pourquoi les listes vieillissent vite

    Graphite a comparé 10 000 articles humains à 90 000 articles produits par neuf modèles, puis recensé environ treize mille mots, expressions et tournures qui apparaissent au moins deux fois plus souvent dans le texte de machine que dans le texte humain. Le tiret cadratin, indice devenu célèbre, ne représente qu’une ligne de cette liste.

    Chaque modèle laisse sa propre signature. GPT-6 Astra emploie les formules prudentes du type may provide trente-six fois plus souvent qu’un humain. Gemini 3.1 Pro pousse incredibly à un rythme mille huit cent trente-cinq fois supérieur. Claude Opus 5 revient sans cesse sur des superlatifs comme single most. Cinq familles de tics reviennent partout : les adjectifs d’évaluation sans description concrète, les transitions formulaires, la définition par contraste, l’évitement des arbitrages et le fait de souligner au lecteur que quelque chose est important.

    Deux enseignements pratiques en découlent. L’écriture humaine se distingue d’abord par des marqueurs mesurables : la première personne, l’adresse directe au lecteur, les anecdotes vécues et les points d’exclamation, employés plus de cent fois plus souvent que par les modèles. Ensuite, les listes de tics se périment : d’une version de GPT à la suivante, seuls 45 % des indices se recoupent, et les marqueurs les plus connus reculent de 41 % à 86 %. Un détecteur d’IA calibré sur la génération précédente voit sa fiabilité baisser à chaque sortie de modèle.

    Les données synthétiques choisies : un cas à part

    Le mot synthétique recouvre deux réalités qu’il faut séparer. D’un côté, on trouve des textes générés en masse, publiés sans contrôle et ramassés par un moissonnage aveugle du web. De l’autre, des laboratoires fabriquent des données exprès, avec un cahier des charges, pour entraîner un modèle sur ce qui manque à son corpus.

    Microsoft Research a documenté la seconde approche avec Phi-4, un modèle de 14 milliards de paramètres publié en décembre 2024, dont le rapport technique décrit l’incorporation de données synthétiques à toutes les étapes de l’entraînement. Les auteurs mesurent que Phi-4 dépasse son modèle enseignant sur les questions scientifiques, ce qui écarte l’explication par la simple distillation. Des données générées peuvent donc ajouter de la capacité, à condition d’avoir été conçues pour cela.

    Le résultat de Gerstgrasser et de ses coauteurs prend alors tout son sens. Accumuler des données synthétiques à côté des données réelles laisse l’erreur bornée, alors que remplacer les secondes par les premières la fait croître sans limite. La différence tient à la méthode d’entraînement, un sujet que nous abordons dans notre présentation du machine learning.

    Provenance et marquage : C2PA, SynthID et l’article 50 de l’AI Act

    Pour filtrer le synthétique, il faut d’abord savoir le reconnaître. Trois chantiers avancent en parallèle, un standard de provenance, un tatouage propriétaire et une obligation légale.

    La Coalition for Content Provenance and Authenticity, dite C2PA, publie une spécification ouverte qui attache à un fichier l’historique de son origine et de ses modifications, sous le nom de Content Credentials. Son comité de pilotage réunit Adobe, Amazon, la BBC, Google, Meta, Microsoft, OpenAI, Publicis Groupe, Sony, TikTok et Truepic. La spécification en est à la version 2.3, et l’adoption effective par les plateformes reste la vraie question.

    Google DeepMind suit une autre voie avec SynthID, un tatouage invisible appliqué aux images et aux vidéos générées par ses produits, aux audios de Lyria et des résumés parlés de NotebookLM, et au texte produit par l’application Gemini. Le tatouage des images résiste au recadrage, aux filtres et à la compression. Un portail de vérification, SynthID Detector, est en test avec des journalistes et des professionnels des médias.

    L’obligation légale, elle, existe déjà en Europe. L’article 50 de l’AI Act est entré en application le 2 août 2026 et n’a pas été reporté par le règlement omnibus numérique du 27 juillet 2026, contrairement aux obligations sur les systèmes à haut risque. Il impose aux fournisseurs de systèmes génératifs de marquer leurs sorties dans un format lisible par une machine, avec des solutions efficaces, interopérables et robustes dans la mesure où la technique le permet. Les systèmes déjà sur le marché avant le 2 août 2026 disposent d’un délai jusqu’au 2 décembre 2026 pour s’y conformer.

    L’obligation d’étiquetage pour un éditeur

    L’article 50 vise d’abord les fournisseurs de modèles. Il prévoit aussi une obligation pour qui publie un texte généré par IA destiné à informer le public sur des questions d’intérêt public. Une exception explicite l’accompagne : elle joue quand le contenu a fait l’objet d’une relecture éditoriale humaine et qu’une personne assume la responsabilité éditoriale de sa publication. Relire, corriger et signer votre contenu vous place donc dans cette exception. Les hypertrucages audio ou vidéo doivent en revanche être signalés dans tous les cas. Notre guide sur la déclaration IA d’un site détaille la démarche.

    Ce que ça change pour un créateur de contenu

    Le web s’uniformise, la différenciation redevient payante

    Les contenus générés se ressemblent d’un site à l’autre, ce qui rend la différenciation éditoriale plus difficile sur la forme et plus facile sur le fond. Un contenu ancré dans une expérience vécue, un test réel ou une expertise vérifiable se détache mécaniquement de la masse. C’est ce que Google cherche à valoriser avec ses critères E-E-A-T, pour expérience, expertise, autorité et fiabilité.

    Le chiffre de Graphite donne la mesure de l’occasion. La moitié de ce qui se publie est synthétique, et cette moitié n’apparaît quasiment pas dans les résultats de recherche. La concurrence réelle sur une requête reste bien moins nombreuse que le volume publié ne le laisse croire.

    Ce que Google sanctionne réellement

    Google n’interdit pas le contenu produit avec une IA. Ses règles anti-spam visent l’abus de contenu à grande échelle, défini comme la production de nombreuses pages dont l’objectif premier est de manipuler le classement plutôt que d’aider les utilisateurs. Le texte cite explicitement l’usage d’outils génératifs pour créer beaucoup de pages sans apporter de valeur. Le critère porte sur l’intention et sur la qualité, pas sur l’outil employé.

    En pratique, un texte assisté par IA, enrichi d’une expertise humaine et vérifié, garde toute sa valeur de référencement. Un texte produit à la chaîne sans relecture tombe sous la règle. Nous détaillons cette ligne de partage dans notre article sur l’IA et le SEO.

    La voix humaine reprend de la valeur

    Les corpus de haute qualité deviennent des ressources recherchées : textes littéraires, productions académiques, témoignages de première main. Les laboratoires signent des accords de licence pour y accéder, et l’audit de Longpre montre qu’ils affrontent un web qui se referme. Ce qui devient rare finit par se payer.

    La conséquence pour vous est directe. Ce que vous savez et que personne n’a encore écrit vaut plus cher que ce que vous savez reformuler, parce que la reformulation est justement ce que la machine fait pour trois centimes.

    Peut-on sortir de la boucle ?

    Les pistes existent, et aucune ne suffit seule.

    • Le filtrage actif — il s’agit d’identifier et d’écarter les textes générés lors de la constitution des corpus. Le recul de 41 % à 86 % des indices connus d’une génération de modèles à la suivante rend l’exercice de plus en plus coûteux.
    • Le marquage et la provenance — on attache au contenu une signature ou un historique vérifiable, par SynthID ou par Content Credentials. L’efficacité dépend entièrement du taux d’adoption et de la survie du marquage aux transformations que subit un fichier.
    • L’accumulation plutôt que le remplacement — les laboratoires conservent les données réelles dans le mélange d’entraînement au lieu de les remplacer. Cette piste est la mieux étayée théoriquement, et c’est déjà la pratique courante.
    • La traçabilité des données — il faut conserver des métadonnées précises sur l’origine de chaque texte utilisé, ce qui suppose une discipline que le moissonnage massif du web ne facilite pas.

    Ces mesures butent toutes sur la même limite. Elles demandent une coordination à l’échelle du web, alors que la production de contenu synthétique ne demande l’accord de personne.

    Ce que cela change pour vous

    La boucle affecte la qualité des outils que vous utilisez au quotidien, assistants de rédaction, robots conversationnels, générateurs de contenu. Elle explique une partie des réponses plates ou approximatives que vous obtenez, et elle croise le problème des hallucinations sans se confondre avec lui, puisque celui-ci a ses propres causes.

    Elle vous donne aussi un avantage, à condition de le saisir. La moitié de ce qui se publie est générée et ne se voit pas dans les résultats. Le web se referme aux moissonneurs et la matière humaine se raréfie. Ce que vous apportez de vous, une mesure que vous avez faite, un client que vous avez suivi, une erreur que vous avez commise, ne se trouve nulle part ailleurs et ne sortira d’aucun modèle.

    La règle de travail qui en découle tient en une phrase. Servez-vous de l’IA pour aller plus vite sur la structure, la recherche et la relecture, et gardez pour vous la partie que personne ne peut générer, c’est-à-dire ce que vous avez vu, testé et compris. Cette discipline protège votre référencement, et elle vous place du bon côté de l’article 50.

    Aller plus loin
    Découvrez tous nos guides IA

    Concepts, tendances et guides pratiques : le blog rassemble tout ce qu’il faut connaître sur l’IA.

    Explorer le blog
    Mise à jour : 21 septembre 2026