#Le brief du 21 août 2026

Sur le web, les bots IA écrivent de plus en plus pour les bots

Les bots lisent les bots. Les sites web sont de plus en plus rédigés par des robots IA : plus d’un tiers des pages web mises en ligne après le lancement de ChatGPT intègre des contenus IA, selon une étude du Pew Research.

10 % des 10 000 pages web en anglais prélevées au mois de juillet par le Pew Research « présentent des signes significatifs d’une rédaction par IA » (textes complets ou largement remaniés). Cela parait finalement peu, mais comme le soulignent les chercheurs, une grande partie de ces pages a été mise en ligne avant l’avènement de l’IA. En mettant de côté les pages mises en ligne avant novembre 2022 et le lancement de ChatGPT, le taux monte à 35 % de pages intégrant du contenu IA.

L’étude a été réalisée avec l’aide de l’outil d’archivage web Common Crawl, les textes ayant été scrutés avec l’outil de détection IA Open Pangram. Ces utilitaires ne sont pas infaillibles, ils peuvent ranger à tort des documents rédigés par des humains dans la mauvaise case, et inversement. Néanmoins, certains types de ponctuation, de mots et d’expressions ont tendance à revenir plus fréquemment dans les textes générés par IA.

L’intelligence artificielle générative semble en effet apprécier les tirets cadratins (ils sont utilisés environ deux fois plus souvent) ; l’usage de la virgule de série (le fameux Oxford comma dans une énumération avant le « and », par exemple « I invited Alice, Bob, and Charlie ») augmente de 63 % ; certains mots prisés des IA sont employés plus de deux fois plus souvent (« testament », « interplay »…).

Pour rédiger une comparaison, l’IA a également davantage recours au parallélisme négatif, comme dans la phrase « Ce n’est pas seulement de l’information, c’est de l’influence ». Une tournure qui reste relativement rare tout de même. Les humains ne doivent pas pour autant s’interdire d’utiliser cet arsenal, mais l’IA montre un tropisme certain pour ces formes.

Début juin, Matthew Prince le patron de Cloudflare constatait que les bots (agents IA, mais aussi les bots plus traditionnels) représentaient plus de trafic que les internautes de chair et de sang. « Le trafic généré par les agents IA augmente si rapidement que, pour la première fois dans l’histoire d’internet, le trafic des bots a désormais dépassé celui des humains en ligne », s’étonnait-il. Le dirigeant avait prévu que cette bascule arriverait début 2027.

Autrement dit, de plus en plus de textes rédigés par des bots sont lus par d’autres bots. À ce rythme, les humains risquent bien de faire figure d’intrus sur Internet.

L’IRD confirme un piratage, les données de 7 500 personnes exposées

L’Institut de recherche pour le développement (IRD) a annoncé ce mardi 18 aout à son personnel, via une lettre en PDF que Next a pu se procurer, qu’une « intrusion d’origine externe dans son système d’information » a eu lieu cet été. Ce piratage a conduit, selon la PDG de l’institut, Valérie Verdier, qui signe ce courrier, « à l’exposition des données de 7 500 personnes ».

Ce chiffre est particulièrement frappant lorsqu’on le compare au nombre d’agents travaillant pour l’organisme. En effet, le rapport d’activité de l’IRD de 2025 publié en juin dernier indique que l’organisme compte 2 249 agents.

Dans ce courrier, la responsable fait la liste des données qui ont été exposées :

  • « vos données d’identification : nom, prénom(s), sexe, nationalité, date et lieu de naissance ;
  • vos données relatives à la vie personnelle : adresse postale et numéro de téléphone personnels ;
  • vos données relatives à la vie professionnelle : matricule agent, rattachement administratif, affectation géographique, statut, corps, grade, poste, niveau, échelon, emploi, discipline, adresse
    électronique professionnelle, numéro de téléphone pofessionnel ;
  • votre numéro de sécurité sociale ».

Toujours selon le document, l’incident aurait été détecté par l’IRD le 24 juillet. C’est le 6 aout que l’enquête menée en interne a permis d’établir que ces données ont été exposées. Néanmoins, « à ce stade, nous ne sommes pas en mesure de confirmer que ces données aient été exfiltrées », précise la lettre.

Valérie Verdier ajoute que son organisme de recherche a « immédiatement engagé des investigations afin d’en déterminer l’origine, l’étendue et les conséquences. Elle assure que « les mesures nécessaires pour contenir l’incident, sécuriser les systèmes concernés et rétablir progressivement les services ont été appliquées depuis cette date ».

La direction explique que la « situation est susceptible d’entraîner notamment des risques de piratage de compte, d’usurpation d’identité ou de fraude ».

Elle assure aussi avoir signalé l’incident aux autorités compétentes, porté plainte et mis en place une cellule de crise. De façon pratique, elle signale avoir mis à l’isolement des serveurs informatiques concernés afin de limiter les risques et travailler en coopération avec l’ANSSI, le CERT RENATER, le Centre opérationnel de la sécurité des systèmes d’information (COSSI) et le fonctionnaire de sécurité des systèmes d’information (FSSI).

L’IRD vient aussi de publier un communiqué plus succinct.

Ce n’est pas la première institution de recherche française à subir un incident de ce genre cette année. En effet, le CNRS a fait part en février dernier d’une fuite de données concernant les personnels recrutés avant le 1/1/2007.

Apple Music va étiqueter la musique IA

Apple Music va étiqueter les morceaux générés par IA d’ici la fin de l’année. Le service de streaming a prévenu ses partenaires de la filière via un courriel obtenu par Billboard. Les chansons signalées comme « largement générées à l’aide de l’IA » par les maisons de disques et les distributeurs auront droit un tag « Made With AI ».

En mars, la plateforme d’Apple avait dévoilé son système de signalement « AI Transparency Tags », par lequel les fournisseurs de musique doivent indiquer quand et où l’IA a été utilisée de manière « significative » – dans la création des visuels par exemple, ou encore le clip vidéo, la composition ou la chanson. « Tout contenu provenant principalement d’un service d’IA générative », précise le courriel.

Ces informations, qui permettront à Apple Music d’identifier les contenus concernés, devront obligatoirement être fournies par les distributeurs. Et si certains ne jouent pas le jeu ? Olivier Schusser, le directeur du service, expliquait à Billboard en avril qu’Apple avait développé une technologie qui permet de « savoir précisément quel type de musique nous est envoyé, quel modèle d’IA a été utilisé ».

Apple pourrait donc aisément mettre la main au collet des titres IA. Mais le responsable estimait que la responsabilité devait être portée par les fournisseurs de contenus. « Toutes les maisons de disques dans le monde nous livrent des contenus utilisant l’IA, même si elles n’en ont pas forcément conscience. Elles doivent elles aussi développer des outils pour comprendre l’ampleur de cette utilisation », déclarait-il.

La musique générée par IA ne représente que 0,5 % des écoutes sur Apple Music, a indiqué Olivier Schusser. En revanche, plus d’un tiers des chansons téléversées sur les serveurs de la plateforme est généré par IA. Apple Music rejoint ainsi Deezer, Tidal et Spotify dans le signalement des morceaux IA.

Flock : un été à la française

Avec tout ce qui s’est passé : plus de mal que de peur, comme on dit…