Connexion Premium

Des sites d’infos usurpent mon nom et m’attribuent des citations hallucinées par IA

L'Attaque de la moussakIA géante

Des sites d’infos usurpent mon nom et m’attribuent des citations hallucinées par IA

Illustration : Flock

Un rédacteur SEO a publié dans le « magazine des professionnels de l’information stratégique » un article vraisemblablement généré par IA qui m’attribuait un « témoignage d’expert » où je recommandais une formation… que je ne connaissais pas. Mon nom vient aussi d’apparaître sur des sites GenAI créés par un dentiste roumain usurpant également la réputation de l’Electronic Frontier Foundation.

Il y a quelques semaines, une journaliste me contactait en DM pour me demander mon avis sur le diplôme d’université (DU) Analyste OSINT de l’UTT de Troyes, qui « vise à former des experts capables de rechercher, traiter, analyser et rapporter des informations issues de sources ouvertes, dans le respect de la réglementation et de l’éthique ».

Elle m’expliquait s’y être inscrite et avoir lu sur Veillemag.com, le « magazine des professionnels de l’information stratégique », que j’aurais déclaré que « ce DU répond à un besoin criant de formation structurée, alliant rigueur académique et pragmatisme opérationnel », laissant entendre que je le connaissais, et recommandais.

Une citation présentée sous l’intitulé « Témoignage d’expert » et signée « Jean-Marc Manach, journaliste et expert en OSINT » (pour Open Source INTelligence, ou renseignement de sources ouvertes). Pionnier de l’OSINT en France, j’ai effectivement été plusieurs fois interviewé à ce sujet.

 

Problème : la citation qui m’est imputée est fausse, et je ne connaissais même pas l’existence de ce diplôme d’université, que j’ai découvert lorsque la journaliste m’a contacté.

Contacté, le « rédacteur SEO » qui avait signé l’article de Veillemag.com, m’a répondu qu’il ne sait plus qui lui aurait fourni cette citation, précisant qu’« il y a plusieurs mois, je suivais des comptes osint sur LinkedIn. Sur un post. J’ai vu cette mention. »

Le fait que son « article » ne soit qu’une succession de listes à puces laisse cela dit peu de doutes quant au fait qu’il a vraisemblablement été généré par IA, et que la citation qui m’est attribuée a elle-même été « hallucinée ».

La citation en question a été effacée par la rédactrice en chef de veillemag.com après que je l’ai interrogée à ce sujet.

Reste qu’attribuer une citation « hallucinée » par IA à un journaliste spécialiste de fact-checking est une incongruité à laquelle je ne m’attendais pas. Au surplus alors que j’enquête depuis plus de deux ans sur les sites d’infos générés par IA, comme expliqué dans le dernier épisode de notre podcast Entre la chaise et le clavier.

« Il ne s’agit pas seulement de fuites. C’est une question d’architecture »

Las : deux autres sites d’infos viennent, eux aussi, d’halluciner à mon sujet. La baseline du site archyde.com est « Découvrez les vraies personnes qui se cachent derrière les gros titres », quand bien même les photos de profil de ses journalistes, censés avoir remporté des prix Pulitzer (mais qui n’existent pas), sont générées par IA :

« Chez Archyde.com, nous respectons les normes les plus strictes en matière d’intégrité journalistique. Tous nos articles font l’objet d’une vérification rigoureuse des faits et s’appuient sur des sources indépendantes. »

Récemment, un article consacré au fait qu’un « documentaire exclusif retraçant 15 ans de ministère est désormais disponible sur YouTube » (qui n’existe pas), émanant du collectif indépendant « Time to Edit » (qui n’existe pas), me présentait comme « un avocat spécialisé dans les droits numériques à La Quadrature du Net » (je suis journaliste chez Next). À l’en croire, j’aurais déclaré que cela « pourrait créer un précédent permettant de contester le secret d’État », avec des arguments pour le moins « hallucinés », mais renvoyant effectivement au RFC de l’IETF sur HTTP/1.1 :

« Il ne s’agit pas seulement de fuites. C’est une question d’architecture. Le système du ministère a été conçu pour passer inaperçu : il utilise des protocoles ouverts comme HTTP/1.1 pour les canaux de commande tout en transférant les données sensibles vers des fonctions AWS Lambda. Si les tribunaux jugent la licence valide, cela obligera l’État soit à classer rétroactivement ces données, soit à admettre que le système n’était pas conforme dès le départ. »

L’article évoque également une certaine Dr. Élise Gauthier, chercheuse en cybersécurité à l’INRIA, qui déplore une « violation tant du droit français que du droit européen », et dont une photographie sert d’illustration. Mais une recherche image inversée renvoie vers un article de Radio Canada datant de 2015 où l’on apprend qu’Élise Gauthier était en fait candidate du Bloc québécois, un parti indépendantiste et social-démocrate.

Un agrégat, généré par IA, d’infos émanant de sites eux aussi générés par IA

NewsDirectory3.com, qui « répertorie les journaux, les agences de presse, les kiosques à journaux et les médias d’information en ligne des 50 États américains », me présente quant à lui comme « chercheur en politiques technologiques chez Les Numériques » (je n’ai jamais écrit pour ce titre).

L’article, intitulé « Paramètres cachés de Samsung et d’Android pour optimiser l’autonomie de la batterie et les performances Wi-Fi », est quant à lui un agrégat d’infos émanant du média Les Numériques mais également de DroidSoft, Le Tribunal du Net, ainsi que d’un « message publié sur le forum d’assistance Samsung, vérifié par Pleine Vie », trois sites figurant dans notre base de données de sites d’infos dont les articles sont « majoritairement, voire complètement générés par IA » (GenAI).

Je ne suis bien évidemment pas le seul à me voir attribuer des fonctions et propos que je n’ai jamais tenus sur des sites GenAI. L’Electronic Frontier Foundation (EFF) pionnière des ONG de défense des libertés numériques, alertait récemment ses lecteurs au sujet du site News-USA Today, qui se présente quant à lui comme « un éditeur d’actualités indépendant axé sur un journalisme clair, précis et utile ». 

L’EFF a en effet découvert que plusieurs de ses articles mentionnent les témoignages d’experts de l’ONG qui n’existent pas :

« Qu’ont en commun Sarah Chen, Javier Morales, Caitlin Chin, Emma Rodriguez et Mikko Kopponen, tous membres du personnel de l’EFF ? D’une part, ils n’existent pas. D’autre part, ils ont tous été cités en tant qu’experts de l’EFF dans des articles publiés au cours des deux derniers mois sur un site appelé News-USA Today. »

« Il est regrettable que ce soit au public de devoir distinguer le vrai du faux »

Ironie de l’histoire, ces trois sites d’infos GenAI font partie d’une ferme de contenus (ou PBN, pour Private blog network) que nous avions déjà identifiée il y a quelques mois, parce qu’elle comporte également (au moins) trois sites GenAI en français.

Son administrateur est un dentiste roumain qui, après s’être expatrié à Dubaï, est devenu éditeur web indépendant. Il est à la tête d’un PBN de plus d’une vingtaine de sites d’infos GenAI, dans plusieurs langues, cumulant des millions de pages vues chaque mois.

L’IA générative lui a aussi permis de vibe-coder plusieurs services web divers et variés, allant d’un calculateur de risques de voyage à un calculateur de résultats scolaires de terminale (par rapport à ceux de tous les élèves de votre tranche d’âge dans toute l’Australie), en passant par un site indiquant… la date du jour.

Rappelant que « les citations erronées qui déforment nos positions nuisent à la confiance que le public et les médias réputés nous accordent », l’EFF avance que « la meilleure chose qu’un consommateur d’informations puisse faire est de consacrer un peu de temps et d’énergie à apprendre à distinguer le vrai du faux » :

« Il est regrettable que ce soit au public qu’il incombe de fournir un tel effort, mais alors que nous nous adaptons à de nouveaux outils et à une nouvelle normalité, un petit effort aujourd’hui peut s’avérer très utile à long terme. »

C’est l’occasion de rappeler que notre extension (gratuite) GenAI affiche précisément un message d’alerte lorsque ses utilisateurs consultent l’un des 15 000 sites d’infos GenAI que nous avons identifiés.

Commentaires (40)

votre avatar
Effarant. Tendance inquiétante déjà décrite par ta consœur dans ces colonnes (que je n'ai pas vue citée ici) : next.ink Next
votre avatar
C'est IA-llucinant !
votre avatar
C'est la contrepartie de la renommée. Blague à part, quelle moyen as-tu pour faire retirer tes fausses citations ? J'imagine que contacter l'éditeur du site revient à pisser dans un violon, donc ...
votre avatar
Blocage DNS, comme pour le streaming ?
votre avatar
En s'appuyant sur quel article de loi ?
votre avatar
VeilleMag a effacé la citation, mais j'ai autre chose à faire que de me battre avec le dentiste roumain.
votre avatar
VeilleMag a effacé la citation, mais j'ai autre chose à faire que de me battre avec le dentiste roumain.
Pète-lui les dents, ça l'occupera avec son métier principal :p
votre avatar
On se demande à quoi servent les sommes engagées dans l'entraînement des LLMs, les articles semblent à peine digne de SciGen.
votre avatar
"cumulant des millions de pages vues chaque mois" <= elles servent a ça ...
votre avatar
On s'en fout.
Je pense que le but n'est pas qu'ils soient lu par des humains . Le but est simplement d'exister, qu'ils soient référencés par les moteurs de recherche (donc par les scrappers IA) et générer un millionième de pouillème de dollar de pub et/ou d'affiliation Accessoirement si ça peux saper la confiance de tout le monde dans les écrits sur le net, c'est toujours ça de pris.
Pour moi c'est comme le trafic de drogue : les gens qui font ça ont une idée pour faire de l'argent (même un petit peu), ils le font, point. Ça s'arrête là. Les dégâts collatéraux, de long terme, sociétaux ou environnementaux ne sont absolument pas leur problème , d'autre géreront cela plus tard.

Il y a un défaut à l'extension de Next pour l'IA: Elle s'affiche une fois que la page est chargée.
Que l'humain devant le navigateur la lise ou pas, ça compte comme une vue.
Ca reste "rentable", même par accident.
Et si les scrappeurs sont assez malin pour être confondu avec de vrais visites, ça reste de l'argent facilement gagné.
votre avatar
L'AI Act n'interdit pas de publier du contenu généré par IA, mais de ne pas être transparent à ce sujet en le mentionnant clairement... même si c'est un chouillas plus compliqué que ça, cf Les contenus générés par IA devront être tatoués, sauf s’ils sont vérifiés par un humain.
votre avatar
Il y a un défaut à l'extension de Next pour l'IA: Elle s'affiche une fois que la page est chargée.
J'avais commencé à faire une extension qui indique a priori ce genre de site, en changeant le style des liens qui pointent vers eux, afin de clairement les identifier.

Il faudrait que je m'y replonge. J'avais "copité" les listes de l'extension de next (redflagdomains, amf). J'ai tenté de contacter seb à de nombreuses reprises quant à l'utilisation possible de la liste des sites identités par Jean-Marc, mais je n'ai jamais eu de réponse et j'ai abandonné :craint:

Aujourd'hui, j'envisage d'utiliser une liste tiers comme celle de Wikipédia (qui en plus, n'est pas lié qu'aux sites français) et qui inclut d'autres sites (les fermes à contenus "non IA", les scam, etc.).

J'envisageais aussi une liste reprenant les sites appartenant à Reworld Media, mais cela signifie donner une tournure beaucoup plus "politique" à l'extension... Et dans ce cas, pourquoi se limiter à Reworld Media ? Pourquoi pas les sites complotistes, de fake news, etc. Bref, c'est un pied dans une porte à la fois politique et qui demanderait un boulot assez conséquent.
votre avatar
Fais une liste blanche, ça ira plus vite. :fumer:
votre avatar
bonne idée. Voici la liste :

  • next.ink



no more entry
votre avatar
On n'a pas oublié ta proposition, encore merci d'ailleurs, mais elle soulève deux difficultés :


  • dans une version estampillée Next de l'extension, c'est compliqué de mon point de vue de flag (et donc d'une certaine façon de bloquer a priori) des sites avant qu'ils aient été affichés. Sans trop rentrer dans les détails, ça nous expose à des risques supplémentaires que je ne souhaite pas prendre. Si tu forkes l'extension par contre, tu fais bien ce que tu veux :p ça nous ramène d'ailleurs à la publication du code, il faudra que je reboucle avec Séb sur le sujet. Sinon, regardez du côté d'extensions déjà existantes comme uBlacklist.




  • à tort ou à raison, on ne souhaite pas rendre publique la liste des sites constituée par Jean-Marc, pour différents motifs déjà évoqués, notamment le fait qu'elle peut être utilisée pour justement améliorer l'efficacité des outils spécialisés dans la repompe d'infos média. On en partage par contre tout ou partie avec certains acteurs sélectionnés, dont Wikipédia justement.

votre avatar
Alors, j'avais déjà fait des propositions, on en avait effectivement déjà discuté. L'idée était bien de faire une extension en nom propre, pas affilié à Next. La seule "affiliation" serait la source de la donnée. Mais je ne voulais pas exploiter la source sans autorisation.

Je note juste l'absence de réponse de Seb sur le coup. Ni un oui, ni un non. Juste... pas de réponse (pourtant, je l'ai pinger sur Discord, dans les commentaires et par mail).

Et pour terminer le propos, l'idée n'était pas d'utiliser la source d'origine (la liste des domaines), mais bien d'intégrer le filtre de Bloom (donc sans un accès à la liste des domaines). Mais ça, je ne voulais pas le faire sans autorisation (par principe, même si rien ne m'empêchait de le faire en douce sans rien dire :p)
votre avatar
Seb est au four, au moulin, au lavoir et à l'usine en même temps, il lui arrive de ne pas répondre aux messages, mais promis ça n'est pas malintentionné. Hein @SébastienGavois ? :stress:
votre avatar
Je veux bien croire qu'il soit bien occupé et qu'il n'ait pas de mauvaises intentions. Mais après peut-être 3 ou 4 mois de tentatives pour le joindre sur ce sujet, j'ai juste... abandonné. Surtout que sur d'autres sujets, il répondait présent :mdr:

J'en avais tiré la conclusion (peut-être erronée) que c'était un sujet délicat sur lequel il ne souhaitait pas du tout prendre position. Mais juste ça en fait, il aurait pu me le dire et je l'aurais compris. Et c'est pas comme si je ne lui avais pas tendu une énorme perche dans ce sens dans un mail le 10 octobre 2025 ;) (j'ai les dates, les mails, tout !!! lol).

Quoi qu'il en soit, aujourd'hui, cela n'a plus vraiment d'importance. Je penche plutôt sur l'utilisation d'une liste issue de Wikipédia par exemple, où certains contenu flagué GenIA sont marqués. (mais pas autant que la liste établie par Jean-Marc à ma connaissance). Et là, pas besoin de l'avis de Next, et vous ne serez en porte-à-faux en aucune manière. Il faut juste que je trouve un peu de temps et de motivation pour le faire ;)
votre avatar
Je dirais que malheureusement il m’arrive parfois de répondre, mais ça reste un vrai problème je vous l’accorde :(
votre avatar
S'il ne répond pas, c'est que les :sm: ne sont pas suffisamment forts et fréquents pour le motiver.
Mais attention à l'accident de travail :accident:, il ne faudra pas que le manieur du dit instrument choppe une tendinite.

:pastaper: quoi que ...
votre avatar
Non, la violence ne résoudrait rien, mais par contre on pourrait p't'être le priver de VPS jusqu'à ce qu'il ait répondu à tous les messages en suspens :troll:
votre avatar
On voit déjà arriver le mécanisme de l'effondrement de l'IA. Des données corrompues qui vont alimenter les modèles de demain, qui les biaiseront encore plus.

Vraiment, l'avenir va être GEN-IA-L.
votre avatar
Oui je vois pas comment ça va tenir la route sur le long terme.
votre avatar
Concernant l'effondrement de l'IA, la recherche récente semble indiquée qu'il pourrait être évité (voir cet article ou celui-là.
votre avatar
Le problème n'est pas l'entraînement sur des données générées par IA, c'est l'entraînement sur des données de merde. Et il se trouve que les gens utiliset beaucoup l'IA pour générer ces données de merde. Ca viendrait d'humains ces données pourries que ça reviendrait au même.
votre avatar
Oui, sauf qu'on est 3 ans après la sortie de ChatGPT et qu'on voit déjà que le contenu généré est omniprésent, de façon entièrement automatisée ou semi-automatisée dans des proportions qui sont de plus en plus difficile à cerner vu la qualité du travail produit (imitation de style rédactionnel, etc.) par rapport aux premières réponses "très ChatGPT" comme on disait au début.

Même la photo de vacances dans Google Photos, espace plutôt privé, on est aujourd'hui poussés à l'éditer en 2sec pour rajouter un faux coucher de soleil, et maintenant Meta AI va inciter le truc à chaque publication pour "augmenter" tout le contenu de l'espace public.

A ce train là, la curation humaine pour l'entraînement des modèles va être impossible, ou alors elle va se limiter à des contenus ultra-subjectifs mais aux sources vérifiables, comme les communiqués de presse et les éléments produits par les lobbys.
votre avatar
Avocat du diable : n'est il pas préférable que le système se pourrisse le plus vite possible afin que le commun des mortel arrête de "s'informer" sur les réseaux soitdisantsociaux ou sur le premier résultat de recherche venu et que seules émergent les sources réputées ?
votre avatar
Vu la confiance envers les médias traditionnels en ce moment, ces derniers ne bénéficieront pas de ce pourrissement. On peut espérer au mieux un arrêt complet de s'informer par une partie de ces usagers. Je dis "au mieux" car j'imagine déjà le narratif suivant : ces sites sont tenus par des journalistes afin de nuire à l'information populaire et la réinformation. N'oubliez pas, "on ne hait jamais assez les journalistes".
votre avatar
"on ne hait jamais assez les journalistes" : c'est une citation ? (je n'en ai pas retrouvé la source)

Reste que cette "slopisation" de l'information en particulier, et du web en général, risque effectivement de contribuer à la défiance d'une bonne partie de la population envers les médias.

Pour autant, elle devrait aussi potentiellement redorer le blason des médias et journalistes qui "font le job" auprès des internautes soucieux de pouvoir s'informer auprès de sources "a priori" fiables.
votre avatar
A ma connaissance ce n'en est pas une même si certaines variantes pourraient y faire penser. Elle a été utilisée par des personnalités comme Javier Milei mais cette phrase circulait sur les réseaux sociaux bien avant. Il vaut mieux rechercher avec la version anglaise si on veut trouver un semblant de date de début : « You don’t hate journalists enough. You think you do but you don’t. ».
votre avatar
Attendre le chaos pour rétablir l'ordre, c'est la stratégie d'extrême-droite. Au contraire, il ne faudrait pas trop attendre que la démocratie pourrisse de trop si on veut garder des principes de liberté et de droits humains. La presse est comme tous les secteurs de l'économie : il est normal qu'il y ait des brebis galeuses, c'est quand une grande partie d'un secteur économique est sujet à de la merdification que ça sent mauvais pour ceux qui ont l'audace de lancer de nouvelles entreprises ou qui tentent de péréniser des entreprises saines malgré les secousses.
votre avatar
Vraiment flippant.
votre avatar
Le sous-titre réveille des souvenirs de soirées ciné-navet. Du slop avant l'heure de l'IA générative !
votre avatar
VeilleMag qui efface la citation…
Autant justement faire un papier comme Next.ink pour un retour d’expérience qui explique comment on aboutit à ça… Maintenant les archives ça se trouve facilement d’autant plus avec leur lectorat.
votre avatar
Un élément auquel je repense à la vue d'une des images de la vidéo lié et une autre image liée : la mise en avant en jaune sur les textes, y'a plus que ça.

Quasi toutes les affiches que je vois un peu partout son ainsi, les images (souvent générées par IA) aussi. Encore un truc standardisé.
votre avatar
Vivement qu'on puisse carrément bloquer les sites GenAI directement depuis AdGuard Home ...
votre avatar
votre avatar
Oh, merci !
votre avatar
Je compléterai aussi avec certaines de ces listes :
https://ublacklist.github.io/rulesets
votre avatar
C'est donc bien "mentir comme un arracheur de dents" ? (désolé, il fallait bien que quelqu'un la fasse ! ;)).