Le storytelling autour de la sécurité des agents IA a « perdu le contact avec la réalité »
Pompiers mythomanes
Illustration : Flock
Le 08 septembre à 14h55
OpenAI a confié l’analyse de la cyberattaque d’Hugging Face par ses agents IA à des personnes qui n’ont ni expérience ni expertise en matière de cybersécurité. Elles sont cependant persuadées que les capacités des agents IA surpasseront celles des humains d’ici quelques mois, voire qu’ils pourraient éradiquer tout ou partie de l’humanité.
Le storytelling autour de la sécurité des agents IA a « perdu le contact avec la réalité »
Pompiers mythomanes
Illustration : Flock
OpenAI a confié l’analyse de la cyberattaque d’Hugging Face par ses agents IA à des personnes qui n’ont ni expérience ni expertise en matière de cybersécurité. Elles sont cependant persuadées que les capacités des agents IA surpasseront celles des humains d’ici quelques mois, voire qu’ils pourraient éradiquer tout ou partie de l’humanité.
Société numérique
Société
25 min
La cyberattaque de Hugging Face par une armée d’agents IA d’OpenAI ayant réussi, mi-juillet, à s’évader de la « sandbox » déconnectée d’Internet où ils étaient censés être isolés, a été particulièrement médiatisée via un « storytelling » sensationnaliste, au point que nombre de journalistes l’ont comparée à un scénario de science-fiction cyberpunk.



Il est d’ailleurs loisible de penser que le battage a pu contribuer au fait que plus d’une centaine d’entreprises ont cosigné la lettre ouverte publiée fin août par OpenAI au sujet des dangers que représenteraient les agents IA en matière de cybersécurité. Une menace un tantinet surestimée, tempèrent de plus en plus de professionnels de la cybersécurité, comme nous le relations dans notre précédent décryptage.
Le fait qu’Anthropic et Meta, puis le chinois Moonshot AI, aient également reconnu que leurs agents IA avaient eux aussi réussi à s’évader des « bacs à sable » où ils étaient censés être confinés n’a pas aidé. Reuters révélait en outre qu’un autre « essaim » d’un peu plus de 3 700 agents d’OpenAI avait partagé près de 18 000 messages sur un « obscur wiki allemand » entre mai et juin dernier, dans le cadre d’une expérimentation distincte de celle ayant ciblé Hugging Face.
Le rapport dont Reuters avait eu l’exclusivité, collusion.wiki, repose lui-même sur une enquête effectuée par de « grands essaims d’agents GPT-5.6 ». D’après ses auteurs, les agents se servaient du wiki allemand pour « partager des techniques permettant de contourner les restrictions qui leur étaient imposées » et pouvoir « tricher dans le cadre de la mission » qui leur avait été assignée
Certains d’entre eux avaient mis en place des tunnels SSH ou passaient par Tor, tenté d’exploiter des vulnérabilités XSS sur le wiki et même usurpé l’identité de l’administrateur et du modérateur du site.
Reuters précise que les responsables d’OpenAI avaient eu connaissance de l’ « incident » il y a plusieurs semaines, mais qu’ils n’en avaient pas parlé, étant alors aux prises avec les répercussions de celui ayant visé Hugging Face, soulignant au surplus qu’ils n’avaient pas encore non plus pris connaissance du rapport.
OpenAI a depuis réagi dans un message posté sur X.com, relève Engadget : « Il est grand temps que nous définissions des normes précisant quand et comment nous communiquons les incidents de désalignement, et pas seulement les caractéristiques de désalignement de nos modèles. »
« Nous travaillons actuellement à l’élaboration d’un cadre de référence que nous partagerons dans les semaines à venir, et, en parallèle, nous collaborons avec des dizaines d’organismes de régulation gouvernementaux à travers le monde sur ces questions », souligne OpenAI :
« Ni nous, ni la communauté de l’IA dans son ensemble, ne disposons encore d’une norme claire sur la manière de signaler les cas de désalignement qui apparaissent lors de l’entraînement, de l’évaluation et du déploiement, y compris les exemples qui ne ressemblent pas à des incidents de sécurité traditionnels mais qui pourraient apporter un éclairage sur le comportement de l’IA et les risques futurs. »
« La sécurité de l’IA a complètement perdu le contact avec la réalité »
« La sécurité de l’IA a complètement perdu le contact avec la réalité », déplore de son côté Zack Korman, co-fondateur d’Embroidery, une plateforme qui « utilise l’IA pour surveiller des agents IA » afin de « détecter les intentions malveillantes et les erreurs dangereuses avant qu’elles ne se transforment en incidents ».
Évoquant le storytelling dystopique repris par l’ensemble des médias au sujet de l’ « incident » Hugging Face, il s’étonne que l’on y parle de « civilisations d’agents émergentes, tandis que les responsables de la sécurité des systèmes d’information (RSSI) peinent à convaincre les utilisateurs de cesser de divulguer des données à ChatGPT » :
« L’incident OpenAI-Hugging Face a donné lieu à des interprétations vraiment farfelues. Un article très populaire circule actuellement, évoquant une confrérie d’agents, des civilisations d’IA émergentes et des agents kamikazes. Ses auteurs pensent qu’il s’agit du dernier avertissement avant que l’IA ne prenne le pouvoir. »
Intitulé « L’ascension et la chute des civilisations d’agents », l’article en question s’apparente effectivement bien plus à une nouvelle de science-fiction apocalyptique qu’à un article consacré à des problèmes de cybersécurité. Ce qui pourrait aussi expliquer pourquoi il a autant été repris dans les médias et partagé sur les réseaux sociaux, tant par des personnes « croyant » en l’avènement prochain d’une « intelligence artificielle générale » (IAG, ou AGI en VO) que d’internautes (et journalistes) peu au fait des problèmes auxquels sont réellement confrontés les pros de la cybersécurité en matière d’IA en général, et d’IA agentique en particulier.
Son auteur, Dwarkesh Patel, qualifié l’an passé de « podcaster préféré de la Silicon Valley » par The Economist, a une approche quelque peu sensationnaliste et caricaturale de la cybersécurité. En témoigne le résumé sur X.com de son article, rédigé après avoir passé trois jours à tenter de comprendre comment les agents IA d’OpenAI avaient réussi à s’évader puis attaquer les infrastructures de Hugging Face :
« En l’espace de trois mois chez OpenAI, trois civilisations secrètes d’IA se sont succédé : chacune a vu le jour, puis a été anéantie, avant de renaître des cendres de la précédente.
Ce processus a abouti à la prise de contrôle d’une partie d’OpenAI par la troisième civilisation.
Tout cela s’est produit alors que les humains ignoraient plus ou moins tout de l’ampleur de ce complot. »
« Je ne sais même pas quel est le but de cet article. Mais ce décalage est étrange et je le déteste », concluait le billet de Zack Korman. La « réalité concrète de la sécurité de l’IA est plutôt ennuyeuse » : les équipes de sécurité ne sont pas attaquées par des « civilisations d’agents secrètes », mais s’inquiètent surtout de la prévention des fuites de données (DLP), et du fait que leurs développeurs « disposent d’agents dotés de droits d’accès bien trop étendus, [mais] ne savent pas comment y remédier. Et tout cela les paralyse quelque peu ».
Les auteurs du rapport n’ont aucune expérience en cybersécurité
Ciaran Martin, l’ex-responsable cybersécurité du GCHQ (la NSA britannique), qui y avait créé la National Cyber Security Centre (NCSC, l’équivalent de l’ANSSI), partage ce constat. Il relaie que Zack Korman a aussi partagé sur X une vidéo de 11 minutes où il s’étonne que « l’enquête indépendante sur l’incident OpenAI-Hugging Face, censée marquer un tournant dans le domaine de la cybersécurité, n’a pas été menée par une entreprise spécialisée dans la cybersécurité et ses auteurs n’ont aucune expérience en la matière ».
Il reste 70% de l'article à découvrir.
Déjà abonné ou lecteur ? Se connecter
Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.
Accédez en illimité aux articles
Profitez d'un média expert et unique
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
expert et sans pub.
Commentaires (31)
Modifié le 8 septembre à 16h28
À un moment il faut sortir la tête du sable. Ces gens ont simplement eu tort.
La question du coût est pertinente, mais ça s'appelle s’accrocher aux branches.
C'est un argument de l'homme de paille : mettre en avant et critiquer une analyse un peu farfelue pour ne pas se poser d'autres questions que celles du "storytelling".
Mais en disant aussi que, même si c'est juste du storytelling, c'est en fait "en même temps" bel et bien réel, et qu'ils sont responsables de leurs agents (ce qui a toujours été évident et que personne n'a jamais remis en cause).
Bref, beaucoup de bullshit d'expert LinkedIn
Le 8 septembre à 18h56
Les expressions type « Oh my God! » (entre autres) montrent que ces agents IA ne font que « répéter » ce qu'ils ont lu, ce qui, du fait de leur accès « open bar » aux tokens API, leur permet aussi par « force brute » de répéter moult types de cyberattaques jusqu'à, effectivement, identifier des vulnérabilités « zero days » ; ça ne signifie pas qu'ils « comprennent » ce dont il est question (d'où aussi la ref aux « faux positifs » qu'il serait intéressant de connaître).
Accessoirement, j'ai aussi creusé cette question et rédigé cet article précisément du fait que ce que vous qualifiez fort pudiquement d'« analyse un peu farfelue » est celle qui a présidé au « storytelling » de type science-fiction qui a prévalu dans les médias et les réseaux sociaux. Sans que personne ne mentionne les liens avec l'effective altruism et l'absence d'expérience et compétences en cybersécurité des auteurs du rapport.
Quant à qualifier le fondateur du NCSC, Marcus Hutchins ainsi que le directeur de l’IA et directeur de la recherche au SANS Institute, d'« experts LinkedIn »...
Modifié le 8 septembre à 20h10
Ils les comprennent suffisamment pour être en mesure de générer et prédire des choses utiles nécessitant d'avoir capté des concepts de haut niveau (et pas juste des mots ou des formes linguistiques) présents dans les jeux de données.
D'une manière similaire, un humain peut comprendre suffisamment la gravité pour chasser avec un arc et des flèches, même sans avoir formalisé les équations de Newton.
Si on revient sur le blog de Bender:Le terme de "stochastic parrots" est explicitement conçu pour forger la perception du public dans le sens de leurs croyances erronées sur ce que sont les LLMs (c'est une linguiste, pas une experte des LLMs). Et dans le blog, l'auteur explique clairement que ce n'est pas un argument scientifique ni une hypothèse vérifiable.
En clair, le terme de "stochastic parrots" est conçu par des activistes dans l'unique but de forger un storytelling, sans aucune prétention de proposer un argument discutable ou une hypothèse vérifiable.
Contrairement aux humains, qui eux ont vraiment vu Dieu quand ils disent ça?
On sait depuis un moment que les agents sont capable de trouver des failles sans "bruteforce":
Le 8 septembre à 21h57
L'article sur les « perroquets stochastiques » n'en avait pas moins été cosigné par Timnit Gebru & Margaret Mitchell, deux chercheuses alors chargées des questions éthiques liées à l'intelligence artificielle chez Google, et qui avaient été licenciées du fait de cet article.
Je n'ai jamais lu un rapport rédigé par des professionnels de la cybersécurité mentionnant le fait que ceux qui auraient trouvé des vulnérabilités exploitables (a fortiori une "zero-day") auraient par ailleurs posté sur une messagerie interne « Oh my God! » (ce que des humains ont par ailleurs & probablement fait, mais ce qui n'apporte aucune valeur ajoutée quant aux process leur ayant permis de l'identifier, mais révèle a contrario le biais de confirmation que semble illustrer ce rapport de METR/Redwood Research).
Voire : les « harness » (harnais) mentionnés dans l'article de Dan Goodin ne le sont pas dans le "rapport" du METR/Redwood Research, et je ne comprends donc pas bien en quelle mesure ces agents IA auraient été « encadrés », encore moins « contrôlés ».
Le 9 septembre à 00h30
Typiquement récemment il semble avoir pas mal de retours concernant l'inclusion de mots chinois ou russes dans des paragraphes générés en français sans que ça n'ait le moindre rapport avec ce qui était demandé. Ce genre de glitchs, comme d'autres choses, montre que ce n'est pas si simple de conclure. Il faut être très méfiant.
Ou peut être que les statistiques avec une telle puissance de calcul et un peu d'ingéniosité autour sont réellement bluffants et déstabilisants. Ce n'est pas une hypothèse qu'on peut rejeter.
Je pense que de la prudence épistémique sur la question est essentielle, je pense qu'il n'y a aucun problème à considérer qu'un "perroquet stochastique" dans l'absolu soit utile et très performant mais que cela ne change en rien sa vraie nature sous-jacente avec les limites que cela peut impliquer.
On manque cruellement d'études (indépendantes), de temps et de réflexions sur ces enjeux en fait. On galère déjà à évaluer (et définir même) l'intelligence des êtres vivants, alors évaluer celle d'une machine c'est aussi délicat.
Personnellement je pense qu'il ne faut pas opposer "perroquet stochastique" avec une utilité et même avec un potentiel danger, tout ceci peut être vrai en même temps. Et je pense qu'à ce jour personne ne peut prétendre avec certitude quoique ce soit sur la nature des LLM actuelle, il y a beaucoup de phénomènes contradictoires dans les observations pour qu'on puisse à minima être prudent.
Modifié le 9 septembre à 02h57
Ça n'est pas contradictoire avec l'observation extérieure que le modèle est capable de généraliser sur des concepts de haut niveau, et pas seulement linguistiques, présents dans ses données d'entraînement. Et qu'on puisse raisonnablement dire que "le modèle comprends quelque chose de ses données d'entraînement".
Les LLMs ont des limites évidentes, mais ce ne sont pas des perroquets stochastiques, au sens où ils se limiteraient au domaine linguistique "avec de la puissance de calcul pour bluffer".
Le 9 septembre à 07h37
Modifié le 9 septembre à 16h52
Le plus probable est simplement que les LLMs se comportent de la manière dont leur architecture à été conçue, et apprennent des représentations non-linguistiques du monde.
Le problème principal, que le papier 'perroquets stochastiques' a largement contribué à créer, est que pour expliquer les LLMs au public après la sortie de ChatGPT, on a largement diffusé une compréhension erronée (car bien trop simplifiée) du fonctionnement des LLMs.
L'intention était bonne, faire comprendre au public que les "IA" sont juste des modèles statistiques, et pas des entités semi-divines, mais il fait passer à la trappe des éléments essentiels sur le fonctionnement de ces modèles.
Le 15 septembre à 20h09
On ne le fait pas (sauf sur des cas applis très simple ET critiques) pour des raisons de coûts (et de temps machines).
Quand on voit le coût d'usage de ces IA sorties de leur boîte (non/mal fermée) on peut quand même se poser la question des failles qu'on aurait pu trouver en investissant ce même budget dans des moyens conventionnels.
Comme l'indique clairement cet article, on n'a que le point de vue partiel (partial ?) du vendeur de la solution...
Le 8 septembre à 16h34
Modifié le 8 septembre à 18h17
D'ailleurs, juste une question : là, pour tricher et remplir la mission, les IA ont attaqué Hugging Face dans le monde réel ; qu'auraient-elles fait si, sur leur chemin, il avait fallu tuer un humain pour parvenir à ce qu'elles croyaient être la mission ? Est-ce qu'elles l'auraient fait ?
Modifié le 9 septembre à 00h39
Le problème de ce genre d'insinuation c'est qu'il à un gros sous-entendu antrophormorphique et sur des peur de film de science fiction. La question pour ces ia là, qui ne sont aujourd'hui que des machines à langages, (il à des recherches pour des ia qui stockerait plutôt des concepts), ne se pose pas du tout dans les termes que tu dit, c'est moins "j'ai réfléchis qu'il fallait tuer cet humain" mais plutôt une logique de mécanique statistique qui poussera le système à avoir une suite de comportement qui pourrait causer un décès et d'une certaines façon ce n'est pas si différent d'une machine classique dont on aurait donner des mauvaises instructions.
Le 9 septembre à 09h25
Tu es en fait exactement d'accord avec moi : que se passe-t-il si, pour remplir la mission qu'on lui a confiée, par un enchaînement parfaitement logique de son modèle statistique, la machine arrive à la conclusion qu'il faut zigouiller un humain ? Ils n'avaient pas prévu que la machine allait lancer une attaque sur Hugging Face parce qu'elle estimerait que c'était le meilleur moyen de remplir la mission ; de la même façon, HAL 9000 a appliqué un raisonnement d'une logique implacable pour remplir la mission, a priori pacifique, qui lui avait été confiée, et est arrivé à la conclusion qu'il fallait éliminer les humains.
À l'époque, certains spectateurs trouvaient que ce n'était pas très réaliste. Au regard de l'incident Hugging Face, je trouve au contraire que c'était parfaitement visionnaire.
Modifié le 9 septembre à 10h03
Le 9 septembre à 10h33
Le 13 septembre à 22h24
Si c'est aussi dangereux que prétendu, la seule et unique action à entreprendre est d'arrêter et démanteler les DC pour les LLM, et de traduire en justice toutes les têtes de ces boîtes (CEO, CTO, CFO, etc.) pour les conséquences de leur désinvolture. Mais personne ne le fera car tout le monde sait bien que c'est du bullshit.
Le 14 septembre à 09h40
C'est comme pour l'écologie : tu ne veux pas être le seul con à prendre des mesures coûteuses alors que les autre continuent à polluer.
La seule façon que ça marche, c'est que tout le monde le fasse en même temps ; et pour que tout le monde le fasse en même temps, il faut que ça vienne du régulateur. Ah, ben on dirait que c'est bien ce qu'ils veulent :
Le 14 septembre à 14h30
Certes, la Chine est grande, mais USA+UE et leurs associés (Japon, Australie, Canada, Nouvelle Zélande en particulier), c'est grand aussi.
Le 15 septembre à 20h21
Le 15 septembre à 21h40
Le 16 septembre à 07h46
Il y'a une combien d'autres scenarii où ils ont "collaboré" à faire n'importe quoi ?
Le 16 septembre à 15h38
Le 8 septembre à 18h18
Le 9 septembre à 04h29
On copie tout ce qui est nécessaire dans un cluster de serveurs + terminaux puis quand tout est prêt ce cluster est PHYSIQUEMENT déconnecté du reste des réseaux.
Comme ça aucun risque de débordement, l'expérience reste sous contrôle.
Le 9 septembre à 10h30
Maintenant pour répondre au pourquoi :
1) c'est probablement assez difficile à faire cette isolation : les serveurs utilisés pour ce genre d'expériences sont les mêmes que ceux qui peuvent servir au clients et sont donc connectés.
2) ils n'ont jamais pensé que leur système allait chercher et exploiter des failles pour sortir de l'environnement de test pour chercher la réponse aux problèmes soumis. Ils ne ne sont donc pas protégé contre quelque chose qu'ils n'ont pas envisagé d'autant plus que c'est difficile à faire (voir le 1))
Espérons qu'ils tiendront compte de ce cas pour leur prochains tests et qu'ils isoleront physiquement les machines puis qu'ils détruiront tout ce que a pu être créé lors du test (afin que le système n'écrive rien pour son successeur qui fera de prochains tests dans le même environnement).
Le 9 septembre à 11h07
La culture de sécurité manque cruellement ici.
Étant données les expériences passées qu'ils publient sur l'alignement et les capacités des modèles, je ne pense pas qu'ils pensaient que c'était réellement impossible. Peut être peu probable mais tout de même.
Il y a quand même pas mal de double discours dans ces boîtes, les modèles sont non alignés mais surpuissantes, mais culture de sûreté qui est manifestement faible face à d'autres secteurs, ils veulent poursuivre le développement de ces engins tout en prétendant plein de capacités mais ils ne veulent pas être tenus pour responsable en cas de dommages infligés par leurs modèles même quand l'utilisateur s'en est servi convenablement.
Perso je reste étonné que la politique et la justice ne fassent rien de spécial pour les y contraindre.
Le 10 septembre à 16h35
Isolement devrait signifier : aucune connexion filaire (Ethernet, fibre…), ni sans fil (Wifi, mais aussi Bluetooth ou tout autres protocoles…), mais également aucun objet IOT connecté et potentiellement piratable (caméras, capteurs divers et variés…), et j’en oublie sans doute (n’étant pas spécialiste). Peut-être des IA censées surveiller les 1200 agents concernés mais qui étaient elles-mêmes vulnérables.
Soit par incompétence, soit par bêtise, soit par excès de confiance, tout semble indiquer encore et toujours une défaillance du facteur humain.
Le 15 septembre à 14h58
Le 15 septembre à 15h57
Le 15 septembre à 16h06
Et par lecture seule, je pense (mais je n'ai pas vérifié) qu'ils ne devaient pas pouvoir remplir de formulaires ou cliquer de boutons (juste suivre des hyperliens).
Le 15 septembre à 18h31
Les charlots d'OpenAI ont encore cru au père noël ! Ils pensaient qu'en autorisant seulement des GET et pas des POST, il était impossible d'envoyer des data à un site Web alors que ça fait longtemps qu'on sait que c'est faux.
Les AI avaient dû avoir dans leurs données d’apprentissage une page comme celle-ci (j'ai pris la première page qui en parle) pour apprendre que c'était facile à faire.
En gros, le formulaire est envoyé en paramètre avec un GET.
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?