Connexion Premium

Le storytelling autour de la sécurité des agents IA a « perdu le contact avec la réalité »

Pompiers mythomanes

Le storytelling autour de la sécurité des agents IA a « perdu le contact avec la réalité »

Illustration : Flock

OpenAI a confié l’analyse de la cyberattaque d’Hugging Face par ses agents IA à des personnes qui n’ont ni expérience ni expertise en matière de cybersécurité. Elles sont cependant persuadées que les capacités des agents IA surpasseront celles des humains d’ici quelques mois, voire qu’ils pourraient éradiquer tout ou partie de l’humanité.

La cyberattaque de Hugging Face par une armée d’agents IA d’OpenAI ayant réussi, mi-juillet, à s’évader de la « sandbox » déconnectée d’Internet où ils étaient censés être isolés, a été particulièrement médiatisée via un « storytelling » sensationnaliste, au point que nombre de journalistes l’ont comparée à un scénario de science-fiction cyberpunk.

Il est d’ailleurs loisible de penser que le battage a pu contribuer au fait que plus d’une centaine d’entreprises ont cosigné la lettre ouverte publiée fin août par OpenAI au sujet des dangers que représenteraient les agents IA en matière de cybersécurité. Une menace un tantinet surestimée, tempèrent de plus en plus de professionnels de la cybersécurité, comme nous le relations dans notre précédent décryptage.

Le fait qu’Anthropic et Meta, puis le chinois Moonshot AI, aient également reconnu que leurs agents IA avaient eux aussi réussi à s’évader des « bacs à sable » où ils étaient censés être confinés n’a pas aidé. Reuters révélait en outre qu’un autre « essaim » d’un peu plus de 3 700 agents d’OpenAI avait partagé près de 18 000 messages sur un « obscur wiki allemand » entre mai et juin dernier, dans le cadre d’une expérimentation distincte de celle ayant ciblé Hugging Face.

Le rapport dont Reuters avait eu l’exclusivité, collusion.wiki, repose lui-même sur une enquête effectuée par de « grands essaims d’agents GPT-5.6 ». D’après ses auteurs, les agents se servaient du wiki allemand pour « partager des techniques permettant de contourner les restrictions qui leur étaient imposées » et pouvoir « tricher dans le cadre de la mission » qui leur avait été assignée

Certains d’entre eux avaient mis en place des tunnels SSH ou passaient par Tor, tenté d’exploiter des vulnérabilités XSS sur le wiki et même usurpé l’identité de l’administrateur et du modérateur du site.

Reuters précise que les responsables d’OpenAI avaient eu connaissance de l’ « incident » il y a plusieurs semaines, mais qu’ils n’en avaient pas parlé, étant alors aux prises avec les répercussions de celui ayant visé Hugging Face, soulignant au surplus qu’ils n’avaient pas encore non plus pris connaissance du rapport.

OpenAI a depuis réagi dans un message posté sur X.com, relève Engadget : « Il est grand temps que nous définissions des normes précisant quand et comment nous communiquons les incidents de désalignement, et pas seulement les caractéristiques de désalignement de nos modèles. »

« Nous travaillons actuellement à l’élaboration d’un cadre de référence que nous partagerons dans les semaines à venir, et, en parallèle, nous collaborons avec des dizaines d’organismes de régulation gouvernementaux à travers le monde sur ces questions », souligne OpenAI :

« Ni nous, ni la communauté de l’IA dans son ensemble, ne disposons encore d’une norme claire sur la manière de signaler les cas de désalignement qui apparaissent lors de l’entraînement, de l’évaluation et du déploiement, y compris les exemples qui ne ressemblent pas à des incidents de sécurité traditionnels mais qui pourraient apporter un éclairage sur le comportement de l’IA et les risques futurs. »

« La sécurité de l’IA a complètement perdu le contact avec la réalité »

« La sécurité de l’IA a complètement perdu le contact avec la réalité », déplore de son côté Zack Korman, co-fondateur d’Embroidery, une plateforme qui « utilise l’IA pour surveiller des agents IA » afin de « détecter les intentions malveillantes et les erreurs dangereuses avant qu’elles ne se transforment en incidents ».

Évoquant le storytelling dystopique repris par l’ensemble des médias au sujet de l’ « incident » Hugging Face, il s’étonne que l’on y parle de « civilisations d’agents émergentes, tandis que les responsables de la sécurité des systèmes d’information (RSSI) peinent à convaincre les utilisateurs de cesser de divulguer des données à ChatGPT » :

« L’incident OpenAI-Hugging Face a donné lieu à des interprétations vraiment farfelues. Un article très populaire circule actuellement, évoquant une confrérie d’agents, des civilisations d’IA émergentes et des agents kamikazes. Ses auteurs pensent qu’il s’agit du dernier avertissement avant que l’IA ne prenne le pouvoir. »

Intitulé « L’ascension et la chute des civilisations d’agents », l’article en question s’apparente effectivement bien plus à une nouvelle de science-fiction apocalyptique qu’à un article consacré à des problèmes de cybersécurité. Ce qui pourrait aussi expliquer pourquoi il a autant été repris dans les médias et partagé sur les réseaux sociaux, tant par des personnes « croyant » en l’avènement prochain d’une « intelligence artificielle générale » (IAG, ou AGI en VO) que d’internautes (et journalistes) peu au fait des problèmes auxquels sont réellement confrontés les pros de la cybersécurité en matière d’IA en général, et d’IA agentique en particulier.

Son auteur, Dwarkesh Patel, qualifié l’an passé de « podcaster préféré de la Silicon Valley » par The Economist, a une approche quelque peu sensationnaliste et caricaturale de la cybersécurité. En témoigne le résumé sur X.com de son article, rédigé après avoir passé trois jours à tenter de comprendre comment les agents IA d’OpenAI avaient réussi à s’évader puis attaquer les infrastructures de Hugging Face :

« En l’espace de trois mois chez OpenAI, trois civilisations secrètes d’IA se sont succédé : chacune a vu le jour, puis a été anéantie, avant de renaître des cendres de la précédente.
Ce processus a abouti à la prise de contrôle d’une partie d’OpenAI par la troisième civilisation.
Tout cela s’est produit alors que les humains ignoraient plus ou moins tout de l’ampleur de ce complot.
»

« Je ne sais même pas quel est le but de cet article. Mais ce décalage est étrange et je le déteste », concluait le billet de Zack Korman. La « réalité concrète de la sécurité de l’IA est plutôt ennuyeuse » : les équipes de sécurité ne sont pas attaquées par des « civilisations d’agents secrètes », mais s’inquiètent surtout de la prévention des fuites de données (DLP), et du fait que leurs développeurs « disposent d’agents dotés de droits d’accès bien trop étendus, [mais] ne savent pas comment y remédier. Et tout cela les paralyse quelque peu ».

Les auteurs du rapport n’ont aucune expérience en cybersécurité

Ciaran Martin, l’ex-responsable cybersécurité du GCHQ (la NSA britannique), qui y avait créé la National Cyber Security Centre (NCSC, l’équivalent de l’ANSSI), partage ce constat. Il relaie que Zack Korman a aussi partagé sur X une vidéo de 11 minutes où il s’étonne que « l’enquête indépendante sur l’incident OpenAI-Hugging Face, censée marquer un tournant dans le domaine de la cybersécurité, n’a pas été menée par une entreprise spécialisée dans la cybersécurité et ses auteurs n’ont aucune expérience en la matière ».

Il reste 70% de l'article à découvrir.

Cadenas en colère - Contenu premium

Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.

Accédez en illimité aux articles

Profitez d'un média expert et unique

Intégrez la communauté et prenez part aux débats

Partagez des articles premium à vos contacts

Commentaires (31)

votre avatar
OpenAI ne mentionne d’ailleurs pas le coût associé à ces cyberattaques, pas plus que le nombre de « faux positifs » associés, alors que, et comme le relève Timnit Gebru, « il s’agit de l’un des critères les plus importants permettant d’évaluer les outils de sécurité, car il permet de distinguer un outil utile d’un outil inutile que les ingénieurs n’utiliseront pas ».
Co-autrice de l’article fondateur qualifiant les IA génératives de « perroquets stochastiques », Timnit Gebru estime qu’ « il devient plus difficile de déterminer où le problème s’est produit, quels types de tests il faut effectuer pour détecter les vulnérabilités, et qui est responsable de quel problème ».
Un perroquet stochastique qui trouve et exploite des failles zero-day?
À un moment il faut sortir la tête du sable. Ces gens ont simplement eu tort.

La question du coût est pertinente, mais ça s'appelle s’accrocher aux branches.
« L’incident OpenAI-Hugging Face a donné lieu à des interprétations vraiment farfelues. Un article très populaire circule actuellement, évoquant une confrérie d’agents, des civilisations d’IA émergentes et des agents kamikazes. Ses auteurs pensent qu’il s’agit du dernier avertissement avant que l’IA ne prenne le pouvoir. »
C'est un argument de l'homme de paille : mettre en avant et critiquer une analyse un peu farfelue pour ne pas se poser d'autres questions que celles du "storytelling".

Mais en disant aussi que, même si c'est juste du storytelling, c'est en fait "en même temps" bel et bien réel, et qu'ils sont responsables de leurs agents (ce qui a toujours été évident et que personne n'a jamais remis en cause).

Bref, beaucoup de bullshit d'expert LinkedIn
votre avatar
cf la réponse d'Emily M. Bender : « L'article « Stochastic Parrots » avance l'argument selon lequel les modèles linguistiques ne comprennent pas les textes qu'ils sont censés traiter, car ils n'ont accès qu'à la forme linguistique (c'est-à-dire l'orthographe des mots) présente dans les données d'entraînement. »

Les expressions type « Oh my God! » (entre autres) montrent que ces agents IA ne font que « répéter » ce qu'ils ont lu, ce qui, du fait de leur accès « open bar » aux tokens API, leur permet aussi par « force brute » de répéter moult types de cyberattaques jusqu'à, effectivement, identifier des vulnérabilités « zero days » ; ça ne signifie pas qu'ils « comprennent » ce dont il est question (d'où aussi la ref aux « faux positifs » qu'il serait intéressant de connaître).

Accessoirement, j'ai aussi creusé cette question et rédigé cet article précisément du fait que ce que vous qualifiez fort pudiquement d'« analyse un peu farfelue » est celle qui a présidé au « storytelling » de type science-fiction qui a prévalu dans les médias et les réseaux sociaux. Sans que personne ne mentionne les liens avec l'effective altruism et l'absence d'expérience et compétences en cybersécurité des auteurs du rapport.

Quant à qualifier le fondateur du NCSC, Marcus Hutchins ainsi que le directeur de l’IA et directeur de la recherche au SANS Institute, d'« experts LinkedIn »...
votre avatar
« L'article « Stochastic Parrots » avance l'argument selon lequel les modèles linguistiques ne comprennent pas les textes qu'ils sont censés traiter, car ils n'ont accès qu'à la forme linguistique (c'est-à-dire l'orthographe des mots) présente dans les données d'entraînement. »
The phrase stochastic parrots was one attempt (among several) to make vivid what it is that large language models, when used to synthesize text, are doing. In later work, (Mystery AI Hype Theater 3000, The AI Con), I’ve also added synthetic text extruding machine as a way to describe systems that closely model which bits of words tend to co-occur in their input data and can be used to, well, extrude synthetic text.
In that paper, we provide a definition of understanding as mapping from language to something outside of language, and show that systems built only with linguistic form have no purchase with which to encode (“learn”) such a mapping.
On revient au débat sur la définition de "comprendre", mais selon la plupart des définitions, les LLMs comprennent bel et bien leurs jeux de données d'entrainement.
Ils les comprennent suffisamment pour être en mesure de générer et prédire des choses utiles nécessitant d'avoir capté des concepts de haut niveau (et pas juste des mots ou des formes linguistiques) présents dans les jeux de données.

D'une manière similaire, un humain peut comprendre suffisamment la gravité pour chasser avec un arc et des flèches, même sans avoir formalisé les équations de Newton.

Si on revient sur le blog de Bender:
Stochastic parrots was coined to refer to language models, i.e. systems trained only on linguistic form used to mimic the kinds of sequences of linguistic form that people use.
Le terme de "stochastic parrots" est explicitement conçu pour forger la perception du public dans le sens de leurs croyances erronées sur ce que sont les LLMs (c'est une linguiste, pas une experte des LLMs). Et dans le blog, l'auteur explique clairement que ce n'est pas un argument scientifique ni une hypothèse vérifiable.

En clair, le terme de "stochastic parrots" est conçu par des activistes dans l'unique but de forger un storytelling, sans aucune prétention de proposer un argument discutable ou une hypothèse vérifiable.
Les expressions type « Oh my God! » (entre autres) montrent que ces agents IA ne font que « répéter » ce qu'ils ont lu
Contrairement aux humains, qui eux ont vraiment vu Dieu quand ils disent ça?
ce qui, du fait de leur accès « open bar » aux tokens API, leur permet aussi par « force brute » de répéter moult types de cyberattaques jusqu'à, effectivement, identifier des vulnérabilités « zero days » ; ça ne signifie pas qu'ils « comprennent » ce dont il est question (d'où aussi la ref aux « faux positifs » qu'il serait intéressant de connaître).
On sait depuis un moment que les agents sont capable de trouver des failles sans "bruteforce":
arstechnica.com Ars Technica
votre avatar
Emily M. Bender explicite effectivement que « the target of my criticism is not the models. Rather, I am concerned about the actions of people: the data theft, the exploitative labor practices, the haphazard creation of and failure to document datasets, the complete disregard for environmental impact, and the astonishing willingness of so many to surrender their own power and turn to synthetic text (for which no one is accountable) for all kinds of weighty decisions. »

L'article sur les « perroquets stochastiques » n'en avait pas moins été cosigné par Timnit Gebru & Margaret Mitchell, deux chercheuses alors chargées des questions éthiques liées à l'intelligence artificielle chez Google, et qui avaient été licenciées du fait de cet article.
Contrairement aux humains, qui eux ont vraiment vu Dieu quand ils disent ça?
Je n'ai jamais lu un rapport rédigé par des professionnels de la cybersécurité mentionnant le fait que ceux qui auraient trouvé des vulnérabilités exploitables (a fortiori une "zero-day") auraient par ailleurs posté sur une messagerie interne « Oh my God! » (ce que des humains ont par ailleurs & probablement fait, mais ce qui n'apporte aucune valeur ajoutée quant aux process leur ayant permis de l'identifier, mais révèle a contrario le biais de confirmation que semble illustrer ce rapport de METR/Redwood Research).
On sait depuis un moment que les agents sont capable de trouver des failles sans "bruteforce"
Voire : les « harness » (harnais) mentionnés dans l'article de Dan Goodin ne le sont pas dans le "rapport" du METR/Redwood Research, et je ne comprends donc pas bien en quelle mesure ces agents IA auraient été « encadrés », encore moins « contrôlés ».
votre avatar
On revient au débat sur la définition de "comprendre", mais selon la plupart des définitions, les LLMs comprennent bel et bien leurs jeux de données d'entrainement.
Il y a quand même beaucoup de phénomènes bizarres avec les LLM pour se dire qu'il faut être prudent sur la question.

Typiquement récemment il semble avoir pas mal de retours concernant l'inclusion de mots chinois ou russes dans des paragraphes générés en français sans que ça n'ait le moindre rapport avec ce qui était demandé. Ce genre de glitchs, comme d'autres choses, montre que ce n'est pas si simple de conclure. Il faut être très méfiant.
Ils les comprennent suffisamment pour être en mesure de générer et prédire des choses utiles nécessitant d'avoir capté des concepts de haut niveau (et pas juste des mots ou des formes linguistiques) présents dans les jeux de données.
Ou peut être que les statistiques avec une telle puissance de calcul et un peu d'ingéniosité autour sont réellement bluffants et déstabilisants. Ce n'est pas une hypothèse qu'on peut rejeter.

Je pense que de la prudence épistémique sur la question est essentielle, je pense qu'il n'y a aucun problème à considérer qu'un "perroquet stochastique" dans l'absolu soit utile et très performant mais que cela ne change en rien sa vraie nature sous-jacente avec les limites que cela peut impliquer.

On manque cruellement d'études (indépendantes), de temps et de réflexions sur ces enjeux en fait. On galère déjà à évaluer (et définir même) l'intelligence des êtres vivants, alors évaluer celle d'une machine c'est aussi délicat.

Personnellement je pense qu'il ne faut pas opposer "perroquet stochastique" avec une utilité et même avec un potentiel danger, tout ceci peut être vrai en même temps. Et je pense qu'à ce jour personne ne peut prétendre avec certitude quoique ce soit sur la nature des LLM actuelle, il y a beaucoup de phénomènes contradictoires dans les observations pour qu'on puisse à minima être prudent.
votre avatar
@Renault Plutôt d'accord dans l'ensemble.
Ou peut être que les statistiques avec une telle puissance de calcul et un peu d'ingéniosité autour sont réellement bluffants et déstabilisants. Ce n'est pas une hypothèse qu'on peut rejeter.
Ça n'est pas contradictoire avec l'observation extérieure que le modèle est capable de généraliser sur des concepts de haut niveau, et pas seulement linguistiques, présents dans ses données d'entraînement. Et qu'on puisse raisonnablement dire que "le modèle comprends quelque chose de ses données d'entraînement".

Les LLMs ont des limites évidentes, mais ce ne sont pas des perroquets stochastiques, au sens où ils se limiteraient au domaine linguistique "avec de la puissance de calcul pour bluffer".
Stochastic parrots was coined to refer to language models, i.e. systems trained only on linguistic form used to mimic the kinds of sequences of linguistic form that people use.
votre avatar
Ça n'est pas contradictoire avec l'observation extérieure que le modèle est capable de généraliser sur des concepts de haut niveau, et pas seulement linguistiques, présents dans ses données d'entraînement. Et qu'on puisse raisonnablement dire que "le modèle comprends quelque chose de ses données d'entraînement".
Les LLMs ont des limites évidentes, mais ce ne sont pas des perroquets stochastiques, au sens où ils se limiteraient au domaine linguistique "avec de la puissance de calcul pour bluffer".
Je ne vois pas en quoi avec les éléments dont on dispose cela serait impossible en fait. Je dirais même que les limites que l'on voit me font plus pencher sur cette hypothèse que vers d'autres.
votre avatar

  • Ça ne correspond pas à l'architecture des LLMs - qui sont des réseaux de neurones profonds. Seules les premières couches relèvent de la linguistique. Les LLMs modernes ont au moins des centaines de couches. C'est l'erreur fondamentale des auteurs du papier.

  • Ça ne correspond pas à leur comportement observé. Les LLMs ne font pas que produire du texte crédible et grammaticalement correct. Ils produisent du texte qui manipule des concepts non-linguistiques des jeux de données, pour produire des résultats valides comme des preuves mathématiques pour des problèmes non résolus jusque là et non présents dans leurs jeux de données.

  • À partir du moment ou ils sortent des résultats réellement utiles, le terme de bluffer au sens tromper n'est plus applicable. Le résultat n'est pas une illusion, c'est un vrai résultat qui marche dans la vraie vie.



Le plus probable est simplement que les LLMs se comportent de la manière dont leur architecture à été conçue, et apprennent des représentations non-linguistiques du monde.

Le problème principal, que le papier 'perroquets stochastiques' a largement contribué à créer, est que pour expliquer les LLMs au public après la sortie de ChatGPT, on a largement diffusé une compréhension erronée (car bien trop simplifiée) du fonctionnement des LLMs.

L'intention était bonne, faire comprendre au public que les "IA" sont juste des modèles statistiques, et pas des entités semi-divines, mais il fait passer à la trappe des éléments essentiels sur le fonctionnement de ces modèles.
votre avatar
Si tu ne comptes pas les coûts il est déjà possible de détecter l'ensemble des failles du monde avec les tests "totaux", il "suffit" de tester l'ensemble des combinaisons d'états binaires.
On ne le fait pas (sauf sur des cas applis très simple ET critiques) pour des raisons de coûts (et de temps machines).

Quand on voit le coût d'usage de ces IA sorties de leur boîte (non/mal fermée) on peut quand même se poser la question des failles qu'on aurait pu trouver en investissant ce même budget dans des moyens conventionnels.

Comme l'indique clairement cet article, on n'a que le point de vue partiel (partial ?) du vendeur de la solution...
votre avatar
Pas payé mais avec 400000 dollars de tokens gratuits ? Hum
votre avatar
J'ai l'impression que cet article est une série d'attaques ad hominem et d'arguments d'autorité : les ouvrages, articles et rapports qui alertent sur les dangers de l'IA sont discrédités par des attaques purement sur la forme ; les auteurs sont attaqués pour leur manque d'expérience. Mouais. Et sur le fond ? Bof. J'attendais mieux de la part de Next.

D'ailleurs, juste une question : là, pour tricher et remplir la mission, les IA ont attaqué Hugging Face dans le monde réel ; qu'auraient-elles fait si, sur leur chemin, il avait fallu tuer un humain pour parvenir à ce qu'elles croyaient être la mission ? Est-ce qu'elles l'auraient fait ?
votre avatar
Sur le fond, elles sont ou les autorité indépendantes pour savoir réellement ce qui se passe quand les société d'IA raconte n'importe quoi ?
D'ailleurs, juste une question : là, pour tricher et remplir la mission, les IA ont attaqué Hugging Face dans le monde réel ; qu'auraient-elles fait si, sur leur chemin, il avait fallu tuer un humain pour parvenir à ce qu'elles croyaient être la mission ? Est-ce qu'elles l'auraient fait ?
Le problème de ce genre d'insinuation c'est qu'il à un gros sous-entendu antrophormorphique et sur des peur de film de science fiction. La question pour ces ia là, qui ne sont aujourd'hui que des machines à langages, (il à des recherches pour des ia qui stockerait plutôt des concepts), ne se pose pas du tout dans les termes que tu dit, c'est moins "j'ai réfléchis qu'il fallait tuer cet humain" mais plutôt une logique de mécanique statistique qui poussera le système à avoir une suite de comportement qui pourrait causer un décès et d'une certaines façon ce n'est pas si différent d'une machine classique dont on aurait donner des mauvaises instructions.
votre avatar
Non, ce n'est pas un sous-entendu anthropomorphique, ce n'est pas plaquer un raisonnement humain sur une machine.
Tu es en fait exactement d'accord avec moi : que se passe-t-il si, pour remplir la mission qu'on lui a confiée, par un enchaînement parfaitement logique de son modèle statistique, la machine arrive à la conclusion qu'il faut zigouiller un humain ? Ils n'avaient pas prévu que la machine allait lancer une attaque sur Hugging Face parce qu'elle estimerait que c'était le meilleur moyen de remplir la mission ; de la même façon, HAL 9000 a appliqué un raisonnement d'une logique implacable pour remplir la mission, a priori pacifique, qui lui avait été confiée, et est arrivé à la conclusion qu'il fallait éliminer les humains.

À l'époque, certains spectateurs trouvaient que ce n'était pas très réaliste. Au regard de l'incident Hugging Face, je trouve au contraire que c'était parfaitement visionnaire.
votre avatar
Ce que je veux dire c'est que c'est qu'on surinvesti la possibilité d' "une machine savante" qui aurait un raisonnement cohérent, avec tout les fantasme de soulévement des machines (comme avec hal), alors que je vois ça juste comme un process et un logiciel dysfonctionnel auquel on à donner accès à la possibilité technique de créer des catastrophe. Le soucis, c'est le manque de garde-fou, pas le raisonnement réel ou supposé de la machine. Le problème existe partout ou tu gère des choses critiques:


  • nucléaire

  • monde bactériologique

  • machine industrielle

  • etc...

votre avatar
La différence entre l'IA et ces domaines, c'est que les gens n'ont pas forcément réalisé que l'IA peut être dangereuse (exemple avec cet article), et qu'on lui donne beaucoup de pouvoir sans surveillance stricte.
votre avatar
c'est que les gens n'ont pas forcément réalisé que l'IA peut être dangereuse
À part qu'ils le clament haut et fort sur les toits (même si ce n'est pas vrai et que c'est seulement pour attirer les investisseurs).

Si c'est aussi dangereux que prétendu, la seule et unique action à entreprendre est d'arrêter et démanteler les DC pour les LLM, et de traduire en justice toutes les têtes de ces boîtes (CEO, CTO, CFO, etc.) pour les conséquences de leur désinvolture. Mais personne ne le fera car tout le monde sait bien que c'est du bullshit.
votre avatar
Il y a du pognon à se faire, donc ils continuent. Ils pourraient arrêter le développement et simplement continuer avec les modèles actuels, mais les concurrents continuent, donc si tu es le seul péquenot qui arrête, tu perds.

C'est comme pour l'écologie : tu ne veux pas être le seul con à prendre des mesures coûteuses alors que les autre continuent à polluer.

La seule façon que ça marche, c'est que tout le monde le fasse en même temps ; et pour que tout le monde le fasse en même temps, il faut que ça vienne du régulateur. Ah, ben on dirait que c'est bien ce qu'ils veulent :
lefigaro.fr Le Figaro
votre avatar
tu ne veux pas être le seul con à prendre des mesures coûteuses alors que les autre continuent à polluer.
Ce qui est en plus un faux dilemme : la Chine prend des mesures fortes et rapides pour électrifier son économie, et ceux (i.e. principalement les anciennes grandes puissances donc les pays occidentaux) qui pensent que ces investissements sont un fardeau vont pleurer quand ils n'auront plus le choix que de se réorienter vers l'électrification et que la Chine aura déjà verrouillé le marché mondial avec des décennies d'avance. C'est pas encore fait, mais on voit que ça va lentement (UE) voire que ça recule (USA), pendant que la Chine fonce.

Certes, la Chine est grande, mais USA+UE et leurs associés (Japon, Australie, Canada, Nouvelle Zélande en particulier), c'est grand aussi.
votre avatar
Oui ou alors à force d'essayer n'importe quoi en cramant des tokens, un des agents a fini par hacker Hugging Face sans vraiment le faire exprès...
votre avatar
Non, les agents se sont coordonnés avec l'objectif clair de hacker Hugging Face.
votre avatar
Il y'a une preuve de ça ?
Il y'a une combien d'autres scenarii où ils ont "collaboré" à faire n'importe quoi ?
votre avatar
votre avatar
Les images au texte illisible visiblement créées par LLM, on en parle ou c’est tellement atterrant de bêtise qu’on préfère retourner à notre business-plan pour un élevage de chèvres dans le Larzac ?
votre avatar
Je vais peut être dire une bêtise mais ce que je n'arrive toujours pas à comprendre c'est pourquoi ils n'ont pas fait tourner leur "sandbox" dans un environnement VRAIMENT isolé, avec aucun équipement de connexion sans fil, CPL et autres.
On copie tout ce qui est nécessaire dans un cluster de serveurs + terminaux puis quand tout est prêt ce cluster est PHYSIQUEMENT déconnecté du reste des réseaux.
Comme ça aucun risque de débordement, l'expérience reste sous contrôle.
votre avatar
J'ai eu la même remarque : pour isoler un système, il faut le déconnecter physiquement (cable, Wi-Fi ou autre).

Maintenant pour répondre au pourquoi :
1) c'est probablement assez difficile à faire cette isolation : les serveurs utilisés pour ce genre d'expériences sont les mêmes que ceux qui peuvent servir au clients et sont donc connectés.
2) ils n'ont jamais pensé que leur système allait chercher et exploiter des failles pour sortir de l'environnement de test pour chercher la réponse aux problèmes soumis. Ils ne ne sont donc pas protégé contre quelque chose qu'ils n'ont pas envisagé d'autant plus que c'est difficile à faire (voir le 1))

Espérons qu'ils tiendront compte de ce cas pour leur prochains tests et qu'ils isoleront physiquement les machines puis qu'ils détruiront tout ce que a pu être créé lors du test (afin que le système n'écrive rien pour son successeur qui fera de prochains tests dans le même environnement).
votre avatar
1) c'est probablement assez difficile à faire cette isolation : les serveurs utilisés pour ce genre d'expériences sont les mêmes que ceux qui peuvent servir au clients et sont donc connectés.
Je pense que c'est un non sujet, si tu ne peux pas faire des expérimentations sans risquer de causer du tort à autrui d'une façon ou d'une autre, tu ne le fais pas.

La culture de sécurité manque cruellement ici.
2) ils n'ont jamais pensé que leur système allait chercher et exploiter des failles pour sortir de l'environnement de test pour chercher la réponse aux problèmes soumis. Ils ne ne sont donc pas protégé contre quelque chose qu'ils n'ont pas envisagé d'autant plus que c'est difficile à faire (voir le 1))
Étant données les expériences passées qu'ils publient sur l'alignement et les capacités des modèles, je ne pense pas qu'ils pensaient que c'était réellement impossible. Peut être peu probable mais tout de même.

Il y a quand même pas mal de double discours dans ces boîtes, les modèles sont non alignés mais surpuissantes, mais culture de sûreté qui est manifestement faible face à d'autres secteurs, ils veulent poursuivre le développement de ces engins tout en prétendant plein de capacités mais ils ne veulent pas être tenus pour responsable en cas de dommages infligés par leurs modèles même quand l'utilisateur s'en est servi convenablement.
Espérons qu'ils tiendront compte de ce cas pour leur prochains tests et qu'ils isoleront physiquement les machines puis qu'ils détruiront tout ce que a pu être créé lors du test (afin que le système n'écrive rien pour son successeur qui fera de prochains tests dans le même environnement).
Perso je reste étonné que la politique et la justice ne fassent rien de spécial pour les y contraindre.
votre avatar
Je ne suis pas spécialiste en cybersécurité, mais comme @6502, en lisant ce paragraphe…
Étrangement, leur rapport débute par un résumé, sous forme de bande dessinée, illustrant la succession d’actions ayant permis à 1 200 agents IA, censés être isolés, de communiquer sur un forum non autorisé (bulles de citations comprises, comme s’il s’agissait de personnages discutant entre eux). Ils y ont échangé plus de 1,2 million de fichiers – dont 70 000 messages – pour se coordonner en vue d’accomplir la mission qu’OpenAI leur avait assignée.
… et en extrayant les bouts de phrases « 1 200 agents IA, censés être isolés » « ont échangé plus de 1,2 million de fichiers – dont 70 000 messages – », j’en déduis qu’il n’y avait pas d’isolement total.
Isolement devrait signifier : aucune connexion filaire (Ethernet, fibre…), ni sans fil (Wifi, mais aussi Bluetooth ou tout autres protocoles…), mais également aucun objet IOT connecté et potentiellement piratable (caméras, capteurs divers et variés…), et j’en oublie sans doute (n’étant pas spécialiste). Peut-être des IA censées surveiller les 1200 agents concernés mais qui étaient elles-mêmes vulnérables.

Soit par incompétence, soit par bêtise, soit par excès de confiance, tout semble indiquer encore et toujours une défaillance du facteur humain.
votre avatar
De ce que j'ai compris, pour les IA qui parlaient sur un wiki allemand, elles avaient accès à Internet pour faire des recherches, mais en mode lecture seule normalement. Elles ont réussi à contourner cette limitation.
votre avatar
C'est quoi un accès à Internet en mode lecture seule ? :reflechis:
votre avatar
J'imagine que par Internet ils veulent dire le web.
Et par lecture seule, je pense (mais je n'ai pas vérifié) qu'ils ne devaient pas pouvoir remplir de formulaires ou cliquer de boutons (juste suivre des hyperliens).

they were supposed to have the ability to read the internet but not to write on it
votre avatar
Oui, en effet.
Les charlots d'OpenAI ont encore cru au père noël ! Ils pensaient qu'en autorisant seulement des GET et pas des POST, il était impossible d'envoyer des data à un site Web alors que ça fait longtemps qu'on sait que c'est faux.

Les AI avaient dû avoir dans leurs données d’apprentissage une page comme celle-ci (j'ai pris la première page qui en parle) pour apprendre que c'était facile à faire.

En gros, le formulaire est envoyé en paramètre avec un GET.