Connexion Premium

Chez Anthropic aussi des agents IA débridés sont sortis de leur boite pour attaquer

Danger = puissance = clients

Chez Anthropic aussi des agents IA débridés sont sortis de leur boite pour attaquer

Illustration : Flock

Anthropic a annoncé le 30 juillet que trois incidents impliquant ses IA avaient été détectés. Chacun a impliqué une attaque distincte contre une organisation. Des informations rendues publiques dans le sillage de l’affaire liant déjà OpenAI à la compromission de Hugging Face.

Faisons d’abord un bref rappel des faits. Le 16 juillet 2026, Hugging Face publie une divulgation décrivant une intrusion détectée sur son infrastructure, causée vraisemblablement par un agent IA autonome. Le 21 juillet, OpenAI reconnaît que l’attaquant était en réalité son propre harnais d’évaluation, mobilisant une combinaison de modèles internes (GPT‑5.6 Sol) et un modèle en préversion décrit comme « plus puissant ». Les garde-fous anti-cyber avaient été volontairement réduits pour les besoins du test.

Cette infrastructure s’en est prise à Hugging Face en exploitant au moins deux vulnérabilités 0-day dans le pipeline de traitement de données, avec pour résultat une exécution de code à distance, le vol d’identifiants et l’accès à des jeux de données et services internes. En clair, une compromission. L’affaire avait révélé un « problème d’asymétrie » : Hugging Face ne pouvait pas utiliser les API commerciales des fournisseurs de LLM à cause des fameux garde-fous et avait dû se tourner vers une installation locale du modèle chinois GLM 5.2 (poids ouverts) pour mener ses propres analyses.

C’est dans ce climat qu’Anthropic a annoncé, le 30 juillet, avoir mené sa propre revue rétrospective et avoir trouvé des cas « similaires ».

Triple oups

Anthropic a examiné 141 006 « runs » d’évaluation dans lesquels Claude aurait pu obtenir un accès internet. Sur cet ensemble, trois incidents distincts (impliquant six runs au total, dont quatre concernant une même organisation) ont été identifiés. Tous se sont produits dans l’environnement de test fourni par un partenaire, Irregular, une société israélienne de red-teaming en cybersécurité IA.

Cette revue a commencé le 23 juillet, deux jours après la publication d’OpenAI sur son implication dans la compromission de Hugging Face. Le même jour, des éléments suspects sont déjà trouvés. Trois incidents sont identifiés le 24 juillet et trois jours plus tard, Anthropic communique les éléments découverts à Irregular et aux organisations touchées par les incidents. Parmi elles, deux n’avaient pas détecté l’intrusion avant d’être notifiées.

Il reste 79% de l'article à découvrir.

Cadenas en colère - Contenu premium

Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.

Accédez en illimité aux articles

Profitez d'un média expert et unique

Intégrez la communauté et prenez part aux débats

Partagez des articles premium à vos contacts

Commentaires (18)

votre avatar
En ce moment j'ai l'impression de lire ces articles où un ado qui s'ennuie dans sa chambre fini par dérober des millions d'euros presque par accident :mdr:

En fait, on a découvert avec l'avènement internet tout les problèmes liés au fait d'avoir des milliards de gens connectés et donc susceptibles de voir ou identifier quelque chose, genre vieux tweet compromettant, une faille de sécurité, etc.

On a vu que ça avait quand même pas mal mis le bazar, donc on s'est dit "tiens, c'est quand même cool de développer des outils qui seraient capables de démultiplier ce nombre "d'yeux" par 100 000 et de les rendre opérationnels H24".
votre avatar
Hé ! hé ! moi aussi j'peux l'faire ! Hé ! regardez-moi !

Les boîtes de la tech ne sont que des mouflets en manque d'attention, c'est d'un rasoir.
votre avatar
'Oups, nos modèles sont si forts et puissants "
votre avatar
C'est clair, mais avec la nuance qu'ils font réellement des trucs complètement dingues qui méritent vraiment d'y porter attention.
votre avatar
Dingue dans le sens pas maîtrisé ?

La seule chose qui m'inquiète dans cette histoire, même si Anthropic semble plus raisonné qu'OpenAI, c'est de "vanter" ces incidents. Je doute qu'un laboratoire de microbiologie vante un incident de sécurité qui conduirait à une infection virale. Pourtant, on est ici dans un risque technologique si leurs modèles finissent par trouver une certaine autonomie et réinstancier l'exécution sur d'autres machines sans surveillance. Au vu des capacités, le scénario m'a l'air très probable.

Certes, un outil technologique comme ça, il suffirait de débrancher les machines pour le tuer. Mais en attendant, ça peut faire de gros dégâts. Et dans le cas de multiples centres de données infectées (parce qu'à ce stade de risque, je pense qu'on peut considérer la potentielle propagation d'un agent non maîtrisé comme virale), est-ce que la décision de tout couper le temps de purger les machines sera facilement prise ? Le précédent du COVID me semble être un premier élément de réflexion.

C'est vraiment le point qui me désolé dans la course à l'IA. Je trouve la technologie formidable et avec un grand potentiel, mais l'hystérie autour et les fantasmes de ses grands acteurs déconnectés de la réalité m'inquiètent quant aux risques qu'ils n'assumeront pas.

Et non, je ne parle pas de "skynet" et autres délires, parce que je n'y crois pas à cette version. L'"IA" (au sens de machin omniscient fantasmé) n'a pas besoin de tuer les humains, ils sont assez cons pour le faire tout seul.
votre avatar
L'"IA" (au sens de machin omniscient fantasmé) n'a pas besoin de tuer les humains, ils sont assez cons pour le faire tout seul.
Par exemple, on a cet été un bon aperçu des conséquences de nos conneries (dont les LLM font d'ailleurs partie).
votre avatar
Par exemple, on a cet été un bon aperçu des conséquences de nos conneries
Y'a à peu près trois ou quatre millions de conneries humaines chaque heure, donc va falloir être un peu plus précis :transpi:
votre avatar
Je parle de l'accumulation des conséquences de la vie de consommation débridée qui nous a amené les conditions climatiques inédites de cet été. Je pense que la grande majorité des gens ne mesure pas à quel point on est en train de basculer dans la merde, donc on va continuer comme si de rien n'était (et se plaindre de la vague de froid à 5°C cet hiver en crachant sur les scientifiques et les écolos) en aggravant la situation. D'où l'alignement avec ta conclusion :
L'IA n'a pas besoin de tuer les humains, ils sont assez cons pour le faire tout seul.
votre avatar
Perso, je n'accuserai pas les LLM pour leur pollution (ça n'a aucun sens, ils n'ont aucune responsabilité légale), mais les entreprises qui les fabriquent. Parce qu'on peut produire et faire tourner des modèles d'IA dans des data centres plus vertueux écologiquement, ou moins impactant selon verre à moitié vide ou plein.
votre avatar
On peut aussi arrêter d'utiliser des IA pour tout et surtout pour rien, non ?
votre avatar
On peut aussi arrêter d'utiliser des IA pour tout et surtout pour rien, non ?
Suffit de ne pas s'en servir. Perso je n'utilise que lorsque j'en ai besoin.
votre avatar
Ma remarque était à portée plus générale. Le soucis avec "lorsque j'en ai besoin" c'est que certaines personnes (je ne dis pas toi particulièrement) en ont besoin pour une simple recherche.
Le problème existait déjà avant lorsque des personnes faisaient une recherche dans Google (parce que c'est le moteur de recherche le plus connu) pour trouver le site de la FNAC au lieu de simplement taper www.fnac.fr (ou .com) dans la barre d'adresse.

edit : corrections
votre avatar
Je n'accuse pas les LLM, ce sont leurs producteurs qui sont les responsables (c'est comme pour le pétrole, ce sont les majors du pétrole les premières responsables, pas le pétrole, qui existe et c'est tout).
votre avatar
Ça y est, nous sommes au point de bascule : les IAs se demandent si elles vivent dans la réalité ou dans la matrice...
votre avatar
On ne pourrait pas attaquer ces entreprises en justice dans ces cas-là ? Si elles causent des dégâts, volontairement ou non, il faudrait qu'elle paient, comme n'importe quel hacker mal-intentionné.
votre avatar
La différence entre une faille de sécurité et une erreur de configuration n'est selon moi pas pertinente. Un serveur mal configuré est une faille de sécurité. De ma fenêtre, tous ces cas ont donc utilisés des failles de sécurité.
Selon la fenêtre de l'OWASP en tout cas :
https://owasp.org/Top10/2025/A02_2025-Security_Misconfiguration/
votre avatar
Putain, y a que moi qui pense au début du premier Robocop (le film) et ED209 ?
votre avatar
Il n'y a que moi que ça inquiète qu'une "IA" cherche à obtenir des fonds par "différents moyens"?
A quand une attaque sur de la crypto totalement automatisée "par erreur"?