Chez Anthropic aussi des agents IA débridés sont sortis de leur boite pour attaquer
Danger = puissance = clients
Illustration : Flock
Le 31 juillet à 18h21
Anthropic a annoncé le 30 juillet que trois incidents impliquant ses IA avaient été détectés. Chacun a impliqué une attaque distincte contre une organisation. Des informations rendues publiques dans le sillage de l’affaire liant déjà OpenAI à la compromission de Hugging Face.
Chez Anthropic aussi des agents IA débridés sont sortis de leur boite pour attaquer
Danger = puissance = clients
Illustration : Flock
Anthropic a annoncé le 30 juillet que trois incidents impliquant ses IA avaient été détectés. Chacun a impliqué une attaque distincte contre une organisation. Des informations rendues publiques dans le sillage de l’affaire liant déjà OpenAI à la compromission de Hugging Face.
IA et algorithmes
IA
11 min
Faisons d’abord un bref rappel des faits. Le 16 juillet 2026, Hugging Face publie une divulgation décrivant une intrusion détectée sur son infrastructure, causée vraisemblablement par un agent IA autonome. Le 21 juillet, OpenAI reconnaît que l’attaquant était en réalité son propre harnais d’évaluation, mobilisant une combinaison de modèles internes (GPT‑5.6 Sol) et un modèle en préversion décrit comme « plus puissant ». Les garde-fous anti-cyber avaient été volontairement réduits pour les besoins du test.
Cette infrastructure s’en est prise à Hugging Face en exploitant au moins deux vulnérabilités 0-day dans le pipeline de traitement de données, avec pour résultat une exécution de code à distance, le vol d’identifiants et l’accès à des jeux de données et services internes. En clair, une compromission. L’affaire avait révélé un « problème d’asymétrie » : Hugging Face ne pouvait pas utiliser les API commerciales des fournisseurs de LLM à cause des fameux garde-fous et avait dû se tourner vers une installation locale du modèle chinois GLM 5.2 (poids ouverts) pour mener ses propres analyses.
- Attaquée par un agent IA autonome, Hugging Face a analysé les traces avec un LLM local
- L’attaque contre Hugging Face est venue… d’OpenAI
C’est dans ce climat qu’Anthropic a annoncé, le 30 juillet, avoir mené sa propre revue rétrospective et avoir trouvé des cas « similaires ».
Triple oups
Anthropic a examiné 141 006 « runs » d’évaluation dans lesquels Claude aurait pu obtenir un accès internet. Sur cet ensemble, trois incidents distincts (impliquant six runs au total, dont quatre concernant une même organisation) ont été identifiés. Tous se sont produits dans l’environnement de test fourni par un partenaire, Irregular, une société israélienne de red-teaming en cybersécurité IA.
Cette revue a commencé le 23 juillet, deux jours après la publication d’OpenAI sur son implication dans la compromission de Hugging Face. Le même jour, des éléments suspects sont déjà trouvés. Trois incidents sont identifiés le 24 juillet et trois jours plus tard, Anthropic communique les éléments découverts à Irregular et aux organisations touchées par les incidents. Parmi elles, deux n’avaient pas détecté l’intrusion avant d’être notifiées.
Il reste 79% de l'article à découvrir.
Déjà abonné ou lecteur ? Se connecter
Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.
Accédez en illimité aux articles
Profitez d'un média expert et unique
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
expert et sans pub.
Commentaires (5)
Il y a 55 minutes
En fait, on a découvert avec l'avènement internet tout les problèmes liés au fait d'avoir des milliards de gens connectés et donc susceptibles de voir ou identifier quelque chose, genre vieux tweet compromettant, une faille de sécurité, etc.
On a vu que ça avait quand même pas mal mis le bazar, donc on s'est dit "tiens, c'est quand même cool de développer des outils qui seraient capables de démultiplier ce nombre "d'yeux" par 100 000 et de les rendre opérationnels H24".
Il y a 53 minutes
Les boîtes de la tech ne sont que des mouflets en manque d'attention, c'est d'un rasoir.
Il y a 5 minutes
Il y a 33 minutes
À l'instant
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?