Anthropic : le tatouage de Claude se niche dans le choix des mots
Au hasard des mots
Illustration : Flock
Le 17 août à 16h53
Anthropic a annoncé mercredi dernier comment il allait répondre à l’exigence de l’AI Act européen de « tatouer » les contenus générés par Claude, images comme texte. L’entreprise en était restée aux grandes lignes sans entrer dans les détails techniques pour ce qui concerne les textes. C’est désormais chose faite.
Anthropic : le tatouage de Claude se niche dans le choix des mots
Au hasard des mots
Illustration : Flock
Anthropic a annoncé mercredi dernier comment il allait répondre à l’exigence de l’AI Act européen de « tatouer » les contenus générés par Claude, images comme texte. L’entreprise en était restée aux grandes lignes sans entrer dans les détails techniques pour ce qui concerne les textes. C’est désormais chose faite.
IA et algorithmes
IA
5 min
Comment Anthropic va-t-elle se débrouiller pour intégrer un filigrane dans les textes générés par Claude ? C’est une des obligations de l’AI Act mises en œuvre le 2 août, et la page d’assistance publiée le 11 août était chiche en détails. On en sait un peu plus après la publication, en fin de semaine dernière, d’un billet de blog. Et comme on le pressentait, le modèle va insérer dans le texte généré une sorte de signature statistique, sans ajouter le moindre caractère caché.
Quand Claude est confronté à plusieurs mots pour dire la même chose, il ne choisit plus complètement au hasard : le choix sera influencé par une clé secrète et par les mots qui précèdent. Cette mécanique, basée sur SynthID-Text de Google DeepMind, crée un motif invisible pour le lecteur, mais détectable par Anthropic avec la bonne clé.
Pas de caractères cachés
L’entreprise donne cet exemple : « Aujourd’hui, il faisait froid et… ». Il est très peu probable que le mot suivant soit « sucré », en revanche, il pourrait être « gris » ou « couvert ». Dans la plupart des cas, le lecteur ne verra guère de différence entre les deux mots, le sens de la phrase restant globalement le même. Pour Anthropic, ce choix « sans grande conséquence » peut laisser un « motif » qui, répété de nombreuses fois dans les réponses de Claude, reste indétectable pour le lecteur. Par contre, « il peut être repéré par quiconque possède la clé qui permet de l’identifier ».
Dans ce cas de figure, jusque-là, Claude utilisait un générateur de nombres aléatoires pour choisir le prochain mot, ça n’est plus le cas : il se sert maintenant de cette clé et des mots précédents. Le modèle ne privilégiera pas systématiquement le mot « couvert » ou « gris » pour autant : l’un ou l’autre pourra être choisi dans une phrase en fonction des mots qui précèdent.
En examinant la succession de ces mots, il devient possible de vérifier si cela correspond aux choix que Claude aurait effectués en se servant de cette clé. Résultat : « on peut alors estimer la probabilité que le texte ait été généré par Claude ».
Anthropic l’affirme : cette technique n’affectera pas la qualité du texte généré par Claude. Un lecteur ne devrait voir aucune différence entre un texte « normal » de Claude et un autre qui contient le tatouage numérique. Lors de tests internes, aucun effet « sur le contenu, le niveau de créativité ou la lisibilité des textes » n’aurait été constaté.
Les limites de la méthode
Ce système a ses limites, reconnues par Anthropic dans son billet. D’une, ce tatouage ne permet pas de prouver à 100 % qu’un texte a été écrit par Claude : il ne sert qu’à estimer la probabilité que le modèle a rédigé le texte, ou l’a modifié. Dans le sens inverse, il n’est pas non plus possible de conclure que le texte a été entièrement rédigé par un humain, ni identifier si le texte a été généré par une autre IA (chaque entreprise utilisant ses propres clés, ou une autre méthode).
Autre faiblesse : la détection d’IA dans les textes courts est plus difficile, voire impossible. Le système repose sur une accumulation de nombreux choix de vocabulaire ; plus le texte est long, plus le signal statistique se renforce. En quelques phrases, il est difficile de parvenir à une conclusion fiable. Dans le même ordre d’idée, les passages très factuels, ou encore des calculs, du code ou une simple correction ne renverront pas de réponse certaine.
Une réécriture peut également dégrader, voire supprimer, un tatouage. Quelques modifications ne devraient pas changer fondamentalement les choses, mais une réécriture complète peut l’effacer. La popularité d’outils « gags » comme Declaude, qui réécrit un texte IA pour en générer une version en « prose naturelle » (en le moulinant dans plusieurs modèles IA), pourrait se renforcer…
L’application du filigrane ne ralentit pas la génération de texte, promet Anthropic qui parle d’« impact négligeable » ; le système ne produit pas de tokens supplémentaires. La société assure aussi qu’il est impossible de tracer l’utilisateur ni de remonter à son organisation. Une API de détection sera bientôt disponible.
Quant aux images, on sait déjà qu’elles intègrent un filigrane « content credential », un standard C2PA. De fait, tout outil compatible peut détecter une image générée par Claude (comme celui-ci), mais Anthropic proposera également une version maison.
Commentaires (1)
Abonnez-vous pour prendre part au débat
Déjà abonné ou lecteur ? Se connecter
Cet article est en accès libre, mais il est le produit d'une rédaction qui ne travaille que pour ses lecteurs, sur un média sans pub et sans tracker. Soutenez le journalisme tech de qualité en vous abonnant.
Accédez en illimité aux articles d'un média expert
Profitez d'au moins 1 To de stockage pour vos sauvegardes
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
Abonnez-vousModifié aujourd'hui à 17h34
Je ne serais pas étonné d'y voir quelques pépites !
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?