Connexion Premium

On a soumis plus de 5 000 textes à 75 détecteurs d’IA gratuits : un constat d’échec

Détecte moi si tu peux

On a soumis plus de 5 000 textes à 75 détecteurs d’IA gratuits : un constat d’échec

Illustration : Flock

La détection de textes générés par IA est sur toutes les lèvres depuis l’affaire du livre de Thélyson Orélien. Chez Next, nous avons décidé de voir ce qu’il en était avec des milliers de nos articles, écrits à 100 % par des humains ! Dans cette première partie, nous passons au crible 75 détecteurs gratuits.

Next s’engage de manière forte sur l’utilisation de l’IA générative : aucun de nos articles n’est rédigé tout ou partie avec des IA génératives. Nous allons très prochainement publier une charte précise sur le sujet, mais ce n’est pas l’objet du jour.

Cette première partie de notre dossier permet de poser les bases : comment sont étiquetés nos 5 000 articles, quels sont les détecteurs utilisés et surtout ce que la détection implique. Car, oui, c’est une histoire de compromis entre les vraies et les fausses détections ; et il n’est pas toujours facile de placer le curseur au bon endroit.

5 000 textes passés au crible de 75 détecteurs

Pour nos tests, nous avons plus de 5 000 textes étiquetés ainsi : 4 000 articles écrits à 100 % par des humains (actus Next) et plus de 1 000 générés par des IA. Première limite : notre corpus de textes comprend donc des articles techniques, avec la patte et l’angle Next.

Nous avons généré entre 150 et 200 articles par modèle Anthropic, OpenAI, Google, Mistral et Qwen. La moitié environ est générée depuis des réécritures d’un article humain, l’autre moitié inventée à partir d’un titre et du chapô.

Nous avons ensuite testé environ 70 combinaisons de détecteurs d’IA. Dans le détail, il y a cinq classifieurs autonomes : AI Text Detector, RoBERTa AI Text Detection (de fakespot), ChatGPT Detector RoBERTa, RoBERTa OpenAI Detector et RADAR Vicuna-7B.

Nous avons également une dizaine de méthodes statistiques (Binoculars, Fast-DetectGPT, log-vraisemblance, GLTR, entropie…) avec sept modèles de langage (Qwen, Llama, Gemma, Mistral…). On parle dans ce cas de détecteurs statistiques (ou zero-shot) : ils utilisent un modèle de langage pour estimer à quel point un texte est prévisible, et donc potentiellement généré par IA.

Les 5 classifieurs et les 70 combinaisons de détecteurs statistiques sont tous exécutés sur les 5 000 articles, dans un VPS géré par nos soins, avec un A10 de NVIDIA (cela a tout de même nécessité près de 10 heures de calcul). Font-ils mieux qu’un pile ou face ?

TPR, FPR, AUROC : des notions importantes pour comprendre la suite !

Il reste 78% de l'article à découvrir.

Cadenas en colère - Contenu premium

Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.

Accédez en illimité aux articles

Profitez d'un média expert et unique

Intégrez la communauté et prenez part aux débats

Partagez des articles premium à vos contacts

Commentaires (1)

votre avatar
Super boulot :yes: