Pangram sait-il vraiment détecter les textes IA ? Notre test sur plus de 1 000 articles
On peut tromper 1 000 fois un détecteur, mais pas 1 000 détecteurs une fois
Illustration : Flock
Le 29 septembre à 11h01
Après les tests sur les détecteurs à poids ouverts, passons à un modèle commercial qui fait beaucoup parler de lui : Pangram. Nous lui avons envoyé des centaines d’articles, soit rédigés à 100 % par des humains (depuis notre base de données), soit générés par des IA.
Pangram sait-il vraiment détecter les textes IA ? Notre test sur plus de 1 000 articles
On peut tromper 1 000 fois un détecteur, mais pas 1 000 détecteurs une fois
Illustration : Flock
Après les tests sur les détecteurs à poids ouverts, passons à un modèle commercial qui fait beaucoup parler de lui : Pangram. Nous lui avons envoyé des centaines d’articles, soit rédigés à 100 % par des humains (depuis notre base de données), soit générés par des IA.
IA et algorithmes
IA
11 min
Quasiment 100 % de réussite sur les articles écrits par des humains
En tout, 460 articles humains ont été soumis au détecteur. Pangram en a détecté 450 comme totalement humains, 9 comme principalement humains mais avec quelques passages signalés comme étant GenAI et enfin un seul faux positif identifié comme étant surtout écrit par une IA.
Dans les 460 textes, une trentaine de textes n’avaient jamais été publiés sur Internet, impossible donc pour Pangram d’en trouver la moindre trace (ce sont des brouillons finalisés de certains articles). Gardez en tête un élément important de notre analyse : elle repose sur un corpus d’articles techniques.
- Bilan : 459 textes sur 460 sont bien étiquetés humains.
95 % de réussite sur notre corpus de textes GenAI
Sur les textes générés par IA nous avons multiplié les analyses. Nous avons utilisé 350 textes différents générés par IA, mais au total 570 articles ont été soumis au détecteur Pangram. Il y a parfois plusieurs variantes d’un même texte pour essayer de comprendre les mécanismes du détecteur. Nous y reviendrons.
Il reste 81% de l'article à découvrir.
Déjà abonné ou lecteur ? Se connecter
Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.
Accédez en illimité aux articles
Profitez d'un média expert et unique
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
expert et sans pub.
Commentaires (62)
Mardi à 11h22
Mardi à 12h24
Mardi à 12h40
Même si l'article est lui même très intéressant
Mardi à 12h50
Mardi à 12h54
Modifié mardi à 12h57
Donc on est "fortement incité" à utiliser un palanquée d'outils qui ne se trompent que "très peu souvent" mais dont les résultats sont pris pour argent comptant ( parce que, quand même, on gagne un temps fou! On peu aller plus vite!).
Ces resultats ont un impact très concret dans la vie réelle.
On ne peut donc plus être sûr de rien.
Bienvenue dans l'ère de la post-post-vérité, où les faits sont discutables.
Ça va nous aider tiens...
Modifié mardi à 13h09
(oui, même avec la dernière phrase, elle est là pour nous induire une erreur, c'est typiquement ce qu'une IA dirait)
Mardi à 13h19
Mardi à 13h41
Plus sérieusement, il y a pleins d'articles dans les journaux "grands publics", plein de blabla et les sections commentaires qui regorgent de pépites lunaires, oui, des pépites lunaires, j'invente des expressions si je veux!... mais aucun ne fait le test pour concrètement vérifier comment Pangram se comporte afin de pouvoir parler en connaissance de cause...
Bref, encore bravo à Next pour ce travail de fourmis à tout décortiquer et tout tester.
Mardi à 14h09
Mardi à 14h34
Mardi à 15h10
Mardi à 15h53
Et si j'ai bien compris la polémique, tous les extraits testés indique une écriture IA.
Ce sont de très fortes présomptions.
Il faudrait que Pangram se trompe sur tous les extraits et que l'auteur ait changé complètement sa manière d'écrire. Ça fait des sacrés coïncidences.
Mardi à 16h38
Du coup, la découverte de plagiat couplé à de très fortes suspicions de l'usage de l'IA via un outil, certes pas sans faille, mais quand même très précis (moins de 0.5% d'erreur dans ce sens là), pour ma part, offre une quasi-certitude.
C'est triste ce que je vais dire, mais j'aurais juste préféré que l'auteur soit "caucasien". Cela nous aurait évité les excuses sur les attaques racistes...
Mardi à 16h58
Modifié mercredi à 10h54
L'origine de l'attaque venant de l'ED et d'un pourri qui a trempé dans l'affaire du fonds Marianne, et qui a menti à la presse (alors qu'il est lui même censé se conformer à la déontologie journalistique), tous ceux qui se jettent sur Orélien en sentant le sang, aussi louables soient leurs intentions, participent à un harcèlement raciste.
Edit :
Selon la police. On ne peut pas statuer sur un résultat non explicable et non garanti.
Modifié mercredi à 11h47
Etre potentiellement récompensé pour un livre qu'on n'a pas vraiment écrit, pour ma part, je ne trouve pas cela vraiment normal, et cela relève de la malhonnêteté intellectuel. Que les sélectionnés d'un prix comme le prix Goncourt soit passé au crible, ne m'étonne donc pas.
Le fait qu'il soit racisé, bien évidemment (malheureusement !) provoque une récupération massive de l'ED. Mais le problème de fond reste le même.
Modifié mercredi à 11h41
Sur le fond, tu réécris un peu l'histoire.
@deathscythe0666 a raison : il a été attaqué au départ parce qu'il était racisé, sinon, son texte n'aurait même pas été testé.
L’académie Goncourt pouvait difficilement le garder dans sa liste suite à ces suspicions et de toute façon, même s'ils l'avaient gardé, le jury ne l'aurait pas choisi à cause de ces suspicions.
Comme l'a dit @AlexandreLaurent dans son article, la position de l'académie est maladroite, elle mélange une suspicion sur l'œuvre sélectionnée et des accusations de plagiat sur des œuvres précédentes mais pas celle-ci. Parler de passer au crible les lauréats du Goncourt quand on se souvient de la vie devant soi, ça me fait hurler de rire !
J'utilise à dessein le mot suspicion parce qu'une boîte noire ne sera jamais une preuve, sauf dans les cas des accidents d'avion, bien entendu, mais là, non seulement elles ne sont pas noires, mais en plus, on sait parfaitement comment elles fonctionnent contrairement à Pangram.
Mercredi à 12h03
jusqu'à preuve du contraire, pour l'instant, le compte Balance ton claude n'a pas vraiment de couleur politique, et la volonté affiché du compte est quand même de balancer ceux qui use de l'IA sans le dire.
Thélyson Orélien est un auteur qui rencontre actuellement un certain succès. Quoi de plus normal de s'intéresser à lui dès lors ? Le compte Balance ton Claude aurait pu s'attaquer aux écrits de @SebGF , mais je crains que l'impact aurait été moindre.
Par contre oui, cela a été très repris par l'ED. Mais l'ED qui fait de la récupération politique de tout et de rien, c'est pas nouveau...
Nous sommes d'accord. Et même s'il ne s'agit que de suspicions (assez forte, il faut l'avouer), le caractère douteux (plagiat avéré dans le passé) tant à inciter à une prudence accrue face à une personne ayant eu, par le passé, un comportement intellectuellement discutable.
Mercredi à 12h32
Ça fait plusieurs jours que l'on connaît au moins une des personnes se cachant derrière ce compte et elle est très à droite et anti-woke comme par hasard !
Mercredi à 13h00
C'est comme dire que toute asso ayant des bénévoles d'ED sont des assos ED....
Mercredi à 16h30
Mercredi à 17h22
Samuel Fitoussi s’explique sur l’affaire Thélyson Orélien : «Les gens auraient moins aimé ce livre s’ils avaient su qu’il avait été largement généré par une IA»
Mercredi à 19h20
Mercredi à 19h34
Et on rappelle que balancer des choses comme ça (de la diffamation), ça a valu une astreinte à une femme qui s'est fait, elle, insulter par un crétin et dont elle a publié l'insulte. Et il me semble que tu étais d'accord qu'elle n'avait pas à faire ça.
Mercredi à 21h41
Parce que le mec est d'ED, alors il a choisi sa cible parce qu'elle est racisée ? On occulte complètement le fait que c'est un auteur qui rencontre actuellement un grand succès, qui a reçu des prix, qui est sélectionné pour d'autres, et dont on parle beaucoup ces derniers temps.
Je ne dis pas que le mec n'a pas agit en fonction de ses convictions personnelles. Je dis qu'on ne peut pas le savoir, tout comme on ne peut pas savoir à 100% que Thélyson Orélien a utilisé l'IA ou non pour son roman.
Mais ça ne pose pas de problème à certains pour évoquer le doute et la présomption d'innocence pour l'un, et fustiger l'autre sans aucune forme de retenue.
Fitoussi l'a dit. Comme c'est lui qui a dit qu'il était derrière le compte. Donc pareil, qu'est-ce qu'on fait ? On choisi de croire Fitoussi quand il dit que c'est lui mais de ne pas le croire quand il dit qu'ils sont plusieurs ? Là encore, on choisi donc ce que l'on doit croire ou pas ? Sur quelle base ?
Si tu fais référence à cet article du relou numérique, tu dois me confondre avec un autre, car je n'ai justement pas commenté cet article, et tu me prêtes donc une position sans savoir ce qu'elle est réellement. Bravo.
Hier à 13h47
Donc un type d'extrême droite qui calomnie un auteur racisé, c'est pareil que ceux qui dénoncent les agissements de ce type, maintenant ?
Et il a menti quelques jours avant en prétendant ne pas être l'auteur de cette dénonciation.
Hier à 14h17
Calomnie = accusation mensongère .
Où est la calomnie ? Les suspicions sont très fortes, et cela à même permis de mettre en évidence des plagiats passés.
Encore une fois, 2 poids, 2 mesures.
Là encore, tu choisis donc de croire ce qui t'arrange. Pourquoi le croire quand il dit que c'est lui derrière alors ? Pourquoi décider que c'est ça la vérité ?
En bref, tu crois exactement ce qui t'arrange.
Pour finir, j'attends toujours des excuses sur le fait que tu m'aies prêter une position sans savoir ce qu'il en est, ne m'étant pas prononcé sur le sujet.
Modifié hier à 14h38
Mediapart fait des enquêtes journalistiques et n'aurait certainement pas affirmé quoi que ce soit sur la base d'un détecteur IA et uniquement sur cette base-là. On ne se contente pas d'indices et de fausses probabilités pour affirmer quelque chose. Les articles de Mediapart sont plus documentés et longs qu'une publication sur X.
On pense ce qu'on veut des opinions sur Mediapart, l'intention de Mediapart n'est franchement pas la même.
Hier à 17h03
Mais le niveau de foutage de gueule ! Il nie être derrière l'affaire, puis finit par avouer que c'est lui, mais c'est moi le problème ?
Continue à inventer une réalité alternative dans laquelle la déontologie de Fitoussi serait ne serait-ce que la moitié de celle de Mediapart pour te raccrocher aux branches.
Carrément ! Les excuses pour quelque chose que je n'ai pas écrit, tu vas les attendre longtemps.
Modifié hier à 18h22
Et après, tu dis que tu n'as rien écrit ? Et c'est moi le foutage de gueule ?
Bon allez, j'arrête là.
Mercredi à 19h35
Mercredi à 14h53
Mais bon, s'pas demain la veille que je serai nominé à un Goncourt pour peu que ce genre de prix ait de la valeur réelle. L'académie n'a pas brillé par son intelligence dans cette affaire et encore moins son équité à considérer ces soupçons comme des critères éliminatoires. Si ça devient une règle, tous les ouvrages nominés devraient donc être scannés.
Le monde éditorial n'en est clairement pas ressorti grandi dans cette histoire.
Mardi à 16h54
Mercredi à 10h49
Quant au changement de style, il n'y en a pas, puisqu'on a établi qu'il a plagié donc pas écrit lui même son livre précédent.
Hier à 10h11
Se cacher derrière le racisme est très problématique, car ça va justement nourrir les discours malveillants et manipulatoire d'extrême droite qui pourront dire : "Vous voyez, le racisme n'existe pas vraiment, c'est un étendard dans lequel les personnes d'origine étrangère peuvent se cacher pour faire leurs méfaits."
C'est faux, car le racisme est tout à fait documenté, mais la manière dont il se défend est un cadeau pour l'extrême droite.
Hier à 13h49
Mardi à 17h51
Mardi à 18h12
On passe notre temps sur le Web à se défendre d'être un robot.
Et désormais, les robots nous accuseront de dire qu'on a utilisé un autre robot, tout en brandissant la preuve générée par un robot comme vérité.
Quel droit de réponse quand la machine accuse ? L'impact sociétal qui se dessine est loin d'être neutre.
Mardi à 18h55
Voici d’abord deux liens intéressants sur le sujet de l’IA :
https://www.liberation.fr/culture/livres/une-etape-est-franchie-lecrivain-julien-blanc-gras-victime-dusurpation-didentite-pour-un-livre-ecrit-par-lia-20260629_TXNG3BYR6JHE3CL5354ISDZ7TY/
https://actualitte.com/article/126907/technologie/ces-livres-ecrits-par-ia-vendus-sur-amazon-recit-alarmiste-d-une-mere
J’ai moi-même de forte suspicions depuis 2024 sur deux auteurs inconnus et dont on ne trouve quasiment pas d’information.
Je me suis renseigné à la FNAC à l’époque. Ils n’ont rien trouvé sur les différentes bases de données auxquelles ils ont accès. Ma médiathèque a suggéré que ce pouvait être un collectif d’écrivain, mais ça ne colle pas.
Les auteurs présumés seraient américains : Kate Bold et Blake Pierce (il y en a visiblement d’autres), pour lesquels, en fouillant longtemps en ligne, j’ai réussi à trouver un lien ténu entre eux.
Commençons par Blake Pierce :
— aucunes photos véritables trouvées, ce sont toujours les couvertures des livres (idem pour les vidéos)
— aucunes informations personnelles trouvées (notamment sur les rézosocios)
— pas d’éditeur trouvé, mais quelques mentions d’auto-édition
— par contre un rythme de publication phénoménal : 700 ouvrages en VO, dont 255 en VF, depuis 2015 (recherche effectuée début 2024)
— des séries de romans policiers, dont la particularité repose sur des titres qui débutent de la même façon :
Say Die, Say When, Say Nothing, Say Goodbye, Say Now, Say Please, etc.
— voir ici pour un aperçu du phénomène : https://www.bookseriesinorder.com/blake-pierce/
Quant à Kate Bold : c’est la même chose pour tous les points évoqués précédemment, mais la période de publication est encore plus courte. Au 6 août 2026, elle aurait publié 34 séries pour un total de 234 romans policiers entre 2021 et 2027.
— voir ici : https://inorderbookseries.com/authors/kate-bold
Il n’est pas ici question de duperie (pour rester poli) mais d’une impossibilité pratique d’écrire à un tel rythme. Enfin, ces auteurs auraient beaucoup de succès avec des centaines de milliers d’avis de lecteurs (toujours proches de 4 sur 5)… alors qu’ils sont parfaitement inconnus.
Est-il possible de les tester avec Pangram ? Je suis vraiment intéressé par le résultat.
Mercredi à 00h00
Pour sortir un peu du biais "corpus d'articles techniques" que vous signalez vous-même, pensez-vous que les "bons détecteurs d'IA" sont à même de classer comme "100% humain" des styles littéraires nouveaux ou différents ?
De ce que je comprends, les "bons détecteurs d'IA" tentent surtout de détecter "le style IA" et mettent dans "humain" ce qui en est "très éloigné" (en fonction du calibrage) et dans "mixed" ce qui s'en éloigne un peu mais pas totalement.
Mais j'imagine que les benchmarks qui peuvent exister se concentrent sur les styles littéraires "pré-2020".
En effet il est peu probable que les détecteurs en question puissent être évalués sur beaucoup de romans post-2020 étant donné la forte incertitude (du point de vue de l'humain qui crée le benchmark) sur le fait qu'ils aient pu être produits avec de l'IA ou non.
Ne faudrait-il pas que les fabricants des détecteurs en question payent des humains pour écrire des textes et même de vrais écrivains (tout en garantissant que ces mêmes écrivains ont écrit "sans IA"), afin d'avoir des benchmarks encore plus réalistes et précis, et toujours à jour.
Mercredi à 00h11
Les benchmarks comme les IA génératives, ont besoin de données étiquetées (Humain ou IA pour faire simple) pour s’entrainer. Le pré-2020 est une source en effet, mais encore faut-il être certain.
Ensuite, cela reste des modèles statistiques qui dépendent des données d'entraînement, je ne sais pas comment ils se comporteraient face à un style ou un vocabulaire totalement différent des données d'entraînement.
Payer des humains ne me semble pas productif vu la quantité de texte qu’il faudrait produire pour avoir des données, qui seraient encore dépendantes du style des plumes.
Mercredi à 01h05
https://www.hors-serie.net/cetait-ca-ou-mourir-entre-consecration-et-soupcon-retour-sur-loeuvre/
Il s’agit d’une critique en date du 23 septembre 2026 de l’objet du délit : le roman de Thélyson Orélien, « C’était ça ou mourir », proposée sur l’ancien site partenaire d’Arrêt sur images (Hors Série).
Et plus précisément le dernier chapitre intitulé : « Détecteurs d’IA : quand le douanier fabrique les faux passeports ».
Extrait :Je ferais bien des tests moi-même, mais l’utilisation gratuite de Pangram est limitée à 1 crédit / 100 mots et 20 crédits au total : ça fait un texte de 2000 mots maxi.
On peut pas tester grand-chose avec ça.
Mercredi à 09h11
"est entraîné directement sur la manière dont les humains écrivent naturellement " : à l'ère post-IA, ne va-t-on pas assister à un changement de style d'écriture, influencé par la quantité importante - pour ma part du moins - de textes IA que l'on lit ? Ou, au contraire, chacun passera (et passe déjà, j'en suis bien persuadé) ses textes dans des vérificateurs et modèlera son texte jusqu'à atteindre un score parfaitement humain ?
Mercredi à 09h18
Mercredi à 09h40
Mercredi à 16h31
Hier à 05h09
Pour lire des textes avec du vocabulaire riche, il vaut mieux lire des articles de presse et des livres écrits par des humains. Les mails, c'est très administratif ou circonstanciel. L'IA n'existe que parce que des contenus humains existent (on verra si l'IA est capable de faire évoluer la langue et d'inventer les mots qui conviennent à une époque, pour le moment ça reste très limité à ce sujet).
Hier à 05h12
Hier à 05h02
Faire une fiche de cuisine ou un manuel technique à l'IA générative : oui.
Pour tout exercice de création de texte, l'IA générative ne peut être qu'une aide, à la manière du correcteur orthographique ou de la traduction basique d'un texte (une oeuvre littéraire exigera une intervention humaine).
On dit souvent que la pensée se forme en la formulant avec des mots. L'IA générative devient très frustrante dès qu'on lui demande autre chose de l'automatisme. L'IA permet d'aller plus vite, pas de créer quoi que ce soit. Le jour où le monde littéraire et les industriels de l'IA auront admis cette réalité, on n'aura pas besoin de vérifier les textes des humains pour prouver qu'ils sont d'origine humaine. Et si des gens veulent lire des textes générés par IA, je ne vois pas le problème (les romans de gare existent, les articles de fait divers n'ont aucune originalité littéraire même avant qu'on parle de l'IA).
Hier à 09h01
Dès les premiers LLMs, des gens s'en sont servis pour générer des textes entiers avec très peu de supervision. Ce n'est pas une "aide" dans ce cas : le modèle peut tout générer, de l'histoire aux personnages et aux péripéties et même au choix du style. En quelques minutes il sort un livre entier.
Aujourd'hui des gens publient de grandes quantités de livres entiers générés par IA sur Amazon et ailleurs. Ils ne jouent presque aucun rôle dans le processus créatif et souvent ne lisent même pas le livre généré. Ça serait parfois matériellement impossible vu le nombre publié par une seule personne.
Il est bien sûr aussi possible d'utiliser des LLMs pour de l'aide à l'écriture, de la relecture ou un travail d'édition.
Mais pour que le livre entier soit considéré comme généré par IA à 100% par pangram, et considérant le résultat des tests de Next et d'autres, l'implication de l'auteur dans le processus créatif peut clairement être mis en question.
Modifié hier à 10h15
Modifié hier à 10h58
Si c'est interdit c'est justement parce que c'est possible de le faire, et que des gens le font. Et les lecteurs dans leur majorité ne souhaitent pas lire de livre généré par IA. Quand ils l'apprennent après avoir passé du temps à lire un texte ils se sentent souvent trahis. Quand l'utilisation de l'IA est clairement annoncée, les ventes ne sont pas du tout au même niveau.
Ce n'est pas contre-culturel de chercher à savoir si un texte est généré, c'est au contraire en plein dans la tendance actuelle, car dans ce monde où nous sommes submergé par du contenu algorithmique, on recherche souvent du vrai, de l'humain quand on achète un livre.
Cela n'interdit pas de lire ou publier du contenu généré, mais la pratique éthique/déontologique qui s'impose est au minimum de le dire.
Hier à 18h53
Hum... cf la polémique sur le Goncourt et le test qui avait été fait pour le Nouvel Obs (https://www.nouvelobs.com/bibliobs/20250316.OBS101513/le-prix-goncourt-herve-le-tellier-s-est-mesure-a-l-ia-et-le-match-a-ete-a-la-fois-surprenant-et-terrifiant.html)
Je pourrais aussi citer les journalistes et critiques, qui ne sont fait berner par de la musique IA (le reconnaissent et sont bluffés). Pas le temps de retrouver les sources.
Et je suis bien le premier a être dépité par ce qu'est capable de produire une IA en image, son, musique, quand on sait prompter (ou utiliser des outils déjà prévus pour).
Nier ça, c'est juste ignorer totalement ce dont sont capables les IA.
Mercredi à 11h26
Pour approfondir cet article très intéressant, il faudrait par exemple:
Comment voulez-vous continuer?
Mercredi à 11h30
Pour des exemples sur d’autres natures de textes, il faut un corpus, et un corpus fiable comme pour les articles de Next. Problème, je n’ai pas sous la main d’autres réserves dans lesquelles puiser :/
Mercredi à 13h30
J'ai juste essayé de faire l'IA humaine :)
Mercredi à 14h55
Mercredi à 15h24
Mercredi à 20h27
Peut-être une occasion de reconsidérer le protocole de test et expérimenter une variante ?
Mercredi à 21h38
Mon test ici est de voir sur un corpus large de textes dont je sais avec certitude la provenance humaine, à 100 %. Et comme je le précise, mon analyse se limite à des articles tech sur le numérique, bref à Next. Je n’ai pas d’autres corpus sous la main aussi fiable.
J’ai un peu parlé stats dans la première partie sur les 75 détecteurs, mais j’ai tjs peur de faire fuir tout le monde avec des chiffres (j’ai bouffé des stats pendant des années à la fac… bon j’ai jamais aimé, donc ça m’arrange aussi ^^)
Modifié hier à 12h18
L'auteur y explique que le style d'écriture des Kényans, inculqué par leur système éducatif très strict, ressemble à l'IA dans sa construction.
J'obtiens un score de 87% écrit par IA, 13% par humain, sur le texte de l'article avec Pangram (sans les deux derniers paragraphes, pour ne pas dépasser la limite du compte gratuit).
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?