« Un vol d’une ampleur sans précédent » : les documents qui fragilisent OpenAI
« Boucle infernale »
Illustration : Flock
Le 18 septembre à 17h25
« Le plus grand vol de travail de l’histoire de l’humanité » : cette déclaration reprise par le New York Times dans sa procédure en justice contre OpenAI résonne particulièrement fort puisqu’elle émane de Brent Hecht, directeur scientifique de Microsoft. Dans un mémoire de synthèse remis à la justice, l’éditeur du célèbre quotidien aligne les éléments à charge contre le créateur de ChatGPT.
« Un vol d’une ampleur sans précédent » : les documents qui fragilisent OpenAI
« Boucle infernale »
Illustration : Flock
« Le plus grand vol de travail de l’histoire de l’humanité » : cette déclaration reprise par le New York Times dans sa procédure en justice contre OpenAI résonne particulièrement fort puisqu’elle émane de Brent Hecht, directeur scientifique de Microsoft. Dans un mémoire de synthèse remis à la justice, l’éditeur du célèbre quotidien aligne les éléments à charge contre le créateur de ChatGPT.
IA et algorithmes
IA
5 min
Le New York Times est parti en guerre contre OpenAI. En décembre 2023, l’éditeur portait plainte contre l’entreprise IA, l’accusant d’avoir utilisé des millions d’articles sans autorisation pour entraîner ses modèles GPT. L’administration Trump a récemment volé au secours d’OpenAI, en affirmant que l’entraînement de l’IA sur des contenus protégés par droit d’auteur relevait du « fair use » (usage équitable), un argument seriné en boucle par les entreprises IA pour se défausser de leur responsabilité.
Des documents internes difficiles à balayer
Le mémoire de synthèse, déposé devant le tribunal fédéral de New York (PDF) par le NYT et d’autres éditeurs de presse (Chicago Tribune, Ziff Davis, Mother Jones…), détaille les éléments recueillis pendant la phase de collecte des preuves : témoignages sous serment, messages et autres documents produits par OpenAI et Microsoft. Ils sont évidemment à charge, mais ils s’appuient sur des pièces et des témoignages qui donnent un aperçu assez cru de la manière dont OpenAI et Microsoft considéraient en interne l’exploitation des contenus de presse.
Le témoignage de Brent Hecht est particulièrement embarrassant. Selon lui, « des millions de personnes dans le monde considéreront bientôt que les grands modèles qui « aspirent » tout leur travail constituent un vol d’une ampleur sans précédent ». Il admet que « presque personne n’avait prévu que les contenus créés seraient utilisés de cette manière, sans que leurs auteurs soient rémunérés ».
Le directeur scientifique de Microsoft estime aussi qu’accepter l’argument d’OpenAI selon lequel le moissonnage de contenus n’est que du « fair use » revient à complètement vider la notion de son sens. « Ces propos reflètent le point de vue personnel d’un employé et ne constituent pas une analyse juridique », a déclaré Microsoft auprès d’Ars Technica.
Le mémoire cite un autre échange dans lequel Nick Ryder, responsable de recherche chez OpenAI, annonce à Greg Brockman l’existence d’un « moyen pour contourner le paywall du New York Times » afin de collecter les articles. Le cofondateur et président de l’entreprise a simplement répondu : « ah, très bien » (« ah nice »).
Des aveux qui tombent mal
Les éditeurs de presse font tout simplement face à une « menace existentielle », reconnait Nick Turley, responsable de ChatGPT chez OpenAI, dans un message interne remontant à juin 2023. Une fois que ChatGPT fournit une réponse, il n’y a « aucune bonne raison de cliquer » sur le lien vers la source d’origine, ajoute-t-il. Un document chez Microsoft parle de « boucle infernale » : en détournant une partie du trafic des sites d’actualité, les assistants IA fragilisent les éditeurs qui produisent précisément les contenus dont leurs modèles ont besoin pour rester performants.
Selon les propres données de Microsoft, le taux de clic depuis Bing Chat ou Copilot vers les sites des éditeurs est très inférieur à celui observé depuis la recherche Bing classique : baisse de 87 à 93 % pour les sites du New York Times, de 83 à 91 % pour les autres plaignants. C’est d’autant moins de revenus pour les sites de presse qui se retrouvent en concurrence avec leurs propres contenus recrachés par les bots. Un ingénieur logiciel d’OpenAI reconnaissait dans un message interne que, « peu importe la visibilité donnée aux liens, les utilisateurs ne cliqueront pas dessus ».

Satya Nadella face à la question des paywalls
Dans son témoignage sous serment, Satya Nadella, le directeur général de Microsoft, admet que « tout contenu placé derrière un paywall devrait faire l’objet d’une licence de la part de quiconque souhaite l’utiliser, que ce soit pour alimenter les réponses d’un modèle ou pour son entraînement ».
S’il avait su qu’OpenAI – dont Microsoft est un des principaux partenaires – avait moissonné des contenus placés derrière un paywall pour entraîner ses modèles IA, Nadella aurait invoqué le droit de Microsoft d’exiger le réentraînement des modèles sans ces données protégées. Pour le dirigeant, les entreprises IA ne devraient pas accéder à des contenus enfreignant les conditions d’utilisation.
Satya Nadella reconnait également que les chatbots comme Copilot peuvent se substituer aux sites d’actualité : ils donnent en effet l’information « directement sur la plateforme d’IA, plutôt que d’obliger l’utilisateur à se rendre à la source d’origine ». Pour le porte-parole de Microsoft, ce témoignage porte sur des « principes généraux », il ne s’agit que « d’observations qui ne doivent pas être confondues avec des conclusions sur les questions de droit d’auteur soumises au tribunal ».
Si ce mémoire de synthèse est certes accablant, il ne constitue pas pour autant une décision de justice ni une conclusion du tribunal sur le fond de l’affaire. Néanmoins, les pièces de première main qu’il expose éclairent l’état d’esprit d’OpenAI et de Microsoft quant à la portée réelle de leur utilisation du « fair use ».
Commentaires (16)
Abonnez-vous pour prendre part au débat
Déjà abonné ou lecteur ? Se connecter
Cet article est en accès libre, mais il est le produit d'une rédaction qui ne travaille que pour ses lecteurs, sur un média sans pub et sans tracker. Soutenez le journalisme tech de qualité en vous abonnant.
Accédez en illimité aux articles d'un média expert
Profitez d'au moins 1 To de stockage pour vos sauvegardes
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
Abonnez-vousLe 18 septembre à 19h04
Ce serait du "fair use" non ? 😉
Qu'en pensent-ils ?
Le 18 septembre à 19h07
Le 18 septembre à 19h08
Le 18 septembre à 19h20
Donc c'est pas très difficile de voir comment ça va finir. Dans les pays libéraux, les éditeurs d'AI rachèteront les éditeurs de contenu. Dans les pays socialistes les éditeurs d'AI seront forcés de contribuer à un fond commun pour financer la presse.
Le 18 septembre à 20h26
Modifié le 18 septembre à 23h46
Les droits d'auteurs et tout ça c'était bien quand ça protégeais les grandes compagnies, mais avec les nouvelles tech rendant la copie et le partage plus simple, c'était plus forcément rentable. Sans parler de ces vilains communistes qui partageai gratuitement tout et n'importe quoi... rendez vous compte, de la musique libre de droits! quelle infamie... Heureusement, avec cette nouvelle technologie on va pouvoir refaire du pognon en
volantutilisant pour le bien commun leur productions et celle payante des vilains concurrents!Le savoir, c'est le pouvoir. Avec les LLM, le savoir, c'est pas vous qui l'avez...
Le 19 septembre à 00h17
Le siphonnage dont il est question dans l'article est "simplement" pour moi une énième instance d'une photocopieuse qui copie un livre, dont la copie se retrouve copiée, ...
Bref on s'échine à essayer de faire des règles pour que les créations soient considérées comme des biens: Les DRM, les paywall... et "ça passe" tant que la copie n'est pas trop répandue.
C'était déjà le cas sous Louis XIV (et à l'époque la copie était compliquée), avec le numérique c'est devenu trivial et à cout nul .
Bref, à mon avis c'est tout le financement de la création qu'il faut revoir.
Quand on achète un journal on achète pas l'exemplaire qu'on lit : On achète la possibilité d'en avoir d'autre plus tard, et si pas assez de gens considèrent que ça vaux le coup , ben le journal disparait.
Pour moi l'une des solutions passe par le crowd-funding ( autre nom de ce qu'on appelait avant le mécénat, d'un certain point de vue). En contrepartie tout ce qui est produit de cette manière est "gratuit" pour les autres ensuite. Et si c'est pas assez intéressant pour que collectivement on décide d'y mettre de l'argent, alors soit le créateur le fait bénévolement pour le plaisir de son art, soit ça n'existe pas.
(Une 3ème voie est le collectivisme, où des impôts servent à financer de la création sans a-priori, mais il reste le risque qu'un état autoritaire arrête de financer ce qui lui semble défavorable).
Mais pour moi, "vendre" des "copies numériques" est et restera toujours un non-sens.
Dans le cas de l'article, oui, OpenAI aurait dû payer (et ça reste encore possible) , pas pour 'le vol' mais plutôt pour financer la création future. Toute la question est de savoir si, avec un tel financement , l'IA aurait été ne serait-ce que possible dès le départ (à mon avis non)
Le 19 septembre à 10h09
Rien de neuf sous le soleil, c'est juste une version évoluée d'une organisation connue.
Le 19 septembre à 16h31
Or, le numérique pose le problème de l'offre infinie...
Maintenant que les sociétés d'immatériel sont les plus puissantes financièrement, l'économie a du mal à tenir debout.
Modifié le 23 septembre à 14h38
Le 22 septembre à 10h38
Quand tu achètes un journal, tu achètes l'objet et tu peux toujours en bénéficier (sous réserve de le conserver), ça ne dit rien sur la possibilité future d'avoir d'autres numéros (même si le business model de l'éditeur va normalement viser à ce que ce soit possible).
Et acheter le journal/le livre/etc. ne te donne pas pour autant le droit de faire n'importe quoi avec le contenu (genre un plagiat pour faire de l'argent en profitant d'un travail qui n'est pas le tien).
Le 22 septembre à 16h23
Le 22 septembre à 16h45
En tous cas c'est pas du tout comme ça que moi je le conçois.
L'objet je peux aussi l'emprunter à la médiathèque, en faire une copie ou un scan chez moi puis le rendre, et j'aurais le contenu sans en avoir la propriété (ni matérielle, ni "morale" du contenu), et pourtant je pourrais en profiter et en faire profiter d'autre.
Le 22 septembre à 17h10
Je pense au contraire que la révolution industrielle, puis la révolution numérique (surtout) ont propulsé des personnes totalement étrangères à toute raison à des niveaux de fortune et de pouvoir impensables même à l'époque des monarques absolus.
Les rois de France, par exemple, ont suscité du mécontentement en réglementant le déboisement car ils ont accepté de voir qu'il y avait un problème et qu'il fallait le résoudre (même si ce n'était pas un problème pour le lendemain).
On n'est probablement collectivement pas vraiment plus déraisonnables qu'avant, mais non seulement on a la capacité technique de tout dévaster pour notre confort, mais en plus, on est tellement coupés de la réalité du monde naturel qu'on voit encore moins les limites et qu'on ne les accepte plus (surtout avec le mirage de la solution miracle qui ne manquera pas de survenir).
Le 19 septembre à 01h01
A moins bien sûr que cette déclaration ne soit que pure hypocrisie...
Le 19 septembre à 12h33
En pratique, ils gonflent leur taux de vues à mes dépens. Je me sens victime d'une espèce de guerre des boutons 2.0 : si j'aurais su, j'aurais pas v'nu.
Et puis ils viennent se plaindre qu'un autre acteur (attention, je ne dis pas que cet acteur est un bisounours) capte leur trafic en transformant cela en "Le service ferroviaire entre Grâce-Berleur et Hoût-Si-Ploût sera interrompu entre samedi 6h et dimanche 21h". Ouin, seuls les gens qui voulaient prendre cette ligne-là ce jour-là vont cliquer sur le lien pour avoir des détails, c'est trop injuste.
Comme dit OB, le problème des sites d'information est le financement, pas forcément les LLM.
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?