Connexion Premium

« Un vol d’une ampleur sans précédent » : les documents qui fragilisent OpenAI

« Boucle infernale »

« Un vol d’une ampleur sans précédent » : les documents qui fragilisent OpenAI

Illustration : Flock

« Le plus grand vol de travail de l’histoire de l’humanité » : cette déclaration reprise par le New York Times dans sa procédure en justice contre OpenAI résonne particulièrement fort puisqu’elle émane de Brent Hecht, directeur scientifique de Microsoft. Dans un mémoire de synthèse remis à la justice, l’éditeur du célèbre quotidien aligne les éléments à charge contre le créateur de ChatGPT.

Le New York Times est parti en guerre contre OpenAI. En décembre 2023, l’éditeur portait plainte contre l’entreprise IA, l’accusant d’avoir utilisé des millions d’articles sans autorisation pour entraîner ses modèles GPT. L’administration Trump a récemment volé au secours d’OpenAI, en affirmant que l’entraînement de l’IA sur des contenus protégés par droit d’auteur relevait du « fair use » (usage équitable), un argument seriné en boucle par les entreprises IA pour se défausser de leur responsabilité.

Des documents internes difficiles à balayer

Le mémoire de synthèse, déposé devant le tribunal fédéral de New York (PDF) par le NYT et d’autres éditeurs de presse (Chicago Tribune, Ziff Davis, Mother Jones…), détaille les éléments recueillis pendant la phase de collecte des preuves : témoignages sous serment, messages et autres documents produits par OpenAI et Microsoft. Ils sont évidemment à charge, mais ils s’appuient sur des pièces et des témoignages qui donnent un aperçu assez cru de la manière dont OpenAI et Microsoft considéraient en interne l’exploitation des contenus de presse.

Le témoignage de Brent Hecht est particulièrement embarrassant. Selon lui, « des millions de personnes dans le monde considéreront bientôt que les grands modèles qui « aspirent » tout leur travail constituent un vol d’une ampleur sans précédent ». Il admet que « presque personne n’avait prévu que les contenus créés seraient utilisés de cette manière, sans que leurs auteurs soient rémunérés ».

Le directeur scientifique de Microsoft estime aussi qu’accepter l’argument d’OpenAI selon lequel le moissonnage de contenus n’est que du « fair use » revient à complètement vider la notion de son sens. « Ces propos reflètent le point de vue personnel d’un employé et ne constituent pas une analyse juridique », a déclaré Microsoft auprès d’Ars Technica.

Le mémoire cite un autre échange dans lequel Nick Ryder, responsable de recherche chez OpenAI, annonce à Greg Brockman l’existence d’un « moyen pour contourner le paywall du New York Times » afin de collecter les articles. Le cofondateur et président de l’entreprise a simplement répondu : « ah, très bien » (« ah nice »).

Des aveux qui tombent mal

Les éditeurs de presse font tout simplement face à une « menace existentielle », reconnait Nick Turley, responsable de ChatGPT chez OpenAI, dans un message interne remontant à juin 2023. Une fois que ChatGPT fournit une réponse, il n’y a « aucune bonne raison de cliquer » sur le lien vers la source d’origine, ajoute-t-il. Un document chez Microsoft parle de « boucle infernale » : en détournant une partie du trafic des sites d’actualité, les assistants IA fragilisent les éditeurs qui produisent précisément les contenus dont leurs modèles ont besoin pour rester performants.

Selon les propres données de Microsoft, le taux de clic depuis Bing Chat ou Copilot vers les sites des éditeurs est très inférieur à celui observé depuis la recherche Bing classique : baisse de 87 à 93 % pour les sites du New York Times, de 83 à 91 % pour les autres plaignants. C’est d’autant moins de revenus pour les sites de presse qui se retrouvent en concurrence avec leurs propres contenus recrachés par les bots. Un ingénieur logiciel d’OpenAI reconnaissait dans un message interne que, « peu importe la visibilité donnée aux liens, les utilisateurs ne cliqueront pas dessus ».

Un dessin présent dans un document de Microsoft, repris dans le mémoire du NYT : « Argument tiré des travaux sur le pouvoir de négociation lié aux données : nous, dans la tech, avons peut-être tendance à nous croire au centre du monde, mais ce sont les créateurs de contenus qui tiennent le levier d’Archimède. »

Satya Nadella face à la question des paywalls

Dans son témoignage sous serment, Satya Nadella, le directeur général de Microsoft, admet que « tout contenu placé derrière un paywall devrait faire l’objet d’une licence de la part de quiconque souhaite l’utiliser, que ce soit pour alimenter les réponses d’un modèle ou pour son entraînement ».

S’il avait su qu’OpenAI – dont Microsoft est un des principaux partenaires – avait moissonné des contenus placés derrière un paywall pour entraîner ses modèles IA, Nadella aurait invoqué le droit de Microsoft d’exiger le réentraînement des modèles sans ces données protégées. Pour le dirigeant, les entreprises IA ne devraient pas accéder à des contenus enfreignant les conditions d’utilisation.

Satya Nadella reconnait également que les chatbots comme Copilot peuvent se substituer aux sites d’actualité : ils donnent en effet l’information « directement sur la plateforme d’IA, plutôt que d’obliger l’utilisateur à se rendre à la source d’origine ». Pour le porte-parole de Microsoft, ce témoignage porte sur des « principes généraux », il ne s’agit que « d’observations qui ne doivent pas être confondues avec des conclusions sur les questions de droit d’auteur soumises au tribunal ».

Si ce mémoire de synthèse est certes accablant, il ne constitue pas pour autant une décision de justice ni une conclusion du tribunal sur le fond de l’affaire. Néanmoins, les pièces de première main qu’il expose éclairent l’état d’esprit d’OpenAI et de Microsoft quant à la portée réelle de leur utilisation du « fair use ».

Commentaires (16)

votre avatar
En compensation du "fair use" gratuit de nos données, les acteurs de l'IA n'ont qu'à donner accès gratuitement à leurs outils à tout le monde.
Ce serait du "fair use" non ? 😉
Qu'en pensent-ils ?
votre avatar
Pour le moment, ils le font, en partie... Mais ce qui est pris est pris et ne sera jamais rendu.
votre avatar
En effet, mais ça m'étonnerait que ça fasse partie de leur business model à moyen terme.
votre avatar
Au delà du fait que c'est nouveau et donc le bordel, si on regarde le problème de façon pragmatique, les éditeurs d'AI ont besoin des éditeurs de news/contenus pour le... contenu des AI justement.

Donc c'est pas très difficile de voir comment ça va finir. Dans les pays libéraux, les éditeurs d'AI rachèteront les éditeurs de contenu. Dans les pays socialistes les éditeurs d'AI seront forcés de contribuer à un fond commun pour financer la presse.
votre avatar
Pourquoi se limiter à la presse ? D'autres secteurs sont pillés.
votre avatar
Alors au cas où ce ne serai pas clair, l'idée derrière ces grandes compagnies , c'est de privatiser le savoir de l'humanité (y compris les trucs protégés par le droit d'auteur...). Besoin d'un savoir? paye.

Les droits d'auteurs et tout ça c'était bien quand ça protégeais les grandes compagnies, mais avec les nouvelles tech rendant la copie et le partage plus simple, c'était plus forcément rentable. Sans parler de ces vilains communistes qui partageai gratuitement tout et n'importe quoi... rendez vous compte, de la musique libre de droits! quelle infamie... Heureusement, avec cette nouvelle technologie on va pouvoir refaire du pognon en volant utilisant pour le bien commun leur productions et celle payante des vilains concurrents!

Le savoir, c'est le pouvoir. Avec les LLM, le savoir, c'est pas vous qui l'avez...
votre avatar
Pour moi il y a, et il y a toujours eu, le problème de la non-rivalité des contenus immatériels.
Le siphonnage dont il est question dans l'article est "simplement" pour moi une énième instance d'une photocopieuse qui copie un livre, dont la copie se retrouve copiée, ...

Bref on s'échine à essayer de faire des règles pour que les créations soient considérées comme des biens: Les DRM, les paywall... et "ça passe" tant que la copie n'est pas trop répandue.

C'était déjà le cas sous Louis XIV (et à l'époque la copie était compliquée), avec le numérique c'est devenu trivial et à cout nul .

Bref, à mon avis c'est tout le financement de la création qu'il faut revoir.
Quand on achète un journal on achète pas l'exemplaire qu'on lit : On achète la possibilité d'en avoir d'autre plus tard, et si pas assez de gens considèrent que ça vaux le coup , ben le journal disparait.

Pour moi l'une des solutions passe par le crowd-funding ( autre nom de ce qu'on appelait avant le mécénat, d'un certain point de vue). En contrepartie tout ce qui est produit de cette manière est "gratuit" pour les autres ensuite. Et si c'est pas assez intéressant pour que collectivement on décide d'y mettre de l'argent, alors soit le créateur le fait bénévolement pour le plaisir de son art, soit ça n'existe pas.
(Une 3ème voie est le collectivisme, où des impôts servent à financer de la création sans a-priori, mais il reste le risque qu'un état autoritaire arrête de financer ce qui lui semble défavorable).

Mais pour moi, "vendre" des "copies numériques" est et restera toujours un non-sens.

Dans le cas de l'article, oui, OpenAI aurait dû payer (et ça reste encore possible) , pas pour 'le vol' mais plutôt pour financer la création future. Toute la question est de savoir si, avec un tel financement , l'IA aurait été ne serait-ce que possible dès le départ (à mon avis non)
votre avatar
C'est bien pour ça que les business model virent vers les abonnements ou le tipping. C'est la forme moderne du financement des ménestrels.
Rien de neuf sous le soleil, c'est juste une version évoluée d'une organisation connue.
votre avatar
Je trouve qu'il y a une dimension supplémentaire: l'économie. Dans notre économie, on nous parle du prix fixé par l'offre et la demande.
Or, le numérique pose le problème de l'offre infinie...
Maintenant que les sociétés d'immatériel sont les plus puissantes financièrement, l'économie a du mal à tenir debout.
votre avatar
Le plus marrant ici c'est que je ne suis pas certain qu'il existe une demande pour l'ia de type résumé ia dans les moteurs de recherches, dans les ordi de Mr tout le monde... Mais la techno est entrain de créer le besoin, les résumé, ah c'est pratique et tellement reposant pour le cerveau, les compagnon ia, mais quelle bonne idée pour éviter l'effort de se sociabiliser et de passer peut-être un mauvais moment de temps à autre et d'apprendre à gérer l'altérité, c'est reposant. À force de se reposer, on aura un QI de limace et des capacités "asociales" .
votre avatar
Le siphonnage dont il est question dans l'article est "simplement" pour moi une énième instance d'une photocopieuse qui copie un livre, dont la copie se retrouve copiée, ...
Je ne suis pas d'accord. Le problème ici, c'est qu'une entreprise (qui est donc censée se conformer aux mêmes lois qui sont aussi là pour la protéger elle) se permette de piller à grande échelle le travail d'autrui pour court-circuiter le marché. C'est non seulement totalement pourri en termes éthiques, mais c'est en plus contre productif à terme : qui va continuer à se casser le q à produire des contenus si c'est pour que ce soit l'éditeur de LLM qui en tire la valeur en s'en servant pour produire un succédané ? Cette méthode risque de couper la source de création et d'assécher à son tour les modèles.
Quand on achète un journal on achète pas l'exemplaire qu'on lit : On achète la possibilité d'en avoir d'autre plus tard
Quand tu achètes un journal, tu achètes l'objet et tu peux toujours en bénéficier (sous réserve de le conserver), ça ne dit rien sur la possibilité future d'avoir d'autres numéros (même si le business model de l'éditeur va normalement viser à ce que ce soit possible).

Et acheter le journal/le livre/etc. ne te donne pas pour autant le droit de faire n'importe quoi avec le contenu (genre un plagiat pour faire de l'argent en profitant d'un travail qui n'est pas le tien).
votre avatar
votre avatar
C'est non seulement totalement pourri en termes éthiques, mais c'est en plus contre productif à terme : qui va continuer à se casser le q à produire des contenus si c'est pour que ce soit l'éditeur de LLM qui en tire la valeur en s'en servant pour produire un succédané ?
C'est un peu l'histoire de l'humanité, ça, pourrir la vie de tout le monde sans s'occuper le moins du monde des conséquences même à court terme tant qu'il y a tant soit peu de fric à se faire.
Quand tu achètes un journal, tu achètes l'objet
En tous cas c'est pas du tout comme ça que moi je le conçois.
L'objet je peux aussi l'emprunter à la médiathèque, en faire une copie ou un scan chez moi puis le rendre, et j'aurais le contenu sans en avoir la propriété (ni matérielle, ni "morale" du contenu), et pourtant je pourrais en profiter et en faire profiter d'autre.
votre avatar
en faire une copie ou un scan chez moi puis le rendre
Je pense que ce serait toléré (parce que à petit volume), mais si tu te mets à en photocopier des milliers d'exemplaires et à les vendre, ça sera mal vu (euphémisme).
C'est un peu l'histoire de l'humanité, ça, pourrir la vie de tout le monde sans s'occuper le moins du monde des conséquences même à court terme tant qu'il y a tant soit peu de fric à se faire.
Je pense au contraire que la révolution industrielle, puis la révolution numérique (surtout) ont propulsé des personnes totalement étrangères à toute raison à des niveaux de fortune et de pouvoir impensables même à l'époque des monarques absolus.

Les rois de France, par exemple, ont suscité du mécontentement en réglementant le déboisement car ils ont accepté de voir qu'il y avait un problème et qu'il fallait le résoudre (même si ce n'était pas un problème pour le lendemain).

On n'est probablement collectivement pas vraiment plus déraisonnables qu'avant, mais non seulement on a la capacité technique de tout dévaster pour notre confort, mais en plus, on est tellement coupés de la réalité du monde naturel qu'on voit encore moins les limites et qu'on ne les accepte plus (surtout avec le mirage de la solution miracle qui ne manquera pas de survenir).
votre avatar
S’il avait su qu’OpenAI – dont Microsoft est un des principaux partenaires – avait moissonné des contenus placés derrière un paywall pour entraîner ses modèles IA, Nadella aurait invoqué le droit de Microsoft d’exiger le réentraînement des modèles sans ces données protégées.
Maintenant il le sait, donc qu'est-ce qu'il attend pour agir ?
A moins bien sûr que cette déclaration ne soit que pure hypocrisie...
votre avatar
Les producteurs de contenu sont également victimes de leur propes actions. À force de titres putaclic, les journaux en ligne (j'ai personnellement un abonnement à un quotidien) deviennent pénibles à lire. Régulièrement je vois en une un article du genre "Le trafic ferroviaire entre ces deux gares belges sera interrompu tout le week-end". Je suis obligé de cliquer sur l'article pour savoir si cette information m'impacte ou pas...

En pratique, ils gonflent leur taux de vues à mes dépens. Je me sens victime d'une espèce de guerre des boutons 2.0 : si j'aurais su, j'aurais pas v'nu.

Et puis ils viennent se plaindre qu'un autre acteur (attention, je ne dis pas que cet acteur est un bisounours) capte leur trafic en transformant cela en "Le service ferroviaire entre Grâce-Berleur et Hoût-Si-Ploût sera interrompu entre samedi 6h et dimanche 21h". Ouin, seuls les gens qui voulaient prendre cette ligne-là ce jour-là vont cliquer sur le lien pour avoir des détails, c'est trop injuste.

Comme dit OB, le problème des sites d'information est le financement, pas forcément les LLM.