Les sous-titres de plus de 53 000 films et 85 000 épisodes de séries utilisés pour entraîner des IA
I'll be back
Inclus dans la fameuse archive The Pile, un ensemble de sous-titres tirés du site OpenSubtitles est utilisé depuis plusieurs années par des entreprises comme Apple, Anthropic, Meta ou Nvidia pour entraîner leurs IA génératives.
Le 25 novembre à 14h20
4 min
IA et algorithmes
IA
Pour entrainer les modèles de langage, les entreprises d'IA génératives ont besoin de quantités massives de données pour que leurs outils puissent générer des contenus les plus proches possibles de contenus créés par des humains.
Elles utilisent le travail des « data workers » pour obtenir des données. Mais, comme nous l'avons plusieurs fois évoqué ici, elles puisent aussi dans des bases de données de contenus dont la légalité est discutée.
En début d'année, nous montrions que Midjourney recrache, parfois sans même qu’on le lui demande, des images Pixar et d'œuvres protégées.
Les IA génératives entrainées sur les dialogues du Parrain ou de Pulp Fiction
La semaine dernière, The Atlantic a expliqué que plusieurs de ces modèles utilisent des milliers de sous-titres de films pour leur entrainement. Cela expliquerait que des auteurs de dialogues puissent régulièrement retrouver leur travail dans les réponses des chatbots comme ChatGPT.
Pour le vérifier, le média américain a téléchargé The Pile, une archive déjà pointée du doigt, par exemple dans un procès contre NVIDIA, pour compiler des livres numériques protégés par le copyright. The Atlantic y a recensé plus de 53 000 fichiers de sous-titres de films et 85 000 d'épisodes de séries. Y figurent des films comme Le Parrain, Pulp Fiction ou encore Star Wars: Clone Wars.
Tous ces sous-titres viennent, de fait, du site de téléchargement de sous-titres Opensubtitles. Si les auteurs de The Pile n'ont pas caché avoir rassemblé près de 20Go de données venant de ce site, l'information a été peu (si ce n'est pas) relevée.
De GPT-3 à de récents modèles d'Apple
L'archive The Pile n'a pas seulement été utilisée par NVIDIA. GPT-3 d'OpenAI est cité comme exemple par le site du groupe de recherche EleutherAI qui a créé l'archive, même si OpenAI a détruit les jeux de données avec lesquels elle a entrainé ses premiers modèles.
Les modèles OPT de Meta, en 2022, et les modèles OpenELM d'Apple, créés en avril dernier, s'appuient aussi sur The Pile, expliquent dans leurs articles les chercheurs des deux entreprises [PDF, PDF]. Et sur Hugging Face, plus de 220 modèles utilisant cette archive sont recensés.
Les sous-titres, une source pour le rythme et le style des discussions orales
Si les livres utilisés par les entreprises d'IA génératives pour entraîner leurs IA leur permettent de générer des textes proches de ce que peuvent créer les écrivains, les sous-titres leur amènent d'autres données précieuses sur la langue. Ils sont une source d'information importante sur la façon dont sont rythmées nos conversations, ainsi que le style linguistique que les humains utilisent à l'oral.
Sur son site, le syndicat des auteurs britanniques WGGB a réagi en affirmant que les écrivains « sont à juste titre en colère et préoccupés par cette nouvelle ». Il indique s'opposer « fermement à cette mainmise sur le travail des écrivains et a mené une campagne et un lobbying acharnés sur cette question ». Il demande à ce que les auteurs soient rémunérés pour l'utilisation de leur travail de cette manière et qu'un organisme de régulation soit mis en place.
The Atlantic a créé un petit outil permettant de rechercher les sous-titres de tel film, telle autrice ou tel acteur.
Les sous-titres de plus de 53 000 films et 85 000 épisodes de séries utilisés pour entraîner des IA
-
Les IA génératives entrainées sur les dialogues du Parrain ou de Pulp Fiction
-
De GPT-3 à de récents modèles d'Apple
-
Les sous-titres, une source pour le rythme et le style des discussions orales
Commentaires (6)
Vous devez être abonné pour pouvoir commenter.
Déjà abonné ? Se connecter
Abonnez-vousAujourd'hui à 15h20
La guilde des auteurs aux USA doivent avoir un peu la haine. ^^'
Modifié le 25/11/2024 à 15h31
D'un coté je me dis que quand même ces entreprises qui gagnent des milliards (allez des millions) de dollard ne paie pas le coût des efforts fait.
D'un autre coté si les documents sont libre d'accès sans contraites nous n'avons rien à dire.
Indépendement sur le fond, je vois quand même un problème avec l'asuge des soustitres car ce n'est pas seulement une traduction mais aussi une interpréation subjectif aussi.
(conf. les vidéo youtube de MisterFOX
par exemple : YouTube
Aujourd'hui à 15h30
Donc tout en punchline? Ou version Achille Talon "Cher Lefuneste, nonobstant l'intérêt particulier porté à la simulation intellectuelle assistée par calculateur, j'épanche ma soif littéraire littéralement avec des bulles, à l'opposé de la bière dont le pouvoir désaltérateur est à l'inverse ces dernières. Hop."
Aujourd'hui à 15h38
f ma remarque, car justement les "bons" créateurs de sous titre traduisent moins qu'ils intreprètent car il faut que le temps de lecteur soit aussi cohérent avec le temps de la scène. ~~y
En fin de compte le propos est juste j'avais oublié le volet livre de la chose.
My bad.
Aujourd'hui à 16h22
De plus, pour ce qui est d'Opensubtitles, il faudrait savoir comment le contenu a été récupéré. De ce que je lis sur le site, pour récupérer d'importantes quantités de données sans se faire bannir, il faut les consulter. Par contre, le statut légal de ces données n'est pas très clair, la page fait assez brouillon. L'usage commercial est soumis aux lois US et "étrangères" sur le Copyright. On lit aussi : Dans ce cas, c'est chaque auteur de traduction qui doit se prononcer sur la légalité de l'usage.
On revient donc toujours aux mêmes questions : l'usage de ce type de données pour l'entraînement est-il commercial, entre-t-il dans le fair use ?
Il serait intéressant de demander aux deux parties (The Pile et Opensubtitles) si les données ont été récupérées avec l'accord de Opensubtitles ou non. Cela apporterait au moins une information intéressante.
Aujourd'hui à 16h39