Connexion
Abonnez-vous

Les sous-titres de plus de 53 000 films et 85 000 épisodes de séries utilisés pour entraîner des IA

I'll be back

Les sous-titres de plus de 53 000 films et 85 000 épisodes de séries utilisés pour entraîner des IA

Inclus dans la fameuse archive The Pile, un ensemble de sous-titres tirés du site OpenSubtitles est utilisé depuis plusieurs années par des entreprises comme Apple, Anthropic, Meta ou Nvidia pour entraîner leurs IA génératives.

Le 25 novembre à 14h20

Pour entrainer les modèles de langage, les entreprises d'IA génératives ont besoin de quantités massives de données pour que leurs outils puissent générer des contenus les plus proches possibles de contenus créés par des humains.

Elles utilisent le travail des « data workers » pour obtenir des données. Mais, comme nous l'avons plusieurs fois évoqué ici, elles puisent aussi dans des bases de données de contenus dont la légalité est discutée.

En début d'année, nous montrions que Midjourney recrache, parfois sans même qu’on le lui demande, des images Pixar et d'œuvres protégées.

Les IA génératives entrainées sur les dialogues du Parrain ou de Pulp Fiction

La semaine dernière, The Atlantic a expliqué que plusieurs de ces modèles utilisent des milliers de sous-titres de films pour leur entrainement. Cela expliquerait que des auteurs de dialogues puissent régulièrement retrouver leur travail dans les réponses des chatbots comme ChatGPT.

Pour le vérifier, le média américain a téléchargé The Pile, une archive déjà pointée du doigt, par exemple dans un procès contre NVIDIA, pour compiler des livres numériques protégés par le copyright. The Atlantic y a recensé plus de 53 000 fichiers de sous-titres de films et 85 000 d'épisodes de séries. Y figurent des films comme Le Parrain, Pulp Fiction ou encore Star Wars: Clone Wars.

Tous ces sous-titres viennent, de fait, du site de téléchargement de sous-titres Opensubtitles. Si les auteurs de The Pile n'ont pas caché avoir rassemblé près de 20Go de données venant de ce site, l'information a été peu (si ce n'est pas) relevée.

De GPT-3 à de récents modèles d'Apple

L'archive The Pile n'a pas seulement été utilisée par NVIDIA. GPT-3 d'OpenAI est cité comme exemple par le site du groupe de recherche EleutherAI qui a créé l'archive, même si OpenAI a détruit les jeux de données avec lesquels elle a entrainé ses premiers modèles.

Les modèles OPT de Meta, en 2022, et les modèles OpenELM d'Apple, créés en avril dernier, s'appuient aussi sur The Pile, expliquent dans leurs articles les chercheurs des deux entreprises [PDF, PDF]. Et sur Hugging Face, plus de 220 modèles utilisant cette archive sont recensés.

Les sous-titres, une source pour le rythme et le style des discussions orales

Si les livres utilisés par les entreprises d'IA génératives pour entraîner leurs IA leur permettent de générer des textes proches de ce que peuvent créer les écrivains, les sous-titres leur amènent d'autres données précieuses sur la langue. Ils sont une source d'information importante sur la façon dont sont rythmées nos conversations, ainsi que le style linguistique que les humains utilisent à l'oral.

Sur son site, le syndicat des auteurs britanniques WGGB a réagi en affirmant que les écrivains « sont à juste titre en colère et préoccupés par cette nouvelle ». Il indique s'opposer « fermement à cette mainmise sur le travail des écrivains et a mené une campagne et un lobbying acharnés sur cette question ». Il demande à ce que les auteurs soient rémunérés pour l'utilisation de leur travail de cette manière et qu'un organisme de régulation soit mis en place.

The Atlantic a créé un petit outil permettant de rechercher les sous-titres de tel film, telle autrice ou tel acteur.

Commentaires (6)

Vous devez être abonné pour pouvoir commenter.

Abonnez-vous
votre avatar
Il demande à ce que les auteurs soient rémunérés pour l'utilisation de leur travail de cette manière et qu'un organisme de régulation soit mis en place.
Heureusement qu'ils sont pas aux USA, car la tendance y est l'inverse en ce moment.
La guilde des auteurs aux USA doivent avoir un peu la haine. ^^'
votre avatar
Je suis toujours partagé avec ce type de pratique :
D'un coté je me dis que quand même ces entreprises qui gagnent des milliards (allez des millions) de dollard ne paie pas le coût des efforts fait.
D'un autre coté si les documents sont libre d'accès sans contraites nous n'avons rien à dire.

Indépendement sur le fond, je vois quand même un problème avec l'asuge des soustitres car ce n'est pas seulement une traduction mais aussi une interpréation subjectif aussi.

(conf. les vidéo youtube de MisterFOX
par exemple : youtube.com YouTube
votre avatar
On va avoir des IA qui parlent comme des héros de série ou des perso de BD.
Donc tout en punchline? Ou version Achille Talon "Cher Lefuneste, nonobstant l'intérêt particulier porté à la simulation intellectuelle assistée par calculateur, j'épanche ma soif littéraire littéralement avec des bulles, à l'opposé de la bière dont le pouvoir désaltérateur est à l'inverse ces dernières. Hop."
votre avatar
~~Oui pour le 1er exemple, moins pour le second.
f ma remarque, car justement les "bons" créateurs de sous titre traduisent moins qu'ils intreprètent car il faut que le temps de lecteur soit aussi cohérent avec le temps de la scène. ~~y

En fin de compte le propos est juste j'avais oublié le volet livre de la chose.
My bad.
votre avatar
Mais, comme nous l'avons plusieurs fois évoqué ici, elles puisent aussi dans des bases de données de contenus dont la légalité est discutée.
Pour The Pile dont il s'agit ici, leur point de vue sur la légalité est expliqué dans leur papier au § 7.1, ils pensent évidement être dans la légalité. Comme je l'ai déjà dit, seule la justice US (qui semble être concernée ici) peut dire si l'usage est légal ou pas.
De plus, pour ce qui est d'Opensubtitles, il faudrait savoir comment le contenu a été récupéré. De ce que je lis sur le site, pour récupérer d'importantes quantités de données sans se faire bannir, il faut les consulter. Par contre, le statut légal de ces données n'est pas très clair, la page fait assez brouillon. L'usage commercial est soumis aux lois US et "étrangères" sur le Copyright. On lit aussi :
we mainly provide movie's subtitles translated by users.
Dans ce cas, c'est chaque auteur de traduction qui doit se prononcer sur la légalité de l'usage.
On revient donc toujours aux mêmes questions : l'usage de ce type de données pour l'entraînement est-il commercial, entre-t-il dans le fair use ?

Il serait intéressant de demander aux deux parties (The Pile et Opensubtitles) si les données ont été récupérées avec l'accord de Opensubtitles ou non. Cela apporterait au moins une information intéressante.
votre avatar
Le site est illégal. Les sous-titres sont soient récupérés illégalement des DVD / BluRay / plateformes de SVOD… soient traduits par des amateurs (fansub) sans autorisation des ayants droits.

Les sous-titres de plus de 53 000 films et 85 000 épisodes de séries utilisés pour entraîner des IA

  • Les IA génératives entrainées sur les dialogues du Parrain ou de Pulp Fiction

  • De GPT-3 à de récents modèles d'Apple

  • Les sous-titres, une source pour le rythme et le style des discussions orales

Fermer