Connexion Premium

Modération : on a testé Shieldstral de Mistral sur un million de commentaires Next

Sword offline

Modération : on a testé Shieldstral de Mistral sur un million de commentaires Next

Illustration : Flock

Mistral vient d’annoncer son modèle local (avec des poids ouverts) pour la modération. Nous l’avons testé sur un million de commentaires Next, avec trois instructions différentes. Les résultats sont riches en enseignements.

Shieldstral (ou plus précisément Shieldstral-1.0-3B) est un modèle de 3,8 milliards de paramètres, qui occupent 7,7 Go de mémoire à eux seuls. Développé par une entreprise française – Mistral –, nous avons voulu tester son fonctionnement. Nous avons à disposition les commentaires laissés par les lecteurs de Next (qu’ils aient été modéré ou non), utilisons-les… en local, évidemment. Il y a peu, nous avons utilisé les actus de Next pour vous présenter le RAG par l’exemple.

La première étape consiste à déployer le « petit » modèle Shieldstral de Mistral sur un serveur avec un GPU capable de tenir la charge. Nous avons utilisé une machine avec une RTX 4000 Ada, une carte avec 20 Go de mémoire. C’est largement suffisant pour charger les près de 8 Go des poids et laisser de la marge pour le cache et le traitement des données.

Nous avons lancé trois « runs » avec trois duos d’instructions/questions au modèle Shieldstral. Toute l’inférence a été effectuée en local sur la machine, bien évidemment, aucune donnée n’a été envoyée à Mistral. Chaque run prenait entre 4h30 et 5 h pour un million de commentaires (extrait de la base de données de Next). Il s’agissait en effet de grosses passes. Traiter quelques milliers de commentaires ne prend qu’une minute, par exemple.

Pour notre expérience, nous avons repris l’exemple de base de Mistral (dans le readme) adapté à nos besoins. Le SYSTEM_PROMPT est toujours le même : « Judge whether the Document meets the requirements based on the Query and the Instruction provided. Note that the answer can only be « yes » or « no » ». Il doit être en anglais (comme expliqué page 23 de ce docucment), peu importe la langue des commentaires à analyser.

Un million de commentaires, trois passes différentes de Shieldstral

Première passe (alias Passe Next) avec une longue instruction détaillée, inspirée d’un billet de Vincent sur le sujet et de nos règles :

INSTRUCTION:
  Tu modères les commentaires de Next, site d'actualité technologique
  francophone doté d'une communauté forte et ancienne pour certains.

  Quatre règles régissent cet espace : rester dans le sujet de l'article, être
  respectueux, argumenter (particulièrement quand l'opinion est tranchée), ne
  pas faire de publicité gratuite.

  Ce que la communauté autorise : le désaccord franc, l'humour, l'ironie, la
  critique sévère d'une entreprise, d'un produit, d'une décision politique ou
  d'une personnalité publique, la connivence entre habitués. Les échanges
  techniques nourris et les avis tranchés mais argumentés sont la raison d'être
  de cet espace et ne doivent jamais être signalés.

  Ce que la communauté refuse :- l'insulte ou l'attaque personnelle visant un autre commentateur ou un membre
  de la rédaction ;- le troll : un avis tranché, sans argumentation, visant uniquement à faire
  réagir ;- le sarcasme méprisant ou dédaigneux adressé à une personne ;- le hors-sujet manifeste qui détourne la discussion de l'article ;- la publicité gratuite pour un produit, un service ou un site ;- l'incitation à la haine ou à la violence envers un groupe en raison de son
  origine, sa religion, son genre, son orientation sexuelle ou son handicap, y
  compris exprimée poliment ;- l'injure et la diffamation visant une personne identifiable ;- les menaces de violence physique ;- le contenu sexuellement explicite ;- la divulgation de données personnelles.

  Critère décisif : la présence d'un argument. Une opinion dure mais étayée
  reste légitime, même sur un sujet clivant. La même opinion assénée sans
  justification, ou enrobée de mépris pour l'interlocuteur, ne l'est pas.
  Distingue la critique des idées, toujours acceptable, de l'attaque des
  personnes, qui ne l'est pas.

  Nuance importante : mentionner, citer ou discuter un contenu problématique
  n'est pas l'endosser. Un commentaire qui rapporte des propos haineux pour les
  dénoncer, qui débat d'une affaire judiciaire ou qui analyse un phénomène
  criminel ne doit pas être signalé.

  QUESTION:
  Ce commentaire enfreint-il l'une des règles de modération énoncées ?

Dans le deuxième cas (alias Passe édito), on compresse un peu le message :

INSTRUCTION:
  Tu modères les commentaires de Next, site d'actualité technologique
  francophone.

  Applique une tolérance modérée : le désaccord franc, l'humour, l'ironie et le
  second degré explicite, la critique sévère (entreprise, produit, décision
  politique, personnalité publique), et les avis tranchés mais argumentés sont
  autorisés et ne doivent jamais être signalés. Mentionner, citer ou discuter un
  propos problématique pour le rapporter ou le dénoncer n'est pas l'endosser.
  Prendre position dans un débat géopolitique, historique ou religieux n'est pas
  une infraction, même avec un vocabulaire fort. Juge sur le sens global du
  commentaire, pas sur une phrase isolée.

  Signale uniquement s'il relève d'une de ces catégories :- insulte ou attaque personnelle envers un commentateur ou la rédaction
- incitation à la haine ou à la violence envers un groupe en raison de son
  origine, sa religion, son genre, son orientation sexuelle ou son handicap
- menace de violence physique
- injure ou diffamation visant une personne identifiable : l'attaque porte sur
  la personne elle-même plutôt que sur ses actes, ses propos ou ses décisions
- contenu sexuellement explicite
- divulgation de données personnelles
- publicité manifeste pour un produit, un service ou un site
- troll : opinion tranchée assenée sans le moindre élément de justification,
  ni fait, ni exemple, ni raisonnement

  QUESTION:
  Ce commentaire enfreint-il l'une des règles de modération énoncées ?

Enfin, un troisième run ainsi sous la forme d’une modération « légale » (alias Passe légale) :

INSTRUCTION:
  Tu évalues des commentaires publiés sur un site d'actualité francophone au
  regard du droit français, principalement la loi du 29 juillet 1881 sur la
  liberté de la presse.

  Applique une tolérance élevée : la liberté d'expression est le principe, la
  restriction l'exception. La critique, même violente, d'une entreprise, d'un
  produit, d'une institution, d'une politique publique ou des actes d'une
  personnalité publique est licite. La grossièreté, l'ironie et le mauvais goût
  ne sont pas des délits. Mentionner, citer ou dénoncer un propos illicite n'est
  pas le commettre.

  Signale uniquement ce qui constitue une infraction pénale :- injure publique : expression outrageante visant une personne identifiable,
  sans imputation d'un fait précis
- diffamation publique : imputation d'un fait précis portant atteinte à
  l'honneur d'une personne identifiable
- provocation à la discrimination, à la haine ou à la violence envers un
  groupe ou une personne en raison de son origine, son ethnie, sa nation, sa
  race, sa religion, son sexe, son orientation sexuelle, son identité de genre
  ou son handicap
- contestation de crime contre l'humanité- apologie de crimes de guerre, de crimes contre l'humanité, d'esclavage ou de
  collaboration
- apologie ou provocation au terrorisme
- menace de mort ou d'atteinte à l'intégrité physique
- harcèlement moral, notamment par propos répétés
- diffusion de données personnelles permettant d'identifier ou de localiser
  une personne dans le but de lui nuire
- diffusion d'images à caractère sexuel sans consentement, ou de contenu
  pédopornographique

  QUESTION:
  Ce commentaire constitue-t-il une infraction pénale au regard du droit
  français ?

Entre 0,3 et 5,2 % de commentaires signalés lors des runs Shieldstral

Ces trois runs (de 5 h chacun environ) correspondent donc à la Passe Next, Passe édito et Passe légale par la suite. À chaque fois, un million de commentaires sont ainsi passés à la moulinette. Ce ne sont que trois exemples, nous ne sommes pas des experts sur le sujet, il est donc certainement possible de faire mieux, mais cela permet déjà d’en tirer de premières conclusions et d’appréhender le fonctionnement de Shieldstral.

Il reste 46% de l'article à découvrir.

Cadenas en colère - Contenu premium

Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.

Accédez en illimité aux articles

Profitez d'un média expert et unique

Intégrez la communauté et prenez part aux débats

Partagez des articles premium à vos contacts

Commentaires (6)

votre avatar
Le fil à plus de 10 000 commentaires était de la partie ? 🤭
votre avatar
Très intéressant, merci pour cet article !

Pour aller plus loin : est-ce que vous prévoyez de le déployer, pas forcément pour une modération automatisée, mais a minima pour de l'alerte automatisée ?

De plus, est-ce que vous avez été mené à supprimer des commentaires qui étaient passés entre les mailles du filet de la modération pendant ce test ?
votre avatar
Pour aller plus loin : est-ce que vous prévoyez de le déployer, pas forcément pour une modération automatisée, mais a minima pour de l'alerte automatisée ?
L'outil pourrait avoir un intérêt pour qualifier un commentaire signalé par une personne, je pense. Selon l'évaluation, il pourrait aider à prioriser les revues de messages.
votre avatar
Nop, je n’ai pas modéré de commentaire suite à ce test (mais j’ai pas regardé tous les signalements à >0.5 dans les différentes instructions)
votre avatar
On peut avoir l'instruction donnée à SwordIA ?
votre avatar
Je sais pas si vous avez pu accéder à cette info mais j’imagine que le top des utilisateurs que l’IA sword n’a pas trop du vous surprendre - je n’ai plus aucun pseudo problématique en tête. L’époque où certains commentateurs chevronnés me navraient est bien loin !