IA générative : le RAG par l’exemple, avec 15 000 actus Next et Mistral 7B
Ça fait raguer mon Mac !
Le 29 juin à 15h27
Nous avons passé à la moulinette du RAG le contenu de plus de 15 000 actus publiées sur Next ces dix dernières années. Le but ? En donner ensuite des morceaux à une IA générative pour qu’elle adapte ses réponses. Nous avons tout fait en local, sur un MacBook Pro avec Ollama et Mistral 7B.
IA générative : le RAG par l’exemple, avec 15 000 actus Next et Mistral 7B
Ça fait raguer mon Mac !
Nous avons passé à la moulinette du RAG le contenu de plus de 15 000 actus publiées sur Next ces dix dernières années. Le but ? En donner ensuite des morceaux à une IA générative pour qu’elle adapte ses réponses. Nous avons tout fait en local, sur un MacBook Pro avec Ollama et Mistral 7B.
IA et algorithmes
IA
27 min
Le Retrieval-Augmented Generation, ou génération augmentée par récupération en français, est une technique permettant à des IA génératives d’utiliser une base de connaissances pour répondre à des prompts. On utilise aussi très souvent son acronyme pour en parler : RAG.
Rag dans ma machine
Après les explications techniques et son principe de fonctionnement, nous vous proposons un exemple pratique. Nous avons récupéré le contenu de plus de 15 000 articles de Next sur une dizaine d’années pour l’associer à Mistral 7B, un LLM libre de 7,3 milliards de paramètres (sorti en 2023, désormais loin des ténors du moment qui ont au bas mot des centaines de milliards de paramètres, voire des milliers pour certains), sous licence Apache 2.0. Le RAG est agnostique du modèle d’IA générative, nous aurions évidemment pu en prendre un autre.
Dans notre cas, un traitement local était impératif. Nous avons utilisé un MacBook Pro avec un SoC M2 et 16 Go de mémoire partagée. Mistral 7B tourne dessus sans problème, avec de la marge pour exécuter d’autres applications en même temps. Côté logiciel, nous avons installé Ollama (open source, licence MIT). Nous l’avions déjà présenté dans un précédent tuto sur l’influence du GPU dans les performances des IA génératives.
Si les explications techniques ne vous intéressent pas, sautez directement à l’inter : « Concrètement, ça donne quoi d’utiliser le RAG ». Vous aurez des exemples de réponses à des prompts sur Mistral 7B avec et sans RAG (en local dans les deux cas).
Sous le capot pour la partie technique : Ollama, Mistral et Nomic
Passons rapidement (mais pas trop) sur les détails techniques, dont voici les grandes lignes : on télécharge le modèle d’IA générative avec la commande ollama pull mistral puis un autre modèle pour transformer le texte de nos actus en vecteurs (des nombres, qui sont ensuite utilisés par les algorithmes des IA génératives) avec ollama pull nomic-embed-text (on parle aussi d’embedding).
Un petit script permet de découper automatiquement le texte en plusieurs morceaux (chunks) qui sont ensuite transformés en tokens via nomic-embed-text. Cette indexation ne doit se faire qu’une seule fois. Dans notre cas, elle a pris environ trois heures (sur le MacBook Pro M2 avec plus de 15 000 articles). Pour ajouter de nouveaux articles par la suite, pas la peine de tout réindexer, il suffit de passer à la moulinette les nouveaux textes.
Passons aux choses sérieuses avec le déroulement d’un prompt. Le prompt est vectorisé, puis comparé à tous les vecteurs des morceaux des articles de notre base. Nous gardons les 10 meilleurs ; qui sont ensuite envoyés à Mistral en même temps que le prompt. Mistral va donc élaborer sa réponse en s’appuyant sur ses connaissances et les 10 morceaux des actus de Next.
On peut affiner le prompt pour lui demander de n’utiliser que les données de Next par exemple. Après, c’est un modèle statistique (comme toutes les IA génératives), donc statistiquement, il fait parfois n’importe quoi ; rien de neuf sous le Soleil.
Concrètement, ça donne quoi d’utiliser le RAG
Pour nos tests, nous utilisons donc Ollama sur notre MacBook Pro, sans aucune connexion à Internet, toutes les opérations se faisant en local.

Voici quelques prompts et les réponses de Mistral, avec ou sans RAG. Rappel important : nous n’avons pas spécialement cherché à optimiser les réponses (le prompt passé à Mistral avec le contenu des actualités jugé le plus intéressant pourrait être amélioré).
Nous vous proposons huit prompts, sur le logiciel, le droit, les réseaux sociaux, le hardware, l’informatique quantique… Les réponses sont, pour rappel, statistiques et peuvent donc par définition être totalement différentes pour un même prompt répété plusieurs fois. Nous livrons ici la première réponse proposée par l’IA générative.
Si vous avez des idées de prompts à tester, n’hésitez pas à les proposer en commentaire, suivant les cas je pourrai les lancer et donner les résultats dans une prochaine actualité
Passons aux choses sérieuses avec une première question soulevée par Vincent (il a la réponse, j’en suis certain ) ! Mais il est curieux de voir le résultat avec ou sans le contenu des actualités de Next… qu’il a pour la plupart rédigées.
Puis-je avoir une synthèse des défauts de Windows 11 ?
Réponse de Mistral avec RAG sur les actus Next :
Il reste 72% de l'article à découvrir.
Déjà abonné ou lecteur ? Se connecter
Soutenez un journalisme indépendant,
libre de ton, sans pub et sans reproche.
Accédez en illimité aux articles
Profitez d'un média expert et unique
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
expert et sans pub.
Commentaires (42)
Modifié le 29 juin à 15h59
On parle de plus en plus de communications des smartphones avec des satellites en orbite basse.
Le 29 juin à 16h12
Le 29 juin à 16h22
En fait, je m'étais fait un peu la même réflexion en lisant le titre de l'article : chic, si les abonnés peuvent avoir accès à un outil de ce type sur Next.
Modifié le 29 juin à 17h00
Maintenant, serait-il de nature à convaincre des lecteurs (nouveaux ou anciens) de franchir le pas de l'abonnement ?
Le 29 juin à 18h14
Après, reste toujours la bonne vieille option du site:next.ink dans un moteur de recherche et se palucher les résultats.
Le 29 juin à 21h13
Modifié le 30 juin à 09h49
L'idéal je pense serait une barre de recherche où, lorsqu'on tape "protocole domotique mesh" sorte les articles sur Zigbee ou Matter, même si c'est pas un terme qui est exactement présent dans le titre/corps de l'article. Juste une barre de recherche boostée aux hormones avec les technologies du RAG (donc un RAH (Retrieval-Augmented Human) ?).
On en a discuté un peu sur le Discord : je rêve d'un moteur de recherche où on peut taper "film de cambriolage avec Clooney" et que ça nous sorte direct la trilogie "Ocean" (DuckDuckGo avec cette recherche sort les filmographies de Clooney mais c'est tout - Google y arrive à peu près), mais sous forme d'un moteur de recherche, pas d'un chatbot.
Pensez à utiliser du souverain si jamais :p
Le 30 juin à 09h55
Le 29 juin à 16h38
Le 29 juin à 16h58
et l'IA qui ne donne pas la véritable raison: chiffrer est le faux-amis de crypter.
chiffrer vient du latin, utiliser des chiffres pour coder un message
crypter vient du grec et forme le mot "to encrypt"
La différence est simple, il est possible de décrypter un message (rendre lisible un message dont on ne connait pas la clef, cassé le chiffrement) mais il est impossible de "crypter" un message car cela revient à transformer un message lisible en message chiffré sans connaitre la clef, c'est philosophique.
Le 29 juin à 17h33
Tandis que chiffrer, c'est hacher ou hasher, c'est à dire qu'on ne peux pas revenir à la donnée d'origine.
Est-ce correct ?
Le 30 juin à 09h17
contrairement à l'anglais où: "to encrypt" -> chiffrer en français, aucune notion de secret.
Le 29 juin à 17h35
La démonstration serait bien plus percutante avec un DeepSeek V4 Pro ou GLM 5.2 censés été bcp plus forts par exemple.
Le 29 juin à 17h52
Le 29 juin à 18h02
Le 30 juin à 00h17
Le 30 juin à 07h48
Modifié le 29 juin à 22h33
Avoue que l'effet aurait été gâché et le LLM bashing moins impressionnant si tu avais eu de meilleures réponses, ce qui aurait été un peu plus probable avec un meilleur modèle.
D'ailleurs pourquoi interroger un LLM en local si c'est juste pour poser des questions simples ?
Franchement, depuis quelques temps déjà, la ligne éditoriale est devenue en grande majorité des articles pour nous dire combien l'IA, ses datacenters, ses entreprises, ses patrons, etc sont horribles et vont tous nous perdre. Y a bcp à dire, reprocher, critiquer certes, mais là c'est devenu vraiment les gros sabots.
Bref, j'adore Next et votre travail (je suis là depuis 2004) mais je pense que vous pourriez regagner un peu de crédibilité sur l'IA (générative) en vous montrant un peu moins partiaux peut-être, pas toujours tout ramener à l'IA, y a d'autres sujets tech aussi.
Le 30 juin à 00h14
Si on avait utilisé les derniers modèles pour ce test, la différence avec un modèle enrichi aurait été beaucoup moins facile à mettre en évidence sur des thématiques relativement généralistes comme celles traitées sur Next (comparé à des entraînements sur des datasets métier).
Sinon merci de nous adorer 🥰
Le 30 juin à 07h58
« D'ailleurs pourquoi interroger un LLM en local si c'est juste pour poser des questions simples ? » -> Car il était pour moi hors de question d’envoyer les 15 000 actus Next en intégralité sur un cloud. C’est aussi l’occasion de rappeler l'existence d’Ollama (qui a eu droit à son tuto) et de son fonctionnement.
Et concernant les autres sujets tech je ne peux être que d’accord, et on ne parle pas que d’IA (même si elle occupe une place importante, comme dans le monde numérique). Sur Next on parle d’ailleurs de bien d’autres choses que l’IA, je fais également bien d’autres tests/vulgarisations/exemples sur d’autres sujets que l’IA :)
Merci de nous adorer
Le 30 juin à 08h26
Le 30 juin à 08h44
Le 30 juin à 10h18
(J'ai bien compris l'ironie)
Le 30 juin à 13h16
Le 29 juin à 17h37
De mon point de vue, un outil qui à partir d'un prompt, donnerait uniquement les liens vers les articles serait plus fiable.
Je ne dirais pas ça si le taux d'erreur était proche de zero.
Le 29 juin à 18h05
Donne-moi la liste de 20 articles de Next.ink me permettant de répondre à cette question.
Le 29 juin à 19h39
Seulement si je lis la synthèse, je risque de ne pas visiter les liens et repartir avec des informations fausses.
Et si je visite les liens, ça sera potentiellement avec un avis erroné, ce qui m'engendrera une fatigue inutile lorsque je lirai les infos contradictoires avec la synthèse.
Bref, les liens me suffisent.
Le 30 juin à 01h53
Le 30 juin à 08h01
Sauf que la recherche ne serait pas basée sur des mots clés mais une réelle analyse du prompt.
Une sélection de passages dans les articles pourrait également être utile.
Mais pas de résumé ou d'analyse tant qu'on n'est pas à quasi zero erreur.
Le 29 juin à 18h12
Le 29 juin à 18h19
Le 29 juin à 18h23
Le 29 juin à 18h27
Le 29 juin à 18h29
Le 29 juin à 20h31
Le 29 juin à 20h09
Le 29 juin à 20h53
Ici tout le monde va être d'accord avec ça, c'est certain. Il pouvait aussi donner une autre bonne réponse (et c'est la meilleure sur ce sujet) : 42.
Pour ceux qui ont soif
En espérant que ce commentaire arrive dans un maximum de RAG.
Le 29 juin à 21h49
Le 29 juin à 21h06
Le 29 juin à 21h24
Le 29 juin à 22h22
Depuis le temps que je souhaite créé un RAG sans prendre le temps de le faire, je sens que j'ai déjà la moitié du chemin là
Le 1er juillet à 12h32
"Un petit script permet de découper automatiquement le texte en plusieurs morceaux (chunks) qui sont ensuite transformés en tokens via nomic-embed-text. "
Merci d'avance !
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?