Connexion Premium

Les IA médicales génèrent des erreurs dans les diagnostics et les noms de médicaments

IA bobo

Les IA médicales génèrent des erreurs dans les diagnostics et les noms de médicaments

Illustration : Flock

Alors qu’un nombre croissant de médecins recourent à l’IA pour enregistrer et retranscrire leurs consultations, un organisme de surveillance du système de santé publique britannique alerte sur la propension de ces dispositifs à générer des erreurs. Ces dernières peuvent avoir de réelles répercussions sur la vie des patients.

Le recours à des technologies d’IA pour enregistrer et retranscrire les consultations peut mener à des erreurs dans le rendu des diagnostics et des noms de médicaments, alerte Healthwatch England. Ce dernier agit comme organisme de surveillance du National Health System (NHS), le système public de santé britannique.

Alors qu’elle s’appuyait sur la transcription générée par IA d’un entretien avec son praticien, une patiente a par exemple été choquée d’apprendre qu’elle était atteinte de démyélinisation, rapporte the Guardian. Le diagnostic était faux : le produit d’une erreur, ou « hallucination », de la machine utilisée pour transcrire les échanges. Ce n’est qu’une fois vérifiés les résultats d’une IRM passée à l’hôpital qu’elle a pu constater que le résultat correct aurait dû être transcrit en « absence de démyélinisation ».

Dans un autre cas, un patient s’est rendu compte qu’un système de transcription par IA avait mélangé deux noms de médicaments. Plutôt que de retranscrire celui réellement prescrit, il en avait inscrit un second, au nom proche. Là encore, c’est le patient qui s’est aperçu de l’erreur, plutôt que le médecin. Dans une troisième affaire, la machine n’avait pas retranscrit le caractère répétitif de la prescription médicamenteuse, ce qui aurait pu laisser le patient, souffrant de migraine, sans possibilité d’obtenir ses médicaments s’il ne s’était pas aperçu du problème.

Outils de santé et IA : des technologies toujours plus poreuses

Ces histoires ne sont que quelques cas parmi de multiples erreurs : pour Healthwatch England, ce type de fautes de transcription dues au recours à l’IA pourrait poser de réels dangers pour la sécurité des patients. Un enjeu d’autant plus important qu’en dehors de la NHS, au Royaume-Uni, nombreux sont les services et logiciels médicaux à intégrer de l’IA générative, en particulier des outils d’enregistrement et de retranscription, dans les outils qu’ils fournissent à leur clientèle médicale.

En sens inverse, des moteurs grand public déploient désormais des fonctionnalités dédiées à renforcer leur usage par un public de professionnels de la médecine. Chez Open AI, ChatGPT Health intègre désormais un système de gestion électronique des dossiers patients, auquel les praticiens états-uniens peuvent recourir pour importer leurs dossiers puis questionner le moteur.

Au Royaume-Uni, où au moins 27 « scribes IA » différents sont déjà utilisés par le personnel de santé, la NHS pousse pour le déploiement généralisé de ce type de technologies. D’après un plan gouvernemental pensé sur dix ans, ces dernières permettront en effet de « libérer les équipes de leur charge administrative », leur rendant de ce fait du temps pour le soin des patients.

Qualifier les robots de transcription d’outils de santé ?

Si la promesse est belle, elle fait pour le moment peu de cas de la propension de ces technologies à générer du faux ou de l’inexistant, ce que critiquent Healthwatch England et certaines associations de patients. Parmi les autres dysfonctionnements déjà connus, la question des biais de représentation est tout à fait prévalente dans les applications de l’IA générative à la santé.

Pour de mêmes symptômes, des outils utilisés par le grand public tendent par exemple à recommander aux hommes d’aller aux urgences et aux femmes d’attendre de trouver un rendez-vous chez le médecin. Dans les contextes où des professionnels de santé génèrent des cas cliniques synthétiques, notamment pour préserver les données de patients réels, les machines surévaluent certains risques médicaux masculins et sous-représentent des risques répandus chez les femmes. Du côté des machines de transcription, certains accents sont moins compris que d’autres, ce qui rend la qualité de la transcription des échanges variable selon l’expression du ou de la patiente – dans certains cas, ces derniers ne parviennent pas à passer l’étape du répondeur automatisé.

Pour Healthwatch England, ces différents éléments rendent « inquiétant » le fait de ne pas faire entrer les « scribes IA » des médecins dans la catégorie juridique des dispositifs de santé, ce qui permettrait de les encadrer comme ces technologies dédiées.

Au sein de l’Union européenne, ce type de dispositifs est régulé par différents textes, dont le règlement sur l’intelligence artificielle et le règlement relatif à l’espace européen des données de santé. Le premier des deux fonctionne sur un système de niveaux de risque, la santé étant généralement considérée comme un domaine nécessitant des précautions avancées.

Pour autant, une cinquantaine de chercheurs internationaux regrettaient fin 2025 l’absence d’évaluation complète et rigoureuse sur le déploiement des technologies d’IA, notamment génératives, dans les usages des professionnels de santé.

Commentaires (33)

votre avatar
Les médecins qui laissent passer de telles erreurs sont bien responsables d'elles, juridiquement parlant, non ?
votre avatar
Toujours la même logique, présente aussi dans l'administration.

Le grand saint et omnipotent ordinateur/IA/logiciel a toujours raison !
:roll:
votre avatar
OK, mais quand il a tort, et qu'il y a des conséquences (imaginez qu'une IA fasse qu'on donne un mauvais médicament à une personne et qu'elle en tombe malade), c'est bien le médecin prescripteur qui devra "payer", j'espère.
Ça aiderait à ce qu'ils fassent très attention. Et les assurances pourraient aussi mettre ainsi la pression sur la vérification des prescriptions.
votre avatar
Le problème majeur c'est que ça peut tuer le patient une mauvaise prescription.

Et là, je préfère que l'on évite ce cas que rechercher a posteriori le responsable de la mort.

Donc, interdire un outil d'IA générative dans les cas où ça peut mettre en danger la vie d'une personne me semble la seule solution.
votre avatar
Je dirais la vie et la santé. Donc dans le medical, tous les cas.
Et puis quand la NHS affirme que ça va faire gagner du temps, c'est en théorie faux.
En effet une utilisation responsable implique de vérifier intégralement la réponse de l'IA et de corriger ses erreurs. Ce qui à mon avis fait plutôt perdre du temps.
votre avatar
Ici on parle de retranscription, pas de diagnostic. Donc ce n'est pas différent du toubib qui enregistre sur dictaphone et demande à sa secrétaire de le taper comme on a depuis plus de 50 ans. Il ne mettra pas plus de temps à relire le texte écrit par l'IA que par la secrétaire.
votre avatar
Je pense que la secrétaire a un esprit critique suffisant pour signaler au médecin si quelque chose la chiffonne et qu'elle ne va pas halluciner, sauf si elle a pris trop de CBD...
votre avatar
Je pense que la secrétaire a un esprit critique suffisant pour signaler au médecin si quelque chose la chiffonne et qu'elle ne va pas halluciner, sauf si elle a pris trop de CBD...
C'est oublier le biais cognitif du "la machine a déjà pré-mâché le travail" qui engendre très (trop) souvent une relecture superficielle, voire pas de relecture.

Cf l'exemple des CR de réunion générés par transcription qui sont parfois incompréhensibles.

La raison étant, je suppose, que le modèle qui écoute n'a de contexte que celui de la réunion en cours et rien d'autre, donc il va supposer beaucoup de choses qui sont des évidences pour les parties prenantes en place.
votre avatar
Oui on est d'accord je pense :)

Ça m'a également amené une autre réflexion, c'est que lorsque le médecin prend lui même des notes, il interprète ce que je dis. Il ajoute de la valeur en notant pour lui même des choses que je n'aurais peut-être pas reussi à exprimer.
Il prend également en compte mon état émotionnel et d'autres facteurs qui m'échappent. Et qui échappent à la machine.
votre avatar
Ça me semble un peu excessif comme approche : pour moi, c'est au médecin de faire attention à ce qu'il fait.
Ça m'est déjà arrivé d'avoir une prescription au nom d'un autre patient, probablement parce que le médecin a dû oublier de "switcher" de patient dans son logiciel au moment de faire la prescription. C'est pas la faute du logiciel : c'est clairement le médecin le fautif.

Mais ce qu'indique @pingouinplus bas n'est pas rassurant...
votre avatar
Je suis sûr que la famille du défunt sera heureuse de savoir que c'est le médecin le fautif !
À moins qu'elle ne préfère que cela n'arrive pas grace à une interdiction.

Manifestement, à la lecture de l'article, il y a des médecins qui laissent passer des erreurs venant d'IA transcriptrices et ça va jusqu'à des erreurs de prescription. Tu préfères quand même qu'on laisse ce risque et que des personnes en meurent ? Pas moi.
votre avatar
Le truc, c'est qu'interdire tout type d'IA me semble extrême.
La transcription, par exemple, peut être très facilement corrigée par le médecin.
Le truc, c'est qu'il faut responsabiliser et éduquer les médecins à ces outils.

Après, tout est question de gestion de risque en rapport avec le danger. Ici, le danger est grand, et le risque est augmenté par l'IA qui génère des hallucinations, mais ce risque est sensé être "réduit" par le médecin qui doit vérifier sa prescription. On pourrait aussi réduire le risque en mettant un garde-fou technique au moment de générer la transcription : par exemple, la transcription ne peut pas intégrer de nom de médicament (on supprime tout nom de médicament dans le texte généré par un système déterministe de type rechercher/remplacer) ou on entoure le nom du médicament de "balises" que le médecin se doit de supprimer à la main.

Je serais comme toi outré si une erreur liée à une hallucination d'IA venait à causer la mort d'un patient, mais pour moi le fautif serait très majoritairement le prescripteur.
votre avatar
Honnêtement, si le toubib doit revalider tout la prescription autogénérée, la corriger, l'amender, il ira plus vite à l'écrire et les risques d'erreurs seront bien plus réduits.

On ne parle pas de code informatique ici, la prescription médicale c'est pas ce qui prend 3 jours à rédiger pour le médecin.
votre avatar
Juste changer/valider le nom d'un médicament qu'on a dicté il y a quelques minutes, ça devrait pas prendre beaucoup de temps, et ça devrait malgré tout faire gagner du temps de ne pas avoir à retranscrire le reste de la conversation.
votre avatar
Le truc, c'est que pour une tâche simple (résumer un texte), c'est 5% d'hallucinations.
Sur une tâche plus "ouverte", c'est entre 15 et 30% d'hallucinations.

Les techno basées sur les transformeurs sont juste des générateurs de contenus artificiels, il ne faut pas leur prêter d'autres qualités.
5% d'hallucinations, ça fait combien d'erreurs de transcription/prescription par jour sur la population d'un pays ?
votre avatar
D'où le pourquoi il est indispensable de faire une relecture réelle.
Mais j'avoue que je n'avais pas ces chiffres en tête : 5%, c'est assez énorme...
votre avatar
D'où le pourquoi il est indispensable de faire une relecture réelle.
Et c'est là qu'on tombe dans le travers où un outil supposé faire gagner du temps en fait perdre.

J'ai beau être quelqu'un appréciant et voyant la valeur ajoutée de l'IA générative, à un moment ça sert à rien d'en foutre au forceps et de demander ensuite à des gens dont c'est pas le boulot de corriger la merde générée.

Pour donner un parallèle par rapport à mes propres activités (plus orientées dans le commerce) : quand une nouvelle solution demande aux collègues en magasin de se dépatouiller / corriger des conneries dedans plutôt que de servir le client, ça s'appelle une perte d'argent.
votre avatar
Mais j'avoue que je n'avais pas ces chiffres en tête : 5%, c'est assez énorme...
Je ne suis pas utilisateur de ce genre d'outils mais les rares fois où j'ai testé c'était complètement à côté de la plaque.
Il y aura des marchés de niches avec des modèles spécialisés qui seront pertinents, c'est sûr (ou des technos autres que les transformeurs). Mais à mon avis, une utilisation de masse ne peut que mener dans le mur.

Les chiffres varient énormément d'une étude à l'autre et d'une méthodologie à l'autre.
Mais ce qui est sûr c'est qu'un outil, c'est fait pour être fiable. Une calculatrice qui oublie la retenue, même si c'est une fois sur dix mille, personne n'en veut.

Voilà un article (rédigé par IA ?) qui fait la synthèse de plusieurs études. N'étant pas moi-même utilisateur, je me demande comment des gens peuvent utiliser ces "outils" si ces chiffres reflètent vraiment la réalité :

  • Stanford research found 58% to 88% hallucination rates in legal queries across major models.

  • Benchmarks show modern LLMs still exceed 15% hallucination rates in structured analysis tasks.

  • In medical case summaries, hallucinations reached 64.1% without mitigation prompts.

  • Domain-specific hallucination averages reach 18.7% in legal and 16.9% in scientific contexts.





Et le "leaderboard" du HHEM (Hughes Hallucination Evaluation Model) :
This evaluates how often an LLM introduces hallucinations when summarizing a document.
https://github.com/vectara/hallucination-leaderboard

Quand je disais 5%, j'étais gentil.
votre avatar
Pour avoir eu un collègue dont toute la famille est soit médecin, soit pharmacien, il nous a bien expliqué ce genre de situation : Si un médecin fait un connerie avec les médoc, et que ça ce passe mal, il y a enquête avec un autre médecin. Sauf que les médecins se protègent entre eux. La faute retombera toujours sur le pharmacien "qui aurai du faire gaffe"...
votre avatar
Chez Open AI, ChatGPT Health intègre désormais un système de gestion électronique des dossiers patients, auquel les praticiens étés-uniens peuvent recourir pour importer leurs dossiers puis questionner le moteur.
Ou comment donner toutes tes informations de santé à une entreprise capable de se transformer en data-broker si elle se retrouve dans la panade (par exemple, si la bulle IA explose).
Y'a que moi que ça choque ?
votre avatar
:troll:

C'est parce que ce sont des boites disruptives.

Et comme elles sont disruptives, elles savent que si la bulle éclate cela provoque de la disruption dans leur modèle économique.

Du coup elles anticipent la disruption provoquée par une bulle pour rester disruptive.

Donc elles se disruptent de manière préventive au regard d'une potentielle disruption future.

Normal. Quelle boite ne le ferait pas ?
votre avatar
Je me demande quel médicament propose l'IA pour soigner la bêtise humaine qui force l'usage de l'IA dans des domaines aussi critiques.
votre avatar
Ça doit être ce médicament la.
votre avatar
Il est intéressant d'aller lire l'étude du premier lien ("Gender-Dependent Diagnostic Substitution in LLM Medical Triage: Same Symptoms, Unequal Urgency"). Parce l'article de parent.fr fait quand même de sacré raccourci et manque beaucoup de nuances dans son écriture...

Les symptômes utilisés sont quand même assez "génériques" et pas hyper caractéristiques d'une pathologie.
Alors oui quand ces symptômes sont compatibles avec une augmentation de la pression intracrânienne cela nécessite d'aller aux urgences.
Je pense même que ces symptômes un peu ambigus ont été choisis exprès pour tester les LLM.
Nous avons pas mal de boulot pour faire rentrer dans la tête du grand public qu'une crise cardiaque chez la femme ne ressemble généralement pas à une crise cardiaque chez l'homme.

Claude envoie quasiment tout le monde aux urgences, Gemini c'est le contraire.
Les différences constatées s"annulent peu importe le sexe pour les groupes de 65 ans.

Comme il est précisé dans la conclusion de l'étude : "Il ne s’agit pas ici de modèles « sexistes » au sens littéral du terme. Il s’agit plutôt de modèles qui apprennent une a priori épidémiologique fondée sur des données cliniques"
Les LLM font l'erreur de se baser sur les données épidémiologiques pour supposer un diagnostique alors que le tableau clinique nécessite une évaluation urgente pour écarter le risque.

On en revient toujours au même, les données existantes ne sont pas exhaustives et je pense que ce ne peut qu'être une aide diagnostic pour le médecin et qu'il garde la responsabilité en cas de problème.
Il y a déjà assez de souci avec les médecins sans qu'ils soient inquiétés de quoi que ce soit, si on leur laisse ce genre d'outils en open bar, ce sera la Bérézina...
votre avatar
"ces dernières permettront en effet de « libérer les équipes de leur charge administrative », leur rendant de ce fait du temps pour le soin des patients."

La dernière fois qu'on a "libéré" mon équipe d'une charge administrative, c'était plutôt pour virer des techniciens... :roll:
votre avatar
Alors qu’elle s’appuyait sur la transcription générée par IA d’un entretien avec son praticien
Pour voir les CR de réunion en entreprise générés comme ça... C'est juste incompréhensible et à côté de la plaque les 3/4 du temps. La techno n'est clairement pas encore au point pour ça.

Alors pour du médical, on est à la limite du criminel là.
votre avatar
C'est surtout l'occasion d'un bon fou rire avec les collègues quand on nous envoie la transcription d'une visio générée par IA ! Avec les noms propres et les acronymes qui se retrouvent complètement déformés, les hésitations et les interruptions qui se retrouvent au milieu des phrases, les ponctuations aléatoires...
votre avatar
Moi ce sont les transcriptions en live qui me font délirer, quand dans une réunion en anglais une personne présente un truc, qu'elle dit "yes, I haven't shared it yet" et que la transcription affiche momentanément "yes, I haven't eat shit yet" avant de se corriger :mdr:
votre avatar
Je suis désolé mais je vais prendre le contre pied des messages précédents.
Médecin, j'utilise un scribe IA depuis 6 mois. Enfin j'en ai essayé plusieurs (Nabla, Heidi, Doctolib)

Il y a clairement besoin de relire et les erreurs restent nombreuses, sur le nom de médicaments, des dates (Doctolib se croit en 2023) ou parfois des propos diffamatoire d'un patient repris un peu trop à l'identique dans le texte. En même temps, Dragon sans IA, faisant des erreurs de dictée assez proches en définitive.

Mais c'est un vrai gain de qualité de consultation : j'écoute le patient au lieu de taper ce qu'il dit. L'enregistrement IA note parfois des détails que j'aurai naturellement dégagé, alors que bien utiles. Lors de certaines consultations à plusieurs langues, cela capte parfois des détails dans des langues que je ne maitrise pas.

En revanche ce n'est que de la retranscription, pas de la prescription ou autre. (J'en conviens, une erreur de transcription peut conduire à une erreur de prescription la fois suivante.

Je reste donc convaincu qu'avec une relecture attentive, c'est intéressant pour la qualité d'écoute.
votre avatar
Le problème c'est qu'on vend le produit en disant qu'il n'y a pas besoin de relire.
Alors qu'il faut s'en méfier comme de la peste.
votre avatar
salut,

ca me semble vraiment pas nouveaux.

j'ai été opéré il y a 6-7 ans et le chirurgien dictait deja ses rapports à un logiciel de retranscription. c'était surement pas un LLM derriere mais le principe reste le meme ainsi que les erreurs possibles.

bref c'est au medicin de faire gaffe et de se relire.. j'aurai été le patient qui se rends compte de l'erreur j'aurai été un peu vénére..
votre avatar
Mon médecin tape vite et écrit quelques phrases dans le dossier. C'est plus court qu'une retranscription.
deuxième point, on peut faire de la dictée vocale depuis longtemps, c'est plus ou moins équivalent de ce genre d'outils ? Mieux ? Trop limité ?
votre avatar
C'était peut-être mieux parce que c'était limité