Les IA médicales génèrent des erreurs dans les diagnostics et les noms de médicaments
IA bobo
Illustration : Flock
Le 03 septembre à 08h49
Alors qu’un nombre croissant de médecins recourent à l’IA pour enregistrer et retranscrire leurs consultations, un organisme de surveillance du système de santé publique britannique alerte sur la propension de ces dispositifs à générer des erreurs. Ces dernières peuvent avoir de réelles répercussions sur la vie des patients.
Les IA médicales génèrent des erreurs dans les diagnostics et les noms de médicaments
IA bobo
Illustration : Flock
Alors qu’un nombre croissant de médecins recourent à l’IA pour enregistrer et retranscrire leurs consultations, un organisme de surveillance du système de santé publique britannique alerte sur la propension de ces dispositifs à générer des erreurs. Ces dernières peuvent avoir de réelles répercussions sur la vie des patients.
Société numérique
Société
5 min
Le recours à des technologies d’IA pour enregistrer et retranscrire les consultations peut mener à des erreurs dans le rendu des diagnostics et des noms de médicaments, alerte Healthwatch England. Ce dernier agit comme organisme de surveillance du National Health System (NHS), le système public de santé britannique.
Alors qu’elle s’appuyait sur la transcription générée par IA d’un entretien avec son praticien, une patiente a par exemple été choquée d’apprendre qu’elle était atteinte de démyélinisation, rapporte the Guardian. Le diagnostic était faux : le produit d’une erreur, ou « hallucination », de la machine utilisée pour transcrire les échanges. Ce n’est qu’une fois vérifiés les résultats d’une IRM passée à l’hôpital qu’elle a pu constater que le résultat correct aurait dû être transcrit en « absence de démyélinisation ».
Dans un autre cas, un patient s’est rendu compte qu’un système de transcription par IA avait mélangé deux noms de médicaments. Plutôt que de retranscrire celui réellement prescrit, il en avait inscrit un second, au nom proche. Là encore, c’est le patient qui s’est aperçu de l’erreur, plutôt que le médecin. Dans une troisième affaire, la machine n’avait pas retranscrit le caractère répétitif de la prescription médicamenteuse, ce qui aurait pu laisser le patient, souffrant de migraine, sans possibilité d’obtenir ses médicaments s’il ne s’était pas aperçu du problème.
Outils de santé et IA : des technologies toujours plus poreuses
Ces histoires ne sont que quelques cas parmi de multiples erreurs : pour Healthwatch England, ce type de fautes de transcription dues au recours à l’IA pourrait poser de réels dangers pour la sécurité des patients. Un enjeu d’autant plus important qu’en dehors de la NHS, au Royaume-Uni, nombreux sont les services et logiciels médicaux à intégrer de l’IA générative, en particulier des outils d’enregistrement et de retranscription, dans les outils qu’ils fournissent à leur clientèle médicale.
En sens inverse, des moteurs grand public déploient désormais des fonctionnalités dédiées à renforcer leur usage par un public de professionnels de la médecine. Chez Open AI, ChatGPT Health intègre désormais un système de gestion électronique des dossiers patients, auquel les praticiens états-uniens peuvent recourir pour importer leurs dossiers puis questionner le moteur.
Au Royaume-Uni, où au moins 27 « scribes IA » différents sont déjà utilisés par le personnel de santé, la NHS pousse pour le déploiement généralisé de ce type de technologies. D’après un plan gouvernemental pensé sur dix ans, ces dernières permettront en effet de « libérer les équipes de leur charge administrative », leur rendant de ce fait du temps pour le soin des patients.
Qualifier les robots de transcription d’outils de santé ?
Si la promesse est belle, elle fait pour le moment peu de cas de la propension de ces technologies à générer du faux ou de l’inexistant, ce que critiquent Healthwatch England et certaines associations de patients. Parmi les autres dysfonctionnements déjà connus, la question des biais de représentation est tout à fait prévalente dans les applications de l’IA générative à la santé.
Pour de mêmes symptômes, des outils utilisés par le grand public tendent par exemple à recommander aux hommes d’aller aux urgences et aux femmes d’attendre de trouver un rendez-vous chez le médecin. Dans les contextes où des professionnels de santé génèrent des cas cliniques synthétiques, notamment pour préserver les données de patients réels, les machines surévaluent certains risques médicaux masculins et sous-représentent des risques répandus chez les femmes. Du côté des machines de transcription, certains accents sont moins compris que d’autres, ce qui rend la qualité de la transcription des échanges variable selon l’expression du ou de la patiente – dans certains cas, ces derniers ne parviennent pas à passer l’étape du répondeur automatisé.
Pour Healthwatch England, ces différents éléments rendent « inquiétant » le fait de ne pas faire entrer les « scribes IA » des médecins dans la catégorie juridique des dispositifs de santé, ce qui permettrait de les encadrer comme ces technologies dédiées.
Au sein de l’Union européenne, ce type de dispositifs est régulé par différents textes, dont le règlement sur l’intelligence artificielle et le règlement relatif à l’espace européen des données de santé. Le premier des deux fonctionne sur un système de niveaux de risque, la santé étant généralement considérée comme un domaine nécessitant des précautions avancées.
Pour autant, une cinquantaine de chercheurs internationaux regrettaient fin 2025 l’absence d’évaluation complète et rigoureuse sur le déploiement des technologies d’IA, notamment génératives, dans les usages des professionnels de santé.
Commentaires (33)
Abonnez-vous pour prendre part au débat
Déjà abonné ou lecteur ? Se connecter
Cet article est en accès libre, mais il est le produit d'une rédaction qui ne travaille que pour ses lecteurs, sur un média sans pub et sans tracker. Soutenez le journalisme tech de qualité en vous abonnant.
Accédez en illimité aux articles d'un média expert
Profitez d'au moins 1 To de stockage pour vos sauvegardes
Intégrez la communauté et prenez part aux débats
Partagez des articles premium à vos contacts
Abonnez-vousJeudi à 08h54
Jeudi à 10h54
Le grand saint et omnipotent ordinateur/IA/logiciel a toujours raison !
Jeudi à 11h18
Ça aiderait à ce qu'ils fassent très attention. Et les assurances pourraient aussi mettre ainsi la pression sur la vérification des prescriptions.
Jeudi à 11h40
Et là, je préfère que l'on évite ce cas que rechercher a posteriori le responsable de la mort.
Donc, interdire un outil d'IA générative dans les cas où ça peut mettre en danger la vie d'une personne me semble la seule solution.
Jeudi à 14h27
Et puis quand la NHS affirme que ça va faire gagner du temps, c'est en théorie faux.
En effet une utilisation responsable implique de vérifier intégralement la réponse de l'IA et de corriger ses erreurs. Ce qui à mon avis fait plutôt perdre du temps.
Jeudi à 18h46
Jeudi à 19h23
Vendredi à 08h36
Cf l'exemple des CR de réunion générés par transcription qui sont parfois incompréhensibles.
La raison étant, je suppose, que le modèle qui écoute n'a de contexte que celui de la réunion en cours et rien d'autre, donc il va supposer beaucoup de choses qui sont des évidences pour les parties prenantes en place.
Vendredi à 11h54
Ça m'a également amené une autre réflexion, c'est que lorsque le médecin prend lui même des notes, il interprète ce que je dis. Il ajoute de la valeur en notant pour lui même des choses que je n'aurais peut-être pas reussi à exprimer.
Il prend également en compte mon état émotionnel et d'autres facteurs qui m'échappent. Et qui échappent à la machine.
Jeudi à 17h20
Ça m'est déjà arrivé d'avoir une prescription au nom d'un autre patient, probablement parce que le médecin a dû oublier de "switcher" de patient dans son logiciel au moment de faire la prescription. C'est pas la faute du logiciel : c'est clairement le médecin le fautif.
Mais ce qu'indique @pingouinplus bas n'est pas rassurant...
Jeudi à 19h11
À moins qu'elle ne préfère que cela n'arrive pas grace à une interdiction.
Manifestement, à la lecture de l'article, il y a des médecins qui laissent passer des erreurs venant d'IA transcriptrices et ça va jusqu'à des erreurs de prescription. Tu préfères quand même qu'on laisse ce risque et que des personnes en meurent ? Pas moi.
Jeudi à 23h26
La transcription, par exemple, peut être très facilement corrigée par le médecin.
Le truc, c'est qu'il faut responsabiliser et éduquer les médecins à ces outils.
Après, tout est question de gestion de risque en rapport avec le danger. Ici, le danger est grand, et le risque est augmenté par l'IA qui génère des hallucinations, mais ce risque est sensé être "réduit" par le médecin qui doit vérifier sa prescription. On pourrait aussi réduire le risque en mettant un garde-fou technique au moment de générer la transcription : par exemple, la transcription ne peut pas intégrer de nom de médicament (on supprime tout nom de médicament dans le texte généré par un système déterministe de type rechercher/remplacer) ou on entoure le nom du médicament de "balises" que le médecin se doit de supprimer à la main.
Je serais comme toi outré si une erreur liée à une hallucination d'IA venait à causer la mort d'un patient, mais pour moi le fautif serait très majoritairement le prescripteur.
Vendredi à 08h42
On ne parle pas de code informatique ici, la prescription médicale c'est pas ce qui prend 3 jours à rédiger pour le médecin.
Samedi à 10h24
Modifié samedi à 01h07
Sur une tâche plus "ouverte", c'est entre 15 et 30% d'hallucinations.
Les techno basées sur les transformeurs sont juste des générateurs de contenus artificiels, il ne faut pas leur prêter d'autres qualités.
5% d'hallucinations, ça fait combien d'erreurs de transcription/prescription par jour sur la population d'un pays ?
Samedi à 10h25
Mais j'avoue que je n'avais pas ces chiffres en tête : 5%, c'est assez énorme...
Modifié samedi à 10h46
J'ai beau être quelqu'un appréciant et voyant la valeur ajoutée de l'IA générative, à un moment ça sert à rien d'en foutre au forceps et de demander ensuite à des gens dont c'est pas le boulot de corriger la merde générée.
Pour donner un parallèle par rapport à mes propres activités (plus orientées dans le commerce) : quand une nouvelle solution demande aux collègues en magasin de se dépatouiller / corriger des conneries dedans plutôt que de servir le client, ça s'appelle une perte d'argent.
Modifié dimanche à 02h33
Il y aura des marchés de niches avec des modèles spécialisés qui seront pertinents, c'est sûr (ou des technos autres que les transformeurs). Mais à mon avis, une utilisation de masse ne peut que mener dans le mur.
Les chiffres varient énormément d'une étude à l'autre et d'une méthodologie à l'autre.
Mais ce qui est sûr c'est qu'un outil, c'est fait pour être fiable. Une calculatrice qui oublie la retenue, même si c'est une fois sur dix mille, personne n'en veut.
Voilà un article (rédigé par IA ?) qui fait la synthèse de plusieurs études. N'étant pas moi-même utilisateur, je me demande comment des gens peuvent utiliser ces "outils" si ces chiffres reflètent vraiment la réalité :
Et le "leaderboard" du HHEM (Hughes Hallucination Evaluation Model) :https://github.com/vectara/hallucination-leaderboard
Quand je disais 5%, j'étais gentil.
Jeudi à 14h45
Jeudi à 08h57
Y'a que moi que ça choque ?
Jeudi à 10h36
C'est parce que ce sont des boites disruptives.
Et comme elles sont disruptives, elles savent que si la bulle éclate cela provoque de la disruption dans leur modèle économique.
Du coup elles anticipent la disruption provoquée par une bulle pour rester disruptive.
Donc elles se disruptent de manière préventive au regard d'une potentielle disruption future.
Normal. Quelle boite ne le ferait pas ?
Jeudi à 09h43
Jeudi à 10h26
Modifié jeudi à 10h39
Les symptômes utilisés sont quand même assez "génériques" et pas hyper caractéristiques d'une pathologie.
Alors oui quand ces symptômes sont compatibles avec une augmentation de la pression intracrânienne cela nécessite d'aller aux urgences.
Je pense même que ces symptômes un peu ambigus ont été choisis exprès pour tester les LLM.
Nous avons pas mal de boulot pour faire rentrer dans la tête du grand public qu'une crise cardiaque chez la femme ne ressemble généralement pas à une crise cardiaque chez l'homme.
Claude envoie quasiment tout le monde aux urgences, Gemini c'est le contraire.
Les différences constatées s"annulent peu importe le sexe pour les groupes de 65 ans.
Comme il est précisé dans la conclusion de l'étude : "Il ne s’agit pas ici de modèles « sexistes » au sens littéral du terme. Il s’agit plutôt de modèles qui apprennent une a priori épidémiologique fondée sur des données cliniques"
Les LLM font l'erreur de se baser sur les données épidémiologiques pour supposer un diagnostique alors que le tableau clinique nécessite une évaluation urgente pour écarter le risque.
On en revient toujours au même, les données existantes ne sont pas exhaustives et je pense que ce ne peut qu'être une aide diagnostic pour le médecin et qu'il garde la responsabilité en cas de problème.
Il y a déjà assez de souci avec les médecins sans qu'ils soient inquiétés de quoi que ce soit, si on leur laisse ce genre d'outils en open bar, ce sera la Bérézina...
Jeudi à 12h43
La dernière fois qu'on a "libéré" mon équipe d'une charge administrative, c'était plutôt pour virer des techniciens...
Jeudi à 13h16
Alors pour du médical, on est à la limite du criminel là.
Jeudi à 15h07
Jeudi à 15h14
Jeudi à 14h15
Médecin, j'utilise un scribe IA depuis 6 mois. Enfin j'en ai essayé plusieurs (Nabla, Heidi, Doctolib)
Il y a clairement besoin de relire et les erreurs restent nombreuses, sur le nom de médicaments, des dates (Doctolib se croit en 2023) ou parfois des propos diffamatoire d'un patient repris un peu trop à l'identique dans le texte. En même temps, Dragon sans IA, faisant des erreurs de dictée assez proches en définitive.
Mais c'est un vrai gain de qualité de consultation : j'écoute le patient au lieu de taper ce qu'il dit. L'enregistrement IA note parfois des détails que j'aurai naturellement dégagé, alors que bien utiles. Lors de certaines consultations à plusieurs langues, cela capte parfois des détails dans des langues que je ne maitrise pas.
En revanche ce n'est que de la retranscription, pas de la prescription ou autre. (J'en conviens, une erreur de transcription peut conduire à une erreur de prescription la fois suivante.
Je reste donc convaincu qu'avec une relecture attentive, c'est intéressant pour la qualité d'écoute.
Jeudi à 14h36
Alors qu'il faut s'en méfier comme de la peste.
Modifié jeudi à 17h39
ca me semble vraiment pas nouveaux.
j'ai été opéré il y a 6-7 ans et le chirurgien dictait deja ses rapports à un logiciel de retranscription. c'était surement pas un LLM derriere mais le principe reste le meme ainsi que les erreurs possibles.
bref c'est au medicin de faire gaffe et de se relire.. j'aurai été le patient qui se rends compte de l'erreur j'aurai été un peu vénére..
Modifié lundi à 09h41
deuxième point, on peut faire de la dictée vocale depuis longtemps, c'est plus ou moins équivalent de ce genre d'outils ? Mieux ? Trop limité ?
Lundi à 09h38
Signaler un commentaire
Voulez-vous vraiment signaler ce commentaire ?