Actualités
ActualitéModèles & plateformes1 octobre 2026

Comparatif inédit : Claude, Gemini et ChatGPT face aux experts pour répondre aux questions médicales

Une étude récente évalue trois chatbots IA généralistes sur leur capacité à citer des études cliniques pertinentes. Résultats mitigés pour Claude, Gemini et ChatGPT face aux revues Cochrane.

Par François MariFondateur, ligne8 Studio3 min de lecture1 source
Create a realistic editorial news photograph for a serious AI and technology publication.
The image must look like a real photo shot for a business/technology n

Une publication récente sur arXiv analyse la capacité de trois chatbots basés sur de grands modèles de langage (LLM) à répondre à des questions médicales en citant des études cliniques pertinentes. Claude Sonnet 5, Gemini 3.1 Pro et ChatGPT GPT-5.5 ont été testés sur 20 questions extraites de revues Cochrane, référence en matière d’évidence scientifique en santé.

L’étude a simulé trois rôles d’utilisateur — patient, clinicien et chercheur en synthèse d’évidence — pour évaluer la cohérence et la pertinence des réponses fournies par chaque chatbot, avec un total de 720 réponses analysées.

Claude, Gemini et ChatGPT : des performances variables face aux revues Cochrane

Les chatbots ont été invités à justifier leurs réponses par des citations d’études primaires, comparées aux études incluses et exclues dans les revues Cochrane correspondantes. Cette méthode rigoureuse permet de mesurer la capacité des modèles à retrouver des preuves validées par des experts humains.

Les résultats montrent que la qualité des citations varie significativement selon le modèle et le rôle simulé. Aucun chatbot ne parvient à reproduire parfaitement la sélection d’études des revues Cochrane, ce qui souligne les limites actuelles des LLM dans la recherche documentaire médicale spécialisée.

Influence du rôle utilisateur sur la qualité des réponses

L’étude révèle que le rôle simulé influence la pertinence des réponses. Par exemple, les chatbots tendent à fournir des citations plus précises lorsqu’ils jouent le rôle d’un chercheur en synthèse d’évidence, comparé à un patient ou un clinicien. Cette différence suggère que la formulation des requêtes et le contexte utilisateur impactent directement la qualité des informations fournies.

Pour les entreprises intégrant ces agents dans des produits destinés à des professionnels de santé ou au grand public, cette variabilité pose la question de l’adaptation fine des interfaces et prompts selon le profil utilisateur.

Outils d’aide à la décision médicale : effets opérationnels à anticiper

La capacité à citer des études pertinentes est un critère clé pour les applications d’aide à la décision clinique. Les résultats de cette étude indiquent que les chatbots actuels ne peuvent pas encore remplacer une revue systématique humaine, mais peuvent servir d’outil d’appoint pour orienter la recherche documentaire.

Les éditeurs de solutions IA dans la santé devront donc intégrer des mécanismes complémentaires, comme des bases de données validées ou des systèmes de vérification humaine, pour garantir la fiabilité des recommandations générées.

Architecture et données : un frein à la précision des citations

Les différences observées entre Claude, Gemini et ChatGPT peuvent s’expliquer par leurs architectures et leurs corpus d’entraînement. L’accès aux bases de données médicales à jour et la capacité à extraire précisément des références bibliographiques restent des défis techniques notables.

Par ailleurs, la gestion du contexte et la compréhension fine des questions cliniques sont essentielles pour éviter les citations hors sujet ou erronées, ce qui nécessite des améliorations dans la conception des prompts et des modèles.

Acteurs du marché IA en santé : prochaines étapes

Cette étude souligne la nécessité pour les fournisseurs de chatbots et d’agents IA de renforcer la transparence et la traçabilité des sources citées, notamment dans le secteur médical où les enjeux de fiabilité sont élevés.

Les entreprises doivent aussi anticiper les attentes réglementaires croissantes autour de la validation des données utilisées par les IA, ce qui pourrait influencer la conception produit et les partenariats avec des institutions médicales.

Enfin, l’adoption de ces outils dépendra de leur capacité à s’adapter aux différents profils utilisateurs, en proposant des interfaces et des niveaux d’explication adaptés, pour accompagner efficacement les décisions cliniques.

Sources

Articles et annonces consultés

Passer à l'action

Vous voulez identifier les workflows IA qui peuvent transformer votre entreprise ? Parlons-en.

Identifier mes workflows IA