De nouveaux travaux de David Emerson, chercheur en sciences appliquées chez Vector, mettent en lumière l'utilisation des modèles de langage généralistes (LLM) pour automatiser la sélection des revues systématiques. L'article « Développement de modèles d'invite pour la sélection par LLM dans les revues systématiques », coécrit par Emerson, Christian Cao, Jason Sang et Rohit Arora, démontre comment des stratégies d'invite sophistiquées peuvent améliorer considérablement les performances des LLM pour les tâches de classification de texte essentielles aux processus de revue systématique. En créant des modèles d'invite généralisés (par opposition à des solutions spécifiques à chaque revue), les chercheurs proposent une approche accessible de l'automatisation des revues systématiques, permettant des économies de temps et d'argent significatives.
En bref : Découvrez des recherches révolutionnaires en IA en 3 minutes
Ce résumé concis permet de vulgariser les avancées scientifiques complexes. Parfait pour les passionnés comme pour les non-spécialistes, écoutez-le dès maintenant !
Les applications antérieures des modèles linéaires à longue portée (MLL) pour la sélection de textes dans les revues systématiques reposaient principalement sur des méthodes d'initiation sans exemple, ce qui sous-estimait fortement les capacités réelles des MLL pour les tâches en aval. Par conséquent, les MLL étaient jusqu'alors considérés comme incapables d'effectuer ces tâches avec suffisamment de précision pour être utilisées efficacement dans le cadre de revues systématiques. En appliquant les meilleures pratiques d'initiation, ainsi que de nouvelles techniques d'initiation, les auteurs ont pu exploiter pleinement le potentiel des MLL.
Contexte et motivation
En médecine, les revues systématiques (RS) synthétisent les résultats d'études cliniques et de recherche, fournissant des preuves de l'efficacité d'une intervention. Elles constituent la référence en matière de pratique fondée sur les preuves. Cependant, leur réalisation est extrêmement coûteuse, nécessitant généralement un an et plus de 100 000 $. L'objectif d'une RS est d'analyser de vastes corpus de recherches, d'identifier les articles pertinents et de synthétiser de nouvelles connaissances qui, prises dans leur ensemble, répondent à une question importante et précise. Un exemple simplifié pourrait être : « L'intervention X améliore-t-elle l'état de santé des patients ? » La phase de sélection initiale des RS est particulièrement exigeante, nécessitant l'examen indépendant des articles par deux chercheurs, en deux étapes, selon des critères d'éligibilité. Dans un premier temps, les chercheurs examinent les résumés des articles (premier filtrage). Dans un deuxième temps, ils examinent l'intégralité de l'article (« texte intégral ») afin de déterminer s'il répond aux critères prédéfinis d'inclusion finale.
Malgré les outils existants, l'automatisation de la recherche systématique demeure difficile à atteindre, car les solutions actuelles ne font que compléter les processus humains, manquent de performances pour une prise de décision autonome et nécessitent d'importantes quantités de données d'apprentissage historiques. L'émergence des maîtrises en sciences juridiques (LLM) offre de nouvelles perspectives pour l'automatisation du tri des données de recherche systématique, permettant potentiellement de réduire considérablement les besoins en temps et en ressources.
Méthodologie
Dans cette étude, les chercheurs ont développé des modèles d'invite génériques pour la sélection de revues systématiques par des assistants de recherche en lecture (ARL), tant pour les résumés que pour les articles complets. Ils ont d'abord créé BenchSR , une base de données de 10 revues systématiques publiées et couvrant neuf domaines cliniques, qui a servi de terrain d'expérimentation. Par une approche itérative avec différentes techniques d'invites, ils ont mis au point « Framework Chain-of-Thought », une méthode novatrice guidant les ARL dans un raisonnement systématique basé sur des critères prédéfinis, à l'image des processus cognitifs humains, en évaluant chaque critère avant de prendre une décision finale. Pour la sélection des articles complets, ils ont constaté que la répétition des instructions au début et à la fin des invites améliorait significativement les performances avec les documents longs, résolvant ainsi le problème de la « perte d'informations au milieu », difficulté rencontrée par les ARL pour retenir les informations situées au cœur des textes volumineux. Ces observations ont abouti à deux modèles optimisés : « Abstract ScreenPrompt » pour le tri des résumés et « ISO-ScreenPrompt » (Instruction-Structure-Optimized) pour le tri des textes intégraux, tous deux conçus pour maximiser la sensibilité tout en maintenant une spécificité acceptable pour différents types de revues systématiques.
Dispositif expérimental
L'étude a comparé plusieurs approches d'incitation, notamment les techniques « zéro exemple », « quelques exemples » et « Chaîne de pensée », sur un large éventail de modèles de langage (GPT-3.5, variantes de GPT-4, Gemini Pro, Mixtral, Mistral et Claude-3.5-Sonnet). La performance a été évaluée à l'aide des mesures d'exactitude, de sensibilité et de spécificité. Les décisions finales de sélection humaine des revues systématiques originales ont servi de référence absolue pour la comparaison de toutes les décisions du modèle, tant pour la sélection des résumés que pour celle des articles complets. Le protocole expérimental a suivi un processus d'entraînement, de validation et de test : les incitations ont d'abord été optimisées à l'aide d'échantillons d'entraînement provenant d'une seule revue systématique (SeroTracker), validées sur un autre échantillon SeroTracker, puis testées de manière approfondie sur un ensemble de tests SeroTracker et sur neuf autres ensembles de données de revues systématiques. Pour la sélection des résumés, les chercheurs ont examiné l'ensemble des titres et résumés issus des recherches originales, tandis que la sélection des articles complets a porté sur tous les articles librement accessibles de PubMed Central. L'équipe a également effectué des analyses de temps et de coûts comparant le dépistage basé sur les LLM aux approches humaines traditionnelles, fournissant ainsi des informations pratiques sur la mise en œuvre pour les équipes de recherche.
Principales conclusions
- Le modèle optimisé Abstract ScreenPrompt a obtenu des performances élevées sur 10 revues diverses ( sensibilité pondérée de 97,7 %, spécificité pondérée de 85,2 % ), surpassant significativement l'incitation zéro-shot ( sensibilité pondérée de 49,0 %, spécificité pondérée de 97,9 % ) et les outils de sélection précédents, car une sensibilité élevée tout en maintenant une bonne spécificité est la mesure la plus importante pour la sélection de résumés.
- Le modèle ISO-ScreenPrompt pour le filtrage en texte intégral a démontré des performances élevées similaires (sensibilité pondérée de 96,5 %, spécificité pondérée de 91,2 %).
- Les performances des modèles d'invites, tant pour le résumé que pour le texte intégral, ont dépassé les estimations de la littérature précédente sur les performances d'un seul examinateur humain (sensibilité de 86,6 % et spécificité de 79,2 %).
- Le criblage basé sur la méthode LLM a permis de réduire considérablement les coûts et les délais : selon la revue systématique, Abstract ScreenPrompt coûtait entre 16,74 $ et 157,02 $, contre 194,83 $ à 1 666,67 $ pour un criblage manuel , tandis qu’ISO-ScreenPrompt coûtait entre 14,53 $ et 622,12 $, contre 676,35 $ à 25 956,40 $ pour un criblage manuel du texte intégral. Les deux méthodes LLM ont permis de réaliser le criblage en moins de 24 heures, contre 9,74 à 83,33 heures (résumés) et 33,82 à 1 297,82 heures (textes intégraux) pour un criblage manuel.
Conclusion et implications
Cette recherche démontre que des modèles d'aide à la décision bien conçus (LLM) permettent d'atteindre une sensibilité et une spécificité élevées pour le criblage de revues systématiques, et ce, pour diverses revues, sans nécessiter de réglage fin du modèle ni de données d'entraînement étiquetées. L'étude propose des pistes d'application immédiates : les LLM peuvent servir d'évaluateurs uniques et indépendants, compléter les évaluateurs humains pour réduire de moitié leur charge de travail, ou encore d'outils de présélection pour diminuer le volume de travail des évaluateurs humains de 66 à 95 %. Les recherches futures valideront ces modèles sur un plus large éventail de revues systématiques, évalueront leur rendement par rapport aux évaluateurs humains dans des études prospectives et exploreront l'application de techniques d'aide à la décision similaires à d'autres tâches basées sur des critères en sciences médicales.
Créé par l'IA, édité par des humains, à propos de l'IA
Cet article fait partie de notre série « ANDERS – Explication des avancées majeures de l'IA et vulgarisation de la recherche ». Nous utilisons des agents d'IA pour générer des brouillons à partir d'articles scientifiques, qui sont ensuite soigneusement édités et peaufinés par nos équipes. Notre objectif est de vous proposer des explications claires et concises des recherches de pointe menées par les chercheurs de Vector. Grâce à ANDERS, nous nous efforçons de rendre accessibles les avancées scientifiques complexes au grand public, en soulignant leur importance et leur impact sur notre monde.