Innovation majeure : le traitement automatique du langage naturel est à l'honneur lors du dernier atelier du Vector Institute.

13 mars 2024

Rechercher

Par Arber Kacollja

L'atelier récent du Vector Institute sur le traitement automatique du langage naturel (TALN) a réuni des chercheurs en TALN afin d'échanger sur leurs intérêts communs et de présenter les travaux menés par la communauté TALN du Vector Institute. Le domaine de la recherche en TALN est vaste et complexe ; il permet aux machines de comprendre les nuances du langage humain. Il s'agit d'un aspect essentiel de l'IA, un point de convergence entre la linguistique et l'informatique.

Les progrès récents en traitement automatique du langage naturel (TALN), notamment l'essor des grands modèles de langage préentraînés (LLM), ont permis d'intégrer les systèmes de TALN dans de nombreux aspects de notre vie quotidienne. De plus, l'évolution rapide de la recherche en TALN a engendré une multitude d'applications dans des domaines variés. Au-delà des applications classiques comme les assistants vocaux personnels et les systèmes de recommandation, on peut citer parmi les avancées récentes ChatGPT pour la génération de contenu et Dall-E pour la conversion de texte en image.

Frank Rudzicz, membre du corps professoral de Vector, souhaite la bienvenue aux participants à l'atelier.
Frank Rudzicz, membre du corps professoral de Vector, souhaite la bienvenue aux participants à l'atelier.

Tout au long de cette journée, les membres du corps professoral de Vector, les professeurs affiliés, les postdoctorants et les chercheurs de la communauté Vector élargie ont discuté de travaux de pointe, examiné les opportunités et les défis du PNL à l'ère des LLM et échangé des points de vue sur divers sujets liés au PNL.

Les participants ont également participé à des ateliers interactifs ainsi qu'à une séance d'affichage où les étudiants diplômés ont présenté leurs recherches.

Les progrès rapides réalisés dans le domaine des modèles de langage préentraînés ont permis des percées remarquables. Frank Rudzicz , membre du corps professoral de Vector et titulaire de la chaire d'intelligence artificielle du CIFAR Canada, également professeur agrégé à l'Université Dalhousie, a présenté une communication sur la méthode scientifique en recherche moderne sur le traitement automatique du langage naturel, explorant notamment les enjeux liés aux métriques et à l'évaluation comparative dans les technologies de reconnaissance vocale profonde. 

La conférence a aussi exploré le concept de dette scientifique en TAL, en s'intéressant aux difficultés rencontrées pour rendre la recherche sur les modèles de langage préentraînés plus rigoureuse. La dette technique, a-t-il expliqué, apparaît lorsque les équipes techniques optent pour des solutions de facilité, certes, mais sous-optimales, ou négligent d'investir du temps dans l'élaboration de méthodes durables. Cela peut se traduire par l'adoption d'une approche difficilement adaptable ou par la fusion de plusieurs composants sans en comprendre les interactions. Bien que ces raccourcis puissent paraître efficaces au premier abord, ils engendrent souvent des difficultés importantes à long terme.

De la même manière que la dette technique s'accumule généralement lors du développement rapide de nouveaux logiciels, la dette scientifique décrit des problèmes similaires découlant du développement et de l'intégration de modèles de langage pré-entraînés. « Au lieu d'accepter hâtivement les tendances en TAL, nous devons soigneusement démêler les composantes interconnectées et évaluer leur contribution individuelle aux résultats obtenus », explique Rudzicz. 

Il a également formulé de nombreuses recommandations essentielles pour l'avenir et tiré des leçons visant à favoriser les progrès dans ce domaine.

Des mesures explicables et fiables et des systèmes de traitement automatique du langage naturel (TALN) cohérents à l'ère des grands modèles de langage

Avec le déploiement des technologies d'IA générative dans notre quotidien, la communication entre l'IA et les utilisateurs humains devient plus cruciale que jamais. Zining Zhu , récemment diplômée d'un doctorat de l'Université de Toronto et nouvelle professeure à l'Institut Stevens, a présenté un cadre de communication où l'IA, en tant qu'assistante, aide les humains à traiter des données complexes et à comprendre les résultats de prédictions automatiques. Ce cadre utilise la théorie de l'information pour révéler les mécanismes des explications générées par l'IA et intègre le public cible afin d'adapter le contenu et le format. L'explication est un outil de communication très utilisé.

Les LLM peuvent générer une explication, mais celle-ci doit être informative, contextualisée et utile.

Zining Zhu

Membre du corps professoral, Institut de technologie Stevens

Sa présentation s'inscrit dans le cadre des efforts continus visant à établir des normes d'évaluation rigoureuses pour l'IA explicable. Outre les difficultés informatiques liées à la production de ces explications, leur évaluation nécessite une approche et des indicateurs centrés sur l'humain.

Dans le but de développer une métrique explicable pour toutes les tâches de génération de texte, Dongfu Jiang , doctorant à l'Université de Waterloo, a présenté TIGERScore, une métrique entraînée qui suit des instructions précises pour réaliser une évaluation explicable et sans référence sur un large éventail de tâches de génération de texte. Contrairement aux mesures automatiques traditionnelles, TIGERScore fournit une analyse détaillée des erreurs pour identifier les fautes dans le texte généré, accompagnée d'explications pour chaque erreur. Il a expliqué comment lui et son équipe, dirigée par Wenhu Chen , membre du corps professoral de Vector et titulaire de la chaire d'intelligence artificielle du CIFAR Canada, également professeur adjoint à l'Université de Waterloo, ont constitué l'ensemble de données synthétiques MetricInstruct en interrogeant GPT-4, utilisé pour affiner LLama-13b, afin d'obtenir le score TIGERScore. Il a présenté les stratégies et les intuitions utilisées pour améliorer la qualité de l'ensemble de données, ainsi que les scénarios d'application du score TIGERScore et les orientations futures de la recherche visant à améliorer les mesures LLM.

Bien que les modèles de langage naturel (MLN) aient démontré une capacité impressionnante à comprendre et à générer des textes d'apparence humaine, l'évaluation des tâches de génération de langage naturel demeure un problème ouvert de longue date. Les méthodes permettant d'assurer leur pertinence et leur cohérence, ainsi que de corriger leurs erreurs, demeurent ambiguës.

L'édition de modèles dans les modèles de langage (LLM) est une tâche qui utilise un seul exemple pour modifier directement les connaissances factuelles d'un modèle de langage pré-entraîné. Le succès des méthodes d'édition de modèles n'est actuellement évalué qu'à l'aide des quelques jetons suivants, ce qui ne nous permet pas de comprendre l'impact de l'édition de modèles sur la génération de textes longs, tels que des paragraphes. Pour remédier à cela, Domenic Rosati , doctorant à l'Université Dalhousie, a présenté un nouvel ensemble de protocoles d'évaluation. L'évaluation de l'édition de modèles pour les textes longs (LEME) est un protocole d'évaluation qui mesure l'efficacité et l'impact de l'édition de modèles dans des contextes de génération de textes longs. Après avoir présenté le protocole, il Les résultats présentés incluent des problèmes de « dérive des faits » dans les méthodes d'optimisation directe telles que MEMIT et ROME, la surestimation des méthodes contextuelles comme IKE lorsque l'analyse n'est pas correctement contrôlée, et divers problèmes de qualité introduits par la modification du modèle, comme le manque de cohésion lexicale et la dérive thématique, que nous ne pouvons identifier qu'à l'aide de nos techniques d'évaluation. Ce travail novateur a été soumis pour publication et est actuellement disponible en ligne en prépublication. Finalement, l'auteur a souligné l'importance des interventions de modification du modèle pour concevoir des techniques permettant de générer des modèles caractérisés par une grande cohérence.

Bien que les modèles de langage préentraînés sur de vastes corpus aient démontré d'excellentes performances dans diverses tâches de traitement automatique du langage naturel (TALN), ces systèmes ont été critiqués pour leur manque de connaissances factuelles. Pascal Poupart , membre du corps professoral de Vector et titulaire de la chaire d'intelligence artificielle du CIFAR Canada, également professeur à l'Université de Waterloo, a présenté les avancées en matière de représentation des connaissances pour le TALN. Il a passé en revue les progrès récents de son équipe, notamment l'inférence de graphes de connaissances sur les croyances et les représentations d'objets latents pour les jeux textuels. M. Poupart a également présenté de nouvelles techniques pour l'ajustement efficace des invites et la distillation de grands modèles en modèles plus maniables. Finalement, il a abordé les défis liés à l'utilisation de grands modèles linguistiques pour la correction des erreurs grammaticales et l'accélération de la découverte de contenu.

Vers un traitement automatique du langage naturel universel et des systèmes d'IA plus inclusifs et sensibles aux différences culturelles

Avec la prolifération croissante des technologies d'IA dans la société, il est essentiel de développer des systèmes adaptés aux utilisateurs issus de divers horizons et qui dépassent le cadre culturel occidental en intégrant une sensibilité interculturelle. Négliger les nuances culturelles pourrait engendrer des modèles renforçant les inégalités et les stéréotypes sociaux, et en limiter l'efficacité pour les utilisateurs non occidentaux.

Malgré leur succès remarquable, les modèles de modélisation linguistique (LLM) et de génération d'images présentent plusieurs limitations. Vered Shwartz , membre du corps professoral de Vector et titulaire de la chaire d'intelligence artificielle du CIFAR Canada, également professeure adjointe à l'Université de la Colombie-Britannique, a axé sa présentation sur la perspective occidentale, nord-américaine, voire américaine, trop étroite de ces modèles. Cette perspective découle d'une formation sur des textes et des images provenant principalement d'utilisateurs américains. Par conséquent, les utilisateurs de diverses cultures qui interagissent avec ces outils peuvent se sentir incompris et les percevoir comme moins utiles. Pire encore, lorsque ces modèles sont utilisés dans des applications qui influencent la vie des gens, le manque de sensibilité culturelle peut engendrer des modèles qui perpétuent les stéréotypes et renforcent les inégalités sociales.

Dans mon laboratoire, nous évaluons actuellement la sensibilité culturelle des titulaires d'une maîtrise en droit (LLM) et nous travaillons à l'améliorer en y intégrant des compétences culturelles.

Vered Shwartz

Membre du corps professoral de Vector, titulaire de la chaire d'IA du CIFAR Canada

Elle a également présenté un axe de recherche de son laboratoire visant à quantifier et à atténuer ce biais.

À l'instar du traitement automatique du langage naturel multiculturel, le traitement automatique du langage naturel multilingue doit tenir compte de ces différences afin d'améliorer l'efficacité des systèmes de traitement automatique du langage naturel pour les utilisateurs. Le langage est au cœur des interactions et de la communication humaines. Avec plus de 7 000 langues parlées dans le monde, un système de traitement automatique du langage naturel universel optimal doit être capable de traiter et de comprendre efficacement une grande diversité de langues.

Freda Shi , doctorante à l'Institut technologique Toyota de Chicago, s'est intéressée aux capacités multilingues des grands modèles de langage. Face aux performances remarquables des récents modèles linguistiques, une question se pose naturellement quant à leur capacité multilingue, notamment pour les langues peu dotées en ressources et sous-représentées. Bien que les langues du monde entier présentent de nombreuses similitudes, elles possèdent également une importante diversité typologique. Elle a analysé le multilinguisme des modèles linguistiques actuels, en prenant l'induction d'un lexique bilingue et le raisonnement multilingue comme deux tâches représentatives. Elle a conclu en abordant les défis et les perspectives du multilinguisme à l'ère des modèles de langage.

Faire progresser la recherche et les systèmes de traitement automatique du langage naturel (TALN) exige de surmonter les obstacles spécifiques liés à la collecte et à l'analyse de données provenant de langues à faibles ressources. À mesure que les techniques de TALN évoluent, il est impératif de s'assurer que l'identité culturelle et la langue des locuteurs natifs ne soient ni négligées ni exploitées. Au contraire, ces derniers doivent être activement impliqués dans le processus et avoir les moyens d'influencer la manière dont la technologie les représente, eux, leur langue et leur culture.

Aperçu de VectorLM : Optimisation des charges de travail LLM sur la grappe de calcul Vector

John Willes , responsable technique de l'équipe d'ingénierie IA de Vector, a présenté VectorLM . VectorLM est un ensemble léger développé par l'équipe d'ingénierie IA de l'Institut Vector pour optimiser les charges de travail courantes d'ajustement fin des modèles linéaires à grande échelle (LLM) et permettre aux chercheurs de Vector d'entraîner plus efficacement des modèles de taille moyenne sur la grappe Vector. Willes a présenté un aperçu des enseignements pratiques tirés de l'entraînement de LLM sur la grappe HPC de Vector. Les compromis importants entre le matériel et le logiciel ont été examinés en fonction des contraintes de calcul et de réseau propres au cluster.

Les progrès rapides du traitement automatique du langage naturel (TALN) ont révolutionné la communication. L'interconnexion croissante à l'échelle mondiale a engendré une multitude d'applications dans des domaines très divers. Avec le TALN maintenant omniprésent et dépendant de plus en plus des données générées par les utilisateurs, il est primordial que la recherche dans ce domaine adopte des méthodologies sûres et fiables.

Plongez dans le traitement du langage naturel

Vous voulez en savoir plus sur les initiatives de recherche actuelles du Vector Institute en matière de traitement automatique du langage naturel ? Visionnez la liste de lecture complète des conférences sur YouTube.

Recherche en PNL