Wenhu Chen, chercheur en vecteurs, travaille sur l'amélioration et l'évaluation comparative des modèles de fondation.

20 août 2024

Rechercher

Par Wenhu Chen

La dernière année a été marquée par des progrès considérables dans le domaine des modèles de base, qui atteignent maintenant des performances de niveau expert pour la résolution de problèmes complexes issus du monde réel. Au début de 2023, les meilleurs modèles à code source ouvert 7B, comme Llama-2-7B, n'ont réussi à résoudre que 10 % des problèmes d'algèbre élémentaire de niveau primaire de l'ensemble de données GSM8K. Un an plus tard, Qwen2-7B réglait déjà près de 56 % des problèmes des concours de mathématiques américains de l'ensemble de données MATH. De même, en 2023, les modèles de diffusion vidéo, comme ModelScope, produisaient encore des clips vidéo de piètre qualité et peu réalistes. Mi-2024, plusieurs modèles de diffusion vidéo, tels que Sora et Kling, étaient capables de produire des vidéos longues, fluides et d'un réalisme saisissant. Cette rapidité de développement est sans précédent. Ces progrès sont principalement dus au préentraînement et à l'optimisation des instructions sur des ensembles de données plus vastes et de meilleure qualité.

Mon laboratoire, le laboratoire TIGER de l'Université de Waterloo, est principalement consacré à trois axes de recherche : 

  • Améliorer les capacités des modèles de base pendant la phase de post-entraînement, par exemple en ajustant les instructions ou en optimisant les préférences. 
  • Élaboration de nouveaux points de référence pour évaluer les progrès actuels des modèles de base. 
  • Accroître la fidélité et la contrôlabilité des modèles génératifs pour débloquer diverses applications d'IA générative. 

J'aimerais mettre en lumière quelques articles publiés concernant ces orientations.

Instructions d'accordage

The post-training phase plays an instrumental role in achieving remarkable performance in different down-stream applications. Instruction tuning is the most commonly adopted post-training enhancement. Previously, instruction tuning was done at small scales (< 1M examples). There was a common belief that instruction tuning is not meant to improve models’ core capabilities. In “MAmmoTH2: Scaling instructions from the web,” we attempted to scale up instruction tuning to 10M size to show whether instruction tuning can improve models’ core capabilities. Specifically, we propose an approach to automatically mine educational web documents from pre-training data and then utilize open LLMs to extract large scale naturally existing instruction-response pairs. Through instruction tuning on these massive instruction data, we can significantly improve the reasoning capabilities of LLMs like Mistral or Llama-3. Our model MAmmoTH2 obtained state-of-the-art performance on a wide array of reasoning benchmarks. 

Dans un autre travail intitulé « MANTIS : Réglage d'instructions pour des entrées multi-images entrelacées », nous avons constitué un ensemble de données de réglage d'instructions, MANTIS-instruct, afin de permettre aux modèles multimodaux existants de traiter des entrées multimodales entrelacées. Nous démontrons qu'avec un réglage d'instructions limité, notre ensemble MANTIS-instruct améliore considérablement les performances du modèle pour les tâches impliquant des entrées multi-images entrelacées. Notre meilleur modèle atteint même les performances de GPT-4V.

Dans « StructLM : Vers la construction de modèles généralistes pour l'ancrage des connaissances structurées », nous avons créé un ensemble de données de haute qualité afin d'améliorer la capacité des LLM à s'ancrer sur les connaissances structurelles. En s'appuyant sur les LLM existants, nous avons pu construire un modèle de base robuste capable de traiter différents types de connaissances structurelles, comme les tableaux et les graphes. StructLM atteint des performances de pointe sur huit ensembles de données d'ancrage structurel différents.

C'est une période excitante pour travailler et repousser les limites de ces modèles. Les modèles de base modernes vont complètement révolutionner notre utilisation de l'IA.

Wenhu Chen

Membre du corps professoral de Vector; professeur adjoint à l'École d'informatique David Cheriton de l'Université de Waterloo; titulaire de la chaire d'intelligence artificielle du CIFAR (Canada).

Évaluation des modèles de fondation

Afin de mieux évaluer les modèles de langage modernes et les modèles multimodaux, le laboratoire TIGER travaille également à la construction de suites d'évaluation plus performantes. Notre objectif est de tester les limites des capacités réelles des modèles existants face à des tâches concrètes. 

Dans « MMMU : un banc d'essai multidisciplinaire et multimodal massif pour la compréhension et le raisonnement dans le cadre d'une intelligence artificielle générale experte », nous présentons le premier banc d'essai multidisciplinaire et multimodal massif destiné à évaluer les capacités perceptives et de raisonnement des modèles multimodaux. Ce nouveau banc d'essai se distingue par sa diversité, incluant une grande variété d'entrées visuelles telles que des photographies, des diagrammes, des icônes, des logos, des graphiques et des tableaux. Cet ensemble de données est largement adopté par la communauté comme l'un des bancs d'essai de référence.

Dans « MMLU-Pro : un banc d'essai plus robuste et stimulant pour la compréhension du langage multitâche », nous nous attachons à résoudre les problèmes du jeu de données MMLU actuel, tels que sa sensibilité et sa simplicité. Ces problèmes sont principalement dus au fait que MMLU n'offre que quatre options, ce qui offre des raccourcis permettant au modèle de deviner correctement. Afin de réduire le hasard, nous proposons d'augmenter le nombre d'options pour chaque problème à dix. Cette augmentation réduit considérablement les raccourcis et augmente ainsi la robustesse du banc d'essai. De plus, on l'enrichit avec plus de problèmes de niveau universitaire afin d'en augmenter la difficulté. Grâce à ces améliorations, MMLU-Pro permet de discriminer efficacement les modèles. Cet ensemble de données est également largement utilisé comme banc d'essai officiel pour l'évaluation des modèles dans le classement Hugging Face LM.

Dans l'article « Les modèles de langage à contexte long (LLM) ont du mal à gérer l'apprentissage en contexte long », nous proposons une approche novatrice pour évaluer les LLM à contexte long. Contrairement aux LLM à contexte long précédents (résumé ou questions-réponses sur documents), qui évaluent principalement leurs capacités de recherche à partir d'un contexte d'entrée étendu, nous proposons d'évaluer leurs capacités de compréhension du contexte long à travers le prisme de l'apprentissage en contexte. Avec les tâches de classification d'étiquettes extrêmes, les LLM à contexte long sont contraints de comprendre la séquence complète afin de couvrir l'intégralité de l'espace des étiquettes. Cela permet de réduire le biais de position présent dans les benchmarks existants et d'évaluer plus précisément les capacités des LLM à gérer le contexte long.

Modèles de diffusion d'images/vidéos

La modélisation générative est aussi un axe majeur du TIGER-Lab. Notre objectif est de construire des modèles génératifs plus fidèles et plus contrôlables pour les images et les vidéos.

Dans les tâches de génération d'images à partir de vidéos, un problème majeur est l'infidélité de la vidéo générée par rapport à l'image initiale. Dans « ConsistI2V : Amélioration de la cohérence visuelle pour la génération d'images à partir de vidéos », nous proposons une nouvelle couche d'attention temporelle dilatée afin d'aider les modèles de génération vidéo à être plus fidèles au conditionnement de l'image.

Un autre problème avec les modèles de génération vidéo est leur vitesse. La plupart d'entre eux prennent plus de deux minutes pour produire une vidéo. Différentes approches de distillation permettent d'accélérer ce processus, mais au détriment de la qualité. Dans « T2V-Turbo : Lever le goulot d'étranglement de la qualité des modèles de cohérence vidéo grâce à un système de récompenses mixtes », nous proposons une approche combinant cohérence et apprentissage par renforcement afin d'équilibrer ces deux aspects. Notre modèle T2V-Turbo parvient ainsi à maintenir à la fois efficacité et qualité.

Outre la génération vidéo, le montage vidéo constitue également une application pratique, permettant à l'utilisateur de modifier une vidéo donnée de diverses manières : remplacer des sujets, changer le style, ajouter ou supprimer des éléments. Cependant, les approches de montage vidéo existantes sont souvent empiriques. Dans « AnyV2V : un cadre prêt à l'emploi pour toutes les tâches de montage vidéo », nous proposons de construire un cadre unifié qui répond aux différents besoins des utilisateurs finaux. Notre approche ne nécessite aucun apprentissage et est hautement compatible avec différentes méthodes de retouche d'image. Nous démontrons que notre méthode surpasse largement les autres méthodes existantes. AnyV2V est aussi devenu une référence solide au sein de la communauté GenAI.

Conclusion

Face à l'évolution rapide des modèles de base, nous adoptons chaque jour des modèles plus performants. C'est une période excitante pour travailler à repousser les limites de ces modèles. Les modèles de base modernes vont révolutionner notre utilisation de l'IA. Notre laboratoire continuera de travailler sur différents aspects de ces modèles, tels que l'ajustement des instructions, l'optimisation des préférences, l'évaluation, l'augmentation des données de recherche et la génération de contenu visuel.

Profil de recherche