Recherche vectorielle présentée à ICLR 2023

12 juin 2023

Rechercher

Par Natasha Ali

Plusieurs articles de membres et de chercheurs associés de Vector ont été acceptés lors de la conférence internationale sur les représentations de l'apprentissage (ICLR) de 2023. Cet événement annuel, qui s'est tenu du 1er au 5 mai, a présenté des présentations et des ateliers animés par des chercheurs en apprentissage profond du monde entier.

Parmi les 21 articles des professeurs et des membres affiliés de Vector figuraient des travaux inédits et des approches novatrices dans les domaines du traitement automatique du langage, de l'IA prédictive et de l'apprentissage par renforcement.

Les chercheurs travaillant sur les vecteurs font des progrès remarquables dans le domaine de l'intelligence artificielle générative et de l'apprentissage par renforcement.

Jimmy Ba, membre du corps professoral de Vector, est coauteur de l'article « Large Language Models are Human-Level Prompt Engineers », qui propose un nouvel algorithme générant automatiquement des instructions à partir d'entrées en langage naturel. Baptisé Automatic Prompt Engineering (Ingénierie Automatique des Instructions), cet algorithme permet aux chercheurs de programmer des modèles de langage de grande taille (LLM) pour traiter les commandes humaines, créer une liste d'instructions potentiellement pertinentes et choisir le modèle d'instruction le plus adapté. Cette méthode permet aux LLM de traiter le langage humain avec une plus grande précision et d'exécuter les instructions souhaitées. L'objectif final est de faciliter l'interaction homme-machine et d'atteindre des performances comparables à celles de l'humain avec les modèles de génération de texte.

L'article de Pascal Poupart, intitulé « Benchmarking Constraint Inference in Inverse Reinforcement Learning », a également été accepté à la conférence de cette année. Cet article souligne l'importance de la collecte de données expérimentales pour développer des modèles d'apprentissage machine capables d'imiter le comportement humain. Afin de recréer fidèlement des scénarios réalistes, les chercheurs ont conçu un simulateur de course humaine intégrant des composants et des obstacles réalistes. Explorant les perspectives de l'IA dans la conduite automatisée, ils ont développé une simulation de conduite sur autoroute et recruté des participants humains pour réaliser des démonstrations contrôlées. En observant les réactions humaines face aux contraintes et aux obstacles dans des conditions de conduite réelles, ils ont recueilli des données pratiques pour développer un algorithme d'apprentissage automatique. Grâce à l'apprentissage par renforcement contraint inverse (ICRL), cet algorithme a été entraîné à reconnaître des schémas comportementaux et à éviter les contraintes environnementales en conséquence. En récompensant les comportements semblables aux données expérimentales, ils ont renforcé les comportements humains et développé des modèles ICRL performants.

Articles de recherche sur les vecteurs présentés à ICLR 2023

Vous trouverez ci-dessous les résumés de chacun des articles coécrits par des membres du corps professoral de Vector et des membres affiliés à la faculté, acceptés lors de la conférence ICLR de cette année.

Évaluation comparative de l'inférence de contraintes dans l'apprentissage par renforcement inverse

Guiliang Liu, Yudong Luo, Ashish Gaurav, Kasra Rezaee, Pascal Poupart

Lors du déploiement d'agents d'apprentissage par renforcement (RL) dans un système physique, il est essentiel de s'assurer qu'ils comprennent parfaitement les contraintes sous-jacentes. Or, dans de nombreux problèmes concrets, ces contraintes sont souvent difficiles à spécifier mathématiquement et inconnues des agents RL. Pour pallier ces difficultés, l'apprentissage par renforcement inverse contraint (ICRL) estime empiriquement les contraintes à partir de démonstrations d'experts. En tant que domaine de recherche émergent, l'ICRL n'a pas de bancs d'essai communs, et les travaux antérieurs ont testé les algorithmes dans des environnements conçus manuellement, avec des démonstrations d'experts générées manuellement. Dans cet article, nous construisons un banc d'essai ICRL dans le contexte des domaines d'application du RL, notamment le contrôle de robots et la conduite autonome. Pour chaque environnement, nous concevons des contraintes pertinentes et entraînons des agents experts à générer des données de démonstration. De plus, contrairement aux méthodes de référence existantes qui apprennent une contrainte déterministe, nous proposons une méthode ICRL variationnelle pour modéliser une distribution a posteriori des contraintes candidates. Nous menons des expériences approfondies sur ces algorithmes dans le cadre de notre banc d'essai et montrons comment ils peuvent faciliter l'étude des principaux défis de recherche pour l'ICRL.

Équilibrage occasionnel pour la généralisation du domaine

Xinyi Wang, Michael Saxon, Jiachen Li, Hongyang Zhang, Kun Zhang, William Yang Wang

Alors que les modèles d'apprentissage machine font rapidement progresser l'état de l'art dans diverses tâches concrètes, la généralisation hors domaine (OOD) demeure un problème complexe en raison de la vulnérabilité de ces modèles aux corrélations parasites. Nous proposons une stratégie d'échantillonnage par mini-lots équilibrés pour transformer une distribution de données biaisée en une distribution équilibrée exempte de corrélations parasites, en nous appuyant sur l'invariance des mécanismes causaux sous-jacents au processus de génération des données. Nous démontrons que les classificateurs bayésiens optimaux entraînés sur une telle distribution équilibrée sont minimax optimaux dans un espace d'environnements suffisamment diversifié. Nous fournissons également une garantie d'identifiabilité du modèle à variables latentes du processus de génération de données proposé, en utilisant un nombre suffisant d'environnements d'entraînement. Des expériences menées sur DomainBed démontrent empiriquement que notre méthode obtient les meilleures performances parmi 20 méthodes de référence disponibles sur ce benchmark.

Confidentiel-PROFITT : Preuve confidentielle de la bonne formation des arbres

Ali Shahin Shamsabadi, Sierra Calanda Wyllie, Nicholas Franzese, Natalie Dullerud, Sébastien Gambs, Nicolas Papernot, Xiao Wang, Adrian Weller

L'audit a posteriori de l'équité des modèles présente des inconvénients potentiels : (1) l'audit peut être très sensible aux échantillons de test choisis ; (2) le modèle et/ou ses données d'entraînement pourraient devoir être partagées avec un auditeur, ce qui compromet la confidentialité. Nous résolvons ces problèmes en fournissant un certificat attestant que l'algorithme d'apprentissage lui-même est équitable et, par conséquent, que le modèle entraîné l'est également. Nous introduisons une méthode permettant de fournir une preuve confidentielle d'équité pour la formation, dans le contexte des arbres de décision largement utilisés, que nous appelons Confidential-PROFITT. Nous proposons de nouveaux algorithmes d'apprentissage d'arbres de décision équitables, ainsi que des protocoles de preuve à divulgation nulle de connaissances personnalisés, afin d'obtenir une preuve d'équité vérifiable par un tiers. L'utilisation de preuves à divulgation nulle de connaissances nous permet d'assurer la confidentialité du modèle et de ses données d'entraînement. Nous montrons empiriquement que la limitation du gain d'information de chaque nœud par rapport aux attributs sensibles réduit l'iniquité de l'arbre final. Dans le cadre d'expérimentations approfondies menées sur les ensembles de données COMPAS, Communities and Crime, Default Credit et Adult, nous démontrons qu'une entreprise peut utiliser Confidential-PROFITT pour certifier l'équité de son arbre de décision auprès d'un auditeur en moins de 2 minutes, ce qui confirme la pertinence de notre approche. Ceci est valable pour les définitions d'équité basées sur la parité démographique et sur l'égalité des chances. Finalement, on étend Confidential-PROFITT afin de l'appliquer aux ensembles d'arbres.

Extension de valeur basée sur un modèle bayésien conservateur pour le hors ligne

Optimisation des politiques

Jihwan Jeong, Xiaoyu Wang, Michael Gimelfarb, Hyunwoo Kim, Baher Abdulhai, Scott Sanner

L'apprentissage par renforcement hors ligne (RL) s'attaque au problème de l'apprentissage d'une politique performante à partir d'un ensemble fixe de données recueillies en suivant une politique comportementale donnée. Les approches basées sur un modèle sont particulièrement intéressantes dans ce contexte, car elles permettent d'extraire davantage de signaux d'apprentissage des données enregistrées en apprenant un modèle de l'environnement. Cependant, les performances des approches basées sur un modèle existantes restent inférieures à celles des approches sans modèle, en raison de l'accumulation des erreurs d'estimation dans le modèle appris. Partant de ce constat, nous affirmons qu'il est crucial pour une méthode basée sur un modèle de savoir quand se fier au modèle et quand s'appuyer sur des estimations sans modèle, et comment adopter une approche prudente par rapport aux deux. À cette fin, nous proposons une méthodologie élégante et simple, appelée expansion de valeur bayésienne conservatrice basée sur un modèle pour l'optimisation de politique hors ligne (CBOP), qui établit un compromis entre les estimations sans modèle et celles basées sur un modèle lors de l'évaluation de la politique, en fonction de leurs incertitudes épistémiques, et favorise le conservatisme en fixant une borne inférieure à l'estimation bayésienne de la valeur a posteriori. Sur les tâches de contrôle continu D4RL standard, notre méthode surpasse nettement les approches basées sur des modèles précédentes : par exemple, MOPO de 116,4 %, MOReL de 23,2 % et COMBO de 23,7 %. De plus, CBOP atteint des performances de pointe sur 11 des 18 ensembles de données de référence, tout en obtenant des résultats équivalents sur les autres.

L'apprentissage contrastif peut trouver une base optimale pour approximativement

Fonctions invariantes par point de vue

Daniel D. Johnson, Ayoub El Hanchi, Chris J. Maddison

L'apprentissage contrastif est un cadre puissant pour l'apprentissage de représentations auto-supervisées qui se généralisent bien aux tâches supervisées en aval. Nous montrons que plusieurs méthodes d'apprentissage contrastive existantes peuvent être réinterprétées comme l'apprentissage d'un noyau défini positif qui approxime un *noyau contrastif* particulier défini par les paires positives. Les composantes principales des données sous ce noyau correspondent exactement aux fonctions propres d'une chaîne de Markov de paires positives, et ces fonctions propres peuvent être utilisées pour construire une représentation qui minimise de manière prouvée l'erreur d'approximation dans le pire des cas des prédicteurs linéaires, en supposant que les paires positives ont des étiquettes similaires. Nous donnons des bornes de généralisation pour la prédiction linéaire en aval à l'aide de cette représentation optimale, et montrons comment approximer cette représentation à l'aide de l'ACP à noyau. Nous explorons également des représentations basées sur un noyau sur une tâche MNIST bruitée pour laquelle la distribution des paires positives a une forme analytique, et comparons les propriétés des fonctions propres réelles avec leurs approximations apprises.

Restauration par lots d'étiquettes par instance par gradients dans un environnement fédéré

Apprentissage

Kailang Ma, Yu Sun, Jian Cui, Dawei Li, Zhenyu Guan, Jianwei Liu

Les attaques par inversion de gradient constituent une menace sérieuse pour la confidentialité de l'apprentissage fédéré. Ces attaques recherchent la paire optimale entrée-étiquette correspondant le mieux aux gradients partagés, et leur espace de recherche peut être réduit par la restauration préalable des étiquettes. Récemment, des techniques de restauration d'étiquettes ont permis l'extraction analytique des étiquettes à partir des gradients, mais même les méthodes les plus avancées restent limitées à l'identification de la présence de catégories (restauration d'étiquettes par classe). Ce travail considère des contextes plus réalistes, où chaque classe est représentée par plusieurs instances dans un lot d'entraînement. Une méthode analytique est proposée pour effectuer la restauration d'étiquettes par lot, instance par instance, à partir du seul gradient de la dernière couche. À partir des représentations vectorielles approximatives par classe et des probabilités post-softmax, nous établissons des équations linéaires reliant les gradients, les probabilités et les étiquettes afin de calculer le nombre d'instances (NoI) par classe grâce à l'algorithme de pseudo-inverse de Moore-Penrose. Nos évaluations expérimentales atteignent une précision d'existence des étiquettes (LeAcc) supérieure à 99 % et une précision du nombre d'étiquettes (LnAcc) supérieure à 96 % dans la plupart des cas, sur trois ensembles de données d'images et quatre modèles de classification. Ces deux mesures permettent d'évaluer respectivement la précision de la restauration des étiquettes par classe et par instance. La restauration est possible même avec une taille de lot de 4096 et des activations partiellement négatives (par exemple, Leaky ReLU et Swish). De plus, nous démontrons que notre méthode facilite les attaques par inversion de gradient existantes en exploitant les étiquettes restaurées, avec un gain de 6 à 7 en PSNR sur MNIST et CIFAR100.

Les grands modèles de langage sont des ingénieurs en prompteur de niveau humain.

Yongchao Zhou, Andrei Ioan Muresanu, Ziwen Han, Keiran Paster, Silviu Pitis, Harris Chan, Jimmy Ba

En s'appuyant sur des instructions en langage naturel, les grands modèles de langage (GML) ont démontré des capacités impressionnantes en tant qu'ordinateurs à usage général. Cependant, leur performance dépend grandement de la qualité de l'instruction utilisée pour les piloter, et les instructions les plus efficaces ont été conçues manuellement. Inspirés par la synthèse de programmes classique et l'approche humaine de l'ingénierie des instructions, nous proposons Automatic Prompt Engineer (APE) pour la génération et la sélection automatiques d'instructions. Dans notre méthode, l'instruction est considérée comme le « programme », optimisé par une recherche parmi un ensemble d'instructions candidates proposées par un GML afin de maximiser une fonction de score choisie. Pour évaluer la qualité de l'instruction sélectionnée, nous évaluons les performances initiales d'un autre GML suivant cette instruction. Des expériences menées sur 24 tâches de traitement automatique du langage naturel (TALN) montrent que nos instructions générées automatiquement surpassent largement les GML de référence et atteignent des performances supérieures ou comparables à celles des instructions générées par des annotateurs humains sur 21 tâches sur 24. Nous menons des analyses qualitatives et quantitatives approfondies pour explorer les performances d'APE. Nous montrons que les invites conçues par APE peuvent être utilisées pour orienter les modèles vers la véracité et/ou la pertinence, ainsi que pour améliorer les performances d'apprentissage avec peu d'exemples en les ajoutant simplement aux invites d'apprentissage standard en contexte.

Structure d'apprentissage pour l'exploration structurée dans

Domaines à faible récompense

Zihan Zhou, Animesh Garg

Nous proposons SEA (Structured Exploration with Achievements), un algorithme d'apprentissage par renforcement multi-étapes conçu pour les environnements basés sur les succès, un type particulier d'environnement possédant un ensemble de succès internes. SEA utilise d'abord des données hors ligne pour apprendre une représentation des succès connus grâce à une fonction de perte déterminante. Ensuite, il reconstruit le graphe de dépendance des succès appris à l'aide d'un algorithme heuristique, et finalement, il interagit en ligne avec l'environnement pour apprendre des stratégies permettant de maîtriser les succès connus et d'en explorer de nouveaux grâce à un contrôleur construit à partir du graphe de dépendance reconstruit. Nous démontrons empiriquement que SEA peut reconstruire la structure des succès avec précision et améliorer l'exploration dans des domaines complexes tels que Crafter, générés de manière procédurale à partir d'observations de grande dimension, comme des images.

Apprentissage des contraintes souples à partir de démonstrations d'experts contraintes

Ashish Gaurav, Kasra Rezaee, Guiliang Liu, Pascal Poupart

Les méthodes d'apprentissage par renforcement inverse (IRL) supposent que les données d'experts sont générées par un agent optimisant une fonction de récompense. Cependant, dans de nombreux contextes, l'agent peut optimiser cette fonction sous certaines contraintes, lesquelles induisent des comportements difficiles à exprimer par la seule fonction de récompense. Nous considérons le cas où la fonction de récompense est donnée et les contraintes inconnues, et proposons une méthode capable de les reconstruire de manière satisfaisante à partir des données d'experts. Alors que les travaux précédents se sont concentrés sur la reconstruction de contraintes strictes, notre méthode permet de reconstruire les contraintes souples cumulatives que l'agent satisfait en moyenne par épisode. À l'instar de l'IRL, notre méthode résout ce problème en ajustant itérativement la fonction de contrainte par une procédure d'optimisation contrainte, jusqu'à ce que le comportement de l'agent corresponde à celui de l'expert. Nous illustrons notre approche sur des environnements synthétiques, des environnements robotiques et des scénarios de conduite réelle sur autoroute.

Mesurer l'oubli d'exemples de formation mémorisés

Matthew Jagielski, Om Thakkar, Florian Tramer, Daphne Ippolito, Katherine Lee, Nicholas Carlini, Eric Wallace, Shuang Song, Abhradeep Guha Thakurta, Nicolas Papernot, Chiyuan Zhang

Les modèles d'apprentissage machine présentent deux phénomènes apparemment contradictoires : la mémorisation des données d'entraînement et diverses formes d'oubli. La mémorisation amène les modèles à surapprendre certains exemples d'entraînement et à devenir vulnérables aux atteintes à la vie privée. L'oubli, quant à lui, se traduit par l'oubli graduel des exemples apparus au début de l'entraînement. Dans ce travail, nous établissons un lien entre ces phénomènes. Nous proposons une technique permettant de mesurer dans quelle mesure les modèles « oublient » les spécificités des exemples d'entraînement, devenant ainsi moins vulnérables aux atteintes à la vie privée sur les exemples qu'ils n'ont pas vus récemment. Nous montrons que, si la non-convexité peut empêcher l'oubli dans le pire des cas, les modèles standard d'images, de parole et de langage oublient bel et bien des exemples au fil du temps. Nous identifions le non-déterminisme comme une explication potentielle, en démontrant que les modèles entraînés de manière déterministe n'oublient pas. Nos résultats suggèrent que les exemples vus au début de l'entraînement avec des ensembles de données extrêmement volumineux — par exemple, ceux utilisés pour le pré-entraînement d'un modèle — peuvent bénéficier d'une meilleure protection de la vie privée au détriment des exemples vus ultérieurement.

Archéologie des métadonnées : déterrer des sous-ensembles de données en tirant parti de

Dynamique de l'entraînement

Shoaib Ahmed Siddiqui, Nitarshan Rajkumar, Tegan Maharaj, David Krueger, Sara Hooker

La recherche moderne en apprentissage machine repose sur un nombre relativement restreint d'ensembles de données soigneusement organisés. Même dans ces ensembles, et généralement avec des données brutes ou « non structurées », les chercheurs sont confrontés à d'importants problèmes de qualité et de diversité des données, dont la résolution peut s'avérer extrêmement laborieuse. Les méthodes existantes pour relever ces défis reposent souvent sur des hypothèses fortes concernant les problèmes spécifiques en jeu et nécessitent fréquemment des connaissances a priori ou des métadonnées telles que des étiquettes de domaine. Notre travail est orthogonal à ces méthodes : nous nous concentrons plutôt sur la fourniture d'un cadre unifié et efficace pour l'archéologie des métadonnées, c'est-à-dire la découverte et l'inférence des métadonnées d'exemples dans un ensemble de données. Nous organisons différents sous-ensembles de données susceptibles d'exister dans un ensemble de données (par exemple, des exemples mal étiquetés, atypiques ou hors distribution) à l'aide de transformations simples, et nous exploitons les différences de dynamique d'apprentissage entre ces ensembles de données pour inférer les métadonnées pertinentes. Notre méthode est comparable à des méthodes d'atténuation beaucoup plus sophistiquées pour différentes tâches : identification et correction d'exemples mal étiquetés, classification d'échantillons de groupes minoritaires, priorisation des points pertinents pour la formation et mise en place d'un audit humain à grande échelle des exemples pertinents.

Apprentissage par renforcement multiobjectif : convexité, stationnarité

et l'optimalité de Pareto

Haoye Lu, Daniel Herman, Yaoliang Yu

Au cours des dernières années, les algorithmes d'apprentissage par renforcement à objectif unique (SORL) ont suscité un vif intérêt et ont obtenu des résultats prometteurs. Cependant, il est généralement admis que de nombreux problèmes pratiques présentent des propriétés multi-objectifs intrinsèques, difficiles à traiter par les algorithmes SORL. Bien que de nombreux algorithmes d'apprentissage par renforcement multiobjectif (MORL) aient été proposés, les propriétés fondamentales des espaces d'apprentissage ont été peu explorées récemment. Dans cet article, nous menons une analyse rigoureuse des fonctions de valeur induites par les politiques et utilisons ces observations pour distinguer trois conceptions de l'optimalité de Pareto. Les résultats impliquent la convexité de l'image de la fonction de valeur induite pour les politiques stationnaires et suggèrent que tout point de son front de Pareto peut être atteint en entraînant une politique par scalarisation linéaire (LS). Nous montrons que le problème à l'origine des performances sous-optimales de LS peut être résolu en ajoutant des termes fortement concaves aux récompenses immédiates, ce qui nous incite à proposer un nouvel algorithme d'apprentissage Q basé sur la récompense vectorielle : CAPQL. Associé à une formulation acteur-critique, notre algorithme atteint des performances de pointe sur plusieurs tâches MuJoCo dans un contexte agnostique des préférences. De plus, nous démontrons empiriquement que, contrairement à d'autres algorithmes basés sur les moindres carrés, notre approche est nettement plus stable, obtenant des résultats similaires pour différentes valeurs initiales aléatoires.

VAE multifréquences : un seul entraînement suffit pour obtenir la courbe débit-distorsion complète.

Juhan Bae, Michael R. Zhang, Michael Ruan, Eric Wang, So Hasegawa, Jimmy Ba, Roger Baker Grosse

Les auto-encodeurs variationnels (VAE) sont des outils puissants pour l'apprentissage de représentations latentes de données, utilisés dans de nombreuses applications. En pratique, les VAE nécessitent généralement plusieurs itérations d'entraînement pour déterminer la quantité d'information que la variable latente doit conserver. Ce compromis entre l'erreur de reconstruction (distorsion) et la divergence de Kullback-Leibler (taux) est généralement paramétré par un hyperparamètre β. Dans cet article, nous présentons les VAE multi-taux (MR-VAE), un cadre de calcul efficace pour l'apprentissage de paramètres optimaux correspondant à différentes valeurs de β en une seule itération d'entraînement. L'idée principale est de formuler explicitement une fonction de réponse à l'aide d'hyperréseaux, qui associe β aux paramètres optimaux. Les MR-VAE construisent un hyperréseau de réponse compact où les préactivations sont conditionnées par β. Nous justifions l'architecture proposée en analysant des VAE linéaires et en montrant qu'elle peut représenter exactement les fonctions de réponse de ces derniers. Grâce à l'hyperréseau appris, les MR-VAE peuvent construire la courbe débit-distorsion sans entraînement supplémentaire et être déployés avec un réglage des hyperparamètres considérablement réduit. Empiriquement, notre approche est compétitive et surpasse souvent les performances de l'entraînement de plusieurs β-VAE, avec une surcharge de calcul et de mémoire minimale.

Contrôle du risque quantile : un cadre souple pour limiter le

Probabilité de prévisions de pertes élevées

Jake Snell, Thomas P Zollo, Zhun Deng, Toniann Pitassi, Richard Zemel

Des garanties rigoureuses quant aux performances des algorithmes prédictifs sont essentielles pour assurer leur utilisation responsable. Les travaux antérieurs se sont principalement concentrés sur la limitation de la perte attendue d'un prédicteur, mais cela s'avère insuffisant dans de nombreuses applications sensibles aux risques où la distribution des erreurs est cruciale. Dans cet article, nous proposons un cadre souple pour générer une famille de bornes sur les quantiles de la distribution des pertes subies par un prédicteur. Notre méthode exploite les statistiques d'ordre des valeurs de perte observées plutôt que de se baser uniquement sur la moyenne de l'échantillon. Nous démontrons qu'un quantile constitue une méthode pertinente pour quantifier les performances prédictives et que notre cadre s'applique à diverses mesures basées sur les quantiles, chacune ciblant des sous-ensembles importants de la distribution des données. Nous analysons les propriétés théoriques de notre méthode et démontrons sa capacité à contrôler rigoureusement les quantiles de perte sur plusieurs ensembles de données réels.

Re-Imagen : Générateur de texte en image enrichi par la recherche

Wenhu Chen, Hexiang Hu, Chitwan Saharia, William W. Cohen

La recherche sur la génération d'images à partir de texte a connu des progrès significatifs dans la production d'images diversifiées et photoréalistes, grâce aux modèles de diffusion et autorégressifs entraînés sur des ensembles de données image-texte à grande échelle. Bien que les modèles les plus performants puissent générer des images de haute qualité d'entités courantes, ils éprouvent souvent des difficultés à générer des images d'entités rares, comme « Chortai (chien) » ou « Picarones (aliment) ». Pour remédier à ce problème, nous présentons Re-Imagen, un générateur de texte à partir d'informations enrichies, qui utilise des informations extraites pour produire des images fidèles et précises, même pour des entités rares ou inconnues. À partir d'une requête textuelle, Re-Imagen accède à une base de connaissances multimodale externe pour extraire les paires (image, texte) pertinentes et les utilise comme références pour générer l'image. Grâce à cette étape d'extraction, Re-Imagen est enrichi de connaissances sémantiques de haut niveau et de détails visuels de bas niveau sur les entités mentionnées, ce qui améliore la précision de la génération de leur apparence visuelle. Nous entraînons ReImagen sur un jeu de données construit contenant des triplets (image, texte, requête) afin d'apprendre au modèle à se baser à la fois sur l'invite textuelle et sur la requête. De plus, on développe une nouvelle stratégie d'échantillonnage pour intégrer les indications sans classificateur aux conditions de texte et de requête, afin d'équilibrer l'alignement entre ces deux éléments. ReImagen obtient un gain significatif en termes de score FID par rapport à COCO et WikiImage. Pour évaluer plus en détail les capacités du modèle, nous présentons EntityDrawBench, un nouveau benchmark qui évalue la génération d'images pour diverses entités, des plus fréquentes aux plus rares, dans de multiples catégories d'objets, notamment les chiens, les aliments, les monuments, les oiseaux et les personnages. L'évaluation humaine sur EntityDrawBench montre que ReImagen peut améliorer significativement la fidélité des images générées, en particulier pour les entités les moins fréquentes.

Supervision automatique par segments aléatoires avec autorégression

Codage (RandSAC)

Tianyu Hua, Yonglong Tian, ​​Sucheng Ren, Michalis Raptis, Hang Zhao, Leonid Sigal

Inspirés par le succès de l'apprentissage autorégressif de représentations en langage naturel (GPT et ses variantes) et par les avancées récentes en matière d'architecture visuelle avec les Vision Transformers (ViT), nous explorons dans cet article l'influence de différents choix de conception sur l'efficacité de telles stratégies d'apprentissage pour l'extraction de caractéristiques visuelles. Plus précisément, nous introduisons une nouvelle stratégie : RandSAC (Random Segments with Autoregressive Coding). Dans RandSAC, les représentations de patchs (jetons d'images) sont regroupées en segments hiérarchisés. Au sein de chaque segment, les jetons sont prédits en parallèle, comme pour BERT, tandis que les prédictions entre segments sont séquentielles, comme pour GPT. Nous montrons que la sérialisation aléatoire des segments améliore significativement les performances et permet d'obtenir une distribution des prédictions spatialement longues (entre segments) et courtes (au sein d'un même segment), efficace pour l'apprentissage des caractéristiques. Nous illustrons la pertinence de ces choix de conception et explorons des alternatives sur plusieurs ensembles de données (par exemple, CIFAR10, CIFAR100 et ImageNet). Bien que notre stratégie de pré-entraînement fonctionne avec le Transformer classique, nous proposons également un ajout conceptuellement simple, mais très efficace, au décodeur qui permet des connexions de saut apprenables vers les couches de caractéristiques de l'encodeur, ce qui améliore encore les performances.

L'auto-encodeur variationnel incliné : amélioration des performances hors distribution

Détection

Griffin Floto, Stefan Kremer, Mihai Nica

L'utilisation d'une distribution gaussienne comme loi a priori pour un auto-encodeur variationnel (VAE) pose problème : l'ensemble des régions de forte densité de probabilité des gaussiennes se réduit lorsque la dimension latente augmente. Or, les VAE visent à la fois une forte vraisemblance par rapport à la distribution a priori et une bonne séparation des points pour une reconstruction optimale. Un faible volume dans la région de forte densité de la loi a priori est donc problématique, car il limite la séparation des points latents. Afin d'y remédier, nous proposons une généralisation simple de la distribution gaussienne : la gaussienne inclinée. Dans cette généralisation, la densité de probabilité maximale est sur une sphère et non sur un point unique. La gaussienne inclinée présente un volume exponentiellement plus grand dans les régions de forte densité que la gaussienne standard, en fonction de la dimension de la distribution. Nous démontrons empiriquement que cette simple modification de la distribution a priori améliore les performances du VAE pour la détection non supervisée d'échantillons hors distribution (OOD). Nous présentons également une nouvelle procédure de test OOD, appelée test Will-It-Move, dans laquelle la gaussienne inclinée atteint des performances OOD remarquables.

Quand l'adaptation de domaine sans source rencontre l'apprentissage avec des étiquettes bruitées

Li Yi, Gezheng Xu, Pengcheng Xu, Jiaqi Li, Ruizhi Pu, Charles Ling, Ian McLeod, Boyu Wang

Les méthodes d'adaptation de domaine sans source (SFDA) les plus récentes se sont concentrées sur l'apprentissage de structures de grappes pertinentes dans l'espace des caractéristiques. Elles ont ainsi réussi à adapter les connaissances du domaine source à un domaine cible non étiqueté sans accéder aux données sources privées. Cependant, les méthodes existantes reposent sur les pseudo-étiquettes générées par les modèles sources, lesquelles peuvent être bruitées en raison du changement de domaine. Dans cet article, nous étudions la SFDA sous l'angle de l'apprentissage avec bruit d'étiquettes (LLN). Contrairement au bruit d'étiquettes dans le scénario LLN conventionnel, nous démontrons que le bruit d'étiquettes en SFDA suit une hypothèse de distribution différente. Nous prouvons également que cette différence rend les méthodes LLN existantes, qui reposent sur leurs hypothèses de distribution, incapables de traiter le bruit d'étiquettes en SFDA. Les résultats empiriques suggèrent que l'application des méthodes LLN existantes à la résolution du problème de SFDA n'apporte que des améliorations marginales. Par ailleurs, bien qu'il existe une différence fondamentale entre le bruit d'étiquettes dans les deux scénarios, nous démontrons théoriquement que le phénomène d'apprentissage précoce (ETP), déjà observé dans les contextes de bruit d'étiquettes conventionnels, peut également être observé dans le problème de SFDA. Des expériences approfondies démontrent des améliorations significatives des algorithmes SFDA existants en tirant parti de l'ETP pour traiter le bruit d'étiquetage dans SFDA.

SlotFormer : Simulation de dynamique visuelle non supervisée avec

Modèles centrés sur les objets

Ziyi Wu, Nikita Dvornik, Klaus Greff, Thomas Kipf, Animesh Garg

Comprendre la dynamique à partir d'observations visuelles est un problème complexe qui nécessite de désintégrer les objets individuels de la scène et d'apprendre leurs interactions. Bien que les modèles récents centrés sur les objets réussissent à décomposer une scène en objets, la modélisation efficace de leur dynamique demeure un défi. Nous abordons ce problème en introduisant SlotFormer, un modèle autorégressif basé sur l'architecture Transformer et fonctionnant à partir de représentations centrées sur les objets apprises. À partir d'un clip vidéo, notre approche analyse les caractéristiques des objets pour modéliser les relations spatio-temporelles et prédire avec précision leurs états futurs. Dans cet article, nous appliquons avec succès SlotFormer à la prédiction vidéo sur des ensembles de données présentant des interactions complexes entre objets. De plus, le modèle de dynamique non supervisé de SlotFormer peut être utilisé pour améliorer les performances de tâches supervisées en aval, telles que la réponse visuelle aux questions (VQA) et la planification conditionnée par un objectif. Comparativement aux travaux antérieurs sur la modélisation de la dynamique, notre méthode permet une synthèse à long terme de la dynamique des objets nettement supérieure, tout en conservant une génération visuelle de haute qualité. D'ailleurs, SlotFormer permet aux modèles VQA de raisonner sur l'avenir sans étiquettes au niveau des objets, surpassant même les modèles utilisant des annotations de vérité sur le terrain. Finalement, nous démontrons sa capacité à servir de modèle mondial pour la planification basée sur des modèles, qui est compétitive par rapport aux méthodes conçues spécifiquement pour de telles tâches.

Apprentissage mutuel d'étiquettes partielles avec bruit d'étiquettes compétitif

Yan Yan, Yuhong Guo

L'apprentissage d'étiquettes partielles (PLL) est un problème important d'apprentissage faiblement supervisé, où chaque instance d'entraînement est associée à un ensemble d'étiquettes candidates comprenant à la fois l'étiquette réelle et des étiquettes bruitées supplémentaires. La plupart des méthodes PLL existantes supposent que ces étiquettes bruitées candidates sont choisies au hasard, ce qui est rarement le cas dans les scénarios d'apprentissage réels. Dans cet article, nous considérons un scénario PLL plus réaliste avec un bruit d'étiquettes compétitif, plus difficile à distinguer de l'étiquette réelle qu'un bruit aléatoire. Nous proposons une nouvelle approche PLL basée sur l'apprentissage mutuel, nommée ML-PLL, pour résoudre ce problème complexe. ML-PLL apprend conjointement un classificateur basé sur un réseau de prédiction et un classificateur basé sur des prototypes de classes, grâce à un apprentissage mutuel interactif et à la correction des étiquettes. De plus, nous utilisons un réseau de transformation pour modéliser les relations d'association entre l'étiquette réelle et les étiquettes candidates, et nous l'apprenons conjointement avec le réseau de prédiction afin de faire correspondre les étiquettes candidates observées dans les données d'entraînement et d'améliorer la correction des étiquettes. De nombreuses expériences ont été menées sur plusieurs ensembles de données PLL de référence, et l'approche ML-PLL proposée démontre des performances de pointe pour l'apprentissage d'étiquettes partielles.

Adaptation de domaine non supervisée avec étiquetage partiel et alignement classe-prototype

Yan Yan, Yuhong Guo

L'apprentissage d'étiquettes partielles (PLL) s'attaque au problème où chaque instance est associée à un ensemble d'étiquettes candidates, dont une seule correspond à l'étiquette de référence. La plupart des approches PLL existantes supposent que les ensembles d'entraînement et de test partagent une distribution de données identique. Cependant, cette hypothèse est invalidée dans de nombreux scénarios réels où les données d'entraînement et de test proviennent de distributions différentes. Dans cet article, nous officialisons ce scénario d'apprentissage comme un nouveau problème appelé adaptation de domaine non supervisée avec étiquettes partielles (PLUDA). Pour résoudre ce problème PLUDA complexe, nous proposons une nouvelle méthode PLUDA basée sur l'alignement de prototypes, nommée PAPLUDA. Cette méthode affine dynamiquement les pseudo-étiquettes des instances des domaines source et cible en consultant les sorties d'un modèle maître-élève selon une méthode de moyenne mobile, et comble la divergence entre les domaines grâce à un alignement inter-domaines des prototypes de classes. De plus, une régularisation contrastive basée sur un modèle maître-élève est déployée pour améliorer la stabilité des prédictions et, par conséquent, les prototypes de classes dans les deux domaines pour PLUDA. Des résultats expérimentaux complets démontrent que PAPLUDA atteint des performances de pointe sur les ensembles de données de référence largement utilisés.