Des chercheurs travaillant sur les vecteurs récompensés lors de la Conférence internationale sur les représentations d'apprentissage (ICLR) de 2022

19 mai 2022

Rechercher

Par Ian Gormely
19 mai 2022

Deux articles coécrits par des chercheurs de Vector ont été reconnus lors de la Conférence internationale sur les représentations d'apprentissage (ICLR) de cette année. 

Nicolas Papernot et Thomas Steinke, membres du corps professoral de Vector, ont remporté le prix du meilleur article pour leurs travaux intitulés « Optimisation des hyperparamètres avec confidentialité différentielle de Renyi ». Cet article démontre comment la méthode actuelle d'analyse de la confidentialité d'un algorithme pendant son entraînement peut sous-estimer les fuites d'informations privées. « En général, on analyse une seule exécution de l'algorithme pendant l'entraînement », dit Papernot. « Nous montrons ici comment étendre cette analyse afin de tenir compte des fuites d'informations sur l'ensemble de l'entraînement, y compris l'optimisation des hyperparamètres. »

L'article intitulé « Effondrement neuronal sous perte MSE : proximité et dynamique du chemin central », écrit par Vardan Papyan, membre associé de la faculté Vector, et ses coauteurs XY Han et David L. Donoho, a également reçu la distinction de Meilleur article. Cet article met en évidence un schéma empirique commun d'« effondrement neuronal » observé dans de nombreux ensembles de données et architectures de classification : une structure géométrique simple qui émerge lors de l'entraînement des réseaux profonds. « L'analyse théorique de cette structure peut éclairer des propriétés clés des méthodes d'IA modernes, comme la robustesse face aux adversaires et la généralisation », explique Papyan. 

Au total, 21 articles coécrits par des membres du corps professoral et des professeurs affiliés à Vector ont été acceptés à la conférence de cette année, qui s'est tenue en ligne. Deux ont été sélectionnés pour des présentations orales et cinq ont fait l'objet de brèves interventions. 

Vous trouverez ci-dessous les résumés de nombreux articles acceptés, coécrits par des membres du corps professoral et des professeurs affiliés à Vector.

Une touche de lime : vers des distances de modèles indépendantes de l’architecture
Hengrui Jia, Hongyu Chen, Jonas Guan, Ali Shahin Shamsabadi, Nicolas Papernot

Les définitions de la distance entre deux modèles d'apprentissage machine caractérisent soit la similarité de leurs prédictions, soit celle de leurs poids. Si la similarité des poids est intéressante parce qu'elle implique une similarité des prédictions à la limite, elle est inapplicable à la comparaison de modèles d'architectures différentes. La similarité des prédictions, quant à elle, est largement applicable mais dépend fortement du choix des entrées du modèle lors de la comparaison. Dans cet article, nous proposons de calculer la distance entre des modèles à boîte noire en comparant leurs explications locales interprétables et indépendantes du modèle (LIME). Pour comparer deux modèles, on utilise un jeu de données de référence et on approche localement les modèles à chaque point de référence par des modèles linéaires entraînés par LIME. Nous calculons ensuite la distance cosinus entre les poids concaténés de ces modèles linéaires. Cette approche est à la fois indépendante de l'architecture et permet de comparer les modèles dans l'espace des poids. Nous montrons empiriquement que notre méthode, que nous appelons Zest, peut être appliquée à deux problèmes nécessitant des mesures de similarité entre modèles : la détection du vol de modèles et le désapprentissage automatique.

Apprentissage accéléré des politiques grâce à la simulation parallèle différentiable
Jie Xu, Viktor Makoviychuk, Yashraj Narang, Fabio Ramos, Wojciech Matusik, Animesh Garg, Miles Macklin

L'apprentissage par renforcement profond permet de générer des politiques de contrôle complexes, mais nécessite d'importantes quantités de données d'entraînement pour fonctionner efficacement. Des travaux récents ont tenté de résoudre ce problème en exploitant des simulateurs différentiables. Cependant, des problèmes inhérents tels que les minima locaux et l'explosion/disparition des gradients numériques empêchent l'application générale de ces méthodes aux tâches de contrôle présentant une dynamique complexe et riche en contacts, comme la locomotion humanoïde dans les benchmarks classiques d'apprentissage par renforcement. Dans ce travail, nous présentons un simulateur différentiable haute performance et un nouvel algorithme d'apprentissage de politiques (SHAC) capable d'exploiter efficacement les gradients de simulation, même en présence d'irrégularités. Notre algorithme d'apprentissage atténue les problèmes de minimum locaux grâce à une fonction critique lisse, évite l'explosion/disparition des gradients grâce à une fenêtre d'apprentissage tronquée et permet l'exécution en parallèle de nombreux environnements physiques. Nous évaluons notre méthode sur des tâches de contrôle classiques d'apprentissage par renforcement et démontrons des améliorations substantielles en termes d'efficacité d'échantillonnage et de temps d'exécution par rapport aux algorithmes d'apprentissage par renforcement et aux algorithmes de simulation différentiables de pointe. De plus, nous démontrons l'évolutivité de notre méthode en l'appliquant au problème complexe et multidimensionnel de la locomotion musculaire avec un vaste espace d'actions, obtenant ainsi une réduction significative du temps d'entraînement par rapport aux algorithmes d'apprentissage par renforcement les plus performants. D'autres résultats visuels sont disponibles à l'adresse : https://short-horizon-actor-critic.github.io/

CoordX : Accélération de la représentation neuronale implicite grâce à une architecture MLP divisée
Ruofan Liang, Hongyi Sun, Nandita Vijaykumar

Les représentations neuronales implicites avec des perceptrons multicouches (MLP) ont récemment gagné en importance pour une grande variété de tâches telles que la synthèse de vues inédites et la représentation et le rendu d'objets 3D. Cependant, un défi majeur de ces représentations réside dans le fait que l'entraînement et l'inférence avec un MLP sur un grand nombre de coordonnées d'entrée, pour apprendre et représenter une image, une vidéo ou un objet 3D, nécessitent d'importants efforts de calcul et des temps de traitement longs. Dans ce travail, nous proposons une nouvelle architecture MLP divisée, CoordX, afin d'accélérer l'inférence et l'entraînement des MLP basés sur les coordonnées pour les représentations neuronales implicites. Avec CoordX, les couches initiales sont divisées pour apprendre séparément chaque dimension des coordonnées d'entrée. Les caractéristiques intermédiaires sont ensuite fusionnées par les dernières couches pour générer le signal appris au point de coordonnées correspondant. Cela réduit considérablement la quantité de calculs nécessaires et permet des gains de vitesse importants lors de l'entraînement et de l'inférence, tout en conservant une précision semblable à celle du MLP de référence. Cette approche vise donc à apprendre d'abord des fonctions de décomposition du signal original, puis à les fusionner pour générer le signal appris. Notre architecture peut être utilisée pour de nombreuses tâches de représentation neuronale implicite sans surcoût de mémoire. Nous démontrons un gain de vitesse jusqu'à 2,92 fois supérieur au modèle de référence pour la représentation et le rendu d'images, de vidéos et de formes 3D.

Réglage fin différentiellement privé des modèles de langage
Da Yu, Saurabh Naik, Arturs Backurs, Sivakanth Gopi, Huseyin A Inan, Gautam Kamath, Janardhan Kulkarni, Yin Tat Lee, Andre Manoel, Lukas Wutschitz, Sergey Yekhanin, Huishuai Zhang

Nous proposons des algorithmes plus simples, plus parcimonieux et plus rapides pour l'ajustement différentiellement privé de modèles de langage pré-entraînés à grande échelle, qui atteignent les meilleurs compromis entre confidentialité et utilité sur de nombreuses tâches de traitement automatique du langage naturel (TALN) standard. Nous proposons un méta-cadre pour ce problème, inspiré par le récent succès des méthodes d'ajustement très efficaces en termes de paramètres. Nos expériences montrent que les adaptations différentiellement privées de ces approches surpassent les algorithmes privés précédents sur trois dimensions importantes : l'utilité, la confidentialité et le coût de calcul et de mémoire de l'entraînement privé. Sur de nombreux ensembles de données couramment étudiés, l'utilité des modèles privés se rapproche de celle des modèles non privés. Par exemple, sur l'ensemble de données MNLI, nous atteignons une précision de 87,8 % avec RoBERTa-Large et de 83,5 % avec RoBERTa-Base avec un budget de confidentialité ε = 6,7. En comparaison, sans contraintes de confidentialité, RoBERTa-Large atteint une précision de 90,2 %. Nos résultats sont similaires pour la génération de langage naturel lors de l'ajustement privé de GPT-2. Nos expériences montrent également que les modèles plus grands sont mieux adaptés au réglage fin privé : bien qu’ils soient reconnus pour atteindre une précision supérieure de manière non privée, nous constatons qu’ils conservent également mieux leur précision lorsque la confidentialité est introduite.

Apprentissage par renforcement distributionnel avec des splines monotones
Yudong Luo, Guiliang Liu, Haonan Duan, Oliver Schulte, Pascal Poupart

L'apprentissage par renforcement distributionnel (RL distributionnel) se distingue de l'apprentissage par renforcement traditionnel par l'estimation de la distribution des rendements, permettant ainsi de saisir l'incertitude intrinsèque des processus décisionnels markoviens (MDP). L'un des principaux défis de l'apprentissage par renforcement distributionnel réside dans la paramétrisation de la fonction quantile lors de la minimisation de la métrique de Wasserstein des différences temporelles. Les algorithmes existants utilisent des fonctions en escalier ou des fonctions linéaires par morceaux. Dans cet article, nous proposons d'apprendre des fonctions quantiles continues et lisses, représentées par des splines rationnelles quadratiques monotones, qui résolvent naturellement le problème du franchissement des quantiles. Des expériences menées dans des environnements stochastiques montrent qu'une estimation dense des fonctions quantiles améliore l'apprentissage par renforcement distributionnel, se traduisant par une convergence empirique plus rapide et des récompenses plus élevées dans la plupart des cas.

Entraînement aux adversaires de domaine : une perspective de jeu
David Acuna, Marc T Law, Guojun Zhang, Sanja Fidler

Les travaux dominants en adaptation de domaine se sont concentrés sur l'apprentissage de représentations invariantes par entraînement antagoniste. Dans cet article, on interprète cette approche sous l'angle de la théorie des jeux. En définissant les solutions optimales dans l'entraînement antagoniste comme un équilibre de Nash local, nous montrons que la descente de gradient peut violer les garanties de convergence asymptotique de l'optimiseur, ce qui nuit souvent aux performances de transfert. Notre analyse nous amène à remplacer la descente de gradient par des solveurs d'équations différentielles ordinaires d'ordre élevé (par exemple, Runge-Kutta), pour lesquels nous établissons des garanties de convergence asymptotique. Cette famille d'optimiseurs est nettement plus stable et permet des taux d'apprentissage plus élevés, ce qui se traduit par des gains de performance importants lorsqu'elle est utilisée en remplacement direct des optimiseurs standards. Nos expériences montrent qu'en combinaison avec des méthodes antagonistes de pointe, nous obtenons une amélioration allant jusqu'à 3,5 % avec moins de la moitié des itérations d'entraînement. Nos optimiseurs sont faciles à mettre en œuvre, ne nécessitent aucun paramètre supplémentaire et peuvent être intégrés à n'importe quel cadre d'attaque par adversaire de domaine.

Optimisation des hyperparamètres avec confidentialité différentielle de Renyi
Nicolas Papernot, Thomas Steinke

Pour de nombreux algorithmes différentiellement privés, tels que la descente de gradient stochastique bruitée (DP-SGD), l'analyse nécessaire pour limiter la fuite d'informations privées lors d'une seule exécution d'entraînement est bien établie. Cependant, peu d'études se sont penchées sur la fuite d'informations privées résultant des multiples exécutions d'entraînement nécessaires à l'optimisation des hyperparamètres de l'algorithme. Dans ce travail, nous montrons d'abord comment le simple fait de définir des hyperparamètres à partir d'exécutions d'entraînement non privées peut entraîner une fuite d'informations privées. Forts de ce constat, nous proposons ensuite des garanties de confidentialité pour les procédures de recherche d'hyperparamètres dans le cadre de la confidentialité différentielle de Rényi. Nos résultats améliorent et élargissent les travaux de Liu et Talwar (STOC 2019). Notre analyse confirme notre observation précédente selon laquelle le réglage des hyperparamètres entraîne effectivement une fuite d'informations privées, mais nous démontrons que, sous certaines hypothèses, cette fuite reste modeste, pourvu que chaque exécution d'entraînement candidate nécessaire à la sélection des hyperparamètres soit elle-même différentiellement privée.

Amélioration de l'estimation de l'information mutuelle grâce à des bornes recuites et basées sur l'énergie
Rob Brekelmans, Sicong Huang, Marzyeh Ghassemi, Greg Ver Steeg, Roger Baker Grosse, Alireza Makhzani

L'information mutuelle (IM) est une quantité fondamentale en théorie de l'information et en apprentissage automatique. Cependant, son estimation directe est complexe, même si la densité de probabilité conjointe réelle des variables d'intérêt est connue, car elle implique l'estimation d'une fonction de partition logarithmique potentiellement de grande dimension. Dans ce travail, nous présentons une vision unifiée des bornes d'IM existantes du point de vue de l'échantillonnage d'importance, et proposons trois nouvelles bornes basées sur cette approche. Puisqu'une borne d'IM précise sans information de densité nécessite une taille d'échantillon exponentielle en IM réelle, nous supposons que l'information de densité marginale unique ou la densité conjointe complète est connue. Lorsque la densité conjointe complète est disponible, nous proposons des bornes d'échantillonnage d'importance recuit multi-échantillons (AIS) pour l'IM, dont nous démontrons, dans nos expériences, la capacité d'estimer précisément de grandes valeurs d'IM. Lorsque seule une distribution marginale unique est connue, nous proposons les bornes IWAE généralisées (GIWAE) et MINE-AIS. Notre borne GIWAE unifie les bornes variationnelles et contrastives dans un cadre unique qui généralise les bornes InfoNCE, IWAE et Barber-Agakov. Notre méthode MINE-AIS améliore les méthodes énergétiques existantes telles que MINE-DV et MINE-F en optimisant directement une borne inférieure plus précise pour l'information mutuelle (MI). MINE-AIS utilise l'échantillonnage MCMC pour estimer les gradients d'entraînement et l'AIS multi-échantillon pour évaluer la borne. Nos méthodes sont particulièrement adaptées à l'évaluation de la MI dans les modèles génératifs profonds, car les formes explicites des densités marginales ou conjointes sont souvent disponibles. Nous évaluons nos bornes sur l'estimation de la MI des VAE et des GAN entraînés sur les ensembles de données MNIST et CIFAR, et démontrons des gains significatifs par rapport aux bornes existantes dans ces contextes complexes avec une MI réelle élevée.

Augmentation du coût d'extraction de modèles grâce à une preuve de travail calibrée
Adam Dziedzic, Muhammad Ahmad Kaleem, Yu Shen Lu, Nicolas Papernot

Lors d'attaques par extraction de modèles, des adversaires peuvent s'emparer d'un modèle d'apprentissage automatique exposé via une API publique en l'interrogeant de manière répétée et en ajustant leur propre modèle en fonction des prédictions obtenues. Pour prévenir ce vol de modèle, les défenses existantes se concentrent sur la détection des requêtes malveillantes, la troncature ou la distorsion des résultats, ce qui introduit nécessairement un compromis entre robustesse et utilité du modèle pour les utilisateurs légitimes. Nous proposons une alternative : limiter l'extraction de modèle en exigeant des utilisateurs qu'ils effectuent une preuve de travail avant de pouvoir consulter les prédictions du modèle. Cette mesure dissuade les attaquants en augmentant considérablement (jusqu'à 100 fois) l'effort de calcul nécessaire pour exploiter l'accès par requête à des fins d'extraction de modèle. Comme nous évaluons l'effort requis pour effectuer la preuve de travail pour chaque requête, cela n'entraîne qu'une légère surcharge pour les utilisateurs réguliers (jusqu'à 2 fois). Pour ce faire, notre calibration utilise des outils de confidentialité différentielles afin de mesurer les informations révélées par une requête. Notre méthode ne nécessite aucune modification du modèle cible et peut être appliquée par les spécialistes de l'apprentissage automatique pour protéger leurs modèles publics contre le vol.

L'équité est-elle seulement liée à l'apprentissage profond des mesures ? Évaluation et correction des écarts entre sous-groupes dans l'apprentissage profond des mesures
Natalie Dullerud, Karsten Roth, Kimia Hamidieh, Nicolas Papernot, Marzyeh Ghassemi

L'apprentissage métrique profond (DML) permet un apprentissage moins supervisé grâce à son approche basée sur la structure de similarité des représentations. De nombreux travaux ont porté sur l'amélioration de la généralisation du DML dans des contextes tels que la recherche d'informations sans exemple, mais ses implications en matière d'équité demeurent peu connues. Dans cet article, nous sommes les premiers à évaluer des méthodes DML de pointe entraînées sur des données déséquilibrées et à démontrer l'impact négatif de ces représentations sur les performances des sous-groupes minoritaires lorsqu'elles sont utilisées pour des tâches en aval. Nous définissons d'abord l'équité en DML par l'analyse de trois propriétés de l'espace de représentation : l'alignement interclasses, l'alignement intraclasse et l'uniformité. Nous proposons ensuite finDML , le benchmark d'équité dans le DML déséquilibré , pour caractériser l'équité des représentations. À l'aide de finDML , on constate que les biais des représentations DML se propagent aux tâches de classification courantes en aval. Étonnamment, ce biais persiste même après le rééquilibrage des données d'entraînement de la tâche en aval. Pour résoudre ce problème, nous présentons la décorrélation partielle des attributs ( PARADE ) afin de séparer les représentations des caractéristiques des attributs sensibles et de réduire les écarts de performance entre les sous-groupes dans l'espace d'intégration et les métriques en aval.

Apprendre la dynamique orientée objet pour la planification à partir de textes
Guiliang Liu, Ashutosh Adhikari, Amir-Massoud Farahmand, Pascal Poupart

Le développement de modèles dynamiques permet une planification basée sur des modèles dans des environnements complexes. Les modèles dynamiques existants étudient généralement les jeux basés sur l'image avec des états entièrement observables. Généraliser ces modèles aux jeux textuels (TBG), qui décrivent généralement des états partiellement observables avec des observations textuelles bruitées, représente un défi. Dans ce travail, nous proposons un modèle de dynamique textuelle orienté objet (OOTD) qui permet aux algorithmes de planification de résoudre des problèmes de prise de décision dans le domaine textuel. OOTD prédit un graphique de mémoire qui conserve dynamiquement l'historique des observations d'objets et filtre les informations non pertinentes. Pour améliorer la robustesse de la dynamique, notre modèle OOTD identifie les objets influencés par les actions d'entrée et prédit la probabilité des états des objets grâce à des couches de transition paramétrées indépendamment. Nous développons des objectifs variationnels dans les contextes de supervision par les objets et d'autosupervision afin de modéliser la stochasticité de la dynamique prédite. Les résultats empiriques montrent que le planificateur basé sur OOTD surpasse significativement les méthodes de référence sans modèle en termes d'efficacité d'échantillonnage et de scores cumulés.

Apprentissage actif à faible budget via la distance de Wasserstein : une approche de programmation linéaire en nombres entiers
Rafid Mahmood, Sanja Fidler, Marc T. Law

L'apprentissage actif consiste à entraîner un modèle avec un nombre limité de données étiquetées en sélectionnant un sous-ensemble central d'un ensemble de données non étiquetées. La grande taille des ensembles de données utilisés en apprentissage profond impose à la plupart des stratégies de sélection d'échantillons d'employer des heuristiques efficaces. Cet article présente un problème d'optimisation en nombres entiers pour la sélection d'un ensemble central minimisant la distance de Wasserstein discrète par rapport à l'ensemble des données non étiquetées. Nous démontrons que ce problème peut être résolu efficacement grâce à un algorithme de décomposition de Benders généralisée. Notre stratégie utilise des caractéristiques latentes de haute qualité, obtenues par apprentissage non supervisé sur l'ensemble des données non étiquetées. Les résultats numériques obtenus sur plusieurs ensembles de données montrent que notre approche d'optimisation est compétitive par rapport aux méthodes de référence et les surpasse particulièrement dans le cas de données peu étiquetées (moins de 1 % des données).

Effondrement neuronal suite à une perte MSE : proximité et dynamique du chemin central
XY Han, Vardan Papyan, David L. Donoho

Le phénomène d'effondrement neuronal (EN), récemment découvert, est omniprésent dans le paradigme actuel d'entraînement des réseaux profonds, qui consiste à tendre la perte d'entropie croisée (EC) vers zéro. Lors d'un EN, les caractéristiques de la dernière couche convergent vers leurs moyennes de classe, les classificateurs et les moyennes de classe convergent vers le même cadre serré équiangulaire simplex, et le comportement des classificateurs converge vers la règle de décision de la moyenne de classe la plus proche. Des travaux récents ont démontré que les réseaux profonds entraînés avec une perte d'erreur quadratique moyenne (EQM) offrent des performances comparables à celles entraînées avec l'EC. À titre préliminaire, nous établissons empiriquement que l'EN émerge également dans ces réseaux profonds entraînés avec l'EQM, grâce à des expériences menées sur trois réseaux canoniques et cinq ensembles de données de référence. Nous fournissons, dans un carnet Google Colab, le code PyTorch permettant de reproduire l'ENM et l'EC : https://colab.research.google.com/github/neuralcollapse/neuralcollapse/blob/main/neuralcollapse.ipynb . La perte MSE, analytiquement traitable, offre plus de possibilités mathématiques que la perte CE, difficile à analyser, ce qui nous a incités à exploiter la perte MSE pour l'étude théorique de la NC. Nous présentons trois contributions principales : (I) Nous proposons une nouvelle décomposition de la perte MSE en (A) termes directement interprétables dans le cadre de la NC et qui supposent que le classificateur de la dernière couche est exactement le classificateur des moindres carrés ; et (B) un terme capturant l'écart par rapport à ce classificateur des moindres carrés. (II) Nous présentons des expériences sur des ensembles de données et des réseaux canoniques démontrant que le terme (B) est négligeable pendant l'entraînement. Cela nous amène à introduire un nouveau concept théorique : le chemin central, où le classificateur linéaire reste MSE-optimal pour les activations de caractéristiques tout au long de la dynamique. (III) En étudiant le flux de gradient renormalisé le long du chemin central, on en déduit une dynamique exacte qui prédit la NC.

NODE-GAM : Modèle additif généralisé neuronal pour l'apprentissage profond interprétable
Chun-Hao Chang, Rich Caruana, Anna Goldenberg

Le déploiement de modèles d'apprentissage machine dans des contextes réels à haut risque (par exemple, la santé) dépend souvent non seulement de la précision du modèle, mais aussi de son équité, de sa robustesse et de son interprétabilité. Les modèles additifs généralisés (GAM) constituent une classe de modèles interprétables utilisés depuis longtemps dans ces domaines à haut risque, mais ils ne possèdent pas certaines caractéristiques souhaitables de l'apprentissage profond, comme la différentiabilité et la scalabilité. Dans ce travail, nous proposons un GAM neuronal (NODE-GAM) et un GA2M neuronal (NODEGA2M) qui s'adaptent bien aux grands ensembles de données et offrent de meilleures performances que les autres GAM, tout en restant interprétables par rapport aux autres modèles d'ensemble et d'apprentissage profond. Nous démontrons que nos modèles identifient des motifs intéressants dans les données. Enfin, nous montrons que nous améliorons la précision du modèle grâce à un préentraînement auto-supervisé, une amélioration impossible pour les GAM non différentiables.

Représentations optimales pour le décalage de covariables
Yangjun Ruan, Yann Dubois, Chris J. Maddison

Les systèmes d'apprentissage machine subissent souvent un décalage de distribution entre l'entraînement et les tests. Dans cet article, nous introduisons un objectif variationnel simple dont les optima correspondent précisément à l'ensemble des représentations pour lesquelles les minimisateurs de risque sont garantis robustes à tout décalage de distribution préservant le prédicteur bayésien, par exemple, les variations de covariables. Notre objectif comporte deux composantes. Premièrement, une représentation doit rester discriminante pour la tâche, c'est-à-dire qu'un prédicteur doit pouvoir minimiser simultanément le risque source et le risque cible. Deuxièmement, le support marginal de la représentation doit être identique pour la source et la cible. Nous rendons cela possible en concevant des objectifs auto-supervisés qui utilisent uniquement des données non étiquetées et des augmentations de données pour entraîner des représentations robustes. Nos objectifs permettent de mieux comprendre la robustesse de CLIP et d'améliorer encore ses représentations afin d'atteindre des performances de pointe sur DomainBed.

Amorçage pessimiste pour l'apprentissage par renforcement hors ligne piloté par l'incertitude
Chenjia Bai, Lingxiao Wang, Zhuoran Yang, Zhi-Hong Deng, Animesh Garg, Peng Liu, Zhaoran Wang

L'apprentissage par renforcement hors ligne (RL) vise à apprendre des politiques à partir d'ensembles de données préalablement recueillis, sans explorer l'environnement. L'application directe d'algorithmes hors stratégie au RL hors ligne échoue généralement en raison de l'erreur d'extrapolation causée par les actions hors distribution (OOD). Les méthodes existantes abordent ce problème en pénalisant les valeurs Q des actions OOD ou en contraignant la politique entraînée à se rapprocher de la politique comportementale. Néanmoins, ces méthodes empêchent généralement la généralisation des fonctions de valeur au-delà des données hors ligne et manquent également d'une caractérisation précise des données OOD. Dans cet article, nous proposons le bootstrap pessimiste pour le RL hors ligne (PBRL), un algorithme hors ligne purement basé sur l'incertitude et sans contraintes de politique explicites. Plus précisément, PBRL quantifie l'incertitude via le désaccord des fonctions Q bootstrapées et effectue des mises à jour pessimistes en pénalisant la fonction de valeur en fonction de l'incertitude estimée. Pour traiter l'erreur d'extrapolation, nous proposons aussi une nouvelle méthode d'échantillonnage OOD. Nous démontrons que l'échantillonnage OOD et le bootstrap pessimiste permettent d'obtenir un quantificateur d'incertitude vérifiable dans les processus décisionnels markoviens linéaires, fournissant ainsi le fondement théorique de l'apprentissage par renforcement pessimiste (PBRL). De nombreuses expériences menées sur l'ensemble de données de référence D4RL montrent que PBRL surpasse les algorithmes de pointe.

Pix2seq : un cadre de modélisation linguistique pour la détection d’objets
Ting Chen, Saurabh Saxena, Lala Li, David J. Fleet, Geoffrey Hinton

Nous présentons Pix2Seq, un cadre simple et générique pour la détection d'objets. Contrairement aux approches existantes qui intègrent explicitement des connaissances a priori sur la tâche, nous concevons la détection d'objets comme une tâche de modélisation du langage conditionnée par les pixels observés. Les descriptions d'objets (par exemple, les boîtes englobantes et les étiquettes de classe) sont exprimées sous forme de séquences de jetons discrets, et nous entraînons un réseau de neurones à percevoir l'image et à générer la séquence souhaitée. Notre approche repose principalement sur l'intuition que si un réseau de neurones sait où se trouvent les objets et ce qu'ils sont, il suffit de lui apprendre à les identifier. Outre l'utilisation d'augmentations de données spécifiques à la tâche, notre approche repose sur des hypothèses minimales concernant la tâche, tout en obtenant des résultats compétitifs sur l'ensemble de données COCO, pourtant exigeant, comparativement à des algorithmes de détection hautement spécialisés et optimisés.

Réexamen des modèles génératifs de flux pour la détection hors distribution
Dihong Jiang, Sun Sun, Yaoliang Yu

Les modèles génératifs profonds sont largement utilisés dans des applications pratiques telles que la détection de données hors distribution (OOD). Dans ce travail, nous réexaminons le potentiel des modèles de flux génératifs pour la détection d'OOD. Nous proposons d'abord une combinaison simple d'un test statistique univarié à un échantillon (par exemple, le test de Kolmogorov-Smirnov) et de projections aléatoires dans l'espace latent des modèles de flux pour effectuer la détection d'OOD. Ensuite, nous proposons une version à deux échantillons de notre test pour tenir compte des modèles de flux imparfaits. Notre méthode se distingue par le fait qu'elle ne repose sur aucune hypothèse paramétrique concernant les données OOD et qu'elle est compatible avec tout modèle de flux. Expérimentalement, nous confirmons d'abord l'efficacité de notre méthode par rapport aux méthodes de référence les plus performantes grâce à de nombreuses expériences sur plusieurs ensembles de données d'images ; ensuite, nous étudions la relation entre la précision du modèle (par exemple, la qualité de la génération) et les performances de détection d'OOD, et nous constatons, de manière surprenante, qu'elles ne sont pas toujours positivement corrélées. et troisièmement, nous montrons que la détection dans l'espace latent des modèles de flux surpasse généralement la détection dans l'espace d'échantillonnage sur divers ensembles de données OOD, soulignant ainsi les avantages de l'entraînement d'un modèle de flux.

Comprendre l'effondrement de la variance de SVGD en haute dimension
Jimmy Ba, Murat A Erdogdu, Marzyeh Ghassemi, Shengyang Sun, Taiji Suzuki, Denny Wu, Tianzong Zhang

La descente de gradient variationnelle de Stein (SVGD) est un algorithme d'inférence déterministe qui fait évoluer un ensemble de particules pour ajuster une distribution cible. Malgré son efficacité de calcul, la SVGD sous-estime souvent la variance de la distribution cible en grande dimension. Dans ce travail, on cherche à expliquer l'effondrement de la variance dans la SVGD. Qualitativement, on compare la mise à jour de la SVGD avec la descente de gradient sur la fonction objectif de divergence moyenne maximale (MMD). Nous observons que le phénomène d'effondrement de la variance est lié au biais des mises à jour déterministes présent dans la « force motrice » de la SVGD et vérifions empiriquement que la suppression de ce biais mène à une estimation de la variance plus précise. Quantitativement, nous démontrons que l'effondrement de la variance de la SVGD peut être prédit avec précision à la limite asymptotique proportionnelle, c'est-à-dire lorsque le nombre de particules et la dimension divergent au même rythme. En particulier, pour l'apprentissage de gaussiennes isotropes de grande dimension, nous dérivons la variance d'équilibre exacte pour SVGD et la descente MMD sous une certaine hypothèse de quasi-orthogonalité sur les particules convergées, et confirmons que SVGD souffre de la « malédiction de la dimensionnalité ». 

Apprentissage par renforcement basé sur un modèle pondéré par le gradient de valeur
Claas A Voelcker, Victor Liao, Animesh Garg, Amir-massoud Farahmand

L'apprentissage par renforcement basé sur un modèle (MBRL) est une technique efficace pour obtenir des politiques de contrôle, mais les erreurs de modélisation inévitables entraînent souvent une dégradation des performances. Dans MBRL, le modèle est souvent ajusté uniquement pour reconstruire la dynamique, et en particulier les observations d'état, tandis que l'impact des erreurs de modélisation sur la politique n'est pas pris en compte par l'objectif d'entraînement. Il en résulte un décalage entre l'objectif initial du MBRL, soit un bon apprentissage des politiques et des valeurs, et la cible de la fonction de perte utilisée en pratique, la prédiction de l'état futur. Intuitivement, on pourrait penser qu'apprendre un modèle tenant compte des valeurs résoudrait ce problème. En fait, plusieurs solutions à ce décalage d'objectifs ont été proposées sur la base d'analyses théoriques. Cependant, elles sont généralement moins performantes en pratique que les approches basées sur le maximum de vraisemblance (MLE). Dans cet article, nous proposons VaGraM (Value-gradient weighted Model Learning), une nouvelle méthode d'apprentissage de modèle prenant en compte les valeurs, qui améliore les performances du MBRL dans des contextes difficiles, tels qu'une faible capacité de modèle et la présence de dimensions d'état parasites. Nous analysons les approches d'estimation du maximum de vraisemblance (MLE) et les approches prenant en compte la valeur, et démontrons leur incapacité à intégrer l'exploration et le comportement de l'approximation de fonction lors de l'apprentissage de modèles tenant compte de la valeur. Nous soulignons également les objectifs supplémentaires à atteindre pour stabiliser l'optimisation dans le contexte de l'apprentissage profond. Nous validons notre analyse en montrant que notre fonction de perte permet d'obtenir des performances élevées sur la suite de tests Mujoco, tout en étant plus robuste que les approches basées sur le maximum de vraisemblance.