ICLR 2021 : Des chercheurs adoptent des techniques pédagogiques pour entraîner des réseaux neuronaux comme s’il s’agissait d’étudiants.

23 avril 2021

Rechercher

23 avril 2021

Par Ian Gormely

Les membres de la communauté de recherche de Vector se préparent pour l'édition 2021 de la Conférence internationale sur les représentations d'apprentissage (ICLR), l'une des plus importantes conférences mondiales sur l'apprentissage profond. Cette année, la conférence aura lieu en ligne du 3 au 7 mai. 

Plusieurs membres du corps professoral de Vector ont vu leurs articles acceptés à la conférence. L'ICLR a reçu près de 3 000 articles cette année, mais n'en a retenu qu'un quart. 

Parmi les articles acceptés par la faculté de Vector figurent « Teaching With Commentaries », coécrit par Geoffrey Hinton, cofondateur et conseiller scientifique en chef de Vector, David Duvenaud, membre de la faculté, et les chercheurs Aniruddh Raghu, Maithra Raghu et Simon Kornblith, qui imagine les réseaux neuronaux comme des étudiants.

« Les vrais enseignants doivent apprendre à enseigner », explique Duvenaud, « et on ne se contente pas de montrer des données aux élèves sans leur apporter d’aide. Tout comme les élèves ont besoin de contexte pour comprendre ce qu’on leur enseigne, « les réseaux neuronaux peuvent tirer profit de commentaires adaptés à leur mode d’apprentissage. C'est pourquoi, avec ses coauteurs, il a cherché à concevoir un système qui aide automatiquement les élèves – les réseaux neuronaux – à mieux apprendre.

Ce faisant, les réseaux neuronaux apprennent plus rapidement et font des prédictions plus précises (on parle alors de réduction du surapprentissage), et les chercheurs parviennent à mieux comprendre leur fonctionnement, ce qui leur permet de décrypter la « boîte noire ». « Nous croyons que l’analyse des types de commentaires utiles devrait permettre de mieux comprendre ce que le réseau neuronal a tiré des données dans différentes circonstances. » 

Lors de l'entraînement d'un classificateur, Duvenaud et ses coauteurs ont constaté qu'il était utile de privilégier différentes données d'entraînement. Lorsqu'il y a peu de recoupements entre elles, par exemple des images de voitures et d'avions (l'une avec des roues et l'autre avec des ailes), il était préférable de se concentrer sur les exemples les plus stéréotypés de ce qui définit chaque type. En revanche, lorsqu'il n'existe pas de distinction nette, comme une limite arbitraire entre les personnes de grande et de petite taille, les classificateurs étaient plus performants lorsque les exemples intermédiaires étaient mis en avant.

Vous trouverez ci-dessous les résumés et les résumés simplifiés de nombreux articles acceptés, coécrits par des membres du corps professoral de Vector. 

Un critère d'inégalité pour évaluer la généralisation dans la démonstration de théorèmes

Yuhuai Wu, Albert Jiang, Jimmy Ba et Roger Grosse.

Les démonstrateurs de théorèmes interactifs offrent un moyen puissant de vérifier formellement les théorèmes mathématiques et les logiciels, mais la rédaction de preuves formelles est notoirement difficile et chronophage pour les humains. Si l'on pouvait entraîner un agent d'apprentissage profond à réaliser tout ou partie de la preuve, cela élargirait considérablement le champ des vérifications formelles possibles. Nous avons développé un ensemble de données composé de problèmes d'inégalités mathématiques générés synthétiquement et l'avons utilisé pour évaluer la capacité des systèmes d'apprentissage profond à généraliser à des énoncés de théorèmes différents de ceux rencontrés auparavant.

Une approche bayésienne PAC des bornes de généralisation pour les réseaux neuronaux graphiques

Renjie Liao, Raquel Urtasun, Richard Zemel

Les réseaux de neurones graphiques (GNN) ont récemment gagné en popularité pour le traitement de données structurées en graphiques, comme la génération de molécules pour la découverte de médicaments et la prédiction de liens dans les réseaux sociaux. Dans cet article, nous cherchons à comprendre pourquoi les GNN généralisent des graphiques d'entraînement à des graphiques de test non vus lors de l'entraînement. Nous présentons d'abord des bornes de généralisation pour les variantes courantes de GNN via une approche bayésienne PAC. Nos résultats révèlent que le degré maximal des nœuds du graphe et la norme spectrale des poids déterminent ces bornes. De plus, notre borne PAC-Bayésienne améliore la borne précédente basée sur la complexité de Rademacher, en démontrant une valeur plus précise empiriquement sur des ensembles de données de graphes synthétiques et réels.

Classification bayésienne avec peu d'exemples et processus gaussiens augmentés Polya-Gamma de type « un contre chaque »

Jake Snell, Richard Zemel

L'entraînement d'un classificateur d'images profond est un processus long et coûteux. Idéalement, on pourrait entraîner un modèle une seule fois et le déployer, mais en pratique, un classificateur est confronté à des images difficiles à classer, y compris celles appartenant à des classes qu'il n'a jamais rencontrées. Nous avons développé une approche novatrice basée sur les processus gaussiens, qui fait une moyenne sur un nombre infini de modèles, pondérée par leur adéquation aux nouvelles données. Notre algorithme est mieux calibré (meilleures estimations de sa confiance dans ses prédictions) que les méthodes de référence précédentes, tout en affichant une excellente précision dans ce contexte complexe.

CaPC Learning : Apprentissage collaboratif confidentiel et privé

Christopher A. Choquette-Choo, Natalie Dullerud, Adam Dziedzic, Yunxiang Zhang, Somesh Jha, Nicolas Papernot, Xiao Wang

CaPC est un protocole d'apprentissage machine collaboratif offrant de solides garanties de confidentialité et de protection des données. Les organisations ayant entraîné des modèles localement peuvent désormais collaborer et faire des prédictions conjointes sans divulguer aux autres les données d'entrée utilisées, leurs modèles ou leurs données d'entraînement. CaPC est indépendant du modèle : chaque participant peut utiliser une architecture différente. Notre cadre améliore l'équité des modèles, même en cas de distribution non uniforme des données, notamment grâce à l'apprentissage actif. CaPC offre une nouvelle solution pour répondre aux exigences de la législation sur la protection des données, tout en minimisant l'impact sur les pipelines d'apprentissage automatique existants.

C-Apprentissage : Estimation de l’accessibilité cumulative tenant compte de l’horizon

Panteha Naderian , Gabriel Loaiza-Ganem , Harry J. Braviner , Anthony L. Caterini , Jesse C. Cresswell , Tong Li , Animesh Garg

L'apprentissage C est un algorithme novateur d'apprentissage par renforcement, utilisé en robotique et en planification de trajectoires. L'objectif principal d'un agent d'apprentissage C est d'apprendre des chemins efficaces vers des objectifs prédéfinis. En entraînant la fonction de valeur avec un paramètre supplémentaire, l'horizon, cette méthode remédie à trois lacunes des travaux précédents : 1) elle apprend des chemins plus courts et plus efficaces vers un objectif ; 2) elle apprend les tâches avec moins d'expérience et de données d'entraînement ; 3) elle trouve plusieurs façons d'atteindre un objectif. Ainsi, les utilisateurs peuvent choisir parmi différents chemins en fonction de leurs préférences en matière de vitesse et de fiabilité.

Critiques conservatrices de la sécurité en exploration

Homanga Bharadhwaj, Aviral Kumar, Nicholas Rhinehart, Sergey Levine, Florian Shkurti, Animesh Garg

Cet article présente une nouvelle approche de la sécurité dans le contexte de l'apprentissage par renforcement (RA) en robotique. L'AR est un paradigme d'apprentissage par essais et erreurs où un agent interagit avec son environnement, est récompensé positivement pour les comportements souhaitables et négativement pour les comportements indésirables, renforçant ainsi ses comportements souhaitables au fil du temps. Lors de l'entraînement de robots à la résolution d'une tâche particulière par AR, il est crucial d'éviter les comportements indésirables susceptibles d'entraîner des défaillances catastrophiques, comme l'endommagement du robot. Cet article présente un algorithme d'entraînement d'agents AR qui contraint de manière prouvable la probabilité de défaillances catastrophiques, permettant ainsi un entraînement plus sécuritaire des robots.

Inférence des ensembles de données : résolution de la propriété dans l’apprentissage machine 

Pratyush Maini, Mohammad Yaghini, Nicolas Papernot

Craignez-vous qu'un modèle d'apprentissage machine soit une copie volée de votre modèle propriétaire ? Nous partons du constat pessimiste, mais réaliste, qu'il est impossible d'empêcher le vol de modèles. En matière d'inférence sur les données, on cherche plutôt à détecter a posteriori si un adversaire a volé le modèle. Notre principale intuition est que la propriété intellectuelle la plus précieuse du propriétaire du modèle est l'ensemble de données sur lequel il a été entraîné. Par conséquent, quelle que soit la méthode utilisée par un adversaire pour le voler, son modèle contiendra des renseignements personnels propres à l'ensemble de données de la victime. L'inférence sur les données utilise ces signaux pour distinguer le comportement suspect du modèle sur des échantillons provenant des données d'entraînement et de données inconnues, et déterminer si un adversaire a utilisé des connaissances privées.

Règles de circulation émergentes dans les environnements de conduite multiagents

Avik Pal, Jonah Philion, Yuan-Hong Liao, Sanja Fidler

Pour partager la route en toute sécurité avec les conducteurs humains, les véhicules autonomes doivent respecter les mêmes règles de conduite que les humains. Ces règles comprennent les obligations légales, comme l'arrêt obligatoire aux feux rouges, ainsi que les règles sociales, comme la désignation implicite des voies rapides. Nous démontrons que, dans des environnements de conduite simulés où les agents cherchent à atteindre rapidement leur destination, ces agents développent des règles de conduite similaires à celles mises en place par les humains. Nos résultats suggèrent la faisabilité d'un nouveau paradigme pour la conduite autonome, dans lequel des agents entièrement entraînés en simulation pourraient être déployés dans le monde réel.

Planification des compétences latentes pour l'exploration et le transfert

Kevin Xie, Homanga Bharadhwaj, Danijar Hafner, Animesh Garg, Florian Shkurti

Cet article décrit une approche d'apprentissage de compétences réutilisables pour la résolution efficace de tâches par des robots. Nous laissons le robot interagir avec son environnement et construisons un modèle du monde décrivant les changements de cet environnement en réponse à ses actions. À partir de ce modèle, le robot planifie une séquence de compétences de haut niveau nécessaires à la réalisation d'une tâche particulière, par exemple se déplacer d'un point A à un point B. L'idée clé de notre approche est d'apprendre ces compétences de manière à ce qu'elles puissent être réutilisées pour différentes tâches et dans des environnements légèrement différents. Ceci est essentiel pour minimiser le nombre d'interactions du robot avec son environnement, interactions souvent coûteuses et chronophages.

Pas de MCMC pour moi : Échantillonnage amorti pour un entraînement rapide et stable des modèles énergétiques

Will Grathwohl, Jacob Kelly, Milad Hashemi, Mohammad Norouzi, Kevin Swersky, David Duvenaud

Les classificateurs de réseaux neuronaux classiques sont de simples fonctions qui prennent une image en entrée et fournissent la probabilité que cette image appartienne à différentes classes. Il existe une alternative prometteuse pour entraîner ces modèles : la modélisation générative, qui apprend simultanément à produire des images réalistes. Un des avantages de cette approche est sa capacité à apprendre à partir de données majoritairement non étiquetées. Cependant, la formation de ces modèles implique généralement une recherche coûteuse dans les images. Nous montrons comment une machine peut apprendre à effectuer cette recherche plus rapidement pendant l’entraînement, ce qui nous permet d’entraîner plus rapidement des modèles de grande taille, autant sur de grandes images que sur des tableaux de données non structurées, comme ceux que l’on rencontre souvent dans les secteurs des affaires ou de la santé.

Planification à partir de pixels à l'aide de modèles de dynamique inverse

Keiran Paster, Sheila A. McIlraith, Jimmy Ba

L'apprentissage automatique de la modélisation des éléments d'un environnement pertinents pour la prise de décision est essentiel pour permettre aux agents d'apprentissage par renforcement profond (DRL) de résoudre des tâches complexes du monde réel. Nous démontrons que les modèles appris en prédisant les actions (dynamique inverse) plutôt que les états futurs (dynamique directe) permettent une modélisation précise de la dynamique de l'environnement, même dans des environnements visuels complexes, et peuvent aider l'agent à planifier plus efficacement. Notre nouvel algorithme DRL (GLAMOR) représente une avancée majeure pour permettre aux agents de modéliser et de planifier dans des environnements plus complexes.

Enseignement avec commentaires

Aniruddh Raghu, Maithra Raghu, Simon Kornblith, David Duvenaud, Geoffrey Hinton

Comment les enseignants apprennent-ils à enseigner ? Une des méthodes employées consiste à commenter les exemples présentés aux élèves. Nous avons implanté une idée semblable pour l'entraînement des réseaux de neurones. Nos enseignants ont élaboré des commentaires pertinents en simulant un réseau de neurones « élève » apprenant à partir de leurs exemples et commentaires, puis en ajustant ces derniers par rétropropagation afin d’améliorer ses performances. L'analyse de ces commentaires a permis de comprendre comment les élèves ont appris et quelles parties des données étaient importantes pour différentes tâches, comme la classification d'images médicales.

Limites théoriques de l'erreur d'estimation pour le méta-apprentissage

James Lucas, Mengye Ren, Irene Raissa Kameni Kameni, Toniann Pitassi, Richard Zemel

Traditionnellement, on suppose que les modèles d'apprentissage machine sont entraînés à l'aide de la même distribution de données que l'on s'attend à rencontrer en situation réelle. Or, cette hypothèse est peu réaliste. Par exemple, imaginons que nous avions des données de santé provenant de cinq hôpitaux et que nous voulions déployer notre modèle dans un nouvel hôpital où les caractéristiques démographiques des patients et la formation médicale diffèrent sensiblement. Nous étudions la difficulté fondamentale de ce problème et démontrons des bornes inférieures pour les performances optimales de tout algorithme d'apprentissage machine dans ce contexte.

Apprentissage non supervisé de représentations pour les séries temporelles avec codage de voisinage temporel

Sana Tonekaboni, Danny Eytan, Anna Goldenberg

Les données de séries temporelles sont souvent complexes et riches en informations, mais peu étiquetées, ce qui rend leur modélisation difficile. Dans cet article, nous proposons un cadre d'apprentissage auto-supervisé pour l'acquisition de représentations généralisables pour les séries temporelles non stationnaires. Notre approche, appelée Codage Temporel de Voisinage (TNC), exploite la régularité locale du processus génératif d'un signal pour définir des voisinages temporels stationnaires et apprend à distinguer les échantillons voisins grâce à une fonction objectif contrastive non biaisée. Notre motivation provient du domaine médical, où la capacité de modéliser la nature dynamique des données de séries temporelles est particulièrement précieuse pour identifier, suivre et prédire l'état des patients dans des contextes où l'étiquetage des données est pratiquement impossible.

Errer dans un monde : apprentissage contextualisé en ligne avec peu d'exemples

Mengye Ren, Michael L. Iuzzolino, Michael C. Mozer, Richard S. Zemel

Notre objectif est de combler le fossé entre les environnements d'apprentissage humain et automatique classiques en étendant le cadre standard de l'apprentissage avec peu d'exemples à un contexte en ligne et continu, qui imite l'expérience visuelle d'un agent évoluant dans un monde. Nous présentons un nouvel ensemble de données basé sur des images d'intérieur à grande échelle et proposons un nouveau modèle capable d'exploiter les informations contextuelles spatio-temporelles grâce à une combinaison de mémoires à court et à long terme.

Dans quels cas le préconditionnement favorise-t-il ou nuit-il à la généralisation ?

Shun-ichi Amari, Jimmy Ba, Roger Grosse, Xuechen Li, Atsushi Nitanda, Taiji Suzuku, Denny Wu, Ji Xu

L'un des phénomènes les plus déconcertants de l'entraînement des réseaux de neurones est que le choix de l'algorithme d'optimisation influe non seulement sur la vitesse de convergence, mais aussi sur la capacité de généralisation de la solution convergée. Le préconditionneur, qui détermine la vitesse de variation des paramètres, constitue un choix d'optimisation crucial. Nous analysons les propriétés de généralisation de divers préconditionneurs dans le contexte de la régression linéaire. Contrairement à l'idée reçue selon laquelle les optimiseurs du second ordre généralisent moins bien que ceux du premier ordre, nous constatons que l'effet réel est beaucoup plus nuancé. Nous analysons différentes situations où le préconditionnement avec des informations de second ordre peut améliorer ou nuire à la généralisation.