14 juillet 2021
Par Ian Gormely
L'édition 2021 de la Conférence internationale sur l'apprentissage machine (ICML), qui se tiendra virtuellement du 18 au 24 juillet, réunira une fois de plus la communauté de l'apprentissage machine pour partager et découvrir les dernières recherches de pointe en la matière.
Parmi les articles coécrits par des chercheurs de Vector lors de la conférence de cette année figure « LTL2Action : Généralisation des instructions LTL pour l'apprentissage par renforcement multitâche », coécrit par Pashootan Vaezipoor, Andrew Li, Rodrigo Toro Icarte et Sheila McIlraith, titulaire de la chaire d'intelligence artificielle du CIFAR Canada et membre du corps professoral de Vector. Cet article représente une avancée majeure vers la création d'un système d'apprentissage automatique (ML) capable d'effectuer une grande variété de tâches et de suivre des instructions ouvertes. « Nous souhaitons qu'un humain puisse indiquer à un système d'IA, comme un robot ou un téléphone, ce qu'il attend de lui, de manière simple et naturelle », explique Andrew Li, coauteur de l'article. Or, l'ambiguïté et la nature ouverte du langage humain, tant à l'oral qu'à l'écrit, peuvent dérouter les machines.
Le groupe s'est tourné vers la logique temporelle linéaire (LTL), un langage formel expressif qui, tout en étant dépourvu de l'ambiguïté du langage naturel, permet de communiquer les instructions requises par les systèmes d'apprentissage automatique. « Nous disposons d'un langage très riche, extrêmement utile dans des domaines comme la robotique », explique Pashootan Vaezipoor. « Les possibilités sont infinies. »
Ces travaux s'appuient sur les recherches antérieures de Toro Icarte et d'autres membres du groupe de McIlraith, qui utilisaient LTL et d'autres langages formels pour communiquer les attentes d'un humain à l'égard d'un système d'apprentissage automatique. « Habituellement, l'entraînement d'un tel modèle nécessite d'énormes quantités de données étiquetées ou d'interactions humaines », explique McIlraith. LTL2Action se distingue par sa capacité à généraliser à des instructions inédites pour plus de 10³⁹ tâches possibles, sans aucun retour humain. « C'est là toute la force de ce travail. »
Vous trouverez ci-dessous les résumés et les résumés simplifiés de nombreux articles acceptés, coécrits par des membres du corps professoral de Vector.
Apprentissage par renforcement multi-agents entraîneur-joueur pour une composition d'équipe dynamique
Bo Liu, Qiang Liu, Peter Stone, Animesh Garg, Yuke Zhu, Animashree Anandkumar
Dans les systèmes multi-agents réels, les agents aux capacités différentes peuvent se joindre ou quitter l'équipe sans que cela n'affecte ses objectifs généraux. Coordonner des équipes à la composition aussi dynamique est complexe : la stratégie optimale varie selon la composition. Nous offrons COPA, un cadre coach-joueur, pour résoudre ce problème. Nous supposons que l'entraîneur a une vue d'ensemble de l'environnement et coordonne les joueurs, qui n'en ont qu'une vision partielle, en distribuant des stratégies individuelles. Plus précisément, nous : 1) adoptons un mécanisme d'attention pour l'entraîneur et les joueurs ; 2) proposons un objectif variationnel pour régulariser l'apprentissage ; et 3) concevons une méthode de communication adaptative permettant à l'entraîneur de décider quand communiquer avec les joueurs. Nous validons nos méthodes sur une tâche de collecte de ressources, un jeu de sauvetage et les tâches de microgestion de StarCraft. Nous démontrons une généralisation sans précédent à de nouvelles compositions d'équipe. Notre méthode atteint des performances comparables, voire supérieures, à celles obtenues lorsque tous les joueurs ont une vue complète de l'environnement. De plus, nous constatons que les performances restent élevées même lorsque l'entraîneur communique seulement 13 % du temps grâce à la stratégie de communication adaptative.
Tests statistiques efficaces : une approche par noyau tangent neuronal
Sheng Jia, Ehsan Nezhadarya, Yuhuai Wu, Jimmy Ba
Êtes-vous certain que votre modèle d'apprentissage machine peut faire des prédictions fiables sur les données de test ? Que se passe-t-il si la précision est faible simplement parce que vos données de test sont intrinsèquement différentes des données d'entraînement ?
Dans notre dernier article intitulé « Tests statistiques efficaces : une approche par noyau tangent neuronal », nous présentons une méthode efficace pour détecter les divergences entre deux ensembles d'échantillons grâce à un test à deux échantillons basé sur un noyau tangent neuronal. Notre approche permet aux spécialistes de l'apprentissage automatique de déterminer rapidement si leurs échantillons de test suivent la même distribution que les échantillons d'entraînement. Le principal avantage de notre méthode réside dans le fait qu'elle ne nécessite pas d'entraînement du noyau, tout en conservant sa compositionnalité pour les données de grande dimension grâce aux réseaux de neurones. Notre processus de test permet d'identifier rapidement si votre modèle est prêt à être déployé sur de nouvelles tâches.
Inférence environnementale pour l'apprentissage invariant
Elliot Creager, Jörn-Henrik Jacobsen, Richard Zemel
Bien que les systèmes d'apprentissage automatique (ML) soient généralement performants dans des contextes similaires aux données d'entraînement, ils peuvent échouer lorsqu'ils sont déployés dans de nouveaux environnements présentant de subtiles différences. L'apprentissage invariant vise à pallier cette fragilité en apprenant des caractéristiques « invariantes » aux changements de contexte durant l'entraînement. Malheureusement, cela nécessite de partitionner manuellement les données d'entraînement en « environnements » codant les contextes pertinents. Pour traiter les situations plus réalistes où cette information est indisponible, nous proposons l'Inférence d'environnement pour l'apprentissage invariant (EIIL), une méthode qui infère les étiquettes d'environnement les plus défavorables directement à partir des données d'entraînement, ce qui peut améliorer les méthodes d'apprentissage invariant en aval dans certains contextes.
Apprentissage adverse dans le domaine f : théorie et algorithmes
David Acuna, Guojun Zhang, Marc T. Law, Sanja Fidler
L'adaptation de domaine non supervisée est utilisée dans de nombreuses applications d'apprentissage machine où, lors de l'entraînement, un modèle a accès à des données non étiquetées du domaine cible et à un ensemble de données étiquetées associé. Dans cet article, nous introduisons un nouveau cadre d'apprentissage antagoniste de domaine général. Plus précisément, nous établissons une nouvelle borne de généralisation pour l'adaptation de domaine qui exploite une nouvelle mesure de divergence entre les distributions, basée sur une caractérisation variationnelle des f-divergences. Ce cadre retrouve les résultats théoriques de Ben-David et al. (2010a) comme cas particulier et supporte les divergences utilisées en pratique. À partir de cette borne, nous dérivons un nouveau cadre algorithmique qui introduit une correction essentielle dans la méthode d'entraînement antagoniste originale de Ganin et al. (2016). Nous montrons que de nombreux régulariseurs et objectifs ad hoc introduits ces dernières années dans ce cadre ne sont alors plus nécessaires pour atteindre des performances comparables, voire supérieures, à celles des méthodes antagonistes de domaine de pointe. L'analyse expérimentale menée sur des ensembles de données réels de langage naturel et de vision par ordinateur montre que notre cadre surpasse les références existantes et obtient les meilleurs résultats pour les divergences f qui n'étaient pas prises en compte auparavant dans l'apprentissage adverse de domaine.
Au niveau de l'image ou de l'objet ? Comparaison de deux stratégies de rééchantillonnage pour la détection à longue traîne
Nadine Chang, Zhiding Yu, Yu-Xiong Wang, Anima Anandkumar, Sanja Fidler, Jose M. Alvarez
L'entraînement sur des ensembles de données présentant des distributions à longue traîne s'avère complexe pour les principales tâches de reconnaissance telles que la classification et la détection. Pour remédier à cela, le rééchantillonnage d'images est généralement proposé comme une approche simple mais efficace. Cependant, nous observons que la détection de distributions à longue traîne diffère de la classification, car plusieurs classes peuvent être présentes dans une même image. Par conséquent, le rééchantillonnage d'images seul n'est pas suffisant pour obtenir une distribution suffisamment équilibrée au niveau de l'objet. Nous proposons une solution au rééchantillonnage au niveau de l'objet : une stratégie de relecture de mémoire centrée sur l'objet et basée sur des banques de mémoire dynamiques et épisodiques. Notre stratégie présente deux avantages : 1) un rééchantillonnage au niveau de l'objet aisé, sans calcul supplémentaire significatif, et 2) une augmentation implicite des caractéristiques grâce aux mises à jour du modèle. Nous démontrons l'importance des rééchantillonnages au niveau de l'image et au niveau de l'objet, et les unifions par une stratégie de rééchantillonnage conjointe (RIO). Notre méthode surpasse les méthodes de détection et de segmentation de pointe pour les distributions à longue traîne sur LVIS v0.5, et ce, sur différentes architectures.
Amélioration des taux de compression sans perte grâce au codage inverse des bits par la méthode de Monte Carlo
Yangjun Ruan, Karen Ullrich, Daniel Severo, James Townsend, Ashish Khisti, Arnaud Doucet, Alireza Makhzani, Chris J. Maddison
Les modèles à variables latentes ont été appliqués avec succès à la compression sans perte grâce à l'algorithme de codage par bits. Cependant, ce dernier présente une augmentation du débit binaire égale à la divergence de Kullback-Leibler entre la distribution a posteriori approximative et la distribution a posteriori réelle. Dans cet article, nous montrons comment éliminer asymptotiquement cet écart en dérivant des algorithmes de codage par bits à partir de bornes variationnelles plus précises. L'idée principale est d'exploiter les représentations spatiales étendues des estimateurs de Monte Carlo de la vraisemblance marginale. Appliqués naïvement, nos schémas nécessiteraient plus de bits initiaux que le codeur par bits standard, mais nous montrons comment réduire drastiquement ce coût supplémentaire grâce à des couplages dans l'espace latent. Lorsque des architectures parallèles peuvent être exploitées, nos codeurs atteignent des débits supérieurs à ceux du codage par bits pour un coût additionnel minime. Nous démontrons des taux de compression sans perte améliorés dans divers contextes, notamment pour la compression de données hors distribution ou séquentielles.
Attaques par inférence d'appartenance basées uniquement sur les étiquettes
Christopher A. Choquette-Choo, Florian Tramer, Nicholas Carlini, Nicolas Papernot
Êtes-vous tenté d'éviter de payer pour l'utilité du modèle en échange d'une garantie théorique de confidentialité, en contrant des attaques spécifiques comme l'inférence d'appartenance ? Nous avons identifié un ensemble de défenses, que nous appelons « masquage de confiance », et nous démontrons qu'elles ne constituent pas une protection efficace contre les attaques par inférence d'appartenance. Pour ce faire, nous avons créé les premières attaques par inférence d'appartenance basées uniquement sur les étiquettes et montré que ces attaques adaptatives parviennent à extraire l'appartenance malgré l'utilisation de ces défenses masquant les scores de confiance. Grâce à nos attaques, nous proposons une évaluation rigoureuse de l'efficacité de nombreuses défenses et montrons que l'entraînement différentiellement privé avec apprentissage par transfert offre le meilleur compromis entre les fuites de données et la performance du modèle.
Apprentissage d'un modèle universel pour la généralisation d'ensembles de données à partir de peu d'exemples
Eléni Triantaflou, Hugo Larochelle, Richard Zemel, Vincent Dumoulin
L'apprentissage avec peu d'exemples consiste à apprendre de nouveaux concepts à partir d'un nombre restreint d'exemples étiquetés. Cela représente un défi majeur pour les algorithmes d'apprentissage automatique traditionnels, gourmands en données et dépendants de la disponibilité de vastes ensembles de données étiquetées, contrairement à la flexibilité d'apprentissage humaine. Nos travaux s'attaquent à un scénario d'apprentissage avec peu d'exemples particulièrement complexe : nous disposons d'exemples étiquetés issus d'un ensemble diversifié de jeux de données (images de fleurs, de champignons, textures, croquis, caractères manuscrits, etc.), dans le but de construire un modèle capable d'apprendre, à partir de peu d'exemples, des classes provenant de jeux de données inédits. Comparé au problème bien étudié de la classification avec peu d'exemples, cette formulation présente la difficulté supplémentaire que les nouvelles classes sont thématiquement et visuellement distinctes de celles utilisées pour l'entraînement. Pour cela, nous proposons d'apprendre un modèle de base (un sous-ensemble de couches d'un réseau de neurones) qui, une fois correctement initialisé (par le choix des valeurs des couches restantes), définit des modèles performants pour différentes distributions de données, permettant ainsi un apprentissage rapide de divers ensembles de classes. Nous proposons une implémentation évolutive et efficace de cette idée, qui obtient d'excellents résultats en matière d'apprentissage avec peu d'exemples pour divers ensembles de classes.
LIME : Apprentissage du biais inductif pour les primitives du raisonnement mathématique
Yuhuai Wu, Markus Rabe, Wenda Li, Jimmy Ba, Roger Grosse, Christian Szegedy
Le terme « biais inductif » désigne la manière dont un modèle généralise à des situations inédites. Si les biais inductifs sont généralement spécifiés par l'architecture du modèle ou une distribution a priori, nous proposons une approche alternative pour spécifier des biais inductifs utiles : définir un ensemble de tâches auxiliaires synthétiques pour lesquelles ce biais inductif s'avère pertinent. Nous appliquons avec succès cette approche à plusieurs ensembles de données de référence pour l'apprentissage du raisonnement mathématique.
LTL2Action : Généralisation des instructions LTL pour le RL multitâche
Pashootan Vaezipoor, Andrew Li, Rodrigo Toro Icarte, Sheila McIlraith
Imaginez une IA polyvalente capable d'effectuer diverses tâches et de suivre des instructions linguistiques ouvertes. En général, entraîner une telle IA à comprendre et à respecter ces instructions est un processus fastidieux, nécessitant une importante rétroaction humaine – soit de manière interactive, soit à partir de vastes corpus d'instructions annotées par des humains. Nous proposons une alternative : un cadre d'apprentissage par renforcement profond (RL) qui utilise des instructions formelles, sans ambiguïté et compositionnelles, permettant la génération automatique de rétroaction pour l'entraînement. Les instructions sont spécifiées en logique temporelle linéaire (LTL) , capable d'exprimer des schémas temporels complexes dans une syntaxe interprétable par l'humain. Dans des domaines complexes de robotique, nous démontrons que notre agent RL apprend à interpréter le langage, ce qui lui permet de généraliser à des instructions inédites provenant d'un espace diversifié de plus de 10³⁹ tâches possibles.
Markpainting : L'apprentissage machine adverse rencontre le remplissage
David Khachaturov, Ilia Shumailov, Yiren Zhao, Nicolas Papernot, Ross Anderson
L'inpainting est une technique d'interpolation apprise, basée sur la modélisation générative, utilisée pour compléter les parties masquées ou manquantes d'une image ; elle trouve de nombreuses applications en retouche et édition d'images. Récemment, l'inpainting a commencé à être utilisé pour la suppression de filigranes, ce qui a suscité des inquiétudes. Dans cet article, on étudie comment le manipuler grâce à notre technique de markpainting. Premièrement, nous montrons comment un propriétaire d'image ayant accès à un modèle d'inpainting peut augmenter son image de telle sorte que toute tentative de modification à l'aide de ce modèle ajoute des informations visibles arbitraires. Nous constatons que notre technique permet de cibler simultanément plusieurs modèles différents. Ceci peut être conçu pour reconstituer un filigrane si l'éditeur a tenté de le supprimer. Deuxièmement, nous montrons que notre technique de markpainting est transférable à des modèles ayant des architectures différentes ou ayant été entraînés sur des ensembles de données différents, rendant ainsi les filigranes créés avec cette technique difficiles à supprimer pour les attaquants. Le markpainting est une technique novatrice qui peut servir d'alerte à la manipulation, devenant visible en cas d'inpainting.
Oups, j'ai pris un gradient : Échantillonnage évolutif pour les distributions discrètes
Will Grathwohl, Milad Hashemi, Kevin Swersky, David Duvenaud, Chris Maddison.
Souvent, les scientifiques veulent explorer automatiquement toutes les hypothèses qui pourraient expliquer des données. Cependant, la plupart des hypothèses s'ajustent très mal aux données, et il est difficile de trouver celles qui sont compatibles. C'est particulièrement vrai quand les hypothèses ont plusieurs degrés de liberté. Au cours des dernières décennies, les méthodes de recherche basées sur le gradient d'ajustement de l'hypothèse ont été étendues à des dizaines de milliers, voire des millions de degrés de liberté. Nous avons développé une méthode simple pour appliquer cette recherche par gradient à des hypothèses décrites par des choix discrets. Nous illustrons cette approche par la modélisation de données de repliement des protéines.
Algorithme d'itération de valeur accélérée PID
Amir-Massoud Farahmand, Mohammed Ghavamzadeh
Comment accélérer le calcul de la politique optimale pour les agents d'apprentissage par renforcement (RL) ? De nombreux algorithmes RL reposent sur un algorithme fondamental appelé itération de valeur (VI). Cependant, l'itération de la valeur est assez lente pour les problèmes à long terme, où l'agent doit anticiper l'avenir. Ce travail propose des modifications de l'itération de valeur afin d'accélérer sa convergence. L'idée clé est que l'itération de valeur peut être interprétée comme un système dynamique, qui peut ensuite être modifié à l'aide d'outils de la théorie du contrôle, tels que le régulateur proportionnel-dérivé-intégral (PID), pour concevoir des variantes plus rapides de l'algorithme d'itération de valeur.
Exploration raisonnée par amorçage optimiste et induction rétrograde
Chenjia Bai, Lingxiao Wang, Lei Han, Jianye Hao, Animesh Garg, Peng Liu, Zhaoran Wang
Une approche rigoureuse pour une exploration efficace consiste à intégrer la borne supérieure de confiance (BSC) à la fonction de valeur sous forme de bonus. Cependant, la BSC est conçue pour les contextes linéaires et tabulaires et est incompatible avec l'apprentissage par renforcement profond (DRL). Dans cet article, nous proposons une méthode d'exploration rigoureuse pour le DRL basée sur le bootstrap optimiste et l'induction rétrograde (OB2I). OB2I construit un bonus BSC générique par bootstrap non paramétrique dans le cadre du DRL. Ce bonus estime l'incertitude épistémique des paires état-action pour une exploration optimiste. Nous établissons des liens théoriques entre le bonus BSC proposé et la BSC LSVI dans un contexte linéaire. Nous propageons l'incertitude future de manière cohérente dans le temps grâce à une mise à jour rétrograde épisodique, ce qui exploite l'avantage théorique et améliore empiriquement l'efficacité d'échantillonnage. Nos expériences sur le labyrinthe MNIST et la suite Atari suggèrent qu'OB2I surpasse plusieurs approches d'exploration de pointe.
S2SD : Auto-distillation simultanée basée sur la similarité pour l'apprentissage métrique profond
Karsten Roth, Timo Milbich, Björn Ommer, Joseph Paul Cohen, Marzyeh Ghassemi
L'apprentissage métrique profond (DML) constitue un outil essentiel pour la similarité visuelle et les applications zéro-shot en apprenant des espaces d'intégration généralisables. Cependant, des travaux récents en DML ont mis en évidence une forte saturation des performances pour différents objectifs d'entraînement. Or, la capacité de généralisation est connue pour être proportionnelle à la dimensionnalité de l'espace d'embeddings. Malheureusement, les emboîtements de grande dimension entraînent également un coût de récupération plus élevé pour les applications en aval. Pour remédier à ce problème, nous proposons la distillation automatique basée sur la similarité simultanée (S2SD). S2SD étend le DML en distillant les connaissances issues d'espaces d'intégration et de caractéristiques auxiliaires de grande dimension afin d'exploiter un contexte complémentaire lors de l'entraînement, tout en conservant le coût de la phase de test et en n'influençant que très légèrement le temps d'entraînement. Des expériences et des analyses comparatives sur différents objectifs et benchmarks standards montrent que S2SD offre des améliorations notables, jusqu'à 7 % en Recall@1, tout en établissant une nouvelle référence. Le code est disponible ici.
Processus gaussiens variationnels évolutifs par décomposition à noyau harmonique
Shengyang Sun, Jiaxin Shi, Andrew Gordon Wilson, Roger Grosse
Les processus gaussiens définissent des distributions sur les fonctions. Nous introduisons la décomposition en noyau harmonique, qui décompose un processus gaussien respectant certaines symétries en une somme de processus gaussiens orthogonaux. Grâce à cette décomposition, nous proposons un algorithme d'inférence pour les processus gaussiens plus performant que les approches précédentes.
Segmentation des trajectoires hybrides avec des EDO latentes
Ruian Shi, Quaid Morris
Les trajectoires hybrides sont un type de données de séries temporelles caractérisées par des changements soudains dans leur génération. Par exemple, l'état de santé d'un patient peut changer soudainement suite à l'apparition d'une nouvelle maladie. De nombreux ensembles de données de séries temporelles réelles contiennent des trajectoires hybrides, mais les méthodes traditionnelles ont du mal à les modéliser avec précision, surtout lorsque les points de rupture sont inconnus. C'est pourquoi nous avons développé l'ODE segmentée latente (LatSegODE), qui permet une interpolation et une extrapolation précises des trajectoires hybrides et détecte avec exactitude les points de rupture. LatSegODE utilise un algorithme de recherche optimisé pour trouver la meilleure reconstruction en considérant tous les points de rupture possibles dans une trajectoire hybride, ce qui lui permet de fonctionner sans connaissance préalable de leur emplacement et de leur nombre.
SketchEmbedNet : Apprendre de nouveaux concepts en imitant des dessins
Alexander Wang, Mengye Ren, Richard S. Zemel
Les croquis permettent de saisir l'information essentielle des concepts visuels. Des travaux antérieurs ont démontré que les réseaux de neurones sont capables de produire des croquis d'objets naturels provenant d'un nombre restreint de classes. Alors que les approches précédentes se concentrent sur la qualité de la génération ou de la récupération, nous explorons les propriétés des représentations d'images apprises en entraînant un modèle à produire des croquis d'images. Nous montrons que ce modèle génératif, indépendant des classes, produit des représentations informatives d'images issues d'exemples, de classes et même d'ensembles de données inédits, et ce, avec un nombre limité d'exemples. De plus, on constate que ces représentations apprises présentent une structure et une compositionnalité intéressantes.
Tesseract : Acteurs tensorisés pour l’apprentissage par renforcement multiagents
Anuj Mahajan, Mikayel Samvelyan, Lei Mao, Viktor Makoviychuk, Animesh Garg, Jean Kossaifi, Shimon Whiteson, Yuke Zhu, Animashree Anandkumar
L'apprentissage par renforcement dans de grands espaces d'action est un problème complexe. L'apprentissage par renforcement multi-agents coopératif (MARL) accentue cette difficulté en imposant diverses contraintes sur la communication et l'observabilité. Dans ce travail, nous considérons l'obstacle fondamental qui affecte les approches basées sur la valeur et sur le gradient de politique : l'explosion exponentielle de l'espace d'actions avec le nombre d'agents. Pour les méthodes basées sur la valeur, cela pose des problèmes pour la représentation précise de la fonction de valeur optimale. Pour les méthodes basées sur le gradient de politique, cela rend difficile l'entraînement du critique et aggrave le problème du critique retardé. Nous montrons que, du point de vue de la théorie de l'apprentissage, ces deux problèmes peuvent être résolus en représentant précisément la fonction de valeur d'action associée par une classe d'hypothèses de faible complexité. Cela nécessite de modéliser avec précision les interactions entre agents de manière efficace en termes d'échantillons. À cette fin, nous proposons une nouvelle formulation tensorisée de l'équation de Bellman. Cela donne naissance à notre méthode Tesseract, qui considère la fonction Q comme un tenseur dont les modes correspondent aux espaces d'actions des différents agents. Les algorithmes dérivés de Tesseract décomposent le tenseur Q entre les agents et utilisent des approximations tensorielles de faible rang pour modéliser les interactions entre agents pertinentes à la tâche. Nous présentons une analyse PAC pour les algorithmes basés sur Tesseract et soulignons leur pertinence pour la classe des processus décisionnels markoviens (MDP) à observations riches. Des résultats empiriques dans différents domaines confirment les gains d'efficacité d'échantillonnage prédits par la théorie grâce à Tesseract.
Représentation non supervisée des parties par capsules de flux
Sara Sabour, Andrea Tagliasacchi, Soroosh Yazdani, Geoffrey E. Hinton, David J. Fleet
Les réseaux de capsules visent à analyser les images en une hiérarchie d'objets, de parties et de relations. Bien que prometteurs, ils demeurent limités par leur incapacité à apprendre des descriptions de parties efficaces et détaillées. Pour remédier à ce problème, nous proposons une méthode d'apprentissage des encodeurs de capsules primaires qui détectent les parties atomiques d'une seule image. Lors de l'entraînement, nous exploitons le mouvement comme un puissant indice perceptif pour la définition des parties, grâce à un décodeur expressif pour la génération des parties au sein d'un modèle d'image multicouche avec occlusion. Les expériences démontrent une détection robuste des parties en présence de plusieurs objets, d'arrière-plans complexes et d'occlusion. Le décodeur de parties infère les masques de forme sous-jacents, remplissant efficacement les régions occultées des formes détectées. Nous évaluons FlowCapsules sur la segmentation non supervisée de parties et la classification non supervisée d'images.
Itération de valeur dans les actions, les états et le temps continus
Michael Lutter, Shie Mannor, Jan Peters, Dieter Fox, Animesh Garg
Les approches classiques d'itération de valeur ne s'appliquent pas aux environnements à états et actions continus. Dans ces environnements, les états et les actions sont généralement discrétisés, ce qui entraîne une augmentation exponentielle de la complexité du calcul. Nous proposons dans cet article l'itération de valeur ajustée continue (cFVI). Cet algorithme permet la programmation dynamique pour des états et actions continus avec un modèle de dynamique connu. Grâce à la formulation en temps continu, la politique optimale peut être dérivée pour une dynamique non linéaire affine au contrôle. Cette solution analytique permet d'étendre efficacement l'itération de valeur aux environnements continus. Nous montrons, à travers des expériences de contrôle non linéaire, que la solution de programmation dynamique atteint les mêmes performances quantitatives que les méthodes d'apprentissage par renforcement profond en simulation, mais surpasse les performances réelles lors de son application au système physique. La politique obtenue par cFVI est plus robuste aux changements de dynamique, malgré l'utilisation d'un modèle déterministe et l'absence d'intégration explicite de la robustesse dans l'optimisation. Des vidéos du système physique sont disponibles ici .