Par Ian Gormely
27 novembre 2020
Les chercheurs travaillant sur les vecteurs se préparent à nouveau pour la principale conférence d'apprentissage machine, la 34e conférence annuelle sur les systèmes de traitement de l'information neuronale (NeurIPS). Initialement prévue à Vancouver (Colombie-Britannique), la conférence de cette année se tiendra en ligne du 6 au 12 décembre. Au programme : conférences invitées, démonstrations, symposiums et présentations orales et par affiche d'articles évalués par des pairs.
Vous trouverez ci-dessous des résumés et des résumés simplifiés de nombreux articles et ateliers acceptés par les chercheurs affiliés à Vector.
Vous pouvez en savoir plus sur le travail de Vector lors des conférences des années précédentes ici et ici .
La communauté de recherche de Vector continue de croître rapidement. Si vous êtes un chercheur affilié à Vector et que vos travaux ne figurent pas ici, veuillez contacter ian.gormely@vectorinstitute.ai
Communications présentées lors de conférences par les membres du corps professoral et les professeurs affiliés de Vector :
Fartash Faghri (Université de Toronto/Institut Vector), Iman Tabrizian (Université de Toronto/Institut Vector), Ilia Markov (IST Autriche), Dan Alistarh (IST Autriche/Neural Magic Inc.), Daniel Roy (Université de Toronto/Institut Vector), Ali Ramezani-Kebrya (Institut Vector)
À mesure que l'apprentissage profond s'étend à des modèles plus grands et à des volumes de données plus importants, les chercheurs utilisent des algorithmes distribués et parallèles pour accélérer l'entraînement. Ces travaux montrent comment réduire la surcharge de communication de 70 %, ouvrant ainsi la voie à des calculs à une échelle encore plus grande.
Une approche d'apprentissage de fonctions implicites pour la régression modale paramétrique
Yangchen Pan (Université de l'Alberta), Ehsan Imani (Université de l'Alberta), Martha White (Université de l'Alberta), Amir-Massoud Farahmand (Institut Vector/Université de Toronto)
L'apprentissage de la relation entre une entrée et une sortie à valeurs réelles est un problème fondamental en apprentissage machine, connu sous le nom de problème de régression. Les méthodes de régression classiques apprennent la valeur moyenne d'une sortie à partir de son entrée. Cette approche est acceptable lorsque la sortie, pour une entrée donnée, est concentrée autour d'un seul mode (unimodale), mais elle ne l'est plus lorsqu'elle présente plusieurs modes. Ce travail développe un nouvel algorithme évolutif pour apprendre une telle relation. Ce résultat est obtenu grâce au théorème des fonctions implicites, qui permet de transformer le problème de l'apprentissage d'une fonction multivaluée, complexe, en celui de l'apprentissage d'une fonction univaluée, plus simple.
Découverte causale dans les systèmes physiques à partir de vidéos
Yunzhu Li (Massachusettes Institute of Technology), Antonio Torralba (Massachusettes Institute of Technology), Anima Anandkumar (NVIDIA/CalTech), Dieter Fox (NVIDIA/Université de Washington), Animesh Garg (University of Toronto/Vector Institute)
La découverte causale est au cœur de la cognition humaine. Elle nous permet de raisonner sur l'environnement et de faire des prédictions contrefactuelles concernant des scénarios inédits, potentiellement très différents de nos expériences passées. Nous abordons la découverte causale à partir de vidéos de manière globale, sans supervision de la structure du graphe de référence. Plus précisément, notre objectif est de découvrir les dépendances structurelles entre les variables environnementales et les variables liées aux objets : inférer le type et l'intensité des interactions ayant un effet causal sur le comportement du système dynamique. Notre modèle se compose de : (a) un module de perception qui extrait des images une représentation sémantiquement pertinente et temporellement cohérente des points clés ; (b) un module d'inférence qui détermine la distribution du graphe induite par les points clés détectés ; et (c) un module de dynamique capable de prédire l'avenir en se basant sur le graphe inféré. Nous présumons avoir accès à différentes configurations et conditions environnementales, c'est-à-dire à des données provenant d'interventions inconnues sur le système sous-jacent ; ainsi, on peut espérer découvrir le graphe causal sous-jacent correct sans interventions explicites. Nous évaluons notre méthode dans un environnement d'interaction multicorps planaire et dans des scénarios impliquant des tissus de formes variées, comme des chemises et des pantalons. Les expériences démontrent que notre modèle peut identifier correctement les interactions à partir d'une courte séquence d'images et faire des prédictions à long terme. La structure causale supposée par le modèle lui permet aussi de faire des prédictions contrefactuelles et d'extrapoler à des systèmes de graphes d'interaction inédits ou de tailles diverses.
Augmentation des données contrefactuelles à l'aide de dynamiques factorisées localement
Silviu Pitis (Université de Toronto/Institut Vector), Elliot Creager (Université de Toronto/Institut Vector), Animesh Garg (Université de Toronto/Institut Vector)
Nous détectons et exploitons l'indépendance causale locale entre les objets et les caractéristiques de l'état du monde afin d'améliorer l'efficacité d'échantillonnage des robots simulés dans le cadre de l'apprentissage par renforcement. Nous formalisons cette indépendance causale locale à l'aide d'un cadre de modélisation causale locale et l'utilisons dans notre algorithme d'augmentation de données contrefactuelles pour générer de nouvelles données causalement valides permettant l'entraînement des modèles.
Programme d'études par lissage
Samartha Sinha (Université de Toronto/Institut Vector), (Animesh Garg (Université de Toronto/Institut Vector), Hugo Larochelle (Google Brain)
Les réseaux neuronaux convolutifs (CNN) ont démontré des performances impressionnantes en vision par ordinateur, notamment pour la classification, la détection et la segmentation d'images. De plus, des travaux récents sur les réseaux antagonistes génératifs (GAN) ont mis en évidence l'importance d'un apprentissage progressif, par augmentation graduelle de la difficulté de la tâche (Kerras et al.). Lors de l'apprentissage d'un réseau à partir de zéro, les informations propagées au sein du réseau pendant les premières étapes de l'entraînement peuvent contenir des artefacts de distorsion dus au bruit, ce qui peut nuire à l'apprentissage. Dans cet article, nous proposons une méthode élégante, basée sur un programme d'apprentissage progressif, qui lisse l'intégration des caractéristiques d'un CNN à l'aide de filtres anti-repliement ou passe-bas. Nous proposons d'améliorer l'entraînement des CNN en contrôlant la quantité d'informations à haute fréquence propagées au sein du réseau au fur et à mesure de l'entraînement, en convoluant la sortie de la carte de caractéristiques de chaque couche avec un noyau gaussien. En diminuant la variance du noyau gaussien, on augmente graduellement la quantité d'informations à haute fréquence disponibles pour l'inférence au sein du réseau. À mesure que la quantité d'informations dans les cartes de caractéristiques augmente pendant l'entraînement, le réseau apprend progressivement de meilleures représentations des données. Notre schéma d'entraînement augmenté améliore significativement les performances des CNN sur diverses tâches de vision, sans ajout de paramètres entraînables supplémentaires ni d'objectif de régularisation auxiliaire. La généralité de notre méthode est démontrée par des gains de performance empiriques sur des architectures CNN dans quatre tâches différentes : apprentissage par transfert, apprentissage par transfert intertâches et modèles génératifs.
Stanislav Fort (Université Stanford/Google Research), Gintare Karolina Dziugaite (Element AI), Mansheej Paul (Université Stanford), Sepideh Kharaghani (Element AI), Daniel Roy (Université de Toronto/Vector Institute), Surya Ganguli (Université Stanford)
Nous comprenons maintenant l'entraînement des réseaux profonds dans certains régimes limites, où ils se comportent comme des automates à noyau simplifiés. Mais comment ces simplifications se rapportent-elles aux réseaux réels qui offrent des performances empiriques supérieures ? Dans ce travail, nous utilisons une étude empirique pour relier la géométrie de l'entraînement à l'évolution temporelle du noyau.
Juhan Bae (Université de Toronto/Institut Vector), Roger Grosse (Université de Toronto/Institut Vector)
L'entraînement des réseaux neuronaux implique de nombreux hyperparamètres, c'est-à-dire des paramètres à optimiser pour obtenir de bonnes performances. Nous avons développé une approche permettant d'ajuster automatiquement ces hyperparamètres en temps réel pendant l'entraînement du réseau (contrairement à la plupart des méthodes d'ajustement qui nécessitent de nombreuses itérations). L'astuce consiste à apprendre le jacobien de la meilleure réponse, qui détermine comment l'optimum de la fonction objectif d'entraînement évolue suite à de petites perturbations des hyperparamètres. Cela nous permet d'estimer approximativement les modifications à apporter aux hyperparamètres pour améliorer la généralisation.
Modèles hybrides pour l'apprentissage de la ramification
Prateek Gupta (Université d'Oxford), Maxime Gasse (Polytechnique Montréal), Elias Khalil (Université de Toronto/Vector Institute), Pawan K Mudigonda (Université d'Oxford), Andrea Lodi (École polytechnique Montréal), Yoshua Bengio (Mila/Université de Montréal)
Une approche récente de réseau neuronal graphique (GNN) pour l'apprentissage des embranchements a démontré sa capacité à réduire le temps d'exécution des algorithmes de séparation et d'évaluation pour la programmation linéaire en nombres entiers mixtes (PLNE). Alors que le GNN s'appuie sur un GPU pour l'inférence, les solveurs de PLNE fonctionnent exclusivement sur CPU. Cela limite considérablement son application, car de nombreux praticiens n'ont pas accès à des GPU haut de gamme. Dans ce travail, on pose deux questions essentielles. Premièrement, dans un contexte plus réaliste où seul un CPU est disponible, le modèle GNN reste-t-il compétitif ? Deuxièmement, pouvons-nous concevoir un modèle alternatif peu gourmand en ressources de calcul qui conserve la puissance prédictive de l'architecture GNN ? Nous répondons par la négative à la première question et abordons la seconde en proposant une nouvelle architecture hybride pour un embranchement efficace sur CPU. L'architecture proposée combine la puissance expressive des GNN avec des perceptrons multicouches (MLP) peu gourmands en ressources de calcul pour l'embranchement. Nous évaluons nos méthodes sur quatre classes de problèmes MILP et montrons qu'elles permettent de réduire le temps d'exécution du solveur jusqu'à 26 % par rapport aux méthodes de pointe sans GPU, tout en s'étendant à des problèmes plus complexes que ceux sur lesquels elles ont été entraînées. Le code de ce projet est accessible au public à cette adresse : [URL].
Modèles d'enrichissement des données à partir d'exemples
Sajad Norouzi (Université de Toronto/Institut Vector), David J Fleet (Université de Toronto/Institut Vector), Mohammad Norouzi (Google Brain)
Exemplar VAE est un nouveau type de modèle génératif qui combine une architecture encodeur-décodeur de réseau neuronal avec des techniques non paramétriques basées sur des exemples. L'encodeur de réseau neuronal transforme une image en un espace de caractéristiques qui détermine, pour une image donnée, les images similaires. Les emplacements dans cet espace de caractéristiques proches d'images naturelles (exemples) sont considérés comme représentant des images plausibles. Pour générer de nouvelles images selon le modèle, on choisit d'abord une image naturelle parmi un vaste ensemble d'exemples. On la perturbe ensuite en modifiant aléatoirement sa position dans l'espace des caractéristiques, puis on transforme ce nouveau vecteur de caractéristiques en une image à l'aide du décodeur de réseau neuronal. Le modèle est extrêmement performant pour l'estimation de la densité et s'avère utile pour l'apprentissage de représentations. Une propriété remarquable du modèle est que les données générées aléatoirement peuvent être utilisées pour l'augmentation générative de données afin d'améliorer les classificateurs d'images.
Dimension de Hausdorff, queues lourdes et généralisation dans les réseaux neuronaux
Umut Simsekli (Institut polytechnique de Paris/Université d'Oxford), Ozan Sener (Intel Labs), George Deligiannidis (Université d'Oxford), Murat Erdogdu (Université de Toronto/Vector Institute)
Cet article démontre des bornes de généralisation pour les modèles d'apprentissage automatique entraînés par descente de gradient stochastique (SGD), sous l'hypothèse que leurs trajectoires peuvent être bien approchées par une diffusion à queue lourde. L'erreur de généralisation est contrôlée par la dimension de Hausdorff des trajectoires, étroitement liée au comportement de la queue de la diffusion. Nos résultats impliquent que les processus à queue plus lourde devraient atteindre une meilleure généralisation ; par conséquent, l'indice de queue du processus peut être utilisé comme mesure de capacité.
À la recherche de mesures robustes de généralisation
Gintare Karolina Dziugaite (Élément AI), Alexandre Drouin (Élément AI), Brady Neal (Mila), Nitarshan Rajkumar (Mila, Université de Montréal), Ethan Caballero (Mila), Linbo Wang (Université de Toronto/Vector Institute), Ioannis Mitliagkas (Mila/Université de Montréal), Daniel Roy (Université de Toronto/Vector Institute)
Comment évaluer les théories mathématiques de la généralisation en apprentissage profond ? Des travaux récents proposent d’utiliser des études empiriques à grande échelle. Nous insistons sur l'importance d'utiliser des mesures de robustesse afin que ces études ne nous induisent pas en erreur. Nous constatons qu'aucune théorie existante n'est robuste.
Sélection d'instances pour les GAN
Terrance DeVries (Université de Guelph/Institut Vector), Michal Drozdzal (FAIR), Graham W Taylor (Université de Guelph/Institut Vector)
En résumé, contrairement aux idées reçues en apprentissage machine, « plus de données ne signifie pas toujours mieux ». Nous démontrons qu'en supprimant automatiquement les exemples de données provenant des zones clairsemées de l'ensemble de données, nous pouvons améliorer la qualité des échantillons des réseaux antagonistes génératifs (GAN), réduire leurs besoins en ressources et diminuer considérablement le temps d'entraînement. Par exemple, sur des images de 128 × 128 pixels, notre modèle nécessite moins de quatre jours d'entraînement, tandis que le modèle de référence en requiert plus de deux semaines. Pour les images ImageNet de 256 × 256 pixels, c'est la première fois que des images photoréalistes sont obtenues sans matériel spécialisé (c'est-à-dire des centaines de TPU).
Représentations d'agents d'apprentissage pour le hockey sur glace
Guiliang Liu (Université Simon Fraser) · Oliver Schulte (Université Simon Fraser) · Pascal Poupart (Université de Waterloo/RBC Borealis AI/Institut Vector) · Mike Rudd (Université de Waterloo/Institut Vector) · Mehrsan Javan (SPORTLOGiQ)
Ce travail présente une nouvelle représentation des joueurs dans les sports collectifs. Cette nouvelle technique de représentation est mise en œuvre au hockey sur glace, avec des résultats de pointe permettant d'identifier le joueur actif, d'estimer les buts attendus et de prédire l'écart de pointage final.
Apprendre les équations différentielles rapides à résoudre
Jacob Kelly (Université de Toronto/Institut Vector), Jesse Bettencourt (Université de Toronto/Institut Vector), Matthew Johnson (Google Brain), David Duvenaud (Université de Toronto/Institut Vector)
Lorsqu'on modélise des systèmes physiques, certains modèles sont plus faciles à approcher et à utiliser pour faire des prédictions que d'autres. Il arrive que différents modèles aboutissent à des prédictions presque identiques, mais l'un d'eux sera beaucoup plus simple à manipuler. Nous montrons comment concevoir des modèles plus faciles à prédire tout en conservant une excellente concordance avec les données. Plus précisément, nous montrons comment procéder dans une classe générale de modèles de systèmes à évolution continue appelés équations différentielles ordinaires.
Apprentissage des maillages tétraédriques déformables pour la reconstruction 3D *
Jun Gao (Université de Toronto) · Wenzheng Chen (Université de Toronto) · Tommy Xiang (Université de Toronto) · Alec Jacobson (Université de Toronto) · Morgan McGuire (NVIDIA) · Sanja Fidler (Vector Institute/Université de Toronto/NVIDIA)
*Recherche effectuée pour NVIDIA
La représentation de formes 3D adaptée à la reconstruction 3D par apprentissage automatique constitue un problème ouvert en apprentissage machine et en infographie. Les travaux antérieurs sur la reconstruction 3D neuronale ont démontré les avantages, mais aussi les limites, des représentations par nuages de points, voxels, maillages de surface et fonctions implicites. Nous introduisons les Maillages tétraédriques déformables (DEFTET) comme paramétrisation particulière utilisant des maillages tétraédriques volumétriques pour la reconstruction. Contrairement aux approches volumétriques existantes, DEFTET optimise à la fois le placement et l'occupation des sommets, et est différentiable par rapport aux fonctions de perte standard de reconstruction 3D. Il est ainsi simultanément de haute précision, volumétrique et compatible avec les architectures neuronales basées sur l'apprentissage. Nous montrons qu'il peut représenter des topologies complexes et arbitraires, qu'il est efficace en termes de mémoire et de calcul, et qu'il peut produire des reconstructions haute fidélité avec une taille de grille nettement inférieure à celle des autres approches volumétriques. Les surfaces prédites sont également intrinsèquement définies comme des maillages tétraédriques et ne nécessitent donc aucun post-traitement. Nous démontrons que DEFTET égale, voire surpasse, la qualité des meilleures approches précédentes et les performances des plus rapides. Notre approche permet d'obtenir des maillages tétraédriques de haute qualité, calculés directement à partir de nuages de points bruités. Elle est la première à présenter des résultats de maillage tétraédrique 3D de haute qualité à partir d'une seule image.
Apprentissage de graphes de croyances dynamiques pour généraliser aux jeux textuels
Ashutosh Adhikari (Université de Waterloo) · Xingdi Yuan (Microsoft Research) · Marc-Alexandre Côté (Microsoft Research) · Mikuláš Zelinka (Université Charles, Faculté de mathématiques et de physique) · Marc-Antoine Rondeau (Microsoft Research) · Romain Laroche (Microsoft Research) · Pascal Poupart (Université de Waterloo/RBC Borealis AI/Institut Vector) · Jian Tang (Mila) · Adam Trischler (Microsoft) · Will Hamilton (McGill)
Jouer à des jeux textuels exige des compétences en traitement du langage naturel et en prise de décision séquentielle. Atteindre un niveau de performance comparable à celui des humains dans ce type de jeux reste un défi, et les recherches antérieures se sont principalement appuyées sur des représentations structurées et des heuristiques élaborées manuellement. Dans ce travail, nous décrivons une nouvelle technique de planification et de généralisation dans les jeux textuels, utilisant des représentations structurées en graphes apprises de bout en bout à partir du texte brut.
Jorge Mendez (Université de Pennsylvanie), Boyu Wang (Université de Western Ontario/Institut Vector), Eric Eaton (Université de Pennsylvanie)
Les méthodes de gradient de politique ont démontré leur efficacité pour l'apprentissage de politiques de contrôle dans les systèmes dynamiques de grande dimension. Leur principal inconvénient est l'exploration importante nécessaire avant d'obtenir des politiques performantes. Dans un contexte d'apprentissage continu, où un agent est confronté à de multiples tâches consécutives tout au long de sa vie, la réutilisation des informations issues des tâches précédemment effectuées peut considérablement accélérer l'apprentissage de nouvelles tâches. Nous proposons une méthode novatrice d'apprentissage continu par gradient de politique qui entraîne directement des approximants de fonctions via les gradients de politique, permettant ainsi à l'agent de bénéficier des connaissances accumulées tout au long du processus d'entraînement. Nous démontrons empiriquement que notre algorithme apprend plus rapidement et converge vers de meilleures politiques que les méthodes de référence pour une tâche unique et l'apprentissage continu, et qu'il évite complètement l'oubli catastrophique dans divers domaines complexes.
LoCo : Apprentissage des représentations contrastives locales*
Yuwen Xiong (Uber ATG/Université de Toronto), Mengye Ren (Université de Toronto/Uber ATG), Raquel Urtasun (Uber ATG/Vector Institute)
*Recherche effectuée pour Uber ATG
Les réseaux de neurones profonds utilisent généralement la rétropropagation de bout en bout pour apprendre les poids, une procédure qui impose des contraintes de synchronisation lors de la mise à jour des poids entre les couches et qui n'est pas biologiquement plausible. Les progrès récents en matière d'apprentissage non supervisé de représentations contrastives soulèvent la question à savoir si un algorithme d'apprentissage peut également être local, c'est-à-dire que les mises à jour des couches inférieures ne dépendent pas directement du calcul des couches supérieures. Bien que Greedy InfoMax apprenne chaque bloc séparément avec un objectif local, nous avons constaté qu'il nuit systématiquement à la précision de lecture des algorithmes d'apprentissage non supervisé de pointe en matière d'apprentissage contrastif, probablement en raison de l'objectif glouton et de l'isolement du gradient. Dans ce travail, nous découvrons qu'en superposant des blocs locaux, nous augmentons efficacement la profondeur du décodeur et permettons aux blocs supérieurs d'envoyer implicitement des rétroactions aux blocs inférieurs. Cette conception simple comble pour la première fois l'écart de performance entre l'apprentissage local et les algorithmes d'apprentissage contrastif de bout en bout. Outre les expériences ImageNet standard, nous présentons également des résultats sur des tâches en aval complexes telles que la détection d'objets et la segmentation d'instances directement à l'aide de caractéristiques de lecture.
Modélisation des processus stochastiques continus avec des flux normalisants dynamiques
Ruizhi Deng (Université Simon Fraser), Bo Chang (Borealis AI), Marcus Brubaker (Borealis AI/Vector Institute), Greg Mori (Borealis AI), Andreas Lehrmann (Borealis AI)
Les flux normalisateurs transforment une distribution de base simple en une distribution cible complexe et se sont avérés être des modèles performants pour la génération de données et l'estimation de la densité. Dans ce travail, nous proposons un nouveau type de flux normalisateur piloté par une déformation différentielle du processus de Wiener. Nous obtenons ainsi un modèle de séries temporelles riche dont le processus observable hérite de nombreuses propriétés intéressantes de son processus de base, comme le calcul efficace des vraisemblances et des marginales. De plus, notre traitement continu offre un cadre naturel pour les séries temporelles irrégulières avec un processus d'arrivée indépendant, incluant une interpolation directe. Nous illustrons les propriétés avantageuses du modèle proposé sur des processus stochastiques courants et démontrons sa flexibilité supérieure aux modèles de référence RNN variationnels et EDO latents dans une série d'expériences sur des données synthétiques et réelles.
MuSCLE : Compression multibalayage de LiDAR utilisant des modèles d'entropie profonde*
Sourav Biswas (Université de Waterloo), Jerry Liu (Uber ATG), Kelvin Wong (Université de Toronto), Shenlong Wang (Université de Toronto), Raquel Urtasun (Uber ATG/Institut Vector)
*Recherche effectuée pour Uber ATG
Nous présentons un nouvel algorithme de compression pour réduire l'espace de stockage des flux de données de capteurs LiDAR. Notre modèle exploite les relations spatio-temporelles entre plusieurs balayages LiDAR afin de réduire le débit binaire des valeurs géométriques et d'intensité. À cette fin, nous proposons un nouveau modèle d'entropie conditionnelle qui modélise les probabilités des symboles de l'octree en considérant à la fois la géométrie globale et les informations géométriques et d'intensité des balayages précédents. Nous utilisons ensuite la probabilité apprise pour encoder le flux de données complet en un flux compact. Nos expériences démontrent que notre méthode réduit significativement le débit binaire combiné de la géométrie et de l'intensité par rapport aux méthodes de compression LiDAR de pointe, avec une réduction de 7 à 17 % sur les ensembles de données UrbanCity et de 15 à 35 % sur les ensembles de données SemanticKITTI.
Ye He (Université de Californie à Davis), Krishnakumar Balasubramanian (Université de Californie à Davis), Murat Erdogdu (Université de Toronto/Institut Vector)
La méthode du point médian aléatoire s'est imposée comme une procédure optimale pour l'échantillonnage par diffusion à partir d'une distribution de probabilité. Cet article analyse plusieurs propriétés probabilistes de cette méthode, en établissant sa normalité asymptotique et en soulignant ses avantages et inconvénients par rapport à d'autres méthodes. Les résultats présentés ici offrent un nouvel éclairage sur le comportement de la méthode de discrétisation par point médian aléatoire, notamment en permettant d'obtenir des intervalles de confiance pour les intégrations numériques.
Les auto-encodeurs linéaires régularisés finissent par récupérer les composantes principales.
Xuchan Bao (Université de Toronto/Institut Vector), James Lucas (Université de Toronto/Institut Vector), Sushant Sachdeva (Université de Toronto/Institut Vector), Roger Grosse (Université de Toronto/Institut Vector)
Il est établi depuis longtemps que les auto-encodeurs reconstruisent le sous-espace des composantes principales (celui qui maximise la variance projetée des données). Nous montrons qu'avec un régulariseur particulier, ils reconstruisent les composantes principales individuelles, et pas seulement le sous-espace. Cependant, cette reconstruction est très lente ; nous analysons les raisons de cette lenteur et proposons une procédure d'entraînement alternative qui permet une reconstruction plus efficace des composantes.
Mahdi Haghifam (Université de Toronto/Vector Institute), Jeffrey Negrea (Université de Toronto/Vector Institute), Ashish Khisti (Université de Toronto), Daniel Roy (Université de Toronto/Vector Institute), Gintare Karolina Dziugaite (Element AI)
Aucune théorie de généralisation existante pour l'algorithme de Langevin ne permet de relier son comportement réel à de fortes performances de généralisation. En s'appuyant sur de nouvelles notions d'information mutuelle conditionnelle, nous présentons de nouvelles bornes qui fournissent des bornes de généralisation non triviales, même pour CIFAR10.
Complétion d'objet amodale variationnelle *
Huan Ling (Université de Toronto, NVIDIA) · David Acuna (Université de Toronto, NVIDIA) · Karsten Kreis (NVIDIA) · Seung Wook Kim (Université de Toronto) · Sanja Fidler (Institut Vector/Université de Toronto/NVIDIA)
*Recherche effectuée pour NVIDIA
Dans les images de scènes complexes, les objets s'occultent souvent mutuellement, ce qui rend difficiles les tâches de perception telles que la détection et le suivi d'objets, ou les tâches de contrôle robotique telles que la planification. Pour faciliter les tâches en aval, il est donc important de raisonner sur l'étendue complète des objets, c'est-à-dire de voir au-delà des occultations, ce qu'on appelle généralement la complétion d'instances amodales. Dans cet article, nous proposons un cadre génératif variationnel pour la complétion amodale, appelé Amodal-VAE, qui ne nécessite aucune étiquette amodale lors de l'entraînement, car il est capable d'utiliser des masques d'instances d'objets largement disponibles. Nous illustrons notre approche de la tâche en aval d'édition de scènes, où l'utilisateur dispose d'outils interactifs pour compléter et effacer des objets dans des photographies. Des expériences sur des scènes de rue complexes démontrent des performances de pointe en matière de complétion de masques amodaux et présentent des résultats d'édition de scènes de haute qualité. Fait intéressant, une étude utilisateur montre que les humains préfèrent les complétions d'objets inférées par notre modèle à celles étiquetées par des humains.
Wavelet Flow : Entraînement rapide de flux normalisants haute résolution
Jason Yu (Université York), Konstantinos Derpanis (Université Ryerson/Institut Vector), Marcus Brubaker (Université York/Institut Vector)
Les méthodes de normalisation des flux se sont traditionnellement limitées à la génération d'images à basse résolution en raison du coût de l'entraînement. Nous présentons une nouvelle méthode basée sur les ondelettes, permettant un entraînement efficace sur des images haute résolution. Nous démontrons qu'elle permet l'entraînement sur des images haute résolution (par exemple, 1024 × 1024) et qu'elle accélère significativement l'entraînement sur des jeux de données standard à basse résolution. De plus, elle intègre automatiquement des modèles d'images basse résolution et peut effectuer une super-résolution sans effort supplémentaire grâce à la nature multi-échelle de la représentation par ondelettes.
Sana Tonekaboni (Université de Toronto/Institut Vector), Shalmali Joshi (Institut Vector), Kieran Campbell (Université de la Colombie-Britannique/Institut Vector), David Duvenaud (Université de Toronto/Institut Vector), Anna Goldenberg (Institut Vector/Hôpital pour enfants malades)
L'explication des prédictions des modèles est cruciale, notamment dans des domaines complexes comme le suivi des séries temporelles dans les soins aux patients. L'explicabilité des séries temporelles demeure un domaine relativement peu exploré dans la littérature sur l'apprentissage automatique. Nous proposons un nouveau cadre pour expliquer les modèles de type « boîte noire » en attribuant une importance aux observations en fonction de leur influence sur la prédiction du modèle. Contrairement aux approches précédentes, notre méthode tient compte de la dynamique temporelle. Il s'agit d'un des premiers travaux à explorer l'attribution de caractéristiques et l'explicabilité des modèles de séries temporelles. Nous prévoyons une forte pertinence dans le domaine de la santé et explorons actuellement diverses applications.
Les chercheurs de l'Institut Vector organisent quatre ateliers
« Les musulmans dans le ML » est un atelier d'échange organisé par Marzyeh Ghassemi et ses collaborateurs. Il portera sur les perspectives d’avancement et les risques pour les musulmans et les personnes vivant dans des pays à majorité musulmane qui s’identifient religieusement, partagent une appartenance culturelle ou sont considérées comme « musulmanes » par proximité géographique.
L'événement Machine Learning for Health (ML4H) : Advance Healthcare for All , coorganisé par Anna Goldenberg, exposera les participants à de nouvelles questions en matière d'apprentissage machine pour les soins de santé et les incitera à réfléchir à la manière dont leur travail s'inscrit dans des systèmes de santé plus vastes.
Le colloque « Machine Learning and the Physical Sciences » , organisé par Juan Carrasquilla, réunit des informaticiens, des mathématiciens et des physiciens intéressés par l'application de l'apprentissage automatique à divers problèmes physiques remarquables.
« Parler à des inconnus : la communication émergente sans exemple » est un atelier interactif coorganisé par Jakob Foerster. Son objectif est d'explorer les possibilités offertes aux agents artificiels de développer spontanément une communication ad hoc, en interagissant avec des inconnus.
Le projet « Learning Meaningful Representations of Life » (LMRL.org), coorganisé par Alán Aspuru-Guzik, vise à réunir des stagiaires et des experts en apprentissage automatique avec ceux qui sont à la fine pointe de la recherche biologique actuelle afin de percer les secrets des systèmes biologiques.