Les chercheurs travaillant sur les vecteurs remportent les plus hautes distinctions à NeurIPS 2018

4 décembre 2018

Rechercher

Les professeurs et les étudiants de Vector ont collaboré et remporté deux des quatre prix du meilleur article et un prix du meilleur article étudiant à NeurIPS 2018, la plus importante conférence mondiale sur l'apprentissage automatique.

David Duvenaud, cofondateur et membre du corps professoral de Vector, et les étudiants de Vector, Jesse Bettencourt, Yulia Rubanova et Ricky Chen, tous de l'Université de Toronto, sont les auteurs de « Neural Ordinary Differential Equations » et ont reçu le prix du meilleur article à NeurIPS 2018.

De plus, Will Grathwohl, Ricky Chen et Jesse Bettencourt ont reçu un deuxième prix lorsqu'ils ont remporté le prix du meilleur article étudiant lors de l'atelier Advances in Approximate Bayesian Inference en collaboration avec David Duvenaud et Ilya Sutskever.

Shai Ben-David, l'un des plus récents membres du corps professoral de Vector à l'Université de Waterloo, et Hassan Ashtiani, affilié postdoctoral de Vector, ainsi que leurs collaborateurs, ont également remporté les plus hautes distinctions avec le prix du meilleur article pour leur article intitulé « Limites de complexité d'échantillon quasi serrées pour l'apprentissage de mélanges de gaussiennes via des schémas de compression d'échantillon » .

La trente-deuxième conférence annuelle sur les systèmes de traitement de l'information neuronale (NeurIPS) a débuté ce dimanche à Montréal. NeurIPS est une conférence multi-sessions consacrée à l'apprentissage machine et aux neurosciences computationnelles. Elle offre des conférences invitées, des démonstrations, des symposiums ainsi que des présentations orales et par affiche d'articles évalués par des pairs.

Meilleur article 

Limites de complexité d'échantillonnage quasi optimales pour l'apprentissage de mélanges de gaussiennes via des schémas de compression d'échantillons

Par Hassan Ashtiani, Shai Ben-David, Nicholas Harvey, Christopher Liaw, Abbas Mehrabian, Yaniv Plan

Abstrait:

Nous démontrons que ϴ(kd²/ε²) échantillons sont nécessaires et suffisants pour l'apprentissage d'un mélange de k gaussiennes dans R^d, à une erreur ε près sur la distance de variation totale. Cela améliore les bornes supérieure et inférieure connues pour ce problème. Pour les mélanges de gaussiennes alignées sur les axes, nous montrons que O(kd/ε²) échantillons suffisent, ce qui correspond à une borne inférieure connue.

La borne supérieure repose sur une technique novatrice d'apprentissage de distributions, basée sur une notion de compression d'échantillons. Toute catégorie de distributions admettant une telle compression peut être apprise avec un nombre réduit d'échantillons. De plus, si une classe de distributions admet une telle compression, il en va de même pour les classes de produits et de mélanges de ces distributions. Notre résultat principal démontre que la classe des gaussiennes dans R^d admet une compression d'échantillons efficace.

Papier | Affiche

Meilleur article

Équations différentielles neuronales ordinaires

Par Ricky Chen*, Yulia Rubanova*, Jesse Bettencourt*, David Duvenaud (*contribution égale)

Abstrait:

Nous introduisons une nouvelle famille de modèles de réseaux de neurones profonds. Au lieu de spécifier une séquence discrète de couches cachées, nous paramétrons la dérivée de l'état caché à l'aide d'un réseau de neurones. La sortie du réseau est calculée par un solveur d'équations différentielles à boîte noire. Ces modèles à profondeur continue ont un coût mémoire constant, adaptent leur stratégie d'évaluation à chaque entrée et peuvent optimiser la précision numérique au profit de la vitesse. Nous démontrons ces propriétés dans des réseaux résiduels à profondeur continue et des modèles à variables latentes à temps continu. Nous construisons également des flux normalisants continus, un modèle génératif pouvant être entraîné par le maximum de vraisemblance, sans partitionnement ni ordonnancement des dimensions des données. Pour l'entraînement, nous montrons comment effectuer une rétropropagation à grande échelle à travers n'importe quel solveur d'équations différentielles ordinaires, sans accès à ses opérations internes. Cela permet l'entraînement de bout en bout d'équations différentielles ordinaires au sein de modèles plus vastes.

Papier

Meilleur article étudiant 

Symposium sur les progrès en matière d'inférence bayésienne approximative 2018. Présentation orale

FFJORD : Dynamique continue de forme libre pour les modèles génératifs réversibles et évolutifs

Par Will Grathwohl*, Ricky TQ Chen*, Jesse Bettencourt, Ilya Sutskever et David Duvenaud. (*contribution égale)

Abstrait:

Une classe prometteuse de modèles génératifs transforme les points d'une distribution simple en une distribution complexe grâce à un réseau neuronal inversible. L'apprentissage de ces modèles par vraisemblance nécessite de contraindre leur architecture afin de permettre un calcul rapide des déterminants jacobiens. Alternativement, la trace jacobienne peut être utilisée si la transformation est définie par une équation différentielle ordinaire. Dans cet article, nous utilisons l'estimateur de trace de Hutchinson pour obtenir une estimation sans biais et évolutive de la log-densité. Il en résulte un modèle génératif inversible à temps continu avec une estimation de densité sans biais et un échantillonnage en une seule passe, tout en autorisant des architectures de réseaux de neurones non restreintes. Nous illustrons notre approche par l'estimation de la densité en grande dimension, la génération d'images et l'inférence variationnelle, atteignant ainsi des performances de pointe parmi les méthodes de vraisemblance exacte avec un échantillonnage efficace.

Papier