Les chercheurs travaillant sur les vecteurs présenteront plus de 50 articles à NeurIPS 2021.

30 novembre 2021

Rechercher

30 novembre 2021
Par Ian Gormely

Les chercheurs de Vector se préparent à nouveau pour la conférence virtuelle NeurIPS (Neural Information Processing Systems). Cette année, la conférence aura lieu en ligne du 6 au 14 décembre. Les articles présentés par les professeurs de Vector exploreront de nouvelles pistes dans différents domaines de la recherche en intelligence artificielle, notamment l'apprentissage profond, l'apprentissage par renforcement, la vision par ordinateur et l'IA responsable. Ces travaux pourraient avoir un impact considérable sur de nombreux aspects de la vie quotidienne et du travail, de l'architecture à la santé. 

Les nouveaux travaux de Graham Taylor, directeur de recherche par intérim chez Vector, ont particulièrement retenu l'attention, car ils associaient les efforts de son équipe à ceux du chercheur Jungtaek Kim, rencontré lors de la conférence NeurIPS de l'année précédente. Les deux présentaient des travaux liés aux jouets de construction LEGO.

Cette année, l'équipe canado-coréenne, composée notamment de Boris Knyazev, chercheur chez Vector, et de Hyunsoo Chung, Jinhwi Lee, Jaesik Park et Minsu Cho, chercheurs chez POSTECH, présente un nouvel article sur les briques LEGO, intitulé « Brique par brique : construction combinatoire avec apprentissage par renforcement profond ». Dans cet article, ils utilisent l'apprentissage par renforcement pour construire une structure en briques LEGO à partir d'une photo. Ce modèle pourrait permettre de créer des plans architecturaux à partir d'images ou de rendus.

D’autres travaux remarquables sont à mettre au crédit de Richard Zemel, directeur de recherche chez Vector (actuellement en congé) , et d’ Ali Reza Makhzani , membre du corps professoral. Avec leurs co-auteurs Kuan-Chieh Wang, Yan Fu, Ke Li et Ashish J Khisti, ils étudient la vulnérabilité des réseaux neuronaux face aux attaques par inversion de modèle, susceptibles de révéler des données d'entraînement à des utilisateurs non autorisés. Leur article, intitulé « Attaques par inversion de modèle variationnelle », examine comment améliorer la précision de ces attaques afin que les données révélées soient à la fois réalistes et diversifiées. Leurs travaux pourraient avoir un impact significatif sur les questions de confidentialité liées à l'apprentissage machine, en particulier dans le domaine de la santé.

Finalement, Chris Maddison, membre du corps professoral de Vector, et Yann Dubois, stagiaire chez Vector, en collaboration avec Benjamin Bloem-Reddy et Karen Ullrich, ont mis au point un nouveau paradigme de compression pour les données traitées par des algorithmes et non visualisées par des humains. Dans leur article intitulé « Compression avec perte pour une prédiction sans perte », ils présentent un modèle mille fois plus performant que le JPEG pour la compression d'images. La réduction de la taille des données pourrait permettre aux jeunes entreprises et aux petites institutions de travailler avec d'importants volumes de données, actuellement soumis à des ressources de calcul extrêmement coûteuses.

Vous trouverez ci-dessous des résumés et des résumés simplifiés de nombreux articles et ateliers acceptés par les membres du corps professoral de Vector. 

Vous pouvez en savoir plus sur le travail de Vector lors des conférences des années précédentes ici (2020) , ici (2019) et ici (2018) .

Analyse de la descente de gradient stochastique à pas constant en régime non convexe : normalité asymptotique et biais
Lu Yu, Krishnakumar Balasubramanian, Stanislav Volgushev, Murat A. Erdogdu
Les problèmes d'apprentissage structurés non convexes, pour lesquels les points critiques présentent des propriétés statistiques favorables, sont fréquents en apprentissage automatique statistique. La convergence algorithmique et les taux d'estimation statistique sont bien compris pour ces problèmes. Cependant, la quantification de l'incertitude associée à l'algorithme d'apprentissage sous-jacent reste peu étudiée dans le contexte non convexe. Afin de pallier cette lacune, nous établissons dans ce travail un résultat de normalité asymptotique pour l'algorithme de descente de gradient stochastique (SGD) à pas constant, un algorithme largement utilisé en pratique. Plus précisément, en nous basant sur la relation entre le SGD et les chaînes de Markov [DDB19], nous montrons que la moyenne des itérations du SGD suit asymptotiquement une loi normale autour de l'espérance de leur unique distribution invariante, pourvu que la fonction objectif non convexe et non lisse satisfasse une propriété de dissipativité. Nous caractérisons aussi le biais entre cette espérance et les points critiques de la fonction objectif sous différentes conditions de régularité locale. Ensemble, les deux résultats ci-dessus pourraient être utilisés pour construire des intervalles de confiance pour les problèmes non convexes entraînés à l'aide de l'algorithme SGD.

Mes systèmes d'apprentissage profond sont-ils justes ? Une étude empirique de l'entraînement à graine fixe
Shangshu Qian, Hung Viet Pham, Thibaud Lutellier, Zeou Hu, Jungwon Kim, Lin Tan, Yaoliang Yu, Jiahao Chen, Sameena Shah
Les systèmes d'apprentissage profond (DL) sont de plus en plus utilisés pour des tâches critiques telles que l'évaluation du crédit et la prédiction de la criminalité. Ces systèmes exigent de l'équité. Des travaux récents montrent que les implémentations logicielles de DL introduisent de la variance : des entraînements DL identiques (réseau, données, configuration, logiciel et matériel identiques) avec une valeur initiale fixe produisent des modèles différents. Cette variance pourrait rendre les modèles et les réseaux DL non conformes aux lois sur l'équité, avec des conséquences sociales négatives. Nous menons la première étude empirique visant à quantifier l'impact de l'implémentation logicielle sur l'équité et sa variance dans les systèmes DL. Notre étude, portant sur 22 techniques d'atténuation et cinq méthodes de référence, révèle une variance d'équité pouvant atteindre 12,6 % entre des entraînements identiques avec des valeurs initiales identiques. De plus, la plupart des algorithmes de correction des biais ont un impact négatif sur le modèle, notamment en réduisant sa précision, en augmentant la variance d'équité ou en augmentant la variance de précision. Notre analyse de la littérature montre que, malgré l'intérêt croissant pour l'équité dans les conférences sur l'intelligence artificielle (IA), seulement 34,4 % des articles utilisent plusieurs entraînements identiques pour évaluer leur approche, ce qui soulève des questions quant à la validité de leurs résultats. Nous demandons de meilleurs protocoles d'évaluation et de test de l'équité afin d'améliorer l'équité et la variance de l'équité des systèmes d'apprentissage profond, ainsi que la validité et la reproductibilité de la recherche en apprentissage profond en général.

ATISS : Transformateurs autorégressifs pour la synthèse de scènes d'intérieur
Despoina Paschalidou, Amlan Kar, Maria Shugrina, Karsten Kreis, Andreas Geiger, Sanja Fidler
La capacité de synthétiser automatiquement ou à partir d'informations partielles des agencements de mobilier intérieur réalistes et variés ouvre la voie à de nombreuses applications, allant de l'amélioration des outils 3D interactifs à la synthèse de données pour l'entraînement et la simulation. Dans cet article, nous présentons ATISS, une nouvelle architecture de transformateur autorégressive permettant de créer des environnements intérieurs synthétiques diversifiés et plausibles, à partir du seul type de pièce et de son plan. Contrairement aux travaux antérieurs qui conçoivent la synthèse de scènes comme une génération de séquences, notre modèle génère les pièces comme des ensembles non ordonnés d'objets. Nous soutenons que cette formulation est plus naturelle, car elle rend ATISS utile au-delà de la simple synthèse automatique d'agencements de pièces. Par exemple, le même modèle entraîné peut être utilisé dans des applications interactives pour compléter des scènes, réorganiser partiellement des pièces avec les objets spécifiés par l'utilisateur, et suggérer des objets pour toute pièce incomplète. Pour ce faire, notre modèle exploite l'équivariance par permutation du transformateur lors du conditionnement sur la scène partielle, et est entraîné pour être invariant par permutation quel que soit l'ordre des objets. Notre modèle est entraîné de bout en bout comme un modèle génératif autorégressif, utilisant uniquement des boîtes englobantes 3D étiquetées comme supervision. Les évaluations effectuées sur quatre types de pièces de l'ensemble de données 3D-FRONT démontrent que notre modèle génère de manière constante des agencements de pièces plausibles et plus réalistes que les méthodes existantes. De plus, il comporte moins de paramètres, est plus facile à mettre en œuvre et à entraîner, et son exécution est jusqu'à huit fois plus rapide.

Construction combinatoire par brique avec apprentissage par renforcement profond
Hyunsoo Chung, Jungtaek Kim, Boris Knyazev, Jinhwi Lee, Graham W. Taylor, Jaesik Park, Minsu Cho
L'équipe du Vector Institute, dirigée par le directeur de recherche intérimaire Graham Taylor, démontre une fois de plus que les ordinateurs peuvent aussi jouer aux LEGO. L'année dernière, lors de l'atelier NeurIPS sur l'apprentissage machine pour la modélisation, la simulation et la conception en ingénierie, l'équipe a présenté un modèle génératif de graphes capables d'apprendre à partir de différents types de structures LEGO créées par l'homme et de proposer ses propres créations . C'est là qu'ils ont rencontré Jungtaek Kim, étudiant à POSTECH, qui présentait par ailleurs ses propres travaux sur les LEGO . Les deux équipes ont décidé d'unir leurs forces et Kim a fait un stage au Vector Institute. Dans un article qui sera présenté à NeurIPS, l'équipe coréano-canadienne propose une nouvelle formulation du problème de la construction LEGO grâce à l'apprentissage par renforcement profond. Dans « Brick-by-Brick », un agent d'apprentissage par renforcement pour la construction LEGO accepte une connaissance incomplète de la cible souhaitée sous la forme d'une image, au lieu de construire à partir de zéro. L'innovation majeure de ce travail réside dans la gestion d'un grand nombre d'actions de construction invalides susceptibles de compromettre l'intégrité d'une construction. Ce travail a des implications pour la conception architecturale, où l'inspiration peut être suggérée par une photo ou un rendu et où l'agent élabore un plan réalisable qui respecte les contraintes complexes du monde réel.

Caractérisation de la généralisation sous l'effet de décalages hors distribution dans l'apprentissage métrique profond
Timo Milbich, Karsten Roth, Samarth Sinha, Ludwig Schmidt, Marzyeh Ghassemi, Björn Ommer
L'apprentissage métrique profond (DML) vise à apprendre des espaces de représentation dans lesquels une métrique prédéfinie (par exemple, la distance euclidienne) relie la similarité sémantique des données d'entrée de manière à permettre le regroupement d'échantillons de classes non vues lors de l'apprentissage, en fonction de leur similarité intrinsèque, même en présence de décalages sémantiques hors distribution. Cependant, les benchmarks standards utilisés pour évaluer les capacités de généralisation des différentes méthodes DML utilisent des ensembles d'entraînement et de test fixes, et donc des décalages fixes entre ces ensembles. Ou, en pratique, le décalage lors du test n'est pas connu a priori ; par conséquent, la configuration d'évaluation par défaut est insuffisante pour évaluer l'utilisabilité pratique des différentes méthodes DML. Pour remédier à ce problème, nous proposons un nouveau protocole permettant de générer des séquences de décalages sémantiques de plus en plus difficiles pour des ensembles d'entraînement et de test donnés, afin d'évaluer les performances de généralisation des méthodes DML dans des scénarios plus réalistes avec différents décalages entre les ensembles d'entraînement et de test. Ensuite, nous proposons une évaluation approfondie des approches conceptuelles du DML et de leurs avantages ou inconvénients face aux décalages train-test de difficulté variable, nous étudions les liens avec les métriques structurelles en tant qu'indicateurs potentiels des performances de généralisation en aval et nous introduisons le DML à peu d'exemples comme un remède économique pour une généralisation constamment améliorée dans des décalages OOD plus sévères.

Codeurs variationnels à mécanisme d'horlogerie automatique
Vaibhav Saxena, Jimmy Ba, Danijar Hafner
L'apprentissage profond a permis aux algorithmes de générer des images réalistes. Cependant, la prédiction précise de longues séquences vidéo exige la compréhension des dépendances à long terme et demeure un défi. Si les modèles de prédiction vidéo existants parviennent à générer des images nettes, ils ont souvent du mal à prédire avec précision les événements futurs. Nous présentons Clockwork VAE (CW-VAE), un modèle de prédiction vidéo qui exploite une hiérarchie de séquences latentes, les niveaux supérieurs s'incrémentant à des intervalles plus lents. Nous démontrons les avantages de la hiérarchie des séquences latentes et de l'abstraction temporelle sur quatre ensembles de données de prédiction vidéo variés, comportant des séquences allant jusqu'à 1 000 images. CW-VAE surpasse ainsi les meilleurs modèles de prédiction vidéo. De plus, nous offrons un banc d'essai Minecraft pour la prédiction vidéo à long terme. Plusieurs expériences nous ont permis de mieux comprendre le fonctionnement de CW-VAE et de confirmer que les niveaux les plus lents apprennent à représenter les objets qui évoluent plus lentement dans la vidéo, tandis que les niveaux les plus rapides apprennent à représenter les objets qui évoluent plus rapidement.

Taux de convergence de la descente de gradient stochastique en présence d'une variance de bruit infinie
Hongjian Wang, Mert Gürbüzbalaban, Lingjiong Zhu, Umut Şimşekli, Murat A. Erdogdu
Des études récentes ont fourni des preuves empiriques et théoriques illustrant l'apparition de queues de distribution épaisses dans la descente de gradient stochastique (SGD) sous différents scénarios. Ces queues épaisses peuvent engendrer des itérations à variance divergente, ce qui limite l'utilisation des techniques d'analyse de convergence classiques reposant sur l'existence des moments d'ordre deux. Dans cet article, nous proposons des garanties de convergence pour la SGD en présence d'un bruit à queue épaisse, dépendant de l'état et de variance potentiellement infinie, pour une classe de fonctions objectives fortement convexes. Lorsque le moment d'ordre p du bruit existe pour un certain p ∈ [1, 2), nous identifions d'abord une condition sur la matrice hessienne, appelée « p-positivité (semi-)définie », qui permet une interpolation intéressante entre les matrices semi-définies positives (p = 2) et les matrices à diagonale dominante non négative (p = 1). Dans cette condition, nous établissons ensuite un taux de convergence pour la distance à l'optimum global dans Lp. De plus, nous présentons un théorème central limite généralisé, qui démontre que la moyenne de Polyak-Ruppert, correctement normalisée, converge faiblement vers un vecteur aléatoire multivarié α-stable. Nos résultats indiquent que, même en présence d'un bruit à queue lourde et de variance infinie, la descente de gradient stochastique (SGD) peut converger vers l'optimum global sans qu'il soit nécessaire de modifier la fonction de perte ni l'algorithme lui-même, contrairement aux exigences habituelles en statistique robuste. Nous illustrons les implications de nos résultats pour des applications telles que la régression linéaire et les modèles linéaires généralisés soumis à des données à queue lourde.

Tétraèdres à marche profonde : une représentation hybride pour la synthèse de formes 3D haute résolution
Tianchang Shen, Jun Gao, Kangxue Yin, Ming-Yu Liu, Sanja Fidler
Nous présentons DMTet, un modèle génératif conditionnel 3D profond capable de synthétiser des formes 3D haute résolution à partir de guides simples, tels que des voxels grossiers. Il combine les avantages des représentations 3D implicites et explicites grâce à une nouvelle représentation 3D hybride. Contrairement aux approches implicites actuelles, entraînées à régresser les valeurs de distance signée, DMTet optimise directement la surface reconstruite, ce qui permet de synthétiser des détails géométriques plus fins avec moins d'artefacts. Contrairement aux modèles génératifs 3D profonds qui génèrent directement des représentations explicites, comme des maillages, notre modèle peut synthétiser des formes à topologie arbitraire. Le cœur de DMTet comprend une grille tétraédrique déformable qui encode une fonction de distance signée discrétisée et une couche de tétraèdres différentiables qui convertit la représentation implicite de la distance signée en une représentation explicite du maillage de surface. Cette combinaison permet l'optimisation conjointe de la géométrie et de la topologie de la surface, ainsi que la génération de la hiérarchie des subdivisions à l'aide de pertes de reconstruction et d'adversité définies explicitement sur le maillage de surface. Notre approche surpasse nettement les travaux existants sur la synthèse de formes conditionnelles à partir d'entrées voxel grossières, entraînée sur un ensemble de données de formes animales 3D complexes. Page du projet : cette URL.

Démystifier et généraliser BinaryConnect
Tim Dockhorn, Yaoliang Yu, Eyyüb Sari, Mahdi Zolnouri, Vahid Partovi Nia
BinaryConnect (BC) et ses nombreuses variantes sont devenus la norme de facto pour la quantification des réseaux de neurones, essentielle pour réduire la consommation d'énergie et permettre le déploiement sur des appareils aux ressources limitées. Malgré son succès empirique, BC est resté en grande partie un simple truc d'entraînement, et son fonctionnement interne reste encore mal compris. Dans ce travail, nous montrons qu'une extension de BC est une modification non convexe de l'algorithme du gradient conditionnel généralisé, ce qui nous permet d'établir facilement ses propriétés de convergence. Nous présentons également une théorie rigoureuse pour la construction de quantificateurs proximaux qui transforment progressivement les poids continus en poids discrets. Pour la première fois, en nous basant sur nos résultats théoriques, nous justifions rigoureusement le paramètre de divergence dans les quantificateurs proximaux, qui constituait jusqu'à présent une incohérence entre la théorie et la pratique.

DIB-R++ : Apprendre à prédire l'éclairage et les matériaux avec un moteur de rendu différentiable hybride
Wenzheng Chen, Joey Litalien, Jun Gao, Zian Wang, Clement Fuji Tsang, Sameh Khamis ou Litany, Sanja Fidler
Nous abordons le problème complexe de la prédiction des propriétés intrinsèques d'un objet à partir d'une seule image, en exploitant des moteurs de rendu différentiables. De nombreuses approches d'apprentissage automatique pour l'infographie inverse utilisent des moteurs de rendu basés sur la rastérisation et supposent des modèles d'éclairage et de matériaux simplistes, qui ne tiennent souvent pas compte des réflexions spéculaires non lambertiennes fréquemment observées dans la réalité. Dans ce travail, nous proposons DIBR++, un moteur de rendu différentiable hybride qui prend en charge ces effets photoréalistes en combinant rastérisation et lancer de rayons, tirant parti de leurs atouts respectifs : rapidité et réalisme. Notre moteur de rendu intègre l'éclairage ambiant et des modèles de matériaux spatialement variables pour approximer efficacement le transport de la lumière, soit par estimation directe, soit via des fonctions de base sphériques. Comparé aux moteurs de rendu différentiables physiques plus avancés utilisant le lancer de rayons, DIBR++ est très performant grâce à son modèle d'ombrage compact et expressif, qui permet une intégration facile avec les cadres d'apprentissage pour la prédiction de la géométrie, de la réflectance et de l'éclairage à partir d'une seule image, sans nécessiter de données de référence. Nous démontrons expérimentalement que notre approche permet une séparation supérieure des matériaux et de l'éclairage sur des données synthétiques et réelles par rapport aux approches existantes basées sur la rastérisation et présentons plusieurs applications artistiques, notamment l'édition de matériaux et le rééclairage.

Échantillonnage d'importance de recuit différentiable et les dangers du bruit de gradient
Guodong Zhang, Kyle Hsu, Jianing Li, Chelsea Finn, Roger Grosse
En apprentissage machine, plusieurs de nos algorithmes clés (par exemple, la descente de gradient stochastique) effectuent des mises à jour sur de petits lots de données. Notre expérience montre généralement que les petits lots sont au moins aussi efficaces que les grands (en termes de convergence à l'époque). Nous présentons et analysons un algorithme de mini-lots pour estimer la vraisemblance marginale d'un modèle bayésien. Étonnamment, on constate que (contrairement aux contextes d'optimisation et d'échantillonnage) l'estimateur par mini-lots est inconvergé ; notre analyse met en lumière un obstacle majeur à l'estimation efficace de la vraisemblance marginale.

Apprentissage profond distribué dans le cadre de collaborations ouvertes
Michael Diskin, Alexey Bukhtiyarov, Max Ryabinin, Lucile Saulnier, Quentin Lhoest, Anton Sinitsin, Dmitry Popov, Dmitriy Pyrkin, Maxim Kashirin, Alexander Borzunov, Albert Villanova del Moral, Denis Mazur, Yacine Jernite, Thomas Wolf, Gennady Pekhimenko
L'entraînement des réseaux neuronaux les plus performants exige des ressources de calcul souvent inaccessibles en dehors des grandes organisations, ce qui freine le progrès scientifique. Dans ce travail, nous proposons une approche permettant d'entraîner de grands réseaux neuronaux grâce à des collaborations internationales. Notre méthode DeDLOC s'adapte aux différentes vitesses de connexion, ce qui la rend nettement plus efficace que les méthodes classiques conçues pour les réseaux homogènes. Nous démontrons les avantages de DeDLOC dans des environnements infonuagiques économiques et lors d'une expérience participative, en entraînant un modèle de langage de haute qualité pour le bengali avec 40 participants.

Ne me générez pas : Entraînement de modèles génératifs différentiellement privés avec divergence de Sinkhorn
Tianshi Cao, Alex Bie, Arash Vahdat, Sanja Fidler, Karsten Kreis
Bien que les modèles d'apprentissage automatique entraînés sur des volumes massifs de données aient permis des avancées majeures dans plusieurs domaines, leur déploiement dans les secteurs sensibles à la protection de la vie privée demeure limité en raison de l'accès restreint aux données. Les modèles génératifs entraînés avec des contraintes de confidentialité sur des données privées peuvent contourner cet obstacle, en offrant un accès indirect aux données privées. Nous proposons DP-Sinkhorn, une nouvelle méthode générative basée sur le transport optimal pour l'apprentissage des distributions de données à partir de données privées avec confidentialité différentielle. DP-Sinkhorn minimise la divergence de Sinkhorn, une approximation efficace en termes de calcul de la distance de transport optimale exacte, entre le modèle et les données de manière différentiellement privée, et utilise une technique novatrice pour contrôler le compromis biais-variance des estimations de gradient. Contrairement aux approches existantes pour l'entraînement de modèles génératifs différentiellement privés, qui sont principalement basées sur des réseaux antagonistes génératifs (GAN), nous ne nous appuyons pas sur des objectifs antagonistes, notoirement difficiles à optimiser, en particulier en présence de bruit imposé par les contraintes de confidentialité. Par conséquent, DP-Sinkhorn est facile à entraîner et à déployer. Expérimentalement, nous améliorons l'état de l'art sur plusieurs bancs d'essai de modélisation d'images et démontrons une synthèse différentiellement privée d'images RVB informatives. Page du projet : cette URL.

Drop-DTW : Alignement du signal commun entre les séquences tout en éliminant les valeurs aberrantes
Nikita Dvornik, Isma Hadji, Konstantinos G. Derpanis, Animesh Garg, Allan D. Jepson
Le problème de l'alignement de séquences est central dans de nombreuses applications d'IA, telles que la biologie computationnelle, la vidéo, l'audio ou l'analyse multimodale. S'il est facile d'aligner des signaux « propres », l'alignement de séquences contenant des valeurs aberrantes est plus complexe et peut s'avérer ambigu. Dans ce travail, nous proposons Drop-DTW, un nouvel algorithme d'alignement de séquences avec des valeurs aberrantes intercalées. Drop-DTW offre la solution optimale pour la détection simultanée des valeurs aberrantes et l'alignement des séquences sans valeurs aberrantes, bénéficie d'une implémentation efficace et peut être rendu différentiable. Grâce à Drop-DTW, nous améliorons la tâche générale de recherche de séquences, l'apprentissage de représentations non supervisé et faiblement supervisé, et proposons une nouvelle méthode efficace pour la localisation d'étapes dans les vidéos pédagogiques. Dans toutes les applications, Drop-DTW atteint des performances de pointe.

Goulot d'étranglement dynamique pour une exploration autosupervisée robuste
Chenjia Bai, Lingxiao Wang, Lei Han, Animesh Garg, Jianye Hao, Peng Liu, Zhaoran Wang
Le compromis entre exploration et exploitation représente depuis longtemps un défi majeur en apprentissage par renforcement (RL), notamment pour de nombreuses applications concrètes telles que la conduite autonome. Une approche efficace de l'exploration auto-supervisée consiste à concevoir une récompense intrinsèque dense qui motive l'agent à explorer de nouvelles transitions. Cependant, les méthodes d'exploration existantes deviennent instables lorsque les états sont bruités, par exemple lorsqu'ils contiennent des informations non pertinentes pour la dynamique. Dans les tâches de conduite autonome, par exemple, les états capturés par la caméra peuvent contenir des objets non pertinents, tels que des nuages ​​dont le comportement est semblable au mouvement brownien. Si l'on mesure la nouveauté des états ou la curiosité des transitions à partir des pixels observés bruts, l'exploration risque d'être affectée par la dynamique de ces objets non pertinents. Pour résoudre ce problème, nous proposons un modèle de goulot d'étranglement dynamique (DB) afin d'obtenir une représentation pertinente pour la dynamique et d'éliminer le bruit, en nous basant sur le principe du goulot d'étranglement de l'information. Nous offrons un bonus DB pour encourager l'agent à explorer les paires état-action à gain d'information élevé. Les expériences montrent que le bonus DB surpasse plusieurs méthodes d'exploration de pointe dans les environnements bruités.

EditGAN : Édition d'images sémantiques de haute précision
Huan Ling, Karsten Kreis, Daiqing Li, Seung Wook Kim, Antonio Torralba, Sanja Fidler
Les réseaux antagonistes génératifs (GAN) ont récemment trouvé des applications dans le domaine de l'édition d'images. Cependant, la plupart des méthodes d'édition d'images basées sur les GAN nécessitent souvent de vastes ensembles de données annotés de segmentation sémantique pour l'entraînement, n'offrent qu'un contrôle de haut niveau ou se contentent d'interpoler entre différentes images. Nous proposons ici EditGAN, une nouvelle méthode d'édition d'images sémantique de haute qualité et de haute précision, permettant aux utilisateurs de modifier des images en ajustant leurs masques de segmentation très détaillés, par exemple, en dessinant un nouveau masque pour le phare d'une voiture. EditGAN s'appuie sur un cadre GAN qui modélise conjointement les images et leurs segmentations sémantiques, ne nécessitant qu'une poignée d'exemples étiquetés, ce qui en fait un outil d'édition évolutif. Concrètement, on intègre une image dans l'espace latent du GAN et on effectue une optimisation conditionnelle du code latent en fonction de la modification de la segmentation, ce qui modifie aussi l'image. Pour amortir l'optimisation, on trouve dans l'espace latent des vecteurs d'édition qui font les modifications. Le cadre nous permet d'apprendre un nombre arbitraire de vecteurs d'édition, qui peuvent ensuite être appliqués directement à d'autres images à des vitesses interactives. Nous démontrons expérimentalement qu'EditGAN permet de manipuler des images avec un niveau de détail et une liberté sans précédent, tout en préservant leur qualité d'origine. Il est également possible de combiner facilement plusieurs modifications et d'effectuer des retouches plausibles au-delà des données d'entraînement d'EditGAN. Nous présentons les performances d'EditGAN sur une grande variété de types d'images et constatons qu'il surpasse quantitativement plusieurs méthodes de retouche existantes sur des tâches de référence standard.

Structure fractale et propriétés de généralisation des algorithmes d'optimisation stochastique
Alexander Camuto, George Deligiannidis, Murat A. Erdogdu, Mert Gürbüzbalaban, Umut Şimşekli, Lingjiong Zhu
Comprendre la généralisation en apprentissage profond constitue l'un des principaux défis de la théorie de l'apprentissage statistique depuis une dizaine d'années. Si des travaux récents ont démontré la nécessité de prendre en compte l'ensemble de données et l'algorithme d'entraînement pour obtenir des bornes de généralisation pertinentes, les propriétés des données et de l'algorithme qui déterminent les performances de généralisation restent encore mal définies d'un point de vue théorique. Dans cette étude, nous abordons ce problème sous l'angle de la théorie des systèmes dynamiques et représentons les algorithmes d'optimisation stochastique comme des systèmes de fonctions itérées aléatoires (IFS). Bien étudiés dans la littérature sur les systèmes dynamiques, ces IFS peuvent, sous des hypothèses peu restrictives, être démontrés ergodiques, avec une mesure invariante souvent supportée par des ensembles à structure fractale. Notre principale contribution est de prouver que l'erreur de généralisation d'un algorithme d'optimisation stochastique peut être bornée à partir de la « complexité » de la structure fractale sous-jacente à sa mesure invariante. En s'appuyant sur des résultats de la théorie des systèmes dynamiques, nous montrons que l'erreur de généralisation est explicitement liée au choix de l'algorithme (par exemple, la descente de gradient stochastique – SGD), à ses hyperparamètres (par exemple, le pas d'apprentissage, la taille du lot) et à la géométrie du problème (par exemple, la matrice hessienne de la fonction de perte). Nous appliquons ensuite nos résultats à des problèmes spécifiques (par exemple, la régression linéaire/logistique, les réseaux de neurones à une couche cachée) et à des algorithmes particuliers (par exemple, la SGD et ses variantes préconditionnées), et obtenons des estimations analytiques de notre borne. Pour les réseaux neuronaux modernes, nous développons un algorithme efficace pour calculer cette borne et validons notre théorie par diverses expériences sur des réseaux de neurones.

L'avenir est log-gaussien : les réseaux ResNet et leur limite infinie de profondeur et de largeur à l'initialisation
Mufan (Bill) Li, Mihai Nica, Daniel M. Roy
La théorie de la limite de largeur infinie a considérablement enrichi notre compréhension des réseaux de neurones. Cependant, les réseaux réels sont trop profonds : leurs performances s’écartent de cette théorie. Nous étudions des réseaux avec des connexions résiduelles dans la limite de profondeur et de largeur infinies, et montrons une concordance remarquable entre les prédictions théoriques et les mesures empiriques effectuées sur des réseaux réels.

Grad2Task : Amélioration de la classification de texte avec peu d’exemples grâce à l’utilisation de gradients pour la représentation des tâches
Jixuan Wang, Kuan-Chieh Wang, Frank Rudzicz, Michael Brudno
Le pré-entraînement de modèles de langage basés sur Transformer sur des textes non étiquetés, suivi d'un ajustement fin sur des tâches cibles, a permis d'obtenir d'excellents résultats dans divers domaines du traitement automatique du langage naturel (TALN). Cependant, l'étape d'ajustement fin nécessite encore une grande quantité de données étiquetées pour obtenir de bonnes performances. Dans ce travail, nous proposons une approche de méta-apprentissage pour la classification de textes avec peu d'exemples, où chaque classe ne dispose que de quelques exemples. Lors de l'entraînement, notre modèle acquiert des connaissances a priori utiles à partir d'un ensemble de tâches diverses mais connexes. Lors des tests, il utilise ces connaissances pour mieux résoudre diverses tâches en aval dans différents domaines. On utilise les gradients comme caractéristiques pour représenter la tâche. Comparé à l'ajustement fin et à d'autres approches de méta-apprentissage, notre approche offre de meilleures performances sur un ensemble diversifié de tâches de classification de textes. Ce travail constitue une première exploration de l'utilisation de représentations de tâches basées sur les gradients pour le méta-apprentissage.

Comportements à queue lourde dans la descente de gradient stochastique et compressibilité des réseaux de neurones surparamétrés
Melih Barsbey, Milad Sefidgaran, Murat A. Erdogdu, Gaël Richard, Umut Şimşekli
Les techniques de compression des réseaux neuronaux sont de plus en plus populaires, car elles permettent de réduire considérablement les besoins en stockage et en calcul pour les très grands réseaux. Des études empiriques récentes ont montré que même des stratégies d'élagage simples peuvent être étonnamment efficaces, et plusieurs études théoriques ont démontré que les réseaux compressibles (au sens spécifique du terme) devraient présenter une faible erreur de généralisation. Cependant, une caractérisation théorique de la cause sous-jacente qui rend ces réseaux sensibles à de tels schémas de compression simples fait encore défaut. Dans cette étude, nous abordons cette question fondamentale et révélons que la dynamique de l'algorithme d'apprentissage joue un rôle clé dans l'obtention de tels réseaux compressibles. En nous concentrant sur la descente de gradient stochastique (SGD), notre principale contribution est de relier la compressibilité à deux propriétés nouvellement établies de la SGD : (i) lorsque la taille du réseau tend vers l'infini, le système peut converger vers une limite de champ moyen, où les poids du réseau se comportent indépendamment ; (ii) pour un rapport pas/lot élevé, les itérations de la SGD peuvent converger vers une distribution stationnaire à queue lourde. Lorsque ces deux phénomènes se produisent simultanément, nous démontrons que les réseaux sont nécessairement « ℓp-compressibles » et que les erreurs de compression des différentes techniques d'élagage (amplitude, valeur singulière ou élagage de nœuds) tendent vers l'infiniment petit lorsque la taille du réseau augmente. Nous établissons également des bornes de généralisation adaptées à notre cadre théorique, confirmant ainsi que l'erreur de généralisation est plus faible pour les réseaux plus compressibles. Notre étude théorique et numérique sur divers réseaux de neurones montre que des ratios taille de pas/taille de lot élevés introduisent des queues de distribution épaisses qui, combinées à un surparamétrage, induisent la compressibilité.

Comment l'architecture d'un réseau neuronal influence-t-elle sa robustesse face aux étiquettes bruitées ?
Jingling Li, Mozhi Zhang, Keyulu Xu, John P Dickerson, Jimmy Ba
Dans les grands ensembles de données réelles, les étiquettes bruitées sont inévitables. Ce travail explore un domaine peu étudié jusqu'ici : l'impact de l'architecture du réseau sur sa robustesse face aux étiquettes bruitées. Nous proposons un cadre formel reliant la robustesse d'un réseau à l'alignement entre son architecture et les fonctions cible/bruit. Notre cadre mesure la robustesse d'un réseau par le pouvoir prédictif de ses représentations, c'est-à-dire les performances de test d'un modèle linéaire entraîné sur les représentations apprises à l'aide d'un petit ensemble d'étiquettes propres. Nous formulons l'hypothèse qu'un réseau est plus robuste aux étiquettes bruitées si son architecture est plus alignée sur la fonction cible que sur le bruit. Pour appuyer cette hypothèse, nous apportons des preuves théoriques et empiriques à travers diverses architectures de réseaux neuronaux et différents domaines. Nous constatons également que lorsque le réseau est bien aligné sur la fonction cible, son pouvoir prédictif dans les représentations peut améliorer les méthodes d'entraînement sur étiquettes bruitées de pointe en termes de précision de test, et même surpasser les méthodes sophistiquées utilisant des étiquettes propres.

Identification et évaluation comparative des problèmes de prédiction hors contexte naturel
David Madras, Richard Zemel
Les systèmes d'apprentissage profond échouent fréquemment lors de la prédiction hors contexte (OOC), c'est-à-dire lorsqu'ils doivent faire des prédictions fiables sur des entrées ou des sous-groupes inhabituels de la distribution d'entraînement. C'est pourquoi plusieurs points de référence d'évaluation du rendement OOC ont été récemment introduits. Dans ce travail, nous proposons un cadre unifiant la littérature sur la mesure des performances OOC et montrons comment exploiter des informations auxiliaires riches pour identifier des ensembles candidats d'exemples OOC dans les ensembles de données existants. Nous présentons NOOCh : une suite d'« ensembles de défis » naturels, et montrons comment différentes notions de contexte peuvent être utilisées pour sonder des modes d'échec OOC spécifiques. Expérimentalement, nous explorons les compromis entre diverses approches d'apprentissage sur ces ensembles de défis et démontrons comment les choix effectués lors de la conception des benchmarks OOC peuvent mener à des conclusions différentes.

Apprentissage de représentations invariantes au domaine dans les MDP par blocs conditionnés par un objectif
Beining Han, Chongyi Zheng, Harris Chan, Keiran Paster, Michael R. Zhang, Jimmy Ba
L'apprentissage par renforcement profond (RL) résout avec succès de nombreux problèmes complexes de processus décisionnels markoviens (MDP). Cependant, les agents sont souvent confrontés à des changements environnementaux imprévus après leur déploiement dans le monde réel. Ces changements sont souvent parasites et sans lien avec le problème sous-jacent, comme les modifications de l'arrière-plan pour les agents à entrée visuelle. Malheureusement, les politiques de RL profond sont généralement sensibles à ces changements et ont du mal à y réagir de manière robuste. Ceci s'apparente au problème de la généralisation de domaine en apprentissage supervisé. Dans ce travail, nous étudions ce problème pour les agents de RL conditionnés par un objectif. Nous proposons un cadre théorique dans le contexte des MDP par blocs qui caractérise la généralisabilité des politiques conditionnées par un objectif à de nouveaux environnements. Dans ce cadre, nous développons une méthode pratique, PA-SkewFit, qui améliore la généralisation de domaine. L'évaluation empirique montre que notre agent de RL conditionné par un objectif obtient d'excellents résultats dans divers environnements de test inédits, avec une amélioration de 50 % par rapport aux méthodes de référence.

Apprentissage des mécanismes causaux généralisés de Gumbel-max
Guy Lorberbom, Daniel D. Johnson, Chris J. Maddison, Daniel Tarlow, Tamir Hazan
L'inférence contrefactuelle permet de répondre aux questions hypothétiques (« et si »), mais les réponses correctes à ces questions ne peuvent pas être identifiées de manière univoque par l'observation et l'interaction avec le monde. Nous proposons une famille de modèles causaux apprenables, capables de fournir des réponses pertinentes aux requêtes contrefactuelles, selon des critères définis par l'utilisateur. Nos modèles généralisent le modèle causal structurel Gumbel-max précédemment proposé et peuvent être utilisés pour répondre à de nouvelles requêtes contrefactuelles non rencontrées lors de l'entraînement.

Listes de contrôle prédictives optimales pour l'apprentissage
Guiliang Liu, Xiangyu Sun, Oliver Schulte, Pascal Poupart
Les listes de vérification sont des outils d'aide à la décision couramment utilisés en milieu clinique. Leur efficacité tient notamment à leur simplicité : elles se remplissent en quelques minutes, ne nécessitent aucun matériel spécifique (une simple feuille imprimée suffit) et sont facilement vérifiables, contrairement à d'autres modèles d'apprentissage automatique opaques. Cependant, la grande majorité des listes de contrôle actuelles sont élaborées par des groupes d'experts. Dans ce travail, nous proposons une méthode pour créer des listes de contrôle prédictives à partir de données. Cette approche nous permet d'avoir des critères d'évaluation mesurables (c'est-à-dire une mesure concrète pour évaluer les listes de contrôle). Elle accélère également le développement du modèle : nous pouvons créer des listes de vérification en quelques heures, au lieu d'attendre des mois l'avis d'un groupe d'experts. Notre méthode formule la création de la liste de contrôle comme un programme linéaire en nombres entiers, minimisant ainsi directement son taux d'erreur. Notre méthode présente l'avantage crucial d'intégrer des contraintes personnalisables (concernant par exemple la forme, la performance ou l'équité de la liste de contrôle), et de révéler les situations où une liste de contrôle n'est pas adaptée à une tâche donnée. Nous constatons que notre méthode surpasse les méthodes de référence existantes et présentons deux études de cas illustrant son utilité pratique : 1) nous entraînons une liste de contrôle à prédire la mortalité chez les patients en soins intensifs en tenant compte des contraintes d'équité entre les groupes ; 2) on apprend une version abrégée de la liste de vérification du SSPT pour le DSM-5, plus rapide à remplir tout en conservant sa précision.

Interprétation d'arbres de connaissances à partir de représentations d'objets pour l'apprentissage par renforcement profond
Guiliang Liu, Xiangyu Sun, Oliver Schulte, Pascal Poupart
L'interprétation des politiques d'apprentissage par renforcement (RL) est essentielle pour renforcer la confiance et se conformer aux exigences de transparence. Nous décrivons une nouvelle technique pour expliquer ces politiques à l'aide de caractéristiques d'objet de haut niveau, plutôt que de caractéristiques de bas niveau telles que les pixels ou les mesures brutes des capteurs. Cette approche construit un arbre de décision interprétable à partir de caractéristiques d'objet de haut niveau, qui reproduit les politiques RL que nous voulons expliquer.

Compression avec perte pour une prédiction sans perte
Yann Dubois, Benjamin Bloem-Reddy, Karen Ullrich, Chris J. Maddison
Des milliards de téraoctets de données sont recueillis chaque année. À cette échelle, la plupart des données ne sont pas visualisées par l'humain. Elles sont traitées par des algorithmes. Or, les compresseurs de données standards (comme JPEG) sont optimisés pour que les reconstructions soient visuellement proches de la réalité. Dans cet article, nous posons les fondements théoriques de la compression pour une utilisation ultérieure par les algorithmes d'apprentissage automatique. Sur le plan pratique, nous proposons un algorithme simple pour entraîner un compresseur générique, qui compresse les images standard plus de 1 000 fois mieux que JPEG, sans impacter les performances d'apprentissage automatique. Éventuellement, on espère que cette compression permettra aux individus de traiter des données à des échelles présentement réservées aux grandes institutions.

Manipulation de SGD par des attaques de tri de données
Ilia Shumailov, Zakhar Shumaylov, Dmitry Kazhdan, Yiren Zhao, Nicolas Papernot, Murat A. Erdogdu, Ross Anderson
Dans cet article, nous présentons une nouvelle classe d'attaques en phase d'entraînement qui ne nécessitent aucune modification de l'ensemble de données sous-jacent ni de l'architecture du modèle, mais seulement une modification de l'ordre de présentation des données au modèle. Essentiellement, nous démontrons que le biais d'échantillonnage des données est un élément crucial de toute optimisation stochastique et qu'en contrôlant l'aléatoire, c'est-à-dire l'ordre de présentation des données au modèle, un attaquant peut ralentir l'apprentissage, l'interrompre et parfois même amener le modèle à apprendre des choses qu'il n'est pas censé apprendre.

Impasses médicales et apprentissage de l'identification des états et des traitements à haut risque
Mehdi Fatemi, Taylor W. Killian, Jayakumar Subramanian, Marzyeh Ghassemi
Les interactions patient-clinicien sont par nature des processus séquentiels où les décisions thérapeutiques sont prises et adaptées en fonction de la compréhension, par un expert, de l'évolution de la santé du patient. Bien que l'apprentissage par renforcement (RL) se soit révélé un outil puissant pour apprendre des stratégies de décision optimales – apprendre quoi faire –, la garantie de trouver ces solutions dépend de la possibilité d'expérimenter différentes stratégies afin de recueillir davantage de données. Ce type d'exploration est impossible dans le contexte des soins de santé, rendant ainsi l'apprentissage de stratégies optimales impossible. Dans ce travail, nous proposons d'inverser le paradigme du RL dans des contextes critiques de sécurité et de données limitées, afin d'étudier les traitements à haut risque ainsi que les états de santé des patients. Nous entraînons l'algorithme à identifier les traitements à éviter afin de prévenir des complications irréversibles, définies comme une impasse médicale. Nous appliquons cette approche (Découverte d'impasses – DeD) à une tâche clinique réelle en utilisant l'ensemble de données MIMIC-III, concernant la prise en charge de patients gravement malades ayant développé une septicémie. Nous établissons l'existence d'impasses et démontrons l'utilité de la DeD, en émettant des avertissements indiquant quand un patient ou un traitement présente un risque élevé ou extrême de se retrouver dans une impasse et donc de mourir.

Méta-apprentissage pour améliorer la préformation
Aniruddh Raghu, Jonathan Lorraine, Simon Kornblith, Matthew McDermott, David Duvenaud
Le pré-entraînement de grands modèles est utile, voire indispensable pour les performances actuelles dans de nombreuses tâches d'apprentissage automatique. Cependant, il introduit de nombreux paramètres supplémentaires, difficiles à optimiser. Nous proposons une méthode évolutive, basée sur le gradient, pour optimiser ces paramètres de pré-entraînement. Les gradients exacts étant difficiles à calculer, nous les approximons. Plus précisément, nous combinons la différentiation implicite pour la longue phase de pré-entraînement, quasi-convergée, avec la rétropropagation à travers l'entraînement pour la courte phase d'ajustement fin. Nous avons appliqué ces gradients de préentraînement approximatifs pour optimiser des milliers de poids de tâches dans le cadre de la prédiction de la fonction des protéines basée sur les graphiques, et pour apprendre un réseau neuronal complet, enrichi de données supplémentaires, pour l'apprentissage contrastif sur des électrocardiogrammes.

Quantile optimal minimax et regret semi-adversarial via des régularisateurs logarithmiques racine
Jeffrey Negrea, Blair Bilodeau, Nicolò Campolongo, Francesco Orabona, Daniel M. Roy
En matière de prédiction avec avis d'experts, on cherche à égaler les performances d'un ensemble de prédicteurs/prévisionnistes de référence. Dans ce travail, nous présentons des algorithmes dont l'optimalité est démontrée pour deux variantes de cette tâche : égaler les performances des k % meilleurs prédicteurs, et égaler les performances du meilleur expert, quelles que soient les données (positives, négatives ou intermédiaires).

Moshpit SGD : Formation décentralisée à communication efficace sur des dispositifs hétérogènes et peu fiables
Max Ryabinin, Eduard Gorbunov, Vsevolod Plokhotnyuk, Gennady Pekhimenko
L'entraînement des réseaux neuronaux profonds est souvent accéléré par la combinaison de la puissance de plusieurs serveurs et d'algorithmes distribués. Malheureusement, les versions de ces algorithmes optimisées en termes de communication nécessitent fréquemment des connexions à large bande fiables, généralement disponibles uniquement dans des groupes dédiés. Ce travail propose Moshpit All-Reduce, un algorithme évolutif et tolérant aux pannes pour le moyennage décentralisé, qui conserve des propriétés de convergence plus favorables que les approches distribuées classiques. Nous montrons que Moshpit SGD, une méthode d'optimisation distribuée basée sur cet algorithme, offre à la fois de solides garanties théoriques et une grande efficacité pratique. En particulier, nous démontrons des gains de performance de 1,3 à 1,5x dans des expériences d'apprentissage profond à grande échelle, comme la classification d'ImageNet avec ResNet-50 ou le pré-entraînement d'ALBERT-large sur BookCorpus.

Automates hybrides neuronaux : dynamique d’apprentissage avec plusieurs modes et transitions stochastiques
Michael Poli, Stefano Massaroli, Luca Scimeca, Seong Joon Oh, Sanghyuk Chun, Atsushi Yamashita, Hajime Asama, Jinkyoo Park, Animesh Garg
Grâce à leur capacité à intégrer des contraintes et des connaissances a priori spécifiques au domaine, les modèles de réseaux de neurones implicites trouvent de nombreuses applications aux problèmes traditionnels de prévision et de contrôle. Parmi eux, les équations différentielles neuronales constituent un choix naturel pour les systèmes à temps continu, dont l'évolution des variables d'état est décrite par des équations différentielles. Malgré des succès récents, plusieurs questions demeurent en suspens ; en particulier, la meilleure façon d'exploiter cette classe de modèles pour effectuer des prédictions dans des systèmes multimodaux soumis à des événements discrets, tels que des impacts ou des chocs, demeure incertaine. Ces systèmes, appelés systèmes hybrides stochastiques (SHS), sont très fréquents dans les applications concrètes, avec des exemples notables dans les systèmes biologiques, les réseaux de transport, les marchés financiers et la robotique. Ce travail présente les automates hybrides neuronaux (NHA), une méthode multi-étapes évolutive basée sur les flux normalisants, les équations différentielles neuronales et l'autosupervision des données de trajectoire du système. Les automates hybrides neuronaux constituent la première approche d'apprentissage profond capable d'apprendre et de simuler la vaste classe des SHS à partir de données, sans connaissance préalable du nombre de modes de fonctionnement du système cible. L'efficacité du modèle NHA montre comment, moyennant une analyse approfondie, les modèles implicites peuvent être appliqués à la plupart des systèmes, tout en demeurant des approches d'apprentissage profond générales et évolutives.

OctField : Fonctions hiérarchiques implicites pour la modélisation 3D
Jia-Heng Tang, Weikai Chen, Jie Yang, Bo Wang, Songrun Liu, Bo Yang, Lin Gao
Les progrès récents en matière de fonctions implicites localisées ont permis d'étendre la représentation implicite neuronale aux grandes scènes. Cependant, la subdivision régulière de l'espace 3D utilisée par ces approches ne tient pas compte de la faible densité de surface ni de la granularité variable des détails géométriques. Par conséquent, l'empreinte mémoire croît cubiquement avec le volume d'entrée, ce qui entraîne un coût de calcul prohibitif, même pour une décomposition de densité modérée. Dans ce travail, nous présentons OctField, une représentation implicite hiérarchique apprenable pour les surfaces 3D, permettant un encodage de haute précision de surfaces complexes avec un faible besoin en mémoire et en calcul. Notre approche repose sur une décomposition adaptative des scènes 3D, distribuant uniquement des fonctions implicites locales autour de la surface d'intérêt. Pour ce faire, nous introduisons une structure octree hiérarchique afin de subdiviser l'espace 3D de manière adaptative en fonction de la densité de surface et de la richesse géométrique des parties. L'octree étant discret et non différentiable, nous proposons un nouveau réseau hiérarchique qui modélise la subdivision des cellules de l'octree comme un processus probabiliste et qui encode et décode récursivement la structure de l'octree et la géométrie de la surface de manière différentiable. Nous démontrons l'intérêt d'OctField pour diverses tâches de modélisation et de reconstruction de formes, en prouvant sa supériorité par rapport aux approches alternatives.

Sur la minimisation empirique du risque avec des données dépendantes et à queue lourde
Abhishek Roy, Krishnakumar Balasubramanian, Murat A. Erdogdu
Dans ce travail, nous établissons des bornes de risque pour la minimisation du risque empirique (ERM) avec des processus de génération de données dépendants et à queues épaisses. Pour ce faire, nous étendons les travaux fondateurs de Mendelson [Men15, Men18] sur l'analyse de l'ERM avec des observations à queues épaisses mais indépendantes et identiquement distribuées, au cas strictement stationnaire de mélange exponentiel β. Notre analyse repose sur le contrôle explicite du processus multiplicateur issu de l'interaction entre le bruit et les évaluations de la fonction sur les entrées. Elle permet une interaction même à queues épaisses polynomiales, couvrant ainsi une classe significativement plus large de modèles à queues épaisses que ceux analysés dans la littérature sur la théorie de l'apprentissage. Nous illustrons nos résultats en calculant les vitesses de convergence pour le problème de régression linéaire de grande dimension avec des données dépendantes et à queues épaisses.

Prédiction des paramètres pour des architectures profondes inédites
Boris Knyazev, Michal Drozdzal, Graham W. Taylor, Adriana Romero-Soriano
Avons-nous encore besoin de SGD ou d'Adam pour entraîner les réseaux neuronaux ? Des recherches récentes menées par le Vector Institute en collaboration avec Facebook AI Research (maintenant Meta) proposent une approche alternative pour l'entraînement des réseaux. Sous la direction de Boris Knyazev, doctorant à l'Université de Guelph, l'équipe a développé une technique permettant d'initialiser diverses architectures de réseaux de neurones à l'aide d'un « méta-modèle ». Ces travaux remettent en question l'hypothèse longtemps admise selon laquelle les optimiseurs basés sur le gradient sont essentiels à l'entraînement des réseaux de neurones profonds. Étonnamment, le méta-modèle peut prédire les paramètres de presque n'importe quel réseau de neurones en une seule passe, atteignant une précision d'environ 60 % sur le célèbre jeu de données CIFAR-10, sans aucun entraînement préalable. De plus, lors de son entraînement, le méta-modèle n'a observé aucun réseau proche de ResNet-50, dont il a prédit les quelque 25 millions de paramètres. Dans la foulée des travaux menés par l'équipe en 2020 pour réduire les besoins de calcul des GAN , cette approche démocratise l'apprentissage profond en rendant cette technologie accessible aux acteurs plus modestes du secteur, tels que les entreprises en démarrage et les organismes sans but lucratif. Elle sera présentée à NeurIPS 2021.

Quantification et amélioration de la transférabilité dans la généralisation du domaine
Guojun Zhang, Han Zhao, Yaoliang Yu, Pascal Poupart
Lors du transfert d'un modèle prédictif du laboratoire au monde réel, des divergences apparaissent systématiquement entre les données de laboratoire et les données réelles. Dans cet article, nous quantifions la transférabilité des caractéristiques des données et décrivons un nouvel algorithme pour calculer ces caractéristiques. Ce travail fait progresser l'état de l'art en analyse de données lorsqu'il est nécessaire de transférer un modèle prédictif entraîné dans un domaine donné (par exemple, client A) vers un nouveau domaine (par exemple, client B).

Transformer de référence : une approche en une étape pour l'ancrage visuel multitâche
Muchen Li, Léonid Sigal
La capacité de localiser, ou ancrer, une requête linguistique décrivant une entité dans une image est une tâche fondamentale pour les humains et, par extension, pour tout système de reconnaissance visuelle artificielle. Concrètement, étant donné une phrase de requête ( par exemple , « une berline bleue », « un homme barbu portant un blouson de cuir »), l'objectif est de produire un cadre ou un masque au niveau du pixel englobant précisément l'entité décrite dans l'image. La plupart des approches existantes abordent ce problème en deux étapes : premièrement, localiser un ensemble de régions dans les images contenant des entités potentielles d'intérêt ; deuxièmement, déterminer laquelle de ces régions correspond le mieux à la description fournie. Le principal problème avec ces méthodes est que les erreurs commises lors de la première étape limitent considérablement les performances de la seconde. Dans ce travail, nous proposons une architecture en une seule étape, capable d'ancrer simultanément le langage au niveau du cadre de délimitation et au niveau du pixel. Notamment, la plupart des approches précédentes ne pouvaient effectuer qu'une seule de ces opérations. Notre modèle permet également un raisonnement contextualisé en tenant compte de l'image entière, de toutes les phrases de requête d'intérêt et (optionnellement) du contexte linguistique afin d'améliorer les performances. Notre modèle est relativement simple, mais surpasse de loin les méthodes de pointe. Outre sa plus grande précision, notre approche est également considérablement plus rapide, car elle permet la localisation simultanée de plusieurs requêtes, avec différents niveaux de détail.

Serveur de données neuronales évolutif : un système de recommandation de données pour l’apprentissage par transfert
Tianshi Cao, Sasha (Alexandre) Doubov, David Acuna, Sanja Fidler
L'absence de données étiquetées à grande échelle dans le domaine cible du praticien peut constituer un frein à l'application pratique des algorithmes d'apprentissage automatique. L'apprentissage par transfert est une stratégie courante pour exploiter des données supplémentaires et améliorer les performances en aval, mais identifier les données les plus pertinentes à transférer peut s'avérer complexe. Le Neural Data Server (NDS), un moteur de recherche qui recommande des données pertinentes pour une tâche en aval donnée, a été proposé pour résoudre ce problème (Yan et al., 2020). NDS utilise un ensemble d'experts formés sur des sources de données afin d'estimer la similarité entre chaque source et la tâche en aval. Ainsi, le coût de calcul pour chaque utilisateur augmente avec le nombre de sources et nécessite une étape d'entraînement coûteuse pour chaque fournisseur de données. Pour remédier à ces problèmes, nous proposons le Scalable Neural Data Server (SNDS), un moteur de recherche à grande échelle capable d'indexer des milliers d'ensembles de données afin de fournir des données d'apprentissage automatique pertinentes aux utilisateurs finaux. SNDS entraîne l'ensemble d'experts sur des ensembles de données intermédiaires lors de son initialisation et représente à la fois les sources de données et les tâches en aval par leur proximité avec ces ensembles de données intermédiaires. Ainsi, le coût de calcul supporté par les utilisateurs de SNDS reste fixe lors de l'ajout de nouveaux ensembles de données au serveur, sans préentraînement pour les fournisseurs de données. Nous validons SNDS sur une multitude de tâches réelles et constatons que les données recommandées par SNDS améliorent les performances des tâches en aval par rapport aux méthodes de référence. Nous démontrons également l'évolutivité de notre système en prouvant sa capacité à sélectionner des données pertinentes pour un transfert en dehors du contexte d'imagerie naturelle.

Reparamétrisation par décalage de signe clairsemé pour un apprentissage efficace des réseaux à faible décalage de bits
Xinlin Li, Bang Liu, Yaoliang Yu, Wulong Liu, Chunjing Xu, Vahid Partovi Nia
Les réseaux de neurones à décalage réduisent la complexité de calcul en supprimant les opérations de multiplication coûteuses et en quantifiant les poids continus en valeurs discrètes à faible nombre de bits, ce qui les rend plus rapides et moins énergivores que les réseaux de neurones conventionnels. Cependant, les réseaux à décalage existants sont sensibles à l'initialisation des poids et leurs performances sont dégradées par le problème de disparition du gradient et de gel du signe des poids. Pour remédier à ces problèmes, nous proposons la reparamétrisation S3, une nouvelle technique d'entraînement pour les réseaux à décalage à faible nombre de bits. Notre méthode décompose un paramètre discret selon une approche de type « signe-sparse-décalage » en trois étapes. Ainsi, elle permet d'apprendre efficacement un réseau à faible nombre de bits avec une dynamique de poids similaire à celle des réseaux pleine précision et insensible à l'initialisation des poids. Notre méthode d'entraînement repousse les limites des réseaux de neurones à décalage et démontre que les réseaux à décalage 3 bits rivalisent avec leurs homologues pleine précision en termes de précision top-1 sur ImageNet.

Vers des stratégies optimales pour l'entraînement des modèles de perception de la conduite autonome en simulation
David Acuna, Jonas Philion, Sanja Fidler
La conduite autonome repose sur un volume considérable de données réelles, étiquetées avec une grande précision. Des solutions alternatives visent à exploiter les simulateurs de conduite capables de générer d'importantes quantités de données étiquetées présentant une multitude de variations de contenu. Cependant, l'écart entre les données synthétiques et réelles persiste, soulevant une question cruciale : comment tirer le meilleur parti d'un simulateur de conduite autonome pour les tâches de perception ? Dans ce travail, nous nous appuyons sur les avancées récentes de la théorie de l'adaptation de domaine et proposons, dans cette perspective, des méthodes pour minimiser cet écart. Nous nous concentrons principalement sur l'utilisation des étiquettes dans le seul domaine synthétique. Notre approche introduit une méthode rigoureuse d'apprentissage de représentations invariantes par les réseaux de neurones, ainsi qu'une vision théorique de l'échantillonnage des données du simulateur. Notre méthode est facile à mettre en œuvre en pratique, car elle est indépendante de l'architecture du réseau et du choix du simulateur. Nous présentons notre approche pour la segmentation de véhicules en vue aérienne à partir de données multisensorielles (caméras, lidar) à l'aide d'un simulateur open source (CARLA), et nous évaluons l'ensemble du cadre sur un jeu de données réel (nuScenes). Enfin, nous montrons quels types de variations (conditions météorologiques, nombre d'éléments, conception de la carte, diversité des couleurs, etc.) ont un impact sur les réseaux de perception lors de leur entraînement sur simulateurs de conduite, et lesquels peuvent être compensés par notre technique d'adaptation de domaine.

Vers un cadre informationnel unifié pour la généralisation
Mahdi Haghifam, Gintare Karolina Dziugaite, Shay Moran, Daniel M. Roy
Une des propriétés essentielles d'un algorithme d'apprentissage est sa capacité à généraliser à des données inédites. Dans ce travail, nous montrons que la théorie de l'information permet d'élaborer des théories de généralisation quasi optimales dans un nombre de scénarios bien plus important qu'on ne le pensait, ce qui confirme que considérer l'apprentissage comme un canal de communication constitue une perspective unificatrice.

TriBERT : Apprentissage de représentations audiovisuelles centrées sur l’humain pour la séparation visuelle et sonore
Tanzila Rahman, Mengyu Yang, Leonid Sigal
L'apprentissage audiovisuel, qui exploite la relation entre les signaux visuels et auditifs, est un sous-domaine important de l'apprentissage machine et de la vision par ordinateur. Parmi les tâches typiques que ces modèles peuvent résoudre, on peut citer la séparation et la localisation audio-visuelles , où l'objectif est de segmenter les sons produits par des objets individuels dans un enregistrement audio et/ou de localiser ces objets dans une scène visuelle ; et la correspondance audio-visuelle , dont l'objectif est souvent la récupération audio-visuelle, par exemple , la récupération de l'image correspondant à un son. La plupart des approches existantes pour ces problèmes extraient des informations des modalités nécessaires (audio ou visuelles), puis construisent des algorithmes spécifiques au problème pour fusionner ces représentations afin de résoudre une tâche spécifique. Ceci contraste avec les tendances actuelles dans d'autres domaines, où, ces dernières années, les approches se sont largement consolidées autour d'architectures conçues pour apprendre des représentations génériques et indépendantes du problème, qui peuvent ensuite être facilement exploitées pour des tâches spécifiques. Dans ce travail, nous formulons un apprentissage de représentations audio-visuelles génériques centrées sur l'humain, avec pour objectif explicite d'améliorer l'état de l'art en matière de séparation de sources sonores audio-visuelles. Notre modèle de transformation exploite trois flux d'information : vidéo, audio et posture humaine. Il fusionne ces informations pour générer des représentations enrichies, utilisables ensuite pour la séparation finale des sons et des données audiovisuelles. L'utilisation de la posture humaine s'inspire de travaux récents démontrant que de telles représentations peuvent améliorer significativement les performances dans de nombreux scénarios audiovisuels où une ou plusieurs personnes sont responsables du son, explicitement ( par exemple , une personne qui parle) ou implicitement ( par exemple , un son produit lors de la manipulation d'un objet). Nous montrons que les représentations apprises sont générales, utiles et améliorent considérablement les performances dans d'autres tâches auxiliaires ( par exemple , la recherche intermodale d'informations audio, visuelles et de posture).

Attaques par inversion de modèles variationnels
Kuan-Chieh Wang, Yan Fu, Ke Li, Ashish Khisti, Richard Zemel, Alireza Makhzani
Étant donné l'omniprésence des réseaux de neurones profonds, il est crucial que ces modèles ne divulguent aucune information sur les données sensibles ayant servi à leur entraînement. Lors d'attaques par inversion de modèle, un utilisateur malveillant tente de récupérer l'ensemble de données privé utilisé pour entraîner un réseau neuronal supervisé. Une attaque par inversion de modèle réussie doit générer des échantillons réalistes et diversifiés, décrivant précisément chacune des classes de l'ensemble de données privé. Dans ce travail, nous proposons une interprétation probabiliste des attaques par inversion de modèle et formulons un objectif variationnel prenant en compte à la fois la diversité et la précision. Afin d'optimiser cet objectif variationnel, nous choisissons une famille variationnelle définie dans l'espace de code d'un modèle génératif profond, entraîné sur un ensemble de données auxiliaire public présentant des similarités structurelles avec l'ensemble de données cible. Empiriquement, notre méthode améliore considérablement les performances en termes de précision de l'attaque cible, de réalisme des échantillons et de diversité sur des ensembles de données de visages et de radiographies thoraciques.