Les chercheurs travaillant sur les vecteurs remportent les plus hautes distinctions à NeurIPS 2022

28 novembre 2022

Rechercher

Par Ian Gormely 

Deux articles de Vector ont été récompensés lors de la conférence NeurIPS 2022. « Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding », coécrit par David Fleet, membre du corps professoral de Vector, a reçu le prix du meilleur article. Par ailleurs, « ImageNet Classification with Deep Convolutional Neural Networks », un article de 2012 coécrit par Geoffrey Hinton, conseiller scientifique en chef de Vector, a remporté le prix de la persévérance. Cinq autres articles coécrits par des chercheurs de Vector ont été reconnus par la conférence pour leur grande qualité.

Au total, les professeurs, les professeurs affiliés et les postdoctorants de Vector ont vu 47 de leurs articles acceptés à la conférence de cette année, auxquels s'ajoutent huit articles acceptés dans cinq ateliers différents.

L'article primé de Fleet présente un modèle de diffusion texte-image qui produit un degré de photoréalisme sans précédent et une compréhension approfondie du langage. L'article désormais classique de Hinton a bouleversé la communauté de la vision par ordinateur en réduisant de près de moitié le taux d'erreur du modèle précédent. Il a marqué une percée majeure dans la reconnaissance d'images et son influence se fait encore sentir aujourd'hui.

Collectivement, les articles acceptés et coécrits par des chercheurs de Vector témoignent de la diversité des travaux menés au sein de notre communauté de recherche. Parmi ces articles figurent cinq articles coécrits par Nicholas Papernot, membre du corps professoral de Vector, et un nouvel article distinct, coécrit par Hinton et Fleet, intitulé « Une interface de séquence unifiée pour les tâches de vision ». Ce dernier démontre comment un ensemble diversifié de tâches fondamentales de vision par ordinateur peut être unifié grâce à une interface pixel-séquence partagée.

Deux articles portant sur les modèles de base, de grands modèles généralistes formés à grande échelle sur un vaste ensemble de données, puis spécialisés pour des tâches spécifiques, ont également été acceptés . Vector a récemment identifié ce domaine d'étude comme un axe de recherche où nous pouvons mettre à profit notre expérience et notre expertise afin de contribuer à la démocratisation de ces technologies. Deux autres articles portent sur des modèles d'IA formés pour jouer à des jeux vidéo textuels et à Minecraft .

Vous trouverez ci-dessous des résumés et des résumés simplifiés de nombreux articles et ateliers acceptés par les membres du corps professoral de Vector. 

Vous pouvez en savoir plus sur le travail de Vector lors des conférences des années précédentes ici (2021) , ici (2020) , ici (2019) et ici (2018) .

Exploitation adaptative des séparateurs avec des bandits causaux
Blair Bilodeau, Linbo Wang, Daniel M. Roy

Les problèmes de bandits manchots offrent un cadre pour identifier l'intervention optimale au cours d'une séquence d'expériences répétées. Sans hypothèses supplémentaires, la performance optimale minimax (mesurée par le regret cumulatif) est bien comprise. Grâce à l'accès à des variables observées supplémentaires qui séparent l'intervention du résultat (c'est-à-dire qui constituent un séparateur d), les algorithmes récents de « bandits causaux » présentent un regret moindre. Cependant, en pratique, il est souhaitable de ne pas être sensible à la présence ou non d'un séparateur d parmi les variables observées. Idéalement, un algorithme devrait être adaptatif ; autrement dit, avoir des performances presque aussi bonnes qu'un algorithme connaissant la présence ou l'absence d'un séparateur d. Dans ce travail, nous formalisons et étudions cette notion d'adaptabilité, et proposons un nouvel algorithme qui atteint simultanément : (a) un regret optimal lorsqu'un séparateur d est observé, surpassant ainsi les algorithmes minimax classiques ; et (b) un regret significativement inférieur à celui des algorithmes de bandits causaux récents lorsque les variables observées ne constituent pas un séparateur d. Point essentiel, notre algorithme ne nécessite aucune connaissance préalable de la présence d'un séparateur d. Nous généralisons aussi cette adaptabilité à d'autres conditions, comme le critère de la porte d'entrée.

Optimisation proximale amortie
Juhan Bae, Paul Vicol, Jeff Z. HaoChen, Roger Grosse

Plusieurs algorithmes d'optimisation utilisés en apprentissage machine peuvent être considérés comme des approximations d'un objectif proximal. Cet objectif établit un compromis entre la perte sur le lot d'exemples d'entraînement courant, l'impact de cette perte sur les prédictions des autres exemples et la distance parcourue dans l'espace des paramètres. Nous présentons une méthode permettant de méta-apprendre directement des optimiseurs qui minimisent cet objectif proximal à chaque étape. Les optimiseurs ainsi appris sont efficaces avec les méthodes d'optimisation de second ordre existantes pour les réseaux de neurones, tout en étant plus faciles à implémenter.

BigBio : un cadre pour le traitement automatique du langage naturel biomédical centré sur les données
Jason Alan Fries, Leon Weber, Natasha Seelam, Gabriel Altay, Debajyoti Datta, Samuele Garda, Myungsun Kang, Ruisi Su, Wojciech Kusa, Samuel Cahyawijaya, Fabio Barth, Simon Ott, Matthias Samwald, Stephen Bach, Stella Biderman, Mario Sänger, Bo Wang, Alison Callahan, Daniel León Periñán, Théo Gigant, Patrick Haller, Jenny Chim, Jose David Posada, John Michael Giorgi, Karthik Rangasai Sivaraman, Marc Pàmies, Marianna Nezhurina, Robert Martin, Michael Cullan, Moritz Freidank, Nathan Dahlberg, Shubhanshu Mishra, Shamik Bose, Nicholas Michio Broad, Yanis Labrak, Shlok S Deshmukh, Sid Kiblawi, Ayush Singh, Minh Chien Vu, Trishala Neeraj, Jonas Golde, Albert Villanova del Moral, Benjamin Beilhartz

L'entraînement et l'évaluation des modèles linguistiques nécessitent de plus en plus la construction de méta-jeux de données : des collections diversifiées de données organisées et à la provenance clairement définie. L'utilisation du langage naturel pour la génération de réponses a récemment permis d'améliorer la généralisation sans exemple en transformant des ensembles de données supervisés existants en une variété de nouvelles tâches de pré-entraînement, soulignant ainsi les avantages de la conservation des méta-jeux de données. Bien que performantes pour les textes de domaines généraux, ces approches axées sur les données restent difficiles à transposer à la modélisation du langage biomédical, car les ensembles de données biomédicales étiquetées sont largement sous-représentés dans les plateformes de données populaires. Pour relever ce défi, nous présentons BigBIO, une bibliothèque communautaire de plus de 126 ensembles de données de TALN biomédicales, couvrant actuellement 12 catégories de tâches et plus de 10 langues. BigBIO facilite la curation reproductible des méta-jeux de données grâce à un accès programmatique aux ensembles de données et à leurs métadonnées, et est compatible avec les plateformes actuelles d'ingénierie des réponses et d'évaluation de bout en bout des modèles de langage avec peu ou pas d'exemples. Nous présentons notre processus d'harmonisation des schémas de tâches, d'audit des données et de contribution, et décrivons deux cas d'utilisation illustratifs : l'évaluation initiale de requêtes biomédicales et l'apprentissage multitâche à grande échelle. BigBIO est un projet communautaire en cours et est accessible à cette adresse : [URL].

Breaking Bad : un ensemble de données pour la fracture géométrique et le réassemblage
Silvia Sellán, Yun-Chun Chen, Ziyi Wu, Animesh Garg, Alec Jacobson

Nous présentons Breaking Bad, un vaste ensemble de données d'objets fracturés. Cet ensemble comprend plus d'un million d'objets fracturés, simulés à partir de dix mille modèles de base. La simulation de fracture repose sur un algorithme physique récent qui génère efficacement une variété de modes de fracture. Les ensembles de données existants pour l'assemblage de formes décomposent les objets en parties sémantiquement significatives, modélisant ainsi le processus de construction. À l'inverse, Breaking Bad modélise le processus de destruction, c'est-à-dire la façon dont un objet géométrique se brise naturellement en fragments. Notre ensemble de données sert de référence pour l'étude du réassemblage d'objets fracturés et soulève de nouveaux défis pour la compréhension des formes géométriques. Nous analysons notre ensemble de données à l'aide de plusieurs mesures géométriques et comparons trois méthodes d'apprentissage profond de pointe pour l'assemblage de formes, dans différents contextes. De nombreux résultats expérimentaux démontrent la complexité de notre ensemble de données et soulignent la nécessité de futures recherches sur la conception de modèles spécifiquement adaptés à la tâche d'assemblage de formes géométriques. Notre ensemble de données est disponible à cette adresse : [URL].

Distillation d'ensembles de données à l'aide de la régression des caractéristiques neuronales
Yongchao Zhou, Ehsan Nezhadarya, Jimmy Ba

L'obtention de données pertinentes est l'une des étapes les plus cruciales et complexes de la conception de systèmes d'apprentissage profond performants. Comment obtenir un ensemble de données de meilleure qualité pour un apprentissage plus efficace ? La distillation de données offre une solution potentielle : elle consiste à apprendre sur un petit ensemble de données synthétiques préservant au maximum les informations de l'ensemble de données original. Nous proposons un algorithme d'apprentissage performant, « FRePo », capable de condenser un ensemble de données synthétiques compact et informatif à partir d'un ensemble de données volumineux et bruité. Cet ensemble de données distillé permet au modèle d'atteindre des performances comparables à celles du modèle entraîné sur l'ensemble de données original, en un temps considérablement réduit.

Notre article formule la distillation de données comme un problème de méta-apprentissage à deux niveaux. La boucle externe optimise le méta-ensemble de données, tandis que la boucle interne entraîne un modèle sur les données distillées. Un défi majeur de cette formulation réside dans le calcul du méta-gradient, qui peut s'avérer coûteux en temps et en mémoire. Nous relevons ce défi en approximant efficacement l'optimisation de la boucle interne, ce qui nous permet d'atteindre des performances de pointe avec un temps d'entraînement 100 fois plus rapide et une consommation de mémoire GPU 10 fois moindre par rapport aux travaux précédents. Cette amélioration de l'efficacité de l'entraînement ouvre la voie à de nombreuses applications pour les données distillées, allant de l'apprentissage continu à la recherche d'architectures neuronales. De plus, les « données synthétiques », au sens large de données artificielles produites par des modèles génératifs, peuvent aider les chercheurs à comprendre comment une machine apprenante, autrement opaque, « voit » le monde et potentiellement répondre aux préoccupations courantes en apprentissage automatique concernant la confidentialité des données d'entraînement.

Inférence des ensembles de données pour les modèles auto-supervisés
Adam Dziedzic, Haonan Duan, Muhammad Ahmad Kaleem, Nikita Dhawan, Jonas Guan, Yannis Cattan, Franziska Boenisch, Nicolas Papernot

Lors d'attaques par extraction de modèles, des adversaires peuvent s'emparer d'un modèle d'apprentissage automatique exposé via une API publique en l'interrogeant de manière répétée et en ajustant leur propre modèle en fonction des résultats obtenus. Nous proposons une nouvelle défense contre le vol d'encodeurs d'apprentissage autosupervisé (SSL). Contrairement à l'extraction de modèles classiques sur les modèles supervisés, qui renvoient des étiquettes ou des scores de faible dimension, les encodeurs SSL produisent des représentations de dimensionnalité nettement supérieure. Récemment, des fournisseurs de ML-as-a-Service ont commencé à proposer des encodeurs SSL entraînés via des API d'inférence, qui transforment les entrées utilisateur en représentations exploitables moyennant paiement. Cependant, le coût élevé de l'entraînement de ces modèles et leur exposition aux API font de l'extraction en boîte noire une menace pour la sécurité réelle. Nous introduisons une nouvelle défense par inférence de jeux de données, qui utilise les points de données privés de l'encodeur victime comme signature pour en établir la propriété en cas de vol. L'idée est que les représentations de sortie de l'encodeur diffèrent entre les données d'entraînement et les données de test de la victime si l'encodeur lui a été volé, mais pas s'il a été entraîné indépendamment. Dans le cadre de notre évaluation, nous proposons également de mesurer la fidélité des encodeurs volés et de quantifier l'efficacité de la détection des vols en exploitant les informations mutuelles et les mesures de distance.

Analyse comparative EPIC-KITCHENS VISOR : Segmentations vidéo et relations entre objets
Ahmad Darkhalil, Dandan Shan, Bin Zhu, Jian Ma, Amlan Kar, Richard Higgins, Sanja Fidler, David Fouhey, Dima Damen

En collaboration avec nos partenaires des universités de Bristol et du Michigan, nous présentons VISOR, un nouvel ensemble de données d'annotations de pixels et une suite de tests de référence pour la segmentation des mains et des objets en action dans des vidéos égocentriques. VISOR annote les vidéos d'EPIC-KITCHENS, ce qui soulève de nouveaux défis par rapport aux ensembles de données de segmentation vidéo actuels. Plus précisément, nous devons garantir la cohérence à court et à long terme des annotations au niveau du pixel, car les objets subissent des interactions transformatrices, comme l'épluchage, la découpe et la cuisson d'un oignon. Notre objectif est d'obtenir des annotations précises au niveau du pixel de la peau, des morceaux d'oignon, de la planche à découper, du couteau, de la poêle, ainsi que des mains qui effectuent les actions. VISOR introduit un pipeline d'annotation, basé sur la Toronto Annotation Suite ( https://aidemos.cs.toronto.edu/toras/landing ), pour une évolutivité et une qualité optimales. Au total, nous publions 272 000 masques sémantiques manuels pour 257 classes d'objets, 9,9 millions de masques denses interpolés et 67 000 relations main-objet, couvrant 36 heures de 179 vidéos non découpées. Outre ces annotations, nous présentons trois défis liés à la segmentation d'objets vidéo, à la compréhension des interactions et au raisonnement à long terme.

Bornes de généralisation pour la descente de gradient stochastique via des ε-couvertures localisées
Parc Sejun, Umut Simsekli, Murat Erdogdu

Dans cet article, nous proposons une nouvelle technique de couverture localisée pour les trajectoires de la descente de gradient stochastique (SGD). Cette localisation confère à l'algorithme une complexité spécifique, mesurée par le nombre de couverture, dont la cardinalité est indépendante de la dimension, contrairement aux arguments de couverture uniforme classiques qui induisent une dépendance exponentielle à la dimension. À partir de cette construction localisée, nous montrons que si la fonction objectif est une perturbation finie d'une fonction fortement convexe et lisse par morceaux, comportant P morceaux (c'est-à-dire non convexe et non lisse en général), l'erreur de généralisation est majorée par O((log n log(n P))/n√), où n représente le nombre d'échantillons de données. En particulier, cette erreur est indépendante de la dimension et ne nécessite ni arrêt précoce ni décroissance du pas. Finalement, nous utilisons ces résultats dans divers contextes et déduisons des limites de généralisation pour les modèles linéaires multi-indices, les machines à vecteurs de support multi-classes et le regroupement K-moyennes pour les configurations d'étiquettes dures et souples, améliorant ainsi les taux de pointe connus.

GET3D : Un modèle génératif de formes texturées 3D de haute qualité appris à partir d’images *
Jun Gao, Tianchang Shen, Zian Wang, Wenzheng Chen, Kangxue Yin, Daiqing Li ou Litany, Zan Gojcic, Sanja Fidler

NVIDIA GET3D est un nouveau modèle d'IA entraîné à partir d'images 2D seulement, capable de générer un nombre quasi illimité de formes 3D aux textures haute fidélité et aux détails géométriques complexes. Ces objets 3D sont créés dans le même format que celui utilisé par les logiciels graphiques les plus courants, permettant ainsi aux utilisateurs de les importer immédiatement dans des moteurs de rendu 3D et des moteurs de jeu pour les modifier. Les objets générés peuvent être utilisés pour la modélisation 3D de bâtiments, d'espaces extérieurs ou de villes entières, destinés à des secteurs tels que les jeux vidéo, la robotique, l'architecture et les médias sociaux. Pour en savoir plus, consultez le blogue NVIDIA et la vidéo GET3D .

* Cet article a été réalisé par NVIDIA avec la participation de chercheurs de Vector.

Asymptotique en grande dimension de l'apprentissage de caractéristiques : comment une seule étape de gradient améliore la représentation

Jimmy Ba, Murat Erdogdu, Taiji Suzuki, Zhichao Wang, Denny Wu, Greg Yang

Nous étudions la première étape de descente de gradient sur les paramètres W de la première couche d'un réseau de neurones à deux couches : f(x) = 1/N√a⊤σ(W⊤x), où W∈ℝd×N et a∈ℝN sont initialisés aléatoirement, et l'objectif d'apprentissage est la perte MSE empirique : 1/n∑ni=1(f(xi)−yi)². À la limite asymptotique proportionnelle où n, d et N tendent vers l'infini simultanément, et dans un cadre idéal élève-professeur, nous montrons que la première mise à jour du gradient contient un « pic » de rang 1, ce qui entraîne un alignement entre les poids de la première couche et la composante linéaire du modèle enseignant f*. Pour caractériser l'impact de cet alignement, nous calculons le risque de prédiction de la régression de la crête sur le noyau conjugué après une étape de descente de gradient sur W avec un taux d'apprentissage η, lorsque f* est un modèle à un seul indice. Nous considérons deux valeurs de η pour le taux d'apprentissage initial. Pour de petites valeurs de η, nous établissons une propriété d'équivalence gaussienne pour la carte de caractéristiques entraînée et démontrons que le noyau appris améliore le modèle initial basé sur des caractéristiques aléatoires, sans toutefois surpasser le meilleur modèle linéaire appliqué aux données d'entrée. En revanche, pour des valeurs de η suffisamment élevées, nous prouvons que, pour certaines valeurs de f*, le même estimateur de crête appliqué aux caractéristiques entraînées peut dépasser ce « régime linéaire » et surpasser un large éventail de caractéristiques aléatoires et de noyaux invariants par rotation. Nos résultats démontrent qu'une seule étape de gradient peut apporter un avantage considérable par rapport aux caractéristiques aléatoires et soulignent l'importance du choix du taux d'apprentissage lors de la phase initiale de l'entraînement.

Si les fonctions d'influence sont la réponse, alors quelle est la question ?
Juhan Bae, Nathan Ng, Alston Lo, Marzyeh Ghassemi, Roger Grosse

Les fonctions d'influence permettent d'estimer efficacement l'effet d'un point de données spécifique sur un modèle lors de son retrait de l'ensemble d'entraînement. Cependant, des travaux récents ont montré que ces estimations sont peu précises pour les réseaux de neurones. Dans cette étude, nous décomposons cet écart en cinq sources d'erreur et analysons leur contribution sur différentes architectures et ensembles de données. Nous constatons que les fonctions d'influence reproduisent mal le réentraînement réel en l'absence d'un point de données spécifique, mais constituent de bonnes approximations d'un autre objet que nous appelons la fonction de réponse de Bregman proximale (PBRF). La PBRF permet de répondre à de nombreuses questions initiales ayant motivé la création des fonctions d'influence et suggère que les algorithmes actuels d'estimation de ces fonctions fournissent des résultats plus informatifs que ne le laissaient supposer les analyses d'erreur précédentes.

Implications de l'indétermination du modèle pour les explications des décisions automatisées
Marc-Étienne Brunet, Ashton Anderson, Richard Zemel

D'importantes recherches ont été menées sur l'explication des modèles prédictifs, notamment par le biais de méthodes d'explicabilité et de recours a posteriori. La plupart des techniques proposées reposent sur un modèle prédictif unique et fixe. Or, il est bien établi que, pour un ensemble de données et une tâche prédictive donnés, plusieurs modèles peuvent résoudre le problème de manière (presque) équivalente. Dans ce travail, nous étudions les implications de cette indétermination du modèle sur les explications a posteriori des modèles prédictifs. Nous montrons comment elle peut engendrer une multiplicité explicative et nous explorons les facteurs sous-jacents. Nous démontrons également que la multiplicité prédictive, et le concept connexe d'incertitude épistémique, ne sont pas des indicateurs fiables de la multiplicité explicative. De plus, nous illustrons comment un ensemble de modèles présentant des performances globales très similaires sur un ensemble de données de test peut présenter de fortes variations dans leurs explications locales, c'est-à-dire pour une entrée spécifique A. Nous explorons ces effets pour des explications basées sur la valeur de Shapley sur trois ensembles de données d'évaluation des risques. Nos résultats indiquent que l'indétermination du modèle peut avoir un impact considérable sur les explications en pratique, menant à des explications incohérentes, voire contradictoires.

En matière de confidentialité différentielle, la vérité existe : fuite d'histogrammes de votes dans l'apprentissage privé d'ensembles
Jiaqi Wang, Roei Schuster, I Shumailov, David Lie, Nicolas Papernot

Cet article démontre que le mécanisme de confidentialité différentielle de PATE, conçu pour préserver la confidentialité des données d'entraînement, entraîne en réalité la fuite d'éléments de calcul internes sensibles. Des adversaires peuvent exploiter cette faille pour déduire des informations sensibles, comme l'appartenance d'une instance d'entrée à un groupe minoritaire. Ce résultat surprenant souligne la nécessité d'une grande prudence lors de l'utilisation et du raisonnement relatif à la confidentialité différentielle afin de limiter les fuites d'informations.

Génération itérative de graphes de scène
Siddhesh Khandelwal, Léonid Sigal

Les graphiques de scène permettent une compréhension globale des objets et de leurs interactions au sein d'une scène. Ces graphiques sont caractérisés par des nœuds représentant les objets, chacun doté d'une position spatiale et d'une étiquette de classe, et par des arêtes capturant les relations entre paires d'objets. La génération efficace de tels graphiques, à partir d'images ou de vidéos, est devenue un problème fondamental en vision par ordinateur. En raison de l'immensité de l'espace des solutions, les approches existantes de génération de graphes de scène reposent sur certaines hypothèses simplificatrices. L'une d'elles, par exemple, consiste à supposer que les relations entre paires d'objets sont indépendantes de leur type ou de leur position spatiale, ce qui est erroné, car la relation « porter » suggère fortement que l'un des objets est une personne. Dans ce travail, nous proposons un nouveau cadre pour la génération de graphes de scène qui pallie cette limitation et permet ainsi d'estimer et de raisonner conjointement sur les paires d'objets et leurs relations. Ceci est réalisé grâce à une procédure itérative : nous générons d'abord une estimation initiale du graphe de scène, puis nous affinons continuellement les objets et les relations détectés en exploitant leurs interactions. Notre procédure d'affinage itérative surpasse les approches existantes pour cette tâche. De plus, en pratique, certaines relations sont beaucoup moins fréquentes, ce qui entraîne des biais lors de l'apprentissage. Nous étudions ce phénomène et proposons une approche pour améliorer efficacement les performances sur les relations sous-représentées, moyennant une légère diminution des performances sur les relations dominantes.

Apprendre à suivre les instructions dans les jeux textuels
Mathieu Tuli, Andrew Li, Pashootan Vaezipoor, Toryn Klassen, Scott Sanner, Sheila McIlraith

Les jeux textuels sont des environnements virtuels décrits par du texte et manipulés à l'aide de commandes textuelles telles que « ramasser l'épée » ou « déverrouiller la porte ». Ces jeux nécessitent une compréhension du langage et une mémoire à long terme, ce qui représente un défi de taille pour les systèmes d'IA actuels. Nous constatons que les méthodes d'apprentissage par renforcement les plus performantes pour les jeux textuels ont généralement du mal à suivre des instructions formulées en langage naturel, ce qui explique les faibles taux de réussite. Pour remédier à ce problème, nous traduisons ces instructions dans un langage formel (logique) qui permet la décomposition des tâches et le suivi de leur progression. Des expériences menées sur plus de 500 jeux du domaine populaire TextWorld démontrent les avantages de notre approche pour le suivi d'instructions complexes. Au-delà des jeux textuels, nos résultats sont pertinents pour le suivi d'instructions en langage naturel dans divers contextes où un système d'IA doit décider de son comportement au fil du temps.

LION : Modèles de diffusion de points latents pour la génération de formes 3D *
xiaohui zeng, Arash Vahdat, Francis Williams, Zan Gojcic, ou Litanie, Sanja Fidler, Karsten Kreis

Le modèle de diffusion de points latents (LION) de NVIDIA est un modèle génératif de formes 3D conçu pour les artistes et les créateurs de contenu. LION apprend directement à partir de données géométriques 3D et exploite des modèles de diffusion de débruitage très expressifs pour son cadre de génération hiérarchique. Cela permet à LION de s'adapter à des ensembles de données de formes 3D divers et complexes. Bien qu'utilisant une représentation 3D sous forme de nuage de points, LION peut également produire des maillages exploitables, idéaux pour le traitement ultérieur avec les logiciels graphiques courants. LION offre non seulement une qualité de génération de pointe, mais permet également des applications telles que la synthèse 3D guidée par voxels, le débruitage de formes multimodales, la génération de formes à partir de texte, la synthèse guidée par image, et bien plus encore, faisant de LION un outil flexible pour les artistes numériques. Consultez la page du projet pour en savoir plus.
* Cet article a été réalisé par NVIDIA avec la participation de chercheurs de Vector.

Fonctions d'activation logique : équivalents dans l'espace logit des opérateurs booléens probabilistes
Scott C. Lowe, Robert Earle, Jason d'Eon, Thomas Trappenberg, Sageev Oore

Le choix des fonctions d'activation et leur justification constituent un sujet de débat récurrent au sein de la communauté des réseaux de neurones. Un neurone biologique individuel présente une complexité bien supérieure à celle d'un neurone artificiel utilisé en apprentissage automatique. Nous nous sommes donc demandé s'il était possible d'intégrer une partie de cette complexité aux neurones artificiels, tout en conservant des abstractions simples et facilement déployables à grande échelle. Les représentations neuronales dans les réseaux de neurones artificiels sont généralement assimilées à des « logits », représentant la probabilité de présence d'une caractéristique dans le stimulus sous la forme d'un score de log-odds. Par exemple, un neurone individuel du réseau peut indiquer la probabilité de présence de plumes, d'un bec ou d'une poignée de porte à un endroit précis d'une image. Ces valeurs sont ensuite utilisées par les composants du réseau pour déterminer si l'image représente un canard, par exemple. En considérant les neurones individuels comme des logits, nous avons dérivé de nouvelles fonctions d'activation capables de combiner plusieurs entrées, de manière analogue à l'arbre dendritique des neurones biologiques. Nous avons notamment défini des opérateurs logit équivalents aux portes logiques booléennes probabilistes ET, OU et NON-OU exclusifs (XNOR) pour des probabilités indépendantes. Nous avons déployé ces nouvelles fonctions d'activation, individuellement et conjointement, afin de démontrer leur efficacité sur diverses tâches telles que la classification d'images, l'apprentissage par transfert, le raisonnement abstrait et l'apprentissage compositionnel zéro-shot.

MoCoDA : Augmentation des données contrefactuelles basée sur un modèle
Silviu Pitis, Elliot Creager, Ajay Mandlekar, Animesh Garg

Le nombre d'états dans un processus dynamique augmente de façon exponentielle avec le nombre d'objets, ce qui rend l'apprentissage par renforcement (RL) difficile dans les domaines complexes à objets multiples. Pour que les agents puissent interagir avec le monde réel, ils doivent réagir à des combinaisons d'objets inédites et raisonner à leur sujet. Nous soutenons que la capacité de reconnaître et d'utiliser la factorisation locale dans la dynamique de transition est essentielle pour exploiter pleinement le pouvoir du raisonnement multi-objets. À cette fin, nous démontrons que : (1) la connaissance de la structure locale des transitions de l'environnement est suffisante pour réduire exponentiellement la complexité d'échantillonnage nécessaire à l'entraînement d'un modèle de dynamique ; et (2) un modèle de dynamique factorisé localement se généralise de manière prouvée hors distribution à des états et actions inédits. La connaissance de la structure locale nous permet aussi de prédire à quels états et actions inédits ce modèle de dynamique se généralisera. Nous proposons d'exploiter ces observations dans un nouveau cadre d'augmentation de données contrefactuelles basé sur un modèle (MoCoDA). MoCoDA applique un modèle de dynamique factorisé localement, appris par ses auteurs, à une distribution augmentée d'états et d'actions afin de générer des transitions contrefactuelles pour le RL. MoCoDA exploite un ensemble de structures locales plus large que les travaux précédents et permet un contrôle direct de la distribution d'entraînement augmentée. Nous démontrons que MoCoDA permet aux agents d'apprentissage par renforcement (RL) d'apprendre des politiques généralisables à des états et actions inconnus. Nous utilisons MoCoDA pour entraîner un agent RL hors ligne à résoudre une tâche de manipulation robotique hors distribution, pour laquelle les algorithmes RL hors ligne classiques échouent.

L'équation différentielle stochastique (SDE) de covariance neuronale : réseaux de profondeur et de largeur infinis façonnés à l'initialisation
Mufan Bill Li, Mihai Nica, Daniel M. Roy

Les sorties logit d'un réseau de neurones à propagation avant, à l'initialisation, suivent une loi normale conditionnelle, étant donné une matrice de covariance aléatoire définie par l'avant-dernière couche. Dans ce travail, on étudie la distribution de cette matrice aléatoire. Des travaux récents ont montré que la mise en forme de la fonction d'activation à mesure que la profondeur du réseau augmente est nécessaire pour que cette matrice de covariance soit non dégénérée. Cependant, l'approche actuelle de cette méthode de mise en forme, basée sur le modèle de largeur infinie, est insatisfaisante pour les grandes profondeurs : les analyses de largeur infinie ignorent les fluctuations microscopiques d'une couche à l'autre, alors que ces fluctuations s'accumulent sur de nombreuses couches. Pour pallier cette limite, nous étudions la matrice de covariance aléatoire à la limite d'une profondeur et d'une largeur infinies. Nous identifions la mise à l'échelle précise de la fonction d'activation nécessaire pour obtenir une limite non triviale et montrons que la matrice de covariance aléatoire est régie par une équation différentielle stochastique (EDS) que nous appelons l'EDS de covariance neuronale. À l'aide de simulations, on montre que l'équation différentielle stochastique (EDS) correspond étroitement à la distribution de la matrice de covariance aléatoire des réseaux finis. De plus, on retrouve une condition d'existence et d'absence de conditions pour les normes explosives et nulles des réseaux de grande taille, en se basant sur la fonction d'activation.

Itération de la valeur de fractionnement de l'opérateur

Amin Rakhsha, Andrew Wang, Mohammad Ghavamzadeh, Amir-massoud Farahmand

Considérons un problème de planification pour un processus de décision markovien (MDP) à actualisation. Supposons que nous ayons accès à un modèle approximatif peu coûteux à utiliser, en plus de la dynamique réelle, dont l'accès est onéreux. Par exemple, le modèle pourrait être un simulateur de faible fidélité, mais rapide, tandis que la dynamique réelle pourrait être un simulateur de haute fidélité, mais lent. Ou, dans le contexte de l'apprentissage par renforcement basé sur un modèle (MBRL), nous avons accès à un modèle appris, à partir duquel des échantillons peuvent être acquis à moindre coût, alors que l'acquisition d'échantillons à partir de la dynamique réelle, inconnue, du système du monde réel est coûteuse. Peut-on utiliser ce modèle approximatif pour accélérer le calcul de la fonction de valeur ? Cet article propose un algorithme appelé OS-VI (Operator Splitting Value Iteration) qui tire parti du modèle approximatif pour potentiellement accélérer la convergence de la séquence de la fonction de valeur vers la fonction de valeur par rapport à la dynamique réelle. OS-VI est capable d'utiliser le modèle approximatif sans introduire d'erreur dans le calcul de la fonction de valeur. Il atteint une vitesse de convergence beaucoup plus rapide lorsque le modèle est suffisamment précis, ce qui réduit le nombre d'interrogations de la dynamique réelle. Cela permet de réduire les coûts de calcul dans les environnements simulés et, potentiellement, d'améliorer la complexité des échantillons dans les problèmes du monde réel.

Sur l'apprentissage et la réfutation dans la confidentialité différentielle locale non interactive
Alexander Edmonds, Aleksandar Nikolov, Toniann Pitassi

Nous étudions deux tâches statistiques fondamentales dans le cadre de la confidentialité différentielle locale non interactive (LDP) : l’apprentissage et la réfutation. L'apprentissage consiste à trouver le concept qui correspond le mieux à une fonction cible inconnue (à partir d'échantillons étiquetés tirés d'une distribution), tandis que la réfutation consiste à distinguer les distributions de données fortement corrélées à un concept de la classe, des distributions où les étiquettes sont aléatoires. Notre résultat principal est une caractérisation complète de la complexité d'échantillonnage de l'apprentissage PAC agnostique pour les protocoles LDP non interactifs. Nous montrons que la complexité d'échantillonnage optimale pour toute classe de concepts est décrite par la norme γ² approximative d'une matrice naturelle associée à la classe. Combiné aux travaux antérieurs [Edmonds, Nikolov et Ullman, 2019], ce résultat établit une équivalence entre l’apprentissage et la réfutation dans le cadre agnostique.

Sur les limites des défenses de prétraitement stochastique
Yue Gao, I Shumailov, Kassem Fawaz, Nicolas Papernot

Se défendre contre les exemples adverses demeure un problème ouvert. On considère généralement que le hasard lors de l'inférence augmente le coût de la détection d'entrées adverses. Dans cet article, nous étudions les défenses de prétraitement stochastiques et soulignons leurs limites théoriques et pratiques. Nous expliquons pourquoi elles ne sont pas censées renforcer la robustesse des modèles face aux exemples adverses et pourquoi elles restent vulnérables même aux attaques non stochastiques classiques.

Optimalité et stabilité dans les jeux lisses non convexes
Guojun Zhang, Pascal Poupart, Yaoliang Yu

La convergence vers un point selle pour les fonctions convexes-concaves est étudiée depuis des décennies, tandis que ces dernières années ont vu un regain d'intérêt pour les jeux lisses non convexes (à somme nulle), motivé par leurs nombreuses applications récentes. La définition des points optimaux locaux et l'identification des algorithmes capables d'y converger constituent un défi de recherche fascinant. Le concept de point minimax local, étroitement lié à l'algorithme de descente de gradient, est particulièrement intéressant. Cet article propose une analyse approfondie des points minimax locaux, notamment de leur relation avec d'autres concepts de solution et de leurs conditions d'optimalité. Nous montrons que les points selles locaux peuvent être considérés comme un type particulier de points minimax locaux, appelés points minimax uniformément locaux, sous des hypothèses de continuité peu restrictives. Dans le cadre des jeux quadratiques (non convexes), nous démontrons que les points minimax locaux sont, d'une certaine manière, équivalents aux points minimax globaux. Finalement, on étudie la stabilité des algorithmes de gradient au voisinage des points minimax locaux. Bien que les algorithmes de gradient puissent converger vers des points minimax locaux/globaux dans le cas non dégénéré, ils échouent souvent dans le cas général. Cela implique la nécessité de développer de nouveaux algorithmes ou concepts, au-delà des points de selle et des points minimax, pour les jeux lisses non convexes.

Optimisation de la collecte de données pour l'apprentissage machine
Rafid Mahmood, James Lucas, Jose M. Alvarez, Sanja Fidler, Marc Law

Les systèmes d'apprentissage profond modernes nécessitent d'immenses ensembles de données pour atteindre des performances impressionnantes, mais les indications sur la quantité et le type de données à recueillir sont rares. Collecter trop de données entraîne des coûts inutiles immédiatement, tandis que les collecter trop peu peut entraîner des coûts futurs et retarder les flux de travail. Nous proposons un nouveau paradigme pour modéliser le flux de travail de collecte de données comme un problème formel de collecte optimale. Ce paradigme permet aux concepteurs de spécifier des objectifs de rendement, les coûts de collecte, un horizon temporel et des pénalités en cas de non-atteinte des objectifs. De plus, cette formulation se généralise aux tâches nécessitant plusieurs sources de données, comme les données étiquetées et non étiquetées utilisées dans l'apprentissage semi-supervisé. Pour résoudre ce problème, nous développons Learn-Optimize-Collect (LOC), qui minimise les coûts de collecte futurs attendus. Finalement, on compare numériquement notre cadre à la méthode de référence conventionnelle d'estimation des besoins en données par extrapolation à partir des lois d'échelle neuronales. Nous réduisons considérablement les risques de ne pas atteindre les objectifs de rendement souhaités sur plusieurs tâches de classification, de segmentation et de détection, tout en maintenant des coûts de collecte totaux faibles.

Identification partielle des effets du traitement à l'aide de modèles génératifs implicites

Vahid Balazadeh Meresht, Vasilis Syrgkanis, Rahul G Krishnan

Nos travaux proposent un nouvel algorithme pour limiter les effets causaux des interventions à partir de données observationnelles. Ce problème est connu sous le nom d'identification partielle. Nous proposons une nouvelle méthode d'identification partielle des effets moyens du traitement (EMT) dans des graphes causaux généraux, utilisant des modèles génératifs profonds. Notre méthode permet de borner les effets dans des graphiques comprenant des variables aléatoires continues et discrètes. La stratégie adoptée utilise la dérivée moyenne uniforme du traitement (DMUT), c'est-à-dire les dérivées partielles des fonctions de réponse, pour obtenir une approximation régulière de l'EMT. Nous démontrons que notre algorithme converge vers des bornes optimales pour l'EMT dans les modèles causaux structurels linéaires (MCS). Pour les MCS non linéaires, nous montrons empiriquement que l'utilisation de la DMUT mène à des bornes plus précises et plus stables que les méthodes optimisant directement l'EMT.

Les réseaux d'équilibre indépendants du chemin peuvent mieux exploiter le calcul en temps réel lors des tests.
Cem Anil, Ashwini Pokle, Kaiqu Liang, Johannes Treutlein, Yuhuai Wu, Shaojie Bai, J. Zico Kolter, Roger Grosse

Nous étudions la capacité des réseaux de neurones à exploiter des ressources de calcul supplémentaires pour obtenir de bonnes performances sur des instances de problèmes plus complexes que celles sur lesquelles ils ont été entraînés. Nous avons identifié une propriété de certains réseaux entraînés qui semble fortement corrélée à leurs performances de généralisation : l’indépendance du chemin, ou la mesure dans laquelle la propagation avant du réseau converge vers le même point, quelle que soit l’initialisation.

Modèles photoréalistes de diffusion texte-image avec compréhension approfondie du langage Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily Denton, Seyed Kamyar Seyed Ghasemipour, Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans, Jonathan Ho, David Fleet, Mohammad Norouzi

Nous présentons Imagen, un modèle de diffusion texte-image offrant un photoréalisme sans précédent et une compréhension approfondie du langage. Imagen s'appuie sur la puissance des grands modèles de langage Transformer pour la compréhension du texte et sur la robustesse des modèles de diffusion pour la génération d'images haute fidélité. Notre découverte majeure est que les grands modèles de langage génériques (par exemple T5), préentraînés sur des corpus textuels, sont étonnamment efficaces pour l'encodage du texte en vue de la synthèse d'images : augmenter la taille du modèle de langage dans Imagen améliore la fidélité des échantillons et l'alignement image-texte bien plus efficacement qu'augmenter la taille du modèle de diffusion d'images. Imagen atteint un score FID de 7,27 sur l'ensemble de données COCO, une performance inédite, sans aucun entraînement préalable sur ce dernier. De plus, les évaluateurs humains jugent les échantillons d'Imagen équivalents aux données COCO elles-mêmes en termes d'alignement image-texte. Afin d'évaluer plus en profondeur les modèles texte-image, nous présentons DrawBench, un banc d'essai complet et exigeant pour ces modèles. Avec DrawBench, nous comparons Imagen à des méthodes récentes telles que VQ-GAN+CLIP, les modèles de diffusion latente et DALL-E 2. Nous constatons que les évaluateurs humains préfèrent Imagen aux autres modèles lors de comparaisons directes, tant en termes de qualité des échantillons que d'alignement image-texte. Consultez https://imagen.research.google/ pour un aperçu des résultats.

L’effet oignon de la vie privée : la mémorisation est relative
Nicholas Carlini, Matthew Jagielski, Chiyuan Zhang, Nicolas Papernot, Andreas Terzis, Florian Tramer

Il a été démontré que les modèles d'apprentissage machine entraînés sur des ensembles de données privés peuvent divulguer leurs données. Bien que des travaux récents aient montré que les données moyennes sont rarement divulguées, les valeurs aberrantes sont fréquemment mémorisées, entraînant ainsi des fuites de données. Nous démontrons et analysons un effet « oignon » lié à la mémorisation : la suppression de la « couche » de valeurs aberrantes, les plus vulnérables aux atteintes à la vie privée, expose une nouvelle couche de valeurs auparavant protégées à cette même attaque. Nous menons plusieurs expériences pour étudier cet effet et en comprendre les causes. L'existence de cet effet a diverses conséquences. Par exemple, elle suggère que les propositions visant à se prémunir contre la mémorisation sans un entraînement intégrant des garanties de confidentialité rigoureuses ont peu de chances d'être efficaces. De plus, elle suggère que les technologies d'amélioration de la confidentialité, telles que le désapprentissage automatique, pourraient en réalité nuire à la confidentialité des autres utilisateurs.

Apprentissage proximal avec conscience de l'apprentissage par opposition
Stephen Zhao, Chris Lu, Roger Grosse, Jakob Foerster

LOLA (Learning With Opponent-Learning Awareness) (Foerster et al. [2018a]) est un algorithme d'apprentissage par renforcement multi-agents qui apprend généralement la coopération basée sur la réciprocité dans des environnements partiellement compétitifs. Cependant, LOLA a souvent du mal à apprendre ce comportement dans des espaces de politiques plus complexes paramétrés par des réseaux de neurones, notamment parce que la règle de mise à jour est sensible à la paramétrisation des politiques. Ce problème est particulièrement marqué dans le contexte de la modélisation de l'adversaire, où sa politique est inconnue et doit être déduite d'observations ; dans ce cas, LOLA est mal spécifié car des politiques adverses comportementalement équivalentes peuvent entraîner des mises à jour non équivalentes. Pour combler cette lacune, nous réinterprétons LOLA comme une approximation d'un opérateur proximal, puis nous en déduisons un nouvel algorithme, POLA (LOLA Proximal), qui utilise directement la formulation proximale. Contrairement à LOLA, les mises à jour de POLA sont invariantes à la paramétrisation, en ce sens que lorsque l'objectif proximal possède un optimum unique, des politiques comportementalement équivalentes produisent des mises à jour comportementalement équivalentes. Nous présentons ensuite des approximations pratiques de la mise à jour idéale de POLA, que nous évaluons dans plusieurs environnements partiellement compétitifs à l'aide d'approximations de fonctions et de modélisations des adversaires. Cela démontre empiriquement que POLA atteint une coopération basée sur la réciprocité de manière plus fiable que LOLA.

Repenser les ensembles profonds
Taiga Abe, Estefany Kelly Buchanan, Geoff Pleiss, Richard Zemel, John Cunningham

L'assemblage de réseaux neuronaux est une méthode efficace pour améliorer la précision et permet souvent d'égaler les performances de modèles individuels plus grands. Ce constat soulève une question naturelle : si l'on a le choix entre un ensemble profond et un réseau de neurones unique présentant une précision similaire, lequel est préférable ? Des travaux récents suggèrent que les ensembles profonds pourraient offrir des avantages distincts au-delà du simple pouvoir prédictif : notamment la quantification de l'incertitude et la robustesse face aux variations des données. Dans cette étude, nous démontrons les limites de ces avantages supposés et montrons qu'un réseau de neurones unique (mais plus grand) peut reproduire ces qualités. Premièrement, nous montrons que la diversité de l'ensemble, quel que soit le critère utilisé, ne contribue pas significativement à sa capacité à détecter les données hors distribution (OOD), mais est en revanche fortement corrélée à l'amélioration relative d'un modèle unique plus grand. Deuxièmement, nous montrons que les performances des ensembles en matière de détection des données OOD sont fortement déterminées par leur performance sur les données dans la distribution (InD) et, en ce sens, ne sont pas indicatives d'une quelconque « robustesse effective ». Bien que les ensembles profonds constituent un moyen pratique d'améliorer la puissance prédictive, la quantification de l'incertitude et la robustesse, nos résultats montrent que ces améliorations peuvent être reproduites par un modèle unique (plus grand).

Réseaux de filtres multiplicatifs résiduels pour la reconstruction multi-échelle
Shayan Shekarforoush, David Lindell, Marcus Brubaker, David Fleet

Les réseaux de coordonnées tels que les réseaux de filtres multiplicatifs (MFN) et BACON offrent un certain contrôle sur le spectre de fréquences utilisé pour représenter les signaux continus, comme les images ou les volumes 3D. Cependant, ils ne sont pas facilement applicables aux problèmes nécessitant une estimation grossière à fine, notamment divers problèmes inverses où l'optimisation grossière à fine joue un rôle clé pour éviter les minima locaux défavorables. Nous introduisons une nouvelle architecture de réseau de coordonnées et un nouveau schéma d'apprentissage permettant une optimisation grossière à fine avec un contrôle précis du support fréquentiel des reconstructions apprises. Ceci est rendu possible grâce à deux innovations majeures. Premièrement, nous intégrons des connexions résiduelles afin de préserver la structure à une échelle donnée lors de l'ajustement de structures à des échelles plus fines. Deuxièmement, nous proposons un nouveau schéma d'initialisation permettant de contrôler le spectre de fréquences du modèle à chaque étape de l'optimisation. Nous démontrons comment ces modifications permettent une optimisation multi-échelle pour un ajustement grossier à fin à des images naturelles. Nous évaluons ensuite notre modèle sur des ensembles de données synthétiques générés pour le problème de la reconstruction de particules uniques par cryo-microscopie électronique. Nous apprenons des structures multi-échelles haute résolution, comparables aux méthodes de pointe.

SMPL : Environnements d’apprentissage simulant la fabrication industrielle et le contrôle des procédés
Mohan Zhang, Xiaozhou Wang, Benjamin Decardi-Nelson, Bo Song, An Zhang, Jinfeng Liu, Sile Tao, Jiayi Cheng, Xiaohong Liu, Dengdeng Yu, Matthew Poon, Animesh Garg

Les usines de fabrication biologique et pharmaceutique traditionnelles sont pilotées par des opérateurs humains ou par des seuils prédéfinis. Les usines modernisées utilisent des algorithmes avancés de contrôle de processus, comme la commande prédictive (MPC). Cependant, l'application de l'apprentissage par renforcement profond au contrôle des usines de fabrication reste peu explorée. Cela s'explique notamment par le manque de simulations haute fidélité et d'API standard pour l'évaluation comparative. Afin de combler cette lacune, nous avons développé une bibliothèque conviviale comprenant cinq environnements de simulation haute fidélité : BeerFMTEnv, ReactorEnv, AtropineEnv, PenSimEnv et mAbEnv, couvrant un large éventail de procédés de fabrication. Ces environnements sont basés sur des modèles dynamiques publiés. De plus, nous évaluons les performances d'algorithmes d'apprentissage par renforcement, avec et sans modèle, en ligne et hors ligne, afin de faciliter les recherches ultérieures.

Tempo : Accélération de l’entraînement des modèles basés sur les transformateurs grâce à la réduction de l’empreinte mémoire
Muralidhar Andoorveedu, Zhanda Zhu, Bojian Zheng, Gennady Pekhimenko

Les modèles basés sur les Transformers sont devenus prédominants et sont appliqués à de nombreuses tâches, telles que la réponse aux questions, la paraphrase et même le traitement d'images. Cependant, leur entraînement performant peut s'avérer très coûteux, atteignant plusieurs millions de dollars pour les modèles les plus récents. En plus de cela, il y a les coûts liés à l'empreinte carbone et au temps de traitement. Nos travaux permettent de réduire ces coûts en optimisant les modèles Transformers afin de les entraîner sur un plus grand nombre de données simultanément, ce qui réduit le temps d'entraînement et génère des économies d'argent et d'énergie. Nos résultats montrent une amélioration allant jusqu'à 26 % du nombre d'échantillons traités par seconde pour les modèles les plus courants, grâce à un doublement de la taille des lots.

Apprentissage par renforcement tenant compte de l'incertitude pour l'évaluation des joueurs sensibles aux risques dans les jeux sportifs
Guiliang Liu, Yudong Luo, Oliver Schulte, Pascal Poupart

L'évaluation des joueurs est une tâche majeure de l'analyse sportive. Les méthodes précédentes mesuraient généralement l'impact des actions des joueurs sur les résultats souhaités (buts, victoires, etc.) sans tenir compte du risque induit par la dynamique stochastique du jeu. Dans cet article, nous concevons un cadre d'apprentissage par renforcement (RL) prenant en compte l'incertitude afin d'apprendre une mesure d'évaluation des joueurs sensible au risque à partir de cette dynamique stochastique. Pour intégrer le risque des mouvements d'un joueur dans la distribution des valeurs d'action, nous modélisons : 1) l'incertitude aléatoire, qui représente la stochasticité intrinsèque d'un jeu sportif ; et 2) l'incertitude épistémique, due à la connaissance insuffisante du modèle concernant les échantillons hors distribution (OoD). Nous montrons comment un opérateur de Bellman distributionnel et un modèle de densité d'espace des caractéristiques permettent de saisir ces incertitudes. À partir de cette estimation de l'incertitude, nous proposons une mesure d'impact de jeu sensible au risque (RiGIM) qui mesure la performance des joueurs sur une saison en fonction d'un niveau de confiance spécifique. L'évaluation empirique, basée sur plus de 9 millions d'événements de hockey sur glace et de football commentés en direct, montre que RiGIM présente une forte corrélation avec les mesures de succès standard et une sensibilité au risque constante.

Une interface de séquence unifiée pour les tâches de vision
Ting Chen, Saurabh Saxena, Lala Li, Tsung-Yi Lin, David Fleet, Geoffrey E Hinton

Alors que les tâches de traitement du langage s'expriment naturellement dans un cadre de modélisation unique et unifié (génération de séquences de jetons), ce n'est pas le cas en vision par ordinateur. Il en résulte une prolifération d'architectures et de fonctions de perte distinctes pour différentes tâches de vision. Dans ce travail, nous montrons qu'un ensemble diversifié de tâches « fondamentales » de vision par ordinateur peut également être unifié si elles sont formulées en termes d'une interface pixel-séquence partagée. Nous nous concentrons sur quatre tâches : la détection d'objets, la segmentation d'instances, la détection de points clés et la génération de légendes d'images, chacune avec des types de sorties différents (boîtes englobantes ou masques denses, par exemple). Malgré cela, en formulant la sortie de chaque tâche comme une séquence de jetons discrets avec une interface unifiée, nous montrons qu'il est possible d'entraîner un réseau de neurones avec une architecture de modèle et une fonction de perte uniques pour toutes ces tâches, sans personnalisation spécifique. Pour résoudre une tâche spécifique, nous utilisons une brève consigne comme description, et la séquence de sortie s'adapte à cette consigne afin de produire une sortie adaptée à la tâche. Nous démontrons qu'un tel modèle peut atteindre des performances compétitives par rapport aux modèles spécifiques à la tâche bien établis.

Laver l'inlavable : Sur la (im)possibilité de la détection du fairwashing
Ali Shahin Shamsabadi, Mohammad Yaghini, Natalie Dullerud, Sierra Wyllie, Ulrich Aïvodji, Aisha Alaagib, Sébastien Gambs, Nicolas Papernot

Le fairwashing est une nouvelle forme de menace où les entreprises abusent de l'exigence d'explicabilité de leurs modèles « boîte noire » pour dissimuler leurs pratiques potentiellement inéquitables et se soustraire à leurs conséquences juridiques. Dans cet article, nous démontrons que l'utilisation d'un modèle interprétable pour expliquer un modèle « boîte noire » introduit un risque de fairwashing. Nous caractérisons et analysons théoriquement le fairwashing, prouvant que ce phénomène est difficile à éviter en raison d'un facteur irréductible : l'iniquité du modèle « boîte noire ». À partir de la théorie développée, nous proposons une nouvelle technique, appelée FRAUD-Detect (FaiRness AUDit Detection), pour détecter les modèles faisant l'objet de fairwashing en mesurant la divergence des mesures de fidélité du modèle interprétable au sein de sous-populations. Nous explorons comment un adversaire adaptatif (une entreprise malhonnête informée de l'algorithme) pourrait tenter de contourner FRAUD-Detect. Nos résultats empiriques montrent que contourner notre détecteur entraîne une augmentation significative de l'écart entre les sous-populations, annulant ainsi le fairwashing.

Modèles de diffusion vidéo
Jonathan Ho, Tim Salimans, Alexey Gritsenko, William Chan, Mohammad Norouzi, David Fleet

Nous présentons des résultats sur la génération vidéo à l'aide de modèles de diffusion. Nous offrons une architecture pour les modèles de diffusion vidéo, une extension naturelle de l'architecture standard pour l'imagerie. Nous démontrons l'efficacité de cette architecture pour l'apprentissage conjoint à partir de données image et vidéo. Afin de générer des vidéos longues et en haute résolution, nous introduisons une nouvelle technique de conditionnement plus performante que les méthodes précédemment proposées. Nous présentons des résultats sur la génération vidéo conditionnée par du texte, ainsi que des résultats de pointe sur un banc d'essai de génération vidéo non conditionnée.

Préparation vidéo (VPT) : Apprendre à jouer la comédie en regardant des vidéos en ligne non étiquetées
Bowen Baker, Ilge Akkaya, Peter Zhokov, Joost Huizinga, Jie Tang, Adrien Ecoffet, Brandon Houghton, Raul Sampedro, Jeff Clune

Nous avons entraîné un réseau neuronal à jouer à Minecraft grâce à la méthode de préentraînement vidéo (VPT) sur un vaste ensemble de données vidéo non étiquetées de parties humaines, en utilisant seulement une petite quantité de données étiquetées de joueurs confirmés. Après un réglage fin, notre modèle peut apprendre à fabriquer des outils en diamant, une tâche qui prend généralement plus de 20 minutes (24 000 actions) à des joueurs expérimentés. Notre modèle utilise l'interface utilisateur naturelle (touches de clavier et mouvements de souris), ce qui le rend très général et représente une avancée vers la création d'agents informatiques capables d'utiliser des ordinateurs de manière générique.

On ne peut pas se fier à la chance : pourquoi les transformateurs de décision échouent dans les environnements stochastiques
Keiran Paster, Sheila McIlraith, Jimmy Ba

Une tendance récente en apprentissage par renforcement profond (RL) consiste à traiter le RL comme un problème de prédiction supervisée, où la prochaine action de l'agent est décidée de manière probabiliste en sélectionnant l'action la plus probable compte tenu d'un résultat futur donné (par exemple, l'obtention d'une récompense importante). Cependant, dans les environnements stochastiques où les récompenses sont affectées par le hasard, ce cadre est biaisé. Dans ce travail, nous décrivons les conditions théoriques dans lesquelles ces méthodes échouent et proposons un nouvel algorithme qui permet au RL, via des algorithmes d'apprentissage supervisé tels que Decision Transformer, de fonctionner de manière optimale même dans des environnements fortement stochastiques. Cela ouvre la voie à une approche unifiée pour la prédiction, la modélisation de séquences et la prise de décision optimale.

Ateliers NeurIPS 2022 coorganisés par les membres du corps professoral de Vector

La symbiose de l'apprentissage profond et des équations différentielles II – Animesh Garg et David Duvenaud

Leçons tirées des séries chronologiques en santé – Anna Goldenberg et Marzyeh Ghassemi

Robustesse dans la modélisation de séquences – Marzyeh Ghassemi

Deuxième atelier sur le traitement efficace du langage naturel et de la parole (ENLSP-II) : L’avenir des modèles préentraînés – Pascal Poupart

IA pour la conception accélérée de matériaux (AI4Mat) – Alán Aspuru-Guzik