Quatre articles coécrits par des membres du corps professoral et des professeurs affiliés à Vector ont été acceptés lors de la conférence de cette année.
Par Natasha Ali
Les membres du corps professoral et les professeurs affiliés de Vector étaient bien représentés à la conférence IEEE/CVF sur la vision par ordinateur et la reconnaissance des formes (CVPR) 2023. La conférence de cette année s'est tenue à Vancouver du 18 au 22 juin.
Cet événement hybride proposait des exposés de recherche, des présentations d'affiches et des ateliers animés par des experts en intelligence artificielle et en informatique. Vingt-quatre articles, coécrits par des membres du corps professoral et des professeurs affiliés de Vector, ont été acceptés lors de la conférence de cette année.
Parmi les articles acceptés, cinq ont été coécrits par Raquel Urtasun, membre du corps professoral et cofondatrice de Vector, dont les recherches portent sur le développement de simulateurs de capteurs neuronaux pour véhicules autonomes. Sanja Fidler, également membre du corps professoral de Vector, a coécrit cinq articles concernant la construction d'environnements 3D pour la réalité virtuelle et les simulations robotiques.
Des chercheurs modifient les modèles d'entraînement NeRF pour améliorer les représentations 3D des images 2D.
Pour « RobustNeRF : Ignorer les distractions avec des pertes robustes », coécrit par David Fleet, membre du corps professoral de Vector et chef de l'équipe Google Research Brain, les chercheurs ont créé un modèle de réseau neuronal qui entraîne les champs de radiance neuronaux (NeRF) à générer des représentations précises de scènes 3D à partir d'images 2D.
Bien que les méthodes NeRF actuelles fonctionnent lorsque toutes les images d'entraînement représentent la même scène « statique », elles produisent des résultats inexacts lorsque la scène varie d'une image à l'autre (par exemple, en raison d'une personne en mouvement, d'un objet transitoire qui apparaît dans certaines images mais pas dans d'autres, ou d'une ombre transitoire).
En utilisant robustNeRF, Fleet et ses coauteurs ont modifié des algorithmes existants et entraîné des modèles de réseaux neuronaux afin d'ignorer les objets transitoires dans les images d'entraînement. « Le résultat », explique Fleet, « est une simple modification des méthodes existantes, qui s'avère extrêmement performante par rapport aux méthodes d'entraînement NeRF modernes. »
Comment les ordinateurs peuvent-ils reconnaître les objets dans les images de la même manière que les humains ?
L'article « Sparsifiner : Apprentissage d'une attention parcimonieuse dépendante des instances pour des transformateurs de vision efficaces », coécrit par Graham Taylor, directeur de recherche au Vector Institute, présente une nouvelle technique moins gourmande en ressources de calcul qui permet aux ordinateurs de reconnaître les objets dans les images de la même manière que les humains. Cet article s'appuie sur des études antérieures portant sur les transformateurs de vision (ViT), des modèles de reconnaissance d'images qui utilisent des algorithmes d'apprentissage profond pour détecter les objets individuels dans les images et les classifier en vue d'une analyse plus approfondie.
Traditionnellement, les systèmes de visualisation utilisent une technique appelée « auto-attention multi-têtes » pour comparer toutes les parties d'une image entre elles. Cependant, ce processus est très exigeant en ressources de calcul.
Pour remédier à ce problème, Taylor et ses coauteurs ont mis au point Sparsifiner, une version plus efficace de ViTs. Ce transformateur de vision prédit les parties d'une image les plus susceptibles d'entretenir des relations significatives, concentre son attention sur ces relations et ignore le reste.
« L’amélioration majeure apportée à Sparsifiner par rapport aux travaux précédents », explique Taylor, « réside dans sa capacité à prédire un modèle d’attention clairsemé unique pour chaque image d’entrée. »
Sparsifiner réduit la puissance de calcul nécessaire sans perte significative de précision, permettant ainsi des technologies de reconnaissance d'images plus avancées dans les zones où les ressources sont limitées.
Articles de recherche acceptés par les membres du corps professoral de Vector
Vous trouverez ci-dessous les résumés et les résumés en langage clair des articles acceptés, coécrits par des membres du corps professoral et des professeurs affiliés à Vector.
Alignez vos latents : Synthèse vidéo haute résolution avec des modèles de diffusion latente
Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, Karsten Kreis
Les modèles de diffusion latente (LDM) permettent la synthèse d'images de haute qualité tout en limitant les besoins de calcul grâce à l'entraînement d'un modèle de diffusion dans un espace latent comprimé de dimension inférieure. Nous appliquons ici le paradigme LDM à la génération de vidéos haute résolution, une tâche particulièrement gourmande en ressources. Nous préentraînons d'abord un LDM sur des images seulement ; puis, on transforme le générateur d'images en un générateur vidéo en introduisant une dimension temporelle dans le modèle de diffusion de l'espace latent et en l'affinant sur des séquences d'images encodées, c'est-à-dire des vidéos. De même, nous alignons temporellement les suréchantillonneurs du modèle de diffusion, les transformant ainsi en modèles de super-résolution vidéo temporellement cohérents. Nous nous concentrons sur deux applications concrètes pertinentes : la simulation de données de conduite réelles et la création de contenu créatif avec modélisation texte-vidéo. En particulier, nous validons notre LDM vidéo sur des vidéos de conduite réelles d'une résolution de 512 × 1024, obtenant des performances de pointe. De plus, notre approche peut facilement exploiter des modèles de diffusion linéaire (LDM) d'images préentraînés disponibles dans le commerce, puisqu'il suffit alors d'entraîner un modèle d'alignement temporel. Ainsi, nous transformons le LDM texte-image Stable Diffusion, accessible publiquement et à la fine pointe de la technologie, en un modèle texte-vidéo efficace et expressif, avec une résolution allant jusqu'à 1280 x 2048. Nous démontrons que les couches temporelles ainsi entraînées se généralisent à différents LDM texte-image affinés. Grâce à cette propriété, nous présentons les premiers résultats de génération personnalisée de contenu texte-vidéo, ouvrant des perspectives prometteuses pour la création de contenu future.
Portes dérobées architecturales dans les réseaux neuronaux
Mikel Bober-Irizar, Ilia Shumailov, Yiren Zhao, Robert Mullins, Nicolas Papernot
La communauté de l'apprentissage machine est actuellement confrontée à une menace : les réseaux neuronaux compromis, intentionnellement modifiés par des attaquants au sein de la chaîne d'approvisionnement. Ces modèles compromis présentent des comportements cachés qui sont déclenchés par un « déclencheur » secret spécifique dans les données d'entrée, tout en fonctionnant normalement par ailleurs. La plupart des attaques par porte dérobée modifient les poids des modèles entraînés, soit directement, soit en manipulant les données d'entraînement. Dans cet article, nous démontrons que l'architecture même des réseaux neuronaux peut être modifiée pour dissimuler des portes dérobées, les rendant ainsi résistantes à leur suppression, même après un réentraînement complet. Nous construisons une preuve de concept, la Porte Dérobée d'Architecture de Modèle (MAB), et proposons une méthode pour construire de telles portes dérobées qui survivent à la réentraînement sur de nouveaux ensembles de données. Nous identifions les conditions requises pour le succès des portes dérobées architecturales et démontrons leur efficacité sur divers ensembles de données de référence. Nos travaux introduisent une nouvelle classe d'attaques par porte dérobée opérant au niveau de l'architecture, surpassant les méthodes précédentes qui reposent sur la modification des poids.
Coopération ou compétition : éviter la domination des joueurs pour une robustesse multicible grâce à des budgets adaptatifs
Yimu Wang, Dinghuai Zhang, Yihan Wu, Heng Huang, Hongyang Zhang
Malgré des progrès considérables, l'apprentissage profond s'avère vulnérable aux attaques adverses. De nombreuses approches ont été proposées pour entraîner des réseaux robustes, tant empiriquement que de manière certifiable. Cependant, la plupart ne protègent que contre un seul type d'attaque, tandis que des travaux récents s'orientent vers la défense contre des attaques multiples. Dans cet article, afin de comprendre la robustesse multi-cible, nous modélisons ce problème comme un jeu de négociation où différents joueurs (adversaires) s'entendent sur une direction commune de mise à jour des paramètres. Nous identifions un phénomène, la « domination des joueurs », dans ce jeu et montrons qu'en présence de ce phénomène, certaines approches existantes basées sur le maximum, comme MAX et MSD, ne convergent pas. À partir de nos résultats théoriques, nous concevons un nouveau cadre qui ajuste les budgets des différents adversaires pour éviter la domination des joueurs. Des expériences menées sur deux ensembles de données de référence montrent que l'intégration de ce cadre aux approches existantes améliore considérablement la robustesse multi-cible.
DINN360 : Réseau neuronal déformable et inversible pour le redimensionnement d’images à 360° tenant compte de la latitude
Yichen Guo, Mai Xu, Lai Jiang, Leonid Sigal, Yunjin Chen
Avec le développement rapide de la réalité virtuelle, les images à 360 degrés connaissent une popularité croissante. Leur large champ de vision exige une haute résolution pour assurer une qualité d'image optimale. Cependant, cela complique l'acquisition, le stockage et même le traitement de ces images. Pour remédier à ce problème, nous proposons une première méthode de redimensionnement d'images à 360 degrés. Ce processus consiste à produire une version valide, mais à faible résolution, de l'image originale, et une méthode permettant de la redimensionner à la haute résolution d'origine si nécessaire. La clé réside dans la définition, ou l'apprentissage, des processus de sous-échantillonnage et de suréchantillonnage. Partant du constat empirique que la quantité d'informations varie avec la latitude dans les images à 360 degrés, nous proposons un nouveau réseau de neurones déformable et inversible pour cette tâche. Notre réseau apprend à sous-échantillonner les images haute résolution en images basse résolution et à projeter les informations haute fréquence dans l'espace latent en s'adaptant aux différentes régions de latitude. La nature inversible du réseau neuronal conçu facilite la mise à l'échelle des images à basse résolution. De nombreuses expériences menées sur quatre ensembles de données publics démontrent que notre méthode surpasse largement les autres méthodes de pointe pour des facteurs de mise à l'échelle d'images à 360 degrés de 2x, 4x et 8x.
Adaptation dynamique guidée par l'instance : une approche sans rétroaction pour la segmentation sémantique adaptative au domaine lors des tests
Wei Wang · Zhun Zhong · Weijie Wang · Xi Chen · Charles Ling · Boyu Wang · Nicu Sebe
Dans cet article, nous étudions l'application de l'adaptation de domaine en temps de test (TTDA-Seg) à la segmentation sémantique, où l'efficacité et la performance sont cruciales. Les méthodes existantes présentent soit une faible efficacité (par exemple, l'optimisation rétrograde), soit négligent l'adaptation sémantique (par exemple, l'alignement de distribution). De plus, elles souffrent d'erreurs cumulées dues à une optimisation instable et à des distributions anormales. Pour résoudre ces problèmes, nous proposons une nouvelle approche sans rétroaction pour la TTDA-Seg, appelée Adaptation Dynamique guidée par l'Instance (DIGA). Notre principe est d'utiliser chaque instance pour guider dynamiquement sa propre adaptation de manière non paramétrique, ce qui évite l'accumulation d'erreurs et les coûts d'optimisation élevés. Plus précisément, DIGA est composé d'un module d'adaptation de distribution (DAM) et d'un module d'adaptation sémantique (SAM), ce qui nous permet d'adapter conjointement le modèle sur deux aspects indispensables. Le DAM combine les statistiques des réseaux bayésiens de l'instance et de la source pour encourager le modèle à saisir une représentation robuste. SAM combine les prototypes historiques avec les prototypes d'instance pour ajuster les prédictions sémantiques, qui peuvent être associées au classificateur paramétrique pour optimiser les résultats finaux. De nombreuses expériences menées sur cinq domaines cibles démontrent l'efficacité de la méthode proposée. Notre DIGA établit de nouvelles performances de pointe en TTDA-Seg.
Exemplar-FreeSOLO : Amélioration de la segmentation d'instances non supervisée grâce aux exemples
Taoseef Ishtiak, Qing En, Yuhong Guo
La segmentation d'instances vise à identifier et segmenter chaque objet d'une image, ce qui nécessite souvent un grand nombre d'annotations denses pour l'entraînement du modèle. Afin d'alléger cette contrainte, des méthodes de segmentation d'instances non supervisées ont été développées pour entraîner des modèles de segmentation d'instances indépendants de la classe, sans aucune annotation. Dans cet article, nous proposons une nouvelle approche de segmentation d'instances non supervisée, Exemplar-FreeSOLO, qui améliore cette approche en exploitant un nombre limité d'exemplaires non annotés et non segmentés. Le cadre proposé offre une nouvelle perspective pour la perception directe d'informations descendantes sans annotations. Plus précisément, Exemplar-FreeSOLO introduit un nouveau module d'abstraction des connaissances des exemplaires afin d'acquérir des connaissances de guidage descendantes utiles pour les instances grâce à l'extraction non supervisée d'objets exemplaires. De plus, un nouveau module de contraste d'intégration d'exemplaires est conçu pour améliorer la capacité de discrimination du modèle de segmentation en exploitant les connaissances de guidage basées sur les exemplaires contrastifs dans l'espace d'intégration. Pour évaluer l'algorithme ExemplarFreeSOLO proposé, nous avons mené des expériences exhaustives et effectué des analyses approfondies sur trois ensembles de données de segmentation d'instances d'images. Les résultats expérimentaux démontrent l'efficacité de l'approche proposée et sa supériorité par rapport aux méthodes de pointe.
Apprentissage de la similarité visuelle géométrique dans l'imagerie médicale 3D : préentraînement autosupervisé
Yuting He, Guanyu Yang, Rongjun Ge, Yang Chen, Jean-Louis Coatrieux, Boyu Wang, Shuo Li
L'apprentissage de la similarité inter-images est crucial pour le préentraînement auto-supervisé des images médicales 3D, en raison du partage de nombreuses régions sémantiques communes. Cependant, l'absence d'information sémantique a priori dans les métriques et la variation indépendante de la sémantique dans les images médicales 3D rendent difficile l'obtention d'une mesure fiable de la similarité inter-images, ce qui entrave l'apprentissage d'une représentation cohérente pour une même sémantique. Nous étudions ce problème complexe, à savoir l'apprentissage d'une représentation cohérente entre les images pour un effet de regroupement de caractéristiques sémantiques communes. Nous proposons un nouveau paradigme d'apprentissage de la similarité visuelle, l'apprentissage de la similarité visuelle géométrique, qui intègre l'information a priori d'invariance topologique dans la mesure de la similarité inter-images pour une représentation cohérente des régions sémantiques. Pour mettre en œuvre ce paradigme, nous construisons une nouvelle tête de correspondance géométrique, la tête de correspondance Z, afin d'apprendre collaborativement la similarité globale et locale des régions sémantiques, guidant ainsi l'apprentissage efficace de la représentation pour des caractéristiques sémantiques inter-images à différentes échelles. Nos expériences démontrent que le pré-entraînement avec notre apprentissage de la similarité inter-images produit une capacité de transfert intra-scène, inter-scène et global-local plus puissante sur quatre tâches d'imagerie médicale 3D difficiles.
Champs de flux d'occupation implicites pour la perception et la prédiction dans la conduite autonome
Ben Agro, Quinlan Sykora, Sergio Casas, Raquel Urtasun
Un véhicule autonome (VA) doit être capable de percevoir son environnement et de prévoir le comportement des autres usagers de la route. Les travaux existants consistent soit à détecter les objets puis à prédire leur trajectoire, soit à prédire des grilles denses d'occupation et de flux pour l'ensemble de la scène. La première approche pose un problème de sécurité, car le nombre de détections doit être limité pour des raisons d'efficacité, au détriment de la mémorisation des objets. La deuxième est gourmande en ressources de calcul en raison de la grande dimensionnalité de la grille de sortie et souffre du champ réceptif limité inhérent aux réseaux entièrement convolutionnels. De plus, ces deux approches utilisent de nombreuses ressources de calcul pour prédire des zones ou des objets qui ne seront peut-être jamais interrogés par le planificateur de mouvement. Cela motive notre approche unifiée de la perception et de la prédiction, qui représente implicitement l'occupation et le flux au fil du temps grâce à un seul réseau neuronal. Notre méthode évite les calculs inutiles, car elle peut être directement interrogée par le planificateur de mouvement à des emplacements spatio-temporels continus. De plus, nous concevons une architecture qui surmonte le champ réceptif limité des méthodes précédentes de prédiction d'occupation explicites en ajoutant un mécanisme d'attention global efficace. Grâce à des expériences approfondies menées en milieu urbain et autoroutier, nous démontrons que notre modèle implicite surpasse l'état de l'art actuel.
Apprentissage des représentations compactes pour l'achèvement et la génération LiDAR
Yuwen Xiong, Wei-Chiu Ma, Jingkang Wang, Raquel Urtasun
Le LiDAR fournit des mesures géométriques précises du monde 3D. Malheureusement, les LiDAR haute densité sont très coûteux et les nuages de points capturés par les LiDAR à faisceau bas sont souvent clairsemés. Pour remédier à ces problèmes, nous présentons UltraLiDAR, un cadre basé sur les données pour l'achèvement, la génération et la manipulation de données LiDAR au niveau de la scène. Le principe d'UltraLiDAR repose sur une représentation discrète et compacte qui encode la structure géométrique du nuage de points, est robuste au bruit et facile à manipuler. Nous montrons qu'en alignant la représentation d'un nuage de points clairsemé sur celle d'un nuage de points dense, nous pouvons densifier les nuages de points clairsemés comme s'ils avaient été capturés par un véritable LiDAR haute densité, réduisant ainsi considérablement le coût. De plus, en apprenant une information a priori sur le dictionnaire discret, on peut générer des nuages de points LiDAR diversifiés et réalistes pour la conduite autonome. Nous évaluons l'efficacité d'UltraLiDAR pour la complétion de nuages de points clairsemés vers des nuages denses et la génération de données LiDAR. Les expériences montrent que la densification des nuages de points réels grâce à notre approche améliore considérablement les performances des systèmes de perception en aval. Comparé aux méthodes existantes de génération LiDAR, notre approche produit des nuages de points beaucoup plus réalistes. Selon un test A/B, dans plus de 98,5 % des cas, les participants humains préfèrent nos résultats à ceux des méthodes précédentes.
Créer une histoire : Création d’histoires cohérentes conditionnée par la mémoire visuelle
Tanzila Rahman, Hsin-Ying Lee, Jian Ren, Sergey Tulyakov, Shweta Mahajan, Leonid Sigal
Dans ce travail, nous nous intéressons à la génération d'histoires, dont le but est de produire une séquence d'images illustratives cohérentes à partir d'une séquence de phrases – un récit textuel. Cette capacité offre de nombreuses applications intéressantes, notamment la visualisation de ressources pédagogiques et l'assistance aux artistes pour la création de webcomics. Une bonne génération d'histoires visuelles repose non seulement sur la capacité de générer des visuels de haute qualité, mais aussi sur un rendu cohérent des scènes et des personnages, en préservant par exemple leur apparence. De plus, les histoires réalistes sont par nature référentielles et nécessitent la capacité de résoudre les ambiguïtés et les références (ou coréférences) par le raisonnement. Aucun de ces deux défis n'a été abordé dans les travaux antérieurs. Dans cet article, nous étudions pour la première fois (à notre connaissance) la résolution des coréférences dans la génération d'histoires. Pour ce faire, nous introduisons Story-LDM, une approche générative profonde à structure autorégressive. Au sein de ce modèle, nous proposons un nouveau mécanisme d'attention mémorielle qui tient compte de la sémantique déjà générée des images précédentes afin d'assurer la cohérence temporelle et la fluidité du récit. Pour valider la résolution de coréférence et la cohérence entre les personnages et l'arrière-plan, nous avons étendu les ensembles de données et les mesures d'évaluation existants afin d'inclure des scénarios plus complexes. Notre méthode proposée surpasse non seulement les méthodes de pointe actuelles en générant des images de haute qualité visuelle, mais elle modélise également les correspondances appropriées entre les personnages et l'arrière-plan.
MixSim : un cadre hiérarchique pour la simulation de trafic en réalité mixte
Simon Suo, Kelvin Wong, Justin Xu, James Tu, Alexander Cui, Sergio Casas, Raquel Urtasun
La méthode courante pour tester un véhicule autonome (VA) en simulation consiste à rejouer en boucle ouverte, sans réaction, des scénarios réels. Cependant, pour déployer les VA en toute sécurité dans le monde réel, il est nécessaire de les évaluer en boucle fermée. Dans cette optique, nous proposons d'exploiter la multitude de scénarios intéressants capturés dans le monde réel et de les rendre réactifs et contrôlables afin de permettre l'évaluation des VA en boucle fermée dans des situations hypothétiques. Plus précisément, nous présentons MIXSIM, un cadre hiérarchique pour la simulation de trafic en réalité mixte. MIXSIM modélise explicitement les objectifs des agents comme des itinéraires sur le réseau routier et apprend une politique réactive de gestion des itinéraires. En déduisant l'itinéraire de chaque agent à partir du scénario original, MIXSIM peut simuler à nouveau le scénario de manière réactive et permettre de tester différents systèmes d'autonomie dans les mêmes conditions. De plus, en faisant varier l'itinéraire de chaque agent, on peut étendre la portée des tests à des situations hypothétiques avec des variations réalistes dans les comportements des agents, voire des interactions critiques pour la sécurité. Nos expériences montrent que MIXSIM peut servir de jumeau numérique réaliste, réactif et contrôlable de scénarios du monde réel.
Les champs neuronaux rencontrent des représentations géométriques explicites pour le rendu inverse de scènes urbaines
Zian Wang, Tianchang Shen, Jun Gao, Shengyu Huang, Jacob Munkberg, Jon Hasselgren, Zan Gojcic, Wenzheng Chen, Sanja Fidler
La reconstruction et la décomposition intrinsèque de scènes à partir d'images capturées permettraient de nombreuses applications telles que le rééclairage et l'insertion d'objets virtuels. Les méthodes récentes basées sur NeRF atteignent une fidélité impressionnante de reconstruction 3D, mais intègrent l'éclairage et les ombres dans le champ de radiance. Quant aux méthodes basées sur un maillage, qui facilitent la décomposition intrinsèque par rendu différentiable, elles ne sont pas encore adaptées à la complexité et à l'échelle des scènes extérieures. Nous présentons un nouveau cadre de rendu inverse pour les grandes scènes urbaines, capable de reconstruire conjointement la géométrie de la scène, les matériaux spatialement variables et l'éclairage HDR à partir d'un ensemble d'images RGB posées, avec une profondeur optionnelle. Plus précisément, nous utilisons un champ neuronal pour tenir compte des rayons primaires et un maillage explicite (reconstruit à partir du champ neuronal sous-jacent) pour modéliser les rayons secondaires qui produisent des effets d'éclairage d'ordre supérieur, tels que les ombres portées. En dissociant fidèlement la géométrie et les matériaux complexes des effets d'éclairage, notre méthode permet un rééclairage photoréaliste avec des effets spéculaires et d'ombre sur plusieurs ensembles de données extérieurs. De plus, il prend en charge les manipulations de scènes basées sur la physique, comme l'insertion d'objets virtuels avec projection d'ombres par lancer de rayons.
Reconstruction de surface par noyau neuronal
Jiahui Huang, Zan Gojcic, Matan Atzmon ou Litanie, Sanja Fidler, Francis Williams
Nous présentons une méthode novatrice pour la reconstruction d'une surface 3D implicite à partir d'un nuage de points clairsemé, bruité et de grande taille. Notre approche s'appuie sur la représentation par champs de noyaux neuronaux (NKF), récemment introduite. Elle offre des capacités de généralisation similaires à celles des NKF, tout en palliant leurs principales limitations : (a) Grâce à des fonctions noyau compactes, nous pouvons traiter des scènes de grande taille et utiliser des solveurs linéaires clairsemés à faible consommation de mémoire. (b) Notre méthode est robuste au bruit grâce à une méthode d'ajustement de gradient. (c) Nous minimisons les besoins d'apprentissage, ce qui nous permet d'apprendre à partir de n'importe quel ensemble de données de points denses et orientés, et même de combiner des données d'apprentissage composées d'objets et de scènes à différentes échelles. Notre méthode est capable de reconstruire des millions de points en quelques secondes et de traiter des scènes très volumineuses en mode hors mémoire. Nous obtenons des résultats de pointe sur des ensembles de données de reconstruction composés d'objets isolés, de scènes d'intérieur et de scènes d'extérieur.
NeuralField-LDM : Génération de scènes avec des modèles hiérarchiques de diffusion latente
Seung Wook Kim, Bradley Brown, Kangxue Yin, Karsten Kreis, Katja Schwarz, Daiqing Li, Robin Rombach, Antonio Torralba, Sanja Fidler
La génération automatique de scènes 3D réalistes de haute qualité présente un intérêt considérable pour des applications telles que la réalité virtuelle et la simulation robotique. Dans cette optique, nous introduisons NeuralField-LDM, un modèle génératif capable de synthétiser des environnements 3D complexes. Nous exploitons les modèles de diffusion latente, qui ont été utilisés avec succès pour la création efficace de contenu 2D de haute qualité. Nous entraînons d'abord un auto-encodeur de scène pour exprimer un ensemble de paires image-pose sous forme de champ neuronal, représenté par des grilles de voxels de densité et de caractéristiques pouvant être projetées pour produire de nouvelles vues de la scène. Afin de compresser davantage cette représentation, on entraîne un auto-encodeur latent qui transforme les grilles de voxels en un ensemble de représentations latentes. Un modèle de diffusion hiérarchique est ensuite ajusté aux latentes pour finaliser le processus de génération de scène. Nous obtenons ainsi une amélioration significative par rapport aux modèles de génération de scène de pointe existants. De plus, nous montrons comment NeuralField-LDM peut être utilisé pour diverses applications de création de contenu 3D, notamment la génération de scènes conditionnelles, le remplissage de scènes et la manipulation du style de scène.
Omnimatte3D : Association des objets et de leurs effets dans la vidéo monoculaire non contrainte
Erika Lu, Forrester Cole, Tali Dekel, Andrew Zisserman, William T. Freeman, Michael Rubinstein
Dans ce travail, nous proposons une méthode de décomposition vidéo en arrière-plan et un ensemble de couches de premier plan. L'arrière-plan capture les éléments fixes, tandis que les couches de premier plan capturent les objets en mouvement ainsi que leurs effets associés (ombres et reflets, par exemple). Notre approche est conçue pour les vidéos monoculaires sans contrainte, avec des mouvements de caméra et d'objets arbitraires, contrairement aux méthodes précédentes qui fonctionnent sur des vidéos à amplitude de mouvement limitée. La représentation en couches que nous prédisons s'avère utile dans de nombreuses applications telles que la suppression d'objets, la stabilisation de la caméra, le flou synthétique, etc. La nouveauté technique réside dans une série d'objectifs d'apprentissage proposés, qui garantissent une décomposition appropriée en la représentation en couches.
Préservation de la séparabilité linéaire dans l'apprentissage continu par projection de caractéristiques rétrograde
Qiao Gu, Dongsub Shim, Florian Shkurti
L'oubli catastrophique représente un défi majeur pour l'apprentissage continu, où le modèle doit apprendre de nouvelles tâches avec un accès limité, voire inexistant, aux données des tâches précédemment apprises. Pour remédier à cela, des méthodes basées sur la distillation des connaissances dans l'espace des caractéristiques ont été proposées et ont démontré leur capacité à réduire l'oubli. Cependant, la plupart de ces méthodes contraignent directement les nouvelles caractéristiques à correspondre aux anciennes, négligeant ainsi la nécessité de plasticité. Afin d'obtenir un meilleur compromis entre stabilité et plasticité, nous proposons la Projection de caractéristiques rétrogrades (BFP), une méthode d'apprentissage continu permettant aux nouvelles caractéristiques d'évoluer jusqu'à une transformation linéaire apprenable des anciennes. La BFP préserve la séparabilité linéaire des anciennes classes tout en permettant l'émergence de nouvelles directions de caractéristiques pour intégrer les nouvelles classes. La BFP peut être intégrée aux méthodes de réutilisation de l'expérience existantes et améliore considérablement les performances. Nous démontrons également que la BFP contribue à l'apprentissage d'un meilleur espace de représentation, dans lequel la séparabilité linéaire est bien préservée lors de l'apprentissage continu et où le sondage linéaire permet d'atteindre une précision de classification élevée.
RobustNeRF : Ignorer les distractions avec des pertes robustes
Sara Sabour, Suhani Vora, Daniel Duckworth, Ivan Krasin, David J. Fleet, Andrea Tagliasacchi
Les champs de radiance neuronaux (NeRF) excellent dans la synthèse de nouvelles vues à partir d'images multivues et calibrées d'une scène statique. Lorsque les scènes contiennent des éléments perturbateurs, non persistants lors de la capture d'images (objets en mouvement, variations d'éclairage, ombres), des artefacts apparaissent sous forme d'effets dépendants du point de vue ou de « flottants ». Pour pallier à ces perturbations, nous préconisons une estimation robuste pour l'entraînement des NeRF, modélisant les éléments perturbateurs des données d'entraînement comme des valeurs aberrantes d'un problème d'optimisation. Notre méthode élimine efficacement ces valeurs aberrantes et améliore nos performances de référence, sur des scènes synthétiques et réelles. Facile à intégrer aux cadres NeRF modernes, notre technique ne requiert que peu d'hyperparamètres. Elle ne suppose aucune connaissance a priori des types d'éléments perturbateurs et se concentre sur le problème d'optimisation plutôt que sur le prétraitement ou la modélisation d'objets transitoires.
SparsePose : Régression et raffinement de la pose de la caméra à vue clairsemée
Samarth Sinha, Jason Y. Zhang, Andrea Tagliasacchi, Igor Gilitschenski, David B. Lindell
L'estimation de la pose de la caméra est une étape cruciale des chaînes de traitement 3D classiques qui fonctionnent avec un ensemble dense d'images d'un même objet ou d'une même scène. Cependant, les méthodes d'estimation de pose échouent souvent lorsqu'on ne dispose que de quelques images, car elles reposent sur la capacité d'identifier et de faire correspondre de manière robuste les caractéristiques visuelles entre paires d'images. Bien que ces méthodes fonctionnent efficacement avec un grand nombre de vues, la capture d'un grand nombre d'images peut s'avérer longue, voire impossible. Nous proposons SparsePose pour la reconstruction précise des poses de caméra à partir d'un ensemble restreint d'images à large base (moins de 10). La méthode apprend à régresser les poses initiales de la caméra, puis les affine itérativement après un entraînement sur un vaste ensemble de données d'objets (Co3D : Common Objects in 3D). SparsePose surpasse considérablement les méthodes de référence conventionnelles et celles basées sur l'apprentissage automatique pour la reconstruction précise des rotations et des translations de la caméra. Nous présentons également notre chaîne de traitement pour la reconstruction 3D haute fidélité à partir de seulement 5 à 9 images d'un objet.
Sparsifiner : Apprentissage d'une attention parcimonieuse dépendante des instances pour des transformateurs de vision efficaces
Cong Wei, Brendan Duke, Ruowei Jiang, Parham Aarabi, Graham W. Taylor, Florian Shkurti
Les Transformers Vision (ViT) ont démontré leur supériorité en termes de performances par rapport aux réseaux neuronaux convolutifs (CNN), malgré des coûts de calcul souvent élevés. À cette fin, les méthodes précédentes explorent différents schémas d'attention en limitant un nombre fixe de jetons spatialement proches afin d'accélérer les opérations d'auto-attention multi-têtes (MHSA) des ViT. Cependant, ces schémas d'attention structurés limitent les connexions entre les jetons à leur pertinence spatiale, négligeant ainsi les connexions sémantiques apprises à partir d'un masque d'attention complet. Dans ce travail, nous proposons une nouvelle approche pour apprendre des schémas d'attention dépendants de l'instance, en concevant un module de prédiction de connectivité léger pour estimer le score de connectivité de chaque paire de jetons. Intuitivement, deux jetons ont des scores de connectivité élevés si leurs caractéristiques sont considérées comme pertinentes, que ce soit spatialement ou sémantiquement. Comme chaque jeton n'interagit qu'avec un petit nombre d'autres jetons, les masques de connectivité binarisés sont souvent très clairsemés par nature et offrent ainsi la possibilité d'accélérer le réseau grâce à des calculs parcimonieux. Grâce à son modèle d'attention non structurée appris, l'algorithme ViT à attention parcimonieuse (Sparsifiner) offre un compromis Pareto-optimal supérieur entre les FLOP et la précision top-1 sur ImageNet, comparé à la parcimonie des tokens. Notre méthode réduit les FLOP de MHSA de 48 % à 69 %, tandis que la perte de précision reste inférieure à 0,4 %. Nous démontrons également que la combinaison de l'attention et de la parcimonie des jetons réduit les FLOPs de ViT de plus de 60 %.
SPIn-NeRF : Segmentation multivue et remplissage perceptuel avec des champs de radiance neuronaux
Ashkan Mirzaei, Tristan Aumentado-Armstrong, Konstantinos G. Derpanis, Jonathan Kelly, Marcus A. Brubaker, Igor Gilitschenski, Alex Levinshtein
Les champs de radiance neuronaux (NeRF) sont devenus une approche populaire pour la synthèse de nouvelles vues. Bien que les NeRF soient rapidement adaptés à un plus large éventail d'applications, l'édition intuitive de scènes NeRF reste un défi. Une tâche d'édition importante consiste à supprimer les objets indésirables d'une scène 3D, de sorte que la région remplacée soit visuellement plausible et cohérente avec son contexte. Nous désignons cette tâche par le terme de remplissage 3D. En 3D, les solutions doivent être à la fois cohérentes entre plusieurs vues et géométriquement valides. Dans cet article, nous proposons une nouvelle méthode de remplissage 3D qui relève ces défis. À partir d'un petit ensemble d'images posées et d'annotations éparses dans une seule image d'entrée, notre cadre obtient d'abord rapidement un masque de segmentation 3D pour un objet cible. À l'aide de ce masque, une approche basée sur l'optimisation perceptive est ensuite introduite, qui exploite des modèles de remplissage d'images 2D appris, en extrayant leurs informations dans l'espace 3D, tout en assurant la cohérence des vues. Nous pallions également le manque de données de référence diversifiées pour l'évaluation des méthodes de remplissage de scènes 3D en introduisant un ensemble de données composé de scènes réelles complexes. Plus précisément, notre ensemble de données contient des vues d'une même scène avec et sans objet cible, permettant ainsi une évaluation plus rigoureuse de la tâche de remplissage 3D. Nous démontrons d'abord la supériorité de notre approche sur la segmentation multivue, en la comparant aux méthodes basées sur NeRF et aux approches de segmentation 2D. Nous l'évaluons ensuite sur la tâche de remplissage 3D, établissant des performances de pointe par rapport à d'autres algorithmes de manipulation NeRF, ainsi qu'à une référence solide pour le remplissage d'images 2D.
StepFormer : Découverte et localisation autonomes des étapes dans les vidéos pédagogiques
Nikita Dvornik, Isma Hadji, Ran Zhang, Konstantinos G. Derpanis, Animesh Garg, Richard P. Wildes, Allan D. Jepson
Les tutoriels vidéo constituent une ressource précieuse pour l'apprentissage de tâches procédurales à partir de démonstrations humaines. Cependant, les étapes d'instruction y sont généralement courtes et peu nombreuses, la majeure partie de la vidéo étant superflue. Cela souligne la nécessité de localiser temporellement ces étapes, une tâche appelée localisation des étapes clés. Les méthodes traditionnelles de localisation des étapes clés nécessitent des annotations humaines au niveau de la vidéo et ne sont donc pas adaptées aux grands ensembles de données. Dans ce travail, nous abordons ce problème sans supervision humaine et présentons StepFormer, un modèle auto-supervisé qui découvre et localise les étapes d'instruction dans une vidéo. StepFormer est un décodeur de type transformateur qui analyse la vidéo à l'aide de requêtes apprenables et produit une séquence d'emplacements (slots) capturant les étapes clés. Nous entraînons notre système sur un vaste ensemble de données de tutoriels vidéo, en utilisant leurs sous-titres générés automatiquement comme seule source de supervision. Plus précisément, nous supervisons notre système avec une séquence de narrations textuelles, en utilisant une fonction de perte sensible à l'ordre qui filtre les phrases non pertinentes. Nous démontrons que notre modèle surpasse largement toutes les approches non supervisées et faiblement supervisées précédentes en matière de détection et de localisation d'étapes sur trois ensembles de données de référence exigeants. De plus, notre modèle présente une propriété émergente lui permettant de résoudre la localisation multi-étapes sans exemple préalable et surpasse toutes les méthodes de référence pertinentes pour cette tâche.
Vers une détection d'objets non supervisée à partir de nuages de points LiDAR
Lunjun Zhang, Anqi Joyce Yang, Yuwen Xiong, Sergio Casas Bin Yang, Mengye Ren, Raquel Urtasun
Dans cet article, nous étudions le problème de la détection non supervisée d'objets à partir de nuages de points 3D dans des scènes de conduite autonome. Nous présentons une méthode simple mais efficace qui exploite : (i) le regroupement de points dans les zones de proximité où les nuages de points sont denses ; (ii) la cohérence temporelle pour filtrer les détections non supervisées bruitées ; (iii) l'équivariance par translation des CNN pour étendre l'étiquetage automatique à longue portée ; et (iv) l'autosurveillance pour une amélioration continue. Notre approche, OYSTER (Object Discovery via Spatio-Temporal Refinement), ne contraint pas la collecte de données (par exemple, en limitant les passages au même endroit), détecte les objets sans apprentissage supervisé (même dans les régions clairsemées et éloignées) et continue de s'améliorer grâce à des itérations d'auto-apprentissage. Pour mieux évaluer les performances du modèle dans les scénarios de conduite autonome, nous proposons une nouvelle mesure de perception axée sur la planification et basée sur la distance de collision. Nous démontrons que notre détecteur d'objets non supervisé surpasse significativement les méthodes de référence non supervisées sur les ensembles de données PandaSet et Argoverse 2 Sensor, ce qui est prometteur quant à la possibilité que l'autosupervision combinée à des connaissances préalables sur les objets permette la découverte d'objets en conditions réelles.
Trace et rythme : animation piétonne contrôlable par diffusion de trajectoire guidée
Davis Rempe, Zhengyi Luo, Xue Bin Peng, Ye Yuan, Kris Kitani, Karsten Kreis, Sanja Fidler ou Litany
Nous présentons une méthode de génération de trajectoires piétonnes réalistes et d'animations corporelles complètes, contrôlables selon les objectifs définis par l'utilisateur. Nous nous appuyons sur les avancées récentes en modélisation de diffusion guidée pour permettre le contrôle des trajectoires en temps réel, une fonctionnalité généralement réservée aux systèmes à base de règles. Notre modèle de diffusion guidée permet aux utilisateurs de contraindre les trajectoires par des points de passage cibles, la vitesse et des groupes sociaux spécifiques, tout en tenant compte du contexte environnemental. Ce modèle de diffusion de trajectoires est intégré à un nouveau contrôleur humanoïde physique pour former un système d'animation piétonne complet en boucle fermée, capable de gérer de grandes foules dans un environnement simulé aux terrains variés. Nous proposons également d'utiliser la fonction de valeur apprise lors de l'apprentissage par renforcement du contrôleur d'animation pour guider la diffusion et produire des trajectoires mieux adaptées à des scénarios particuliers, tels que l'évitement des collisions et la traversée de terrains accidentés.
UniSim : un simulateur de capteurs neuronaux en boucle fermée
Ze Yang, Yun Chen, Jingkang Wang, Siva Manivasagam, Wei-Chiu Ma, Anqi Joyce Yang, Raquel Urtasun
Tester rigoureusement les systèmes d'autonomie est essentiel pour que les véhicules autonomes sûrs (VAS) deviennent une réalité. Cela nécessite de générer des scénarios critiques pour la sécurité, au-delà de ce qui peut être collecté en toute sécurité dans le monde réel, car de nombreux scénarios sont rares sur nos routes. Pour évaluer précisément les performances, il est nécessaire de tester le VAS sur ces scénarios en boucle fermée, où le VAS et d'autres acteurs interagissent à chaque étape. Les journaux de conduite enregistrés précédemment constituent une ressource précieuse pour construire ces nouveaux scénarios, mais pour une évaluation en boucle fermée, il est nécessaire de modifier les données des capteurs en fonction de la nouvelle configuration de la scène et des décisions du VAS, car des acteurs peuvent être ajoutés ou supprimés et les trajectoires des acteurs existants et du VAS différeront du journal original. Dans cet article, nous présentons UniSim, un simulateur de capteurs neuronal qui prend un seul enregistrement capturé par un véhicule équipé de capteurs et le convertit en une simulation multicapteurs réaliste en boucle fermée. UniSim construit des grilles de caractéristiques neuronales pour reconstruire à la fois l'arrière-plan statique et les acteurs dynamiques de la scène, puis les combine pour simuler des données LiDAR et caméra sous de nouveaux angles, avec des acteurs ajoutés ou supprimés et à de nouveaux emplacements. Afin de mieux gérer les vues extrapolées, nous intégrons des connaissances a priori apprenables pour les objets dynamiques et utilisons un réseau convolutionnel pour compléter les régions non observées. Nos expériences montrent qu'UniSim peut simuler des données de capteurs réalistes avec un faible écart de domaine sur les tâches en aval. Avec UniSim, nous démontrons, pour la première fois, l'évaluation en boucle fermée d'un système autonome dans des scénarios critiques pour la sécurité, comme s'il était en situation réelle.