Les chercheurs de Vector ont apporté une contribution significative à la Conférence internationale sur l'apprentissage des représentations (ICLR) de cette année, le principal événement mondial consacré à la recherche sur l'apprentissage des représentations et l'apprentissage profond, qui s'est tenu du 24 au 28 avril 2025 à Singapour. Conférence de référence sur la manière dont les machines apprennent à construire des représentations pertinentes des données, l'ICLR a réuni la communauté internationale travaillant sur les fondements théoriques et les applications pratiques de l'apprentissage profond.
Le portefeuille de recherche de Vector à ICLR 2025 a démontré le leadership de l'institut dans les domaines clés de l'apprentissage des représentations : des travaux fondamentaux sur les architectures neuronales, l'optimisation et la compréhension théorique aux applications innovantes couvrant l'IA multimodale, la découverte scientifique et l'apprentissage automatique responsable. Les articles acceptés témoignent de l'engagement de Vector à faire progresser la science de l'apprentissage des représentations par les réseaux neuronaux et à développer des systèmes d'IA fiables au service de la société.
Vous trouverez ci-dessous 71 articles acceptés, y compris des collaborations, provenant de membres du corps professoral de Vector, de professeurs affiliés à Vector, de boursiers postdoctoraux distingués de Vector et de l'équipe d'ingénierie en IA de Vector.
ACES : Système d'extraction automatique de cohortes pour les ensembles de données de flux d'événements
Justin Xu, Jack Gallifant, Alistair Johnson (membre affilié de la faculté Vector), Matthew McDermott
Abstrait
La reproductibilité demeure un défi majeur en apprentissage automatique (AA) appliqué à la santé. Dans ce domaine, les jeux de données, les pipelines de modélisation et même les définitions de tâches/cohortes sont souvent privés, ce qui constitue un obstacle important au partage, à l'itération et à la compréhension des résultats d'AA sur les données des dossiers médicaux électroniques (DME). Cet article aborde une partie importante de ce problème en présentant le système d'extraction automatique de cohortes (ACES) pour les données de flux d'événements. Cette bibliothèque est conçue pour simplifier simultanément le développement de tâches/cohortes pour l'AA en santé et permettre la reproduction de ces cohortes, tant au niveau exact pour un ensemble de données unique qu'au niveau conceptuel entre différents ensembles de données. Pour ce faire, ACES fournit : (1) un langage de configuration très intuitif et expressif permettant de définir des concepts spécifiques à un jeu de données ainsi que des critères d'inclusion/exclusion indépendants de l'ensemble de données ; et (2) un pipeline permettant d'extraire automatiquement les dossiers des patients répondant à ces critères à partir de données réelles. ACES peut être appliqué automatiquement à tout jeu de données aux formats MEDS (Medical Event Data Standard) ou ESGPT (EventStreamGPT), ou à tout jeu de données permettant d'extraire les prédicats spécifiques à la tâche sous forme de flux d'événements. ACES a le potentiel de simplifier considérablement la définition des tâches d'apprentissage machine pour l'apprentissage de représentations, de redéfinir la manière dont les chercheurs interagissent avec les données des dossiers médicaux électroniques et d'améliorer considérablement la reproductibilité des études d'apprentissage automatique dans ce domaine.
Abstractions d'actions pour l'échantillonnage amorti
Oussama Boussif, Léna Ezzine, Joseph Viviano, Michał Koziarski (affilié de la faculté Vector), Moksh Jain, Nikolay Malkin, Emmanuel Bengio, Rim Assouel, Yoshua Bengio
Abstrait
À mesure que les trajectoires échantillonnées par les politiques utilisées par l'apprentissage par renforcement (RL) et les réseaux de flux génératifs (GFlowNets) s'allongent, l'attribution du crédit et l'exploration deviennent plus complexes, et le long horizon de planification entrave la découverte de modes et la généralisation. Ce défi est particulièrement marqué dans les méthodes RL de recherche d'entropie, telles que les réseaux de flux génératifs, où l'agent doit apprendre à échantillonner une distribution structurée et à découvrir de multiples états à haute récompense, chacun nécessitant de nombreuses étapes pour être atteint. Pour relever ce défi, nous proposons une approche intégrant la découverte d'abstractions d'actions, ou actions de haut niveau, au processus d'optimisation de la politique. Notre approche consiste à extraire itérativement des sous-séquences d'actions fréquemment utilisées dans de nombreuses trajectoires à haute récompense et à les regrouper en une seule action ajoutée à l'espace d'actions. Lors d'une évaluation empirique sur des environnements synthétiques et réels, notre approche démontre une amélioration de l'efficacité d'échantillonnage dans la découverte d'objets à haute récompense variés, notamment pour les problèmes d'exploration plus difficiles. Nous observons également que les actions d'ordre supérieur abstraites sont potentiellement interprétables, capturant la structure latente du paysage de récompenses. espace d'action. Ce travail propose une approche cognitive de l'abstraction des actions dans l'apprentissage par renforcement et constitue la première démonstration de planification hiérarchique dans l'échantillonnage séquentiel amorti.
AttriBoT : Un ensemble d'astuces pour une approximation efficace de l'attribution de contexte par validation croisée (leave-one-out).
Fengyuan Liu, Nikhil Kandpal, Colin Raffel (membre du corps professoral de Vector)
Abstrait
L'influence du contexte sur le comportement des grands modèles de langage (GML) a mené au développement de méthodes d'attribution de contexte visant à quantifier l'effet de chaque segment de contexte sur les générations d'un GML. L'erreur de validation croisée (ou « leave-one-out »), qui mesure la variation de la vraisemblance de la réponse du GML lorsqu'un segment de contexte donné est supprimé, offre une méthode rigoureuse d'attribution de contexte, mais son calcul peut s'avérer prohibitif pour les grands modèles. Dans ce travail, nous présentons AttriBoT, un ensemble de nouvelles techniques permettant de calculer efficacement une approximation de l'erreur de validation croisée pour l'attribution de contexte. Plus précisément, AttriBoT utilise des activations mises en cache pour éviter les opérations redondantes, effectue une attribution hiérarchique pour réduire le temps de calcul et émule le comportement des grands modèles cibles à l'aide de modèles proxy plus petits. Ainsi, AttriBoT permet un gain de vitesse d'un facteur de 300 tout en demeurant plus fidèle à l'erreur de validation croisée du modèle cible que les méthodes d'attribution de contexte précédentes. Cette nette amélioration des performances rend le calcul des attributions de contexte pour une réponse donnée 30 fois plus rapide que la génération de la réponse elle-même, ce qui permet de développer des applications concrètes nécessitant des calculs d'attribution à grande échelle. Nous publions une implémentation conviviale et performante d'AttriBoT afin de faciliter l'interprétation des modèles de langage naturel (LLM) et d'encourager le développement futur de méthodes d'attribution de contexte efficaces.
Conception automatisée de systèmes agents
Shengran Hu, Cong Lu, Jeff Clune (membre du corps professoral de Vector)
Abstrait
Les chercheurs investissent des efforts considérables dans le développement d'agents polyvalents performants, où les modèles de base sont utilisés comme modules au sein de systèmes agentiques (par exemple, Chain-of-Thought, Self-Reflection, Toolformer). Cependant, l'histoire de l'apprentissage machine nous apprend que les solutions conçues manuellement sont éventuellement remplacées par des solutions apprises. Nous décrivons un nouveau domaine de recherche émergent, la conception automatisée de systèmes agentiques (ADAS), qui vise à créer automatiquement des systèmes agentiques performants, notamment en inventant de nouveaux modules et/ou en les combinant de manière inédite. Nous démontrons également l'existence d'une approche prometteuse, encore inexplorée, au sein d'ADAS : les agents peuvent être définis par le code et de nouveaux agents peuvent être automatiquement découverts par un méta-agent programmant des agents toujours plus performants. Étant donné que les langages de programmation sont Turing-complets, cette approche permet théoriquement l'apprentissage de tout système agentique possible : incluant de nouvelles invites, l'utilisation d'outils, des flux de travail et leurs combinaisons. Nous présentons un algorithme simple mais efficace, nommé Meta Agent Search, pour illustrer cette idée. Dans cet algorithme, un méta-agent programme itérativement de nouveaux agents intéressants à partir d'une archive sans cesse enrichie de découvertes antérieures. Grâce à de nombreuses expériences menées dans divers domaines, dont la programmation, les sciences et les mathématiques, nous démontrons que notre algorithme peut générer progressivement des agents aux conceptions novatrices, surpassant largement les agents conçus manuellement les plus performants. Plus important encore, nous observons systématiquement un résultat surprenant : les agents générés par Meta Agent Search conservent des performances supérieures même lorsqu'ils sont transférés entre différents domaines et modèles, ce qui témoigne de leur robustesse et de leur généralité. Si nous poursuivons son développement en toute sécurité, notre travail illustre le potentiel d'une nouvelle voie de recherche prometteuse : la conception automatique de systèmes agentiels de plus en plus puissants au service de l'humanité.
Optimisation bayésienne par apprentissage variationnel continu de la dernière couche
Article vedette
Paul Brunzema, Mikkel Jordahn, John Willes (personnel professionnel de Vector), Sebastian Trimpe, Jasper Snoek, James Harrison
Abstrait
Les processus gaussiens (PG) sont largement considérés comme les modèles de substitution de pointe pour l'optimisation bayésienne (OB) grâce à leur capacité à modéliser l'incertitude et à leurs performances sur les tâches où les corrélations sont facilement capturées (telles que celles définies par les métriques euclidiennes), ainsi qu'à leur aptitude à être mis à jour efficacement en ligne. Cependant, les performances des PG dépendent du choix du noyau, et la sélection de ce noyau pour des structures de corrélation complexes est souvent difficile ou doit être personnalisée. Bien que les réseaux neuronaux bayésiens (RNB) constituent une voie prometteuse pour les modèles de substitution à plus grande capacité, leur utilisation est restée jusqu'à présent limitée en raison de leurs faibles performances sur certains types de problèmes. Dans cet article, nous proposons une approche qui affiche des performances compétitives sur de nombreux types de problèmes, y compris certains pour lesquels les RNB rencontrent généralement des difficultés. Nous nous appuyons sur les dernières couches bayésiennes variationnelles (LBV) et relions l'entraînement de ces modèles au conditionnement exact des PG. Nous exploitons ce lien pour développer un algorithme d'entraînement en ligne efficace qui entrelace le conditionnement et l'optimisation. Nos résultats suggèrent que les réseaux VBLL surpassent significativement les GP et autres architectures BNN sur les tâches présentant des corrélations d'entrée complexes, et égalent les performances des GP bien réglés sur les tâches de référence établies.
Au-delà du jeu de l'imitation : quantifier et extrapoler les capacités des modèles de langage
Auteurs
Clemencia Siro, Guy Gur-Ari, Gaurav Mishra, Stuart Shieber, Jason Phang, Zijie Wang, Kory Mathewson, Giorgio Mariani, Allen Nie, James Y Zou, Behnam Neyshabur, Karl Krauth, Shixiang Gu, Pablo Antonio Moreno Casares, Maarten Sap, Mohit Tiwari, Bill Yuchen Lin, Aykut Erdem, Angelica Chen, Swaroop Mishra, Chenlin Meng, Ashish Sabharwal, James Simon, Louis-Philippe Morency, Kyle Richardson, Emanuele Rodolà, Adam Fisch, Simone Melzi, Kristen Chiafullo, Rif A. Saurous, Shubh Pachchigar, Siamak Shakeri, Aitor Lewkowycz, Yonatan Belinkov, Mihir Kale, Mantas Mazeika, Dar Gilboa, Hongming Zhang, Seung Jae Lee, Owain Evans, Ambrose Slone, David Dohan, Damien Sileo, Mor Geva, Cameron Diao, Christopher Potts, Jekaterina Novikova, Alicia Parrish, Debajyoti Datta, Chitta Baral, Maarten Bosma, Michael Strube, Jiacheng Xu, Trishala Neeraj, Colin Raffel (Vector Faculty Member), Leo Gao, Vishakh Padmakumar, Yu Hou, Christopher Waites, Ellie Pavlick, Pouya Pezeshkpour, Nanyun (Violet) Peng, Gerard de Melo, Martin Potthast, Aarohi Srivastava, Abhinav Rastogi, Abu Awal Md Shoeb, Adam Brown, Adam Santoro, Aditya Gupta, Agnieszka Kluska, Diyi Yang, Akshat Agarwal, Alexander Kocurek, Ali Safaya, Ali Tazarv, Alice Xiang, Aman Hussain, Amanda Askell, Amanda Dsouza, Ameet Rahane, Anantharaman S. Iyer, Andrea Madotto, Andrea Santilli, Andreas Stuhlmüller, Andrew La, Ethan Dyer, Angela Jiang, Anh Vuong, Animesh Gupta, Anna Gottardi, Antonio Norelli, Anu Venkatesh, Arash Gholamidavoodi, Arfa Tabassum, Arul Menezes, Arun Kirubarajan, Asher Mullokandov, Austin Herrick, Avia Efrat, Ayla Karakaş, B. Roberts, Bao Loe, Bartłomiej Bojanowski, Benjamin Inden, Benno Stein, Batuhan Özyurt, Behnam Hedayatnia, Blake Howald, Bryan Orinion, Cameron Dour, Catherine Stinson, Cedrick Argueta, Cesar Ferri, Chandan Singh, Charles Rathkopf, Christian Voigt, Cindy Ramirez, Clara Rivera, Noah Fiedel, Courtney Ashcraft, Dan Garrette, Dan Kilman, C. Freeman, Daniel Levy, Daniel González, Danielle Perszyk, Danny Hernandez, David Jurgens, Deep Ganguli, Denis Emelin, Denis Kleyko, Deniz Yuret, Derek Chen, Mátyás Schubert, Derek Tam, Dilyar Buzan, Shyam Upadhyay, Dimitri Coelho Mollo, Dylan Schrader, Ekaterina Shutova, Elad Segal, Eleanor Hagerman, Elizabeth Barnes, Elizabeth Donoway, Emma Lam, Eric Tang, Ernie Chang, Ethan Chi, Ethan Jerzak, Ethan Kim, Eunice Manyasi, Evgenii Zheltonozhskii, Fanyue Xia, Fernando Martínez-Plumed, Francesca Happé, Gloria X Wang, Gonzalo Jaimovitch-Lopez, Gregor Betz, Hana Galijasevic, Hannah Kim, Hannah Rashkin, Hayden Bogar, Henry Shevlin, Hiromu Yakura, Hugh Wong, Kumar Shridhar, Ian Ng, Isaac Noble, Jaap Jumelet, Jack Geissinger, Jackson Kernion, James Zheng, Jan Kocon, Jana Thompson, Janelle Wingfield, Jared Kaplan, Jarema Radom, Jelle Bosscher, Jennifer Marsh, Jeremy Kim, Jeroen Taal, Jesujoba Alabi, Jillian Tang, Joan Waweru, John Burden, Dieuwke Hupkes, John Balis, Jonathan Batchelder, Jörg Frohberg, Jose Hernandez-Orallo, Joseph Boudeman, Joseph Guerr, Joseph Jones, Joshua Rule, Joyce Chua, Kamil Kanclerz, Karthik Gopalakrishnan, Katerina Ignatyeva, Li Zhang, Liam Dugan, Katja Markert, Kaustubh Dhole, Lucas Lam, Kevin Omondi, Kyle McDonell, Laria Reynolds, Lianhui Qin, Lidia Contreras-Ochando, Lucy Noble, Ludwig Schmidt, Luheng He, Luis Oliveros-Colón, Lütfi Kerem Senel, Maria Jose Ramirez-Quintana, Maartje Ter Hoeve, Mohit Bansal, Martha Lewis, Maheen Farooqi, Marco Baturan, Marco Marelli, Marco Maru, Marie Tolkiehn, Michael A. Yee, Mario Giulianelli, Michael Gu, Michael Ivanitskiy, Matthias Hagen, Medina Baitemirova, Mike Cain, Mimee Xu, Mitch Walker, Moin Aminnaseri, Mozhdeh Gheini, Nathan Chi, Michael Starritt, Michał Swędrowski, Michele Bevilacqua, Nayeon Lee, Neta Krakover, Nicholas Cameron, Nick Doiron, Nicole Martinez, Nikita Nangia, Niklas Deckers, Niveditha Iyer, Nuan Wen, Oliver Zhang, Omar Agha, Omar Elbaghdadi, Parth Doshi, Pascale Fung, Pegah Alipoormolabashi, Liao Peiyuan, Peter W Chang, Peter Eckersley, Phu Mon Htut, Pinyu Hwang, Piotr Miłkowski, Piyush Patil, Priti Oli, Qing Lyu, Qinlang Chen, Rabin Banjade, Rachel Rudolph, Raefer Gabriel, Rahel Habacker, Ramon Risco, Raphaël Millière, Rhythm Garg, Richard Barnes, Riku Arakawa, Robbe Raymaekers, Robert Frank, Rohan Sikand, Roman Novak, Paul Pu Liang, Rowan Jacobs, Ryan Stovall, Rylan Yang, Saif Mohammad, Sajant Anand, Sam Dillavou, Sam Wiseman, Samuel Gruetter, Sanghyun Han, Mukund Varma T, Sanjeev Kwatra, Sarah Rous, Sarik Ghazarian, Sean Casey, Sebastian Bischoff, Sebastian Gehrmann, Sepideh Sadeghi, Shadi Hamdan, Sherry Shi, Shikhar Singh, Daphne Ippolito, Shima Asaadi, Shyamolima Debnath, Simon Thormeyer, Sneha Makini, Soo-Hwan Lee, Spencer Torene, Stanislas Dehaene, Stefan Divic, Hanna Hajishirzi, Stephanie Lin, Stephen Prasad, Andrew Dai, Steven Piantadosi, Summer Misherghi, Svetlana Kiritchenko, Tao Li, Tariq Ali, Te-Lin Wu, Théo Desbordes, Theodore Rothschild, Thomas Phan, Tianle Wang, Adrià Garriga-Alonso, Tiberius Nkinyili, Timofei Kornev, Titus Tunduny, Trenton Chang, Tushar Khot, Tyler Shultz, Uri Shaham, Vedant Misra, Victoria Nyamai, Vikas Raunak, vinay prabhu, William Saunders, William Zhang, Wout Vossen, Xiaoyu Tong, Xinyi Wu, Yair Lakretz, Yichi Yang, Sophie Hao, Yifu Chen, Yufang Hou, Yuntao Bai, Zachary Seid, Cristina Garbacea, Ziyi Wu, Genta Winata, Shubham Toshniwal, Abubakar Abid, John Miller, Karen Livescu, Tatsunori Hashimoto, Ekin Cubuk, Sayan Ghosh, Harsh Mehta, Jacob Hilton, Yadollah Yaghoobzadeh, Jiaming Song, Siva Reddy, Stefano Ermon, Shashank Srivastava, Percy Liang, Chiyu Wu, James Koppel, Rui Zhang, David Drakard, Germàn Kruszewski, Dong-Ho Lee, Fatemeh Siar, Luke Metz, Roman Sitelew, Dan Hendrycks, Paul Vicol, Alexander Ray, Tobias Gerstenberg, Chris Callison-Burch, Sriharsha Hatwar, Xinran Zhao, Zijian Wang, Luca Moschella, Sam Bowman, Jaime Fernández Fisac, Danqi Chen, Stella R Biderman, Nitish Shirish Keskar, Eric Chu, Manaal Faruqui, Ksenia Shkaruta, Xudong Shen, Ryan Teehan, Vinay Ramasesh, Andy Zou, Jaehoon Lee, Hinrich Schuetze, Jesse Engel, Tal Schuster, Berk Ekmekci, Yangqiu Song, Andrew Lampinen, Dan Roth, Yasaman Bahri, Jascha Sohl-Dickstein, Jason Yosinski, Sebastian Schuster, Melody Arnaud, Russ Salakhutdinov, Nicholas Roberts, William Fedus, Sam Shleifer, Vivek Srikumar, Ronan Le Bras, Jos Rozen, Kevin Gimpel, Melvin McElrath, Omer Levy, Tal Linzen, Diganta Misra, Frieda Rong, Xiang Ren, Abhishek Rao, Mirac Suzgun, Yejin Choi, Michihiro Yasunaga, Sharon Zhou, Joshua B Tenenbaum, Sahib Singh, Michael Cohen, Tao Yu, Samuel Schoenholz, Rosanne Liu, Ryan Chi, Giambattista Parascandolo, Zhuoye Zhao, Erkut Erdem, Matthew Leavitt, Francois Chollet, Anders J Andreassen, Timo Schick, Vera Demberg, Qiaozhu Mei, Daniel Khashabi, Jonathan Berant, Noah Constant, Alex Warstadt, Zirui Wang, Alethea Power, Niklas Muennighoff, Barret Zoph, Jason Wei, Christopher Manning
Abstrait
Les modèles linguistiques présentent des améliorations quantitatives et de nouvelles capacités qualitatives qui se développent à grande échelle. Malgré leur impact potentiellement transformateur, ces nouvelles capacités demeurent encore mal caractérisées. Afin d'orienter les recherches futures, d'anticiper l'émergence de nouvelles capacités de modélisation perturbatrices et d'atténuer les effets socialement néfastes, il est essentiel de comprendre les capacités et les limites actuelles et futures des modèles de langage.
Pour relever ce défi, nous présentons le benchmark Beyond the Imitation Game (BIG-bench). BIG-bench comprend actuellement 204 tâches, auxquelles ont contribué 450 auteurs de 132 institutions. Les thèmes abordés sont variés et couvrent des domaines tels que la linguistique, le développement de l'enfant, les mathématiques, le raisonnement logique, la biologie, la physique, les biais sociaux, le développement logiciel, et bien d'autres. BIG-bench se concentre sur des tâches considérées comme hors de portée des modèles linguistiques actuels. Nous évaluons le comportement des modèles GPT d'OpenAI, des architectures de transformateurs denses internes de Google et des transformateurs clairsemés de type Switch sur BIG-bench, pour des modèles comportant des millions, voire des centaines de milliards de paramètres. De plus, une équipe d'experts humains a réalisé toutes les tâches afin d'établir une base de référence solide. Les résultats montrent que les performances et l'étalonnage des modèles s'améliorent avec l'échelle, mais restent faibles en valeur absolue (et par rapport aux performances des évaluateurs) ; les performances sont remarquablement similaires entre les différentes classes de modèles, malgré un avantage lié à la sparsité des données. Les tâches qui s'améliorent progressivement et de manière prévisible impliquent généralement une importante composante de connaissances ou de mémorisation, tandis que les tâches qui présentent un comportement « révolutionnaire » à une échelle critique impliquent souvent plusieurs étapes ou composantes, ou des mesures fragiles ; le biais social augmente généralement avec l'échelle dans des contextes ambigus, mais cela peut être amélioré par des incitations.
BitStack : Compression de toute taille de grands modèles de langage dans des environnements à mémoire variable
Xinghao Wang, Pengyu Wang, Bo Wang (membre du corps professoral de Vector), Dong Zhang, Yunhua Zhou, Xipeng Qiu
Abstrait
Large language models (LLMs) have revolutionized numerous applications, yet their deployment remains challenged by memory constraints on local devices. While scaling laws have enhanced LLM capabilities, the primary bottleneck has shifted from $\textit{capability}$ to $\textit{availability}$, emphasizing the need for efficient memory management. Traditional compression methods, such as quantization, often require predefined compression ratios and separate compression processes for each setting, complicating deployment in variable memory environments. In this paper, we introduce $\textbf{BitStack}$, a novel, training-free weight compression approach that enables megabyte-level trade-offs between memory usage and model performance. By leveraging weight decomposition, BitStack can dynamically adjust the model size with minimal transmission between running memory and storage devices. Our approach iteratively decomposes weight matrices while considering the significance of each parameter, resulting in an approximately 1-bit per parameter residual block in each decomposition iteration. These blocks are sorted and stacked in storage as basic transmission units, with different quantities loaded based on current memory availability. Extensive experiments across a wide range of tasks demonstrate that, despite offering fine-grained size control, BitStack consistently matches or surpasses strong quantization baselines, particularly at extreme compression ratios. To the best of our knowledge, this is the first decomposition-based method that effectively bridges the gap to practical compression techniques like quantization. Code is available at https://github.com/xinghaow99/BitStack.
Méthodes de boosting pour les données censurées par intervalle avec régression et classification
Yuan Bian, Grace Yi (affiliée à la faculté Vector), Wenqing He
Abstrait
Le boosting a suscité un vif intérêt au sein des communautés de l'apprentissage machine et des statistiques. Les algorithmes de boosting traditionnels, conçus pour des échantillons aléatoires entièrement observés, rencontrent souvent des difficultés avec les problèmes concrets, notamment les données censurées par intervalles. Ce type de données est fréquent en analyse de survie et dans les études de durée de vie, où les moments précis des événements ne sont pas observés, mais se situent dans des intervalles connus. Le traitement efficace de ces données est crucial dans des domaines tels que la recherche médicale, le génie de la fiabilité et les sciences sociales. Dans ce travail, nous introduisons de nouvelles méthodes de boosting non paramétriques pour les tâches de régression et de classification avec des données censurées par intervalles. Nos approches exploitent des transformations de censure non biaisées pour ajuster les fonctions de perte et imputer les réponses transformées tout en préservant la précision du modèle. Implémentées par descente de gradient fonctionnelle, ces méthodes garantissent l'évolutivité et l'adaptabilité. Nous établissons rigoureusement leurs propriétés théoriques, notamment l'optimalité et les compromis d'erreur quadratique moyenne, offrant ainsi des garanties solides. Nos méthodes proposées offrent non seulement un cadre robuste pour améliorer la précision prédictive dans les domaines où les données censurées par intervalles sont courantes, mais complètent également les travaux existants, élargissant ainsi le champ d'application des techniques de boosting. Des études empiriques démontrent des performances robustes dans divers scénarios d'échantillons finis, soulignant l'utilité pratique de nos approches.
Fuite par mille fuites : fuites d’informations dangereuses dans les réponses d’IA « sûres »
David Glukhov, Ziwen Han, Ilia Shumailov, Vardan Papyan (membre associé de la faculté Vector), Nicolas Papernot (membre de la faculté Vector)
Abstrait
La vulnérabilité des modèles de langage Frontier aux abus et aux jailbreaks a incité au développement de mesures de sécurité telles que les filtres et l'entraînement à l'alignement, afin d'assurer la sécurité par une robustesse accrue face aux requêtes malveillantes. Nous affirmons que la robustesse est fondamentalement insuffisante pour garantir les objectifs de sécurité, et que les méthodes de défense et d'évaluation actuelles ne tiennent pas compte des risques liés aux requêtes à double intention et à leur combinaison à des fins malveillantes. Pour quantifier ces risques, nous introduisons un nouveau cadre d'évaluation de la sécurité basé sur les fuites d'informations illicites des sorties du modèle et démontrons comment notre attaque par décomposition de questions permet d'extraire des connaissances dangereuses d'un LLM censuré plus efficacement que les jailbreaks traditionnels. Notre méthode d'évaluation repose sur un nouveau modèle de menace informationnel pour les adversaires inférentiels, qui se distinguent des adversaires de sécurité, tels que les jailbreaks, par le fait que le succès est mesuré par l'inférence de connaissances illicites à partir des sorties de la victime, plutôt que par l'obtention de sorties explicitement illicites de cette dernière. Grâce à notre cadre théorique informationnel, nous montrons que, pour garantir la sécurité contre les adversaires inférentiels, les mécanismes de défense doivent assurer la censure de l'information, limitant ainsi la diffusion d'informations illicites. Cependant, nous prouvons que de telles défenses impliquent inévitablement un compromis entre la sécurité et l’utilité.
Le gradient textuel peut-il fonctionner dans l'apprentissage fédéré ?
Minghui Chen, Ruinan Jin, Wenlong Deng, Yuanyuan Chen, Zhi Huang, Han Yu, Xiaoxiao Li (membre du corps professoral de Vector)
Abstrait
Des études récentes soulignent le potentiel de l'optimisation des invites basée sur les modèles de langage (LLM), notamment avec TextGrad, qui automatise la « différenciation » par le biais de textes et rétropropage la rétroaction textuelle fournie par les LLM. Cette approche facilite l'entraînement dans diverses applications concrètes qui ne supportent pas la propagation numérique du gradient ni le calcul de la perte. Elle ouvre de nouvelles perspectives pour l'optimisation dans des environnements décentralisés aux ressources limitées, suggérant que les utilisateurs de LLM « boîte noire » (par exemple, ChatGPT) pourraient améliorer les composants des systèmes d'agents LLM (tels que l'optimisation des invites) grâce à des paradigmes collaboratifs comme l'apprentissage fédéré (FL). Dans cet article, nous explorons systématiquement le potentiel et les défis de l'intégration du gradient textuel dans l'apprentissage fédéré. Nos contributions sont quadruples. **D'abord**, nous introduisons un nouveau paradigme d'apprentissage fédéré, Federated Textual Gradient (FedTextGrad), qui permet aux clients FL de télécharger leurs invites optimisées localement à partir de gradients textuels, tandis que le serveur FL agrège les invites reçues par résumé textuel. Contrairement aux cadres FL traditionnels, conçus pour l'agrégation numérique, FedTextGrad est spécifiquement adapté au traitement des données textuelles, étendant ainsi l'applicabilité du FL à un plus large éventail de problèmes dépourvus de fonctions de perte numériques bien définies. **Deuxièmement**, en nous basant sur cette conception, nous menons des expériences approfondies pour explorer la faisabilité des gradients textuels fédérés. Nos résultats soulignent l'importance d'un réglage précis des facteurs clés (par exemple, les étapes locales) lors de l'entraînement du FL afin d'intégrer efficacement les gradients textuels. **Troisièmement**, nous soulignons un défi majeur de l'agrégation fédérée des gradients textuels : la conservation des informations essentielles issues des mises à jour distribuées des invites. La concaténation produit souvent des invites qui dépassent la fenêtre de contexte de l'API LLM, tandis que la synthèse peut dégrader les performances en générant un texte trop condensé ou complexe, dépourvu de contexte essentiel. **Enfin,** pour répondre à ce problème, nous améliorons la version de base de FedTextGrad en fournissant des instructions exploitables au LLM lors de la synthèse des invites du client, grâce au principe de densité d'information uniforme. Cette conception réduit la complexité de l'invite globale agrégée, stimulant ainsi la capacité de raisonnement du modèle linéaire. Grâce à cette étude rigoureuse, nous favorisons l'adoption de gradients textuels en didactique des langues pour optimiser les modèles linéaires, identifions des enjeux importants et définissons des pistes de recherche futures, ouvrant ainsi un nouveau champ d'investigation qui mérite d'être approfondi.
Contrôler l'espace et le temps avec des modèles de diffusion
Daniel Watson, Saurabh Saxena, Lala Li, Andrea Tagliasacchi, David Fleet (membre du corps professoral de Vector)
Abstrait
Nous présentons 4DiM, un modèle de diffusion en cascade pour la synthèse de vues 4D inédites (NVS), permettant la génération de vues avec des trajectoires de caméra et des horodatages arbitraires, dans des scènes naturelles, à partir d'une ou plusieurs images. Grâce à une architecture et une procédure d'échantillonnage novatrices, nous autorisons l'entraînement sur un mélange de données 3D (avec pose de la caméra), 4D (pose et temps) et vidéo (temps sans pose), ce qui améliore considérablement la généralisation aux images et aux trajectoires de caméra inédites par rapport aux travaux antérieurs, généralement limités à des domaines spécifiques (par exemple, centrés sur l'objet). 4DiM est la première méthode NVS dotée d'un contrôle intuitif de la pose de la caméra à l'échelle métrique, rendu possible par notre nouveau pipeline d'étalonnage pour les données issues de la reconstruction 3D par mouvement. Les expériences démontrent que 4DiM surpasse les modèles NVS 3D précédents en termes de fidélité d'image et d'alignement des poses, tout en permettant la génération de la dynamique de la scène. 4DiM offre un cadre général pour diverses tâches, notamment la conversion d'une image unique en 3D, la conversion de deux images en vidéo (interpolation et extrapolation) et la traduction vidéo-à-vidéo conditionnée par la pose, que nous illustrons qualitativement sur différentes scènes. Des exemples vidéo sont disponibles à l'adresse https://anonymous-4d-diffusion.github.io .
Les modèles de vision-langage représentent-ils l'espace et comment ? Évaluation du cadre de référence spatial en situation d'ambiguïté
Zheyuan Zhang, Fengyuan Hu, Jayjun Lee, Freda Shi (membre du corps professoral de Vector), Parisa Kordjamshidi, Joyce Chai, Ziqiao Ma
Abstrait
Dans la communication située, les expressions spatiales peuvent être ambiguës, leur signification variant selon les cadres de référence adoptés par les locuteurs et les auditeurs. Bien que la compréhension et le raisonnement spatial par les modèles de vision-langage (MVL) suscitent un intérêt croissant, les ambiguïtés potentielles de ces modèles restent encore peu explorées. Pour pallier ce manque, nous présentons le Test de Cadre de Référence Multilingue Cohérent (COMFORT), un protocole d'évaluation permettant d'évaluer systématiquement les capacités de raisonnement spatial des MVL. Nous évaluons neuf MVL de pointe à l'aide de COMFORT. Malgré une certaine adéquation avec les conventions anglaises pour la résolution des ambiguïtés, nos expériences révèlent des lacunes importantes des MVL : notamment, les modèles (1) présentent une faible robustesse et cohérence, (2) manquent de flexibilité pour intégrer plusieurs cadres de référence, et (3) ne respectent pas les conventions linguistiques ou culturelles spécifiques lors des tests interlingues, l'anglais ayant tendance à dominer les autres langues. Face aux efforts croissants pour aligner les modèles vision-langage sur les intuitions cognitives humaines, nous appelons à une plus grande attention portée à la nature ambiguë et à la diversité interculturelle du raisonnement spatial.
Recherche évolutive efficace dans l'espace chimique avec de grands modèles de langage
Haorui Wang, Marta Skreta, Cher Ser, Wenhao Gao, Lingkai Kong, Felix Strieth-Kalthoff, Chenru Duan, Yuchen Zhuang, Yue Yu, Yanqiao Zhu, Yuanqi Du, Alán Aspuru-Guzik (membre du corps professoral vectoriel), Kirill Neklyudov, Chao Zhang
Abstrait
La découverte moléculaire, formulée comme un problème d'optimisation, présente des défis computationnels importants, car les objectifs d'optimisation peuvent être non différentiables. Les algorithmes évolutifs (AE), souvent utilisés pour optimiser les objectifs de type « boîte noire » en découverte moléculaire, explorent l'espace chimique par mutations et croisements aléatoires, ce qui engendre un grand nombre d'évaluations d'objectifs coûteuses. Dans ce travail, nous pallions cette limite en intégrant des modèles de langage étendus (LLM) sensibles à la chimie aux AE. Plus précisément, nous repensons les opérations de croisement et de mutation des AE à l'aide de LLM entraînés sur de vastes corpus d'informations chimiques. Nous menons des études empiriques approfondies sur des modèles d'affaires et open source, appliquées à de multiples tâches telles que l'optimisation de propriétés, la redécouverte moléculaire et la conception de médicaments basée sur la structure. Nos résultats démontrent que l'utilisation conjointe de LLM et d'AE offre des performances supérieures à tous les modèles de référence, tant dans un contexte mono-objectif que multi-objectif. Nous montrons que notre algorithme améliore à la fois la qualité de la solution finale et la vitesse de convergence, réduisant ainsi le nombre d'évaluations d'objectifs nécessaires.
Édition efficace de modèles avec ajustement fin et parcimonieux localisé par tâche
Leonardo Iurada, Marco Ciccone (boursier postdoctoral distingué Vector), Tatiana Tommasi
Abstrait
Les modèles préentraînés sont des étapes essentielles pour les systèmes d'apprentissage machine modernes. Cependant, l'extraction, la réutilisation et l'orientation efficaces de leurs connaissances vers de nouvelles tâches représentent un domaine de recherche encore exploré, avec de nombreuses questions ouvertes. Les solutions actuelles d'arithmétique des tâches sont fortement liées à la linéarisation des modèles, ce qui engendre des goulots d'étranglement computationnels lors de l'entraînement et de l'inférence, et peut potentiellement négliger des dépendances essentielles entre les tâches. Dans ce travail, nous nous concentrons sur l'étape d'ajustement fin qui définit les vecteurs de tâches et proposons TaLoS, une nouvelle approche basée sur un ajustement fin parcimonieux. TaLoS met à jour stratégiquement seulement les paramètres susceptibles d'assurer une localisation fonctionnelle des tâches. Cette approche permet d'obtenir efficacement des modèles dont les poids sont désenchevêtrés, sans nécessiter de linéarisation explicite. Nous présentons une analyse expérimentale approfondie démontrant comment notre approche améliore significativement l'efficacité de l'entraînement et de l'inférence, tout en surpassant les approches actuelles en matière d'ajout et de négation de tâches. Nos travaux offrent une solution rigoureuse pour l'édition de modèles préentraînés et ouvrent la voie à des systèmes d'apprentissage automatique plus rentables et évolutifs pour des applications concrètes.
EgoSim : Exploration égocentrique dans des mondes virtuels avec conditionnement multimodal
Wei Yu, Songheng Yin, Steve Easterbrook, Animesh Garg (membre affilié de la faculté Vector)
Abstrait
Les progrès récents dans les modèles de diffusion vidéo ont jeté des bases solides pour le développement de modèles mondiaux aux applications pratiques. Le prochain défi consiste à explorer comment un agent peut exploiter ces modèles fondamentaux pour comprendre, interagir avec et planifier ses actions dans les environnements observés. Cela nécessite d'accroître la contrôlabilité du modèle, le transformant en un moteur de jeu polyvalent capable de manipulation et de contrôle dynamiques. Pour ce faire, nous avons étudié trois facteurs de conditionnement clés : la caméra, le cadre de contexte et le texte, et identifié les limites des modèles actuels. Plus précisément, la fusion des représentations de la caméra avec les caractéristiques vidéo fait en sorte que le contrôle de la caméra est influencé par ces dernières. De plus, si l'information textuelle compense les structures spatio-temporelles nécessaires, elle empiète souvent sur les parties déjà observées de la scène. Pour résoudre ces problèmes, nous avons conçu la couche d'attention épipolaire spatio-temporelle, qui garantit que l'égomotion générée par le modèle s'aligne strictement sur le mouvement de la caméra grâce à des contraintes rigides. Par ailleurs, nous proposons l'adaptateur CI2V, qui utilise les informations de la caméra pour mieux déterminer s'il convient de privilégier les représentations textuelles ou visuelles, atténuant ainsi le problème de l'intrusion du texte dans les zones observées. Grâce à de nombreuses expériences, nous démontrons que notre nouveau modèle EgoSim obtient d'excellents résultats sur les ensembles de données RealEstate et Epic-Field, récemment réutilisé. Pour plus de résultats, veuillez consulter https://egosim.github.io/EgoSim/ .
Apprentissage fédéré vertical en ligne axé sur les événements
Ganyu Wang, Boyu Wang (membre associé de la faculté Vector), Bin Gu, Charles Ling (membre associé de la faculté Vector)
Abstrait
L'apprentissage en ligne est plus adaptable aux scénarios réels dans le cadre de l'apprentissage fédéré vertical (VFL) que l'apprentissage hors ligne. Cependant, son intégration au VFL présente des défis en raison de la nature unique de ce modèle, où les clients possèdent des ensembles de caractéristiques non intersectantes pour un même échantillon. Dans des scénarios réels, les clients ne reçoivent généralement pas de flux de données synchrones pour les caractéristiques disjointes d'une même entité. Ces données sont plutôt générées par un événement qui ne concerne qu'un sous-ensemble de clients. Nous sommes les premiers à identifier ces défis dans le VFL en ligne, des défis qui avaient été négligés par les recherches précédentes. Pour y remédier, nous proposons un cadre VFL en ligne axé sur les événements. Dans ce cadre, seul un sous-ensemble de clients est activé lors de chaque événement, tandis que les autres clients collaborent passivement au processus d'apprentissage. De plus, nous avons intégré le *regret local dynamique (DLR)* à VFL afin de relever les défis posés par les problèmes d'apprentissage en ligne avec des modèles non convexes dans un environnement non stationnaire. Nous avons mené une analyse approfondie du regret de notre cadre proposé, en examinant spécifiquement le DLR dans des conditions non convexes avec VFL en ligne piloté par les événements. De nombreuses expériences ont démontré que notre cadre proposé était plus stable que le cadre VFL en ligne existant dans des conditions de données non stationnaires, tout en réduisant considérablement les coûts de communication et de calcul.
Filtré et non mélangé : Contrôle en ligne basé sur le filtrage pour un mélange de grands modèles de langage
Raeid Saqur, Anastasis Kratsios (membre affilié de la faculté Vector), Florian Krach, Yannick Limmer, Blanka Horvath, Frank Rudzicz (membre de la faculté Vector)
Abstrait
Nous proposons MoE-F, un mécanisme formalisé pour combiner N modèles de langage experts de grande taille (LLM) préentraînés dans des tâches de prédiction de séries temporelles en ligne. Ce mécanisme prévoit de manière adaptative la pondération optimale des prédictions des LLM à chaque étape temporelle. Il exploite les informations conditionnelles des performances de chaque expert pour prédire la meilleure combinaison de LLM permettant de prédire la série temporelle à l'étape suivante. Contrairement aux méthodes statiques (apprises) de mélange d'experts (MoE), notre approche utilise des techniques de filtrage stochastique adaptatives pour combiner les experts. En formulant le problème de sélection d'experts comme un modèle de Markov caché (HMM) à espace d'états fini et à temps continu, nous pouvons exploiter le filtre de Wohman-Shiryaev. Notre approche construit d'abord N filtres parallèles, un pour chaque LLM. Chaque filtre offre sa meilleure combinaison de LLM, compte tenu des informations dont il dispose. Par la suite, les sorties des N filtres sont agrégées de manière optimale afin de maximiser leur robustesse prédictive. Cette mise à jour est calculée efficacement par une expression analytique, générant ainsi notre prédicteur d'ensemble. Nos contributions sont les suivantes : **(I)** l'algorithme MoE-F, déployable comme solution de filtrage prête à l'emploi ; **(II)** les garanties d'optimalité théoriques de l'algorithme de filtrage proposé (grâce aux garanties d'optimalité de son filtrage bayésien parallèle et de ses étapes d'agrégation robustes) ; et **(III)** l'évaluation empirique et les résultats comparatifs obtenus avec des modèles linéaires à effets linéaires (LLM) fondamentaux et MoE de pointe sur une tâche réelle de prédiction des mouvements des marchés financiers. Dans ce cas, MoE-F atteint une amélioration remarquable de 17 % en valeur absolue et de 48,5 % en valeur relative du score F1 par rapport au meilleur modèle LLM individuel prédisant les mouvements de marché à court terme à partir de flux d'informations. De plus, nous apportons la preuve empirique de gains de performance substantiels lors de l'application de MoE-F par rapport à des modèles spécialisés dans le domaine de la prévision de séries temporelles à long terme.
Découverte des concepts décodables partagés et de leurs négations dans le cerveau
Cory Efird, Alex Murphy, Joel Zylberberg (membre affilié de la faculté Vector), Alona Fyshe
Abstrait
Prior work has offered evidence for functional localization in the brain; different anatomical regions preferentially activate for certain types of visual input. For example, the fusiform face area preferentially activates for visual stimuli that include a face. However, the spectrum of visual semantics is extensive, and only a few semantically-tuned patches of cortex have so far been identified in the human brain. Using a multimodal (natural language and image) neural network architecture (CLIP, \cite{CLIP}, we train a highly accurate contrastive model that maps brain responses during naturalistic image viewing to CLIP embeddings. We then use a novel adaptation of the DBSCAN clustering algorithm to cluster the parameters of these participant-specific contrastive models. This reveals what we call Shared Decodable Concepts (SDCs): clusters in CLIP space that are decodable from common sets of voxels across multiple participants.
L'examen des images les plus et les moins associées à chaque grappe SDC nous éclaire davantage sur les propriétés sémantiques de chaque SDC. Nous observons des SDC pour des caractéristiques visuelles déjà décrites (par exemple, la sélectivité d'orientation dans le cortex visuel primaire), ainsi que pour des concepts sémantiques visuels tels que les visages, les lieux et les corps. Lorsque notre méthode identifie plusieurs grappes pour un concept visuo-sémantique, les images les moins associées nous permettent de dissocier les facteurs de confusion. Par exemple, on a découvert deux grappes d'images d'aliments, l'une déterminée par la couleur, l'autre par la forme. Nous mettons également en évidence des zones de sensibilité visuo-sémantique jusqu'alors inconnues, telles que des régions de l'aire corporelle extrastriée (EBA) sensibles aux jambes et aux mains, une sensibilité à la numérosité dans le sillon intrapariétal droit, une sensibilité associée à la perspective visuelle (proche/lointain), et bien plus encore. Ainsi, notre méthodologie d'apprentissage contrastif caractérise plus précisément les représentations visuo-sémantiques nouvelles et existantes dans le cerveau, grâce à l'exploitation de représentations multimodales par réseaux de neurones et à une adaptation novatrice des algorithmes de clustering.
Généralisation dans les modèles VAE et de diffusion : une analyse unifiée basée sur la théorie de l’information
Qi Chen, Jierui Zhu, Florian Shkurti (affilié à la faculté Vector)
Abstrait
Malgré le succès empirique des modèles de diffusion (MD) et des auto-encodeurs variationnels (AEV), leurs performances de généralisation restent théoriquement peu explorées, notamment en raison d'un manque de considération pour la structure partagée encodeur-générateur. En s'appuyant sur des outils récents de la théorie de l'information, nous proposons un cadre théorique unifié qui garantit la généralisation de l'encodeur et du générateur en les traitant comme des applications aléatoires. Ce cadre permet en outre : (1) une analyse plus fine des AEV, tenant compte de la généralisation du générateur, jusqu'alors négligée ; (2) d'illustrer un compromis explicite en termes de généralisation pour les MD, dépendant du temps de diffusion $T$ ; et (3) de fournir des bornes estimables pour les MD à partir des seules données d'entraînement, permettant ainsi la sélection de la valeur optimale de $T$ et l'intégration de ces bornes dans le processus d'optimisation afin d'améliorer les performances du modèle. Les résultats empiriques obtenus sur des ensembles de données synthétiques et réelles illustrent la validité de la théorie proposée.
GMValuator : Évaluation des données basée sur la similarité pour les modèles génératifs
Jiaxi Yang, Wenlong Deng, Benlin Liu, Yangsibo Huang, James Y Zou, Xiaoxiao Li (membre du corps professoral de Vector)
Abstrait
L'évaluation des données joue un rôle crucial dans l'apprentissage automatique. Les méthodes d'évaluation existantes, principalement axées sur les modèles discriminatifs, négligent les modèles génératifs, pourtant très populaires ces dernières années. Dans ces derniers, l'évaluation des données mesure l'impact des données d'entraînement sur les ensembles de données générés. Ou, rares sont les méthodes d'évaluation conçues pour les modèles génératifs profonds qui se concentrent sur des modèles spécifiques ou dont les résultats manquent de robustesse. De plus, leur efficacité présente encore des lacunes. Afin de combler ces lacunes, nous formulons le problème de l'évaluation des données dans les modèles génératifs sous l'angle de la correspondance de similarités. Plus précisément, nous présentons GMValuator (Generative Model Valuator), la première approche d'évaluation des données pour les tâches de génération qui ne nécessite aucun entraînement et est indépendante du modèle. Grâce à notre module novateur de correspondance de similarités, GMValuator permet une évaluation efficace des données, corrige les contributions biaisées en intégrant une évaluation de la qualité d'image et attribue des crédits à tous les échantillons d'entraînement en fonction de leur contribution aux échantillons générés. Finalement, nous proposons quatre critères d'évaluation pour les méthodes d'évaluation des données dans les modèles génératifs. GMValuator est évalué en profondeur sur des ensembles de données de référence et à haute résolution, ainsi que sur diverses architectures génératives courantes, afin de démontrer son efficacité.
Exploiter les interfaces utilisateur des pages Web pour une compréhension visuelle riche en texte
Junpeng Liu, Tianyue Ou, Yifan Song, Yuxiao Qu, Wai Lam, Chenyan Xiong, Wenhu Chen (membre du corps professoral de Vector), Graham Neubig, Xiang Yue
Abstrait
La compréhension visuelle riche en texte – la capacité d'interpréter à la fois le contenu textuel et les éléments visuels d'une scène – est cruciale pour que les modèles de langage multimodaux de grande taille (MLLM) interagissent efficacement avec des environnements structurés. Nous proposons d'exploiter les interfaces utilisateur de pages Web comme source de données naturellement structurée et diversifiée afin d'améliorer les capacités des MLLM dans ce domaine. Les approches existantes, telles que l'extraction basée sur des règles, la génération de légendes par modèles multimodaux et l'analyse syntaxique HTML rigide, sont limitées par des problèmes comme le bruit, les hallucinations et une généralisation restreinte. Pour surmonter ces difficultés, nous introduisons MultiUI, un ensemble de données de 7,3 millions d'échantillons couvrant divers types d'interfaces utilisateur et de tâches, structuré à l'aide d'arbres d'accessibilité améliorés et de taxonomies de tâches. En extrayant les instructions multimodales des interfaces utilisateur web via les MLLM, notre ensemble de données améliore la généralisation au-delà du domaine web, améliorant considérablement les performances en matière de compréhension de documents, de compréhension d'interfaces graphiques, d'ancrage et de tâches d'agents avancées. Cela démontre le potentiel des données Web structurées pour améliorer la capacité des MLLM à traiter des environnements visuels riches en texte et à généraliser entre les domaines.
Un critère d'information pour le désenchevêtrement contrôlé des données multimodales
Chenyu Wang, Sharut Gupta, Xinyi Zhang, Sana Tonekaboni (boursière postdoctorale distinguée Vector), Stefanie Jegelka, Tommi Jaakkola, Caroline Uhler
Abstrait
L'apprentissage de représentations multimodales vise à relier et décomposer les informations inhérentes à plusieurs modalités. En dissociant les informations spécifiques à chaque modalité de celles partagées entre elles, nous améliorons l'interprétabilité et la robustesse, et permettons des tâches en aval telles que la génération de résultats contrefactuels. Séparer ces deux types d'informations est complexe parce qu'elles sont souvent profondément imbriquées dans de nombreuses applications concrètes. Nous proposons $\textbf{Disentangled}$ $\textbf{S}$elf-$\textbf{S}$upervised $\textbf{L}$earning (DisentangledSSL), une nouvelle approche d'apprentissage auto-supervisé pour l'obtention de représentations désentremêlées. Nous présentons une analyse exhaustive de l'optimalité de chaque représentation désentremêlée, en nous concentrant particulièrement sur le scénario non traité dans les travaux antérieurs où le seuil d'information minimale nécessaire (MNI) est inatteignable. Nous démontrons que \algo apprend avec succès des caractéristiques partagées et spécifiques à la modalité sur de multiples ensembles de données synthétiques et réels et surpasse systématiquement les références sur diverses tâches en aval, y compris les tâches de prédiction pour les données de vision-langage, ainsi que les tâches de récupération de phénotype moléculaire pour les données biologiques.
Go-Explore intelligent : S'appuyer sur des modèles fondateurs de géants
Cong Lu, Shengran Hu, Jeff Clune (membre du corps professoral de Vector)
Abstrait
Go-Explore est une puissante famille d'algorithmes conçue pour résoudre des problèmes d'exploration complexes. Elle repose sur le principe de l'archivage des états découverts, suivi d'un retour itératif aux états les plus prometteurs pour les explorer. Cette approche a permis d'atteindre des performances exceptionnelles sur une grande variété de problèmes complexes, tels que les jeux Atari et le contrôle robotique. Cependant, elle exige la conception manuelle d'heuristiques pour guider l'exploration (c'est-à-dire déterminer quels états sauvegarder et explorer, et quelles actions envisager ensuite), une tâche fastidieuse et généralement irréalisable. Pour remédier à ce problème, nous proposons Intelligent Go-Explore (IGE), qui étend considérablement la portée de Go-Explore en remplaçant ces heuristiques manuelles par l'intelligence et la notion humaine d'intérêt, intégrées à de vastes modèles de base préentraînés (FM). IGE possède ainsi la capacité, quasi humaine, d'identifier instinctivement le potentiel ou l'intérêt de chaque nouvel état (par exemple, la découverte de nouveaux objets, lieux ou comportements), même dans des environnements complexes où les heuristiques sont difficiles à définir. De plus, IGE offre l'occasion unique de reconnaître et d'exploiter les découvertes fortuites : des états rencontrés lors de l'exploration, précieux pour cette dernière, mais dont l'intérêt n'avait pas été anticipé par l'utilisateur. Nous évaluons notre algorithme sur un large éventail de tâches de traitement du langage et de vision nécessitant recherche et exploration. Sur l'ensemble de ces tâches, IGE surpasse largement les méthodes classiques d'apprentissage par renforcement et de recherche dans les graphes, et réussit même là où des agents FM de pointe comme Reflexion échouent. En résumé, Intelligent Go-Explore combine les atouts considérables des FM et la puissance de l'algorithme Go-Explore, ouvrant ainsi de nouvelles perspectives de recherche pour la création d'agents plus polyvalents dotés de capacités d'exploration impressionnantes. Tout notre code est disponible en open source à l'adresse : https://github.com/conglu1997/intelligent-go-explore.
InverseBench : Évaluation comparative de modèles de diffusion prêts à l'emploi pour les problèmes inverses scientifiques
Article vedette
Hongkai Zheng, Wenda Chu, Bingliang Zhang, Zihui Wu, Austin Wang, Berthy Feng, Caifeng Zou, Yu Sun (affilié à la faculté Vector), Nikola Kovachki, Zachary Ross, Katherine Bouman, Yisong Yue
Abstrait
Les méthodes de diffusion a priori « prêt à l'emploi » constituent une piste de recherche prometteuse pour la résolution des problèmes inverses. Cependant, les études actuelles se concentrent principalement sur la restauration d'images naturelles, laissant les performances de ces algorithmes dans le cadre de problèmes inverses scientifiques largement inexplorées. Pour combler cette lacune, nous présentons \textsc{InverseBench}, un cadre unifié qui évalue les modèles de diffusion sur cinq problèmes inverses scientifiques distincts. Ces problèmes présentent des défis structurels uniques, différents des benchmarks existants, et proviennent d'applications scientifiques critiques telles que l'imagerie des trous noirs, la sismologie, la tomographie optique, l'imagerie médicale et la dynamique des fluides. Avec \textsc{InverseBench}, nous évaluons 15 algorithmes de résolution de problèmes inverses utilisant des méthodes de diffusion a priori « plug-and-play » par rapport à des méthodes de référence robustes et spécifiques au domaine, offrant ainsi de nouvelles perspectives précieuses sur les forces et les faiblesses des algorithmes existants. Nous offrons en open source les ensembles de données, les modèles préentraînés et le code source afin de faciliter les recherches et les développements futurs.
Apprentissage en présence de bruit d'étiquetage temporel
Sujay Nagaraj, Walter Gerych, Sana Tonekaboni (boursière postdoctorale distinguée Vector), Anna Goldenberg (membre du corps professoral de Vector), Berk Ustun, Thomas Hartvigsen
Abstrait
De nombreuses tâches de classification de séries temporelles, où les étiquettes varient au fil du temps, sont affectées par un bruit d'étiquetage lui aussi variable dans le temps. Ce bruit peut améliorer, dégrader ou modifier périodiquement la qualité des étiquettes. Nous proposons et formalisons le concept de bruit d'étiquetage temporel, un problème encore peu étudié pour la classification séquentielle des séries temporelles. Dans ce contexte, plusieurs étiquettes sont enregistrées au fil du temps, tout en étant altérées par une fonction de bruit dépendante du temps. Nous démontrons d'abord l'importance de modéliser la nature temporelle de cette fonction de bruit et comment les méthodes existantes sont systématiquement moins performantes. Nous proposons ensuite des méthodes permettant d'entraîner des classificateurs tolérants au bruit en estimant directement la fonction de bruit d'étiquetage temporel à partir des données. Nous montrons que nos méthodes atteignent des performances de pointe face à divers types de bruit d'étiquetage temporel sur des ensembles de données réels.
Exploiter la rareté des variables pour raffiner la stationnarité de Pareto dans l'optimisation multiobjectif
Zeou Hu, Yaoliang Yu (membre du corps professoral de Vector)
Abstrait
L'optimisation multiobjectif (OMO) basée sur le gradient est essentielle en apprentissage automatique moderne, avec des applications telles que l'apprentissage multitâches, l'apprentissage fédéré, l'équité algorithmique et l'apprentissage par renforcement. Dans ce travail, nous mettons en évidence certaines limitations de la stationnarité de Pareto, une condition de premier ordre largement acceptée pour l'optimalité de Pareto, en présence de structures de fonctions-variables éparses. Ensuite, pour tenir compte de cette éparsité, nous proposons un nouveau concept de solution, la stationnarité de Pareto raffinée (SPR), dont nous démontrons qu'elle se situe toujours entre l'optimalité de Pareto et la stationnarité de Pareto. Nous présentons un algorithme de partitionnement efficace permettant d'extraire automatiquement la dépendance entre les fonctions et les variables et d'éliminer de manière significative les solutions stationnaires de Pareto non optimales. Nous montrons ensuite que les algorithmes de descente basés sur le gradient en OMO peuvent être améliorés grâce à notre partitionnement raffiné. En particulier, nous proposons l'algorithme de descente de gradient multiple avec partitionnement raffiné (RP-MGDA) comme exemple de méthode convergeant vers la SPR, tout en conservant une complexité par étape et un taux de convergence similaires. Finalement, nous validons notre approche par des expériences menées sur des exemples synthétiques et des scénarios d'application réalistes présentant des structures de dépendance fonction-variable distinctes. Nos résultats soulignent l'importance d'exploiter la structure fonction-variable dans l'optimisation multi-objectif basée sur le gradient et constituent une amélioration significative des approches existantes.
Hyperrésolution typée basée sur LLM pour le raisonnement de sens commun avec les bases de connaissances
Armin Toroghi, Ali Pesaranghader, Tanmana Sadhu, Scott Sanner (affilié à la faculté Vector)
Abstrait
Les grands modèles de langage (GML) sont de plus en plus utilisés pour des tâches nécessitant un raisonnement de sens commun. Malgré leur potentiel exceptionnel, le processus de raisonnement des GML est sujet à des erreurs et des hallucinations qui limitent leur applicabilité, notamment dans des contextes critiques. Plusieurs travaux ont tenté d'améliorer les performances de raisonnement de bon sens des GML en : (i) utilisant des styles d'incitation favorisant un raisonnement plus précis ; (ii) utilisant le GML comme analyseur sémantique pour un raisonneur symbolique ; ou (iii) contraignant le GML à simuler une règle d'inférence logique. Cependant, toutes ces solutions présentent des limites importantes : elles ne permettent pas d'exploiter les connaissances de bon sens internes du GML conjointement à une base de connaissances axiomatiques ; elles ne disposent pas d'un mécanisme fiable pour corriger les étapes d'inférence erronées ; et leur application est restreinte à de petites bases de connaissances compatibles avec le contexte du GML. Dans ce travail, nous présentons LLM-TH (Limited Typed Hyperresolution), un cadre de raisonnement logique de sens commun qui exploite la « résolution théorique », un concept de l'inférence logique classique. Cette approche permet d'intégrer les LLM dans la règle d'inférence de « résolution », atténuant ainsi les erreurs et les hallucinations de raisonnement et permettant la vérification de la procédure. LLM-TH est également doté d'un mécanisme de correction des étapes d'inférence erronées, garanti par des hypothèses théoriques. À l'aide des schémas d'« hyperrésolution » et d'« inférence typée », nous démontrons que LLM-TH peut raisonner efficacement sur de vastes bases de connaissances composées de dizaines de milliers de règles avec des prédicats de nature arbitraire. Nos expériences sur trois tâches de raisonnement linguistique diverses — raisonnement de préférence, raisonnement déductif multi-domaine et réponse à des questions géographiques — montrent que LLM-TH, utilisant simplement un modèle d'implication NLI à 406M paramètres BART, réduit considérablement les erreurs de raisonnement par rapport aux références utilisant Llama3-70B, Gemini1.5-Flash, GPT-3.5-Turbo et Mixtral-46.7B.
Avatars sensibles à la localisation tirés de la vidéo
Chunjin Song, Zhijie Wu, Shih-Yang Su, Bastian Wandt, Leonid Sigal (membre du corps professoral de Vector), Helge Rhodin
Abstrait
Nous présentons un avatar sensible à la localité, un réseau basé sur le champ de radiance neuronal (NeRF) pour l'apprentissage des mouvements humains à partir de vidéos monoculaires. Pour ce faire, nous estimons une représentation canonique entre différentes images d'une vidéo grâce à une transformation non linéaire de l'espace d'observation vers l'espace canonique, que nous décomposons en un mouvement rigide squelettique et son homologue non rigide. Notre contribution majeure réside dans la préservation des détails fins grâce à la modélisation de la partie non rigide par un réseau neuronal graphique (GNN), qui conserve l'information de pose localement aux parties du corps voisines. Contrairement aux méthodes précédentes basées sur la représentation canonique, qui opèrent uniquement sur l'espace des coordonnées de la forme entière, notre modélisation de mouvement sensible à la localité reproduit à la fois des contours réalistes et des détails fins et précis. Nous évaluons notre approche sur les bases de données ZJU-MoCap, ActorsHQ, SynWild et diverses vidéos d'extérieur. Les expériences révèlent qu'avec la déformation sensible à la localité vers l'espace des caractéristiques canoniques, nous sommes les premiers à obtenir des résultats de pointe simultanément en matière de synthèse de vues inédites, d'animation de poses inédites et de reconstruction de formes 3D. Afin d'assurer la reproductibilité, le code sera disponible dès sa publication.
MA-RLHF : Apprentissage par renforcement à partir de rétroactions humaines avec des macro-actions
Yekun Chai, Haoran Sun, Huang Fang, Shuohuan Wang, Yu Sun (affilié à la faculté Vector), Hua Wu
Abstrait
L'apprentissage par renforcement à partir de rétroactions humaines (RLHF) a démontré son efficacité pour aligner les grands modèles de langage (LLM) sur les préférences humaines. Cependant, le RLHF au niveau des jetons souffre du problème d'attribution du mérite sur les longues séquences, où les récompenses différées rendent difficile pour le modèle de discerner quelles actions ont contribué à la réussite. Cela nuit à l'efficacité de l'apprentissage et ralentit la convergence. Dans cet article, nous proposons MA-RLHF, un cadre RLHF simple mais efficace qui intègre des macro-actions – des séquences de jetons ou des constructions linguistiques de plus haut niveau – dans le processus d'apprentissage. En opérant à ce niveau d'abstraction supérieur, notre approche réduit la distance temporelle entre les actions et les récompenses, facilitant une attribution du mérite plus rapide et plus précise. Il en résulte des estimations de gradient de politique plus stables et une efficacité d'apprentissage accrue au sein de chaque épisode, le tout sans augmenter la complexité de calcul pendant l'entraînement ou l'inférence. Nous validons notre approche par de nombreuses expériences sur des modèles de tailles variées et pour différentes tâches, notamment la synthèse de texte, la génération de dialogues, la réponse aux questions et la synthèse de programmes. Notre méthode surpasse largement RLHF standard en termes de performances, avec des gains allant jusqu'à 30 % pour la synthèse de texte et la génération de code, 18 % pour les dialogues et 8 % pour les questions-réponses. De plus, notre approche atteint des performances équivalentes à celles de RLHF classique 1,7 à 2 fois plus rapidement en termes de temps d'entraînement et continue de la surpasser lors d'entraînements ultérieurs. Nous publierons notre code, nos données et nos modèles afin d'encourager les recherches futures.
Le désapprentissage automatique ne parvient pas à éliminer les attaques par empoisonnement des données.
Martin Pawelczyk, Jimmy Di, Yiwei Lu, Gautam Kamath (membre du corps professoral de Vector), Ayush Sekhari, Seth Neel
Abstrait
Nous réexaminons l'efficacité de plusieurs méthodes pratiques de désapprentissage automatique approximatif développées pour l'apprentissage profond à grande échelle. Outre la prise en compte des demandes de suppression de données, une application potentielle souvent citée pour les méthodes de désapprentissage est la suppression des effets de l'entraînement sur des données corrompues. Nous démontrons expérimentalement que, bien que les méthodes de désapprentissage existantes se soient révélées efficaces dans plusieurs contextes d'évaluation (par exemple, pour atténuer les attaques par inférence d'appartenance), elles ne parviennent pas à supprimer les effets de la corruption de données, et ce, pour différents types d'attaques (indiscriminées, ciblées et une nouvelle attaque par empoisonnement gaussien) et de modèles (classificateurs d'images et modèles linéaires à longue portée), même avec un budget de calcul relativement important. Afin de caractériser précisément l'efficacité du désapprentissage, nous introduisons de nouvelles mesures d'évaluation basées sur la corruption des données. Nos résultats suggèrent qu'une perspective plus large, incluant une plus grande variété d'évaluations, est nécessaire pour éviter un excès de confiance dans les procédures de désapprentissage automatique pour l'apprentissage profond sans garanties vérifiables. De plus, bien que les méthodes de désapprentissage montrent certains signes d'utilité pour supprimer efficacement les points de données empoisonnés sans avoir à réentraîner le modèle, nos travaux suggèrent que ces méthodes ne sont pas encore « prêtes à être utilisées à grande échelle » et n'offrent actuellement qu'un avantage limité par rapport au réentraînement.
MAD-TD : Les données augmentées par modèle stabilisent l’apprentissage par renforcement à taux de mise à jour élevé
Article vedette
Claas Voelcker, Marcel Hussing, Eric Eaton, Amir-Massoud Farahmand (membre affilié de la faculté Vector), Igor Gilitschenski (membre affilié de la faculté Vector)
Abstrait
La construction d'agents d'apprentissage par renforcement (RL) profonds capables de trouver une bonne politique avec peu d'exemples s'est avérée particulièrement complexe. Pour optimiser l'utilisation des échantillons, des travaux récents ont exploré la mise à jour des réseaux de neurones avec un grand nombre d'itérations de gradient pour chaque nouvel exemple. Bien que ces ratios de mise à jour par rapport aux données (UTD) élevés aient démontré d'excellentes performances empiriques, ils introduisent également une instabilité dans le processus d'entraînement. Les approches précédentes nécessitent une réinitialisation périodique des paramètres du réseau de neurones pour pallier cette instabilité, mais le redémarrage du processus d'entraînement est souvent irréalisable dans des applications concrètes et nécessite un réglage précis de l'intervalle de réinitialisation. Dans cet article, nous nous concentrons sur l'une des principales difficultés de l'entraînement stable avec un nombre limité d'exemples : l'incapacité des fonctions de valeur apprises à se généraliser aux actions non observées. Nous atténuons directement ce problème en enrichissant le processus d'entraînement RL hors politique avec une petite quantité de données générées à partir d'un modèle du monde appris. Notre méthode, MAD-TD (Model-Augmented Data for TD Learning), utilise de petites quantités de données générées pour stabiliser l'entraînement avec un UTD élevé et obtenir des performances compétitives sur les tâches les plus difficiles de la suite de contrôle DeepMind. Nos expériences soulignent en outre l'importance d'utiliser un bon modèle pour générer des données, la capacité de MAD-TD à lutter contre la surestimation des valeurs et ses gains de stabilité pratique pour un apprentissage continu.
Magpie : Synthèse de données d'alignement à partir de zéro en incitant des LLM alignés à ne rien générer
Zhangchen Xu, Fengqing Jiang, Luyao Niu, Yuntian Deng (affilié à la faculté Vector), Radha Poovendran, Yejin Choi, Bill Yuchen Lin
Abstrait
Des données d'instructions de haute qualité sont essentielles à l'alignement des grands modèles linguistiques (LLM). Bien que certains modèles, comme Llama-3-Instruct, disposent de poids ouverts, leurs données d'alignement restent privées, ce qui freine la démocratisation de l'IA. Le coût élevé du travail humain et le périmètre limité et prédéfini des instructions empêchent les méthodes existantes de création de données open source de se généraliser efficacement, limitant potentiellement la diversité et la qualité des ensembles de données d'alignement publics. Est-il possible de synthétiser à grande échelle des données d'instructions de haute qualité en les extrayant directement d'un LLM aligné ? Nous présentons Magpie, une méthode d'autosynthèse permettant de générer des données d'alignement à grande échelle. Notre principale observation est que les LLM alignés, comme Llama-3-Instruct, peuvent générer une requête utilisateur lorsque l'on fournit uniquement les modèles de pré-requête jusqu'à la position réservée aux messages utilisateur, grâce à leur nature autorégressive. Nous utilisons cette méthode pour interroger Llama-3-Instruct et générer 4 millions d'instructions ainsi que leurs réponses correspondantes. Nous présentons des extensions de Magpie pour le filtrage, la génération de séquences multi-tours, l'optimisation des préférences, ainsi que des ensembles de données multilingues et spécifiques à un domaine. Nous faisons une analyse complète des données générées par Magpie. Afin de comparer ces données avec d'autres ensembles de données d'instructions publiques (ShareGPT, WildChat, Evol-Instruct, UltraChat, OpenHermes, Tulu-V2-Mix, GenQA, etc.), nous affinons le modèle Llama-3-8B-Base avec chacun d'eux et évaluons les performances des modèles ainsi affinés. Nos résultats indiquent que l'utilisation de Magpie pour l'affinage supervisé (SFT) surpasse les performances des ensembles de données publics précédemment utilisés pour le SFT et l'optimisation des préférences, comme l'optimisation directe des préférences avec UltraFeedback. Nous montrons également que, pour certaines tâches, les modèles affinés supervisés avec Magpie offrent des performances comparables à celles de l'ensemble de données officiel Llama-3-8B-Instruct, malgré l'enrichissement de ce dernier par 10 millions de points de données grâce au SFT et à l'optimisation des préférences. Cet avantage est évident sur les tests de référence d'alignement comme AlpacaEval, ArenaHard et WildBench.
MEGA-Bench : Élargissement de l’évaluation multimodale à plus de 500 tâches réelles
Jiacheng Chen, Tianhao Liang, Sherman Siu, Zhengqing Wang, Kai Wang, Yubo Wang, Yuansheng Ni, Ziyan Jiang, Wang Zhu, Bohan Lyu, Dongfu Jiang, Xuan He, Yuan Liu, Hexiang Hu, Xiang Yue, Wenhu Chen (membre du corps professoral vectoriel)
Abstrait
Nous présentons MEGA-Bench, une suite d'évaluation qui étend l'évaluation multimodale à plus de 500 tâches réelles, afin de répondre à la grande hétérogénéité des cas d'utilisation quotidiens des utilisateurs finaux. Notre objectif est d'optimiser un ensemble d'échantillons de données de haute qualité couvrant un large éventail de tâches multimodales, tout en permettant une évaluation précise et économique des modèles. Plus précisément, nous avons recueilli 505 tâches réalistes, soit plus de 8 000 échantillons, auprès de 16 annotateurs experts, afin de couvrir de manière exhaustive l'espace des tâches multimodales. Au lieu d'unifier ces problèmes en questions à choix multiples standard (comme MMMU, MM-Bench et MMT-Bench), nous prenons en charge une grande variété de formats de sortie : nombres, phrases, code, LaTeX, coordonnées, JSON, texte libre, etc. Pour s'adapter à ces formats, nous avons développé plus de 40 mesures d'évaluation. Contrairement aux benchmarks existants, MEGA-Bench propose un rapport de capacités détaillé couvrant de multiples dimensions (application, type d'entrée, format de sortie, niveau de compétence, etc.), permettant aux utilisateurs d'interagir avec les modèles et de les visualiser en profondeur. Nous évaluons un large éventail de modèles de vision par ordinateur de pointe sur MEGA-Bench afin de comprendre leurs capacités selon ces différentes dimensions.
MixEval-X : Évaluations interdonnées à partir d’un mélange de données réelles
Article vedette
Jinjie Ni, Yifan Song, Deepanway Ghosal, Bo Li, David Junhao Zhang, Xiang Yue, Fuzhao Xue, Yuntian Deng (affilié à la faculté Vector), Andy Zheng, Kaichen Zhang, Mahir Shah, Kabir Jain, Yang You, Michael Qizhe Shieh
Abstrait
La perception et la génération de modalités diverses sont essentielles pour que les modèles d'IA apprennent efficacement à partir de signaux du monde réel et interagissent avec eux, ce qui nécessite des évaluations fiables pour leur développement. Nous avons identifié deux problèmes majeurs dans les évaluations actuelles : (1) des normes incohérentes, façonnées par différentes communautés avec des protocoles et des niveaux de maturité variés ; et (2) d'importants biais de requête, de notation et de généralisation. Pour y remédier, nous présentons MixEval-X, le premier benchmark universel basé sur des données réelles, conçu pour optimiser et standardiser les évaluations à travers diverses modalités d'entrée et de sortie. Nous proposons des pipelines de mélange de benchmarks multimodaux et d'adaptation-rectification pour reconstruire les distributions de tâches du monde réel, garantissant ainsi une généralisation efficace des évaluations aux cas d'utilisation concrets. De nombreuses méta-évaluations montrent que notre approche aligne efficacement les échantillons de référence avec les distributions de tâches du monde réel. Par ailleurs, les classements des modèles de MixEval-X présentent une forte corrélation avec ceux des évaluations participatives du monde réel (jusqu'à 0,98), tout en étant beaucoup plus efficaces. Nous fournissons des classements complets pour reclasser les modèles et les organisations existants et offrons des perspectives pour améliorer la compréhension des évaluations multimodales et orienter les recherches futures.
MixMax : Robustesse distributionnelle dans l’espace fonctionnel grâce à des mélanges de données optimaux
Anvith Thudi, Chris Maddison (membre du corps professoral de Vector)
Abstrait
Les modèles d'apprentissage machine doivent souvent fonctionner dans plusieurs contextes prédéfinis, comme par exemple au sein de différents groupes d'utilisateurs. La performance dans le pire des cas est une mesure courante pour évaluer cette exigence et constitue l'objectif de l'optimisation robuste à la distribution de groupe (DRO de groupe). Malheureusement, ces méthodes rencontrent des difficultés lorsque la fonction de perte n'est pas convexe par rapport aux paramètres ou lorsque la classe de modèles n'est pas paramétrique. Nous proposons ici une solution classique : nous reparamétrons la DRO de groupe de l'espace des paramètres à l'espace des fonctions, ce qui présente plusieurs avantages. Premièrement, nous démontrons que la DRO de groupe sur l'espace des fonctions bornées admet un théorème minimax. Deuxièmement, pour l'entropie croisée et l'erreur quadratique moyenne, on montre que la distribution optimale du mélange minimax est la solution d'un problème d'optimisation convexe simple. Ainsi, pour une classe de modèles d'approximateurs de fonctions universels, la DRO de groupe peut être résolue par un problème d'optimisation convexe suivi d'un problème classique de minimisation du risque. Nous appelons notre méthode MixMax. Dans nos expériences, nous avons constaté que MixMax égalait ou surpassait les performances de référence du groupe DRO standard, et en particulier, MixMax améliorait les performances de XGBoost par rapport à la seule référence, l'équilibrage des données, pour les variations des ensembles de données d'annotations ACSIncome et CelebA.
MorphoDiff : Peinture de la morphologie cellulaire avec des modèles de diffusion
Article vedette
Zeinab Navidi, Jun Ma, Esteban Miglietta, Le Liu, Anne Carpenter, Beth Cimini, Benjamin Haibe-Kains (affilié à la faculté de vecteur), Bo Wang (faculté de vecteur)
Abstrait
Comprendre les réponses cellulaires aux stimuli externes est essentiel pour élucider les mécanismes biologiques et faire progresser le développement de thérapies. Les analyses d'images à haut débit constituent une approche rentable pour examiner les phénotypes cellulaires induits par diverses interventions, offrant ainsi des informations précieuses sur les processus biologiques et les états cellulaires. Dans cet article, nous présentons MorphoDiff, un pipeline génératif permettant de prédire les réponses morphologiques cellulaires à haute résolution dans différentes conditions, grâce à l'encodage des perturbations. À notre connaissance, MorphoDiff est le premier cadre capable de produire des prédictions guidées et à haute résolution de la morphologie cellulaire, généralisables aux interventions chimiques et génétiques. Le modèle intègre les représentations des perturbations comme signaux de guidage au sein d'un modèle de diffusion latente 2D. Les validations computationnelles, biologiques et visuelles complètes réalisées sur trois ensembles de données libres de peinture cellulaire montrent que MorphoDiff peut générer des images haute fidélité et produire des signaux biologiques significatifs lors de diverses interventions. Nous croyons que ce modèle facilitera l'exploration in silico efficace des paysages de perturbation, contribuant ainsi à des études de découverte de médicaments plus performantes.
Échantillonnage spéculatif multi-ébauches : architectures canoniques et limites théoriques
Article vedette
Ashish Khisti (affilié à la faculté Vector), MohammadReza Ebrahimi, Hassan Dbouk, Arash Behboodi, Roland Memisevic, Christos Louizos
Abstrait
Nous considérons l'échantillonnage spéculatif multi-ébauches, où les séquences de propositions sont échantillonnées indépendamment à partir de différents modèles d'ébauche. À chaque étape, un schéma de sélection d'ébauche au niveau du jeton prend en entrée une liste de jetons valides et produit un jeton de sortie dont la distribution correspond à celle du modèle cible. Des travaux antérieurs ont démontré que le schéma optimal (qui maximise la probabilité d'accepter l'un des jetons d'entrée) peut être formulé comme la solution d'un programme linéaire. Dans ce travail, nous montrons que le schéma optimal peut être décomposé en une solution en deux étapes : dans la première étape, un schéma de type échantillonnage d'importance (EI) est utilisé pour sélectionner un jeton intermédiaire ; dans la deuxième étape (ébauche unique), un échantillonnage spéculatif est appliqué pour générer le jeton de sortie. Dans le cas de deux modèles d'ébauche identiques, nous établissons en outre : 1) une condition nécessaire et suffisante sur les distributions des modèles cible et d'ébauche pour que la probabilité d'acceptation soit égale à un ; et 2) une expression explicite de la probabilité d'acceptation optimale. Notre analyse théorique motive également une nouvelle classe de schémas de sélection au niveau du jeton basée sur un échantillonnage d'importance pondéré. Nos résultats expérimentaux démontrent des améliorations constantes de l'efficacité des blocs et des débits de jetons atteignables par rapport aux schémas de référence dans un certain nombre de scénarios.
Espaces-temps neuronaux pour l'apprentissage de représentations DAG
Haitz Sáez de Ocáriz Borde, Anastasis Kratsios (affilié à la faculté Vector), Marc T Law, Xiaowen Dong, Michael Bronstein
Abstrait
We propose a class of trainable deep learning-based geometries called Neural SpaceTimes (NSTs), which can universally represent nodes in weighted Directed Acyclic Graphs (DAGs) as events in a spacetime manifold. While most works in the literature focus on undirected graph representation learning or causality embedding separately, our differentiable geometry can encode both graph edge weights in its spatial dimensions and causality in the form of edge directionality in its temporal dimensions. We use a product manifold that combines a quasi-metric (for space) and a partial order (for time). NSTs are implemented as three neural networks trained in an end-to-end manner: an embedding network, which learns to optimize the location of nodes as events in the spacetime manifold, and two other networks that optimize the space and time geometries in parallel, which we call a neural (quasi-)metric and a neural partial order, respectively. The latter two networks leverage recent ideas at the intersection of fractal geometry and deep learning to shape the geometry of the representation space in a data-driven fashion, unlike other works in the literature that use fixed spacetime manifolds such as Minkowski space or De Sitter space to embed DAGs. Our main theoretical guarantee is a universal embedding theorem, showing that any $k$-point DAG can be embedded into an NST with $1+\mathcal{O}(\log(k))$ distortion while exactly preserving its causal structure. The total number of parameters defining the NST is sub-cubic in $k$ and linear in the width of the DAG. If the DAG has a planar Hasse diagram, this is improved to $\mathcal{O}(\log(k) + 2)$ spatial and 2 temporal dimensions. We validate our framework computationally with synthetic weighted DAGs and real-world network embeddings; in both cases, the NSTs achieve lower embedding distortions than their counterparts using fixed spacetime geometries.
Optimisation de la stabilité au bruit pour la recherche de minima plats : une approche de régularisation basée sur la matrice hessienne
Haotian Ju, Hongyang Zhang (affiliés à la faculté Vector), Dongyue Li
Abstrait
L'entraînement des réseaux neuronaux surparamétrés a fait l'objet de nombreuses études récentes. La régularisation de ces réseaux, due à leur géométrie fortement non convexe et non linéaire, constitue un aspect important. Dans cet article, nous étudions des algorithmes d'injection de bruit permettant de régulariser la matrice hessienne de la fonction de perte, conduisant à des régions présentant des surfaces de perte planes. Plus précisément, l'injection d'un bruit gaussien isotrope dans les matrices de poids d'un réseau de neurones permet d'obtenir une estimation approximativement sans biais de la trace de la matrice hessienne. Cependant, une implémentation naïve de l'injection de bruit, consistant à ajouter du bruit aux matrices de poids avant la rétropropagation, n'apporte que des améliorations empiriques limitées. Pour pallier cette limite, nous proposons une estimation à deux points de la pénalité hessienne, qui injecte du bruit dans les matrices de poids selon les directions positive et négative du bruit aléatoire. Cette estimation à deux points élimine notamment la variance du terme de développement de Taylor du premier ordre de la matrice hessienne. Nous montrons une borne de généralisation PAC-Bayes qui dépend de la trace du hessien (et du rayon de l'espace des poids), qui peut être mesurée à partir des données.
Nous avons mené une étude expérimentale détaillée pour valider notre approche et démontrer son efficacité pour régulariser la matrice hessienne et améliorer la généralisation. Premièrement, notre algorithme surpasse les approches précédentes lors de l'entraînement avec une netteté réduite, offrant un gain de précision de test allant jusqu'à 2,4 % pour l'ajustement fin des ResNets sur six ensembles de données de classification d'images. De plus, la trace de la matrice hessienne est réduite de 15,8 % et la plus grande valeur propre de 9,7 % grâce à notre approche. Nous avons également constaté que la régularisation de la matrice hessienne peut être combinée à d'autres méthodes de régularisation, telles que la décroissance du poids et l'augmentation des données, pour une régularisation plus efficace. Deuxièmement, notre approche demeure très performante pour améliorer la généralisation lors du pré-entraînement de modèles CLIP multimodaux et de l'ajustement fin par chaîne de pensée.
OATS : Élagage tenant compte des valeurs aberrantes grâce à une décomposition clairsemée et de faible rang
Stephen Zhang, Vardan Papyan (membre affilié de la faculté Vector)
Abstrait
Le récent changement de paradigme vers des modèles de base à grande échelle a inauguré une nouvelle ère pour l'apprentissage profond. Bien que cette ère ait connu un grand succès en pratique, elle s'est également heurtée à des coûts prohibitifs en termes de consommation de mémoire et de puissance de calcul. Pour atténuer ces problèmes, des efforts concertés ont été déployés pour développer des techniques d'élagage a posteriori des réseaux neuronaux, ne nécessitant pas de réentraînement coûteux. Malgré les progrès considérables réalisés, les méthodes existantes présentent souvent une baisse constante des performances du modèle à mesure que la compression augmente. Dans cet article, nous présentons une nouvelle approche de compression des grands transformateurs, appelée OATS, qui compresse les poids du modèle en approximant chaque matrice de poids par la somme d'une matrice creuse et d'une matrice de faible rang. Avant la décomposition, les poids sont d'abord normalisés par le moment d'ordre deux de leurs plongements d'entrée, afin de préserver les caractéristiques aberrantes récemment observées dans les grands modèles de transformeurs. Sans réentraînement, OATS atteint des performances de pointe lors de la compression de grands modèles de langage, tels que Llama-3 et Phi-3, et de transformateurs de vision, tels que ViT et DINOv2 de Google, jusqu'à 60 %, tout en accélérant l'inférence du modèle sur un CPU jusqu'à 1,37 fois par rapport aux méthodes d'élagage précédentes.
OMNI-EPIC : Ouverture par des modèles de notions humaines d’intérêt avec des environnements programmés.
Maxence Faldor, Jenny Zhang, Antoine Cully, Jeff Clune (membre du corps professoral de Vector)
Abstrait
Les algorithmes ouverts et générateurs d'IA visent à générer et résoudre en continu des tâches de plus en plus complexes, offrant ainsi une voie prometteuse vers une intelligence plus générale. Pour réaliser cette vision ambitieuse, l'apprentissage doit se dérouler au sein d'un large éventail de tâches potentielles. Les approches existantes de génération automatique d'environnements sont limitées à des distributions d'environnements prédéfinies manuellement, souvent restreintes, ce qui limite leur capacité à créer n'importe quel environnement d'apprentissage. Pour pallier cette limite, nous introduisons un nouveau cadre, OMNI-EPIC, qui enrichit les travaux précédents sur l'ouverture via les modèles de notions humaines d'intérêt (OMNI) avec des environnements programmés dans le code (EPIC). OMNI-EPIC exploite des modèles fondamentaux pour générer de manière autonome le code spécifiant les prochaines tâches apprenables (c'est-à-dire ni trop faciles ni trop difficiles pour les compétences actuelles de l'agent) et intéressantes (par exemple, pertinentes et nouvelles). OMNI-EPIC génère à la fois des environnements (par exemple, un parcours d'obstacles) et des fonctions de récompense (par exemple, progresser rapidement dans le parcours d'obstacles sans toucher les objets rouges), ce qui lui permet, en principe, de créer n'importe quelle tâche d'apprentissage simulable. Nous mettons en lumière la créativité exceptionnelle d'OMNI-EPIC, qui innove sans cesse pour proposer de nouveaux défis d'apprentissage stimulants. Nous soulignons également sa capacité d'adaptation aux progrès des agents d'apprentissage par renforcement, en générant des tâches d'un niveau de difficulté approprié. En fin de compte, OMNI-EPIC a le potentiel de créer à l'infini des environnements d'apprentissage captivants, contribuant ainsi au développement de systèmes d'IA auto-améliorants et d'algorithmes de génération d'IA.
OmniEdit : Création de modèles généralistes de retouche d’images grâce à la supervision de spécialistes
Cong Wei, Zheyang Xiong, Weiming Ren, Xeron Du, Ge Zhang, Wenhu Chen (membre du corps professoral de Vector)
Abstrait
Les méthodes de retouche d'images guidées par instructions ont démontré un potentiel significatif grâce à l'entraînement de modèles de diffusion sur des paires d'images à retoucher, synthétisées automatiquement ou annotées manuellement. Cependant, ces méthodes demeurent loin des applications pratiques et concrètes. Nous avons identifié trois défis majeurs expliquant cet écart. Premièrement, les modèles existants ont des capacités de retouche limitées en raison du processus de synthèse biaisé. Deuxièmement, ces méthodes sont entraînées avec des ensembles de données comportant un volume élevé de bruit et d'artefacts, en raison de l'application de méthodes de filtrage simples comme le score CLIP. Troisièmement, tous ces ensembles de données sont limités à une seule faible résolution et à un format d'image fixe, ce qui restreint leur polyvalence pour la gestion de cas d'utilisation réels. Dans cet article, nous présentons OmniEdit, un éditeur polyvalent capable de gérer sept tâches de retouche d'images différentes, quel que soit leur format d'image. Notre contribution est quadruple : (1) OmniEdit est formé en utilisant la supervision de sept modèles spécialisés différents afin d'assurer la couverture des tâches. (2) Nous utilisons un échantillonnage d'importance basé sur les scores fournis par de grands modèles multimodaux (comme GPT-4o) au lieu du score CLIP afin d'améliorer la qualité des données. (3) Nous proposons une nouvelle architecture d'édition, EditNet, afin d'améliorer considérablement le taux de réussite des modifications. (4) Nous fournissons des images de formats variés pour nous assurer que notre modèle peut traiter n'importe quelle image. Nous avons constitué un ensemble de test contenant des images de formats différents, accompagnées d'instructions diverses couvrant différentes tâches. Les évaluations automatiques et humaines démontrent qu'OmniEdit surpasse de manière significative tous les modèles existants.
OmniRe : Reconstruction de scènes urbaines Omni
Article vedette
Ziyu Chen, Jiawei Yang, Jiahui Huang, Riccardo de Lutio, Janick Martinez Esturo, Boris Ivanovic, Or Litany, Zan Gojcic, Sanja Fidler (membre du corps professoral de Vector), Marco Pavone, Li Song, Yue Wang
Abstrait
Nous présentons OmniRe, un système complet permettant de créer efficacement des jumeaux numériques haute fidélité de scènes dynamiques réelles à partir des journaux d'activité embarqués. Les méthodes récentes utilisant des champs neuronaux ou le splatting gaussien se concentrent principalement sur les véhicules, ce qui limite la possibilité d'adopter un cadre holistique pour tous les éléments dynamiques au premier plan requis par les applications en aval, comme la simulation du comportement humain. OmniRe va au-delà de la modélisation des véhicules pour permettre une reconstruction précise et complète de divers objets dynamiques dans des scènes urbaines. Notre approche construit des graphiques de scène sur 3DGS et génère de multiples représentations gaussiennes dans des espaces canoniques qui modélisent différents acteurs dynamiques, notamment les véhicules, les piétons, les cyclistes, etc. OmniRe permet de reconstruire de manière holistique tout objet dynamique de la scène, rendant possible des simulations avancées (~60 Hz) incluant des scénarios avec participation humaine, comme la simulation du comportement des piétons et l'interaction homme-véhicule. Cette capacité de simulation complète est inégalée par les méthodes existantes. Des évaluations approfondies de l'ensemble de données Waymo montrent que notre approche surpasse largement les méthodes de pointe existantes, tant quantitativement que qualitativement. Nous étendons ensuite nos résultats à cinq autres ensembles de données de conduite populaires afin de démontrer sa généralisabilité aux scènes urbaines courantes. Le code et les données seront mis à la disposition du public.
Sur les avantages de l'adaptation de domaine graphique pilotée par attributs
Ruiyi Fang, Bingheng Li, Zhao Kang, Qiuhao Zeng, Ruizhi Pu, Nima Hosseini Dashtbayaz, Charles Ling (affilié de la faculté vectorielle), Boyu Wang (affilié de la faculté vectorielle)
Abstrait
L'adaptation de domaine de graphes (GDA) répond à un défi majeur de l'apprentissage interréseaux, particulièrement pertinent en raison de l'absence de données étiquetées dans les ensembles de données de graphiques réels. Des études récentes ont tenté d'apprendre des représentations invariantes au domaine en éliminant les décalages structurels entre les graphes. Dans ce travail, nous montrons que les méthodologies existantes ont négligé l'importance des attributs des nœuds, un facteur crucial pour l'alignement de domaine de graphes. Plus précisément, nous révélons d'abord l'impact des attributs des nœuds sur la GDA en prouvant théoriquement qu'en plus de la divergence structurelle des graphes entre les domaines, la disparité des attributs des nœuds joue également un rôle critique. De plus, nous montrons empiriquement que le décalage d'attributs est plus important que le décalage topologique, ce qui souligne davantage l'importance de l'alignement des attributs des nœuds dans la GDA. Inspirés par cette découverte, nous avons développé un nouveau module inter-canaux pour fusionner et aligner les vues des graphiques source et cible pour la GDA. Les résultats expérimentaux obtenus sur divers ensembles de données de référence confirment l'efficacité de notre méthode.
Démontrer les inégalités des Olympiades en combinant les maîtrises en droit et le raisonnement symbolique
Zenan Li, Zhaoyu Li, Wen Tang, Xian Zhang, Yuan Yao, Xujie Si (affilié à la faculté Vector), Fan Yang, Kaiyu Yang, Xiaoxing Ma
Abstrait
Large language models (LLMs) can prove mathematical theorems formally by generating proof steps (\textit{a.k.a.} tactics) within a proof system. However, the space of possible tactics is vast and complex, while the available training data for formal proofs is limited, posing a significant challenge to LLM-based tactic generation. To address this, we introduce a neuro-symbolic tactic generator that synergizes the mathematical intuition learned by LLMs with domain-specific insights encoded by symbolic methods. The key aspect of this integration is identifying which parts of mathematical reasoning are best suited to LLMs and which to symbolic methods. While the high-level idea of neuro-symbolic integration is broadly applicable to various mathematical problems, in this paper, we focus specifically on Olympiad inequalities (Figure~1). We analyze how humans solve these problems and distill the techniques into two types of tactics: (1) scaling, handled by symbolic methods, and (2) rewriting, handled by LLMs. In addition, we combine symbolic tools with LLMs to prune and rank the proof goals for efficient proof search. We evaluate our framework on 161 challenging inequalities from multiple mathematics competitions, achieving state-of-the-art performance and significantly outperforming existing LLM and symbolic approaches without requiring additional training data.
PWM : Apprentissage de politiques avec des modèles du monde multitâches
Ignat Georgiev, Varun Giridhar, Nicklas Hansen, Animesh Garg (affilié à la faculté Vector)
Abstrait
L'apprentissage par renforcement (RL) a fait des progrès significatifs dans les tâches complexes, mais a du mal à s'adapter aux environnements multitâches aux dynamiques variées. Les méthodes de modèles du monde offrent une bonne évolutivité grâce à l'apprentissage d'une simulation de l'environnement, mais s'appuient souvent sur des méthodes d'optimisation sans gradient, peu efficaces, pour l'extraction des politiques. Inversement, les méthodes basées sur le gradient présentent une variance plus faible, mais ne gèrent pas les discontinuités. Nos travaux révèlent que des modèles du monde bien régularisés peuvent générer des paysages d'optimisation plus lisses que la dynamique réelle, facilitant ainsi une optimisation de premier ordre plus efficace. Nous présentons l'apprentissage de politiques avec des modèles du monde multitâches (PWM), un nouvel algorithme RL basé sur un modèle pour le contrôle continu. Initialement, le modèle du monde est préentraîné sur des données hors ligne, puis les politiques en sont extraites par optimisation du premier ordre en moins de 10 minutes par tâche. PWM résout efficacement des tâches comportant jusqu'à 152 dimensions d'action et surpasse les méthodes utilisant la dynamique réelle. De plus, PWM s'adapte à un environnement de 80 tâches, atteignant des récompenses jusqu'à 27 % supérieures aux méthodes de référence existantes, sans nécessiter de planification en ligne coûteuse. Visualisations et code disponibles sur [ https://policy-world-model.github.io/ ]
Flux de reconstruction dynamique de réajustement
Sara Oblak, Despoina Paschalidou, Sanja Fidler (membre du corps professoral de Vector), Matan Atzmon
Abstrait
La reconstruction de scènes dynamiques à partir d'images est une tâche fondamentale en vision par ordinateur, avec de nombreuses applications. Malgré les progrès récents, les approches existantes ont encore du mal à obtenir des reconstructions de haute qualité à partir de points de vue et d'instantanés inconnus. Ce travail présente le cadre ReMatching, conçu pour améliorer la qualité de généralisation en intégrant des informations a priori sur la déformation dans les modèles de reconstruction dynamique. Notre approche préconise des informations a priori basées sur le champ de vitesse, pour lesquelles nous proposons une procédure d'appariement qui s'intègre facilement aux pipelines de reconstruction dynamique existants. Ce cadre est hautement adaptable et peut être appliqué à diverses représentations dynamiques. De plus, il permet d'intégrer plusieurs types d'informations a priori et de combiner des informations plus simples pour créer des classes plus complexes. Nos évaluations sur des ensembles de données de référence populaires, comprenant des scènes dynamiques synthétiques et réelles, démontrent une nette amélioration de la précision de la reconstruction par rapport aux modèles de pointe actuels.
Retri3D : Recherche de représentations graphiques neuronales 3D
Article vedette
Yushi Guan, Daniel Kwan, Jean Dandurand, Xi Yan, Ruofan Liang, Yuxuan Zhang, Nilesh Jain, Nilesh Ahuja, Selvakumar Panneer, Nandita Vijaykumar (affiliée à la faculté Vector)
Abstrait
Les représentations graphiques neuronales 3D apprenables (3DNGR) se sont montrées prometteuses pour la reconstruction de scènes 3D à partir d'images 2D. De nombreux travaux, tels que les champs de radiance neuronaux (NeRF), le splatting gaussien 3D (3DGS) et leurs variantes, ont considérablement amélioré la qualité de ces représentations. Leur facilité de construction à partir d'images 2D, leur compatibilité avec la visualisation et le partage en ligne, ainsi que leurs applications dans la conception de jeux et d'œuvres d'art, en font une représentation 3D essentielle, permettant la création potentielle d'un grand nombre de modèles 3D. Cela nécessite d'importants espaces de stockage de données, locaux ou en ligne, pour enregistrer les données visuelles 3D dans ces formats. Aucun cadre existant ne permet une récupération précise des 3DNGR stockées. Dans ce travail, nous proposons Retri3D, un cadre permettant une récupération précise et efficace de scènes 3D représentées sous forme de NGR à partir de vastes bases de données, grâce à des requêtes textuelles. Nous présentons une nouvelle technique d'analyse des artefacts de champ neuronal, combinée à un module de déplacement intelligent de la caméra, pour sélectionner des vues nettes et naviguer dans des représentations 3D pré-entraînées. Ces techniques permettent une recherche précise en sélectionnant les meilleures directions de vue dans la scène 3D pour des représentations visuelles de haute qualité. Nous démontrons que Retri3D est compatible avec toute représentation NGR. Sur les ensembles de données LERF et ScanNet++, nous démontrons une amélioration significative de la précision de la recherche par rapport aux techniques existantes, tout en étant considérablement plus rapide et moins gourmande en espace de stockage.
Réexamen de l'élagage des paramètres delta pour les modèles bien ajustés
Article vedette
Wenlong Deng, Yize Zhao, Vala Vakilian, Minghui Chen, Xiaoxiao Li (membre du corps professoral de Vector), Christos Thrampoulidis
Abstrait
Le stockage séparé des modèles open source raffinés introduit de la redondance et augmente les temps de réponse des applications utilisant plusieurs modèles. L'élagage des paramètres delta (DPP), et plus particulièrement la méthode DARE (Random Drop and Rescale) proposée par Yu et al., résout ce problème en supprimant la majorité des paramètres delta (les différences entre les poids des modèles affinés et préentraînés), tout en minimisant généralement la perte de performance. Cependant, DARE est inefficace lorsque le taux d'élagage ou l'amplitude des paramètres delta sont importants. Nous soulignons deux raisons principales à cet échec : (1) un facteur de rééchelonnement excessif lorsque les taux d’élagage augmentent, et (2) une moyenne et une variance élevées des paramètres delta. Pour y remédier, nous développons deux améliorations algorithmiques : (1) DARq, qui modifie le facteur de rééchelonnement dans DARE, ce qui permet des gains de performance significatifs à des taux d’élagage élevés (par exemple, > 30 % sur COLA et SST2 pour les modèles d’encodeur, avec des améliorations encore plus importantes pour les modèles de décodeur), et (2) AdamR, une modification en cours d’entraînement qui intègre une régularisation delta appropriée avant l’application de DPP. Nous démontrons également que DARq peut être facilement combiné avec des techniques d'ajustement fin classiques et efficaces en termes de paramètres, telles que LoRA, et peut faciliter la DPP structurelle. De plus, nous réexaminons l’application des techniques d’élagage basées sur l’importance au sein de la DPP, en démontrant qu’elles surpassent les méthodes aléatoires lorsque les paramètres delta sont élevés. Grâce à cette étude exhaustive, nous développons un pipeline permettant de sélectionner la méthode DPP la plus appropriée dans différents scénarios pratiques.
Réexamen de l'adaptation de domaine sans source : une nouvelle perspective par le biais du contrôle de l'incertitude
Gezheng Xu, Hui Guo, Li Yi, Charles Ling (membre associé de la faculté Vector), Boyu Wang (membre associé de la faculté Vector), Grace Yi (membre associé de la faculté Vector)
Abstrait
L'adaptation de domaine sans source (SFDA) vise à adapter un modèle source préentraîné au domaine cible en utilisant uniquement des données cibles non étiquetées, sans accès aux données sources originales. Si les méthodes de pointe actuelles s'appuient sur une supervision faible du modèle source pour extraire des informations fiables en vue d'une adaptation auto-supervisée, elles négligent souvent l'incertitude inhérente au processus de transfert. Dans cet article, nous menons une analyse systématique et théorique de cette incertitude dans les méthodes SFDA existantes et démontrons son impact sur les performances de transfert à travers le prisme de l'optimisation robuste distributionnelle (DRO). À partir de ces résultats théoriques, nous proposons un nouvel algorithme de contrôle de l'incertitude dépendant de l'instance pour la SFDA. Notre méthode est conçue pour quantifier et exploiter l'incertitude durant le processus d'adaptation, améliorant ainsi significativement les performances du modèle. De nombreuses expériences sur des ensembles de données de référence et des analyses empiriques confirment la validité de nos résultats théoriques et l'efficacité de la méthode proposée. Ce travail offre de nouvelles perspectives pour la compréhension et l'amélioration du rendement de la SFDA.
Distillation de la cohérence latente guidée par la récompense
William Wang, Jiachen Li, Weixi Feng, Wenhu Chen (membre du corps professoral de Vector)
Abstrait
La distillation de cohérence latente (LCD) s'est imposée comme un paradigme prometteur pour la synthèse efficace d'images à partir de texte. En distillant un modèle de cohérence latente (LCM) à partir d'un modèle de diffusion latente (LDM) préentraîné, la LCD facilite la génération d'images haute fidélité en seulement 2 à 4 étapes d'inférence. Cependant, cette efficacité se fait au détriment de la qualité des échantillons. Dans cet article, nous proposons de compenser cette perte de qualité en alignant la sortie du LCM sur les préférences humaines lors de l'entraînement. Plus précisément, nous introduisons la LCD guidée par récompense (RG-LCD), qui intègre la rétroaction d'un modèle de récompense (RM) au processus ACL en augmentant la perte de la LCD originale afin de maximiser la récompense associée à la génération en une seule étape du LCM. Comme l'a validé une évaluation humaine, lorsqu'elles sont entraînées avec les commentaires d'un bon RM, les générations en 2 étapes de notre RG-LCM sont préférées par les humains aux échantillons DDIM en 50 étapes du LDM de l'enseignant, ce qui représente une accélération de l'inférence de 25 fois sans perte de qualité.
L'optimisation directe vers des modèles de réponse différentiables pouvant entraîner une suroptimisation, nous proposons, dans un premier temps, l'utilisation d'un modèle de réponse latent (LRM) comme intermédiaire. Ce nouveau composant assure la liaison entre notre modèle de réponse latent (LCM) et le modèle de réponse. Nos résultats empiriques démontrent que l'intégration du LRM dans notre modèle RG-LCD permet d'éviter le bruit haute fréquence dans les images générées, améliorant ainsi la distance d'inception de Fréchet (FID) sur MS-COCO et le score HPSv2.1 sur l'ensemble de test HPSv2, surpassant les performances du LCM de référence.
Page du projet : https://rg-lcd.github.io/
S4M : S4 pour la prévision de séries temporelles multivariées avec valeurs manquantes
Jing Peng, Meiqi Yang, Qiong Zhang, Xiaoxiao Li (membre du corps professoral de Vector)
Abstrait
Les données de séries temporelles multivariées sont essentielles à de nombreuses applications concrètes, notamment en finance, en santé et en météorologie, où des prévisions précises sont primordiales pour une prise de décision éclairée et des mesures proactives. Cependant, la présence de données manquantes pose des défis importants, compromettant souvent les performances des modèles prédictifs. Les approches traditionnelles en deux étapes, qui consistent d'abord à imputer les valeurs manquantes puis à effectuer la prévision, ont tendance à accumuler des erreurs, en particulier dans des contextes multivariés complexes présentant des taux de données manquantes élevés et des structures de dépendance complexes. Dans ce travail, nous présentons S4M, un cadre de prévision de séries temporelles de bout en bout qui intègre de manière transparente la gestion des données manquantes au sein de l'architecture du modèle S4 (Structured State Space Sequence). Contrairement aux méthodes conventionnelles qui traitent l'imputation comme une étape de prétraitement distincte, S4M exploite l'espace latent des modèles S4 pour reconnaître et représenter directement les schémas de données manquantes, capturant ainsi plus efficacement les dépendances temporelles et multivariées sous-jacentes. Notre approche comprend deux modules clés : l'ATPM (Adaptive Temporal Prototype Mapper) et le MDS-S4 (Missing-Aware Dual Stream S4). L'ATPM utilise une banque de prototypes pour extraire des représentations robustes et informatives des tendances des données historiques, tandis que MDS-S4 traite ces représentations conjointement avec des masques de données manquantes, constituant ainsi deux flux d'entrée pour réaliser des prévisions précises. De nombreuses évaluations empiriques sur divers ensembles de données réels démontrent que S4M atteint systématiquement des performances de pointe, validant l'efficacité de notre approche intégrée pour la gestion des données manquantes et soulignant sa robustesse et sa supériorité par rapport aux méthodes d'imputation traditionnelles. Ces résultats mettent en évidence le potentiel de notre méthode pour améliorer la fiabilité des prévisions de séries temporelles dans les applications pratiques.
Désapprentissage sélectif par effacement de représentation à l'aide d'un entraînement adverse
Nazanin Sepahvand, Eleni Triantafillou, Hugo Larochelle, Doina Precup, Jim Clark, Dan Roy (membre du corps professoral de Vector), Gintare Karolina Dziugaite
Abstrait
Lors du déploiement de modèles d'apprentissage machine en conditions réelles, nous sommes souvent confrontés au défi de « désapprendre » certains points de données ou sous-ensembles après l'entraînement. Inspirés par l'entraînement adverse de réseaux neuronaux (DANN), nous proposons un nouvel algorithme, SURE, pour le désapprentissage ciblé. SURE traite le processus comme un problème d'adaptation de domaine, où l'« ensemble d'oubli » (données à supprimer) et un ensemble de validation issus de la même distribution forment deux domaines distincts. Nous entraînons un classificateur de domaine pour discriminer les représentations des ensembles d'oubli et de validation. À l'aide d'une stratégie d'inversion de gradient semblable à celle de DANN, nous effectuons des mises à jour de gradient sur les représentations afin de « tromper » le classificateur de domaine et ainsi masquer les représentations appartenant à l'ensemble d'oubli. Simultanément, une descente de gradient est appliquée à l'ensemble de conservation (données d'entraînement originales moins l'ensemble d'oubli) pour préserver ses performances de classification. Contrairement aux autres approches de désapprentissage dont les objectifs d'entraînement sont construits à partir des sorties du modèle, SURE manipule directement leurs représentations. Ceci est essentiel pour assurer la robustesse face à des attaques plus puissantes que celles actuellement étudiées dans la littérature, visant à détecter les exemples désappris grâce à l'accès aux plongements lexicaux appris. Nos expériences approfondies révèlent que SURE offre un meilleur compromis qualité/utilité du désapprentissage que les autres techniques de désapprentissage standard pour les réseaux de neurones profonds.
SG-I2V : Contrôle de trajectoire autoguidé dans la génération d'images vidéo
Koichi Namekata, Sherwin Bahmani, Ziyi Wu, Yash Kant, Igor Gilitschenski (affilié de la faculté de vecteur), David Lindell (affilié de la faculté de vecteur)
Abstrait
Les méthodes de génération d'images à partir de vidéos ont atteint une qualité photoréaliste impressionnante. Cependant, l'ajustement d'éléments spécifiques dans les vidéos générées, tels que le mouvement des objets ou de la caméra, est souvent un processus fastidieux d'essais et d'erreurs, impliquant par exemple la régénération des vidéos avec différentes valeurs initiales aléatoires. Des techniques récentes s'attaquent à ce problème en peaufinant un modèle pré-entraîné pour suivre des signaux de conditionnement, tels que des boîtes englobantes ou des trajectoires de points. Néanmoins, cette procédure d'affinage peut s'avérer coûteuse en calcul et nécessite des ensembles de données avec des annotations sur le mouvement des objets, ce qui peut être difficile à obtenir. Dans ce travail, nous présentons SG-I2V, un cadre pour la génération d'images à partir de vidéos contrôlable et autoguidée, offrant un contrôle sans exemple en s'appuyant uniquement sur les connaissances présentes dans un modèle de diffusion image-vidéo préentraîné, sans nécessiter d'affinage ni de connaissances externes. Notre méthode sans exemple surpasse les méthodes de référence non supervisées tout en réduisant considérablement l'écart de performance avec les modèles supervisés en termes de qualité visuelle et de fidélité du mouvement. Des renseignements supplémentaires et des résultats vidéo sont disponibles sur la page de notre projet : https://sgi2v-paper.github.io
SmartPretrain : apprentissage de représentations indépendantes du modèle et de l'ensemble de données pour la prédiction de mouvement
Yang Zhou, Hao Shao, Letian Wang, Steven Waslander (affilié à la faculté Vector), Hongsheng Li, Yu Liu
Abstrait
La prédiction des mouvements futurs des agents environnants est essentielle au bon fonctionnement des véhicules autonomes (VA) dans des environnements dynamiques où coexistent les humains et les robots. Cependant, la rareté des ensembles de données de conduite à grande échelle a freiné le développement de modèles de prédiction de mouvement robustes et généralisables, limitant leur capacité à saisir les interactions complexes et les géométries routières. Inspiré par les progrès récents du traitement automatique du langage naturel (TALN) et de la vision par ordinateur (VCO), l'apprentissage autosupervisé (AAS) a suscité un vif intérêt au sein de la communauté de la prédiction de mouvement pour l'apprentissage de représentations de scènes riches et transférables. Néanmoins, les méthodes de pré-entraînement existantes pour la prédiction du mouvement se sont principalement concentrées sur des architectures de modèles spécifiques et un seul ensemble de données, limitant ainsi leur évolutivité et leur généralisation. Pour relever ces défis, nous proposons SmartPretrain, un cadre d'AAS général et évolutif pour la prédiction de mouvement, indépendant du modèle et de l'ensemble de données. Notre approche intègre l'AAS contrastif et reconstructif, tirant parti des atouts des paradigmes génératifs et discriminatifs pour représenter efficacement l'évolution spatio-temporelle et les interactions sans imposer de contraintes architecturales. De plus, SmartPretrain utilise une stratégie d'échantillonnage de scénarios indépendante de l'ensemble de données, intégrant plusieurs ensembles de données et améliorant ainsi leur volume, leur diversité et leur robustesse. De nombreuses expériences menées sur divers ensembles de données démontrent que SmartPretrain améliore systématiquement les performances des modèles de prédiction de pointe, quels que soient les ensembles de données, les divisions de données et les principales métriques. Par exemple, SmartPretrain réduit significativement le taux d'erreur de prévision (MissRate) de 10,6 %. Ces résultats soulignent l'efficacité de SmartPretrain en tant que solution unifiée et évolutive pour la prédiction du mouvement, s'affranchissant des limites liées aux petits ensembles de données.
Fusion douce d'experts avec routage adaptatif
Haokun Liu, Muqeeth Mohammed, Colin Raffel (membre du corps professoral de Vector)
Abstrait
Les réseaux neuronaux qui apprennent à acheminer leurs entrées via différents sous-réseaux « experts » offrent une modularité dont les modèles denses classiques sont dépourvus. Malgré leurs avantages potentiels, les modèles modulaires avec apprentissage du routage sont souvent moins performants que leurs homologues denses aux paramètres identiques, ainsi que les modèles utilisant des stratégies de routage heuristiques non apprises. Dans cet article, nous émettons l'hypothèse que ces limitations proviennent des techniques d'estimation de gradient utilisées pour entraîner les modèles modulaires qui utilisent des décisions de routage discrètes non différentiables. Pour remédier à ce problème, nous introduisons SMEAR (Soft Merging of Experts with Adaptive Routing), qui évite le routage discret en utilisant un expert « fusionné » unique, construit par une moyenne pondérée des paramètres de tous les experts. En acheminant les activations via cet expert fusionné unique, SMEAR n'entraîne pas d'augmentation significative des coûts de calcul et permet un entraînement standard basé sur le gradient. Nous validons empiriquement que les modèles utilisant SMEAR surpassent ceux qui basent le routage sur les métadonnées ou apprennent le routage par estimation de gradient. De plus, notre analyse qualitative démontre que les experts formés via SMEAR présentent un degré de spécialisation significatif.
Spider 2.0 : Évaluation des modèles de langage sur des flux de travail texte-SQL d'entreprise réels
Fangyu Lei, Jixuan Chen, Yuxiao Ye, Ruisheng Cao, Dongchan Shin, Hongjin SU, Zhaoqing Suo, Hongcheng Gao, Wenjing Hu, Pengcheng Yin, Victor Zhong (membre du corps professoral de Vector), Caiming Xiong, Ruoxi Sun, Qian Liu, Sida Wang, Tao Yu
Abstrait
Les flux de travail texte-SQL en entreprise impliquent souvent des données complexes, locales ou dans le nuage, réparties sur divers systèmes de bases de données, de multiples requêtes SQL dans différents dialectes et des opérations variées allant de la transformation des données à l'analyse. Nous présentons Spider 2.0, un cadre d'évaluation comprenant 595 problèmes de flux de travail texte-SQL provenant de cas d'utilisation de bases de données d'entreprise. Les bases de données de Spider 2.0 proviennent d'applications réelles et contiennent souvent plus de 1 000 colonnes, stockées dans des systèmes de bases de données locaux ou infonuagiques comme BigQuery et Snowflake. Nous montrons que la résolution des problèmes dans Spider 2.0 nécessite fréquemment la compréhension et la recherche dans les métadonnées des bases de données, la documentation des dialectes, voire même les bases de code au niveau du projet. Ce défi exige des modèles qu'ils interagissent avec des environnements de flux de travail SQL complexes, traitent des contextes extrêmement longs, effectuent un raisonnement complexe et génèrent de multiples requêtes SQL avec des opérations variées, dépassant souvent les 100 lignes, ce qui va bien au-delà des défis traditionnels de conversion texte-SQL. Nos évaluations indiquent que, sur la base de l'aperçu o1, notre cadre d'agent de code ne résout avec succès que 15,1 % des tâches, contre 91,2 % sur Spider 1.0 et 73,0 % sur BIRD. Nos résultats sur Spider 2.0 montrent que, malgré les performances remarquables des modèles de langage en génération de code — notamment lors des précédents tests de conversion texte-SQL —, des améliorations significatives sont nécessaires pour atteindre des performances adéquates dans un environnement d'entreprise réel. Les progrès réalisés sur Spider 2.0 constituent des étapes cruciales vers le développement d'agents de code intelligents et autonomes pour les environnements d'entreprise réels.
Appariement de flux de Stiefel pour l'élucidation de structures à contraintes de moment
Austin Cheng, Alston Lo, Kin Long Kelvin Lee, Santiago Miret, Alán Aspuru-Guzik (membre du corps professoral de Vector)
Abstrait
L'élucidation de la structure moléculaire est une étape cruciale pour la compréhension des phénomènes chimiques, avec des applications dans l'identification des molécules présentes dans les produits naturels, les synthèses en laboratoire, les échantillons médico-légaux et le milieu interstellaire. Nous nous intéressons à l'élucidation de la structure 3D d'une molécule à partir de sa seule formule moléculaire et de ses moments d'inertie, en nous appuyant sur la capacité de la spectroscopie rotationnelle à mesurer précisément ces moments. Bien que les modèles génératifs existants puissent échantillonner conditionnellement des structures 3D avec des moments approximativement corrects, ce conditionnement souple ne permet pas d'exploiter la haute précision offerte par la spectroscopie rotationnelle expérimentale. Pour remédier à ce problème, nous montrons d'abord que l'espace des nuages de points à n atomes, avec un ensemble fixe de moments d'inertie, est inclus dans la variété de Stiefel St(n, 4). Nous proposons ensuite l'appariement de flux de Stiefel comme modèle génératif pour l'élucidation de la structure 3D sous contraintes de moments exactes. De plus, on apprend des flux plus simples et plus courts en trouvant des solutions approchées pour le transport optimal sur la variété de Stiefel. Empiriquement, la correspondance de flux de Stiefel atteint des taux de réussite plus élevés et un échantillonnage plus rapide que les modèles de diffusion euclidienne, même sur des variétés de grande dimension correspondant à de grandes molécules dans l'ensemble de données GEOM.
SymmetricDiffusers : Apprentissage de la diffusion discrète sur les groupes symétriques finis
Yongxing Zhang, Donglin Yang, Renjie Liao (membre du corps professoral de Vector)
Abstrait
Le groupe des permutations $S_n$, aussi connu sous le nom de groupes symétriques finis, est fondamental dans des domaines tels que la combinatoire, la physique et la chimie. Cependant, l'apprentissage d'une distribution de probabilité sur $S_n$ représente un défi de taille en raison de sa taille infinie et de sa nature discrète. Dans cet article, nous introduisons *SymmetricDiffusers*, un nouveau modèle de diffusion discrète qui simplifie l'apprentissage d'une distribution complexe sur $S_n$ en la décomposant en l'apprentissage de transitions plus simples de la diffusion inverse à l'aide de réseaux de neurones profonds. Nous identifions le mélange à la volée comme une transition directe efficace et fournissons des recommandations empiriques pour le choix de la longueur de diffusion, basées sur la théorie des marches aléatoires sur les groupes finis. De plus, nous proposons une distribution de Plackett-Luce (PL) généralisée pour la transition inverse, qui est démontrée plus expressive que la distribution PL. Finalement, nous introduisons un « programme de débruitage » théoriquement fondé afin d'améliorer l'efficacité de l'échantillonnage et de l'apprentissage. Des expériences approfondies montrent que notre modèle atteint des performances de pointe ou comparables sur la résolution de tâches telles que le tri d'images MNIST à 4 chiffres, les casse-têtes et le problème du voyageur de commerce.
T2V-Turbo-v2 : Amélioration du modèle vidéo après l'entraînement grâce à la conception de données, de récompenses et de guidage conditionnel
Jiachen Li, Qian Long, Jian (Skyler) Zheng, Xiaofeng Gao, Robinson Piramuthu, Wenhu Chen (membre du corps professoral de Vector), William Wang
Abstrait
Dans cet article, nous nous concentrons sur l'amélioration d'un modèle de conversion texte-vidéo (T2V) basé sur la diffusion, lors de la phase de post-entraînement, en extrayant un modèle de cohérence performant à partir d'un modèle T2V pré-entraîné. Notre méthode proposée, T2V-Turbo-v2, représente une avancée significative grâce à l'intégration de divers signaux de supervision, tels que des données d'entraînement de haute qualité, la rétroaction du modèle de récompense et un guidage conditionnel, au processus d'extraction de la cohérence. Grâce à des études d'ablation approfondies, nous soulignons l'importance cruciale d'adapter les ensembles de données aux objectifs d'apprentissage spécifiques et l'efficacité de l'apprentissage à partir de divers modèles de récompense pour améliorer à la fois la qualité visuelle et l'alignement texte-vidéo. De plus, nous soulignons le vaste espace de conception des stratégies de guidage conditionnel, centré sur la conception d'une fonction d'énergie efficace pour améliorer le solveur d'équations différentielles ordinaires (EDO) du modèle enseignant. Nous démontrons le potentiel de cette approche en extrayant un guidage de mouvement des ensembles de données d'entraînement et en l'intégrant au solveur d'EDO, démontrant ainsi son efficacité pour améliorer la qualité de mouvement des vidéos générées grâce aux mesures de mouvement améliorées de VBench et T2V-CompBench. Empiriquement, notre T2V-Turbo-v2 établit un nouveau résultat de pointe sur VBench, **avec un score total de 85,13**, surpassant les systèmes propriétaires tels que Gen-3 et Kling.
Enseigner aux étudiants en droit comment apprendre grâce à un ajustement contextuel précis
Younwoo Choi, Muhammad Adil Asif, Ziwen Han, John Willes (personnel professionnel de Vector), Rahul G. Krishnan (membre du corps professoral de Vector)
Abstrait
Fournir un contexte au modèle de fonctionnement attendu des grands modèles de langage (GML) est une méthode efficace pour orienter leurs résultats et répondre aux attentes humaines après leur entraînement. Cependant, dans les domaines en évolution rapide, il est souvent nécessaire d'affiner les GML afin d'améliorer la nature des connaissances qu'ils mémorisent ou leur capacité à raisonner de manière ouverte dans de nouveaux domaines. Lorsque nous apprenons de nouveaux concepts, nous le faisons souvent en reliant les nouvelles notions étudiées à des concepts déjà acquis. Dès lors, nous nous demandons : « L'aide fournie par les instructions peut-elle nous permettre d'apprendre aux GML à apprendre ? » Dans ce travail, nous étudions une nouvelle généralisation de l'ajustement des instructions, appelée ajustement contextuel, pour peaufiner les GML. Notre méthode exploite des incitations pédagogiques conçues pour imiter les stratégies cognitives humaines d'apprentissage et de résolution de problèmes afin de guider le processus d'apprentissage pendant l'entraînement, dans le but d'améliorer l'interprétation et la compréhension par le modèle des connaissances spécifiques au domaine. Nous démontrons empiriquement que cette modification simple mais efficace améliore la capacité des LLM à être rapidement ajustés sur de nouveaux ensembles de données, tant dans le domaine médical que financier.
Contrôle plus strict de la confidentialité du DP-SGD dans le modèle de menace d'État caché
Tudor Cebere, Aurélien Bellet, Nicolas Papernot (membre du corps professoral de Vector)
Abstrait
Les modèles d'apprentissage machine peuvent être entraînés avec des garanties de confidentialité formelles grâce à des optimiseurs différentiellement privés tels que DP-SGD. Dans ce travail, nous nous concentrons sur un modèle de menace où l'adversaire n'a accès qu'au modèle final, sans visibilité sur les mises à jour intermédiaires. Dans la littérature, ce modèle de menace à « état caché » présente un écart significatif entre la borne inférieure issue de l'audit de confidentialité empirique et la borne supérieure théorique fournie par la comptabilité de confidentialité. Pour combler cet écart, nous proposons d'auditer ce modèle de menace avec des adversaires qui conçoivent une séquence de gradients visant à maximiser la perte de confidentialité du modèle final sans recourir aux mises à jour intermédiaires. Nos expériences montrent que cette approche surpasse systématiquement les tentatives précédentes d'audit du modèle à état caché. De plus, nos résultats contribuent à une meilleure compréhension des garanties de confidentialité réalisables au sein de ce modèle de menace. Plus précisément, lorsque le gradient conçu est inséré à chaque étape d'optimisation, nous montrons que la dissimulation des mises à jour intermédiaires du modèle dans DP-SGD n'améliore pas la confidentialité. La situation se complexifie lorsque le gradient artificiel n'est pas inséré à chaque étape : notre limite inférieure d'audit correspond à la limite supérieure de confidentialité uniquement pour un paysage de pertes choisi par un adversaire et une taille de lot suffisamment importante. Cela suggère que les limites supérieures de confidentialité existantes pourraient être améliorées dans certains cas.
Couplage des blocs transformateurs et sa corrélation avec la généralisation dans les LLM
Murdock Aubry, Haoming Meng, Anton Sugolov, Vardan Papyan (membre affilié de la faculté Vector)
Abstrait
Les grands modèles de langage (LLM) ont permis des percées significatives dans le traitement automatique du langage naturel, et une compréhension précise des mécanismes internes qui sous-tendent leur succès est essentielle. Dans ce travail, nous suivons les trajectoires de chaque jeton lors de son passage à travers des blocs de transformation, et linéarisons le système le long de ces trajectoires grâce à leurs matrices jacobiennes. En examinant les relations entre ces jacobiennes, nous mettons en évidence un phénomène de couplage des blocs de transformation dans divers LLM, caractérisé par le couplage de leurs vecteurs singuliers principaux à travers les jetons et la profondeur. Nos résultats révèlent que le couplage est positivement corrélé aux performances du modèle, et que cette relation est plus forte qu'avec d'autres hyperparamètres, à savoir le budget des paramètres, la profondeur du modèle et la dimension d'intégration. Nous étudions plus en détail l'émergence de ces propriétés au cours de l'entraînement, en observant le développement du couplage, ainsi qu'une augmentation de la linéarité et une croissance exponentielle des trajectoires des jetons à travers les couches. Ces observations collectives offrent une perspective nouvelle sur les interactions entre les intégrations de jetons et ouvrent la voie à de nouvelles approches pour étudier l'entraînement et la généralisation dans les LLM.
Une méthode de Newton tronquée pour le transport optimal
Mete Kemertas, Amir-massoud Farahmand (membre affilié de la faculté Vector), Allan Jepson
Abstrait
Le développement d'un solveur de transport optimal (TO) moderne exige de trouver un compromis entre plusieurs contraintes critiques : la parallélisation GPU, l'adaptabilité aux problèmes de grande dimension, les garanties de convergence théorique, les performances empiriques en termes de précision et de temps d'exécution, et la stabilité numérique en pratique. Face à ces défis, nous présentons un algorithme de Newton tronqué spécialisé pour le TO régularisé par l'entropie. Outre la démonstration de la possibilité d'une convergence quadratique locale sans supposer une matrice hessienne lipschitzienne, nous proposons des stratégies pour exploiter au maximum la vitesse élevée de convergence locale en pratique. Notre algorithme parallèle sur GPU présente des performances d'exécution exceptionnellement favorables, atteignant une précision élevée plusieurs ordres de grandeur plus rapidement que de nombreuses alternatives existantes. Ceci est confirmé par des expériences de temps d'exécution réel sur MNIST de dimension 4096 et sur des problèmes de transfert de couleur. L'adaptabilité de l'algorithme est illustrée sur un problème de TO extrêmement grand avec n ≈ 10⁶, résolu approximativement sous une régularisation entropique faible.
Comprendre l'inférence de contraintes dans l'apprentissage par renforcement inverse critique pour la sécurité
Bo Yue, Shufan Wang, Ashish Gaurav, Jian Li, Pascal Poupart (membre du corps professoral de Vector), Guiliang Liu
Abstrait
Dans les applications pratiques, les contraintes sous-jacentes sont souvent inconnues et difficiles à spécifier. Pour remédier à ce problème, les avancées récentes en apprentissage par renforcement avec contraintes inverses (ICRL) se sont concentrées sur l'inférence de ces contraintes à partir de démonstrations d'experts. Cependant, l'approche ICRL caractérise généralement l'apprentissage des contraintes comme un problème d'optimisation à trois niveaux, intrinsèquement complexe en raison de ses variables interdépendantes et de ses multiples couches d'optimisation. Face à ces défis, une question cruciale se pose : *Peut-on intégrer implicitement les signaux de contrainte dans les fonctions de récompense et résoudre efficacement ce problème à l'aide d'un algorithme d'inférence de récompense classique ?* La méthode résultante, appelée correction de récompense inverse (IRC), mérite d'être étudiée. Dans ce travail, nous menons une analyse théorique comparant la complexité d'échantillonnage des deux solveurs. Nos résultats confirment que le solveur IRC atteint une complexité d'échantillonnage inférieure à celle de son homologue ICRL. Néanmoins, cette réduction de complexité se fait au détriment de la généralisation. Plus précisément, dans l'environnement cible, les termes de correction de récompense peuvent ne pas garantir la sécurité de la politique résultante. Ce problème peut être efficacement atténué par le transfert des contraintes via le solveur ICRL. Poursuivant notre étude, nous examinons les conditions dans lesquelles le solveur ICRL assure l'optimalité ε lors du transfert vers de nouveaux environnements. Les résultats empiriques obtenus dans divers environnements valident nos conclusions théoriques, soulignant les compromis subtils entre réduction de la complexité et généralisabilité dans les applications critiques pour la sécurité.
Recherche multimodale universelle avec LLM multimodaux
Sheng-Chieh Lin, Chankyu Lee, Mohammad Shoeybi, Jimmy Lin (membre affilié de la faculté Vector), Bryan Catanzaro, Wei Ping
Abstrait
Les modèles de recherche d'information de pointe s'adressent généralement à un scénario de recherche simple, où les tâches sont fixes (par exemple, trouver un passage répondant à une question précise) et où une seule modalité est prise en charge, tant pour les requêtes que pour les résultats. Cet article présente des techniques permettant d'améliorer la recherche d'information grâce à des modèles de langage multimodaux de grande taille (MLLM), ouvrant la voie à un scénario de recherche plus large, appelé recherche multimodale universelle, qui intègre plusieurs modalités et diverses tâches de recherche. À cette fin, nous étudions d'abord l'optimisation d'un MLLM en tant que bi-encodeur sur 10 ensembles de données comportant 16 tâches de recherche. Nos résultats empiriques montrent que le modèle MLLM optimisé est capable de comprendre des requêtes complexes, composées de texte et d'images, mais ses performances sont inférieures à celles d'un modèle CLIP plus simple pour les tâches de recherche intermodales, en raison d'un biais de modalité inhérent aux MLLM. Pour remédier à ce problème, nous proposons une méthode d'extraction de négatifs difficiles qui tient compte de la modalité afin d'atténuer ce biais. Deuxièmement, nous proposons d'optimiser continuellement le moteur de recherche multimodale universel afin d'améliorer ses performances en recherche textuelle tout en préservant ses capacités de recherche multimodale. Ainsi, notre modèle, UniEmb, atteint des performances de pointe sur le benchmark de recherche multimodale M-BEIR, qui couvre de multiples domaines et tâches, et surpasse également le modèle de recherche textuelle de référence NV-Embed-v1 sur le benchmark MTEB. Finalement, nous explorons l'utilisation de modèles de langage naturels (MLLM) prêts à l'emploi comme réordonnanceur zéro-shot pour affiner le classement des candidats issus du moteur de recherche multimodale. Nous constatons que, grâce à cette approche d'optimisation et de réordonnancement, les MLLM peuvent améliorer davantage la recherche multimodale lorsque les requêtes utilisateur (par exemple, les requêtes combinant texte et image) sont plus complexes et difficiles à interpréter. Ces résultats ouvrent également la voie à de futurs progrès en matière de recherche multimodale universelle.
VLM2Vec : Entraînement de modèles de vision-langage pour des tâches d’intégration multimodale massives
Ziyan Jiang, Rui Meng, Xinyi Yang, Semih Yavuz, Yingbo Zhou, Wenhu Chen (membre du corps professoral de Vector)
Abstrait
Les modèles d'intégration ont joué un rôle crucial dans la réalisation de diverses tâches en aval, comme la similarité sémantique, la recherche d'informations et le clustering. Récemment, on a observé un regain d'intérêt pour le développement de modèles d'intégration textuelle universels capables de généraliser à différentes tâches (par exemple, MTEB). Cependant, malgré leur importance, les progrès dans l'apprentissage de modèles d'intégration multimodaux universels demeurent relativement lents. Dans ce travail, nous explorons le potentiel de la construction d'intégrations universelles capables de traiter un large éventail de tâches en aval. Nos contributions sont doubles : (1) MMEB (Massive Multimodal Embedding Benchmark), qui couvre 4 méta-tâches et 36 ensembles de données, dont 20 pour l'entraînement et 16 pour l'évaluation, et (2) VLM2VEC (Vision-Language Model → Vector), un cadre d'entraînement contrastif qui convertit tout modèle de vision-langage de pointe en un modèle d'intégration. Contrairement aux modèles précédents tels que CLIP et BLIP, VLM2VEC peut traiter n'importe quelle combinaison d'images et de texte pour générer un vecteur de dimension fixe en fonction des instructions de la tâche. Nous avons construit une série de modèles VLM2VEC sur Phi-3.5-V et les avons évalués sur MMEB. Nos résultats montrent que VLM2VEC atteint une amélioration moyenne absolue de 10 % à 20 % par rapport aux modèles d'intégration multimodale existants, tant sur les ensembles de données distribués que non distribués de MMEB.
Qu'est-ce que ça veut dire d'être un transformateur ? Perspectives issues d’une analyse théorique de la matrice hessienne
Article vedette
Weronika Ormaniec, Felix Dangel (boursier postdoctoral distingué de Vector), Sidak Pal Singh
Abstrait
L'architecture Transformer a incontestablement révolutionné l'apprentissage profond, surpassant les architectures classiques telles que les perceptrons multicouches (MLP) et les réseaux de neurones convolutifs (CNN). Au cœur de son architecture, le bloc d'attention diffère par sa forme et sa fonctionnalité de la plupart des autres composants architecturaux de l'apprentissage profond – à tel point que les Transformers sont souvent associés à des optimiseurs adaptatifs, à la normalisation des couches, à une phase d'initialisation du taux d'apprentissage, etc., contrairement aux MLP/CNN. Les causes profondes de ces différences et les mécanismes précis qui les régissent demeurent mal compris. Dans ce travail, on comble cette lacune en proposant une compréhension fondamentale de ce qui distingue le Transformer des autres architectures, fondée sur une comparaison théorique de la matrice hessienne (de la fonction de perte). Concrètement, pour une seule couche d'auto-attention : (a) nous dérivons d'abord intégralement la matrice hessienne du Transformer et l'exprimons sous forme de dérivées matricielles ; (b) nous la caractérisons ensuite en fonction des dépendances aux données, aux poids et aux moments d'attention ; et (c) ce faisant, nous soulignons les différences structurelles importantes avec la matrice hessienne des réseaux classiques. Nos résultats suggèrent que plusieurs choix architecturaux et d'optimisation courants dans les Transformers s'expliquent par leur forte dépendance non linéaire aux matrices de données et de poids, qui varient de manière hétérogène selon les paramètres. En fin de compte, nos conclusions permettent de mieux comprendre le paysage d'optimisation unique des Transformers et les défis qu'il pose.
Ce qui a été négligé dans l'adaptation de domaine contrastive sans source : tirer parti de l'augmentation latente informée par la source dans le contexte de voisinage
Jiahong Chen, Kuangen Zhang, Clarence Silva, Jing Wang, Leonid Sigal (membre du corps professoral de Vector), Wonho Bae
Abstrait
L'adaptation de domaine sans source (SFDA) consiste à adapter un modèle initialement entraîné sur un jeu de données étiqueté (domaine source) afin qu'il fonctionne efficacement sur un jeu de données non étiqueté (domaine cible), sans recourir aux données sources lors de l'adaptation. Cette adaptation est particulièrement cruciale lorsque les distributions de données présentent des disparités importantes entre les deux domaines et lorsque la confidentialité des données d'entraînement du modèle source est problématique. L'absence d'accès aux données sources pendant l'adaptation rend difficile l'estimation analytique de l'écart entre les domaines. Pour remédier à ce problème, diverses techniques ont été proposées, telles que le regroupement non supervisé, l'apprentissage contrastif et l'apprentissage continu. Dans cet article, nous présentons d'abord une analyse théorique approfondie de la SFDA basée sur l'apprentissage contrastif, principalement en raison de ses performances supérieures aux autres techniques. Forts de ces résultats, nous introduisons ensuite une méthode d'augmentation latente simple mais très efficace, spécifiquement conçue pour la SFDA contrastive. Cette méthode exploite la dispersion des caractéristiques latentes au voisinage de l'échantillon de requête, guidée par le modèle source préentraîné, afin d'améliorer la pertinence des clés positives. Notre approche, basée sur une seule perte contrastive basée sur InfoNCE, surpasse les méthodes SFDA de pointe sur des ensembles de données de référence largement reconnus.
WildBench : Évaluation comparative des LLM avec des tâches complexes d'utilisateurs réels en situation réelle
Article vedette
Bill Yuchen Lin, Yuntian Deng (affilié à la faculté Vector), Khyathi Chandu, Abhilasha Ravichander, Valentina Pyatkin, Nouha Dziri, Ronan Le Bras, Yejin Choi
Abstrait
Nous présentons WildBench, un cadre d'évaluation automatisé conçu pour comparer les performances des grands modèles de langage (LLM) à l'aide de requêtes utilisateur complexes du monde réel. WildBench comprend 1 024 tâches soigneusement sélectionnées parmi plus d'un million de journaux de conversations entre humains et chatbots. Pour l'évaluation automatisée avec WildBench, nous avons développé deux mesures, WB-Reward et WB-Score, calculables à l'aide de LLM avancés tels que GPT-4 Turbo. L'évaluation WildBench utilise des listes de contrôle spécifiques à chaque tâche pour évaluer systématiquement les résultats des modèles et fournit des explications structurées justifiant les scores et les comparaisons, ce qui permet d'obtenir des jugements automatiques plus fiables et interprétables. WB-Reward effectue des comparaisons par paires fines entre les réponses des modèles, générant cinq résultats possibles : nettement meilleur, légèrement meilleur, légèrement moins bon, nettement moins bon ou égalité. Contrairement aux évaluations précédentes qui utilisaient un seul modèle de référence, nous avons sélectionné trois modèles de référence à différents niveaux de performance afin d'assurer une évaluation par paires exhaustive. De plus, nous proposons une méthode simple pour atténuer le biais de longueur, en convertissant les résultats « légèrement meilleur/pire » en « égalité » si la réponse gagnante dépasse la réponse perdante de plus de K caractères. Le score WB évalue individuellement la qualité des résultats des modèles, ce qui en fait une mesure d'évaluation rapide et économique. Les résultats de WildBench démontrent une forte corrélation avec les classements Elo attribués par les utilisateurs de Chatbot Arena pour les tâches difficiles. Plus précisément, la récompense WB atteint une corrélation de Pearson de 0,98 avec les modèles les mieux classés. De plus, le score WB atteint 0,95, surpassant ainsi les taux de victoire contrôlés par la longueur d'ArenaHard (0,91) et AlpacaEval2.0 (0,89), ainsi que les taux de victoire classiques (0,87).
ZETA : Utiliser les courbes d’ordre Z pour une attention optimale des k premiers
Qiuhao Zeng, Jierui Huang, Peng Lu, Gezheng Xu, Boxing Chen, Charles Ling (affilié de la faculté vectorielle), Boyu Wang (affilié de la faculté vectorielle)
Abstrait
Au cours des dernières années, le Transformer est devenu un élément fondamental des architectures de modélisation de séquences. Cependant, son fonctionnement repose sur l'auto-attention, dont le coût en mémoire et en calcul croît quadratiquement avec la longueur de la séquence N, la rendant prohibitive pour les longues séquences. Une approche prometteuse est l'attention top-k, qui sélectionne uniquement les k jetons les plus pertinents et atteint des performances comparables à l'auto-attention classique tout en réduisant considérablement l'espace mémoire et les besoins en calcul. Toutefois, les masques causaux exigent que le jeton de requête courant ne prenne en compte que les jetons précédents, empêchant ainsi les méthodes d'attention top-k existantes de rechercher efficacement les jetons les plus pertinents en parallèle et limitant ainsi l'efficacité de l'apprentissage. Dans ce travail, nous proposons ZETA, qui exploite les courbes d'ordre Z pour une attention top-k efficace, afin de permettre l'interrogation parallèle des jetons précédents pour des séquences entières. Nous démontrons d'abord théoriquement que le choix des dimensions de la clé et de la requête implique un compromis entre le fléau de la dimensionnalité et la préservation des distances relatives après projection. À la lumière de cette observation, nous proposons de réduire la dimensionnalité des clés et des requêtes par rapport aux valeurs, puis d'exploiter les courbes d'ordre Z pour projeter les clés et requêtes de faible dimension dans un espace unidimensionnel. Cela permet un tri parallèle et améliore considérablement l'efficacité de la sélection des k meilleurs tokens. Les résultats expérimentaux démontrent que ZETA atteint les performances de l'attention standard sur la tâche synthétique de rappel associatif et surpasse l'attention et ses variantes sur les modèles de langage Long-Range Arena et WikiText-103.