Des chercheurs de la dynamique communauté Vector présentent des travaux novateurs couvrant l'ensemble du spectre de l'intelligence artificielle lors de la conférence NeurIPS (Conference on Neural Information Processing Systems) de cette année, qui se tiendra du 2 au 7 décembre à San Diego et du 30 novembre au 5 décembre à Mexico. Cette conférence est le principal rendez-vous mondial de la recherche en traitement de l'information neuronale, réunissant la communauté internationale qui travaille sur les fondements théoriques et les applications pratiques qui façonnent l'avenir de l'IA.
Les contributions de recherche des membres du corps professoral, des professeurs associés et des chercheurs postdoctoraux de renom de Vector à NeurIPS 2025 témoignent de la richesse et de la diversité des innovations issues de notre remarquable écosystème de recherche. Leurs travaux, qui ont été acceptés, couvrent des domaines essentiels – des modèles fondamentaux de nouvelle génération et des systèmes génératifs basés sur la diffusion aux avancées majeures en apprentissage par renforcement et aux approches fédérées respectueuses de la vie privée – reflétant un engagement commun à faire progresser à la fois la science fondamentale de l'apprentissage automatique et le développement de systèmes d'IA fiables capables de relever les défis du monde réel.
Vous trouverez ci-dessous 80 articles acceptés, y compris les collaborations, provenant de membres du corps professoral de Vector, de professeurs affiliés à Vector et de boursiers postdoctoraux distingués de Vector.
ActiveVOO : Acquisition active de connaissances guidée par la valeur de l’information pour la planification de régression liftée incarnée en monde ouvert
Xiatoian Liu, Ali Pesaranghader, Jaehong Kim, Tanmana Sadhu, Hyejeong Jeon, Scott Sanner (affilié à la faculté Vector)
Abstrait
La capacité d'acquérir activement des informations est essentielle à la planification en monde ouvert dans un contexte d'observabilité partielle et de connaissances incomplètes. Les systèmes d'IA incarnés existants s'appuient généralement sur des stratégies passives qui recueillent exhaustivement les informations relatives aux objets et à leurs relations. Cependant, une telle acquisition passive de connaissances devient impraticable dans les environnements visuellement complexes. Par exemple, un foyer typique peut contenir des centaines d'objets aux configurations uniques. Par conséquent, les agents en monde ouvert doivent être capables d'identifier activement les objets pertinents à la tâche à accomplir. Dans ce travail, nous présentons ActiveVOI, un nouveau cadre zéro-shot pour la planification incarnée en monde ouvert, qui met l'accent sur l'acquisition active de connaissances centrée sur les objets. ActiveVOI exploite la régression liftée pour générer des descriptions de sous-objectifs compactes identifiant les objets pertinents à la tâche. Il propose également une approche rigoureuse pour quantifier l'utilité de la détection d'objets à l'aide de la théorie de la valeur de l'information (VOI), guidée par les connaissances de sens commun issues de grands modèles de langage et de vision-langage (LLM/VLM). ActiveVOI est évalué sur le benchmark visuel ALFWorld, démontrant des améliorations substantielles par rapport aux méthodes de planification existantes basées sur les modèles linéaires linéaires (LLM) et visuels (VLM), et surpassant même les VLM optimisés sur les données ALFWorld. Ce travail établit une base solide pour la conception d'agents incarnés capables d'acquérir activement et efficacement les connaissances nécessaires à la planification dans des environnements ouverts.
En bref : nous présentons le cadre ActiveVOO pour l’acquisition active de connaissances afin d’identifier, de quantifier et de hiérarchiser les informations pertinentes pour la planification incarnée en monde ouvert.
Optimisation adaptative de la longueur du contexte avec troncature basse fréquence pour l'apprentissage par renforcement multi-agents
Wenchang Duan, Yaoliang Yu (membre du corps professoral de Vector), Jiwan He, Yi Shi
Abstrait
Récemment, l'apprentissage par renforcement multi-agents profond (MARL) a démontré des performances prometteuses pour la résolution de tâches complexes, telles que les dépendances à long terme et les environnements non markoviens. Son succès est en partie attribué au conditionnement des politiques sur une longueur de contexte fixe importante. Cependant, de telles longueurs de contexte fixes importantes peuvent entraîner une efficacité d'exploration limitée et une redondance d'informations. Dans cet article, nous proposons un nouveau cadre MARL pour obtenir des informations contextuelles adaptatives et efficaces. Plus précisément, nous concevons un agent central qui optimise dynamiquement la longueur du contexte via une analyse du gradient temporel, améliorant ainsi l'exploration pour faciliter la convergence vers les optima globaux du MARL. De plus, pour améliorer la capacité d'optimisation adaptative de la longueur du contexte, nous présentons une représentation d'entrée efficace pour l'agent central, qui filtre efficacement les informations redondantes. En utilisant une méthode de troncature basse fréquence basée sur la transformée de Fourier, nous extrayons les tendances temporelles globales à travers les agents décentralisés, fournissant une représentation efficace de l'environnement MARL. Des expériences approfondies démontrent que la méthode proposée atteint des performances de pointe (SOTA) sur des tâches de dépendance à long terme, notamment PettingZoo, MiniGrid, Google Research Football (GRF) et StarCraft Multi-Agent Challenge v2 (SMACv2).
En résumé : une longueur de contexte fixe importante limite l’exploration et introduit de la redondance dans l’apprentissage par renforcement à long terme (MARL). Nous proposons une méthode d'optimisation adaptative de la longueur du contexte avec troncature basse fréquence basée sur la transformée de Fourier afin d'améliorer la prise de décision à long terme.
Alignez votre flux : mise à l'échelle de la distillation par cartographie des flux en temps continu
Amirmojtaba Sabour, Sanja Fidler (membre du corps professoral de Vector), Karsten Kreis
Abstrait
Les modèles de diffusion et de flux se sont imposés comme des approches de modélisation générative de pointe, mais ils nécessitent de nombreuses étapes d'échantillonnage. Les modèles de cohérence permettent de condenser ces modèles en générateurs efficaces à une seule étape ; cependant, contrairement aux méthodes de flux et de diffusion, leurs performances se dégradent inévitablement avec l'augmentation du nombre d'étapes, comme nous le démontrons analytiquement et empiriquement. Les cartes de flux généralisent ces approches en reliant deux niveaux de bruit quelconques en une seule étape et restent efficaces quel que soit le nombre d'étapes. Dans cet article, nous introduisons deux nouveaux objectifs à temps continu pour l'apprentissage des cartes de flux, ainsi que de nouvelles techniques d'apprentissage, généralisant les objectifs de cohérence et de correspondance de flux existants. Nous démontrons également que l'autoguidage peut améliorer les performances, en utilisant un modèle de faible qualité pour guider la distillation, et qu'un gain supplémentaire peut être obtenu par un ajustement fin adverse, avec une perte minimale de diversité d'échantillons. Nous validons de manière exhaustive nos modèles de flux, appelés *Align Your Flow*, sur des benchmarks de génération d'images exigeants et atteignons des performances de pointe pour la génération en quelques étapes sur ImageNet 64×64 et 512×512, en utilisant des réseaux neuronaux petits et efficaces. Finalement, nous présentons des modèles de flux texte-image qui surpassent tous les échantillonneurs en quelques étapes non entraînés adversement existants dans la synthèse conditionnée par le texte.
En bref : nous développons des méthodes de cartographie des flux pour la génération en quelques étapes de pointe, généralisant les modèles de flux, de diffusion et de cohérence.
Duos asymétriques : les acolytes améliorent l’incertitude
Article vedette
Tim G. Zhou, Evan Shelhamer (membre du corps professoral de Vector), Geoff Pleiss (membre du corps professoral de Vector)
Abstrait
The go-to strategy to apply deep networks in settings where uncertainty informs decisions—ensembling multiple training runs with random initializations—is ill-suited for the extremely large-scale models and practical fine-tuning workflows of today. We introduce a new cost-effective strategy for improving the uncertainty quantification and downstream decisions of a large model (e.g. a fine-tuned ViT-B): coupling it with a less accurate but much smaller “sidekick” (e.g. a fine-tuned ResNet-34) with a fraction of the computational cost. We propose aggregating the predictions of this \emph{Asymmetric Duo} by simple learned weighted averaging. Surprisingly, despite their inherent asymmetry, the sidekick model almost never harms the performance of the larger model. In fact, across five image classification benchmarks, and a variety of model architectures and training schemes (including soups), Asymmetric Duos significantly improve accuracy, uncertainty quantification, and selective classification metrics with only ${\approx}10-20$% more computation.
Les pièges à attention : un mécanisme de « capture, d’étiquetage et de libération » pour les plongements lexicaux
Stephen Zhang, Mustafa Khan, Vardan Papyan (membre du corps professoral de Vector)
Abstrait
Les grands modèles de langage (GML) concentrent souvent leur attention sur quelques jetons spécifiques, appelés « puits d'attention ». Parmi les exemples courants, on trouve le premier jeton, un puits indépendant de l'invite, et les jetons de ponctuation, qui dépendent de l'invite. Bien que les jetons à l'origine des puits soient souvent dépourvus de signification sémantique directe, leur présence est cruciale pour la performance du modèle, notamment en cas de compression et de mise en cache clé-valeur. Malgré leur omniprésence, la fonction, le rôle sémantique et l'origine des puits d'attention – en particulier ceux situés au-delà du premier jeton – restent mal compris. Dans ce travail, nous menons une étude approfondie démontrant que les puits d'attention : *captent* une séquence de jetons, *les étiquettent* selon une direction commune dans l'espace d'intégration, et *les libèrent* dans le flux résiduel, où ils sont ensuite récupérés en fonction des étiquettes acquises. Des expériences préliminaires révèlent que ces étiquettes véhiculent des informations sémantiquement pertinentes, comme la véracité d'une affirmation. Ces résultats s'étendent aux modèles de raisonnement, où le mécanisme concerne davantage de nœuds et explique une plus grande variance dans les représentations vectorielles, ou aux modèles récents avec normalisation des clés de requête, où les nœuds de destination restent tout aussi fréquents. Afin d'encourager de futures analyses théoriques, nous introduisons un problème minimal qui peut être résolu par le mécanisme « capture, étiquetage, libération » et qui émerge au cours de l'apprentissage.
Meilleure attribution des données d'entraînement grâce à de meilleurs produits inverses hessiens-vecteurs
Andrew Wang, Elisa Nguyen, Runshi Yang, Juhan Bae, Sheila McIlraith (membre du corps professoral de Vector), Roger Grosse (membre du corps professoral de Vector)
Abstrait
L'attribution des données d'entraînement (TDA) permet de déterminer quelles données d'entraînement sont responsables du comportement d'un modèle appris. Les méthodes TDA basées sur le gradient, telles que les fonctions d'influence et la différentiation déroulée, impliquent un calcul similaire au produit inverse du hessien par vecteur (iHVP), difficile à approximer efficacement. Nous présentons un algorithme (ASTRA) qui utilise le préconditionneur EKFAC sur les itérations de la série de Neumann pour obtenir une approximation précise de l'iHVP pour la TDA. ASTRA est facile à paramétrer, nécessite moins d'itérations que la série de Neumann et est plus précis que les approximations basées sur EKFAC. Grâce à ASTRA, nous montrons qu'une meilleure précision de l'approximation de l'iHVP peut améliorer significativement les performances de la TDA.
En bref : nous appliquons le préconditionneur EKFAC aux itérations de la série de Neumann pour obtenir une approximation iHVP non biaisée pour TDA qui améliore la fonction d’influence et les performances de la différenciation déroulée.
Au-delà du masqué et du non masqué : modèles de diffusion discrets par masquage partiel
Chen-Hao (Lance) Chao, Wei-Fang Sun, Hanwen Liang, Chun-Yi Lee, Rahul Krishnan (membre du corps professoral de Vector)
Abstrait
Les modèles de diffusion masquée (MDM) sont des modèles génératifs puissants pour les données discrètes. Ils génèrent des échantillons en démasquant graduellement les jetons d'une séquence. Chaque jeton peut prendre l'un des deux états suivants : masqué ou démasqué. Nous observons que les séquences de jetons restent souvent inchangées entre deux étapes d'échantillonnage successives ; par conséquent, le modèle traite de manière répétée les mêmes entrées, ce qui entraîne des calculs redondants. Pour pallier cette inefficacité, nous proposons le schéma de masquage partiel (Prime), qui enrichit le MDM en permettant aux jetons d'adopter des états intermédiaires interpolés entre les états masqué et démasqué. Cette conception permet au modèle d'effectuer des prédictions à partir d'informations partiellement observées sur les jetons et facilite un processus de débruitage fin. Nous définissons une fonction objectif d'apprentissage variationnelle et présentons une architecture simple pour gérer les entrées à états intermédiaires. Notre méthode démontre des performances supérieures sur un ensemble diversifié de tâches de modélisation générative. Sur des données textuelles, ce modèle atteint une perplexité de 15,36 sur OpenWebText, surpassant les modèles MDM précédents (21,52), les modèles autorégressifs (17,54) et leurs variantes hybrides (17,58), sans recourir à une formulation autorégressive. Sur des données d'images, il obtient des scores FID compétitifs de 3,26 sur CIFAR-10 et de 6,98 sur ImageNet-32, comparables aux meilleurs modèles génératifs continus.
BioReason : Inciter au raisonnement biologique multimodal au sein d’un modèle ADN-LLM
Adibvafa Fallahpour, Andrew Magnuson, Purav Gupta, Shihao Ma, Jack Naimer, Arnav Shah, Haonan Duan, Omar Ibrahim, Hani Goodarzi, Chris Maddison (membre du corps professoral de Vector), Bo Wang (membre du corps professoral de Vector)
Abstrait
L'exploitation de données génomiques complexes pour un raisonnement biologique profond et interprétable représente un défi majeur pour l'intelligence artificielle, freinant les découvertes scientifiques cruciales. Les modèles d'ADN existants, malgré leurs puissantes capacités de représentation des séquences, peinent souvent à effectuer un raisonnement en plusieurs étapes et manquent de mécanismes intrinsèques pour des explications transparentes et biologiquement intuitives. Nous présentons BioReason, une architecture novatrice qui, pour la première fois, intègre profondément un modèle d'ADN à un modèle de langage étendu (LLM). Cette connexion inédite permet au LLM de traiter et de raisonner directement avec l'information génomique comme modalité d'entrée fondamentale, ouvrant la voie à une nouvelle forme de compréhension biologique multimodale. La capacité de BioReason à un raisonnement sophistiqué en plusieurs étapes est développée grâce à un processus d'ajustement fin supervisé et d'apprentissage par renforcement ciblé, guidant le système intégré vers la génération de déductions logiques et biologiquement cohérentes. Sur des tests de performance exigeants, notamment la prédiction des voies de signalisation pathologiques basée sur KEGG (où BioReason améliore la précision d'environ 10 points, passant de 88 % à 97 %) et l'analyse de l'effet des variantes, BioReason affiche un gain de performance moyen de 15 % par rapport à des méthodes de référence monomodales performantes. Une avancée majeure réside dans la capacité de BioReason à raisonner sur des entités biologiques inédites et à expliciter son processus décisionnel grâce à des représentations biologiques interprétables et détaillées, étayant mécanistiquement ses prédictions. BioReason propose une approche novatrice pour l'IA en biologie, ouvrant la voie à une compréhension mécanistique plus approfondie et à une génération accélérée d'hypothèses vérifiables à partir de données génomiques.
En bref : BioReason introduit une nouvelle architecture DNA-LLM où le LLM traite directement l’information génomique, permettant un raisonnement biologique multi-étapes supérieur et interprétable et accélérant la découverte des mécanismes.
Lever la barrière des lots (B3) de l'apprentissage contrastif grâce à l'exploration intelligente des lots
Article vedette
Raghuveer Thirukovalluru, Rui Meng, Ye Liu, Karthikeyan K, Mingyi Su, Ping Nie, Semih Yavuz, Yingbo Zhou, Wenhu Chen (membre du corps professoral vectoriel), Bhuwan Dhingra
Abstrait
L'apprentissage contrastif (AC) est une technique courante pour l'entraînement de modèles d'embeddings. Elle rapproche les exemples sémantiquement similaires (positifs) dans l'espace de représentation tout en éloignant les exemples dissemblables (négatifs). Les exemples « intra-lot », c'est-à-dire les exemples positifs du même lot, constituent une source importante de négatifs. L'efficacité de ces modèles est donc fortement influencée par la taille et la qualité des lots d'entraînement. Dans ce travail, nous proposons « Breaking the Batch Barrier » (B3), une nouvelle stratégie de construction de lots conçue pour constituer des lots de haute qualité pour l'AC. Notre approche commence par l'utilisation d'un modèle d'intégration préentraîné pour classer tous les exemples de l'ensemble de données, à partir duquel un graphe de similarité clairsemé est construit. Un algorithme de détection de communautés est ensuite appliqué à ce graphique pour identifier des groupes d'exemples qui se contredisent fortement. Ces groupes servent ensuite à construire des lots riches en exemples négatifs intra-lot. Les résultats empiriques obtenus sur le benchmark d'intégration multimodale MMEB (36 tâches) démontrent que notre méthode établit une nouvelle référence, surpassant les meilleures méthodes précédentes de +1,3 et +2,9 points respectivement aux échelles de modèles 7B et 2B. Notamment, les modèles entraînés avec \bthm\ surpassent les résultats de pointe existants même avec une taille de lot aussi petite que 64, soit 4 à 16 fois plus petite que celle requise par les autres méthodes.
BridgePure : Une protection limitée, même en cas de fuite, peut compromettre la protection des données en boîte noire.
Yihan Wang, Yiwei Lu (affilié du corps enseignant de Vector), Xiao-Shan Gao, Gautam Kamath (membre du corps professoral de Vector), Yaoliang Yu (membre du corps professoral de Vector)
Abstrait
Les attaques de disponibilité, ou exemples non apprenables, sont des techniques de défense permettant aux propriétaires de données de modifier leurs ensembles de données afin d'empêcher les modèles d'apprentissage automatique non autorisés d'apprendre efficacement, tout en préservant la fonctionnalité prévue des données. Cela a mené à la mise à disposition d'outils de type « boîte noire » (par exemple, des API) permettant aux utilisateurs de télécharger des données personnelles et d'en recevoir des copies protégées. Dans ce travail, nous démontrons que ces protections « boîte noire » peuvent être considérablement compromises si un petit ensemble de données non protégées au sein de la distribution est disponible. Plus précisément, nous proposons un nouveau modèle de menace de fuite de protection, où un attaquant peut (1) acquérir facilement des paires (non protégées, protégées) en interrogeant les protections « boîte noire » avec un petit ensemble de données non protégées ; et (2) entraîner un modèle de pont de diffusion pour établir une correspondance entre les données non protégées et protégées. Cette correspondance, appelée BridgePure, peut supprimer efficacement la protection de toute donnée inédite au sein de la même distribution. BridgePure démontre des performances de purification supérieures sur les tâches de classification et d'imitation de style, révélant des vulnérabilités critiques dans la protection des données « boîte noire ». Nous suggérons aux praticiens de mettre en œuvre des contre-mesures à plusieurs niveaux pour atténuer ces risques.
Les LLM multimodaux peuvent-ils fournir un accompagnement en direct, étape par étape, pour l'exécution des tâches ?
Apratim Bhattacharyya, Bicheng Xu, Sanjay Haresh, Reza Pourreza, Litian Liu, Sunny Panchal, Leonid Sigal (membre du corps professoral de Vector), Roland Memisevic
Abstrait
Les modèles de langage multimodaux de grande taille (LLM) possèdent des capacités conversationnelles avancées, mais peinent à fournir un guidage interactif en temps réel, étape par étape, une fonctionnalité essentielle pour les futurs assistants IA. Un guidage efficace nécessite non seulement de transmettre des instructions, mais aussi de détecter leur bonne exécution, ainsi que d'identifier et de signaler les erreurs des utilisateurs, le tout en temps réel. Cela nécessite des modèles non pas à tours de rôle, mais capables de réagir de manière asynchrone à un flux vidéo, ainsi que des données vidéo montrant les utilisateurs effectuant des tâches, y compris leurs erreurs et leurs corrections. À cette fin, nous présentons LiveCook, un nouvel ensemble de données et un banc d'essai construits sur CaptainCook4D, qui contient des erreurs d'utilisateurs lors de l'exécution de tâches. LiveCook propose des instructions et des messages de rétroaction richement annotés et horodatés, incluant notamment des alertes d'erreur précisément synchronisées avec leur apparition visuelle dans la vidéo. Nous évaluons les LLM multimodaux de pointe sur LiveCook et présentons LiveMamba, un LLM multimodal en flux continu conçu pour un guidage pédagogique interactif. Ce travail fournit le premier banc d'essai dédié et une base solide pour le développement et l'évaluation de solutions de coaching en direct et contextualisé.
En résumé : les modèles d’apprentissage multimodaux actuels peinent à fournir un guidage pas à pas en temps réel. Nous avons développé Qualcomm Interactive Cooking (un nouvel ensemble de données comprenant des vidéos d’erreurs et des retours d’information temporels) et LiveMamba (un modèle de diffusion en continu) afin d’améliorer ce guidage interactif en temps réel.
Care-PD : un ensemble de données cliniques anonymisées multicentriques pour l’évaluation de la marche dans la maladie de Parkinson
Vida Adeli, Ivan Klabučar, Javad Rajabi, Benjamin Filtjens, Soroush Mehraban, Diwei Wang, Trung Hieu Hoang, Minh Do, Hyewon Seo, Candice Muller, Daniel Coelho, Claudia de Oliveira, Pieter Ginis, Moran Gilat, Alice Nieuwboer, Joke Spildooren, J. Mckay, Hyeokhyen Kwon, Gari Clifford, Christine Esper, Stewart Factor, Imari Genias, Amirhossein Dadashzadeh, Leia Shum, Alan Whone, Majid Mirmehdi, Andrea Iaboni, Babak Taati (affilié à la faculté Vector)
Abstrait
L'évaluation objective de la marche dans la maladie de Parkinson (MP) est limitée par l'absence de vastes ensembles de données de mouvement diversifiés et annotés cliniquement. Nous présentons Care-PD, la plus grande archive publique de données de marche en 3D pour la MP, et la première collection multicentrique regroupant 9 cohortes provenant de 8 centres cliniques. Tous les enregistrements (vidéo RVB ou capture de mouvement) sont convertis en maillages SMPL anonymisés grâce à un pipeline de prétraitement harmonisé. Care-PD prend en charge deux objectifs clés : la prédiction supervisée des scores cliniques (estimation des scores de marche de l'échelle UPDRS) et les tâches non supervisées de simulation de mouvement (extraction de points clés 2D vers 3D et reconstruction 3D du corps entier). La prédiction clinique est évaluée selon quatre protocoles de généralisation : généralisation intra-ensemble de données, généralisation inter-ensembles de données, validation croisée (un ensemble de données exclu) et adaptation au sein du domaine pour plusieurs ensembles de données. Afin d’évaluer la pertinence clinique, nous comparons des encodeurs de mouvement de pointe à une méthode de référence traditionnelle basée sur les caractéristiques de la marche. Les résultats montrent que les encodeurs surpassent systématiquement les caractéristiques extraites manuellement. Le préentraînement sur Care-PD réduit l’erreur moyenne de prédiction de la marche (MPJPE) (de 60,8 mm à 7,5 mm) et augmente de 17 % le score F1 macro de la gravité de la maladie de Parkinson, soulignant ainsi l’importance de données d’entraînement diversifiées et validées cliniquement. Care-PD et l'ensemble du code de référence sont disponibles pour la recherche non commerciale (code, données).
En bref : Nous présentons Care-PD, un ensemble de données multisite et un référentiel pour l’analyse de la démarche de la maladie de Parkinson, permettant une prédiction robuste de la gravité clinique et améliorant l’apprentissage de la représentation du mouvement grâce à des données de démarche pathologiques diverses et anonymisées.
CausalPFN : Estimation amortie de l’effet causal par apprentissage en contexte
Article vedette
Vahid Balazadeh, Hamidreza Kamkari, Valentin Thomas, Junwei Ma, Bingru Li, Jesse Cresswell, Rahul Krishnan (membre du corps professoral de Vector)
Abstrait
L'estimation des effets causaux à partir de données observationnelles est fondamentale dans de nombreuses applications. Cependant, le choix d'un estimateur approprié parmi des dizaines de méthodes spécialisées exige un effort manuel considérable et une expertise pointue du domaine. Nous présentons CausalPFN, un transformateur unique qui simplifie ce processus : entraîné une seule fois sur une vaste bibliothèque de processus simulés de génération de données respectant le principe d'ignorabilité, il infère immédiatement les effets causaux pour de nouveaux ensembles de données observationnelles. CausalPFN combine des concepts d'inférence causale bayésienne avec le protocole d'entraînement à grande échelle des réseaux à effets a priori (PFN), apprenant à associer directement les observations brutes aux effets causaux sans aucun ajustement spécifique à la tâche. Notre approche obtient des performances moyennes supérieures sur les ensembles de données de référence pour l'estimation de l'effet d'un traitement hétérogène et moyen (IHDP, Lalonde, ACIC). De plus, elle présente des performances compétitives pour la prise de décision dans le monde réel sur des tâches de modélisation de l'effet positif. CausalPFN fournit des estimations d'incertitude calibrées pour soutenir une prise de décision fiable basée sur les principes bayésiens. Ce modèle prêt à l'emploi ne nécessite aucun entraînement ni réglage supplémentaire et constitue un pas vers l'inférence causale automatisée ( https://github.com/vdblm/CausalPFN/ ).
En bref : CausalPFN est un transformateur préentraîné qui amortit l’estimation de l’effet causal : entraîné une seule fois sur des processus de génération de données simulés, il produit des effets calibrés pour de nouveaux ensembles de données d’observation sans aucun réglage.
Simulation de canal et compression distribuée avec échantillonnage par rejet d'ensemble
Truong Buu Phan, Ashish Khisti (affilié à la faculté Vector)
Abstrait
Nous étudions la simulation de canal et l'appariement distribué, deux problèmes fondamentaux ayant de nombreuses applications en apprentissage automatique, en utilisant une généralisation récente de l'algorithme d'échantillonnage par rejet (RS) standard, appelée échantillonnage par rejet d'ensemble (ERS). Pour la simulation de canal, nous proposons un nouveau schéma de codage basé sur l'ERS qui atteint un taux de codage quasi optimal. En faisant cela, nous démontrons que l'algorithme RS standard peut également atteindre un taux de codage quasi optimal et généralisons le résultat de Braverman et Garg (2014) au cadre d'un alphabet continu. Ensuite, notre principale contribution est la présentation d'un lemme d'appariement distribué pour l'ERS, qui constitue l'équivalent, pour l'échantillonnage par rejet, du lemme d'appariement de Poisson (PML) introduit par Li et Anantharam (2021). Notre résultat généralise également un travail récent sur le lemme d'appariement d'importance (Phan et al., 2024) et, à notre connaissance, est le premier résultat sur l'appariement distribué dans la famille des schémas d'échantillonnage par rejet où la probabilité d'appariement est proche du PML. Nous démontrons l'intérêt pratique de notre approche par rapport aux travaux antérieurs en l'appliquant à la compression distribuée. L'efficacité de notre schéma proposé est validée par des expériences impliquant des sources gaussiennes synthétiques et une compression d'images distribuée utilisant l'ensemble de données MNIST.
En bref : Nous proposons une nouvelle approche de simulation de canal pour la compression distribuée utilisant l’échantillonnage par rejet d’ensemble.
CheMixHub : Ensembles de données et points de référence pour la prédiction des propriétés des mélanges chimiques
Ella Miray Rajaonson, Mahyar Rajabi Kochi, Luis Martin Mejia Mendoza, Mohamad Moosavi (membre du corps professoral de Vector), Benjamin Sanchez-Lengeling (affilié du corps professoral de Vector)
Abstrait
Le développement de modèles prédictifs améliorés pour les systèmes multimoléculaires est crucial, car la quasi-totalité des produits chimiques utilisés résultent d'un mélange de substances chimiques. Bien que constituant un lien essentiel de la chaîne de production industrielle, l'espace des mélanges chimiques reste relativement inexploré par la communauté de l'apprentissage automatique. Dans cet article, nous présentons CheMixHub, un ensemble de données de référence complet pour les mélanges moléculaires, couvrant un corpus de 11 tâches de prédiction des propriétés de mélanges chimiques, allant des formulations pour l'administration de médicaments aux électrolytes de batteries, pour un total d'environ 500 000 points de données collectés et organisés à partir de 7 ensembles de données publics. CheMixHub introduit diverses techniques de segmentation des données afin d'évaluer la généralisation contextuelle et la robustesse des modèles, fournissant ainsi une base pour le développement de modèles prédictifs des propriétés des mélanges chimiques. De plus, nous cartographions l'espace de modélisation des modèles d'apprentissage profond pour les mélanges chimiques, établissant des points de référence initiaux pour la communauté. Cet ensemble de données a le potentiel d'accélérer le développement des mélanges chimiques, englobant la reformulation, l'optimisation et la découverte. L'ensemble de données et le code des points de référence sont disponibles à l'adresse suivante : https://github.com/chemcognition-lab/chemixhub
Réutilisation des données d'équilibrage par classe pour l'apprentissage incrémental fédéré par classe
Zhuang Qi, Ying-Peng Tang, Lei Meng, Han Yu, Xiaoxiao Li (membre du corps professoral de Vector), Xiangxu Meng
Abstrait
L'apprentissage incrémental fédéré par classes (FCIL) vise à traiter en collaboration un flux croissant de tâches entrantes réparties sur plusieurs clients. Parmi les différentes approches, la relecture des données s'avère une solution prometteuse, capable d'atténuer l'oubli en réintroduisant des exemples représentatifs des tâches précédentes. Cependant, ses performances sont généralement limitées par le déséquilibre des classes, à la fois au sein du tampon de relecture (en raison d'une connaissance globale limitée) et entre les classes rejouées et les nouvelles classes. Pour résoudre ce problème, nous proposons FedCBDR, une méthode de relecture équilibrée des données par classe pour FCIL. FedCBDR utilise un mécanisme de coordination globale pour la construction de la mémoire au niveau des classes et répond à l'objectif d'apprentissage afin d'atténuer les déséquilibres mentionnés. Plus précisément, FedCBDR comporte deux composantes clés : 1) le module de relecture des données à perspective globale reconstruit des représentations globales des connaissances des tâches précédentes de manière à préserver la confidentialité, puis guide une stratégie d'échantillonnage sensible aux classes et à leur importance pour obtenir une relecture équilibrée ; 2) Par la suite, afin de gérer le déséquilibre des classes entre les tâches, le module d'ajustement de la température, sensible à la tâche, ajuste de manière adaptative la température des logits aux niveaux de la classe et de l'instance en fonction de la dynamique des tâches. Cela réduit la confiance excessive du modèle dans les classes majoritaires tout en améliorant sa sensibilité aux classes minoritaires. Les résultats expérimentaux ont vérifié que FedCBDR assure un échantillonnage équilibré par classe malgré l'hétérogénéité des distributions de données et améliore la généralisation en cas de déséquilibre entre les tâches anciennes et récentes, ce qui se traduit par un gain de précision Top-1 de 2 % à 15 % par rapport à six méthodes de pointe.
Autodifférence en mode écroulé de Taylor
Felix Dangel (boursier postdoctoral distingué de Vector), Tim Siebert, Marius Zeinhofer, Andrea Walther
Abstrait
Le calcul des opérateurs d'équations aux dérivées partielles (EDP) par rétropropagation imbriquée est coûteux, mais répandu, et limite considérablement leur utilité pour l'apprentissage automatique scientifique. Des avancées récentes, comme le laplacien direct et la différenciation automatique (DA) en mode de Taylor randomisé, proposent des schémas directs pour remédier à ce problème. Nous introduisons une technique d'optimisation pour le mode de Taylor qui « réduit » les dérivées en réécrivant le graphe de calcul, et nous montrons comment l'appliquer aux opérateurs d'EDP linéaires généraux et au mode de Taylor randomisé. Les modifications nécessitent simplement la propagation d'une somme dans le graphe de calcul, ce qui pourrait – ou devrait – être fait par un compilateur d'apprentissage automatique, sans exposer la complexité aux utilisateurs. Nous implémentons notre procédure de réduction et l'évaluons sur des opérateurs d'EDP courants, confirmant qu'elle accélère le mode de Taylor et surpasse la rétropropagation imbriquée.
En résumé : nous accélérons le mode de Taylor pour les opérateurs différentiels d’intérêt pratique en réduisant les coefficients de Taylor ; cela peut être fait automatiquement grâce à des simplifications de graphiques de calcul.
The Common Pile v0.1 : un ensemble de données de 8 To de textes du domaine public et sous licence ouverte
Nikhil Kandpal, Brian Lester, Colin Raffel (membre du corps professoral de Vector), Sebastian Majstorovic, Stella Biderman, Baber Abbasi, Luca Soldaini, Enrico Shippole, A. Feder Cooper, Aviya Skowron, Shayne Longpre, Lintang Sutawika, Alon Albalak, Zhenlin Xu, Guilherme Penedo, Loubna Ben allal, Elie Bakouch, John Pressman, Honglu Fan, Dashiell Stander, Guangyu Song, Aaron Gokaslan, John Kirchenbauer, Tom Goldstein, Brian Bartoldson, Bhavya Kailkhura, Tyler Murray
Abstrait
Les grands modèles de langage (LLM) sont généralement entraînés sur d'énormes quantités de textes non libres de droits, une pratique qui a suscité des critiques en raison de possibles violations de la propriété intellectuelle et de préoccupations éthiques. L'entraînement des LLM sur des textes sous licence libre constitue un premier pas vers la résolution de ces problèmes, mais les efforts de collecte de données antérieurs ont produit des ensembles de données trop petits ou de trop faible qualité pour produire des LLM performants. Pour combler cette lacune, nous recueillons, organisons et publions Common Pile v0.1, une collection de huit téraoctets de textes sous licence libre conçue pour le préentraînement des LLM. Common Pile comprend du contenu provenant de 30 sources couvrant divers domaines, notamment des articles de recherche, du code, des livres, des encyclopédies, du matériel pédagogique, des transcriptions audio, etc. Surtout, nous validons nos efforts en entraînant Comma v0.1, un LLM de 7 milliards de paramètres entraîné sur 1 000 milliards de jetons de texte provenant de Common Pile. Comma atteint des performances comparables à celles des LLM entraînés sur des textes non libres de droits avec des budgets de calcul similaires, tels que LLaMA 7B. En plus de publier Common Pile v0.1 elle-même, nous publions également le code utilisé pour sa création ainsi que les points de contrôle et le mélange d'entraînement de Comma v0.1.
En bref : nous recueillons 8 To de textes du domaine public et sous licence ouverte et nous les utilisons pour pré-entraîner un LLM performant à 7 milliards de paramètres.
Ctrl-ADN : Conception d’ADN régulateur contrôlable et spécifique au type cellulaire via RL contraint
Article vedette
Xingyu Chen, Shihao Ma, Runsheng Lin, Jiecong Lin, Bo Wang (membre du corps professoral de Vector)
Abstrait
La conception de séquences d'ADN régulatrices permettant une expression génique précise et spécifique à un type cellulaire est cruciale pour les progrès de la biologie synthétique, de la thérapie génique et de la médecine de précision. Bien que les modèles de langage (ML) basés sur les transformateurs puissent capturer efficacement les motifs présents dans l'ADN régulateur, leurs approches génératives ont souvent du mal à produire de nouvelles séquences dotées d'une activité fiable et spécifique à un type cellulaire. Nous présentons ici regCon, un nouveau cadre d'apprentissage par renforcement (AR) contraint, conçu spécifiquement pour la conception de séquences d'ADN régulatrices à spécificité cellulaire contrôlable. En formulant la conception de séquences régulatrices comme un problème d'optimisation contrainte, éclairé par la biologie, nous appliquons l'AR à des ML génomiques autorégressifs. Cela permet aux modèles d'affiner itérativement les séquences afin de maximiser l'activité régulatrice dans les types cellulaires ciblés, tout en limitant les effets hors cible. Notre évaluation sur des promoteurs et des activateurs humains démontre que regCon surpasse systématiquement les approches génératives et d'AR existantes, en générant des séquences régulatrices à haute performance et en atteignant une spécificité cellulaire de pointe. De plus, les séquences générées par regCon capturent des sites de liaison de facteurs de transcription (TFBS) clés spécifiques au type cellulaire, de courts motifs d'ADN reconnus par des protéines régulatrices qui contrôlent l'expression des gènes, démontrant ainsi la plausibilité biologique des séquences générées.
DenseDPO : Optimisation fine des préférences temporelles pour les modèles de diffusion vidéo
Article vedette
Ziyi Wu, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ashkan Mirzaei, Igor Gilitschenski (membre du corps professoral de Vector), Sergey Tulyakov, Aliaksandr Siarohin
Abstrait
L'optimisation directe des préférences (DPO) a récemment été appliquée comme technique de post-entraînement pour les modèles de diffusion texte-vidéo. Pour obtenir les données d'entraînement, des annotateurs sont invités à indiquer leurs préférences entre deux vidéos générées à partir de bruits indépendants. Cependant, cette approche empêche les comparaisons fines et, comme nous le soulignons, elle biaise les annotateurs en faveur des séquences à faible mouvement, car elles contiennent souvent moins d'artefacts visuels. Dans ce travail, nous présentons DenseDPO, une méthode qui remédie à ces lacunes grâce à trois contributions. Premièrement, on crée chaque paire de vidéos pour DPO en débruitant des copies corrompues d'une vidéo de référence. Cela permet d'obtenir des paires alignées présentant des structures de mouvement similaires tout en différant par des détails locaux, neutralisant ainsi le biais lié au mouvement. Deuxièmement, nous exploitons l'alignement temporel obtenu pour étiqueter les préférences sur de courts segments plutôt que sur des séquences entières, ce qui produit un signal d'apprentissage plus dense et plus précis. Avec seulement un tiers des données étiquetées, DenseDPO améliore considérablement la génération de mouvement par rapport à DPO classique, tout en conservant les mêmes performances en termes d'alignement du texte, de qualité visuelle et de cohérence temporelle. Enfin, nous montrons que… DenseDPO permet l'annotation automatique des préférences grâce à des modèles de langage visuel (VLM) prêts à l'emploi : GPT prédit avec précision les préférences au niveau du segment, semblables aux modèles de récompense vidéo finement ajustés spécifiquement à la tâche, et DenseDPO entraîné sur ces étiquettes atteint des performances proches de celles obtenues avec des étiquettes humaines.
En résumé : nous proposons une méthode DPO améliorée, adaptée aux modèles de diffusion vidéo.
DiffBreak : La purification par diffusion est-elle robuste ?
André Kassis, Urs Hengartner, Yaoliang Yu (membre du corps professoral de Vector)
Abstrait
La purification basée sur la diffusion (DBP) est devenue une défense fondamentale contre les exemples adverses (EA), considérée comme robuste grâce à l'utilisation de modèles de diffusion (MD) qui projettent les EA sur la variété des données naturelles. Nous réfutons cette affirmation principale en démontrant théoriquement que les attaques basées sur le gradient ciblent en réalité le MD plutôt que le classificateur, ce qui a pour conséquence d'aligner les sorties de la DBP sur les distributions adverses. Cela mène à une réévaluation de la robustesse de la DBP, révélant deux failles critiques : des gradients incorrects et des protocoles d'évaluation inappropriés qui ne testent qu'une seule purification aléatoire de l'EA. Nous montrons qu'en tenant correctement compte de la stochasticité et du risque de nouvelle soumission, la DBP s'effondre. Pour appuyer ce résultat, nous présentons DiffBreak, le premier outil fiable de différenciation par DBP, éliminant les défauts de gradient qui, auparavant, surestimaient sa robustesse. Nous analysons également le schéma de défense actuel utilisé pour la DBP, où la classification repose sur une seule purification, et mettons en évidence son invalidité intrinsèque. Nous proposons une alternative au vote majoritaire (VM), fondée sur des données statistiques, qui regroupe les prédictions de plusieurs copies purifiées, démontrant un gain de robustesse partiel mais significatif. Nous proposons ensuite une adaptation inédite d'une méthode d'optimisation contre le tatouage numérique par deepfake, créant des perturbations systémiques qui neutralisent le DBP même avec le VM, remettant ainsi en question sa viabilité.
En bref : DiffBreak fournit le premier cadre fiable pour la différenciation par purification basée sur la diffusion, révélant des vulnérabilités clés sous attaques adaptatives.
Attribution des données d'entraînement distributionnelles : que représentent les fonctions d'influence pour l'échantillonnage ?
Article vedette
Bruno Mlodozeniec, Isaac Reid, Sam Power, David Krueger, Murat Erdogdu (membre du corps professoral de Vector), Richard Turner, Roger Grosse (membre du corps professoral de Vector)
Abstrait
Le hasard est une composante inévitable de l'entraînement des modèles d'apprentissage profond, or les algorithmes traditionnels d'attribution des données d'entraînement ne parviennent pas à le prendre en compte rigoureusement. Ils ignorent le fait que, en raison de la stochasticité de l'initialisation et du traitement par lots, l'entraînement sur un même ensemble de données peut produire des modèles différents. Dans cet article, nous remédions à cette lacune en introduisant l'attribution des données d'entraînement _distributionnelle_ (d-TDA), dont l'objectif est de prédire comment la distribution des sorties du modèle (au fil des itérations d'entraînement) dépend de l'ensemble de données. Nous démontrons l'intérêt pratique de la d-TDA par des expériences, notamment en identifiant des exemples d'entraînement qui modifient drastiquement la distribution d'une mesure cible sans nécessairement en modifier la moyenne. Étonnamment, nous constatons également que les _fonctions d'influence_ (FI), un outil d'attribution de données populaire mais mal compris, émergent naturellement de notre cadre distributionnel comme la limite de la différentiation déroulée – sans nécessiter d'hypothèses de convexité restrictives. Cela fournit une nouvelle justification mathématique à leur efficacité en apprentissage profond et contribue à caractériser leurs limitations.
En bref : cet article présente l’attribution de données d’entraînement distributionnelles, un cadre d’attribution de données qui tient compte de la stochasticité dans l’entraînement en apprentissage profond, permettant une justification mathématique du fonctionnement des fonctions d’influence dans ce contexte.
Ne soyez pas paresseux : CompleteP permet des transformateurs profonds à faible consommation de calcul.
Nolan Dey, Bin Zhang, Lorenzo Noci, Mufan Li (membre affilié de la faculté Vector), Blake Bordelon, Shane Bergsma, Cengiz Pehlevan, Boris Hanin, Joel Hestness
Abstrait
Nous étudions l'efficacité de calcul de l'entraînement des modèles linéaires à couches (LLM) en utilisant différentes paramétrisations, c'est-à-dire des règles d'ajustement des hyperparamètres (HP) du modèle et de l'optimiseur en fonction de la taille du modèle. Certaines paramétrisations ne parviennent pas à transférer les HP de base optimaux (comme le taux d'apprentissage) lors des variations de profondeur du modèle, obligeant les praticiens soit à réajuster ces HP à mesure que la taille du modèle augmente (opération coûteuse), soit à accepter un entraînement sous-optimal lorsque le réajustement est prohibitif. Même lorsque le transfert des HP est réussi, nous développons une théorie montrant que certaines paramétrisations peuvent subsister dans un régime d'apprentissage paresseux où les couches n'apprennent que des caractéristiques proches de leur linéarisation, empêchant une utilisation efficace de la profondeur et de la non-linéarité. Finalement, nous identifions et adoptons la paramétrisation CompleteP qui assure à la fois le transfert des HP en fonction de la profondeur et un apprentissage non paresseux dans toutes les couches. CompleteP permet une plus grande variété de rapports largeur/profondeur du modèle tout en conservant une efficacité de calcul optimale, ouvrant la voie à des architectures mieux adaptées à différentes configurations matérielles et contextes opérationnels. De plus, CompleteP permet des gains d'efficacité de calcul de 12 à 34 % par rapport à l'état de l'art précédent.
En bref : nous présentons CompleteP, qui offre un transfert HP en fonction de la profondeur, des économies de FLOP lors de l’entraînement de modèles profonds et une gamme plus étendue de rapports largeur/profondeur efficaces en termes de calcul.
EAGLE-3 : Accélération de l’inférence des grands modèles linguistiques grâce à des tests effectués lors de l’entraînement
Yuhui Li, Fangyun Wei, Chao Zhang, Hongyang Zhang (membre du corps professoral de Vector)
Abstrait
La nature séquentielle des modèles linéaires à longue portée (LLM) modernes les rend coûteux et lents, et l'échantillonnage spéculatif s'est avéré une solution efficace à ce problème. Des méthodes comme EAGLE effectuent une autorégression au niveau des caractéristiques, réutilisant les caractéristiques de la couche supérieure du modèle cible pour obtenir de meilleurs résultats que l'échantillonnage spéculatif classique. Une tendance croissante dans la communauté des LLM consiste à augmenter le volume des données d'entraînement afin d'améliorer l'intelligence du modèle sans augmenter les coûts d'inférence. Cependant, nous observons que l'augmentation du volume des données n'apporte que des améliorations limitées à EAGLE. Nous identifions que cette limitation provient des contraintes de prédiction des caractéristiques d'EAGLE. Dans cet article, nous présentons EAGLE-3, qui abandonne la prédiction des caractéristiques au profit de la prédiction directe des jetons et remplace la dépendance aux caractéristiques de la couche supérieure par une fusion de caractéristiques multicouches via une technique appelée test en temps d'entraînement. Ces améliorations améliorent considérablement les performances et permettent au modèle de tirer pleinement parti de l'augmentation du volume des données d'entraînement. Nos expériences comprennent des modèles de conversation et des modèles de raisonnement, évalués sur cinq tâches. Les résultats montrent qu'EAGLE-3 atteint un facteur d'accélération jusqu'à 6,5x, soit une amélioration d'environ 1,4x par rapport à EAGLE-2. Dans le cadre SGLang, EAGLE-3 atteint une amélioration du débit de 1,38x pour une taille de lot de 64.
En bref : nous proposons EAGLE-3, en constatant qu’il peut bénéficier d’une augmentation du volume de données.
ELECTRA : Un réseau cartésien pour la prédiction de la densité de charge 3D avec des orbitales flottantes
Article vedette
Jonas Elsborg, Luca Thiede, Alán Aspuru-Guzik (membre du corps professoral de Vector), Tejs Vegge, Arghya Bhowmik
Abstrait
Nous présentons ELECTRA (Electronic Tensor Reconstruction Algorithm), un modèle équivariant permettant de prédire les densités de charge électronique à l'aide d'orbitales flottantes. Ce concept, bien établi en chimie quantique, promet des représentations plus compactes et précises en plaçant librement les orbitales dans l'espace, contrairement à la méthode qui les centre sur les atomes. Cependant, la détermination du placement idéal de ces orbitales exige une connaissance approfondie du domaine, ce qui a jusqu'à présent freiné leur adoption à grande échelle. Nous résolvons ce problème par une approche basée sur les données, en entraînant un réseau de tenseurs cartésiens à prédire les positions et les coefficients des orbitales. Ceci est rendu possible grâce à un mécanisme de brisure de symétrie permettant d'apprendre des déplacements de position de symétrie inférieure à celle de la molécule d'entrée, tout en préservant l'équivariance rotationnelle de la densité de charge. Inspirés par les récents succès de la méthode de projection gaussienne (Gaussian Splatting) pour la représentation spatiale des densités, nous utilisons des orbitales gaussiennes et prédisons leurs poids et matrices de covariance. Notre méthode atteint un équilibre optimal entre l'efficacité du calcul et la précision prédictive sur des bancs d'essai établis.
En bref : Prédiction efficace de la densité de charge à l’aide d’orbitales flottantes
Amélioration de l'attribution des données d'entraînement grâce à l'optimisation représentationnelle
Article vedette
Weiwei Sun, Haokun Liu, Nikhil Kandpal, Colin Raffel (membre du corps professoral de Vector), Yiming Yang
Abstrait
Les méthodes d'attribution des données d'entraînement (TDA) visent à mesurer l'impact des données d'entraînement sur les prédictions d'un modèle. Bien que les méthodes d'attribution basées sur le gradient, telles que les fonctions d'influence, offrent une rigueur théorique, leur coût de calcul les rend impraticables pour les applications à grande échelle. Les méthodes d'attribution basées sur la représentation sont plus efficaces, car elles s'appuient sur des calculs de similarité entre exemples dans un espace de représentation donné, mais elles manquent souvent d'optimisation adaptée à la tâche et au modèle, ce qui limite leur précision. Pour surmonter ces difficultés, nous proposons AirRep, une nouvelle approche basée sur la représentation qui améliore la qualité de la représentation grâce à une optimisation, pilotée par la tâche, d'un modèle d'encodage de représentation. De plus, nous étendons cette méthode au-delà de l'attribution d'un seul exemple en utilisant un mécanisme de regroupement basé sur l'attention afin d'estimer efficacement l'influence collective de groupes d'exemples. Des expériences de réglage des instructions de grands modèles de langage démontrent qu'AirRep atteint des performances équivalentes aux approches basées sur le gradient les plus performantes, tout en étant près de deux ordres de grandeur plus efficace. Une analyse plus poussée met en évidence sa robustesse, notamment sa capacité à se généraliser à de nouvelles données et à de nouvelles tâches TDA.
En bref : AirRep est un modèle de représentation textuelle optimisé pour l’analyse textuelle des données (TDA), offrant des performances comparables aux méthodes basées sur le gradient tout en étant nettement plus efficace.
Évaluation des capacités de généralisation des agents basés sur les modèles linéaires à longue portée (LLM) dans des scénarios à motivations mixtes à l'aide de Concordia
Chandler Smith, Marwa Abdulhai, Manfred Díaz, Marko Tesic, Rakshit Trivedi, Sasha Vezhnevets, Lewis Hammond, Jesse Clifton, Minsuk Chang, Edgar Duenez-Guzman, John Agapiou, Jayd Matyas, Danny Karmon, Beining Zhang, Jim Dilkes, Akash Kundu, Hieu Minh Nguyen, Emanuel Tewolde, Jebish Purbey, Ram Mohan Rao Kadiyala, Siddhant Gupta, Aliaksei Korshuk, Buyantuev Alexander, Ilya Makarov, Gang Zhao, Rolando Fernandez, Zhihan Wang, Caroline Wang, Jiaxun Cui, Lingyun Xiao, Di Shi, Yoonchang Sung, Muhammad Arrasy Rahman, Peter Stone, Yipeng Kang, Hyeonggeun Yun, Ananya Ananya, Taehun Cha, Zhiqiang Wu, Elizaveta Tennant, Olivia Macmillan-Scott, Marta Segura, Diana Riazi, Fuyang Cui, Sriram Ganapathi (enseignant affilié à Vector), Toryn Klassen (boursière postdoctorale en sécurité en IA de Vector CIFAR), Nico Schiavone, Mogtaba Alim, Sheila McIlraith (membre du corps professoral de Vector), Manuel Rios, Oswaldo Peña, Carlos Rojas, Manuela Viviana Chacon-Chamorro, Rubén Manrique, Luis Felipe Giraldo, Nicanor Quijano, Yiding Wang, Yuxuan Chen, Fangwei Zhong, Mengmeng Wang, Wenming Tu, Zhaowei Zhang, Ziang Chen, Zixia Jia, Xue Feng, Zilong Zheng, Chichen Lin, Weijian Fan, Chenao Liu, Sneheel Sarangi, Ziyan Wang, shuqing shi, Yali Du, Avinaash Anand Kulandaivel, Yang Liu, Wu Ruiyang, Chetan Talele, 陆孙嘉, Gema Parreno, Shamika Dhuri, Bain McHale, Tim Baarslag, Dylan Hadfield-Menell, Natasha Jaques, José Hernández-Orallo, Joel Leibo
Abstrait
Les agents basés sur des modèles de langage étendus (LLM) ont démontré des capacités impressionnantes d'interaction sociale et sont de plus en plus déployés dans des situations où ils interagissent avec des agents humains et artificiels. Ces interactions représentent un enjeu crucial pour les agents basés sur les LLM, mais les méthodes d'évaluation existantes ne permettent pas de mesurer la capacité de ces agents à se généraliser à de nouvelles situations sociales. Dans cet article, nous présentons une méthode d'évaluation de la capacité des agents basés sur les LLM à coopérer dans des environnements à motivations mixtes et sans exemple préalable, à l'aide de Concordia, un environnement de simulation multi-agents en langage naturel. Ce travail introduit une approche permettant de mesurer l'intelligence coopérative adaptée au comportement humain, en mettant l'accent sur la capacité d'un agent à identifier et à exploiter les occasions de gain mutuel entre différents partenaires et dans divers contextes. Nous présentons les résultats empiriques du concours Concordia de NeurIPS 2024, où les agents ont été évalués sur leur capacité à réaliser des gains mutuels dans une série de scénarios variés, allant de la négociation aux problèmes d'action collective. Nos résultats révèlent des écarts importants entre les capacités actuelles des agents et la généralisation robuste requise pour une coopération fiable, en particulier dans les scénarios exigeant la persuasion et le respect des normes.
En bref : cet article présente une méthode d’évaluation de la coopération entre agents basés sur LLM et des co-joueurs inconnus dans des scénarios inédits à motivations mixtes, et décrit les techniques analytiques, les méthodes et les résultats du concours Concordia 2024.
Reconstruction en temps réel de scènes dynamiques à partir de vidéos monoculaires avec anticipation
Hanxue Liang, Jiawei Ren, Ashkan Mirzaei, Antonio Torralba, Ziwei Liu, Igor Gilitschenski (membre du corps professoral vectoriel), Sanja Fidler (membre du corps professoral vectoriel), Cengiz Oztireli, Huan Ling, Zan Gojcic, Jiahui Huang
Abstrait
Les progrès récents dans la reconstruction de scènes statiques par propagation directe ont démontré des progrès significatifs dans la synthèse de vues inédites de haute qualité. Cependant, ces modèles ont souvent du mal à se généraliser à divers environnements et à gérer efficacement le contenu dynamique. Nous présentons BTimer (pour Bullet Timer), le premier modèle à propagation directe sensible au mouvement pour la reconstruction en temps réel et la synthèse de vues inédites de scènes dynamiques. Notre approche reconstruit la scène complète dans une représentation 3D par étalement gaussien à un instant cible donné (« bullet ») en agrégeant les informations de toutes les images de contexte. Cette formulation permet à BTimer de gagner en évolutivité et en généralisation en exploitant des ensembles de données de scènes statiques et dynamiques. À partir d'une vidéo dynamique monoculaire, BTimer reconstruit une scène au ralenti en moins de 150 ms, tout en atteignant des performances de pointe sur les ensembles de données de scènes statiques et dynamiques, même par rapport aux approches basées sur l'optimisation.
En bref : Reconstruction dynamique de scènes 3DGS à partir de vidéos, par anticipation.
FlashMD : prédiction universelle et à grande échelle de la dynamique moléculaire
Article vedette
Filippo Bigi, Sanggyu Chong, Agustinus Kristiadi (affilié à la faculté Vector), Michele Ceriotti
Abstrait
La dynamique moléculaire (DM) permet d'étudier les processus à l'échelle atomique en intégrant dans le temps les équations qui décrivent le mouvement des atomes sous l'action des forces interatomiques. Les modèles d'apprentissage machine ont considérablement accéléré la DM en fournissant des prédictions peu coûteuses des forces, mais ils restent limités à des pas d'intégration temporelle minuscules, requis par la rapidité du mouvement atomique. Dans ce travail, nous proposons FlashMD, une méthode permettant de prédire l'évolution des positions et des quantités de mouvement sur des intervalles de temps d'un à deux ordres de grandeur supérieurs aux pas de temps typiques de la DM. Nous intégrons des considérations sur les propriétés mathématiques et physiques de la dynamique hamiltonienne dans l'architecture de la méthode, généralisons l'approche pour permettre la simulation de tout ensemble thermodynamique et évaluons avec précision les échecs éventuels d'une approche DM directe. Nous validons la précision de FlashMD dans la reproduction des propriétés à l'équilibre et dépendantes du temps, en utilisant des modèles spécifiques au système et des modèles génériques, élargissant ainsi la capacité de la simulation DM à atteindre les longues échelles de temps nécessaires à la modélisation de processus microscopiques d'une grande importance scientifique et technologique.
En bref : une méthode de prédiction des trajectoires de dynamique moléculaire utilisant de longs intervalles de temps
Flux4D : Reconstruction 4D non supervisée basée sur le flux
Jingkang Wang, Henry Che, Yun Chen, Ze Yang, Lily Goli, Sivabalan Manivasagam, Raquel Urtasun (membre du corps professoral de Vector)
Abstrait
La reconstruction de scènes dynamiques à grande échelle à partir d'observations visuelles représente un défi fondamental en vision par ordinateur, avec des implications cruciales pour la robotique et les systèmes autonomes. Si les méthodes de rendu différentiables récentes, telles que les champs de radiance neuronaux (NeRF) et le splatting gaussien 3D (3DGS), ont permis d'obtenir des reconstructions photoréalistes impressionnantes, elles souffrent de limitations d'évolutivité et nécessitent des annotations pour dissocier le mouvement des acteurs. Les méthodes autosupervisées existantes tentent de s'affranchir des annotations explicites en exploitant les indices de mouvement et les connaissances géométriques a priori, mais restent limitées par l'optimisation pour chaque scène et leur sensibilité au réglage des hyperparamètres. Dans cet article, nous présentons Flux4D, un cadre simple et évolutif pour la reconstruction 4D de scènes dynamiques à grande échelle. Flux4D prédit directement les gaussiennes 3D et leur dynamique de mouvement pour reconstruire les observations des capteurs, de manière totalement non supervisée. En utilisant uniquement des pertes photométriques et en imposant une régularisation aussi statique que possible, Flux4D apprend à décomposer les éléments dynamiques directement à partir des données brutes, sans nécessiter de modèles supervisés préentraînés ni de connaissances préalables, grâce à un entraînement sur de nombreuses scènes. Notre approche permet une reconstitution efficace de scènes dynamiques en quelques secondes, s'adapte parfaitement aux grands ensembles de données et se généralise bien aux environnements inédits, y compris aux objets rares et inconnus. Des expériences menées sur des ensembles de données de conduite en extérieur montrent que Flux4D surpasse de manière significative les méthodes existantes en termes d'évolutivité, de généralisation et de qualité de reconstruction.
En bref : Flux4D est un cadre simple et évolutif pour la reconstruction 4D non supervisée de scènes de conduite à grande échelle.
FreshStack : Élaboration de référentiels réalistes pour l’évaluation de la recherche de documents techniques
Nandan Thakur, Jimmy Lin (membre affilié de la faculté Vector), Samuel Havens, Michael Carbin, Omar Khattab, Andrew Drozdov
Abstrait
Nous présentons FreshStack, un cadre holistique pour la construction automatique de benchmarks d'évaluation de la recherche d'information (RI) intégrant des questions et des réponses complexes. FreshStack se déroule en trois étapes : (1) la collecte automatique de corpus à partir de code et de documentation technique, (2) la génération de pépites à partir de questions et réponses de la communauté, et (3) l'assistance au niveau des pépites, avec la récupération de documents grâce à une fusion de techniques de recherche et d'architectures hybrides. Nous utilisons FreshStack pour construire cinq ensembles de données portant sur des sujets en forte croissance, récents et de niche, afin d'assurer un niveau de difficulté suffisant. Sur FreshStack, les modèles de recherche existants, appliqués tels quels, sont nettement moins performants que les approches oracle sur les cinq sujets, ce qui indique un potentiel d'amélioration important de la qualité de la RI. De plus, nous avons identifié des cas où les outils de réordonnancement n'améliorent pas la précision de la première étape de recherche (deux sujets sur cinq), et où le contexte de l'oracle aide un générateur LLM à produire une réponse RAG de haute qualité. Nous espérons que FreshStack facilitera les travaux futurs visant à construire des bancs d'essai réalistes, évolutifs et non contaminés pour l'évaluation IR et RAG.
En bref : FreshStack est un cadre permettant de construire des benchmarks réalistes d’évaluation IR et RAG sur des domaines de niche et récents à partir de questions et réponses posées par la communauté.
De l'information à l'exposant génératif : le taux d'apprentissage induit des transitions de phase dans la SGD
Konstantinos Tsiolis, Alireza Mousavi-Hosseini, Murat Erdogdu (membre du corps professoral de Vector)
Abstrait
Pour comprendre la dynamique d'apprentissage des caractéristiques dans les réseaux de neurones, des travaux théoriques récents se sont concentrés sur l'apprentissage par gradient de modèles gaussiens à index unique, où l'étiquette est une fonction non linéaire d'une projection unidimensionnelle latente de l'entrée. Alors que la complexité d'échantillonnage de la descente de gradient stochastique (SGD) en ligne est déterminée par l'exposant d'information du lien non linéaire, des travaux récents ont amélioré ce point en réutilisant des échantillons ou en modifiant la fonction de perte — des transformations qui introduisent des mises à jour non corrélatives — et sont désormais limitées par l'exposant génératif (potentiellement beaucoup plus petit). Cependant, ce modèle n'est valable que si le taux d'apprentissage est suffisamment élevé. Dans cet article, nous caractérisons la relation entre le taux d'apprentissage et la complexité d'échantillonnage pour une large classe d'algorithmes basés sur le gradient, qui englobe à la fois les mises à jour corrélatives et non corrélatives, et nous démontrons une transition de phase d'un « régime d'exposant d'information » avec un faible taux d'apprentissage vers un « régime d'exposant génératif » avec un taux d'apprentissage élevé. Notre cadre théorique englobe les analyses antérieures de la descente de gradient stochastique (SGD) en une seule passe et avec réutilisation des lots, tout en introduisant un nouvel algorithme d'apprentissage par couches. Cet algorithme exploite une approche à deux échelles de temps pour aller au-delà des requêtes corrélationnelles sans réutiliser les échantillons ni modifier la fonction de perte basée sur l'erreur quadratique. Notre étude théorique démontre que le choix du taux d'apprentissage est aussi important que la conception de l'algorithme pour optimiser l'efficacité statistique et computationnelle.
General-Reasoner : Faire progresser le raisonnement juridique dans tous les domaines
Xueguang Ma, Qian Liu, Dongfu Jiang, Ge Zhang, Zejun MA, Wenhu Chen (membre du corps professoral de Vector)
Abstrait
L'apprentissage par renforcement (RL) a récemment démontré un fort potentiel pour améliorer les capacités de raisonnement des grands modèles de langage (LLM). En particulier, l'apprentissage par renforcement « zéro », introduit par Deepseek-R1-Zero, permet un entraînement RL direct des LLM de base sans recourir à une étape intermédiaire de fine-tuning supervisé. Malgré ces progrès, les travaux actuels sur le raisonnement des LLM se concentrent principalement sur les domaines des mathématiques et du codage, en grande partie en raison de l'abondance des données et de la facilité de vérification des réponses. Cela limite l'applicabilité et la généralisation de ces modèles à des domaines plus vastes, où les questions ont souvent des représentations de réponses diverses et où les données sont plus rares. Dans cet article, nous proposons \model, un nouveau paradigme d'entraînement conçu pour améliorer les capacités de raisonnement des LLM dans divers domaines. Nos principales contributions sont les suivantes : (1) la construction d'un ensemble de données à grande échelle et de haute qualité, composé de questions avec des réponses vérifiables, recueillies par exploration du Web et couvrant un large éventail de disciplines ; et (2) le développement d'un vérificateur de réponses basé sur un modèle génératif, qui remplace la vérification traditionnelle par des règles par une capacité de raisonnement logique et de prise en compte du contexte. Notre évaluation exhaustive sur des bases de données de référence telles que MMLU-Pro, GPQA, SuperGPQA, BBEH, MATH et AMC, etc., démontre que le modèle surpasse les méthodes de base existantes, offrant des performances de raisonnement robustes et généralisables tout en conservant une efficacité supérieure dans les tâches de raisonnement mathématique. Le code, les données et les points de contrôle du modèle seront publiés.
Analyse géométrique de l'ACP
Ayoub El Hanchi, Murat Erdogdu (membre du corps professoral de Vector), Chris Maddison (membre du corps professoral de Vector)
Abstrait
Quelle propriété de la distribution des données détermine le risque excédentaire de l'analyse en composantes principales (ACP) ? Dans cet article, nous fournissons une réponse précise à cette question. Nous établissons un théorème central limite pour l'erreur du sous-espace principal estimé par ACP et dérivons la distribution asymptotique de son risque excédentaire sous l'effet de la perte de reconstruction. Nous obtenons une borne supérieure non asymptotique sur le risque excédentaire de l'ACP qui retrouve, à la limite des grands échantillons, notre caractérisation asymptotique. Nos contributions reposent sur le résultat suivant : nous démontrons que le quotient de Rayleigh par blocs négatif, défini sur la grassmannienne, est auto-concordant généralisé le long des géodésiques issues de son minimiseur de rotation maximale inférieure à π/4.
En bref : nous prouvons la normalité asymptotique de l’ACP sur la grassmannienne et dérivons une borne non asymptotique stricte sur son risque excédentaire en utilisant l’auto-concordance.
Amélioration globale des invites avec masquage attentionnel non interférent pour l'apprentissage fédéré en une seule étape
Zhuang Qi, Yu Pan, Lei Meng, Sijin Zhou, Han Yu, Xiaoxiao Li (membre du corps professoral de Vector), Xiangxu Meng
Abstrait
L'apprentissage fédéré par invites (FPL) permet une adaptation efficace en termes de communication grâce à l'ajustement d'invites légères sur des modèles préentraînés figés. Les méthodes FPL existantes s'appuient généralement sur des informations globales, disponibles seulement après le deuxième cycle d'entraînement, pour faciliter la collaboration entre les modèles clients. Elles sont donc intrinsèquement dépendantes d'une communication multicycles pour exploiter pleinement leurs atouts. De plus, les méthodes d'apprentissage fédéré en un seul passage se concentrent généralement sur l'ajustement aux tâches déjà rencontrées, mais manquent de généralisation inter-tâches. Pour combler cette lacune, nous proposons la méthode GPR-NIAM (Global Prompt Refinement with Non-Interfering Attention Masking) pour le FPL en un seul passage. L'idée principale est de concevoir un mécanisme de masquage qui limite l'interaction excessive entre les plongements lexicaux du texte original et les plongements des invites apprises. GPR-NIAM y parvient grâce à la collaboration de deux modules clés. Premièrement, le module d'isolement de l'attention supprime l'attention portée aux jetons du texte original par les jetons des invites apprises et répond à l'attention inverse, préservant ainsi la généralisation entre les tâches. Deuxièmement, le module d'amélioration collaborative inter-silos intègre les connaissances visuelles décentralisées dans une base unifiée et calibre l'invite globale grâce à un alignement multimodal des connaissances multi-sources, atténuant ainsi l'incohérence due à l'hétérogénéité des données. De nombreuses expériences menées sur dix ensembles de données de référence, pour deux tâches, montrent que GPR-NIAM surpasse huit méthodes de pointe en matière de généralisation, tant au niveau des classes qu'au niveau du domaine.
Apprentissage par renforcement, composition et renforcement : programmation d’agents d’apprentissage par renforcement au moyen d’un langage formel
Andrew Li, Toryn Klassen (boursier postdoctoral Vector CIFAR en sécurité de l'IA), Andrew Wang, Parand A. Alamdari, Sheila McIlraith (membre du corps professoral de Vector)
Abstrait
L'ancrage du langage dans la perception et l'action constitue un défi majeur pour la conception d'agents situés capables d'interagir avec des humains ou d'autres agents par le langage. Jusqu'à présent, relever ce défi nécessitait de concevoir manuellement cet ancrage ou de constituer d'immenses ensembles de données associant le langage à l'environnement. Nous proposons Ground-Compose-Reinforce, un cadre neurosymbolique de bout en bout permettant d'entraîner des agents d'apprentissage par renforcement directement à partir de spécifications de tâches de haut niveau, sans fonctions de récompense conçues manuellement ni autres oracles spécifiques au domaine, et sans ensembles de données massifs. Ces spécifications de tâches prennent la forme de Machines à Récompense, des représentations basées sur des automates qui capturent la structure de la tâche de haut niveau et sont, dans certains cas, autoformalisables à partir du langage naturel. De manière cruciale, nous démontrons que les Machines à Récompense peuvent être ancrées à l'aide de données limitées grâce à l'exploitation de la compositionnalité. Des expériences menées dans un domaine Meta-World personnalisé, avec seulement 350 trajectoires de pré-entraînement étiquetées, montrent que notre cadre parvient à extraire fidèlement des comportements complexes à partir de spécifications de haut niveau, y compris des comportements absents du pré-entraînement, contrairement aux approches non compositionnelles.
En bref : nous entraînons des agents d’apprentissage par renforcement directement à partir de spécifications de haut niveau, sans fonctions de récompense ni oracles propres au domaine.
Amélioration de la descente de gradient naturel en énergie grâce à Woodbury, l'inertie et la randomisation
Andrés Guzmán-Cordero, Felix Dangel (boursier postdoctoral distingué Vector), Gil Goldshlager, Marius Zeinhofer
Abstrait
Les méthodes de gradient naturel accélèrent considérablement l'entraînement des réseaux de neurones à information physique (PINN), mais leur coût est souvent prohibitif. Nous présentons un ensemble de techniques visant à améliorer la précision et l'efficacité de la descente de gradient naturel d'énergie (ENGD) pour les PINN. Premièrement, on tire parti de la formule de Woodbury pour réduire drastiquement la complexité de calcul de l'ENGD. Deuxièmement, nous adaptons l'algorithme de descente de gradient naturel à incrément projeté sous-échantillonné, tiré de la littérature sur la méthode de Monte Carlo variationnelle, afin d'accélérer la convergence. Troisièmement, nous explorons l'utilisation d'algorithmes randomisés pour réduire davantage le coût de calcul dans le cas de grands lots. Nous constatons que la randomisation accélère la progression lors des premières étapes de l'entraînement pour les problèmes de faible dimension, et nous identifions les principaux obstacles à l'accélération dans d'autres scénarios. Nos expériences numériques démontrent que nos méthodes surpassent les approches précédentes, atteignant la même erreur L² que l'ENGD originale, jusqu'à 75 fois plus rapidement.
En bref : nous introduisons l’identité matricielle de Woodbury, un SPRING de type momentum et une randomisation pour rendre la descente de gradient naturelle de l’énergie 75 fois plus rapide pour les PINN.
Une étude sur le risque de se souvenir dans les modèles de fondations de soins de santé
Sana Tonekaboni (boursière postdoctorale distinguée Vector), Lena Stempfle, Adibvafa Fallahpour, Walter Gerych, Marzyeh Ghassemi
Abstrait
Les modèles de base entraînés sur des dossiers médicaux électroniques (DME) anonymisés à grande échelle sont prometteurs pour les applications cliniques. Cependant, leur capacité à mémoriser les renseignements des patients soulève d'importantes questions de confidentialité. Dans ce travail, nous présentons une série de tests d'évaluation de type « boîte noire » pour évaluer les risques de mémorisation dans les modèles de base entraînés sur des données DME structurées. Notre cadre inclut des méthodes permettant d'explorer la mémorisation aux niveaux de l'intégration et de la génération, et distingue la généralisation de la mémorisation préjudiciable dans des contextes cliniques pertinents. Nous contextualisons la mémorisation en fonction de son potentiel à compromettre la confidentialité des données des patients, en particulier pour les sous-groupes vulnérables. Nous validons notre approche sur un modèle de base DME accessible au public et publions une trousse d'outils open source pour faciliter des évaluations de confidentialité reproductibles et collaboratives dans le domaine de l'IA appliquée à la santé.
En résumé : nous proposons des tests de type boîte noire pour détecter la mémorisation préjudiciable dans les modèles de base entraînés sur des données structurées de dossiers médicaux électroniques. Validé sur un modèle public, notre outil facilite les vérifications de confidentialité en distinguant la généralisation de la mémorisation compromettant la confidentialité.
L'illusion du classement
Shivalika Singh, Yiyang Nan, Alex Wang, Daniel Dsouza, Sayash Kapoor, Ahmet Üstün, Sanmi Koyejo, Yuntian Deng (affilié à la faculté Vector), Shayne Longpre, Noah Smith, Beyza Ermis, Marzieh Fadaee, Sara Hooker
Abstrait
Mesurer les progrès est fondamental pour l'avancement de tout domaine scientifique. À mesure que les points de référence jouent un rôle de plus en plus central, ils deviennent également plus susceptibles d'être faussés. Chatbot Arena s'est imposé comme le classement de référence des systèmes d'IA les plus performants. Or, dans cette étude, nous identifions des problèmes systémiques qui faussent les critères de compétition. Nous constatons que des pratiques de test privées non divulguées profitent à une poignée de fournisseurs capables de tester de multiples variantes avant leur publication et de retirer leurs scores à leur guise. Nous démontrons que la capacité de ces fournisseurs à choisir le meilleur score induit des scores biaisés sur Arena, en raison de la divulgation sélective des résultats de performance. À l'extrême, nous avons découvert un fournisseur ayant testé 27 variantes privées avant de publier un modèle, qui s'est retrouvé en deuxième position du classement. Nous constatons également que les modèles propriétaires fermés sont échantillonnés plus fréquemment (nombre de combats) et que moins de modèles sont retirés de l'arène que les alternatives open-weight et open-source. Ces deux politiques entraînent d'importantes asymétries d'accès aux données au fil du temps. Les deux premiers fournisseurs ont reçu respectivement environ 19,2 % et 20,4 % de toutes les données de l'arène. En revanche, 83 modèles à pondération ouverte ont reçu environ 29,7 % des données totales. Selon des estimations prudentes, l'accès aux données de Chatbot Arena offre des avantages considérables ; même des données supplémentaires limitées peuvent se traduire par des gains de performance relatifs allant jusqu'à 112 % sur ArenaHard, un ensemble de tests issu de la distribution Arena. Ces dynamiques mènent à un surapprentissage, lié aux spécificités d'Arena plutôt qu'à une amélioration générale de la qualité des modèles. Arena s'appuie sur les efforts considérables des organisateurs et d'une communauté ouverte qui maintient cette précieuse plateforme d'évaluation. Nous formulons des recommandations concrètes pour réformer le cadre d'évaluation de Chatbot Arena et promouvoir une évaluation comparative plus juste et plus transparente dans le domaine.
En bref : Chatbot Arena est devenue une plateforme de référence pour le classement des modèles d’IA. Notre étude approfondie révèle des dynamiques cachées qui faussent les classements et propose des mesures concrètes pour améliorer l’équité et la transparence de l’évaluation des modèles sur Chatbot Arena.
Apprentissage à partir d'exemples positifs et non étiquetés - Limites de taille finie de l'échantillon
Farnam Mansouri, Shai Ben-David (membre du corps professoral de Vector)
Abstrait
L'apprentissage PU (Positive Unlabeled) est une variante de l'apprentissage supervisé par classification, où seules les étiquettes positives sont révélées à l'apprenant. L'apprentissage PU est présent dans de nombreuses applications concrètes. La plupart des travaux existants reposent sur l'hypothèse simplificatrice que les données d'entraînement étiquetées positivement sont issues de la restriction de la distribution génératrice des données aux instances étiquetées positivement et/ou que la proportion de points étiquetés positivement (ou distribution a priori de la classe) est connue a priori de l'apprenant. Cet article propose une analyse théorique de la complexité statistique de l'apprentissage PU dans un plus large éventail de configurations. Contrairement à la plupart des travaux antérieurs, notre étude ne suppose pas que la distribution a priori de la classe soit connue de l'apprenant. Nous démontrons des bornes supérieure et inférieure sur les tailles d'échantillon requises (pour les échantillons étiquetés positivement et non étiquetés).
En bref : cet article fournit des bornes de complexité d'échantillonnage pour l'apprentissage à partir d'exemples positifs et non étiquetés.
Apprentissage de réseaux de neurones quadratiques en grande dimension : dynamique et lois d’échelle de la descente de gradient stochastique
Gérard Ben Arous, Murat Erdogdu (membre du corps professoral de Vector), Nuri Mert Vural, Denny Wu
Abstrait
Nous étudions l'optimisation et la complexité d'échantillonnage de l'entraînement basé sur le gradient d'un réseau neuronal à deux couches avec une fonction d'activation quadratique dans le régime de haute dimension, où les données sont générées comme $y \propto \sum_{j=1}^{r}\lambda_j \sigma\left(\langle \boldsymbol{\theta_j}, \boldsymbol{x}\rangle\right), \boldsymbol{x} \sim \mathcal{N}(0,\boldsymbol{I}_d)$, où $\sigma$ est le 2e polynôme d'Hermite, et $\lbrace \boldsymbol{\theta}_j \rbrace _{j=1}^{r} \subset \mathbb{R}^d$ sont des directions de signal orthonormées. Nous considérons le régime de grande largeur $r \asymp d^\beta$ pour $\beta \in (0, 1)$, et supposons une décroissance en loi de puissance des coefficients (non négatifs) de la deuxième couche $\lambda_j\asymp j^{-\alpha}$ pour $\alpha \geq 0$. Nous proposons une analyse précise de la dynamique de la descente de gradient stochastique (SGD) dans le régime d'apprentissage des caractéristiques, tant à la limite de population qu'avec la discrétisation en ligne à échantillon fini, et nous établissons des lois d'échelle pour le risque de prédiction qui mettent en évidence les dépendances en loi de puissance par rapport au temps d'optimisation, à la taille de l'échantillon et à la largeur du modèle. Notre analyse combine une caractérisation précise de l'équation différentielle de Riccati matricielle associée à de nouveaux arguments de monotonie matricielle afin d'établir des garanties de convergence pour la dynamique effective de dimension infinie.
Apprendre à nettoyer : apprentissage par renforcement pour la correction d'étiquettes bruyantes
Marzi Heidari, Hanping Zhang, Yuhong Guo (affiliés à la faculté Vector)
Abstrait
L'apprentissage avec des étiquettes bruitées représente un défi majeur en apprentissage machine, car il peut dégrader fortement les performances des modèles de prédiction s'il n'est pas correctement pris en compte. Cet article présente un nouveau cadre conceptuel pour la correction des étiquettes bruitées, considéré comme un problème d'apprentissage par renforcement (RL). L'approche proposée, Apprentissage par renforcement pour la correction d'étiquettes bruitées (RLNLC), définit un espace d'états complet représentant les données et leurs étiquettes associées, un espace d'actions indiquant les corrections d'étiquettes possibles et un mécanisme de récompense évaluant l'efficacité de ces corrections. RLNLC apprend un réseau de politiques basé sur une représentation profonde des caractéristiques pour effectuer la correction des étiquettes par apprentissage par renforcement, en utilisant une méthode acteur-critique. La politique apprise est ensuite déployée pour corriger itérativement les étiquettes d'entraînement bruitées et soutenir l'entraînement du modèle de prédiction. L'efficacité de RLNLC est démontrée par de nombreuses expériences sur plusieurs ensembles de données de référence, où elle surpasse systématiquement les techniques de pointe existantes pour l'apprentissage à partir d'étiquettes bruitées.
Couplage de distribution au niveau de la liste avec applications au décodage spéculatif et à la compression avec perte
Joseph Rowan, Truong Buu Phan, Ashish Khisti (affiliés à la faculté Vector)
Abstrait
Nous étudions une relaxation du problème du couplage de distributions de probabilité : une liste d'échantillons est générée à partir d'une distribution et une acceptation est déclarée si l'un de ces échantillons est identique à l'échantillon généré à partir de l'autre distribution. Nous proposons une nouvelle méthode de génération d'échantillons, qui étend l'échantillonnage Gumbel-max suggéré par Daliri et al. (2025) pour le couplage de distributions de probabilité. Nous établissons également une borne inférieure correspondante sur la probabilité d'acceptation, que nous appelons le lemme de correspondance de listes. On discute ensuite de deux applications de notre approche. Premièrement, nous développons un nouveau mécanisme d'échantillonnage spéculatif multi-ébauches, simple à mettre en œuvre et dont les performances sont comparables à celles de méthodes de référence telles que SpecTr et SpecInfer pour diverses tâches de traitement du langage. Notre méthode garantit également un certain degré d'invariance par rapport à l'ébaucheur concernant les jetons de sortie, ce qui n'est pas le cas des méthodes existantes. Nous fournissons également une borne inférieure théorique pour la probabilité d'acceptation au niveau du jeton. Dans une deuxième application, on considère la compression distribuée avec perte et information auxiliaire, dans un contexte où un échantillon source est compressé et accessible à plusieurs décodeurs, chacun disposant d'informations auxiliaires indépendantes. Nous proposons une technique de compression basée sur notre généralisation de l'échantillonnage Gumbel-max et démontrons qu'elle offre des gains significatifs lors d'expériences impliquant des sources gaussiennes synthétiques et l'ensemble de données d'images MNIST.
En bref : nous présentons une technique de couplage des distributions de probabilité lorsque plusieurs échantillons sont disponibles à partir de l’une des distributions, et nous donnons des applications au décodage spéculatif multi-brouillons et à la compression distribuée avec perte et informations auxiliaires.
Échantillonnage privé localement optimal : au-delà du minimax global
Hrad Ghoukasian, Bonwoo Lee, Shahab Asoodeh (affilié à la faculté Vector)
Abstrait
Nous étudions le problème de l'échantillonnage d'une distribution sous l'effet de la confidentialité différentielle locale (LDP). Étant donné une distribution privée $P \in \mathcal{P}$, l'objectif est de générer un échantillon unique à partir d'une distribution dont la $f$-divergence reste proche de $P$ tout en respectant les contraintes de LDP. Cette tâche illustre le défi fondamental que représente la production de données réalistes avec des garanties de confidentialité fortes. Alors que les travaux antérieurs de Park et al. (NeurIPS'24) se concentrent sur l'optimalité minimax globale au sein d'une classe de distributions, nous adoptons une perspective locale. Plus précisément, nous examinons l'erreur minimax dans un voisinage d'une distribution fixée $P_0$, et nous caractérisons sa valeur exacte, qui dépend à la fois de $P_0$ et du niveau de confidentialité. Notre résultat principal montre que l'erreur minimax locale est déterminée par l'erreur minimax globale lorsque la classe de distributions $\mathcal{P}$ est restreinte à un voisinage de $P_0$. Pour ce faire, nous (1) étendons les travaux antérieurs du LDP pur au cadre plus général du LDP fonctionnel, et (2) prouvons que l'échantillonneur LDP fonctionnel globalement optimal conduit à l'échantillonneur local optimal lorsqu'il est contraint à des distributions proches de $P_0$. À partir de ce résultat, nous obtenons également une expression analytique simple pour les échantillonneurs minimax localement optimaux, indépendante du choix de la $f$-divergence. Nous montrons en outre que ce cadre local modélise naturellement l'échantillonnage privé avec des données publiques, la distribution de ces données étant représentée par $P_0$. Dans ce contexte, nous comparons empiriquement notre échantillonneur localement optimal aux méthodes globales existantes et démontrons sa supériorité constante par rapport aux échantillonneurs minimax globaux.
Où regarder ? Reconnaissance visuelle efficace par l'apprentissage de l'autosupervision du point de vue et de la manière de regarder
Anthony Fuller, Yousef Yassin, Junfeng Wen, Tarek Ibrahim, Daniel Kyrollos, James Green, Evan Shelhamer (membre du corps professoral de Vector)
Abstrait
Les transformateurs de vision sont de plus en plus gros, plus précis et plus coûteux à calculer. À haute résolution, le coût est encore plus extrême car le nombre de jetons augmente de façon quadratique avec la taille de l'image. Pour compenser ce coût, nous utilisons le calcul adaptatif en apprenant à prédire où effectuer les calculs. Notre méthode LookWhere répartit le calcul entre un sélecteur basse résolution et un extracteur haute résolution, sans jamais traiter l'intégralité de l'entrée haute résolution. Nous préentraînons conjointement le sélecteur et l'extracteur sans supervision de tâche, par distillation à partir d'un modèle auto-supervisé, apprenant ainsi simultanément où et quoi calculer. Contrairement aux méthodes de réduction de jetons précédentes, qui optimisent le calcul en supprimant les jetons déjà calculés, et aux méthodes de sélection de jetons précédentes, qui nécessitent une optimisation complexe et coûteuse pour chaque tâche, LookWhere sélectionne et extrait de manière économique et précise des représentations transférables d'images. Nous démontrons que LookWhere excelle dans la reconnaissance parcimonieuse d'entrées haute résolution (panneaux de signalisation), en maintenant la précision tout en réduisant les FLOP d'un facteur 17 et le temps d'exécution d'un facteur 4, ainsi que dans les tâches de reconnaissance standard globales (classification ImageNet) et locales (segmentation ADE20K), en améliorant la précision tout en réduisant le temps d'exécution d'un facteur 1,36.
En bref : nous présentons un cadre de sélection-extraction qui extrait des caractéristiques haute résolution sans jamais voir d’images haute résolution complètes afin d’économiser de la puissance de calcul.
LuxDiT : Estimation de l’éclairage avec transformateur de diffusion vidéo
Ruofan Liang, Kai He, Zan Gojcic, Igor Gilitschenski (membre du corps professoral de Vector), Sanja Fidler (membre du corps professoral de Vector), Nandita Vijaykumar (membre du corps professoral de Vector), Zian Wang
Abstrait
L'estimation de l'éclairage d'une scène à partir d'une seule image ou vidéo demeure un défi majeur en vision par ordinateur et en infographie. Les approches basées sur l'apprentissage sont limitées par la rareté des cartes d'environnement HDR de référence, coûteuses à acquérir et peu diversifiées. Bien que les modèles génératifs récents offrent des connaissances a priori solides pour la synthèse d'images, l'estimation de l'éclairage reste complexe car elle repose sur des indices visuels indirects, la nécessité d'inférer un contexte global (non local) et la reconstruction de données à grande gamme dynamique. Nous proposons LuxDiT, une nouvelle approche basée sur les données qui affine un transformateur de diffusion vidéo pour générer des cartes d'environnement HDR conditionnées par l'entrée visuelle. Entraîné sur un vaste ensemble de données synthétiques présentant diverses conditions d'éclairage, notre modèle apprend à inférer l'illumination à partir d'indices visuels indirects et se généralise efficacement aux scènes réelles. Afin d'améliorer l'alignement sémantique entre l'entrée et la carte d'environnement prédite, nous introduisons une stratégie d'ajustement fin par adaptation de faible rang, utilisant un ensemble de données de panoramas HDR. Notre méthode produit des prédictions d'éclairage précises avec des détails angulaires haute fréquence réalistes, surpassant les techniques de pointe existantes dans les évaluations quantitatives et qualitatives.
Le désapprentissage automatique ne fonctionne pas comme vous le pensez : leçons pour les politiques et la recherche en IA générative
A. Feder Cooper, Christopher Choquette-Choo, Miranda Bogen, Kevin Klyman, Matthew Jagielski, Katja Filippova, Ken Liu, Alex Chouldechova, Jamie Hayes, Yangsibo Huang, Eleni Triantafillou, Peter Kairouz, Nicole Mitchell, Niloofar Mireshghallah, Abigail Jacobs, James Grimmelmann, Vitaly Shmatikov, Christopher De Sa, I Shumailov, Andreas Terzis, Solon Barocas, Jennifer Wortman Vaughan, Danah Boyd, Yejin Choi, Sanmi Koyejo, Fernando Delgado, Percy Liang, Daniel Ho, Pamela Samuelson, Miles Brundage, David Bau, Seth Neel, Hanna Wallach, Amy Cyphert, Mark Lemley, Nicolas Papernot (membre du corps professoral de Vector), Katherine Lee
Abstrait
Le « désapprentissage automatique » est une solution souvent proposée pour atténuer la présence, dans un modèle d'IA, de contenu problématique pour des raisons juridiques ou morales, notamment en matière de confidentialité, de droits d'auteur, de sécurité, etc. Par exemple, le désapprentissage est fréquemment invoqué pour supprimer l'influence d'informations spécifiques sur les paramètres d'un modèle d'IA générative, comme les données personnelles d'un individu ou l'inclusion de contenu protégé par le droit d'auteur dans les données d'entraînement. Le désapprentissage est également proposé pour empêcher un modèle de générer des informations ciblées dans ses résultats, par exemple des générations ressemblant fortement aux données d'un individu ou reflétant le concept de « Spiderman ». Ces deux objectifs – la suppression ciblée d'informations d'un modèle et la suppression ciblée d'informations dans ses résultats – présentent divers défis techniques et de fond. Nous proposons un cadre permettant aux chercheurs en apprentissage machine et aux décideurs politiques d'examiner rigoureusement ces défis, en identifiant plusieurs écarts entre les objectifs du désapprentissage et les implémentations possibles. Ces inadéquations expliquent pourquoi le désapprentissage n'est pas une solution universelle pour circonscrire le comportement des modèles d'IA générative au service d'un impact positif plus large.
Matrix : Création d'un monde à horizon infini avec contrôle de mouvement en temps réel
Ruili Feng, Han Zhang, Zhilei Shu, Zhantao Yang, Longxiang Tang, Zhicai Wang, Andy Zheng, Jie Xiao, Zhiheng Liu, Ruihang Chu, Yukun Huang, Yu Liu, Hongyang Zhang (membre du corps professoral vectoriel)
Abstrait
Nous présentons The Matrix, un simulateur de monde réaliste fondamental capable de générer des flux vidéo haute fidélité 720p d'une durée infinie, avec un contrôle réactif en temps réel, aussi bien à la première qu'à la troisième personne. Entraîné sur des données supervisées limitées provenant de jeux vidéo tels que Forza Horizon 5 et Cyberpunk 2077, complétées par des séquences non supervisées à grande échelle provenant d'environnements réels comme les rues de Tokyo, The Matrix permet aux utilisateurs de parcourir des terrains variés (déserts, prairies, étendues d'eau et paysages urbains) dans des séquences continues d'une heure. Avec une fréquence d'images allant jusqu'à 16 images par seconde, le système prend en charge l'interactivité en temps réel et démontre une généralisation sans exemple, transposant les environnements de jeu virtuels dans des contextes réels où la collecte de données de mouvement continues est souvent impossible. Par exemple, The Matrix peut simuler une BMW X3 circulant dans un environnement de bureaux, un environnement absent des données de jeu et des sources réelles. Cette approche met en évidence le potentiel des données de jeu pour faire progresser les modèles robustes du monde, comblant ainsi le fossé entre les simulations et les applications du monde réel dans des scénarios où les données sont limitées.
En bref : cet article présente The Matrix, un simulateur de monde réaliste fondamental capable de générer des flux vidéo haute fidélité 720p de scènes réelles d'une durée infinie avec un contrôle réactif en temps réel.
Mesure des capacités scientifiques des modèles linguistiques à l'aide d'un laboratoire de biologie des systèmes (méthode du « dry lab »)
Haonan Duan, Stephen Lu, Caitlin F Harrigan, Nishkrit Desai, Jiarui Lu, Michał Koziarski, Leonardo Cotta, Chris Maddison (membre du corps professoral de Vector)
Abstrait
La conception d'expériences et l'interprétation des résultats constituent des compétences scientifiques fondamentales, notamment en biologie, où les chercheurs perturbent des systèmes complexes pour en découvrir les mécanismes sous-jacents. Les efforts récents d'évaluation des capacités scientifiques des grands modèles de langage (LLM) se butent à l'impossibilité de tester ces compétences, les expérimentations en laboratoire étant excessivement coûteuses : en termes d'expertise, de temps et d'équipement. Nous présentons SciGym, un banc d'essai novateur qui évalue les capacités des LLM à concevoir et analyser des expériences itératives dans le cadre de tâches de découverte scientifique ouvertes. SciGym s'affranchit du coût des expériences en laboratoire en utilisant un environnement de simulation composé de systèmes biologiques. Ces modèles, codés en langage de balisage de biologie des systèmes (SBM), génèrent efficacement des données simulées, ce qui en fait des plateformes d'expérimentation idéales pour des systèmes complexes et réalistes. Nous avons évalué six LLM de pointe sur 137 petits systèmes et avons publié un total de 350 systèmes à l' adresse https://huggingface.co/datasets/h4duan/scigym-sbml . Notre évaluation montre que si les modèles les plus performants ont démontré des performances supérieures, les performances de tous les modèles ont diminué de manière significative à mesure que la complexité du système augmentait, ce qui suggère une marge d'amélioration substantielle dans les capacités scientifiques des agents LLM.
En bref : Nous présentons un banc d’essai utilisant des systèmes biologiques simulés pour évaluer les capacités de découverte scientifique des LLM.
MoCha : Vers une génération de personnages parlants de qualité cinématographique
Article vedette
Cong Wei, Bo Sun (affilié au corps professoral de Vector), Haoyu Ma, Ji Hou, Felix Juefei-Xu, Zecheng He, Xiaoliang Dai, Luxin Zhang, Kunpeng Li, Tingbo Hou, Animesh Sinha, Peter Vajda, Wenhu Chen (membre du corps professoral de Vector)
Abstrait
Les progrès récents en génération vidéo ont permis d'atteindre un réalisme de mouvement impressionnant, mais négligent souvent la narration axée sur les personnages, une tâche cruciale pour la génération automatique de films et d'animations. Nous introduisons les Personnages Parlants, une tâche plus réaliste permettant de générer des animations de personnages parlants directement à partir de la parole et du texte. Contrairement aux têtes parlantes, les Personnages Parlants visent à générer le portrait complet d'un ou plusieurs personnages, au-delà de la région faciale. Dans cet article, on propose MoCha, le premier système de génération de personnages parlants. Afin d'assurer une synchronisation précise entre la vidéo et la parole, nous proposons un mécanisme d'Attention Audio Localisée qui aligne efficacement les segments de parole et de vidéo. Pour pallier la rareté des ensembles de données vidéo à grande échelle annotés vocalement, nous introduisons une stratégie d'entraînement conjointe qui exploite à la fois les données vidéo annotées vocalement et textuellement, améliorant considérablement la généralisation à diverses actions de personnages. Nous concevons également des modèles de dialogue structurés avec des étiquettes de personnages, permettant, pour la première fois, des conversations à plusieurs personnages avec dialogue au tour par tour — permettant aux personnages générés par l'IA de s'engager dans des conversations contextuelles avec une cohérence cinématographique. Des évaluations qualitatives et quantitatives approfondies, y compris des études d'évaluation humaine et des comparaisons de référence, démontrent que MoCha établit une nouvelle norme pour la narration cinématographique générée par l'IA, atteignant un réalisme, une contrôlabilité et une généralisation supérieurs.
En bref : Nous présentons MoCha, le premier modèle de génération de plans de films pilotée par les dialogues.
MJD neuronal : Diffusion de sauts de Merton non stationnaires neuronales pour la prédiction de séries temporelles
Yuanpei Gao, Qi Yan, Yan Leng, Renjie Liao (membre du corps professoral de Vector)
Abstrait
Bien que les méthodes d'apprentissage profond aient démontré leur efficacité en matière de prédiction de séries temporelles, leur nature de « boîte noire » et leur incapacité à modéliser explicitement les processus stochastiques sous-jacents limitent souvent leur généralisation aux données non stationnaires, notamment en présence de changements brusques. Dans ce travail, nous introduisons Neural MJD, un modèle de diffusion à sauts de Merton (MJD) non stationnaire basé sur un réseau de neurones. Notre modèle formule explicitement la prévision comme un problème de simulation d'équation différentielle stochastique (EDS), combinant une diffusion d'Itô non homogène dans le temps pour capturer la dynamique stochastique non stationnaire avec un processus de Poisson composé non homogène dans le temps pour modéliser les sauts brusques. Afin de faciliter l'apprentissage, nous introduisons un mécanisme de troncature de la vraisemblance qui limite le nombre de sauts dans les petits intervalles de temps et fournissons une borne d'erreur théorique pour cette approximation. De plus, nous proposons un solveur d'Euler-Maruyama avec redémarrage, qui atteint une borne d'erreur inférieure, démontrée, dans l'estimation des états attendus et une variance réduite par rapport au solveur standard. Des expériences menées sur des ensembles de données synthétiques et réels démontrent que Neural MJD surpasse systématiquement les méthodes d'apprentissage profond et d'apprentissage statistique de pointe.
En bref : Une nouvelle équation différentielle stochastique (EDS) de diffusion par sauts de Merton neuronale pour la prédiction probabiliste de séries temporelles.
Sur l'effet du gradient négatif dans l'optimisation du renforcement profond relatif au groupe
Wenlong Deng, Yi Ren, Muchen Li, Danica J. Sutherland, Xiaoxiao Li (membre du corps professoral de Vector), Christos Thrampoulidis
Abstrait
L'apprentissage par renforcement (RL) est devenu populaire pour améliorer les capacités de raisonnement des grands modèles de langage (LLM), l'optimisation de la politique relative de groupe (GRPO) s'imposant comme un algorithme largement utilisé dans les systèmes récents. Malgré l'adoption généralisée de GRPO, nous avons identifié un phénomène jusqu'alors inconnu, que nous appelons déplacement paresseux de vraisemblance (LLD), où la vraisemblance des réponses correctes augmente légèrement, voire diminue, au cours de l'entraînement. Ce comportement reflète un problème de désalignement récemment découvert dans l'optimisation directe des préférences (DPO), attribué à l'influence des gradients négatifs. Nous proposons une analyse théorique de la dynamique d'apprentissage de GRPO, identifiant la source du LLD comme étant la pénalisation naïve de tous les jetons des réponses incorrectes avec la même intensité. Pour y remédier, nous avons développé une méthode appelée NTHR, qui réduit les pénalités appliquées aux jetons contribuant au LLD. Contrairement aux approches DPO précédentes, NTHR tire parti de la structure de groupe de GRPO, utilisant les bonnes réponses comme points d'ancrage pour identifier les jetons influents. Des expériences sur des bancs d'essai de raisonnement mathématique démontrent que NTHR atténue efficacement LLD, ce qui permet d'obtenir des gains de performance constants sur des modèles allant de 0,5 milliard à 3 milliards de paramètres.
Sur la robustesse de la confiance verbale des LLM dans les attaques adverses
Stephen Obadinma, Xiaodan Zhu (membre du corps professoral de Vector)
Abstrait
La robustesse du niveau de confiance verbale généré par les grands modèles de langage (GML) est cruciale pour leur déploiement, afin d'assurer la transparence, la confiance et la sécurité des interactions homme-IA dans de nombreuses applications critiques. Cet article présente la première étude exhaustive sur la robustesse du niveau de confiance verbale face aux attaques adverses. Nous introduisons un nouveau cadre d'attaque des scores de confiance verbale par des méthodes de perturbation et de jailbreak, et montrons que ces attaques peuvent compromettre significativement les estimations de confiance verbale et entraîner de fréquentes modifications des réponses. Nous examinons diverses stratégies d'incitation, tailles de modèles et domaines d'application, révélant la vulnérabilité des méthodes actuelles d'évaluation de la confiance et l'inefficacité, voire la contre-productivité, des techniques de défense couramment utilisées. Nos résultats soulignent l'urgence de concevoir des mécanismes plus robustes pour l'expression de la confiance dans les GML, car même des modifications subtiles préservant la sémantique peuvent induire des réponses erronées.
En bref : une étude exhaustive de la confiance verbale dans les modèles de langage à long terme (LLM), de sa robustesse générale et de son utilisation comme objectif pour les attaques adverses.
Sur la traçabilité dans l'optimisation convexe stochastique ℓp
Article vedette
Sasha Voitovych, Mahdi Haghifam, Idan Attias, Gintare Karolina Dziugaite, Roi Livni, Dan Roy (membre du corps professoral de Vector)
Abstrait
Dans cet article, nous étudions la nécessité de la traçabilité pour un apprentissage précis en optimisation convexe stochastique (OCS) sous des géométries $\ell_p$. De manière informelle, on dit qu'un algorithme d'apprentissage est $m$-traçable$ si, en analysant sa sortie, il est possible d'identifier au moins $m$ de ses exemples d'entraînement. Nos principaux résultats révèlent un compromis fondamental entre la traçabilité et le risque excessif en OCS. Pour tout $p\in [1,\infty)$, nous établissons l'existence d'un seuil de risque excessif en dessous duquel tout algorithme efficace en termes d'échantillons est traçable avec un nombre d'échantillons qui est une fraction constante de son échantillon d'entraînement. Pour $p\in [1,2]$, ce seuil coïncide avec le risque excessif minimal des algorithmes différentiellement privés (DP), c'est-à-dire qu'au-dessus de ce seuil, il existe des algorithmes non traçables, ce qui correspond à une transition de phase abrupte. Pour $p \in (2,\infty)$, ce seuil fournit de nouvelles bornes inférieures pour l'apprentissage par programmation dynamique, résolvant partiellement un problème ouvert dans ce contexte. En établissant ces résultats, nous démontrons une variante parcimonieuse du lemme d'empreinte digitale, qui présente un intérêt propre pour la communauté.
En résumé : nous montrons que dans l’optimisation convexe stochastique, tout algorithme atteignant une erreur inférieure à la meilleure possible sous confidentialité différentielle est traçable, le nombre d’échantillons traçables correspondant à la complexité d’échantillonnage statistique de l’apprentissage.
Sélection multiclasses en ligne avec garantie d'équité de groupe
Faraz Zargari, Hossein Jazi, Lyndon Hallett, Bo Sun (affilié à la faculté Vector), Xiaoqi Tan
Abstrait
Nous étudions le problème de sélection multiclasse en ligne avec garanties d'équité de groupe, où des ressources limitées doivent être allouées à des agents arrivant séquentiellement. Nos travaux comblent deux limites majeures de la littérature existante. Premièrement, nous introduisons un nouveau schéma d'arrondi sans perte qui garantit que l'algorithme intégral atteint les mêmes performances attendues que n'importe quelle solution fractionnaire. Deuxièmement, nous traitons explicitement les difficultés posées par les agents appartenant à plusieurs classes. À cette fin, nous développons un algorithme aléatoire basé sur un cadre de relaxation et d'arrondi. L'algorithme calcule d'abord une solution fractionnaire à l'aide d'une approche de réservation de ressources – appelée mécanisme de mise de côté – afin d'assurer l'équité entre les classes. L'étape suivante d'arrondi préserve ces garanties d'équité sans dégrader les performances. De plus, nous proposons une variante enrichie par l'apprentissage machine, qui intègre des prédictions non fiables issues de l'apprentissage automatique afin de mieux équilibrer l'équité et l'efficacité dans des contextes pratiques.
OpenCUA : Fondements ouverts pour les agents informatiques
Article vedette
Xinyuan Wang, Bowen Wang, Dunjie Lu, Junlin Yang, Tianbao Xie, Junli Wang, Jiaqi Deng, Xiaole Guo, Zhennan Shen, Zhuokai Li, Ryan Li, Xiaochuan Li, Junda Chen, Boyuan Zheng, Li Peihang, Fangyu Lei, Chen Wu, Ruisheng Cao, Yeqiao Fu, Dongchan Shin, Martin Shin, Hu Jiarui, Yuyan Wang, Jixuan Chen, Yuxiao Ye, Yiheng Xu, Danyang Zhang, Yipu Wang, Heng Wang, Diyi Yang, Victor Zhong (membre du corps professoral de Vector), Y. Charles, Zhilin Yang, Tao Yu
Abstrait
Les modèles de vision-langage ont démontré des capacités impressionnantes en tant qu'agents d'utilisation de l'ordinateur (AUC), capables d'automatiser diverses tâches informatiques. Malgré leur potentiel commercial croissant, les détails critiques des systèmes AUC les plus performants demeurent confidentiels et propriétaires. Ces agents étant appelés à intervenir de plus en plus dans les interactions numériques et à prendre des décisions importantes en notre nom, la communauté de recherche a besoin d'accéder à des cadres AUC véritablement ouverts pour étudier leurs capacités, leurs limites et les risques associés. Afin de combler cette lacune, nous proposons AgentNet, un cadre open source complet pour la mise à l'échelle des données et des modèles de base des AUC. Notre cadre comprend : (1) une infrastructure d'annotation qui capture de manière transparente les démonstrations d'utilisation humaine de l'ordinateur ; (2) l'ensemble de données AgentNet, un ensemble de 27 000 échantillons de données d'utilisation de l'ordinateur couvrant divers systèmes d'exploitation, applications et sites Web ; (3) un pipeline qui discrétise les actions continues en paires état-action et synthétise un raisonnement réflexif à long terme ; (4) une méthode d'entraînement pour la modélisation AUC à grande échelle ; et (5) AgentNetBench, un banc d'essai hors ligne multidimensionnel pour une évaluation plus rapide des AUC. Notre modèle AgentNet-7B, optimisé sur le jeu de données AgentNet, affiche d'excellentes performances sur plusieurs benchmarks CUA, avec un taux de réussite de 20,1 % sur OSWorld et de 21,1 % sur WindowsAgentArena. Notre méthode d'entraînement, notamment ses mécanismes de raisonnement avancés et son mélange stratégique de données, assure une montée en puissance robuste malgré l'augmentation de la taille des données. Une analyse plus poussée de nos modèles démontre également une forte généralisation inter-domaines et une montée en puissance des performances avec la puissance de calcul lors des tests. Nous publierons l'outil d'annotation, les ensembles de données, le code et les modèles afin de jeter les bases d'une recherche ouverte et fructueuse en CUA.
Paper2Poster : Évaluation comparative de la génération d’affiches multimodales à partir d’articles à contexte long
Wei Pang, Kevin Qinghong Lin, Xiangru Jian, Xi He (membre du corps professoral de Vector), Philip Torr
Abstrait
La génération d'affiches académiques est une tâche cruciale mais complexe de la communication scientifique, nécessitant la compression de longs documents intercalés en une seule page visuellement cohérente. Pour relever ce défi, nous présentons Paper2Poster, le premier ensemble de tests et de métriques pour la génération d'affiches, qui associe des articles de conférence récents à des affiches conçues par leurs auteurs et évalue les résultats selon quatre critères : (i) la qualité visuelle (alignement sémantique avec les affiches réalisées par des humains), (ii) la cohérence textuelle (fluidité du langage), (iii) l'évaluation holistique (six critères esthétiques et informationnels précis évalués par un assistant visuel), et notamment (iv) PaperQuiz (capacité de l'affiche à transmettre le contenu essentiel de l'article, mesuré par les assistants visuels répondant à des questionnaires générés). À partir de ce test, nous proposons PosterAgent, un pipeline multi-agents descendant avec analyse visuelle intégrée : (a) l'analyseur syntaxique extrait l'article et le transforme en une bibliothèque de ressources structurée ; Le module (b) Planificateur aligne les paires texte-visuel dans une structure arborescente binaire qui préserve l'ordre de lecture et l'équilibre spatial ; et la boucle (c) Peintre-Commentateur affine chaque panneau en exécutant du code de rendu et en utilisant la rétroaction du VLM pour éliminer les débordements et garantir l'alignement. Notre évaluation complète révèle que les productions de GPT-4o, bien qu'attrayantes visuellement au premier abord, présentent souvent un texte bruité et de faibles scores à PaperQuiz. Nous constatons que l'engagement du lecteur constitue le principal obstacle esthétique, car les affiches conçues par des humains reposent en grande partie sur la sémantique visuelle pour transmettre le sens. Notre pipeline Paper2Poster, entièrement open source, surpasse les systèmes basés sur GPT-4o sur presque tous les indicateurs, tout en consommant 87 % de jetons en moins. Ces résultats ouvrent des perspectives claires pour la prochaine génération de modèles de génération d'affiches entièrement automatisés.
Pixel Reasoner : Inciter au raisonnement dans l’espace des pixels par l’apprentissage par renforcement
Alex Su, Haozhe Wang, Weiming Ren, Fangzhen Lin, Wenhu Chen (membre du corps professoral de Vector)
Abstrait
Le raisonnement par chaîne de pensée a considérablement amélioré les performances des modèles de langage étendu (LLM) dans divers domaines. Cependant, ce processus de raisonnement s'est jusqu'à présent limité à l'espace textuel, restreignant son efficacité pour les tâches visuellement exigeantes. Pour pallier cette limite, nous introduisons le concept de raisonnement dans l'espace pixel. Dans ce nouveau cadre, les modèles de vision-langage (VLM) sont dotés d'une suite d'opérations de raisonnement visuel, comme le zoom et la sélection d'images. Ces opérations permettent aux VLM d'inspecter, d'interroger et d'inférer directement à partir d'éléments visuels, améliorant ainsi la fidélité du raisonnement pour les tâches visuelles. Développer de telles capacités de raisonnement dans l'espace pixel au sein des VLM présente des défis importants, notamment le déséquilibre initial des compétences du modèle et sa réticence à adopter les nouvelles opérations dans l'espace pixel. Nous relevons ces défis grâce à une approche d'entraînement en deux phases. La première phase consiste à ajuster les instructions sur des traces de raisonnement synthétisées afin de familiariser le modèle avec les nouvelles opérations visuelles. Dans un deuxième temps, une phase d'apprentissage par renforcement (RL) exploite un système de récompense basé sur la curiosité afin d'équilibrer l'exploration entre le raisonnement dans l'espace des pixels et le raisonnement textuel. Grâce à ces opérations visuelles, les modèles de raisonnement visuel (VLM) peuvent interagir avec des entrées visuelles complexes, telles que des images ou des vidéos riches en informations, pour recueillir proactivement les informations nécessaires. Nous démontrons que cette approche améliore considérablement les performances des VLM sur divers bancs d'essai de raisonnement visuel. Notre modèle 7B, Pixel-Reasoner, atteint 84 % sur le banc d'essai V*, 74 % sur TallyQA-Complex et 84 % sur InfographicsVQA, ce qui représente la meilleure précision jamais obtenue par un modèle open source. Ces résultats soulignent l'importance du raisonnement dans l'espace des pixels et l'efficacité de notre cadre de travail.
En bref : nous présentons un nouveau paradigme de raisonnement : le raisonnement dans l’espace des pixels. Nous avons identifié le piège de l’apprentissage lors du développement de cette capacité et proposé une approche d’apprentissage par renforcement axée sur la curiosité pour le surmonter.
Sélection d'hypothèses localement privées et efficaces en termes de requêtes via le graphique de Scheffé
Gautam Kamath (membre du corps professoral de Vector), Alireza F. Pour, Matthew Regehr, David Woodruff
Abstrait
Nous proposons un algorithme à complexité de requêtes améliorée pour le problème de sélection d'hypothèses sous contraintes de confidentialité différentielle locale. Étant donné un ensemble de $k$ distributions de probabilité $Q$, nous décrivons un algorithme qui satisfait la confidentialité différentielle locale, effectue $\tilde{O}(k^{3/2})$ requêtes non adaptatives auprès d'individus possédant chacun des échantillons issus d'une distribution de probabilité $p$, et fournit en sortie la distribution de probabilité de l'ensemble $Q$ la plus proche de $p$. Les algorithmes précédents nécessitaient soit $\Omega(k^2)$ requêtes, soit de nombreuses itérations de requêtes interactives. Techniquement, on introduit un nouvel objet, le graphe de Scheffé, qui capture la structure des différences entre les distributions de $Q$ et pourrait présenter un intérêt plus large pour les tâches de sélection d'hypothèses.
Reconstruction de biomolécules hétérogènes par mélanges gaussiens hiérarchiques et découverte de parties
Shayan Shekarforoush, David Lindell (membre du corps professoral affilié de Vector), Marcus Brubaker (membre du corps professoral de Vector), David Fleet (membre du corps professoral de Vector)
Abstrait
La cryomicroscopie électronique (cryo-ME) représente une avancée majeure en biologie moléculaire. Elle utilise des méthodes de calcul pour déduire la structure moléculaire 3D à résolution atomique à partir d'images 2D extrêmement bruitées obtenues par microscopie électronique. La modélisation de la structure des particules imagées, présentant une flexibilité conformationnelle et une variation de composition non rigides, avec parfois des parties manquantes, est un enjeu de recherche important. Nous présentons un nouveau cadre de reconstruction 3D basé sur un modèle de mélange gaussien hiérarchique, inspiré en partie par la méthode de projection gaussienne (Gaussian Splatting) pour la reconstruction de scènes 4D. Ce modèle repose sur une étape initiale de segmentation de la particule, fournissant un biais inductif essentiel pour tenir compte de la variabilité conformationnelle et compositionnelle. Ce cadre, appelé CryoSPIRE, révèle des structures biologiquement pertinentes sur des ensembles de données expérimentaux complexes et établit une nouvelle référence sur CryoBench, un banc d'essai pour les méthodes d'analyse de l'hétérogénéité en cryo-ME.
En bref : nous présentons un modèle de densité hiérarchique basé sur un GMM prenant en compte les parties pour aborder la reconstruction hétérogène en cryo-EM.
Réduction de la probabilité de résultats erronés dans les modèles linguistiques grâce à l'inférence probabiliste
Stephen Zhao, Aidan Li, Rob Brekelmans, Roger Grosse (membre du corps professoral de Vector)
Abstrait
Pour éviter les sorties indésirables des modèles de langage (ML), de nombreuses approches d'alignement existent (par exemple, RLHF, DPO). Idéalement, on voudrait que notre ML n'ait aucune probabilité de produire des sorties indésirables. L'apprentissage par renforcement (RA) standard permettrait d'atteindre cet objectif de manière optimale (sans régularisation). Cependant, en pratique, un compromis peut exister entre les méthodes axées sur la récompense espérée (RA standard) et celles visant explicitement à réduire la probabilité de sorties indésirables. Notre objectif est d'améliorer ce compromis, en minimisant la probabilité de sorties indésirables tout en préservant les performances en termes de récompense espérée. Pour ce faire, nous introduisons RePULSe, une nouvelle méthode d'entraînement qui complète la perte AR standard par une perte supplémentaire utilisant des propositions apprises pour guider l'échantillonnage des sorties à faible récompense, puis réduit la probabilité de ces sorties. Nous menons des expériences pour tester si notre méthode offre une meilleure réduction de la probabilité de sorties indésirables et une meilleure robustesse face aux attaques adverses, avec un coût minimal pour la récompense espérée, comparativement aux approches d'alignement AR standard et à d'autres alternatives.
Une stratégie d'enchères basée sur l'apprentissage par renforcement pour les consommateurs de données dans l'apprentissage fédéré basé sur les enchères
Xiaoli Tang, Han Yu, Xiaoxiao Li (membre du corps professoral de Vector)
Abstrait
L'apprentissage fédéré basé sur les enchères (AFL) favorise la collaboration entre les consommateurs de données (CD) et les propriétaires de données (PD). Un défi majeur de l'AFL réside dans la manière dont les CD sélectionnent les PD et soumettent des offres. Les méthodes existantes sont généralement statiques, ce qui les rend inadaptées aux marchés dynamiques de l'AFL. Pour remédier à ce problème, nous proposons la stratégie d'enchères basée sur l'apprentissage par renforcement pour les CD dans l'apprentissage fédéré basé sur les enchères (RLB-AFL). Nous intégrons les états historiques dans un réseau neuronal profond Q (Deep Q-Network) afin de saisir les informations séquentielles essentielles aux décisions d'enchères. Pour atténuer la rareté de l'espace d'états, où certains états se répètent rarement pour chaque CD lors des enchères, nous intégrons le modèle de mélange gaussien à RLB-AFL. Cela facilite le regroupement souple des états séquentiels, réduisant ainsi la dimensionnalité de l'espace d'états et simplifiant l'exploration et l'approximation de la fonction de valeur d'action. De plus, nous améliorons la politique $\epsilon$-greedy pour aider l'agent RLB-AFL à équilibrer exploitation et exploration, ce qui lui permet d'être plus adaptable dans le processus décisionnel AFL. De nombreuses expériences menées sur six ensembles de données de référence largement utilisés démontrent que RLB-AFL surpasse huit approches de pointe. Il surpasse la meilleure approche de référence de 10,56 % et de 3,15 % en termes d'utilité totale moyenne.
Détection fiable des défaillances de modèles lors du déploiement sans étiquettes
Viet Nguyen, Changjian Shui, Vijay Giri, Siddharth Arya, Amol Verma (membre affilié de la faculté Vector), Fahad Razak (membre affilié de la faculté Vector), Rahul Krishnan (membre de la faculté Vector)
Abstrait
La distribution des données évolue au fil du temps ; les modèles fonctionnant dans des environnements dynamiques nécessitent un réentraînement. Cependant, déterminer le moment opportun pour ce réentraînement, sans accès aux étiquettes, représente un défi majeur, car certaines modifications, mais pas toutes, dégradent la performance du modèle. Cet article formalise et aborde le problème de la surveillance de la détérioration post-déploiement (PDD). Nous proposons D3M, un algorithme de surveillance pratique et efficace basé sur la divergence des modèles prédictifs. D3M atteint de faibles taux de faux positifs en l'absence de dégradation et fournit des bornes de complexité d'échantillonnage pour des taux de vrais positifs élevés en cas de dégradation. Les résultats empiriques obtenus sur un ensemble de données de référence standard et sur un vaste ensemble de données réelles de médecine interne démontrent l'efficacité de notre approche et soulignent sa pertinence en tant que mécanisme d'alerte pour les pipelines d'apprentissage automatique critiques.
En bref : D-PDDM surveille de manière prouvée la détérioration du modèle sans nécessiter de données d’entraînement lors du déploiement, et fonctionne bien sur des ensembles de données réels.
ReservoirTTA : Adaptation prolongée de la durée des tests pour les domaines évolutifs et récurrents
Guillaume Vray, Devavrat Tomar, Xufeng Gao, Jean-Philippe Thiran, Evan Shelhamer (membre du corps professoral de Vector), Behzad Bozorgtabar
Abstrait
Cet article présente **ReservoirTTA**, un nouveau cadre modulaire conçu pour l'adaptation prolongée en temps réel (TTA) dans les scénarios où le domaine de test évolue continuellement, y compris dans les cas de domaines récurrents ou évolutifs. ReservoirTTA repose sur un réservoir de modèles spécialisés par domaine – un ensemble de modèles adaptatifs en temps réel – qui détecte les nouveaux domaines par un regroupement en ligne basé sur les caractéristiques stylistiques des échantillons entrants et achemine chaque échantillon vers le modèle spécialisé approprié, permettant ainsi une adaptation spécifique au domaine. Cette stratégie multimodèles surmonte les principales limites de l'adaptation par modèle unique, telles que l'oubli catastrophique, les interférences interdomaines et l'accumulation d'erreurs, garantissant des performances robustes et stables sur des distributions d'essais non stationnaires. Notre analyse théorique révèle les composantes clés qui limitent la variance des paramètres et empêchent l'effondrement du modèle, tandis que notre module TTA modulaire atténue l'oubli catastrophique des domaines déjà rencontrés. Des expériences approfondies sur les ensembles de données de référence pour la classification corrompue, notamment ImageNet-C et CIFAR-10/100-C, ainsi que sur la tâche de segmentation sémantique Cityscapes→ACDC, couvrant des changements de domaine récurrents et continus, démontrent que ReservoirTTA améliore significativement la précision d'adaptation et maintient des performances stables malgré des changements prolongés et récurrents, surpassant ainsi les méthodes de pointe. Le code sera publié après acceptation.
En bref : ReservoirTTA étend l’adaptation en temps d’essai à l’adaptation de plusieurs modèles grâce à un réservoir complet de modèles spécialisés dans le domaine, permettant une adaptation robuste, prolongée et à long terme.
RETRO SYNFLOW : Appariement de flux discret pour une rétrosynthèse en une seule étape précise et diversifiée
Robin Yadav, Qi Yan, Guy Wolf, Joey Bose, Renjie Liao (membre du corps professoral de Vector)
Abstrait
Un défi fondamental en chimie organique consiste à identifier et prédire la séquence de réactions permettant de synthétiser une molécule cible. En raison de la nature combinatoire de l'espace de recherche chimique, la prédiction des réactifs en une seule étape – c'est-à-dire la rétrosynthèse en une seule étape – demeure complexe, même pour les méthodes génératives sans matrice les plus performantes. Ces modèles ont souvent du mal à produire un ensemble précis et diversifié de réactions possibles, de manière chimiquement rationnelle. Dans cet article, nous proposons RETRO SYNFLOW (RSF), un cadre de correspondance de flux discret qui modélise la rétrosynthèse en une seule étape comme un pont de Markov entre une molécule produit donnée et ses réactifs correspondants. Contrairement aux approches précédentes, RSF introduit une étape d'identification des centres réactionnels afin d'extraire les structures intermédiaires, ou synthons, qui constituent une distribution de sources plus informative et structurée pour le modèle de flux discret. Pour améliorer davantage la diversité et la faisabilité chimique des échantillons générés, RSF intègre un pilotage de Feynman-Kac (FK) avec un rééchantillonnage par Monte Carlo séquentiel (SMC) lors de l'inférence. Cette approche exploite un oracle de récompense de synthèse directe appris afin d'orienter le processus de génération vers des réactifs candidats plus prometteurs. Empiriquement, RSF surpasse largement les méthodes de pointe précédentes en termes de précision top-1. De plus, le pilotage par FK améliore significativement la précision aller-retour, démontrant une validité chimique et une faisabilité synthétique accrues, tout en conservant des performances top-k compétitives. Ces résultats font de RSF une nouvelle approche de référence pour la prédiction de rétrosynthèse en une seule étape.
Réglage fin fédéré robuste des LLM via l'optimisation alternée de LoRA
Shuangyi Chen, Yuanxin Guo, Yue Ju, Hardik Dalal, Zhongwen Zhu, Ashish Khisti (affilié à la faculté Vector)
Abstrait
Les méthodes d'ajustement fin à paramètres optimisés (PEFT), telles que l'adaptation à bas rang (LoRA), optimisent l'apprentissage fédéré en réduisant les coûts de calcul et de communication. Nous proposons RoLoRA, un cadre fédéré utilisant une optimisation alternée pour l'ajustement fin des adaptateurs LoRA. Notre approche met l'accent sur l'importance de l'apprentissage des matrices de projection ascendante et descendante afin d'améliorer l'expressivité et la robustesse. Nous utilisons une analyse théorique et des expériences approfondies pour démontrer les avantages de RoLoRA par rapport aux approches précédentes qui génèrent des mises à jour de modèle imparfaites ou limitent l'expressivité du modèle. Nous fournissons une analyse théorique sur un modèle linéaire pour souligner l'importance de l'apprentissage des matrices de projection ascendante et descendante dans LoRA. Nous validons ces résultats sur un modèle non linéaire et fournissons séparément une preuve de convergence sous des conditions générales. Afin de faire le lien entre la théorie et la pratique, nous avons mené des évaluations expérimentales approfondies sur des modèles de langage, notamment RoBERTa-Large et Llama-2-7B, sur diverses tâches et dans différents contextes de langage naturel, afin de démontrer les avantages de RoLoRA par rapport aux autres méthodes.
En résumé : RoLoRA améliore l’optimisation alternée fédérée de LoRA, renforçant ainsi son expressivité et sa robustesse. Il réduit de moitié les coûts de communication et surpasse les solutions alternatives.
SAFE : Détection des défaillances multitâches pour les modèles vision-langage-action
Qiao Gu, Yuanliang Ju, Shengxiang Sun, Igor Gilitschenski (membre du corps professoral de Vector), Haruki Nishimura, Masha Itkina, Florian Shkurti (membre du corps professoral de Vector)
Abstrait
Bien que les modèles vision-langage-action (VLA) aient démontré des comportements robotiques prometteurs pour diverses tâches de manipulation, leur taux de réussite reste limité lorsqu'ils sont déployés sans préparation sur des tâches inédites. Afin de permettre à ces politiques d'interagir en toute sécurité avec leur environnement, un détecteur de défaillances est nécessaire afin d'alerter le robot en temps opportun et lui permettre de s'arrêter, de revenir en arrière ou de demander de l'aide. Or, les détecteurs de défaillances existants sont entraînés et testés uniquement sur une ou quelques tâches spécifiques, alors que les VLA requièrent un détecteur capable de généraliser et de détecter les défaillances également dans des tâches inédites et des environnements nouveaux. Dans cet article, nous introduisons le problème de la détection de défaillances multitâches et proposons SAFE, un détecteur de défaillances pour les politiques robotiques généralistes telles que les VLA. Nous analysons l'espace des caractéristiques des VLA et constatons que ces modèles possèdent une connaissance de haut niveau suffisante sur la réussite et l'échec des tâches, connaissances génériques pour différentes tâches. Forts de cette observation, nous concevons SAFE pour apprendre des caractéristiques internes des VLA et prédire une valeur scalaire unique indiquant la probabilité d'échec d'une tâche. SAFE est entraîné sur des déploiements réussis et échoués, puis évalué sur des tâches inédites. SAFE est compatible avec différentes architectures de politiques. Nous l'avons testé en profondeur sur OpenVLA, π₀ et π₀-FAST dans des environnements simulés et réels. Nous comparons SAFE à diverses solutions de référence et démontrons qu'il atteint des performances de détection de défaillances de pointe et offre le meilleur compromis entre précision et temps de détection grâce à la prédiction conforme.
Simulation d'examens oraux pour évaluer le raisonnement clinique dans de grands modèles de langage
Christopher Chiu, Silviu Pitis (boursier postdoctoral en sécurité de l'IA du CIFAR), Mihaela van der Schaar
Abstrait
Le raisonnement clinique en médecine est un processus hypothético-déductif où les médecins affinent leurs diagnostics à partir d'informations limitées grâce à un interrogatoire ciblé, un examen physique et des investigations complémentaires. À l'inverse, les benchmarks médicaux actuels pour les grands modèles de langage (GML) évaluent principalement la restitution des connaissances par le biais de questions à réponse unique, où l'information clinique complète est fournie d'emblée. Pour combler cette lacune, nous présentons VivaBench, un benchmark à réponses multiples qui évalue le raisonnement clinique séquentiel des agents GML. Notre ensemble de données comprend 1 762 vignettes cliniques élaborées par des médecins et structurées sous forme de scénarios interactifs simulant un examen oral en formation médicale. Ces scénarios exigent des agents qu'ils recherchent activement les éléments pertinents, sélectionnent les investigations appropriées et synthétisent les informations à travers plusieurs étapes pour parvenir à un diagnostic. Si les GML actuels démontrent leur capacité à diagnostiquer des pathologies à partir de présentations cliniques bien décrites, leurs performances se dégradent considérablement lorsqu'ils doivent mener un raisonnement diagnostique itératif en situation d'incertitude, comme le montre notre évaluation. Notre analyse a identifié plusieurs modes de défaillance qui reflètent des erreurs cognitives courantes en pratique clinique, notamment : (1) la fixation sur les hypothèses initiales, (2) la prescription d’examens complémentaires inappropriés, (3) la conclusion prématurée du diagnostic et (4) le défaut de dépistage des affections critiques. Ces schémas révèlent des limites fondamentales dans la manière dont les modèles de langage actuels raisonnent et prennent des décisions en situation d’incertitude. Grâce à VivaBench, nous proposons un référentiel standardisé pour l’évaluation des systèmes d’IA médicale conversationnelle destinés à l’aide à la décision clinique en situation réelle. Au-delà des applications médicales, nous contribuons au corpus plus vaste de la recherche sur l’IA agentielle en démontrant comment les trajectoires de raisonnement séquentiel peuvent diverger dans des environnements décisionnels complexes.
En bref : Nous présentons VivaBench, un banc d’essai extensible qui simule des conversations médicales à plusieurs tours de parole. Nous démontrons que les agents LLM possèdent des connaissances cliniques, mais que leur capacité à recueillir des informations et à établir un diagnostic à partir de présentations incomplètes est limitée.
Résolution du transport optimal discret (semi-)déséquilibré avec mécanisme de transformation équivalent et régularisation par multiplicateur KKT
Weiming Liu, Xinting Liao (boursier postdoctoral distingué Vector), Jun Dan, Fan Wang, Hua Yu, Junhao Dong, Shunjie Dong, Lianyong Qi, Yew Soon Ong
Abstrait
Le problème de transport optimal semi-déséquilibré (SemiUOT) est très prometteur pour la mise en correspondance de deux mesures de probabilité en relâchant l'une des contraintes marginales. Les solveurs existants intègrent souvent un terme de régularisation d'entropie, ce qui peut mener à des solutions de correspondance imprécises. Pour remédier à ce problème, nous nous concentrons sur la détermination de la distribution de probabilité marginale du SemiUOT avec divergence de Kullback-Leibler (KL) à l'aide de l'approche proposée par le mécanisme de transformation équivalente (ETM). De plus, on étend la méthode basée sur l'ETM afin d'exploiter la distribution de probabilité marginale du transport optimal déséquilibré (UOT) avec divergence KL pour valider sa généralisation. Une fois les probabilités marginales de l'UOT/SemiUOT déterminées, elles peuvent être transformées en un problème de transport optimal (OT) classique. De plus, nous proposons un terme de régularisation par multiplicateur de Karush-Kuhn-Tucker (KKT) combiné au transport optimal régularisé par multiplicateur (MROT) pour obtenir des résultats de correspondance plus précis. Nous menons plusieurs expériences numériques pour démontrer l'efficacité de nos méthodes proposées pour la résolution des problèmes UOT/SemiUOT.
En résumé : nous proposons un mécanisme de transformation équivalente avec régularisation par multiplicateur KKT pour résoudre les problèmes SemiUOT et UOT.
STITCH-OPE : Assemblage de trajectoires avec diffusion guidée pour l’évaluation hors stratégie
Article vedette
Hossein Goli, Michael Gimelfarb, Nathan de Lara, Haruki Nishimura, Masha Itkina, Florian Shkurti (membre du corps professoral de Vector)
Abstrait
L'évaluation hors stratégie (OPE) estime le rendement d'une stratégie cible à partir de données hors ligne recueillies au moyen d'une stratégie comportementale. Elle est cruciale dans des domaines tels que la robotique ou la santé, où l'interaction directe avec l'environnement est coûteuse ou dangereuse. Les méthodes OPE existantes sont inefficaces pour les problèmes de grande dimension et à long terme, en raison de l'explosion exponentielle de la variance due à la pondération de l'importance ou à l'accumulation d'erreurs provenant des modèles dynamiques appris. Pour relever ces défis, nous proposons STITCH-OPE, un cadre génératif basé sur un modèle qui exploite la diffusion de débruitage pour l'OPE à long terme dans des espaces d'états et d'actions de grande dimension. À partir d'un modèle de diffusion préentraîné sur les données comportementales, STITCH-OPE génère des trajectoires synthétiques à partir de la stratégie cible en guidant le processus de débruitage à l'aide de la fonction de score de cette stratégie. STITCH-OPE propose deux innovations techniques qui le rendent avantageux pour l'OPE : (1) il empêche la surrégularisation en soustrayant le score de la stratégie comportementale lors du guidage, et (2) il génère des trajectoires à long terme en assemblant bout à bout des trajectoires partielles. Nous fournissons une garantie théorique que, sous des hypothèses peu restrictives, ces modifications entraînent une réduction exponentielle de la variance par rapport à la diffusion de trajectoires à long terme. Les expériences menées sur les ensembles de données D4RL et OpenAI Gym montrent une amélioration substantielle de l'erreur quadratique moyenne, de la corrélation et du regret par rapport aux méthodes OPE de pointe.
En bref : nous présentons STITCH-OPE, un cadre de diffusion guidée pour l’évaluation hors stratégie qui assemble de courtes sous-trajectoires conditionnées par le comportement, utilise un guidage par comportement négatif pour corriger le décalage de distribution et surpasse les références sur tous les indicateurs.
Conseils sur la perturbation des jetons pour les modèles de diffusion
Javad Rajabi, Soroush Mehraban, Seyedmorteza Sadat, Babak Taati (affilié à la faculté Vector)
Abstrait
Le guidage sans classificateur (CFG) est devenu un élément essentiel des modèles de diffusion modernes pour améliorer la qualité de la génération et son alignement avec les conditions d'entrée. Cependant, le CFG requiert des procédures d'apprentissage spécifiques et se limite à la génération conditionnelle. Pour pallier ces limites, nous proposons le guidage par perturbation de jetons (TPG), une méthode novatrice qui applique des matrices de perturbation directement aux représentations intermédiaires des jetons au sein du réseau de diffusion. Le TPG utilise une opération de brassage préservant la norme pour fournir des signaux de guidage efficaces et stables, améliorant ainsi la qualité de la génération sans modification architecturale. Par conséquent, le TPG ne nécessite aucun apprentissage et est indépendant des conditions d'entrée, ce qui le rend facilement applicable à la génération conditionnelle et inconditionnelle. Nous analysons également le terme de guidage fourni par le TPG et montrons que son effet sur l'échantillonnage est plus proche de celui du CFG que celui des techniques de guidage sans apprentissage existantes. Nous évaluons le TPG de manière approfondie sur SDXL et Stable Diffusion 2.1, démontrant une amélioration de près de 2 fois du FID pour la génération inconditionnelle par rapport à la référence SDXL et montrant que le TPG correspond étroitement au CFG en termes d'alignement rapide. Ainsi, le TPG représente une méthode de guidage générale et indépendante des conditions qui étend les avantages de type CFG à une classe plus large de modèles de diffusion.
TLDR : Le jeton Perturbation Guidance (TPG) est un nouveau cadre qui applique des perturbations directement dans l’espace des jetons pour guider le processus d’échantillonnage par diffusion.
Track, Inpaint, Resplat : Génération 3D et 4D axée sur le sujet avec remplissage progressif de textures
Shuhong Zheng, Ashkan Mirzaei, Igor Gilitschenski (membre du corps professoral de Vector)
Abstrait
Les méthodes actuelles de génération 3D/4D sont généralement optimisées pour le photoréalisme, l'efficacité et l'esthétique. Cependant, elles ont souvent du mal à préserver l'identité sémantique du sujet selon les différents points de vue. L'adaptation des méthodes de génération à une ou quelques images d'un sujet spécifique (également appelée personnalisation ou génération pilotée par le sujet) permet de générer du contenu visuel en accord avec l'identité du sujet. Toutefois, la génération 3D/4D personnalisée demeure encore largement inexplorée. Dans ce travail, nous présentons TIRE (Track, Inpaint, REsplat), une nouvelle méthode de génération 3D/4D pilotée par le sujet. Elle prend en entrée une ressource 3D initiale produite par un modèle génératif 3D existant et utilise le suivi vidéo pour identifier les régions à modifier. Ensuite, nous adoptons un modèle de remplissage 2D piloté par le sujet pour compléter graduellement ces régions. Finalement, on redessine les observations 2D multivues modifiées en 3D tout en préservant leur cohérence. Des expériences approfondies démontrent que notre approche améliore considérablement la préservation de l'identité dans la génération 3D/4D par rapport aux méthodes de pointe.
En bref : nous présentons TIRE, une nouvelle méthode de génération 3D/4D axée sur le sujet qui préserve bien l’identité.
Apprentissage découplé et convergent dans les jeux monotones avec rétroaction de bandit
Jing Dong, Baoxiang Wang, Yaoliang Yu (membre du corps professoral de Vector)
Abstrait
Nous étudions le problème des algorithmes d'apprentissage sans regret pour les jeux monotones et lisses généraux, ainsi que leurs propriétés de convergence à la dernière itération. Plus précisément, nous examinons ce problème en présence de rétroaction de type bandit et de dynamiques fortement découplées, ce qui permet un développement modulaire du système multijoueur applicable à un large éventail d'applications réelles. Nous proposons un algorithme basé sur la descente miroir, qui converge en $O(T^{-1/4})$ et est également sans regret. Ce résultat est obtenu grâce à l'utilisation ciblée de deux régularisations et à l'analyse de leur point fixe. Le taux de convergence est encore amélioré à $O(T^{-1/2})$ dans le cas des jeux fortement monotones. Motivés par des tâches pratiques où le jeu évolue au fil du temps, nous étendons l'algorithme aux jeux monotones variant dans le temps. Nous fournissons le premier résultat non asymptotique pour les jeux monotones convergents et présentons des résultats améliorés pour les jeux de suivi d'équilibre.
Unification de l'équité proportionnelle dans le regroupement centré et non centré
Article vedette
Benjamin Cookson, Nisarg Shah (affilié à la faculté Vector), Ziqi Yu
Abstrait
Les critères d'équité proportionnelle, inspirés des idéaux démocratiques de représentation proportionnelle, suscitent un intérêt croissant dans la littérature sur le clustering. Les travaux antérieurs les ont étudiés selon deux paradigmes distincts. Chen et al. [ICML 2019] étudient le regroupement par centroïde, où la perte de chaque point de données est déterminée par sa distance à un point représentatif (centroïde) choisi dans son cluster. Caragiannis et al. [NeurIPS 2024] étudient le clustering sans centroïde, où la perte de chaque point de données est déterminée par sa distance maximale à tout autre point de données de son cluster. Nous généralisons ces deux paradigmes pour introduire le regroupement semi-centroïde, où la perte de chaque point de données est une combinaison de ses pertes par centroïde et sans centroïde, et nous étudions deux critères d'équité proportionnelle : le critère de base et sa relaxation, la représentation pleinement justifiée (FJR). Notre résultat principal est un nouvel algorithme qui atteint une approximation constante du critère de base, en temps polynomial, même lorsque les métriques de distance utilisées pour les mesures de perte par centroïde et sans centroïde sont différentes. Nous obtenons également des résultats améliorés pour des fonctions de perte plus restreintes et le critère FJR plus faible, et établissons des bornes inférieures dans chaque cas.
En résumé : nous concevons des méthodes de clustering proportionnellement équitables lorsque la fonction de perte de chaque agent est déterminée à la fois par sa distance par rapport aux autres agents de son cluster et par rapport à un agent représentatif de son cluster.
UniRelight : Apprentissage de la décomposition et de la synthèse conjointes pour le rééclairage vidéo
Article vedette
Kai He, Ruofan Liang, Jacob Munkberg, Jon Hasselgren, Nandita Vijaykumar (membre du corps professoral de Vector), Alexander Keller, Sanja Fidler (membre du corps professoral de Vector), Igor Gilitschenski (membre du corps professoral de Vector), Zan Gojcic, Zian Wang
Abstrait
Nous nous intéressons au défi du rééclairage d'une image ou d'une vidéo, une tâche exigeant une compréhension précise des caractéristiques intrinsèques de la scène et une synthèse de haute qualité du transport de la lumière. Les modèles de rééclairage de bout en bout existants sont souvent limités par la rareté des données d'éclairage multiple appariées, ce qui restreint leur capacité à généraliser à diverses scènes. À l'inverse, les pipelines en deux étapes combinant rendu inverse et direct peuvent atténuer les besoins en données, mais sont sujets à l'accumulation d'erreurs et ont souvent du mal à produire des résultats réalistes dans des conditions d'éclairage complexes ou avec des matériaux sophistiqués. Dans ce travail, nous introduisons une approche générique qui estime conjointement l'albédo et synthétise les sorties rééclairées en une seule passe, exploitant les capacités génératives des modèles de diffusion vidéo. Cette formulation conjointe améliore la compréhension implicite de la scène et facilite la création d'effets d'éclairage réalistes et d'interactions complexes entre les matériaux, comme les ombres, les reflets et la transparence. Entraîné sur des données d'éclairage multiple synthétiques et sur de nombreuses vidéos réelles étiquetées automatiquement, notre modèle démontre une forte capacité de généralisation dans divers domaines et surpasse les méthodes précédentes en termes de fidélité visuelle et de cohérence temporelle.
Générateur d'exemples polyvalent, transférable et non réapprenable
Zhihao Li, Jiale Cai, Gezheng Xu, Hao Zheng, Qiuyue Li, Fan Zhou, Shichun Yang, Charles Ling, Boyu Wang (affilié à la faculté Vector)
Abstrait
La croissance rapide des données publiques a stimulé les progrès de l'apprentissage profond, mais soulève également des inquiétudes quant à l'utilisation non autorisée de ces données. Les exemples non apprenables (EN) sont apparus comme une stratégie de protection des données qui introduit des perturbations imperceptibles pour empêcher l'apprentissage non autorisé. Cependant, la plupart des méthodes EN existantes produisent des perturbations fortement liées à des ensembles d'entraînement spécifiques, ce qui entraîne une baisse significative de leur capacité à être non apprenables lorsqu'elles sont appliquées à des données ou des tâches inédites. Dans cet article, nous soutenons que, pour une large applicabilité, les EN doivent conserver leur efficacité dans divers scénarios d'application. À cette fin, nous menons la première étude exhaustive sur la transférabilité des EN dans des contextes variés, pratiques et exigeants. Plus précisément, nous identifions les scénarios clés qui posent des défis importants aux méthodes EN existantes, notamment la diversité des styles, les classes hors distribution, les résolutions et les architectures. De plus, nous proposons $\textbf{Générateur Transférable Versatile}$ (GTP), un générateur transférable conçu pour protéger les données dans diverses conditions. Plus précisément, VTG intègre l'augmentation de domaine adverse dans le processus d'entraînement du générateur afin de synthétiser des exemples hors distribution, améliorant ainsi sa capacité de généralisation à des scénarios inédits. De plus, nous proposons un mécanisme de couplage perturbation-étiquette qui exploite l'apprentissage contrastif pour aligner directement les perturbations sur les étiquettes de classe. Cette approche réduit la dépendance du générateur à la sémantique des données, permettant à VTG de produire des perturbations impossibles à apprendre de manière indépendante de la distribution. De nombreuses expériences démontrent l'efficacité et la large applicabilité de notre approche.
En bref : un générateur de perturbations polyvalent qui permet une désapprentissage dans divers scénarios.
VL-Rethinker : Inciter à l’autoréflexion des modèles vision-langage par l’apprentissage par renforcement
Article vedette
Haozhe Wang, Chao Qu, Zuming Huang, Wei Chu, Fangzhen Lin, Wenhu Chen (membre du corps professoral de Vector)
Abstrait
Récemment, des systèmes à réflexion lente comme GPT-o1 et DeepSeek-R1 ont démontré un fort potentiel pour la résolution de problèmes complexes grâce à une réflexion explicite. Ils surpassent significativement les meilleurs modèles à réflexion rapide, tels que GPT-4o, sur divers benchmarks mathématiques et scientifiques. Cependant, leurs capacités de raisonnement multimodal demeurent comparables à celles des modèles à réflexion rapide. Par exemple, les performances de GPT-o1 sur des benchmarks comme MathVista, MathVerse et MathVision sont semblables à celles des modèles à réflexion rapide. Dans cet article, nous visons à améliorer les capacités de réflexion lente des modèles vision-langage en utilisant l'apprentissage par renforcement (sans recourir à la distillation) afin de faire progresser l'état de l'art. Premièrement, on adapte l'algorithme GRPO avec une nouvelle technique appelée Selective Sample Replay (SSR) pour résoudre le problème de la disparition des avantages. Bien que cette approche offre de bonnes performances, les modèles entraînés par RL résultants présentent une autoréflexion ou une auto-vérification limitée. Pour encourager davantage la réflexion en profondeur, nous introduisons la technique de la « repensée forcée », qui ajoute un jeton déclencheur de repensée à la fin des itérations lors de l'entraînement par renforcement, imposant ainsi explicitement une étape de raisonnement autoréflexif. En combinant ces deux techniques, notre modèle, VL-Rethinker, surpasse les performances de pointe sur MathVista et MathVerse, atteignant respectivement 80,4 % et 63,5 %. VL-Rethinker atteint également l'état de l'art open source sur des benchmarks multidisciplinaires tels que MathVision, MMMU-Pro, EMMA et MEGA-Bench, réduisant l'écart avec OpenAI-o1. Nous menons des analyses et des ablations complètes afin de démontrer l'efficacité de notre approche.
Qu'est-ce qu'il faut pour bâtir un classificateur sélectif performant ?
Stephan Rabanser, Nicolas Papernot (membre du corps professoral de Vector)
Abstrait
Les classificateurs sélectifs améliorent la fiabilité en s'abstenant de traiter les entrées incertaines, mais leurs performances restent souvent inférieures à celles d'un classificateur parfaitement ordonné qui accepte les exemples dans l'ordre exact de leur exactitude. Nous formulons ce déficit comme un écart de classification sélective à couverture uniforme et démontrons la première décomposition sur un échantillon fini qui identifie cinq sources distinctes d'imprécision : le bruit bayésien, l'erreur d'approximation, l'erreur de classement, le bruit statistique et les erreurs d'implémentation ou de décalage. Notre borne montre qu'un étalonnage monotone a posteriori ne peut pas réduire cet écart, car il préserve l'ordre initial des scores ; le combler nécessite donc des mécanismes de notation capables de modifier le classement induit par le modèle de base. Nous validons notre décomposition de l'écart sur des données synthétiques Two-Moons et des benchmarks de vision réels, en isolant chaque composante d'erreur par des expériences contrôlées. Les résultats confirment que (i) le bruit bayésien et la capacité limitée du modèle expliquent à eux seuls les écarts importants, (ii) seuls les calibrateurs non monotones ou prenant en compte les caractéristiques réduisent le terme de classement, et (iii) le décalage de distribution introduit une marge d'erreur distincte qui doit être compensée par un apprentissage robuste. Notre décomposition fournit un budget d'erreur quantitatif et des recommandations concrètes pour la conception de classificateurs sélectifs se rapprochant du comportement idéal d'un oracle.
En résumé : nous décomposons l’écart entre les classificateurs sélectifs et l’oracle idéal en cinq sources mesurables, démontrant que seules les méthodes de notation non monotones peuvent le réduire et améliorer la fiabilité.
Quelle est la valeur de vos données pour GPT ? Évaluation des données à l'échelle LLM avec fonctions d'influence
Sang Keun Choe, Hwijeen Ahn, Juhan Bae, Kewen Zhao, Youngseog Chung, Adithya Pratapa, Willie Neiswanger, Emma Strubell, Teruko Mitamura, Jeff Schneider, Eduard Hovy, Roger Grosse (membre du corps professoral de Vector), Eric Xing
Abstrait
Les grands modèles de langage (GML) sont entraînés sur une quantité considérable de données écrites par des humains, mais les fournisseurs de ces données restent souvent anonymes. Face à ce problème, l'évaluation des données (ou attribution des données), qui quantifie la contribution ou la valeur de chaque donnée à la sortie du modèle, a été envisagée comme une solution potentielle. Cependant, l'application des méthodes d'évaluation des données existantes aux GML récents et à leurs vastes ensembles de données d'entraînement est fortement limitée par des coûts de calcul et de mémoire prohibitifs. Dans ce travail, nous nous concentrons sur les fonctions d'influence, une méthode d'évaluation des données populaire basée sur le gradient, et nous améliorons significativement son évolutivité grâce à une stratégie de projection de gradient efficace appelée LoGra, qui exploite la structure du gradient dans la rétropropagation. Nous proposons ensuite une justification théorique des approches de projection de gradient pour les fonctions d'influence afin de renforcer la confiance dans le processus d'évaluation des données. Enfin, nous facilitons la mise en œuvre des systèmes d'évaluation des données en introduisant LogIX, un logiciel capable de transformer le code d'entraînement existant en code d'évaluation des données avec un minimum d'effort. Dans nos expériences d'évaluation de données, LoGra atteint une précision compétitive par rapport à des références plus coûteuses tout en affichant une amélioration jusqu'à 6 500 fois du débit et une réduction de 5 fois de l'utilisation de la mémoire GPU lorsqu'il est appliqué à Llama3-8B-Instruct et à l'ensemble de données de jetons d'un milliard.
En bref : nous adaptons la méthode d’évaluation des données basée sur la fonction d’influence aux LLM récents et à leurs ensembles de données d’entraînement massifs.
Quand les réseaux de neurones à transformateurs surpassent-ils les réseaux à propagation directe et récurrents ? Une perspective statistique
Alireza Mousavi-Hosseini, Clayton Sanford, Denny Wu, Murat Erdogdu (membre du corps professoral de Vector)
Abstrait
Les travaux théoriques visant à démontrer les avantages des Transformers par rapport aux architectures classiques telles que les réseaux de neurones à propagation directe et récurrents se sont principalement concentrés sur la puissance de représentation. Dans ce travail, nous adoptons une perspective alternative et démontrons que, même avec une puissance de calcul infinie, les réseaux à propagation directe et récurrents peuvent présenter une complexité d'échantillonnage supérieure à celle des Transformers, ces derniers étant capables de s'adapter à une forme de parcimonie dynamique. Plus précisément, nous considérons un modèle de génération de données séquence à séquence sur des séquences de longueur $N$, où la sortie à chaque position dépend uniquement de $q \ll N$ jetons pertinents, et les positions de ces jetons sont décrites dans l'invite d'entrée. Nous prouvons qu'un Transformer monocouche peut apprendre ce modèle si et seulement si son nombre de têtes d'attention est au moins égal à $q$, auquel cas sa complexité d'échantillonnage est quasi indépendante de $N$, tandis que les réseaux récurrents nécessitent $N^{\Omega(1)}$ échantillons pour le même problème. En simplifiant ce modèle, les réseaux récurrents peuvent atteindre une complexité quasi indépendante de $N$, tandis que les réseaux à propagation directe nécessitent toujours $N$ échantillons. Notre modèle proposé de récupération parcimonieuse illustre une hiérarchie naturelle dans la complexité des échantillons à travers ces architectures.
En bref : nous démontrons une séparation purement statistique entre les Transformers et d’autres architectures telles que les réseaux à propagation directe et récurrents, où les Transformers sont plus efficaces en termes d’échantillons pour l’apprentissage de modèles de séquences éparses.