Les chercheurs de Vector font progresser la recherche sur l'apprentissage des représentations et l'apprentissage profond lors de la conférence ICLR 2026.

23 avril 2026

Rechercher

Les chercheurs de Vector ont apporté des contributions significatives à la Conférence internationale sur les représentations d'apprentissage (ICLR) de cette année, le principal lieu mondial pour l'apprentissage des représentations et la recherche sur l'apprentissage profond, qui se déroule du 23 au 27 avril 2026 à Rio de Janeiro, au Brésil.

Le portefeuille de recherche de Vector à ICLR 2026 a démontré le leadership de l'institut dans les domaines clés de l'apprentissage par renforcement et de l'IA. Nos articles acceptés couvrent des avancées fondamentales dans l'apprentissage par renforcement pour le raisonnement avancé, des percées dans l'IA générative et les systèmes multimodaux, des travaux pionniers sur les agents d'IA autonomes, des contributions essentielles à une IA fiable et responsable, ainsi que des applications novatrices dans la recherche scientifique et les soins de santé.

Ces contributions témoignent du travail collaboratif de 60 membres du corps professoral, professeurs affiliés et postdoctorants émérites de Vector, dont 11 articles publiés en collaboration. Les chercheurs de Vector ont également dirigé 6 des 40 ateliers retenus, contribuant ainsi directement à 15 % des discussions les plus pointues de la conférence. Ces contributions soulignent le double engagement de la communauté Vector : faire progresser la recherche fondamentale sur l’apprentissage des représentations par les réseaux neuronaux et développer des systèmes d’IA ayant un impact concret. Nos chercheurs repoussent les limites de l'IA tout en s'assurant que ces progrès profitent à la société.

Vous trouverez ci-dessous la liste complète des 48 articles acceptés, y compris les collaborations, provenant des membres du corps professoral de Vector, des professeurs affiliés à Vector et des boursiers postdoctoraux distingués de Vector.

Peut-on générer des représentations portables pour les données de séries temporelles cliniques à l'aide de LLM ?

Zongliang Ji, Yifei Sun, Andre Amaral, Anna Goldenberg (membre du corps professoral de Vector), Rahul G. Krishnan (membre du corps professoral de Vector)

Abstrait: 

Le déploiement de l'apprentissage automatique clinique est lent et fragile : les modèles performants dans un hôpital se dégradent souvent lors de changements de distribution dans un autre. Dans ce travail, nous étudions une question simple : les grands modèles de langage (LLM) peuvent-ils créer des représentations portables des patients, c'est-à-dire des représentations permettant à un prédicteur dérivé, conçu pour un hôpital, d'être utilisé ailleurs avec un minimum, voire sans aucun, réentraînement ni ajustement ? Pour ce faire, nous transformons des séries temporelles irrégulières de soins intensifs en résumés concis en langage naturel à l'aide d'un LLM figé, puis nous intégrons chaque résumé avec un modèle d'intégration de texte figé afin d'obtenir un vecteur de longueur fixe pouvant servir d'entrée à divers prédicteurs dérivés. Sur trois cohortes (MIMIC-IV, HIRID, PPICU), et sur de multiples tâches de prévision et de classification cliniquement pertinentes, nous constatons que notre approche est simple, facile à utiliser et étonnamment compétitive par rapport aux méthodes traditionnelles avec imputation par grille, à l'apprentissage auto-supervisé de représentations et aux modèles de séries temporelles, tout en présentant des baisses de performance relatives plus faibles lors du transfert vers de nouveaux hôpitaux. Nous étudions l'influence de la conception des incitatifs sur la performance des modèles prédictifs. Les incitations structurées s'avèrent essentielles pour réduire la variance des modèles prédictifs sans altérer leur précision moyenne. Nos résultats montrent que l'utilisation de ces représentations portables améliore l'apprentissage avec peu d'exemples et n'augmente pas la capacité de récupération des données démographiques (âge ou sexe) par rapport aux modèles de référence, ce qui suggère un faible risque supplémentaire pour la confidentialité. Nos travaux mettent en évidence le potentiel des modèles linéaires à longue portée (LLM) comme outils permettant le déploiement à grande échelle de modèles prédictifs de qualité professionnelle en réduisant les coûts d'ingénierie.

En bref : explorer la capacité des modèles linéaires à générer des représentations portatives et transférables pour les séries temporelles des unités de soins intensifs.

ChronoEdit : Vers un raisonnement temporel pour l’édition d’images contextuelles et la simulation du monde

Jay Zhangjie Wu, Xuanchi Ren, Tianchang Shen, Tianshi Cao, Kai He, Yifan Lu, Ruiyuan Gao, Enze Xie, Shiyi Lan, Jose M. Alvarez, Jun Gao, Sanja Fidler (membre du corps professoral vectoriel), Zian Wang, Huan Ling

Abstrait: 

Les progrès récents des grands modèles génératifs ont considérablement amélioré l'édition d'images et la génération d'images contextuelles. Cependant, un problème crucial persiste : la cohérence physique, c'est-à-dire la nécessité pour les objets édités de rester cohérents. Cette capacité est particulièrement essentielle pour les tâches de simulation du monde réel. Dans cet article, nous présentons ChronoEdit, un cadre qui reformule l'édition d'images comme un problème de génération vidéo. Premièrement, ChronoEdit traite les images d'entrée et éditées comme la première et la dernière image d'une vidéo, ce qui lui permet d'exploiter de grands modèles génératifs vidéo pré-entraînés. Ces modèles saisissent non seulement l'apparence des objets, mais aussi la physique implicite du mouvement et de l'interaction grâce à la cohérence temporelle apprise. Deuxièmement, ChronoEdit introduit une étape de raisonnement temporel qui effectue explicitement l'édition lors de l'inférence. Dans ce contexte, l'image cible est débruitée conjointement avec des jetons de raisonnement afin d'imaginer une trajectoire d'édition plausible qui restreint l'espace des solutions aux transformations physiquement viables. Les jetons de raisonnement sont ensuite supprimés après quelques étapes pour éviter le coût de calcul élevé du rendu d'une vidéo complète. Pour valider ChronoEdit, nous introduisons PBench-Edit, un nouveau banc d'essai de paires image-invite pour les contextes qui exigent une cohérence physique, et nous démontrons que ChronoEdit surpasse les références de pointe en termes de fidélité visuelle et de plausibilité physique.

Arène des agents informatiques : vers une évaluation et une analyse centrées sur l’humain des agents d’utilisation de l’ordinateur

Bowen Wang, Xinyuan Wang, Jiaqi Deng, Tianbao Xie, Ryan Li, Yanzhe Zhang, Junli Wang, Dunjie Lu, Zicheng Gong, Gavin Li, Toh Hua, Wei-Lin Chiang, Ion Stoica, Diyi Yang, Yu Su, Yi Zhang, Zhiguo Wang, Victor Zhong (membre du corps professoral de Vector), Tao Yu

Abstrait: 

Avec la prolifération et l'augmentation des capacités des agents d'utilisation d'ordinateurs (AUE), leur évaluation devient plus complexe : les benchmarks statiques et élaborés manuellement sont limités à un domaine spécifique, sujets à la contamination et fortement dépendants de l'environnement. De plus, ils divergent considérablement de l'évaluation en situation réelle, pilotée par l'utilisateur. Nous présentons Computer Agent Arena, une plateforme open source permettant l'évaluation comparative directe des AUE et une méthodologie dynamique qui transforme les préférences humaines en rétroactions structurées dans des environnements réalistes. Le système : (i) simule l'utilisation réelle d'un ordinateur grâce à des initialisations et des personnalisations d'environnements diversifiés, dynamiques et hébergés dans le nuage ; (ii) garantit une comparaison authentique et équitable en reproduisant fidèlement les AUE libres et en s'exécutant anonymement dans des environnements identiques et contrôlés ; et (iii) étend l'évaluation au-delà des préférences et de l'exactitude par paires pour inclure des signaux axés sur les capacités et les comportements. Sur 2 201 votes de haute qualité portant sur 12 agents – couvrant des interactions multi-applications, des instructions ambiguës et des requêtes ouvertes –, nous observons des inversions de classement frappantes par rapport aux benchmarks statiques. Une analyse plus poussée montre que la justesse globale est le principal facteur déterminant la préférence humaine ; au-delà de ce critère, l'interaction agent-humain et l'autocorrection renforcent cette préférence, même lorsque le niveau d'exécution global de la tâche est comparable. Notre analyse des erreurs révèle des erreurs de comportement de l’agent, telles que des problèmes de mémoire à long terme et des défaillances d’actions précises, que les benchmarks statiques ne permettent pas d’évaluer. Nous comparons également les agents à interface graphique pure aux agents numériques universels capables d’utiliser des outils et de programmer, et nous discutons des compromis liés à ces différentes philosophies de conception. Nous fournissons en open source la plateforme complète, l’ensemble des données recueillies et le code de Computer Agent Arena afin de soutenir les recherches futures sur l’évaluation et le développement des agents informatiques universels.

Génération cohérente de texte en image par décontextualisation de la scène

Song Tang, Peihao Gong, Kunyu LI, Kai Guo, Boyu Wang (affilié à la faculté Vector), Mao Ye, Jianwei Dr Zhang, Xiatian Zhu

Résumé : La génération cohérente de texte en image (T2I) vise à produire des images préservant l’identité d’un même sujet dans diverses scènes. Cependant, elle échoue souvent en raison d’un phénomène appelé décalage d’identité (ID). Les méthodes précédentes ont abordé ce problème, mais reposent généralement sur l'hypothèse irréaliste de connaître à l'avance toutes les scènes cibles. Cet article révèle qu'une source majeure de décalage d'identité est la corrélation intrinsèque entre le sujet et le contexte de la scène, appelée contextualisation de la scène, qui apparaît naturellement lorsque les modèles T2I s'entraînent sur une vaste distribution d'images naturelles. Nous démontrons formellement la quasi-universalité de cette corrélation scène-sujet et établissons des bornes théoriques à son intensité. Sur cette base, nous proposons une nouvelle approche d’édition d’inserts de texte, efficace et sans entraînement, appelée Décontextualisation de la Scène (SDeC), qui impose un processus d’inversion de la contextualisation de scène intégrée à T2I. Plus précisément, SDeC identifie et supprime la corrélation latente entre la scène et le sujet au sein de l'élément d'identification en quantifiant la stabilité directionnelle de la décomposition en valeurs singulières (SVD) afin de pondérer de manière adaptative les valeurs propres correspondantes. Point crucial, SDeC permet une utilisation par scène (un élément par scène) sans nécessiter d'accès préalable à toutes les scènes cibles. Il s'agit donc d'une solution très souple et générale, parfaitement adaptée aux applications concrètes où ces connaissances préalables sont souvent indisponibles ou variables dans le temps. Les expériences démontrent que SDeC améliore considérablement la préservation de l'identité tout en maintenant la diversité des scènes.

Critique-Coder : Amélioration des modèles de codeurs par apprentissage par renforcement critique

Chi Ruan, Dongfu Jiang, Yubo Wang, Wenhu Chen (membre du corps professoral de Vector)

Abstrait: 

L'apprentissage par renforcement (RL) s'est imposé comme un paradigme d'entraînement populaire, surtout lorsqu'il est associé à des modèles de raisonnement. Bien qu'efficace, il se concentre principalement sur la génération de réponses et manque de mécanismes pour encourager explicitement la critique ou la réflexion. Plusieurs études récentes, telles que Critique-Fine-Tuning (CFT) et Critique-Guided-Distillation (CGD), ont démontré l'intérêt d'enseigner explicitement aux modèles de raisonnement logique (LLM) comment formuler des critiques. Inspirés par ces travaux, nous proposons l'apprentissage par renforcement critique (CRL), où le modèle est chargé de générer une critique pour une paire (question, solution) donnée. La récompense est déterminée uniquement par la concordance entre l'étiquette de jugement final $c \in \{\texttt{Vrai}, \texttt{Faux}\}$ de la critique générée et le jugement de référence $c^*$. Forts de ce constat, nous introduisons \textsc{Critique-Coder}, entraîné sur un modèle hybride RL/CRL en remplaçant 20 % des données RL standard par des données CRL. Nous avons optimisé plusieurs modèles (\textsc{Critique-Coder}) et les avons évalués sur différents ensembles de données de référence afin de démontrer leurs avantages par rapport aux modèles basés uniquement sur l'apprentissage par renforcement (RL). Nous montrons que \textsc{Critique-Coder} surpasse systématiquement les modèles de référence RL sur tous les ensembles de données évalués. Notamment, notre modèle \textsc{Critique-Coder-8B} atteint plus de 60 % sur LiveCodeBench (v5), surpassant d'autres modèles de raisonnement comme DeepCoder-14B et GPT-o1. Au-delà de la génération de code, \textsc{Critique-Coder} démontre également des capacités de raisonnement général améliorées, comme en témoignent ses meilleures performances sur les tâches de raisonnement logique du jeu de données BBEH. Cela indique que l'application de l'apprentissage par renforcement critique (CRL) aux ensembles de données de codage améliore les capacités de raisonnement général et de critique, qui sont transférables à un large éventail de tâches. Par conséquent, nous croyons que le CRL constitue un excellent complément à l'apprentissage par renforcement standard pour le raisonnement sur les modèles logiques.

Algorithmes de score de vraisemblance intertokeniseurs pour la distillation de modèles de langage

Truong Buu Phan, Ashish Khisti (affilié à la faculté Vector), Karen Ullrich

Abstrait: 

Computing the next-token likelihood ratio between two language models (LMs) is a standard task in training paradigms like knowledge distillation. Since this task requires both models to share the same probability space, it becomes challenging when the teacher and student LMs use different tokenizers, for instance, when edge-device deployment necessitates a smaller vocabulary size to lower memory overhead. In this work, we address this vocabulary misalignment problem by uncovering an implicit recursive structure in the commonly deployed Byte-Pair Encoding (BPE) algorithm and utilizing it to create a probabilistic framework for cross-tokenizer likelihood scoring. Our method enables sequence likelihood evaluation for vocabularies different from the teacher model native tokenizer, addressing two specific scenarios: when the student vocabulary is a subset of the teacher vocabulary, and the general case where it is arbitrary. In the subset regime, our framework computes exact likelihoods and provides next-token probabilities for sequential sampling with only $\mathcal{O}(1)$ model evaluations per token. When used for distillation, this yields up to a 12\% reduction in memory footprint for the Qwen2.5-1.5B model while also improving baseline performance up to 4\% on the evaluated tasks. For the general case, we introduce a rigorous lossless procedure that leverages BPE recursive structure, complemented by a fast approximation that keeps large-vocabulary settings practical. Applied to distillation for mathematical reasoning, our approach improves GSM8K accuracy by more than 2% over the current state of the art.

En bref : Algorithmes permettant de calculer des séquences de jetons sous un vocabulaire BPE cible différent de celui du tokenizer natif du modèle.

Machine de Darwin-Gödel : évolution ouverte d’agents auto-améliorants

Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune (membre du corps professoral de Vector)

Abstrait: 

La plupart des systèmes d'IA actuels sont limités par des architectures fixes, conçues par l'homme, et ne peuvent s'améliorer de manière autonome et continue. La méthode scientifique, par contre, est un système cumulatif et ouvert, où chaque innovation s'appuie sur les travaux antérieurs, ouvrant la voie à de futures découvertes. L'espoir grandit de voir le processus manuel actuel de développement de l'IA automatisé. Si cette automatisation est réalisée en toute sécurité, elle accélérerait le développement de l'IA et nous permettrait d'en récolter les fruits bien plus tôt. Cette perspective soulève la question de savoir comment les systèmes d'IA peuvent s'améliorer indéfiniment tout en devenant plus performants dans la résolution des problèmes pertinents. Le méta-apprentissage peut automatiser la découverte de nouveaux algorithmes, mais il est limité par les améliorations de premier ordre et par la conception humaine d'un espace de recherche approprié. La machine de Gödel a proposé une alternative théorique : une IA auto-améliorante qui se modifie de manière répétée et dont les avantages sont prouvés. Malheureusement, il est impossible, en pratique, de prouver que la plupart des modifications sont globalement bénéfiques. Nous présentons la Machine de Gödel de Darwin (DGM), un système novateur d'auto-amélioration qui modifie itérativement son propre code (améliorant ainsi sa capacité à modifier sa propre base de code) et valide empiriquement chaque modification à l'aide de benchmarks de programmation. Inspirée par l'évolution darwinienne et les recherches sur l'exploration ouverte, la DGM constitue une archive d'agents de programmation générés. Elle échantillonne des agents de cette archive, qui s'automodifient pour créer de nouvelles versions intéressantes d'eux-mêmes. Cette exploration ouverte forme un arbre croissant d'agents diversifiés et de haute qualité et permet l'exploration parallèle de nombreux chemins différents dans l'espace de recherche. Empiriquement, la DGM améliore automatiquement ses capacités de programmation (par exemple, de meilleurs outils d'édition de code, une gestion optimisée des fenêtres de contexte long, des mécanismes d'évaluation par les pairs), augmentant ses performances sur SWE-bench de 20,0 % à 50,0 % et sur Polyglot de 14,2 % à 30,7 %. De plus, la DGM surpasse significativement les systèmes de référence sans auto-amélioration ni exploration ouverte. Toutes les expériences ont été réalisées en respectant les consignes de sécurité (environnement isolé, surveillance humaine, etc.). Globalement, le DGM représente une avancée significative vers une IA auto-améliorante, capable de progresser par elle-même et de bâtir un avenir d'innovation sans fin.

Désenchevêtrement des poids sans données dans l'arithmétique des tâches via la courbure approximative factorisée par Kronecker

Angelo Porrello, Pietro Buzzega, Felix Dangel (ancien boursier postdoctoral émérite Vector), Thomas Sommariva, Riccardo Salami, Lorenzo Bonicelli, Simone Calderara

Abstrait: 

L'arithmétique des tâches (TA) offre une méthode modulaire et évolutive pour adapter les modèles de base. Cependant, la combinaison de plusieurs vecteurs de tâches peut engendrer des interférences entre elles, provoquant une dérive de représentation et une dégradation des performances. La régularisation de la dérive de représentation constitue une solution naturelle pour désenchevêtrer les vecteurs de tâches, mais les approches existantes nécessitent généralement des données de tâches externes, ce qui est incompatible avec la modularité de la TA et ses contraintes de disponibilité, notamment en matière de confidentialité. Nous proposons une approche sans données en formulant la régularisation de la dérive de représentation comme un problème d'approximation de la matrice de courbure. Cela nous permet d'exploiter des techniques éprouvées ; en particulier, nous adoptons la courbure approximative factorisée de Kronecker (KFAC) pour obtenir des régulariseurs pratiques. Notre méthode est sans données, présente une complexité constante par rapport au nombre de tâches et améliore les performances sur les benchmarks de TA.

En résumé : nous abordons le problème des interférences entre tâches dans l’arithmétique des tâches grâce à une approche sans date. En considérant la dérive comme une approximation de la courbure et en appliquant K-FAC, on obtient un désenchevêtrement des tâches à grande échelle et des performances de référence améliorées.

Diviser et abstraire : auto-formalisation par décomposition et apprentissage par abstraction

Marcus Min, Yeqi Gao, Wilson Sy, Zhaoyu Li, Xujie Si (affilié à la faculté Vector), Osbert Bastani

Abstrait:

L'autoformalisation, qui consiste à traduire les mathématiques informelles en langages formels vérifiables par machine, représente un défi de longue date, même pour des énoncés isolés. Au-delà du niveau de l'énoncé, les mathématiciens consacrent des efforts considérables à la formalisation d'abstractions réutilisables, telles que les définitions et relations communes, qui permettent de formaliser aisément un vaste corpus d'énoncés. Alors que les travaux antérieurs se concentrent sur l'optimisation des modèles pour l'autoformalisation d'énoncés uniques, nous introduisons $\textit{Divide and Abstract (DNA)}$, un cadre de bout en bout qui non seulement améliore les performances des modèles lors des tests de formalisation d'un corpus d'énoncés, mais apprend également une bibliothèque d'abstractions formelles réutilisables, applicable à des énoncés extérieurs au corpus. Dans un premier temps, $\textit{DNA}$ extrait les concepts mathématiques communs de l'ensemble du corpus informel et les formalise sous forme d'abstractions réutilisables. En s'appuyant sur ces abstractions apprises, $\textit{DNA}$ décompose chaque énoncé informel du corpus en un ensemble structuré de propositions informelles, traduit chaque proposition en son équivalent formel, recompose les propositions formelles et affine la formalisation finale grâce aux retours d'un validateur symbolique. L'ensemble du système ne nécessite aucun apprentissage et s'adapte donc à tout langage formel, en particulier aux langages de domaine spécifiques (DSL) à faibles ressources. $\textit{DNA}$ améliore significativement les performances, jusqu'à $\textbf{8,6}\times$, et fait progresser l'état de l'art de $\textbf{57,8}$ %, passant de $\textbf{40,8}$ à $\textbf{64,4}$.

En bref : nous avons conçu un cadre qui non seulement améliore la capacité des LLM à formaliser un corpus d’énoncés, mais qui apprend également une bibliothèque d’abstractions réutilisables, applicable à des énoncés extérieurs au corpus.

DPQuant : Entraînement de modèles efficace et privé via la planification dynamique de la quantification

Yubo Gao, Renbo Tu, Gennady Pekhimenko (membre du corps professoral de Vector), Nandita Vijaykumar (membre du corps professoral de Vector)

Abstrait: 

La descente de gradient stochastique différentiellement privée (DP-SGD) est une technique performante pour protéger la confidentialité des utilisateurs lors de l'entraînement de réseaux neuronaux à partir de données sensibles. Pendant l'entraînement, la conversion des poids et des activations du modèle en formats de faible précision (quantification) permet de réduire considérablement le temps d'entraînement, la consommation d'énergie et le coût, ce qui explique sa large utilisation. Dans ce travail, nous démontrons que la quantification entraîne une dégradation de la précision significativement plus importante en DP-SGD qu'en SGD classique. Nous observons que cela est dû à l'injection de bruit dans la DP-SGD, qui amplifie la variance de la quantification, menant à une dégradation de la précision disproportionnée. Pour remédier à ce problème, nous présentons DPQuant, un cadre de quantification dynamique qui sélectionne de manière adaptative un sous-ensemble de couches à quantifier à chaque époque. Notre méthode combine deux idées clés qui réduisent efficacement la variance de quantification : (i) un échantillonnage probabiliste des couches, qui fait tourner les couches quantifiées à chaque époque, et (ii) une priorisation des couches prenant en compte les pertes. Cette priorisation utilise un estimateur de sensibilité aux pertes différentiellement privé pour identifier les couches quantifiables avec un impact minimal sur la qualité du modèle. Cet estimateur consomme une fraction négligeable du budget de confidentialité global, préservant ainsi les garanties de confidentialité différentielle. Des évaluations empiriques sur ResNet18, ResNet50 et DenseNet121, effectuées sur divers ensembles de données, démontrent que DPQuant surpasse systématiquement les méthodes de quantification statique de référence. Elle atteint des compromis précision-calcul quasi optimaux (au sens de Pareto) et des gains de débit jusqu’à 2,21 fois supérieurs au débit théorique sur du matériel à faible précision, avec une baisse de précision de validation inférieure à 2 %.

DrivingGen : un banc d'essai complet pour les modèles génératifs de monde vidéo en conduite autonome

Yang Zhou, Hao Shao, Letian Wang, Zhuofan Zong, Hongsheng Li, Steven Waslander (affilié à la faculté Vector)

Abstrait:

Les modèles de génération vidéo, en tant que forme de modèles du monde, représentent l'un des domaines les plus prometteurs de l'IA, offrant aux agents la capacité d'imaginer l'avenir en modélisant l'évolution temporelle de scènes complexes. Dans le domaine de la conduite autonome, cette vision donne naissance aux modèles du monde de conduite : des simulateurs génératifs qui imaginent l'avenir du système et de l'agent, permettant une simulation à grande échelle, des tests sécurisés des cas limites et une génération riche de données synthétiques. Pourtant, malgré une activité de recherche en pleine expansion, le domaine manque d'un référentiel rigoureux pour mesurer les progrès et orienter les priorités. Les évaluations existantes demeurent limitées : les mesures vidéo génériques négligent les facteurs d'imagerie critiques pour la sécurité ; la plausibilité des trajectoires est rarement quantifiée ; la cohérence temporelle et au niveau de l'agent est négligée ; et la contrôlabilité par rapport au conditionnement du système est ignorée. De plus, les ensembles de données actuels ne couvrent pas la diversité des conditions requises pour un déploiement en conditions réelles. Pour combler ces lacunes, nous présentons DrivingGen, le premier référentiel complet pour les modèles du monde de conduite génératifs. DrivingGen combine un ensemble de données d'évaluation diversifié – issu de bases de données de conduite et de sources vidéo à grande échelle sur Internet, couvrant des conditions météorologiques, des moments de la journée, des régions géographiques et des manœuvres complexes variés – avec une série de nouvelles mesures qui évaluent conjointement le réalisme visuel, la plausibilité de la trajectoire, la cohérence temporelle et la contrôlabilité. L'analyse comparative de 14 modèles de pointe révèle des compromis évidents : les modèles généraux offrent un meilleur rendu visuel, mais ne respectent pas les lois de la physique, tandis que les modèles spécifiques à la conduite reproduisent les mouvements de manière réaliste, mais présentent une qualité visuelle inférieure. DrivingGen offre un cadre d'évaluation unifié pour favoriser le développement de modèles du monde de la conduite fiables, contrôlables et déployables, permettant une simulation, une planification et une prise de décision basées sur les données à grande échelle.

EditReward : un modèle de récompense centré sur l’humain pour l’édition d’images guidée par des instructions

Keming Wu, Sicong Jiang, Max Ku, PING NIE, Minghao Liu, Wenhu Chen (membre du corps professoral de Vector)

Abstrait: 

Récemment, nous avons constaté des progrès considérables dans le domaine de l'édition d'images guidée par le langage naturel. Plusieurs modèles propriétaires, tels que GPT-Image-1, Seedream et Google Nano-Banana, ont affiché des performances très prometteuses. Cependant, les modèles à code source ouvert restent à la traîne. Le principal obstacle est l'absence d'un modèle de récompense fiable permettant de traiter à grande échelle des données d'entraînement synthétiques de haute qualité. Pour remédier à ce problème critique, nous avons développé EditReward, formé sur notre nouvel ensemble de données de préférences humaines à grande échelle, méticuleusement annoté par des experts selon un protocole rigoureux et comprenant plus de 200 000 paires de préférences. EditReward démontre une excellente adéquation aux préférences humaines dans les tâches d'édition d'images guidée par des instructions. Les expériences montrent qu'EditReward atteint une corrélation humaine de pointe sur des bancs d'essai établis tels que GenAI-Bench, AURORA-Bench, ImagenHub et notre nouveau banc d'essai EditReward-Bench, surpassant ainsi un large éventail de modèles VLM en tant que juge. De plus, nous utilisons EditReward pour sélectionner un sous-ensemble de haute qualité à partir de l'ensemble de données existant et bruyant ShareGPT-4o-Image. Nous entraînons ensuite Step1X-Edit sur ce sous-ensemble, ce qui révèle une amélioration significative par rapport à un entraînement sur l'ensemble complet. Cela démontre la capacité d'EditReward à servir de modèle de récompense pour étendre la production de données d'entraînement de haute qualité pour l'édition d'images. EditReward, accompagné de son jeu de données d'entraînement, sera mis à disposition afin d'aider la communauté à constituer davantage d'ensembles de données d'entraînement de haute qualité pour l'édition d'images et ainsi rattraper les jeux les plus performants.

En bref : nous présentons EDITREWARD, formé sur EDITREWARD-DATA (200 000 paires de préférences humaines), et introduisons EDITREWARD-BENCH, établissant un nouvel état de l’art en matière d’évaluation de l’édition d’images et de curation de données.

Raisonnement hiérarchique émergent dans les LLM par l'apprentissage par renforcement

Haozhe Wang, Qixin Xu, Che Liu, Junhong Wu, Fangzhen Lin, Wenhu Chen (membre du corps professoral de Vector)

Abstrait: 

L'apprentissage par renforcement (RL) s'est avéré extrêmement efficace pour améliorer les capacités de raisonnement complexe des grands modèles de langage (LLM), mais les mécanismes sous-jacents à ce succès restent largement obscurs. Notre analyse révèle que des phénomènes déroutants tels que les « moments d'illumination », la « mise à l'échelle de la longueur » et la dynamique de l'entropie ne sont pas des occurrences isolées, mais les caractéristiques d'une hiérarchie de raisonnement émergente, comparable à la séparation entre la planification stratégique de haut niveau et l'exécution procédurale de bas niveau dans la cognition humaine. Nous révélons une dynamique fascinante en deux phases : initialement, un modèle est contraint par la correction procédurale et doit améliorer ses compétences de bas niveau. Le goulot d'étranglement de l'apprentissage se déplace ensuite de manière décisive, les gains de performance étant impulsés par l'exploration et la maîtrise de la planification stratégique de haut niveau. Cette observation révèle une inefficacité fondamentale des algorithmes RL dominants comme GRPO, qui appliquent une pression d'optimisation sans discernement et diluent le signal d'apprentissage sur tous les jetons. Pour remédier à cela, nous proposons HICRA (Hierarchy-Aware Credit Assignment), un algorithme qui concentre les efforts d'optimisation sur les jetons de planification à fort impact. Nos expériences approfondies confirment que HICRA surpasse de manière significative les algorithmes de référence performants et offrent une compréhension fine de la progression du raisonnement à travers l'exploration stratégique.

Jetons dynamiques guidés par l'entropie pour l'alignement Graph-LLM dans la compréhension moléculaire

Zihao Jing, Qiuhao Zeng, Ruiyi Fang, Yan Sun, Boyu Wang (affilié à la faculté Vector), Pingzhao Hu

Abstrait: 

La compréhension moléculaire est essentielle au progrès de domaines tels que la recherche scientifique et la découverte de médicaments. Pourtant, les modèles de langage de grande taille (LLM) ont du mal à comprendre efficacement les graphiques moléculaires. Les interfaces graphes-LLM existantes adaptent souvent le connecteur de type Q-Former avec des jetons statiques de longueur fixe, initialement conçu pour les tâches de vision. Ces conceptions négligent la stéréochimie et le contexte substructurel et nécessitent généralement un réglage fin coûteux de la structure du LLM, ce qui limite leur efficacité et leur capacité de généralisation. Nous présentons **EDT-Former**, un **transformateur de jetons dynamique** guidé par l'**entropie** qui génère des jetons alignés sur des zones moléculaires informatives, préservant ainsi les caractéristiques structurelles locales et globales pour la compréhension des graphiques moléculaires. Au-delà des approches précédentes, EDT-Former permet l'alignement entre les encodeurs de graphes figés et les LLM sans ajuster la structure de base du LLM (à l'exclusion de la couche d'intégration), ce qui permet un réglage fin efficace sur le plan du calcul, et obtient des résultats de pointe sur MoleculeQA, Mol-Instructions et les benchmarks de prédiction de propriétés (TDC, MoleculeNet), soulignant son efficacité pour une compréhension moléculaire multimodale évolutive et généralisable.

En bref : EDT-Former : les jetons de requête dynamiques guidés par l’entropie mappent les graphes moléculaires sur des LLM, capturant les caractéristiques de structure locales et globales pour une compréhension et un raisonnement complets avec une formation sans squelette, uniquement basée sur les connecteurs.

Masquage par gradient de signe pour le transport de vecteurs de tâches à travers des modèles préentraînés

Filippo Rinaldi, Aniello Panariello, Giacomo Salici, Fengyuan Liu, Marco Ciccone (boursier postdoctoral distingué Vector), Angelo Porrello, Simone Calderara

Abstrait: 

Lors de la publication d'une nouvelle version d'un modèle de base, les praticiens doivent généralement procéder à un réglage fin complet, même si la même tâche a déjà été résolue dans la version précédente. Une alternative prometteuse consiste à réutiliser les modifications de paramètres (c.-à-d. les vecteurs de tâche) qui capturent la manière dont un modèle s'adapte à une tâche spécifique. Cependant, leur transfert entre différents modèles préentraînés échoue souvent en raison d'un désalignement de leur espace de paramètres. Dans ce travail, nous montrons que la clé d'un transfert réussi réside dans la structure de signe des gradients du nouveau modèle. Forts de cette observation, nous proposons GradFix, une nouvelle méthode qui approxime la structure de signe idéale des gradients et l'exploite pour transférer des connaissances à partir d'un nombre restreint d'exemples étiquetés. Notamment, cette méthode ne nécessite aucun réglage fin supplémentaire : l'adaptation est réalisée en calculant quelques gradients au niveau du modèle cible et en masquant le vecteur de tâche source en conséquence. On obtient ainsi une mise à jour localement alignée sur le paysage de perte cible, ce qui a pour effet de rebaser le vecteur de tâche sur le nouveau pré-entraînement. Nous offrons une garantie théorique que notre méthode assure une descente de premier ordre. Empiriquement, nous démontrons des gains de performance significatifs sur les benchmarks de vision et de langage, surpassant systématiquement l'addition naïve de vecteurs de tâches et le réglage fin à partir de quelques exemples.

En bref : le masquage par signe de gradient transfère les vecteurs de tâches entre les modèles de base avec peu d’échantillons, surpassant le transfert naïf et le réglage fin avec peu d’exemples.

Adaptation homéostatique des codes de population optimaux sous stress métabolique

Yi-Chun Hung, Gregory Schwartz (membre associé de la faculté Vector), Emily Cooper, Emma Alexander

Abstrait: 

Le traitement de l'information dans les populations neuronales est intrinsèquement contraint par les limites des ressources métaboliques et les propriétés du bruit, avec une dynamique que les modèles mathématiques existants ne décrivent pas avec précision. Des données récentes montrent, par exemple, que les neurones du cortex visuel de la souris entrent en « mode basse consommation » où ils maintiennent l'homéostasie de leur fréquence de décharge tout en dépensant moins d'énergie. Cette adaptation entraîne une augmentation du bruit neuronal et un aplatissement de la courbe de réponse en réponse au stress métabolique. Nous avons développé un cadre théorique de codage de population qui capture ce comportement à l'aide de deux contraintes nouvelles et étonnamment simples : une approximation de l'homéostasie de la fréquence de décharge et une limite énergétique liée aux niveaux de bruit par simulation biophysique. Un élément clé de notre contribution est un modèle de bilan énergétique reliant directement la consommation d'adénosine triphosphate (ATP) dans les cellules à un cadre mathématique entièrement explicable qui généralise les codes de population optimaux existants. Plus précisément, notre simulation fournit un modèle de bruit de Poisson dispersé dépendant de l'énergie, basé sur l'hypothèse que la cellule suivra une trajectoire de décroissance optimale pour produire la fréquence de décharge la moins bruyante possible pour un budget énergétique cellulaire donné. Chaque état de ce chemin optimal est associé à des propriétés (potentiel de repos et conductance de fuite) mesurables par électrophysiologie et dont l'évolution a été démontrée lors d'une privation calorique prolongée. Nous dérivons analytiquement la stratégie de codage optimale pour les neurones en fonction des différents budgets énergétiques et objectifs de codage, et montrons comment notre méthode décrit de manière unique l'adaptation des populations de courbes de réponse tout en maintenant l'homéostasie, conformément aux observations empiriques.

ImagenWorld : Tests de résistance des modèles de génération d’images avec une évaluation humaine explicable sur des tâches ouvertes du monde réel

Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Sani, Paria Khoshtab, Wei-Chieh Sun, Parnian Fazel, Zhi Rui Tam, Thomas Chong, Edisy Kin Wai Chan, Donald Tsang, Chiao-Wei Hsu, Ting Lam, Ho Ng, Chiafeng Chu, Chak-Wing Mak, Keming Wu, Wong Hiu-Tung, Yik Ho, Chi Ruan, Zhuofeng Li, I-Sheng Fang, Shih-Ying Yeh, Ho Kei Cheng, Ping Nie, Wenhu Chen (membre du corps professoral de Vector)

Abstrait: 

Advances in diffusion, autoregressive, and hybrid models have enabled high-quality image synthesis for tasks such as text-to-image, editing, and reference-guided composition. Yet, existing benchmarks remain limited, either focus on isolated tasks, cover only narrow domains, or provide opaque scores without explaining failure modes. We introduce \textbf{ImagenWorld}, a benchmark of 3.6K condition sets spanning six core tasks (generation and editing, with single or multiple references) and six topical domains (artworks, photorealistic images, information graphics, textual graphics, computer graphics, and screenshots). The benchmark is supported by 20K fine-grained human annotations and an explainable evaluation schema that tags localized object-level and segment-level errors, complementing automated VLM-based metrics. Our large-scale evaluation of 14 models yields several insights: (1) models typically struggle more in editing tasks than in generation tasks, especially in local edits. (2) models excel in artistic and photorealistic settings but struggle with symbolic and text-heavy domains such as screenshots and information graphics. (3) closed-source systems lead overall, while targeted data curation (e.g., Qwen-Image) narrows the gap in text-heavy cases. (4) modern VLM-based metrics achieve Kendall accuracies up to 0.79, approximating human ranking, but fall short of fine-grained, explainable error attribution. ImagenWorld provides both a rigorous benchmark and a diagnostic tool to advance robust image generation.

Amélioration de l'approximation des fonctions d'ensemble grâce aux réseaux de neurones quasi-arithmétiques

Tomas Tokar, Scott Sanner (membre affilié de la faculté Vector)

Abstrait: 

Les ensembles constituent une abstraction fondamentale pour de nombreux types de données. Afin de gérer la nature non ordonnée des données structurées en ensembles, des modèles tels que DeepSets et PointNet s'appuient sur des opérations de regroupement fixes et non apprenables (par exemple, la somme ou le maximum) – un choix de conception qui peut entraver la transférabilité des plongements appris et limiter l'expressivité du modèle. Plus récemment, des fonctions d'agrégation apprenables ont été proposées comme alternatives plus expressives. Dans ce travail, nous faisons progresser cette voie de recherche en introduisant la moyenne de Kolmogorov neuralisée (NKM) – un nouveau cadre apprenable permettant d'obtenir une mesure généralisée de tendance centrale grâce à une fonction neuronale inversible. Nous proposons également les réseaux de neurones quasi-arithmétiques (QUANN), qui intègrent la NKM comme fonction d'agrégation apprenable. Nous fournissons une analyse théorique montrant que les QUANN sont des approximants universels pour une large classe de décompositions ensemblistes courantes et que, grâce à leurs composants neuronaux inversibles, ils apprennent des représentations latentes plus structurées. Empiriquement, les QUANN surpassent les méthodes de référence les plus performantes sur divers critères d'évaluation, tout en apprenant des représentations qui se transfèrent efficacement même à des tâches qui n'impliquent pas d'ensembles.

En bref : nous introduisons les réseaux neuronaux quasi-arithmétiques (QUANN), qui utilisent la moyenne de Kolmogorov neuronalisée (un mécanisme de regroupement entraînable nouvellement introduit) pour améliorer l’approximation des fonctions d’ensemble.

Apprenez à raisonner efficacement grâce à la mise en forme adaptative des récompenses basée sur la durée.

Wei Liu, Ruochen Zhou, Yiyun Deng, Yuzhen Huang, Junteng Liu, Yuntian Deng (affilié à la faculté Vector), Yizhe Zhang, Junxian He

Abstrait: 

Les grands modèles de raisonnement (LRM) ont démontré des capacités remarquables pour résoudre des problèmes complexes grâce à l'apprentissage par renforcement (RL), notamment en générant de longues traces de raisonnement. Cependant, ces sorties étendues présentent souvent une redondance importante, ce qui limite l'efficacité des LRM. Dans cet article, nous étudions des approches basées sur le RL pour améliorer l'efficacité du raisonnement. Plus précisément, nous présentons d'abord un cadre unifié qui formule diverses méthodes de raisonnement efficaces à travers le prisme de la mise en forme de la récompense basée sur la longueur. En s'appuyant sur cette perspective, nous proposons une nouvelle méthode de façonnage de la récompense basée sur la longueur (LASER), qui utilise une fonction en escalier comme récompense en fonction de la longueur de la cible. LASER surpasse les méthodes précédentes, atteignant un meilleur compromis entre performance et efficacité. Ensuite, nous étendons LASER en nous basant sur deux intuitions clés : (1) Le comportement de raisonnement du modèle évolue dynamiquement pendant l'entraînement, nécessitant des spécifications de récompense également adaptatives et dynamiques ; (2) Plutôt que d'encourager uniformément les chaînes de pensée (CoT) courtes ou longues, nous proposons que la structuration des récompenses en fonction de la longueur tienne compte de la difficulté, c'est-à-dire qu'elle pénalise davantage les CoT longues pour les requêtes faciles. Cette approche devrait faciliter une combinaison de raisonnement rapide et lent, menant à un meilleur compromis global. La méthode résultante est nommée LASER-D (Dynamic et Difficulty-aware). Des expériences sur cinq modèles à poids ouverts, de 1,5 milliard à 32 milliards, démontrent que notre approche améliore significativement à la fois les performances de raisonnement et l'efficacité de la longueur des réponses. Par exemple, LASER-D obtient une amélioration de 5,3 points sur AIME2024 tout en réduisant l'utilisation des jetons de 64 %. Une analyse plus poussée révèle que notre compression basée sur l'apprentissage par renforcement produit des schémas de raisonnement plus concis avec moins d'« autoréflexions » redondantes.

LogicXGNN : Règles logiques fondées pour expliquer les réseaux neuronaux graphiques

Chuqin Geng, Ziyu Zhao, Zhaoyue Wang, Haolin Ye, Yuhe Jiang, Xujie Si (affiliés à la faculté Vector)

Abstrait: 

Les explications existantes basées sur des règles pour les réseaux de neurones graphiques (GNN) offrent une interprétabilité globale, mais optimisent et évaluent souvent la fidélité dans un espace conceptuel intermédiaire et ininterprétable, négligeant ainsi la qualité de l'ancrage des explications finales des sous-graphes pour les utilisateurs finaux. Cette lacune engendre des explications qui peuvent sembler exactes, mais qui s'avèrent peu fiables en pratique. À cette fin, nous proposons LogicXGNN, un cadre a posteriori qui construit des règles logiques sur des prédicats fiables, explicitement conçus pour capturer la structure de passage de messages du GNN, garantissant ainsi un ancrage efficace. Nous introduisons également la fidélité ancrée dans les données ($Fid_D$), une métrique réaliste qui évalue les explications dans leur forme de graphe final, ainsi que des métriques d'utilité complémentaires telles que la couverture et la validité. Dans le cadre d'expérimentations approfondies, LogicXGNN améliore $Fid_D$ de plus de 20 % en moyenne par rapport aux méthodes de pointe, tout en étant 10 à 100 fois plus rapide. Grâce à sa grande évolutivité et à ses performances utilitaires, LogicXGNN produit des explications fidèles à la logique du modèle et solidement ancrées dans des données observables.

Former la boucle : Transformateurs en boucle à profondeur élastique pour le raisonnement latent par modulation par raccourci

Ahmadreza Jeddi, Marco Ciccone (boursier postdoctoral distingué Vector), Babak Taati (affilié universitaire Vector)

Abstrait: 

Les Transformers bouclés se sont imposés comme une classe de modèles performants et efficaces pour le raisonnement dans le domaine du langage. Des études récentes montrent que ces modèles atteignent d'excellentes performances sur les tâches algorithmiques et de raisonnement, suggérant que les architectures bouclées présentent une propension inductive au raisonnement latent. Cependant, les approches précédentes fixent le nombre d'itérations de boucle lors de l'entraînement et de l'inférence, laissant en suspens la question de la capacité de ces modèles à adapter leur profondeur de calcul en fonction des ressources de calcul disponibles. Nous présentons LoopFormer, un Transformer bouclé entraîné sur des trajectoires de longueur variable afin de permettre un raisonnement conditionné par les ressources de calcul. Notre contribution principale réside dans un schéma d'entraînement à cohérence de raccourci qui aligne les trajectoires de différentes longueurs, garantissant ainsi que les boucles plus courtes produisent des représentations informatives tandis que les boucles plus longues continuent de les affiner. LoopFormer conditionne chaque boucle au temps et à la taille du pas actuels, permettant aux représentations d'évoluer de manière cohérente à travers des trajectoires de longueur variable, plutôt que de dériver ou de stagner. Empiriquement, LoopFormer démontre des performances robustes sur les benchmarks de modélisation du langage et de raisonnement, même sous des contraintes de calcul importantes, tout en s'adaptant efficacement à l'augmentation des ressources de calcul. Ces résultats montrent que les Transformers en boucle sont intrinsèquement adaptés à la modélisation adaptative du langage, ouvrant la voie à des modèles de langage de grande taille, contrôlables et économes en ressources.

Lyra : Reconstruction générative de scènes 3D par autodistillation d'un modèle de diffusion vidéo

Sherwin Bahmani, Tianchang Shen, Jiawei Ren, Jiahui Huang, Yifeng Jiang, Haithem Turki, Andrea Tagliasacchi, David Lindell (affilié du corps professoral vectoriel), Zan Gojcic, Sanja Fidler (membre du corps professoral vectoriel), Huan Ling, Jun Gao, Xuanchi Ren

Abstrait: 

La capacité de générer des environnements virtuels est cruciale pour des applications allant des jeux vidéo aux domaines de l'IA physique tels que la robotique, la conduite autonome et l'IA industrielle. Les méthodes actuelles de reconstruction 3D basées sur l'apprentissage machine reposent sur la disponibilité de données multivues réelles, qui ne sont pas toujours facilement accessibles. Les progrès récents des modèles de diffusion vidéo ont démontré des capacités d'imagination remarquables, mais leur nature 2D limite leurs applications à la simulation où un robot doit naviguer et interagir avec son environnement. Dans cet article, nous proposons un cadre d'autodistillation visant à extraire les connaissances 3D implicites des modèles de diffusion vidéo pour obtenir une représentation explicite 3D par projection gaussienne (3DGS), éliminant ainsi le besoin de données d'entraînement multivues. Plus précisément, on complète le décodeur RVB classique par un décodeur 3DGS, supervisé par la sortie du décodeur RGB. Grâce à cette approche, le décodeur 3DGS peut être entraîné exclusivement avec des données synthétiques générées par les modèles de diffusion vidéo. Lors de l'inférence, notre modèle peut synthétiser des scènes 3D à partir d'une simple entrée textuelle ou d'une image unique pour un rendu en temps réel. Notre cadre de travail s'étend à la génération de scènes 3D dynamiques à partir d'une vidéo monoculaire. Les résultats expérimentaux démontrent que notre cadre atteint des performances de pointe en matière de génération de scènes 3D statiques et dynamiques. Vidéo : https://anonlyra.github.io/anonlyra

En bref : Modèles de diffusion vidéo 3D et 4D à anticipation avec caméra

Atténuer les risques liés à la protection de la vie privée grâce au désapprentissage Forget Set-Free

Aviraj Newatia, Michael Cooper, Viet Nguyen, Rahul G. Krishnan (membre du corps professoral de Vector)

Abstrait: 

Training machine learning models requires the storage of large datasets, which often contain sensitive or private data. Storing data is associated with a number of potential risks which increase over time, such as database breaches and malicious adversaries. Machine unlearning is the study of methods to efficiently remove the influence of training data subsets from previously-trained models. Existing unlearning methods typically require direct access to the “forget set”—the data to be forgotten-and organisations must retain this data for unlearning rather than deleting it immediately upon request, increasing risks associated with the forget set. We introduce partially-blind unlearning—utilizing auxiliary information to unlearn without explicit access to the forget set. We introduce a practical framework Reload, a partially-blind method based on gradient optimization and structured weight sparsification to operationalize partially-blind unlearning. We show that Reload efficiently unlearns, approximating models retrained from scratch, and outperforms several forget set-dependent approaches. On language models, Reload unlearns entities using <0.025\% of the retain set and <7\% of model weights in <8 minutes on Llama2-7B. In the corrective case, Reload achieves unlearning even when only 10\% of corrupted data is identified.

PDDL en langage naturel (NL-PDDL) pour la planification de régression de bon sens orientée objectif en monde ouvert dans l'IA incarnée

Xiaotian Liu, Armin Toroghi, Jiazhou Liang, David Courtis, Ruiwen Li, Ali Pesaranghader, Jaehong Kim, Tanmana Sadhu, Hyejeong Jeon, Scott Sanner (Affilié à la faculté Vector)

Abstrait: 

La planification dans des environnements ouverts, où les agents doivent agir avec des états partiellement observés et des connaissances incomplètes, représente un défi majeur pour l'IA incarnée. Planifier dans un monde ouvert implique non seulement de séquencer les actions, mais aussi de déterminer les informations que l'agent doit percevoir pour les réaliser. Les approches existantes, utilisant des modèles de langage étendus (LLM) et des modèles de vision-langage (VLM), ne permettent pas de planifier de manière fiable à long terme et pour des objectifs complexes. Elles présentent souvent des incohérences et sont incapables de raisonner causalement sur les interactions agent-environnement. À l'inverse, les planificateurs PDDL classiques offrent un raisonnement correct et rigoureux, mais échouent dans les environnements ouverts : ils présupposent des modèles complets et dépendent d'une description exhaustive de tous les objets, états et actions ; ils ne peuvent pas gérer les incohérences entre les spécifications d'objectifs (par exemple, « réchauffer le pain ») et les spécifications d'actions (par exemple, « griller le pain ») ; et ils ne généralisent pas entre les modalités (par exemple, texte, vision). Pour relever ces défis fondamentaux : (i) nous étendons le PDDL symbolique en une représentation flexible en langage naturel que nous appelons NL-PDDL, améliorant ainsi l’accessibilité pour les utilisateurs non experts et la généralisation entre les modalités ; (ii) nous généralisons la planification de type régression au NL-PDDL avec un raisonnement d’implication de bon sens afin de déterminer ce qui doit être observé pour atteindre un objectif dans des environnements partiellement observés présentant un potentiel décalage entre la spécification de l’objectif et celle de l’action ; et (iii) nous tirons parti de la spécification étendue du NL-PDDL pour faciliter la planification en monde ouvert, évitant ainsi un ancrage exhaustif et offrant une complexité temporelle et spatiale indépendante du nombre d’objets, d’états et d’actions ancrés. Nos expériences dans trois domaines différents — le Blocksworld classique et l’environnement incarné ALFWorld avec des états textuels et visuels — montrent que le NL-PDDL surpasse largement les méthodes de référence existantes, est plus robuste aux horizons temporels plus longs et aux objectifs plus complexes, et se généralise entre les modalités.

NeuralOS : Vers la simulation des systèmes d'exploitation par des modèles génératifs neuronaux

Luke Rivard, Sun Sun, Hongyu Guo, Wenhu Chen (membre du corps professoral de Vector), Yuntian Deng (affilié du corps professoral de Vector)

Abstrait: 

Nous présentons NeuralOS, un cadre neuronal qui simule les interfaces graphiques (GUI) des systèmes d'exploitation en prédisant directement les images affichées à l'écran en réponse aux interactions de l'utilisateur, telles que les mouvements de souris, les clics et les frappes au clavier. NeuralOS combine un réseau neuronal récurrent (RNN), qui suit l'état de l'ordinateur, avec un moteur de rendu neuronal basé sur la diffusion, qui génère les images de l'écran. Le modèle est entraîné sur un ensemble de données d'enregistrements Ubuntu XFCE, comprenant des interactions générées aléatoirement et des interactions réalistes produites par des agents d'IA. Les expériences montrent que NeuralOS réussit à rendre des séquences d'interface graphique réalistes, à capturer précisément les interactions de la souris et à prédire de manière fiable les transitions d'état, comme le lancement d'applications. Au-delà de la reproduction de systèmes existants, NeuralOS démontre que des données d'entraînement synthétisées peuvent apprendre au modèle à simuler des applications jamais installées, comme l'illustre l'exemple de Doom, et ouvre la voie à l'apprentissage des interfaces utilisateur à partir de démonstrations synthétiques uniquement.

En bref : nous présentons un modèle génératif neuronal qui simule les interfaces des systèmes d’exploitation en générant directement des images d’écran à partir des entrées de l’utilisateur.

Optimisation privée sous contrainte de débit avec applications à l'apprentissage équitable

Mohammad Yaghini, Tudor Cebere, Michael Menart, Aurélien Bellet, Nicolas Papernot (membre du corps professoral de Vector)

Abstrait: 

De nombreux problèmes d'apprentissage automatique fiable peuvent être exprimés comme des contraintes sur les taux de prédiction au sein de sous-populations, notamment des contraintes d'équité entre groupes (parité démographique, chances égales, etc.). Dans ce travail, nous étudions ces problèmes de minimisation sous contraintes de confidentialité différentielle (DP). Les techniques d'optimisation DP standard, telles que DP-SGD, reposent sur des objectifs décomposables sur des exemples individuels, permettant l'écrêtage du gradient et l'ajout de bruit par exemple. Cependant, les contraintes de taux dépendent de statistiques agrégées entre les groupes, créant des dépendances inter-échantillons qui violent cette décomposabilité. Pour y remédier, nous développons RaCO-DP, une variante DP de la descente-ascension de gradient stochastique (SGDA) qui résout la formulation lagrangienne des problèmes de contraintes de taux. Nous montrons que le coût supplémentaire de confidentialité lié à l'intégration de ces contraintes se réduit à l'estimation privée d'un histogramme sur le mini-lot à chaque étape. Nous prouvons la convergence de notre algorithme grâce à une nouvelle analyse de SGDA qui exploite la structure linéaire du paramètre dual. Les résultats empiriques montrent que notre méthode surpasse de Pareto les approches d'apprentissage privé existantes sous contraintes d'équité de groupe et atteint également de solides performances en matière de confidentialité, d'utilité et d'équité sur les réseaux neuronaux.

Co-optimisation des invites et des paramètres pour les grands modèles de langage

Xiaohe Bo, Rui Li, Zexu Sun, Quanyu Dai, Zeyu Zhang, Zihang Tian, ​​Xu Chen (boursier postdoctoral Schmidt AI en sciences), Zhenhua Dong

Abstrait: 

L'optimisation par prompts et le réglage fin sont deux approches majeures pour améliorer les performances des modèles de langage à grande échelle (LLM). Elles renforcent les capacités des LLM selon des perspectives complémentaires : la première par le biais du langage naturel explicite, et le second par la mise à jour implicite des paramètres. Cependant, les travaux antérieurs les ont généralement étudiées isolément, laissant leur potentiel synergique largement inexploré. Pour combler cette lacune, nous présentons dans cet article MetaTuner, un nouveau cadre qui intègre conjointement l'optimisation par prompts et le fin-tuning pour l'entraînement des LLM. Plus précisément, nous introduisons deux réseaux de neurones pour générer respectivement les prompts et les paramètres, tout en leur permettant de partager une couche d'encodage inférieure commune afin de faciliter le partage des connaissances. Guidée par les signaux supervisés finaux, notre approche est optimisée pour découvrir les combinaisons optimales entre les rapides et les paramètres. Étant donné que l'apprentissage des prompts implique une optimisation discrète tandis que le fin-tuning opère dans un espace de paramètres continu, nous concevons une fonction de perte de régularisation supervisée pour entraîner efficacement notre cadre. De nombreuses expériences menées sur divers ensembles de données de référence montrent que notre méthode surpasse systématiquement les méthodes de base. Pour le bénéfice de la communauté de recherche, nous avons publié notre projet sur https://anonymous.4open.science/r/metatuner .

En bref : cet article propose MetaTuner, un nouveau cadre qui optimise conjointement les invites et les paramètres des LLM grâce à un mécanisme de partage des connaissances et une perte de régularisation supervisée, atteignant des performances supérieures sur de multiples benchmarks.

Optimisation de la politique par trajectoire basée sur l'entropie relative

Claas Voelcker, Axel Brunnbauer, Marcel Hussing, Michal Nauman, Pieter Abbeel, Radu Grosu, Eric Eaton, Amir-massoud Farahmand, Igor Gilitschenski (membre du corps professoral de Vector)

Abstrait: 

Les méthodes d'apprentissage de politiques basées sur la fonction de score, telles que REINFORCE et PPO, ont obtenu d'excellents résultats dans les jeux et la robotique. Cependant, leur grande variance compromet souvent la stabilité de l'entraînement. L'utilisation des gradients de politique par trajectoire, c'est-à-dire le calcul d'une dérivée par différentiation de la fonction objectif, atténue les problèmes de variance. Néanmoins, ces méthodes nécessitent une fonction de valeur précise conditionnée par l'action, notoirement difficile à apprendre sans recourir à des tampons de relecture pour réutiliser les données hors stratégie passées. Nous présentons un algorithme en stratégie qui entraîne des modèles de valeur Q uniquement à partir de trajectoires en stratégie, ouvrant ainsi la voie à l'utilisation de mises à jour de politique par trajectoire dans le contexte de l'apprentissage en stratégie. Nous montrons comment combiner des politiques stochastiques pour l'exploration avec des mises à jour contraintes pour un entraînement stable, et nous évaluons les composants architecturaux importants qui stabilisent l'apprentissage de la fonction de valeur. Le résultat, l'optimisation de politique par trajectoire à entropie relative (REPPO), est un algorithme en stratégie efficace qui combine la stabilité des gradients de politique par trajectoire avec la simplicité et la faible empreinte mémoire de l'apprentissage en stratégie standard. Comparé aux méthodes de pointe sur deux benchmarks parallélisés GPU standard, REPPO offre de solides performances empiriques avec une efficacité d'échantillonnage, un temps d'exécution, une empreinte mémoire et une robustesse des hyperparamètres supérieurs.

En bref : REPPO utilise une estimation directe du gradient via une fonction Q de substitution pour obtenir des gradients de politique plus précis.

SANA-Vidéo : Génération vidéo efficace avec transformateur de diffusion linéaire par blocs

Junsong Chen, Yuyang Zhao, Jincheng YU, Ruihang Chu, Junyu Chen, Shuai Yang, Xianbang Wang, Yicheng Pan, Zhou Daquan, Huan Ling, Haozhe Liu, Hongwei Yi, Hao Zhang, Muyang Li, Yukang Chen, Han Cai, Sanja Fidler (membre du corps professoral vectoriel), Ping Luo, Song Han, Enze Xie

Abstrait:

Nous présentons SANA-Video, un modèle de diffusion compact capable de générer efficacement des vidéos jusqu'à une résolution de 720×1280 et d'une durée d'une minute. SANA-Video synthétise des vidéos longues, de haute qualité et en haute résolution, avec un alignement texte-image optimal, à une vitesse remarquable, et est déployable sur GPU RTX 5090. Deux éléments clés garantissent l'efficacité et la longueur de notre génération vidéo : (1) DiT linéaire : nous utilisons l'attention linéaire comme opération centrale, plus efficace que l'attention classique compte tenu du grand nombre de jetons traités lors de la génération vidéo. (2) Cache KV à mémoire constante pour l'attention linéaire par blocs : nous concevons une approche autorégressive par blocs pour la génération de vidéos longues en employant un état à mémoire constante, dérivé des propriétés cumulatives de l'attention linéaire. Ce cache KV fournit au DiT linéaire un contexte global à un coût mémoire fixe, éliminant ainsi le besoin d'un cache KV traditionnel et permettant une génération vidéo efficace d'une minute. De plus, nous explorons des filtres de données et des stratégies d'entraînement de modèle efficaces, réduisant ainsi le coût d'entraînement à 12 jours sur 64 GPU H100, soit seulement 1 % du coût de MovieGen. Grâce à son faible coût, SANA-Video offre des performances compétitives par rapport aux modèles de diffusion de pointe (par exemple, Wan 2.1-1.3B et SkyReel-V2-1.3B), tout en étant 16 fois plus rapide en termes de latence mesurée. Par ailleurs, SANA-Video peut être déployé sur des GPU RTX 5090 avec une précision NVFP4, accélérant la génération d'une vidéo 720p de 5 secondes de 71 s à 29 s (gain de vitesse de 2,4x). En résumé, SANA-Video permet une génération vidéo de haute qualité à faible coût. Le code et le modèle seront publiés.

SAGA : Alignement guidé par agrégation structurelle avec sélection dynamique de l’ordre des vues et des voisinages pour l’adaptation au domaine de graphes multivues

Ruiyi Fang, Jingyu Zhao, Shuo Wang, Ruizhi Pu, Bingheng Li, Jiale Cai, Zhihao Li, Zihao Jing, Jian Zhu, Song Tang, Charles Ling (ancien affilié de la faculté Vector), Boyu Wang (affilié de la faculté Vector)

Abstrait: 

L'adaptation de domaine de graphes (GDA) transfère des connaissances d'un graphe source étiqueté vers un graphe cible non étiqueté afin de pallier le manque d'étiquettes. Dans les graphes multi-vues, la difficulté d'atténuer le décalage de domaine est accentuée par les informations structurelles présentes dans les différentes vues. De plus, au sein de chaque vue, les structures à différents niveaux capturent des voisinages distincts, ce qui peut engendrer des divergences structurelles variables. Or, les méthodes existantes supposent généralement une structure de graphe à vue unique, ce qui ne permet pas de capturer efficacement la richesse des informations structurelles des graphes multirelationnels et nuit aux performances d'adaptation. Dans cet article, nous abordons le problème complexe de l'adaptation de domaine de graphes multi-vues (MGDA) en proposant l'alignement guidé par agrégation structurelle (SAGA), qui aligne les données de graphes multi-vues grâce à une sélection dynamique de l'ordre des vues et des voisinages. Plus précisément, nous proposons la notion de distance d'agrégation structurelle (SAD) comme mesure de divergence dynamique qui prend en compte conjointement l'ordre des vues et des voisinages, permettant ainsi à la paire vue-ordre dominante de varier au cours de l'apprentissage. Par une analyse empirique, nous justifions la validité de SAD et montrons que la divergence de domaine dans MGDA est largement déterminée par la paire vue-ordre dominante, qui évolue au cours de l'entraînement. Motivés par cette observation, nous concevons SAGA, qui exploite SAD pour identifier dynamiquement la paire vue-ordre principale guidant l'alignement, caractérisant et atténuant ainsi efficacement les divergences structurelles, tant au niveau des vues que des sauts, entre les graphes multi-vues. Les résultats expérimentaux obtenus sur divers ensembles de données de référence de graphes multirelationnels confirment l'efficacité de notre méthode.

Diffusion spatio-temporelle SE(3) évolutive pour la dynamique protéique à long terme

Nima Shoghi, Yuxuan Liu, Yuning Shen, Rob Brekelmans (ancien chercheur postdoctoral distingué Vector), Pan Li, Quanquan Gu

Abstrait:

Les simulations de dynamique moléculaire (DM) demeurent la méthode de référence pour l'étude de la dynamique des protéines, mais leur coût de calcul limite l'accès aux échelles de temps biologiquement pertinentes. Les modèles génératifs récents se sont montrés prometteurs pour l'accélération des simulations, mais peinent à générer des trajectoires à long terme en raison de contraintes architecturales, d'une accumulation d'erreurs et d'une modélisation insuffisante de la dynamique spatio-temporelle. Nous présentons STAR-MD (Spatio-temporal Autorégressive Rollout for Molecular Dynamics), un modèle de diffusion SE(3)-équivariant et évolutif, capable de générer des trajectoires protéiques physiquement plausibles sur des échelles de temps de l'ordre de la microseconde. Notre innovation majeure réside dans un transformateur de diffusion causal avec attention spatio-temporelle conjointe, qui capture efficacement les dépendances spatio-temporelles complexes tout en évitant les goulots d'étranglement de la mémoire des méthodes existantes. Sur l'ensemble de données de référence ATLAS, STAR-MD atteint des performances de pointe pour tous les indicateurs, améliorant considérablement la couverture conformationnelle, la validité structurale et la fidélité dynamique par rapport aux méthodes précédentes. STAR-MD réussit à extrapoler avec succès pour générer des trajectoires stables à l'échelle de la microseconde, là où les méthodes de référence échouent lamentablement, tout en maintenant une qualité structurelle élevée tout au long du déploiement étendu. Notre évaluation complète révèle de sérieuses limites des modèles actuels pour la génération à long terme, tout en démontrant que la modélisation spatio-temporelle conjointe de STAR-MD permet une simulation dynamique robuste à des échelles de temps biologiquement pertinentes, ouvrant la voie à une exploration accélérée de la fonction des protéines.

TLDR : Un modèle de diffusion SE(3) spatio-temporel évolutif qui génère des trajectoires de protéines à long terme avec une fidélité de pointe.

SPIKE-RL : Les modèles linéaires linéaires vidéo rencontrent la surprise bayésienne

Sahithya Ravi, Aditya Chinchure, Raymond Ng, Leonid Sigal (membre du corps professoral de Vector), Vered Shwartz (membre du corps professoral de Vector)

Abstrait: 

Les vidéos du monde réel montrent souvent des activités routinières ponctuées d'événements mémorables et surprenants. Cependant, la plupart des modèles linéaires latents vidéo (Video-LLM) traitent les vidéos en échantillonnant uniformément les images, ce qui risque de faire manquer des moments cruciaux qui définissent le récit d'une vidéo. Nous introduisons SPIKE, un cadre d'inférence qui quantifie la surprise bayésienne comme la mise à jour des croyances déclenchée par de nouvelles preuves visuelles dans le flux vidéo, identifiant ainsi les moments où ces nouvelles preuves contredisent les croyances initiales. SPIKE localise efficacement la surprise dans les vidéos, avec des performances corrélées à celles des humains sur des benchmarks de surprise positive (FunQA) et négative (Oops!). SPIKE-RL améliore encore la capacité de SPIKE à détecter la surprise, en utilisant GRPO pour affiner ses hypothèses de croyance à partir d'un signal de récompense provenant de la légende de la vidéo. SPIKE et SPIKE-RL guident un échantillonnage d'images pondéré par la surprise, indépendant de la requête, ce qui alloue davantage d'images aux moments intéressants de la vidéo. Grâce à cette stratégie, nous obtenons des gains de rendement constants sur cinq points de référence en aval. En permettant aux Video-LLM de suivre les croyances et d'enregistrer la surprise, nos travaux ouvrent la voie à des modèles plus robustes capables de réviser leur compréhension en réponse à de nouvelles informations.

En bref : nous rendons les plateformes de formation en ligne pour les étudiants en droit vidéo (Video-LLM) plus réactives aux surprises en suivant l’évolution des croyances dans les vidéos.

StreamSplat : Vers une reconstruction 3D dynamique en ligne à partir de flux vidéo non calibrés

Zike Wu, Qi Yan, Xuanyu Yi, Lele Wang, Renjie Liao (membre du corps professoral de Vector)

Abstrait: 

La reconstruction en temps réel de scènes 3D dynamiques à partir de flux vidéo non calibrés exige des méthodes en ligne robustes capables de reconstituer la dynamique de la scène à partir d'observations éparses, sous des contraintes strictes de latence et de mémoire. Or, la plupart des méthodes de reconstruction dynamique nécessitent plusieurs heures d'optimisation par scène avec un accès à la séquence complète, ce qui limite leur déploiement pratique. Dans ce travail, nous présentons **StreamSplat**, un cadre entièrement feed-forward qui transforme instantanément des flux vidéo non calibrés de longueur arbitraire en représentations 3D dynamiques par projection gaussienne (3DGS), et ce, en ligne. Ce résultat est obtenu grâce à trois innovations techniques clés : 1) un mécanisme d'échantillonnage probabiliste qui prédit de manière robuste des gaussiennes 3D à partir d'entrées non calibrées ; 2) un champ de déformation bidirectionnel qui assure des associations fiables entre les images et atténue l'accumulation d'erreurs à long terme ; 3) une opération de fusion gaussienne adaptative qui propage les gaussiennes persistantes tout en gérant celles qui émergent ou disparaissent. Des expériences approfondies sur des ensembles de données dynamiques et statiques standards démontrent que StreamSplat atteint une qualité de reconstruction et une modélisation de scènes dynamiques de pointe. Notre méthode se distingue par sa capacité unique à reconstruire en ligne des flux vidéo de longueur arbitraire, avec une accélération de 1 200 fois par rapport aux méthodes d'optimisation. Notre code et nos modèles seront mis à la disposition du public.

En bref : nous avons proposé un cadre efficace, évolutif et à propagation directe pour la reconstruction 3D dynamique en ligne.

StructEval : Évaluation comparative des capacités des LLM à produire des résultats structurels

Jialin Yang, Dongfu Jiang, Wenhu Chen (membre du corps professoral de Vector), Ping Nie

Abstrait:

As Large Language Models (LLMs) become integral to software development workflows, their ability to generate structured outputs has become critically important. We introduce $\textbf{StructEval}$, a comprehensive benchmark for evaluating LLMs’ capabilities in producing both non-renderable (JSON, YAML, CSV) and renderable (HTML, React, SVG) structured formats. Unlike prior benchmarks, StructEval systematically evaluates structural fidelity across diverse formats through two paradigms: $\textbf{1)}$ generation tasks, producing structured output from natural language prompts, and $\textbf{2)}$ conversion tasks, translating between structured formats. Our benchmark encompasses 18 formats and 44 types of task, with novel metrics for format adherence and structural correctness. Results reveal significant performance gaps—even state-of-the-art models like o1-mini achieve only $75.58$ average score, with open-source alternatives lagging approximately $10$ points behind. We find generation tasks more challenging than conversion tasks, and producing correct visual content more difficult than generating text-only structures.

Hyperréseaux graphiques sensibles à la structure pour la synthèse de programmes neuronaux

Wenhao Li, Yudong Xu, Elias Khalil (ancien membre affilié de la faculté Vector), Scott Sanner (membre affilié de la faculté Vector)

Abstrait: 

We study the neural program synthesis of $\textit{parameterized}$ function families through the lens of meta-learning with hypernetworks. Given a user intent $U$, a meta-learner $M_{\phi}$ produces a full weight set $\hat{\theta}=M_{\phi}(U)$ for a target neural network with fixed architecture $S$, and the instantiated network $m_{S,\hat{\theta}}(X)\to Y$ realizes the behavior intended for $U$. Classical hypernetworks typically $\textit{ignore the target network’s structure}$ and emit a flat list of weights; as a consequence, they fail to account for $\textit{neuron-permutation symmetry}$—many distinct parameterizations of $S$ implement the same function—so equivalent solutions are treated as different targets, fragmenting supervision and hurting out-of-distribution generalization. To address this, we propose $\textit{Meta-GNN}$, a hypernetwork that constructs a $\textit{neural graph}$ from the target architecture $S$ and applies $\textbf{structure-aware}$ message passing with parameter-tied encoders and decoders. This design reduces the search space during learning by collapsing equivalent classes of target networks, without loss of expressivity. Empirically, across modular arithmetic ($\textit{AddMod}$-$p$), array operations ($\textit{SumFirst}$-$n$), and inverse-rule tasks from 1D-ARC, $\textit{Meta-GNN}$ substantially improves learning and $\textbf{out-of-distribution generalization}$ compared to classic hypernetworks and direct $(U,X)\to Y$ baselines. Mechanistic analyses reveal $\textit{what is learned}$: on $\textit{AddMod}$-$p$ the synthesized Transformers recover the canonical clock representation and admit a compact closed-form map $U\mapsto\theta$. These results demonstrate that structure-aware Meta-GNNs enable reliable generalization to $\textit{unseen program parameterizations}$, providing a critical advance for the nascent field of neural program synthesis.

En bref : nous montrons qu’un hyperréseau sensible à la structure peut générer directement des poids de réseau neuronal complets — en traitant les poids comme une modalité de programme continue — et surpasser les références avec une forte généralisation zéro-shot sur des tâches non vues.

Adaptation en temps réel des agents LLM via l'interaction avec l'environnement

Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong (membre du corps professoral de Vector), Caiming Xiong

Abstrait: 

Les agents basés sur des modèles de langage étendus (LLM) ont du mal à généraliser à des environnements nouveaux et complexes, tels que des sites Web inédits ou de nouveaux ensembles de fonctions, en raison d'une inadéquation fondamentale entre leurs conditions de pré-entraînement et celles de test. Ce problème découle de deux modes d'échec distincts : une mauvaise compréhension syntaxique des composants spécifiques à l'environnement, comme les formats d'observation, et une mauvaise compréhension sémantique de la dynamique des transitions d'état, qui ne sont révélées qu'au moment du test. Pour y remédier, nous proposons deux stratégies distinctes et complémentaires d'adaptation des agents LLM, exploitant les informations spécifiques à l'environnement disponibles lors du déploiement. Premièrement, une méthode d'adaptation distributionnelle en ligne paramétrise les nuances environnementales en apprenant un vecteur d'adaptation léger qui biaise la distribution de sortie du modèle, permettant un alignement rapide avec le format de réponse de l'environnement. Deuxièmement, une méthode d'ancrage dynamique au moment du déploiement utilise une phase d'exploration guidée par le profil de l'agent pour sonder et apprendre systématiquement la dynamique causale de l'environnement avant l'exécution des tâches, dotant ainsi l'agent d'un modèle du monde non paramétrique. Nous évaluons ces stratégies sur divers benchmarks d'agents, notamment l'appel de fonctions et la navigation web. Nos résultats empiriques démontrent l'efficacité des deux stratégies sur l'ensemble des benchmarks, pour un coût de calcul minimal. Nous constatons que l'ancrage dynamique est particulièrement efficace dans les environnements complexes où l'imprévisibilité des dynamiques constitue un obstacle majeur, ouvrant la voie à des agents basés sur les modèles linéaires à longue portée (LLM) plus performants et généralisables. Par exemple, sur le jeu de simulation multisite WebArena, cette méthode augmente le taux de réussite de l'agent de 2 % à 23 %.

En bref : nous proposons un cadre appelé adaptation en temps de test ancrée pour adapter les agents basés sur LLM à des environnements nouveaux et complexes.

Propagation de l'équilibre textuel pour les systèmes d'IA composés profonds

Minghui Chen, Wenlong Deng, James Y Zou, Han Yu, Xiaoxiao Li (membre du corps professoral de Vector)

Abstrait: 

Les grands modèles de langage (LLM) sont de plus en plus déployés au sein de systèmes d'IA complexes qui coordonnent de multiples modules (par exemple, des extracteurs, des outils, des vérificateurs) sur des flux de travail à long terme. Bien que les frameworks récents qui propagent globalement la rétroaction textuelle (par exemple, TextGrad) permettent d'optimiser ces pipelines, nous avons identifié deux modes de défaillance liés à la mise à l'échelle en profondeur dans les flux de travail agentiques à long terme : 1) l'explosion du gradient textuel, où le retour d'information textuel croît exponentiellement avec la profondeur, ce qui entraîne des messages excessivement longs et amplifie les biais d'évaluation ; et 2) la disparition du gradient textuel, où la capacité limitée à gérer le contexte long conduit les modèles à survaloriser les retours d'information récents ou précoces, tandis que la compression des retours d'information longs entraîne une perte progressive de spécificité des messages en aval lors de leur propagation en amont. Pour atténuer ces problèmes, nous introduisons la propagation d'équilibre textuel (TEP), un principe d'apprentissage local inspiré de la propagation d'équilibre dans les modèles énergétiques. TEP comprend deux phases : 1) une phase libre où des critiques LLM locales affinent itérativement les invites jusqu'à atteindre un équilibre (aucune amélioration supplémentaire n'est suggérée) ; et 2) une phase d'ajustement qui applique des modifications d'invites proximales avec une intensité de modification limitée, en utilisant des objectifs au niveau de la tâche qui se propagent par signalisation directe plutôt que par rétropropagation. Cette conception permet une optimisation locale des invites suivie d'une adaptation contrôlée vers des objectifs globaux, sans la charge de calcul ni la dégradation du signal associée à la rétropropagation textuelle globale. Sur des benchmarks QA à long terme et un ensemble de données d'utilisation d'outils multiagents, TEP améliore systématiquement la précision et l'efficacité par rapport aux méthodes de propagation globales telles que TextGrad, avec des gains qui augmentent avec la profondeur, tout en préservant la commodité des composants LLM « boîte noire » dans un système d'IA complexe et profond.

Plus épais et plus rapide : le jeton géant pour des transformateurs de vision simple rapides

Anthony Fuller, Yousef Yassin, Daniel Kyrollos, Evan Shelhamer (membre du corps professoral de Vector), James Green

Abstrait: 

Les ViT sont généraux et précis, et couvrent de nombreuses tâches, mais ils sont lents et ne sont pas toujours pratiques lorsque l'efficacité est primordiale. Les méthodes existantes pour accélérer les ViT conçoivent des architectures hybrides non-ViT, perdant ainsi en généralité, ou réduisent la taille de leurs jetons, sacrifiant la précision. Bien que de nombreuses architectures non-ViT soient à la fois rapides et précises, elles ne peuvent pas traiter avec flexibilité d'autres formes d'entrée, être pré-entraînées par apprentissage autosupervisé de pointe, réduire les calculs en supprimant des jetons, et offrir d'autres fonctionnalités des ViT. Nous accélérons les ViT en réduisant la largeur des jetons de patch tout en augmentant la largeur globale des jetons grâce à l'ajout d'un nouveau jeton Jumbo. Ce jeton Jumbo, plus large, est traité par son propre FFN plus large afin d'accroître la capacité du modèle. Cependant, notre FFN Jumbo est efficace : il traite un seul jeton, pour plus de rapidité, et ses paramètres sont partagés entre toutes les couches, pour une meilleure gestion de la mémoire. Surtout, notre jeton Jumbo est basé uniquement sur l'attention et non hiérarchique, comme un ViT classique ; il est donc simple, évolutif, flexible et compatible avec les méthodes ViT, anciennes comme nouvelles. Jumbo surpasse les modèles de référence ViT avec des registres allant de l'échelle nano à l'échelle grande, tout en maintenant une vitesse et un débit élevés sur ImageNet-1K (augmentation de 0,1 à 13 %). Jumbo améliore également l'erreur absolue moyenne (MAE) lors du préentraînement (augmentation de 4,9 % pour le sondage linéaire sur ImageNet-1K), l'adaptation lors des tests (augmentation de 5,2 % sur ImageNet-C) et la modélisation des séries temporelles. Nos modèles Jumbo offrent même un meilleur compromis vitesse-précision que les modèles spécialisés non-ViT à faible consommation de calcul, tout en conservant la compatibilité avec ViT standard pour une utilisation pratique.

En bref : on ajoute un nouveau jeton « Jumbo » plus large à ViTs afin d’améliorer la précision et l’efficacité en augmentant la capacité du modèle de manière optimale tout en préservant sa généralité.

Couler ou ne pas couler : les voies d’information visuelle dans les grands modèles vision-langage

Jiayun Luo, Wan-Cyuan (Chris) Fan, Lyuyang Wang, Xiangteng He, Tanzila Rahman (ancienne boursière postdoctorale distinguée de Vector), Purang Abolmaesumi, Leonid Sigal (membre du corps professoral de Vector)

Abstrait: 

Les modèles de langage visuel de grande taille (LVLM) sont apparus récemment comme des architectures puissantes capables de comprendre et de raisonner sur des informations visuelles et textuelles. Ces modèles reposent généralement sur deux composantes clés : un transformateur de vision (ViT) et un modèle de langage de grande taille (LLM). Le ViT encode le contenu visuel en une séquence de jetons d'image et sert de front-end perceptif – les yeux du modèle. À l'inverse, le LLM interprète ces jetons pour effectuer un raisonnement de haut niveau, générer des réponses et fonctionne comme le noyau cognitif – le cerveau du modèle. Cependant, on ignore encore quels jetons visuels contribuent le plus à la compréhension et au raisonnement, et comment ces signaux sont efficacement propagés du ViT au LLM. Alors que la plupart des travaux existants se sont concentrés sur l'identification des « puits d'attention », des jetons à faible sémantique recevant une attention disproportionnée au sein du LLM, nous déplaçayons l'attention vers l'encodeur visuel en identifiant une classe de jetons visuels à norme élevée provenant du ViT, que nous appelons « puits d'attention du ViT » – un problème peu étudié mais pourtant crucial pour les LVLM. Nos résultats montrent que ces puits d'attention ViT encapsulent des concepts sémantiques de haut niveau issus des images, permettant ainsi au modèle de langage (LLM) d'effectuer une compréhension et un raisonnement plus efficaces. Malgré leur importance, ces puits sont souvent négligés dans les architectures LVLM existantes. Afin d'explorer leur contribution, nous présentons des analyses qualitatives et quantitatives des informations qu'ils contiennent. Nous proposons également des approches avec et sans apprentissage pour mieux exploiter la manière dont le LLM interprète ces informations, et dans quelle mesure. En utilisant explicitement ces puits, nous démontrons des améliorations substantielles pour un large éventail de LVLM et de tâches de raisonnement visuel, notamment la résolution de problèmes mathématiques, l'inférence logique et la compréhension géométrique, soulignant ainsi le potentiel inexploité des puits d'attention ViT pour améliorer le raisonnement visuel.

Récompense cachée par jeton : Orientation de l’exploration et de l’exploitation dans l’apprentissage par renforcement profond relatif au groupe

Wenlong Deng, Yi Ren, Yushu Li, Boying Gong, Danica Sutherland, Xiaoxiao Li (membre du corps professoral de Vector), Christos Thrampoulidis

Abstrait: 

L'apprentissage par renforcement avec récompenses vérifiables a considérablement amélioré les capacités de raisonnement des grands modèles de langage. Cependant, la question de savoir comment orienter explicitement l'entraînement vers l'exploration ou l'exploitation reste ouverte. Nous introduisons la Récompense Cachée de Jeton (RCJ), une métrique au niveau du jeton qui quantifie l'influence de chaque jeton sur la probabilité de réponses correctes dans le cadre de l'Optimisation de Politique Relative de Groupe (OPRG). Nous constatons que la dynamique d'entraînement est dominée par un petit sous-ensemble de jetons présentant des valeurs de RCJ élevées. Plus intéressant encore, les jetons avec une RCJ positive renforcent la confiance dans les réponses correctes, favorisant ainsi l'exploitation, tandis que les jetons avec une RCJ négative préservent la probabilité des réponses alternatives, permettant l'exploration. Cette observation suggère une intervention naturelle : un algorithme de repondération guidé par la RCJ qui module les signaux d'apprentissage de l'OPRG afin d'orienter explicitement l'entraînement vers l'exploitation ou l'exploration. Nous validons l'efficacité de cet algorithme sur divers ensembles de données de raisonnement mathématique. En amplifiant les jetons avec une valeur de RCJ positive et en atténuant ceux avec une valeur négative, notre algorithme améliore la précision du décodage glouton, favorisant ainsi l'exploitation. La stratégie inverse permet d'obtenir des gains constants en précision Pass@K, favorisant l'exploration. Nous démontrons également que notre algorithme s'intègre parfaitement à d'autres objectifs d'apprentissage par renforcement, tels que GSPO, et se généralise à différentes architectures, notamment Llama. Ces résultats établissent THR comme un mécanisme rigoureux et précis pour contrôler dynamiquement l'exploration et l'exploitation dans les modèles linéaires à longue portée optimisés par l'apprentissage par renforcement, offrant ainsi de nouveaux outils pour un réglage fin ciblé dans les applications à forte intensité de raisonnement.

TrustGen : une plateforme d'évaluation dynamique de la fiabilité des modèles de fondation génératifs

Yue Huang, Chujie Gao, Siyuan Wu, Haoran Wang, Xiangqi Wang, Jiayi Ye, Yujun Zhou, Yanbo Wang, Jiawen Shi, Qihui Zhang, Han Bao, Zhaoyi Liu, Yuan Li, Tianrui Guan, Peiran Wang, Haomin Zhuang, Dongping Chen, Kehan ​​Guo, Andy Zou, Bryan Hooi, Caiming Xiong, Elias Stengel-Eskin, Hongyang Zhang (membre du corps professoral de Vector), Hongzhi Yin, Huan Zhang, Huaxiu Yao, Jieyu Zhang, Jaehong Yoon, Kai Shu, Ranjay Krishna, Swabha Swayamdipta, Weijia Shi, Xiang Li, Yuexing Hao, Zhihao Jia, Zhize Li, Xiuying Chen, Zhengzhong Tu, Xiyang Hu, Tianyi Zhou, Jieyu Zhao, Lichao Sun, Furong Huang ou Cohen-Sasson, Prasanna Sattigeri, Anka Reuel, Max Lamparth, Yue Zhao, Nouha Dziri, Yu Su, Huan Sun, Heng Ji, Chaowei Xiao, Mohit Bansal, Nitesh Chawla, Jian Pei, Jianfeng Gao, Michael Backes, Philip Yu, Neil Gong, Pin-Yu Chen, Bo Li, Dawn Song, Xiangliang Zhang

Abstrait: 

Les modèles de base génératifs (GenFM), tels que les grands modèles de langage et les systèmes de conversion texte-image, ont démontré des capacités remarquables dans diverses applications en aval. Leur déploiement croissant dans des applications critiques rend l'évaluation de leur fiabilité à la fois essentielle et complexe. Les méthodes d'évaluation existantes sont fragmentées, rapidement désuètes et souvent difficilement extensibles à d'autres modalités. Ceci soulève une question fondamentale : comment évaluer de manière systématique, fiable et continue la fiabilité des GenFM en constante évolution, à travers diverses modalités et cas d'utilisation ? Pour combler ces lacunes, nous présentons TrustGen, un système d'évaluation comparative dynamique et modulaire conçu pour évaluer systématiquement la fiabilité des GenFM dans les modalités de conversion texte-image, de grands modèles de langage et de vision-langage. TrustGen standardise l'évaluation de la confiance grâce à une taxonomie unifiée de plus de 25 dimensions précises – dont la véracité, la sécurité, l'équité, la robustesse, la confidentialité et l'éthique des machines – tout en prenant en charge la génération dynamique de données et l'évaluation adaptative grâce à trois modules principaux : Métadata Curator, Test Case Builder et Contextual Variator. L'utilisation de TrustGen pour évaluer la fiabilité de 39 modèles révèle quatre principaux enseignements : (1) Les GenFM de pointe atteignent des performances de confiance globales prometteuses, mais des limites importantes persistent dans certaines dimensions, telles que la résistance aux hallucinations, l'équité et la préservation de la vie privée. (2) Contrairement aux idées reçues, les modèles open source rivalisent désormais avec les systèmes propriétaires et les surpassent parfois en termes de fiabilité. (3) L'écart de confiance entre les modèles les plus performants diminue, probablement en raison d'une convergence accrue du secteur sur les meilleures pratiques. (4) La fiabilité n'est pas une propriété isolée ; elle interagit de manière complexe avec d'autres comportements, comme l'utilité et la prise de décision éthique. TrustGen représente une étape transformatrice vers une évaluation de la fiabilité standardisée, évolutive et exploitable, prenant en charge des évaluations dynamiques selon diverses modalités et dimensions de confiance qui évoluent au rythme de l'évolution de l'IA générative.

Comprendre et améliorer les shampoings et les savons grâce à la minimisation de Kullback-Leibler

Wu Lin (ancien boursier postdoctoral émérite de Vector), Scott C Lowe (boursier postdoctoral émérite de Vector), Felix Dangel (ancien boursier postdoctoral émérite de Vector), Runa Eschenhagen, Zikun Xu, Roger Grosse (membre du corps professoral de Vector)

Abstrait: 

Shampoo et sa variante SOAP, stabilisée par Adam, utilisent une estimation structurée du deuxième moment et ont suscité un intérêt croissant pour leur efficacité. En pratique, Shampoo nécessite l'utilisation d'Adam pour ajuster le pas d'intégration et atteindre des performances compétitives. SOAP atténue ce problème en appliquant Adam à la base propre de Shampoo, réduisant ainsi le temps d'exécution par itération. Cependant, le recours à Adam entraîne une surcharge de mémoire supplémentaire dans les deux méthodes. Les interprétations théoriques antérieures ont principalement examiné leurs schémas d'estimation à l'aide de la norme de Frobenius. Motivés par la correspondance naturelle entre le deuxième moment et une matrice de covariance, nous réinterprétons les procédures d'estimation de Shampoo et SOAP comme des cas d'estimation de covariance à travers le prisme de la minimisation de la divergence de Kullback-Leibler (KL). Cette perspective révèle une limite théorique jusqu'alors négligée et justifie des améliorations de principe de leur conception. En nous basant sur la perspective KL, nous proposons des schémas d'estimation pratiques – KL-Shampoo et KL-SOAP – dont les performances égalent, voire surpassent, celles de Shampoo et SOAP pour le préentraînement de divers modèles de réseaux de neurones, tout en conservant un temps d'exécution par itération comparable à celui de SOAP. Notamment, KL-Shampoo ne compte pas sur Adam pour atteindre des performances supérieures, évitant ainsi la surcharge de mémoire associée. Étonnamment, KL-Shampoo surpasse systématiquement les autres méthodes dans nos expériences.

En bref : Une nouvelle perspective Kullback-Leibler pour interpréter et améliorer Shampoo et SOAP

UniEdit-Flow : Libérer le potentiel de l’inversion et de l’édition à l’ère des modèles de flux

Guanlong Jiao, Biqing Huang, Kuan-Chieh Wang, Renjie Liao (membre du corps professoral de Vector)

Abstrait: 

Les modèles de correspondance de flux se sont imposés comme une alternative performante aux modèles de diffusion, mais les méthodes d'inversion et d'édition existantes, conçues pour la diffusion, sont souvent inefficaces ou inapplicables. Les trajectoires rectilignes et non croisées des modèles de flux constituent un défi pour les approches basées sur la diffusion, mais ouvrent également la voie à de nouvelles solutions. Dans cet article, nous présentons un cadre d'inversion et d'édition pour les modèles de flux, basé sur un système prédicteur-correcteur. Nous proposons d'abord Uni-Inv, une méthode d'inversion efficace conçue pour une reconstruction précise. À partir de là, nous étendons le concept d'injection différée aux modèles de flux et introduisons Uni-Edit, une approche d'édition d'images robuste et sensible aux régions. Notre méthodologie est sans réglage, indépendante du modèle, efficace et performante, permettant diverses modifications tout en préservant les régions non concernées. De nombreuses expériences menées sur différents modèles génératifs démontrent la supériorité et la généralisabilité d'Uni-Inv et d'Uni-Edit, même dans des contextes à faible coût.

UniVideo : Compréhension, génération et montage vidéo unifiés

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen (membre du corps professoral de Vector)

Abstrait: 

Les modèles unifiés de compréhension et de génération multimodaux ont montré des résultats prometteurs en génération et en édition d'images, mais restent largement limités au domaine de l'image. Dans ce travail, nous présentons VOGUE, un cadre polyvalent qui étend la modélisation unifiée au domaine vidéo. VOGUE adopte une architecture à double flux, combinant un modèle de langage multimodal étendu (MLLM) pour la compréhension des instructions avec un modèle d'instruction multimodal (MMDiT) pour la génération vidéo. Cette architecture permet une interprétation précise des instructions multimodales complexes tout en préservant la cohérence visuelle. En s'appuyant sur cette architecture, VOGUE unifie diverses tâches de génération et d'édition vidéo sous un paradigme d'instruction multimodal unique et est entraîné conjointement. De nombreuses expériences démontrent que VOGUE égale ou surpasse les méthodes de référence de pointe spécifiques à chaque tâche en matière de compréhension visuelle, de génération de vidéos à partir de texte ou d'images, d'édition et de génération vidéo contextuelles. Au-delà de ces capacités fondamentales, l'architecture unifiée permet à VOGUE de se généraliser à des tâches d'édition libres inédites, comme l'incrustation de personnages sur fond vert ou la composition de tâches originales (par exemple, édition et transfert de style) en une seule instruction. VOGUE est notamment le premier système à prendre en charge la génération vidéo à partir d'instructions visuelles dans un modèle unifié, où le MLLM interprète ces instructions et guide le MMDiT lors de la synthèse. Afin de favoriser les recherches futures, notre modèle et notre code seront mis à disposition.

En bref : un modèle multimodal unifié capable de gérer diverses tâches multimodales

VisCoder2 : Création d’agents de codage de visualisation multilingues

Yuansheng Ni, Songcheng Cai, Xiangchao Chen, Jiarong Liang, Zhiheng Lyu, Jiaqi Deng, Kai Zou, Ping Nie, Fei Yuan, Xiang Yue, Wenhu Chen (membre du corps professoral vectoriel)

Abstrait: 

Les grands modèles de langage (LLM) ont récemment permis le développement d'agents de codage capables de générer, d'exécuter et de corriger du code de visualisation. Cependant, les modèles existants rencontrent souvent des difficultés dans les flux de travail pratiques en raison d'une couverture linguistique limitée, d'une exécution peu fiable et de l'absence de mécanismes de correction itératifs. Les progrès ont été freinés par des ensembles de données restreints et des benchmarks privilégiant la génération en une seule étape et les tâches monolingues. Pour relever ces défis, nous présentons trois ressources complémentaires pour faire progresser les agents de codage de visualisation. **VisCode-Multi-679K** est un ensemble de données supervisé à grande échelle contenant 679 000 exemples de visualisation validés et exécutables, avec des dialogues de correction à plusieurs étapes, dans 12 langages de programmation. **VisPlotBench** est un benchmark pour l'évaluation systématique, comprenant des tâches exécutables, des rendus et des protocoles pour la génération initiale et l'auto-débogage multi-étapes. Enfin, nous présentons **VisCoder2**, une famille de modèles de visualisation multilingues entraînés sur VisCode-Multi-679K. Les expériences montrent que VisCoder2 surpasse de manière significative les références robustes et libres et se rapproche des performances de modèles propriétaires comme GPT-4.1, avec des gains supplémentaires grâce à l'autodébogage itératif, atteignant un taux de réussite d'exécution global de **82,4 %** à l'échelle 32B, en particulier dans les langages symboliques ou dépendants du compilateur.

Lorsque les connaissances préalables se retournent contre leurs auteurs : la vulnérabilité des exemples non apprenables face au préentraînement

Zhihao Li, Gezheng Xu, Jiale Cai, Ruiyi Fang, Di Wu, Qicheng Lao, Charles Ling (ancien affilié de la faculté Vector) Boyu Wang (affilié de la faculté Vector)

Abstrait: 

Les exemples non apprenables (EN) sont présentés comme une stratégie de protection des données générant des perturbations imperceptibles afin d'induire les modèles en erreur et de les amener à apprendre des corrélations fallacieuses plutôt que la sémantique réelle. Dans cet article, nous révélons une vulnérabilité fondamentale des EN qui apparaît lorsque l'apprentissage est initié à partir d'un modèle pré-entraîné. Plus précisément, notre analyse empirique montre que même lorsque les données sont protégées par des perturbations soigneusement conçues, les connaissances a priori acquises lors du préentraînement permettent au modèle de contourner les raccourcis introduits par les EN et de capturer des informations sémantiques à partir des données, annulant ainsi le caractère non apprenable des EN. Pour contrer cet effet, nous proposons $\textbf{BAIT}$ ($\textbf{B}$inding $\textbf{A}$rtificial perturbations to $\textbf{I}$ncorrect $\textbf{T}$argets), une nouvelle formulation d'optimisation à deux niveaux. Le niveau interne reproduit les objectifs UE standard, tandis que le niveau externe impose une association dynamique des perturbations avec des étiquettes incorrectes, induisant ainsi en erreur les connaissances a priori du préentraînement et les empêchant de s'aligner sur la sémantique réelle. Ce mécanisme d'association entre étiquettes incorrectes et perturbations empêche le modèle préentraîné d'établir facilement la relation entre les étiquettes et les données, de sorte que l'apprentissage ne peut pas s'appuyer rapidement sur la sémantique des images et reste dépendant des perturbations. De nombreuses expériences sur des benchmarks standards et plusieurs architectures de base préentraînées démontrent que notre approche produit des UE qui restent efficaces en présence de connaissances a priori du pré-entraînement.

Lorsque le style compromet la sécurité : défendre les LLM contre un alignement superficiel

Yuxin Xiao, Sana Tonekaboni (boursière postdoctorale distinguée Vector), Walter Gerych, Vinith Suriyakumar, Marzyeh Ghassemi

Abstrait: 

Les grands modèles de langage (LLM) peuvent être sollicités avec des styles spécifiques (par exemple, la mise en forme des réponses sous forme de listes), y compris dans des requêtes malveillantes. Les recherches antérieures sur le jailbreak consistent principalement à enrichir ces requêtes de transformations de chaînes supplémentaires afin de maximiser le taux de réussite des attaques (ASR). Cependant, l'impact des modèles de style dans les requêtes originales, sémantiquement non pertinents pour l'intention malveillante, reste flou. Dans ce travail, nous cherchons à comprendre si les modèles de style compromettent la sécurité des LLM, comment un alignement superficiel des styles accroît la vulnérabilité du modèle et comment atténuer au mieux ces risques lors de l'alignement. Nous définissons d'abord l'inflation de l'ASR comme l'augmentation de l'ASR due aux modèles de style dans les requêtes de référence de jailbreak existantes. En évaluant 32 LLM sur sept points de référence, nous constatons que presque tous les modèles présentent une inflation de l'ASR. Notamment, cette inflation est corrélée à l'attention relative portée par un LLM aux modèles de style, qui coïncident également davantage avec ses données d'optimisation des instructions lorsque l'inflation se produit. Nous étudions ensuite l'alignement superficiel des styles et constatons qu'un réglage fin avec des styles spécifiques rend les LLM plus vulnérables aux jailbreaks utilisant ces mêmes styles. Finalement, nous proposons SafeStyle, une stratégie de défense qui intègre un petit volume de données d'entraînement à la sécurité, augmentées pour correspondre à la distribution des modèles de style dans les données d'ajustement fin. Sur trois LLM, six configurations de style d'ajustement fin et deux ensembles de données réels d'ajustement d'instructions, SafeStyle surpasse systématiquement les méthodes de référence en matière de maintien de la sécurité des LLM.

YuE : Mise à l'échelle des modèles de fondation ouverts pour la génération de musique de longue durée

Ruibin Yuan, Hanfeng Lin, Shuyue Guo, Ge Zhang, Jiahao Pan, Yongyi Zang, Haohe Liu, Yiming Liang, Wenye Ma, Xingjian Du, Xeron Du, Zhen Ye, Tianyu Zheng, Zhengxuan Jiang, Yinghao MA, Minghao Liu, Zeyue Tian, ​​Ziya Zhou, Liumeng Xue, Xingwei Qu, Yizhi Li, Shangda Wu, Tianhao Shen, Ziyang Ma, Jun Zhan, Chunhui Wang, Yatian Wang, Xiaowei Chi, Xinyue Zhang, Zhenzhu Yang, XiangzhouWang, Shansong Liu, Lingrui Mei, Peng Li, Junjie Wang, Jianwei Yu, Guojian Pang, Xu Li, Zihao Wang, Xiaohuan Zhou, Lijun Yu, Emmanouil Benetos, Yong Chen, Chenghua Lin, Xie Chen, Gus Xia, Zhaoxiang Zhang, Chao Zhang, Wenhu Chen (membre du corps professoral vectoriel), Xinyu Zhou, Xipeng Qiu, Roger Dannenberg, Jiaheng Liu, Jian Yang, Wenhao Huang, Wei Xue, Xu Tan, Yike Guo

Abstract: We tackle the task of long-form music generation, particularly the challenging \textbf{lyrics-to-song} problem, by introducing \textbf{YuE (乐)}, a family of open-source music generation foundation models. Specifically, YuE scales to trillions of tokens and generates up to five minutes of music while maintaining lyrical alignment, coherent musical structure, and engaging vocal melodies with appropriate accompaniment. It achieves this through \textbf{track-decoupled next-token prediction} to overcome dense mixture signals, and \textbf{structural progressive conditioning} for long-context lyrical alignment. In addition, we redesign the \textbf{in-context learning} technique for music generation, enabling bidirectional content creation, style cloning, and improving musicality. Through extensive evaluation, we demonstrate that YuE matches or even surpasses some of the proprietary systems in musicality and vocal agility (as of 2025-01). We strongly encourage readers to listen to our demo.

En bref : nous adaptons un modèle de génération de chansons ouvert basé sur LM pour égaler les performances des systèmes propriétaires.

Restez branché sur Vector

Restez à l'affût des dernières avancées en matière de recherche, de perspectives de carrière et d'évolutions au sein de la communauté canadienne de l'IA.