Les chercheurs de Vector ont présenté plus de 50 articles à l'ICML 2024.

23 juillet 2024

Rechercher

Les chercheurs de Vector ont présenté plus de 50 articles lors de la Conférence internationale sur l'apprentissage automatique (ICML) 2024. Parmi eux, 35 articles coécrits par des membres du corps professoral de Vector ont été acceptés, ainsi que 15 autres articles d'enseignants-chercheurs affiliés à Vector. Cette année, la conférence a eu lieu à Vienne, en Autriche, du 21 au 27 juillet. 

Parmi les 50 articles, quatre ont été récompensés par le prix du meilleur article :

Vous trouverez ci-dessous des résumés simplifiés des articles acceptés et des séances d'affiches présentées par les membres du corps professoral de Vector. 

Articles acceptés par Vector

Descriptions des articles rédigés par une IA et édités par les coauteurs des articles.

Modèle acteur-critique à horizon adaptatif pour l'apprentissage des politiques dans une simulation différentiable riche en contacts

Modèle acteur-critique à horizon adaptatif pour l'apprentissage des politiques dans une simulation différentiable riche en contacts

Ignat Georgiev, Krishnan Srinivasan, Jie Xu, Eric Heiden, Animesh Garg
Séance d'affichage 4

Cet article présente une nouvelle approche d'apprentissage par renforcement appelée Adaptive Horizon Actor-Critic (AHAC). Les chercheurs ont cherché à améliorer la façon dont les robots apprennent des tâches motrices complexes, comme la marche ou la course.

Les méthodes traditionnelles ont souvent du mal à accomplir ces tâches en raison de la complexité des interactions physiques, en particulier lors des contacts entre objets. AHAC y remédie en adaptant son horizon de planification lors de la prise de décision, en privilégiant des mouvements fluides et en évitant les collisions problématiques. L'équipe a testé AHAC sur diverses simulations de robots, allant de robots sauteurs simples à des humanoïdes complexes. Les résultats ont montré qu'AHAC surpassait les méthodes existantes, avec des performances supérieures de 40 % sur différentes tâches. AHAC s'est avéré particulièrement efficace pour les robots complexes comportant de nombreuses pièces mobiles. Une innovation majeure réside dans la capacité d'AHAC à ajuster son horizon de planification durant l'apprentissage, ce qui lui permet d'éviter les difficultés liées aux prédictions à long terme dans les interactions physiques complexes.

Ces travaux de recherche constituent une avancée significative dans l'apprentissage des robots pour l'exécution de tâches physiques complexes avec une plus grande efficacité. Ils pourraient permettre de créer des robots plus performants et adaptables à diverses applications concrètes.

Alignez vos étapes : Optimisation des plans d’échantillonnage dans les modèles de diffusion

Alignez vos étapes : Optimisation des plans d’échantillonnage dans les modèles de diffusion

Amirmojtaba Sabour, Sanja Fidler, Karsten Kreis
Séance d'affichage 1

Cet article présente « Align Your Steps » (AYS), une nouvelle méthode d'amélioration de l'échantillonnage dans les modèles de diffusion, un type d'IA utilisé pour la génération d'images et de vidéos. Les modèles de diffusion fonctionnent en éliminant progressivement le bruit des données aléatoires, mais ce processus peut être lent et produire des résultats de moindre qualité s'il est exécuté trop rapidement. Les chercheurs ont développé un cadre mathématique pour optimiser le « plan d'échantillonnage », c'est-à-dire les étapes suivies par le modèle lors de la génération d'images. Ils ont constaté qu'en ajustant précisément ces étapes, ils pouvaient améliorer significativement la qualité du contenu généré, notamment en réduisant le nombre d'étapes. L'équipe a testé sa méthode sur diverses tâches, dont la génération de formes 2D, d'images et de vidéos. Dans presque tous les cas, AYS a surpassé les méthodes existantes, produisant des résultats de meilleure qualité avec les mêmes ressources de calcul. Par exemple, pour les tâches de génération d'images, AYS a obtenu des résultats jusqu'à 40 % supérieurs aux méthodes précédentes.

Cette recherche est importante car elle rend les modèles de diffusion plus efficaces, ce qui pourrait permettre de générer du contenu par IA plus rapidement et de meilleure qualité dans diverses applications, de la création artistique à la synthèse vidéo.

Asymétrie des adaptateurs de bas rang des modèles de fondation

Asymétrie des adaptateurs de bas rang des modèles de fondation

Jiacheng Zhu, Kristjan Greenewald, Kimia Nadjahi, Haitz Sáez de Ocáriz Borde, Rickard Gabrielsson, Leshem Choshen, Marzyeh Ghassemi, Mikhail Yurochkin, Justin Solomon
Séance d'affichage 6

Cet article étudie l'asymétrie de l'adaptation de bas rang (LoRA), une méthode courante d'ajustement fin des grands modèles de langage. LoRA adapte les modèles en ajoutant le produit de deux matrices, A et B, aux poids du modèle original. Les chercheurs ont découvert que ces matrices jouent des rôles distincts : A extrait des caractéristiques de l'entrée, tandis que B utilise ces caractéristiques pour générer la sortie souhaitée.

L'étude démontre, tant théoriquement qu'empiriquement, que l'optimisation de la seule matrice B est plus efficace que celle de la seule matrice A. Étonnamment, l'utilisation d'une matrice A aléatoire et non entraînée donne des résultats presque aussi bons qu'une matrice optimisée. Ce résultat suggère que l'optimisation de la seule matrice B permet d'atteindre des performances similaires à celles de l'algorithme LoRA complet, tout en utilisant moins de paramètres.

Les chercheurs ont testé leur approche sur diverses tâches et modèles, notamment RoBERTa, BART, LLaMA-2 et Vision Transformers. Dans la plupart des cas, leur méthode a surpassé LoRA et d'autres méthodes de référence, en particulier avec un nombre réduit d'étapes d'entraînement.

Ce travail est important car il propose une méthode plus efficace pour raffiner les grands modèles de langage, ce qui peut réduire les coûts de calcul et améliorer la généralisation. Il éclaire également comment ces modèles s'adaptent à de nouvelles tâches.

Audit des prédictions personnelles

Audit des prédictions personnelles

Karan Chadha, Matthew Jagielski, Nicolas Papernot, Christopher A. Choquette Choo, Milad Nasresfahani
Séance d'affichage 3

Cet article présente le premier cadre d'audit des algorithmes de prédiction privés en apprentissage automatique. Alors que la confidentialité différentielle fournit des bornes supérieures théoriques sur les fuites de données, ce travail établit des bornes inférieures pratiques grâce à un audit empirique. Les chercheurs se concentrent sur quatre algorithmes : PATE, CaPC, PromptPATE et Private-kNN.

Ce cadre utilise des adversaires aux capacités d'empoisonnement et d'interrogation variables pour évaluer les fuites de données personnelles. De nouvelles techniques sont développées pour évaluer ces fuites en termes de probabilité de fuite de Renyi.

Les principales conclusions sont :

  1. Les analyses actuelles de la confidentialité des prédictions privées peuvent être améliorées.
  2. Les algorithmes plus susceptibles d'être empoisonnés présentent des fuites de données personnelles plus importantes.
  3. Les adversaires qui ne contrôlent pas les requêtes causent moins de fuites de données personnelles que ceux qui ont un contrôle total.

Ce travail est important car il propose un cadre d'audit complet pour les algorithmes de prédiction privés, en complétant les garanties théoriques par des bornes inférieures pratiques. Il aide les chercheurs et les praticiens à mieux comprendre et à améliorer les garanties de confidentialité concrètes des modèles d'apprentissage machine lors de l'inférence.

Peut-on supprimer la racine carrée dans les méthodes de gradient adaptatif ? Une perspective de second ordre

Peut-on supprimer la racine carrée dans les méthodes de gradient adaptatif ? Une perspective de second ordre

Wu Lin, Felix Dangel, Runa Eschenhagen, Juhan Bae, Richard E Turner, Alireza Makhzani
Séance d'affichage 6

Cet article examine la possibilité de supprimer l'opération de racine carrée des méthodes de gradient adaptatif en apprentissage automatique, notamment pour l'entraînement de grands modèles de langage. Les méthodes adaptatives comme Adam sont couramment utilisées pour l'entraînement des transformateurs, mais leurs performances sont souvent inférieures à celles de la descente de gradient stochastique (SGD) sur les réseaux de neurones convolutifs (CNN).

Les chercheurs proposent un cadre théorique appelé « Align Your Steps » (AYS) pour optimiser les plans d’échantillonnage dans les modèles de diffusion sans recourir aux racines carrées. Ils analysent la méthode dans une perspective d’optimisation du second ordre et démontrent son efficacité sur différents modèles et ensembles de données.

Les principales conclusions sont :

  1. AYS comble le fossé de généralisation entre les méthodes adaptatives et SGD sur les CNN.
  2. Elle maintient les performances sur les modèles de transformateurs par rapport aux méthodes basées sur la racine carrée.
  3. AYS permet un entraînement à faible précision pour les méthodes adaptatives matricielles, améliorant ainsi l'efficacité.

Cette étude jette un nouvel éclairage sur les méthodes d'optimisation adaptative, remettant en question la nécessité du calcul de la racine carrée. Elle suggère que l'adaptabilité, et non de simples mises à jour basées sur le signe, joue un rôle crucial dans le succès de ces méthodes. Ces travaux ouvrent de nouvelles perspectives pour le développement d'algorithmes d'optimisation plus efficaces pour l'apprentissage profond.

Bandits causaux : la frontière optimale de Pareto de l’adaptabilité, une réduction aux bandits linéaires et les limitations liées aux marginales inconnues

Bandits causaux : la frontière optimale de Pareto de l’adaptabilité, une réduction aux bandits linéaires et les limitations liées aux marginales inconnues

Ziyi Liu, Daniel Roy, Idan Attias
Séance d'affichage 1

Cet article explore la difficulté d'adaptation aux structures causales dans les problèmes de bandits manchots, un type de scénario de prise de décision. Les chercheurs étudient comment concevoir des algorithmes efficaces aussi bien en présence d'informations causales utiles que dans le cas contraire.

Cette étude introduit le concept de « frontière de regret de Pareto », qui représente les meilleurs compromis possibles entre les performances dans différents environnements. Les auteurs démontrent qu'il est impossible d'atteindre des performances optimales dans tous les scénarios simultanément, mais ils développent un algorithme qui s'approche des meilleurs compromis possibles.

Les chercheurs démontrent également comment réduire les problèmes de bandit causal à des problèmes de bandit linéaire, ce qui permet d'obtenir des solutions plus efficaces dans certains cas. Ils fournissent les premières bornes de regret dépendantes de l'instance pour les bandits causaux, ce qui peut mener à de meilleures performances dans des scénarios spécifiques.

Finalement, l'article examine l'hypothèse courante selon laquelle les algorithmes possèdent une connaissance parfaite de certaines distributions de probabilité. Il démontre que cette hypothèse est nécessaire pour obtenir de meilleures performances, mais qu'un certain niveau de connaissance imparfaite peut néanmoins s'avérer utile.

Ces recherches font progresser notre compréhension de l'inférence causale dans les problèmes de prise de décision et fournissent de nouveaux outils pour la conception d'algorithmes adaptatifs.

Un cadre de calcul pour la résolution des flots lagrangiens de Wasserstein

Un cadre de calcul pour la résolution des flots lagrangiens de Wasserstein

Kirill Neklyudov, Rob Brekelmans, Alexander Tong, Lazar Atanackovic, Qiang Liu, Alireza Makhzani
Séance d'affichage 4

Cet article présente un cadre de calcul unifié pour la résolution des « flots lagrangiens de Wasserstein », qui sont des problèmes d'optimisation sur l'espace des distributions de probabilité minimisant une action lagrangienne donnée, ou « coût ». Par le choix du lagrangien, les flots lagrangiens de Wasserstein englobent les problèmes de transport optimal et leurs variantes, notamment les ponts de Schrödinger, le transport sous contraintes physiques et le transport optimal déséquilibré.  

Les auteurs se concentrent sur les applications en biologie unicellulaire, visant à comprendre l'évolution des populations cellulaires. Le choix du lagrangien permet d'intégrer des connaissances préalables sur la dynamique réelle, de sorte que la solution optimale minimisant les coûts corresponde mieux aux données. Après l'apprentissage, un modèle de réseau neuronal de la dynamique peut être utilisé pour simuler les trajectoires du processus sous-jacent, ce qui peut permettre de prédire les effets d'un traitement ou de comprendre la différenciation cellulaire ou les processus de développement.

Apprentissage par renforcement inverse contraint tenant compte de la confiance

Apprentissage par renforcement inverse contraint tenant compte de la confiance

Sriram Ganapathi Subramanian, Guiliang Liu, Mohammed Elmahgiubi, Kasra Rezaee, Pascal Poupart
Séance d'affichage 4

Cet article présente CA-ICRL (Confidence Aware Inverse Constrained Reinforcement Learning), une approche novatrice dans le domaine de l'apprentissage par renforcement. Cette méthode résout un problème crucial des applications concrètes : l'apprentissage des contraintes à partir de démonstrations d'experts lorsque ces contraintes sont trop nombreuses ou complexes pour être entièrement spécifiées.

CA-ICRL améliore les méthodes existantes d'apprentissage par renforcement inverse contraintes en intégrant une mesure de confiance dans les contraintes apprises. Cela permet aux utilisateurs de spécifier un niveau de confiance souhaité, et l'algorithme apprend des contraintes au moins aussi restrictives que les véritables contraintes sous-jacentes avec ce niveau de confiance.

L'une des innovations majeures de CA-ICRL réside dans sa capacité à déterminer si les démonstrations d'experts disponibles sont suffisantes pour apprendre les contraintes avec les niveaux de confiance et de performance souhaités. Cette fonctionnalité peut guider les utilisateurs dans la collecte de données d'experts supplémentaires, le cas échéant.

Les auteurs démontrent l'efficacité de CA-ICRL par des expériences menées dans divers environnements simulés et dans un scénario de conduite autonome réaliste. La méthode surpasse systématiquement les approches existantes en termes de taux de violation des contraintes et de récompenses obtenues.

Globalement, CA-ICRL offre une approche plus flexible et informative pour l'apprentissage des contraintes à partir de démonstrations, ce qui peut améliorer la sécurité et l'efficacité de l'apprentissage par renforcement dans des applications complexes du monde réel.

Post-traitement différentiellement privé pour une régression équitable

Post-traitement différentiellement privé pour une régression équitable

Ruicheng Xian, Qiaobo Li, Gautam Kamath, Han Zhao
Séance d'affichage 5

Cet article présente un algorithme de post-traitement différentiellement privé pour l'apprentissage de régresseurs équitables respectant la parité statistique. La méthode répond aux préoccupations relatives à la confidentialité des données sensibles et aux enjeux d'équité dans les modèles d'apprentissage automatique.

L'algorithme est composé de trois étapes principales :

  1. Estimation privée des distributions de sortie à l'aide de l'estimation de la densité d'histogramme et du mécanisme de Laplace
  2. Calcul du barycentre de Wasserstein de ces distributions
  3. Utilisation de transports optimaux vers le barycentre pour le post-traitement afin d'obtenir une répartition équitable

Les auteurs proposent une analyse théorique de la complexité d'échantillonnage et des garanties d'équité de l'algorithme. Ils soulignent un compromis entre le biais statistique et la variance induit par le choix du nombre de classes dans l'histogramme. Réduire le nombre de classes améliore systématiquement l'équité, au prix d'une erreur plus importante.

Cette méthode peut être appliquée au post-traitement de tout régresseur afin d'améliorer l'équité en réattribuant ses sorties. Des expériences menées sur les jeux de données Law School et Communities & Crime démontrent l'efficacité de l'algorithme pour concilier la confidentialité, l'équité et la précision.

Ce travail contribue au domaine en pleine expansion de l'apprentissage automatique équitable préservant la vie privée, en proposant une approche flexible qui permet aux praticiens d'ajuster le compromis entre confidentialité, équité et précision en fonction de leurs besoins spécifiques.

Violation déguisée des droits d'auteur des modèles de diffusion latente

Violation déguisée des droits d'auteur des modèles de diffusion latente

Yiwei Lu, Matthew Yang, Zuoqiu Liu, Gautam Kamath, Yaoliang Yu
Séance d'affichage 5

Cet article introduit le concept de violation du droit d'auteur « déguisée » dans les modèles de diffusion latente (MDL), remettant en question la conception actuelle de l'accès à une œuvre protégée. Les auteurs démontrent qu'il est possible de créer des « déguisations » – des images visuellement différentes du contenu protégé, mais partageant des informations latentes similaires lorsqu'elles sont traitées par les MDL.

Cet article présente un algorithme de génération de ces déguisements et montre comment les utiliser pour entraîner des modèles basés sur la modélisation de données latentes (comme l'inversion textuelle et DreamBooth) à reproduire du contenu protégé par le droit d'auteur sans inclure directement les images originales dans l'ensemble d'entraînement. Cela soulève des questions quant aux méthodes actuelles de détection des violations de droits d'auteur dans les données d'entraînement des systèmes d'IA.

Pour remédier à ce problème, les auteurs proposent une notion plus large de « reconnaissance » et introduisent des méthodes de détection telles que la recherche de similarités entre caractéristiques et l’examen des encodeurs-décodeurs. Ces outils pourraient compléter les pratiques d’audit existantes pour les données d’entraînement en IA.

Cette étude a des implications importantes pour le droit d'auteur, la gouvernance de l'IA et le débat actuel sur l'utilisation de matériel protégé par le droit d'auteur dans la formation des modèles d'IA génératifs. Elle plaide pour une compréhension plus nuancée de la notion d'« accès » dans le contexte de la violation du droit d'auteur pour les systèmes d'IA.

Les experts ne trichent pas : apprendre ce qu’on ignore en prédisant des paires

Les experts ne trichent pas : apprendre ce qu’on ignore en prédisant des paires

Daniel D. Johnson, Daniel Tarlow, David Duvenaud, Chris Maddison
Séance d'affichage 4

Cet article présente une approche novatrice pour quantifier l'incertitude dans les modèles génératifs, en s'attaquant à la difficulté de distinguer l'incertitude aléatoire (caractère aléatoire inhérent) de l'incertitude épistémique (manque de connaissances) dans les prédictions probabilistes. Les auteurs proposent d'entraîner les modèles à prédire des paires de réponses indépendantes tirées de la distribution réelle, permettant ainsi au modèle de « tricher » en observant une réponse tout en prédisant l'autre.

L'idée clé est que le degré de « triche » révèle l'incertitude épistémique du modèle. L'article démontre que cette stratégie incite les modèles à se calibrer au second ordre, permettant ainsi une estimation précise des écarts entre les prédictions du modèle et la distribution réelle. Les auteurs introduisent une mesure de « confiance épistémique corrigée de la tricherie » qui peut être utilisée pour filtrer les échantillons potentiellement hallucinés.

Des garanties théoriques sont fournies pour la détection des hallucinations statistiques, et l'approche est démontrée sur des tâches synthétiques, notamment la description des décimales de π et une tâche d'apprentissage par renforcement partiellement observable. La méthode surpasse les techniques de filtrage existantes dans ces scénarios.

Ce travail contribue au domaine de la quantification de l'incertitude dans l'apprentissage machine, offrant une nouvelle perspective sur la manière d'identifier ce qu'un modèle ne sait pas, avec des applications potentielles pour améliorer la sécurité et la fiabilité des systèmes d'IA génératifs.

FedCal : Effectuer un étalonnage local et global dans l’apprentissage fédéré au moyen d’un scaler paramétré agrégé

FedCal : Effectuer un étalonnage local et global dans l’apprentissage fédéré au moyen d’un scaler paramétré agrégé

Hongyi Peng, Han Yu, Xiaoli Tang, Xiaoxiao Li
Séance d'affichage 6

Cet article présente FedCal, une approche novatrice pour l'étalonnage des modèles dans le cadre de l'apprentissage fédéré (FL). Les auteurs soulignent que l'hétérogénéité des données en FL représente un défi majeur pour l'étalonnage des modèles, affectant leurs performances locales et globales. FedCal vise à réaliser une calibration à la fois locale et globale sans recourir à un jeu de données de validation global, souvent impraticable dans les scénarios d'apprentissage fédéré.

La méthode proposée utilise des facteurs d'échelle spécifiques à chaque client pour un étalonnage local, lesquels sont ensuite agrégés pour former un facteur d'échelle global. Cette approche corrige efficacement le désalignement des sorties sans compromettre la précision des prédictions. Les auteurs présentent une analyse théorique démontrant que, malgré la limitation de la variance des distributions d'étiquettes des clients, l'erreur d'étalonnage globale reste asymptotiquement minorée.

Des expériences approfondies menées sur quatre ensembles de données de référence démontrent que FedCal surpasse nettement les méthodes de référence existantes, réduisant l'erreur d'étalonnage globale de 47,66 % en moyenne. La méthode se révèle robuste face à une hétérogénéité croissante des données et peut être intégrée aux cadres FL existants.

FedCal introduit également le concept de « reconnaissance » pour traiter l’accès indirect aux documents protégés par le droit d’auteur en Floride, élargissant ainsi la compréhension de l’utilisation des données dans les environnements d’apprentissage collaboratif.

Les limites fondamentales de l'apprentissage du moindre privilège

Les limites fondamentales de l'apprentissage du moindre privilège

Theresa Stadler, Bogdan Kulynych, Michael Gastpar, Nicolas Papernot, Carmela Troncoso
Séance d'affichage 4

Cet article examine les limites fondamentales de l'apprentissage au moindre privilège en apprentissage machine, notamment dans les contextes où ce sont les représentations des données qui sont partagées plutôt que les données brutes afin d'éviter toute utilisation abusive. Les auteurs proposent la première définition formelle du principe du moindre privilège pour l'apprentissage machine, le concevant comme une limite au gain d'inférence sur les données au-delà de ce qui est déjà révélé par la fuite d'informations fondamentale de la tâche.

Cette recherche met en évidence un compromis crucial : sous des hypothèses réalistes concernant la distribution des données, toute représentation utile à une tâche donnée divulgue inévitablement des informations allant au-delà de ce qui est nécessaire à cette tâche. Ce constat remet en question l’idée qu’il serait possible de créer des représentations utiles à une tâche spécifique sans rien révéler d’autre sur les données sous-jacentes.

Grâce à une analyse théorique et des expériences approfondies menées sur divers ensembles de données, architectures de modèles et techniques d'apprentissage, les auteurs démontrent que ce compromis est fondamental et ne peut être contourné par les méthodes existantes telles que la censure des attributs ou la confidentialité différentielle.

Les conclusions de cet article ont des implications importantes pour l'apprentissage automatique respectueux de la vie privée, suggérant que les approches actuelles visant à limiter l'accès aux données par le biais de représentations de caractéristiques pourraient ne pas offrir le niveau de protection de la vie privée souvent attendu. Il demande une réévaluation des attentes en matière de confidentialité dans les scénarios d'apprentissage collaboratif et de partitionnement de modèles.

Génie : Environnements interactifs génératifs

Génie : Environnements interactifs génératifs

Jake Bruce, Michael Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, Yusuf Aytar, Sarah Bechtle, Feryal Behbahani, Stephanie Chan, Nicolas Heess, Lucy Gonzalez, Simon Osindero, Sherjil Ozair, Scott Reed, Jingwei Zhang, Konrad Zolna, Jeff Clune, Nando de Freitas, Satinder Singh, Tim Rocktäschel
Vidéo orale 1x

Genie est un modèle d'IA générative novateur qui crée des environnements virtuels interactifs et contrôlables à partir de vidéos Internet non étiquetées. Entraîné sur plus de 200 000 heures de séquences de jeux vidéo accessibles au public, ce modèle à 11 milliards de paramètres peut générer des mondes variés et jouables à partir d'instructions textuelles, d'images de synthèse, de photographies et même de croquis faits à la main.

Le modèle comprend trois composantes clés : un tokenizer vidéo spatio-temporel, un modèle de dynamique autorégressive et un modèle d'actions latentes. Cette architecture permet un contrôle image par image sans nécessiter d’étiquettes d’actions de référence lors de l’entraînement. Genie présente des avantages en termes d'évolutivité avec l'augmentation de la taille du modèle et des lots, ce qui laisse entrevoir des améliorations potentielles grâce à des ressources de calcul supplémentaires.

Les capacités de Genie ne se limitent pas aux environnements de jeu. Entraînée sur des ensembles de données robotiques, elle apprend avec succès des actions distinctes et cohérentes, ce qui laisse entrevoir des applications potentielles dans la simulation et le contrôle robotiques.

Surtout, Genie s'avère prometteur pour l'entraînement d'agents généralistes. Ses actions latentes apprises peuvent être utilisées pour déduire des politiques à partir de vidéos inédites dépourvues d'action, ouvrant ainsi potentiellement la voie à d'immenses quantités de données pour l'entraînement futur de l'IA.

Malgré certaines limitations, comme des hallucinations occasionnelles et une capacité de mémoire limitée, Genie représente une avancée significative vers la création d'environnements virtuels diversifiés et interactifs et la formation d'agents d'IA plus performants.

Complexité informationnelle de l'optimisation convexe stochastique : applications à la généralisation et à la mémorisation

Complexité informationnelle de l'optimisation convexe stochastique : applications à la généralisation et à la mémorisation

Idan Attias, Gintare Karolina Dziugaite, Mahdi Haghifam, Roi Livni, Daniel Roy
Optimisation orale 5x 2

Cet article explore la relation entre la mémorisation et l'apprentissage dans l'optimisation convexe stochastique (OCS). Les auteurs quantifient la mémorisation à l'aide de l'information mutuelle conditionnelle (IMC), qui mesure l'information qu'un algorithme d'apprentissage révèle sur ses données d'entraînement. Ils établissent un compromis fondamental entre la précision d'un algorithme d'apprentissage et son IMC.

Pour les SCO à complexité lipschitzienne, les auteurs démontrent que tout apprenant de complexité ε possède une CMI minorée par Ω(1/ε²). Pour les SCO fortement convexes, cette borne est Ω(1/ε). Ces résultats demeurent valables malgré une complexité d'échantillonnage optimale, ce qui indique qu'un apprentissage précis nécessite une mémorisation substantielle.

Cet article démontre la nécessité de la mémorisation en concevant un adversaire capable d'identifier une partie significative des exemples d'entraînement dans des problèmes SCO spécifiques. Ce résultat remet en question l'intuition selon laquelle les algorithmes d'apprentissage idéaux devraient éviter de mémoriser des informations non pertinentes.

Les auteurs examinent plusieurs implications de leurs résultats, notamment les limites des bornes de généralisation basées sur l'interaction morphogénétique canonique (CMI) pour l'optimisation par compression d'échantillons (SCO) et l'impossibilité de schémas de compression d'échantillons de taille constante. Ces résultats contribuent à notre compréhension du rôle de la mémorisation dans l'apprentissage et ont des implications pour la confidentialité et la généralisation en apprentissage automatique.

Découverte d'injustices intersectionnelles

Découverte d'injustices intersectionnelles

Gezheng Xu, Qi Chen, Charles X. Ling, Boyu Wang, Changjian Shui
Séance d'affichage 4

Cet article présente le Réseau Génératif Guidé par les Biais (BGGN), une approche novatrice pour la détection des inégalités intersectionnelles dans les systèmes d'IA. Contrairement aux méthodes traditionnelles qui se concentrent sur des attributs sensibles isolés ou qui reposent sur des techniques d'énumération et de recherche, le BGGN conçoit le processus de détection comme une tâche générative. Cela permet une génération efficace et diversifiée d'attributs sensibles intersectionnels fortement biaisés.

Les chercheurs démontrent l'efficacité de BGGN sur des jeux de données réels de textes (Toxic) et d'images (CelebA). Le modèle détecte non seulement les biais connus, mais génère également des attributs intersectionnels inédits, potentiellement porteurs de biais importants. Pour valider ces découvertes, les auteurs utilisent des modèles d'IA générative modernes tels que LLaMA et Midjourney afin de produire de nouveaux textes et images à partir des attributs identifiés.

BGGN surpasse les algorithmes de recherche classiques et les modèles génératifs pour identifier des sous-groupes diversifiés et fortement biaisés. Il permet également de mieux comprendre les biais potentiels des systèmes d'IA génératifs populaires, car le contenu généré présente souvent des iniquités.

Ce travail contribue à la compréhension de l'équité intersectionnelle dans l'IA et propose une méthode évolutive pour découvrir de manière proactive les injustices qui peuvent être présentes mais non remarquées dans des systèmes complexes comportant de multiples attributs sensibles.

Relecture proximale par couches : une méthode de point proximal pour l’apprentissage continu en ligne

Relecture proximale par couches : une méthode de point proximal pour l’apprentissage continu en ligne

Jinsoo Yoo, Yunpeng Liu, Frank Wood, Geoff Pleiss
Séance d'affichage 5

Cet article présente Layerwise Proximal Replay (LPR), une approche novatrice d'apprentissage continu en ligne qui combine la relecture d'expériences avec une méthode de points proximaux. Les auteurs identifient une limite des méthodes actuelles basées sur la relecture : l'instabilité des trajectoires d'optimisation, qui nuit à la précision globale. LPR remédie à ce problème en modifiant la géométrie d'optimisation afin d'équilibrer l'apprentissage à partir de nouvelles données et de données relues, tout en n'autorisant que des modifications progressives des activations cachées des données passées.

La méthode a été évaluée de manière approfondie sur de multiples configurations de problèmes et ensembles de données, démontrant systématiquement des performances supérieures aux méthodes de relecture existantes. Notamment, LPR présente des avantages même avec une mémoire illimitée, ce qui suggère que ses améliorations vont au-delà de la simple prévention de l'oubli catastrophique.

Le cadre de LPR repose sur un préconditionneur par couches appliqué aux gradients de perte, conçu pour favoriser un apprentissage continu tout en limitant la dégradation soudaine des performances sur les données passées. Les auteurs présentent une formulation mathématique détaillée et une analyse des effets de la méthode sur les représentations internes et la stabilité de l'optimisation.

Les comparaisons avec les méthodes de pointe démontrent la supériorité de la LPR selon divers critères et pour différents types de problèmes. L'article examine également la relation entre LPR et les méthodes de projection de gradient existantes, en soulignant les différences clés qui rendent LPR plus adapté à l'apprentissage continu en ligne avec des tampons de relecture.

Apprendre les relations d'ordre supérieur entre les régions cérébrales

Apprendre les relations d'ordre supérieur entre les régions cérébrales

Weikang Qiu, Huangrui Chu, Selena Wang, Haolan Zuo, Xiaoxiao Li, Yize Zhao, ZHITAO YING
Séance d'affichage 5

Cet article présente HyBRiD, une méthode novatrice d'identification des relations d'ordre supérieur entre les régions cérébrales à partir de données IRMf. Les auteurs proposent que ces relations soient maximalement informatives et minimalement redondantes (MIMR) concernant les phénotypes. HyBRiD représente les régions cérébrales par des nœuds dans un hypergraphe, les hyperarêtes représentant les relations d'ordre supérieur.

La méthode utilise un constructeur pour identifier les structures d'hyperarêtes et un pondérateur pour calculer les poids de ces hyperarêtes. Un système de goulot d'étranglement multi-têtes est introduit pour atteindre l'objectif MIMR, avec des garanties théoriques. HyBRiD évite la recherche dans un espace exponentiel en apprenant des masques pour identifier les hyperarêtes, assurant ainsi efficacité et cohérence entre les sujets.

Des expériences menées sur les ensembles de données ABIDE et ABCD démontrent que HyBRiD surpasse les modèles prédictifs de pointe de 11,2 % en moyenne. Les résultats indiquent que les hyperarêtes de degré élevé sont plus significatives pour la prédiction des performances cognitives, soulignant ainsi l'importance des relations d'ordre supérieur dans le fonctionnement cérébral.

Les auteurs proposent une analyse qualitative des hyperarêtes les plus significatives, révélant des interactions coordonnées entre plusieurs régions cérébrales lors de tâches cognitives. Ces travaux contribuent à la compréhension des fonctions cérébrales complexes et pourraient enrichir les études cliniques et les outils diagnostiques en neurologie.

Apprentissage des structures latentes dans les jeux en réseau via des auto-encodeurs variationnels de graphes à priorité contrôlée dépendants des données

Apprentissage des structures latentes dans les jeux en réseau via des auto-encodeurs variationnels de graphes à priorité contrôlée dépendants des données

Xue Yu, Muchen Li, Yan Leng, Renjie Liao
Séance d'affichage 5

Cet article présente GPGVAE, un modèle d'apprentissage non supervisé permettant d'inférer les types d'interactions latentes et les structures de réseau dans les jeux en réseau. Ce modèle relève le défi de révéler les relations cachées entre les individus à partir de leurs actions observées, sans connaissance préalable des fonctions d'utilité ni des connexions partielles du réseau.

GPGVAE utilise un encodeur spectral basé sur un réseau neuronal généralisé (GNN) pour prédire les types d'interaction (complémentaire ou substituable stratégique) et une distribution a priori dépendante des données pour modéliser les structures du réseau. Il intègre également un encodeur de type mélange de Bernoulli basé sur un Transformer pour les structures du réseau et un décodeur basé sur un GNN pour les actions de jeu.

Les auteurs proposent une stratégie d'apprentissage par étapes et étudient différentes méthodes d'estimation du gradient par la méthode de Monte Carlo. Ils démontrent que GPGVAE surpasse les modèles de pointe sur des ensembles de données synthétiques et réels, avec une amélioration moyenne de 11,2 % dans l'inférence des structures de réseau.

Le modèle saisit efficacement les interactions stratégiques de complémentarité et de substitution, révélant l'importance des relations d'ordre supérieur dans les structures de réseau. Les auteurs mènent également des études d'ablation approfondies et analysent les performances du modèle dans différents contextes de jeu.

Ce travail contribue à la compréhension des dynamiques complexes des réseaux et peut avoir des applications dans des domaines tels que l'analyse des réseaux sociaux, l'économie et l'élaboration des politiques.

Apprendre à s'orienter parmi les experts spécialisés pour une généralisation sans exemple

Apprendre à s'orienter parmi les experts spécialisés pour une généralisation sans exemple

Mohammed Muqeeth, Haokun Liu, Yufan Liu, Colin Raffel
Séance d'affichage 2

Cet article présente PHATGOOSE, une méthode novatrice pour améliorer la généralisation sans exemple en exploitant un grand nombre de modèles experts spécialisés. Cette méthode permet de relever le défi de la réutilisation d'une vaste collection de modèles spécialisés afin d'améliorer les capacités de généralisation sans exemple d'un modèle de langage de base, sans nécessiter un accès simultané aux ensembles de données ayant servi à la création de ces modèles.

PHATGOOSE apprend à circuler entre des modules spécialisés grâce à un réglage fin et efficace des paramètres. Il permet un routage par jeton et par module, ce qui, selon les auteurs, améliore la généralisation sans exemple en permettant d'utiliser différentes compétences d'experts à différentes étapes et pour différents jetons.

Cette méthode, appliquée a posteriori, ne nécessite qu'une petite quantité de calcul supplémentaire après l'entraînement de chaque modèle expert. Lors d'expériences portant sur diverses collections de modèles spécialisés et des benchmarks de généralisation sans exemple, PHATGOOSE surpasse les méthodes précédentes de routage a posteriori et, dans certains cas, surpasse l'entraînement multitâche explicite.

L'analyse qualitative confirme que la performance de PHATGOOSE repose sur sa capacité à effectuer un routage par jeton et par module. Les auteurs présentent les stratégies de routage apprises par le modèle et discutent des pistes de recherche futures dans ce domaine.

Ce travail jette les bases d'un nouveau cadre prometteur pour le développement décentralisé de systèmes d'IA généralistes.

MagicLens : Recherche d'images auto-supervisées avec instructions ouvertes

MagicLens : Recherche d'images auto-supervisées avec instructions ouvertes

Kai Zhang, Yi Luan, Hexiang Hu, Kenton Lee, Siyuan Qiao, Wenhu Chen, Yu Su, Ming-Wei Chang
Récupération orale 4x

MagicLens est une approche novatrice de la recherche d'images auto-supervisée qui prend en charge les instructions ouvertes. Son innovation majeure réside dans son processus de construction des données, qui exploite des paires d'images naturelles provenant de pages Web et utilise de vastes modèles linguistiques pour générer des instructions variées et ouvertes décrivant les relations entre ces images.

L'architecture du modèle MagicLens se compose d'un constructeur qui identifie les structures d'hyperarêtes et d'un pondérateur qui calcule les poids des hyperarêtes. Elle utilise un système d'optimisation à goulot d'étranglement multi-têtes, garantissant ainsi que les représentations apprises soient les plus informatives possible et la moins redondantes possible.

De nombreuses expériences démontrent que MagicLens surpasse les méthodes de pointe sur plusieurs ensembles de données de référence pour la recherche d'images, notamment CIRCO, DTIN et GeneCIS. Il est à noter qu'il atteint ces performances avec un nombre de paramètres nettement inférieur aux méthodes précédentes, ce qui témoigne d'une grande efficacité paramétrique.

L'un des principaux atouts de MagicLens réside dans sa capacité à gérer des intentions de recherche complexes et non visuelles, comme l'ont démontré des évaluations humaines sur un vaste corpus de 1,4 million d'images. Le modèle fait preuve d'une polyvalence remarquable pour comprendre et satisfaire diverses instructions de recherche, même celles nécessitant un raisonnement abstrait ou une compréhension contextuelle.

Ce travail établit une nouvelle référence en matière de recherche d'images avec des instructions ouvertes et ouvre la voie à des systèmes de recherche d'images plus flexibles et plus puissants.

Mesure de la complexité des données stochastiques à l'aide des fonctions d'influence de Boltzmann

Mesure de la complexité des données stochastiques à l'aide des fonctions d'influence de Boltzmann

Nathan Ng, Roger Grosse, Marzyeh Ghassemi
Séance d'affichage 3

Cet article présente IF-COMP, une nouvelle méthode d'estimation de la complexité stochastique des données dans les réseaux de neurones profonds, utilisant des fonctions d'influence de Boltzmann (BIF) adaptées à la température. L'approche vise à approximer la distribution de vraisemblance maximale normalisée prédictive (pNML), répondant ainsi au défi de l'estimation de l'incertitude des prédictions du modèle, notamment pour les données hors distribution.

IF-COMP introduit une fonction objectif de Bregman proximale à échelle de température afin d'atténuer la courbure locale, permettant ainsi une approximation plus précise des résultats optimaux a posteriori. En linéarisant le modèle, IF-COMP estime efficacement la distribution pNML sans étapes d'optimisation explicites, ce qui représente un gain de vitesse de 7 à 15 fois par rapport aux méthodes existantes telles que ACNML.

La méthode présente d'excellentes performances sur trois tâches clés : l'étalonnage de l'incertitude, la détection des erreurs d'étiquetage et la détection des valeurs hors distribution. Notamment, IF-COMP surpasse plusieurs méthodes de référence, y compris les approches bayésiennes et d'optimisation par suivi, souvent avec moins d'informations disponibles.

De nombreuses expériences valident la capacité d'IF-COMP à estimer avec précision la complexité réelle de la pNML et son efficacité sur différentes architectures de réseaux neuronaux et jeux de données. Les résultats soulignent le potentiel des approches basées sur la longueur de description minimale (MDL) pour améliorer les estimations d'incertitude dans les réseaux neuronaux profonds, offrant ainsi une voie prometteuse pour renforcer la fiabilité et l'étalonnage des modèles face aux variations de distribution.

Algorithme sensible au bruit pour l'apprentissage fédéré hétérogène différentiellement privé

Algorithme sensible au bruit pour l'apprentissage fédéré hétérogène différentiellement privé

Saber Malekmohammadi, Yaoliang Yu, Yang Cao
Séance d'affichage 5

Cet article présente ROBUST-HDP, un nouvel algorithme pour les systèmes d'apprentissage fédéré à confidentialité différentielle hétérogène (DPFL). La méthode relève le défi de l'hétérogénéité des exigences de confidentialité des clients, des tailles de lots et des tailles d'ensembles de données, ce qui peut engendrer des niveaux de bruit variables dans les mises à jour des modèles des clients.

ROBUST-HDP utilise l'ACP robuste pour estimer efficacement le niveau de bruit réel dans les mises à jour des clients, permettant ainsi une agrégation plus performante des mises à jour du modèle. Cette approche améliore les méthodes existantes qui reposent sur des stratégies d'agrégation potentiellement sous-optimales ou vulnérables, basées sur les paramètres de confidentialité déclarés par les clients.

Les auteurs fournissent une analyse théorique et des garanties de convergence pour ROBUST-HDP, démontrant son efficacité dans divers scénarios d'hétérogénéité. De nombreuses expériences menées sur plusieurs ensembles de données montrent que ROBUST-HDP surpasse les méthodes de pointe en termes d'utilité et de vitesse de convergence. Notamment, l'algorithme conserve une grande efficacité paramétrique avec une taille de modèle nettement inférieure à celle des approches précédentes. 

ROBUST-HDP démontre également sa robustesse face à la falsification potentielle des paramètres de confidentialité par les clients, ce qui le rend adapté aux environnements serveurs peu fiables. Les résultats de l'article suggèrent que ROBUST-HDP constitue une approche prometteuse pour améliorer les performances et la fiabilité des systèmes DPFL hétérogènes tout en maintenant de solides garanties de confidentialité.

Hors du commun : Régression à adaptation spectrale pour le décalage de covariables

Hors du commun : Régression à adaptation spectrale pour le décalage de covariables

Benjamin Eyre, Elliot Creager, David Madras, Vardan Papyan, Richard Zemel
Séance d'affichage 1

Cet article présente SpAR (Spectral Adapted Regressor), une méthode novatrice pour améliorer les performances hors distribution (OOD) dans les tâches de régression. Les auteurs commencent par analyser la sensibilité de la régression par les moindres carrés ordinaires (OLS) au décalage des covariables, en caractérisant le risque OOD à l'aide de la décomposition spectrale des données sources et cibles.

L'idée clé réside dans le concept d'« inflation spectrale », où les sous-espaces présentant de faibles variations lors de l'entraînement voient leur variation augmenter lors de l'évaluation. Cela motive SpAR, une méthode légère qui adapte les poids de la dernière couche d'un modèle de régression neuronale préentraîné à l'aide de données de test non étiquetées afin d'estimer les sous-espaces présentant une inflation spectrale et de les projeter hors de ceux-ci.

SpAR utilise l'ACP robuste pour identifier les sous-espaces où la variance entre les ensembles d'entraînement et de test diffère le plus. La méthode est fondée sur une base théorique solide et validée empiriquement sur des ensembles de données synthétiques et réels, démontrant ainsi une performance OOD améliorée par rapport aux approches existantes.

Les auteurs proposent une analyse exhaustive, incluant des démonstrations de théorèmes, des études d'ablation et des comparaisons avec les méthodes de pointe. SpAR s'avère prometteur pour relever le défi de la généralisation hors domaine empirique (OOD) dans les tâches de régression, en offrant une approche de post-traitement efficace sur le plan du calcul et applicable à divers modèles pré-entraînés.

Surmonter les hétérogénéités des données et des modèles dans l'apprentissage fédéré décentralisé grâce à des ancres synthétiques

Surmonter les hétérogénéités des données et des modèles dans l'apprentissage fédéré décentralisé grâce à des ancres synthétiques

Chun-Yin Huang, Kartik Srinivas, Xin Zhang, Xiaoxiao Li
Séance d'affichage 1

Cet article présente DeSA, une approche novatrice d'apprentissage fédéré décentralisé qui tient compte de l'hétérogénéité des données et des modèles sans nécessiter de serveur central. Son innovation majeure réside dans l'utilisation de données d'ancrage synthétiques, générées par appariement de distributions, afin de faciliter le transfert mutuel de connaissances entre les clients.

DeSA intègre deux composantes principales : une perte REG qui régularise la distribution des plongements latents des clients par rapport aux ancres, et une perte KD qui permet aux clients d’apprendre les uns des autres. Les auteurs proposent une analyse théorique démontrant comment ces composantes contribuent à améliorer les bornes de généralisation.

De nombreuses expériences menées sur divers ensembles de données démontrent que DeSA surpasse les algorithmes d'apprentissage fédéré décentralisés existants, tant en termes de performances inter-clients qu'intra-clients. La méthode fait preuve de robustesse face à différentes tâches et distributions de données, même dans des scénarios présentant d'importants changements de domaine.

L'un des principaux atouts de DeSA réside dans sa capacité à gérer simultanément l'hétérogénéité des données et des modèles, un défi que les méthodes précédentes ont eu du mal à relever dans un environnement sans serveur. En synthétisant des points d'ancrage globaux à partir de la distribution des données brutes, DeSA offre une solution flexible et efficace pour l'apprentissage collaboratif dans des environnements décentralisés.

Position : Considérations relatives à l'apprentissage différentiellement privé avec préentraînement public à grande échelle

Position : Considérations relatives à l'apprentissage différentiellement privé avec préentraînement public à grande échelle

Florian Tramer, Gautam Kamath, Nicholas Carlini
Positions orales (1x) sur la façon dont nous menons des recherches en apprentissage automatique

Cet article examine de manière critique la pratique consistant à utiliser des données publiques à grande échelle pour le préentraînement de modèles qui sont ensuite affinés grâce à la protection différentielle de la vie privée sur des données sensibles. Les auteurs soulèvent trois principales préoccupations :

  1. Confidentialité des données publiques : les données extraites du Web et utilisées pour le préentraînement peuvent contenir des informations sensibles, compromettant potentiellement la vie privée des individus même lorsque les modèles sont étiquetés comme « respectueux de la vie privée ».
  2. Limites des points de référence : les benchmarks actuels pour l’apprentissage privé peuvent surestimer la valeur du pré-entraînement public en utilisant des tâches qui ressemblent beaucoup aux données de pré-entraînement, ce qui peut ne pas refléter les applications sensibles à la confidentialité du monde réel.
  3. Exigences de calcul : Les grands modèles préentraînés nécessitent souvent le téléchargement de données sensibles sur des serveurs tiers puissants pour le réglage fin et l’inférence, ce qui peut introduire de nouveaux risques pour la confidentialité.

Les auteurs soutiennent que ces problèmes peuvent engendrer un faux sentiment de protection de la vie privée et appellent à une réflexion plus approfondie sur la définition des données « publiques », au développement de critères d’évaluation plus pertinents pour l’apprentissage privé et à l’exploration de techniques préservant la confidentialité sans externaliser les calculs. L'article conclut en encourageant les chercheurs à relever ces défis et à développer des approches plus robustes pour un apprentissage machine respectueux de la vie privée.

Document de position : Repenser la censure des LLM comme un problème de sécurité

Document de position : Repenser la censure des LLM comme un problème de sécurité

David Glukhov, Ilia Shumailov, Yarin Gal, Nicolas Papernot, Vardan Papyan
Séance d'affichage 1

Ce document de position examine de manière critique la pratique consistant à utiliser des données publiques à grande échelle pour le préentraînement de modèles d'apprentissage automatique, lesquels sont ensuite affinés en appliquant une protection différentielle de la vie privée aux données sensibles. Les auteurs soulèvent trois principales préoccupations :

  1. Confidentialité des données publiques : les données extraites du Web et utilisées pour le préentraînement peuvent contenir des informations sensibles, compromettant potentiellement la vie privée des individus même lorsque les modèles sont étiquetés comme « respectueux de la vie privée ».
  2. Limites des points de référence : les benchmarks actuels pour l’apprentissage privé peuvent surestimer la valeur du pré-entraînement public en utilisant des tâches qui ressemblent beaucoup aux données de pré-entraînement, ce qui peut ne pas refléter les applications sensibles à la confidentialité du monde réel.
  3. Exigences de calcul : Les grands modèles préentraînés nécessitent souvent le téléchargement de données sensibles sur des serveurs tiers puissants pour le réglage fin et l’inférence, ce qui peut introduire de nouveaux risques pour la confidentialité.

Les auteurs soutiennent que ces problèmes peuvent engendrer un faux sentiment de protection de la vie privée. Ils appellent à une réflexion plus approfondie sur la définition des données « publiques », au développement de critères d'évaluation plus pertinents pour l'apprentissage privé et à l'exploration de techniques préservant la confidentialité sans externaliser les calculs. L'article conclut en encourageant les chercheurs à relever ces défis et à développer des approches plus robustes pour un apprentissage automatique respectueux de la vie privée, tout en reconnaissant l'importance des travaux récents démontrant que la confidentialité différentielle peut être préservée pour des problèmes complexes d'apprentissage automatique.

Inférence probabiliste dans les modèles linguistiques via Monte Carlo séquentiel tordu

Inférence probabiliste dans les modèles linguistiques via Monte Carlo séquentiel tordu

Stephen Zhao, Rob Brekelmans, Alireza Makhzani, Roger Grosse
Inférence probabiliste orale 3x

Cet article présente une nouvelle approche, appelée « Monte Carlo séquentiel tordu » (SMC), pour améliorer les performances des modèles de langage. L'objectif est de permettre à ces modèles de générer des textes répondant à des critères spécifiques, comme un sentiment particulier ou l'absence de contenu nuisible. Les chercheurs proposent d'utiliser le SMC, une méthode d'échantillonnage statistique, combinée à des « fonctions de torsion » qui guident le processus de génération de texte. Ils développent une nouvelle méthode d'apprentissage de ces fonctions, appelée « apprentissage de torsion contrastive ». L'article démontre que cette approche permet d'orienter efficacement les performances des modèles de langage vers les caractéristiques souhaitées, tout en préservant la qualité du texte. Il introduit aussi de nouvelles méthodes d'évaluation de l'efficacité des différentes techniques de contrôle du rendement des modèles de langage. Les chercheurs testent leur approche sur des tâches telles que la génération d'avis positifs ou négatifs, le remplissage de textes manquants et la création de récits non toxiques. Ils montrent que leur méthode surpasse souvent les techniques existantes. Ce travail fournit un cadre flexible pour la génération de texte contrôlée, potentiellement utile pour diverses applications, notamment pour rendre les modèles de langage d'IA plus sûrs et plus fiables.

Diversité de qualité grâce à la rétroaction humaine : un système ouvert pour une optimisation axée sur la diversité

Diversité de qualité grâce à la rétroaction humaine : un système ouvert pour une optimisation axée sur la diversité

Li Ding, Jenny Zhang, Jeff Clune, Lee Spector, Joel Lehman
Séance d'affichage 1

Cet article présente une méthode novatrice, appelée « Diversité de la qualité par le biais du retour d'information humain » (QDHF), qui vise à améliorer les systèmes d'intelligence artificielle en les rendant plus aptes à générer des solutions diversifiées et de haute qualité. Les méthodes traditionnelles d'optimisation se concentrent sur la recherche de la meilleure solution unique ; ou, de nombreuses tâches complexes tirent parti d'une variété de solutions.

L'innovation majeure de cette recherche réside dans l'intégration directe du retour d'information humain aux algorithmes de diversité de la qualité (QD). Ces algorithmes excellent dans la production de solutions diversifiées, mais s'appuient souvent sur des indicateurs définis manuellement pour mesurer cette diversité. Le QDHF améliore ce point en apprenant, grâce aux rétroactions des utilisateurs, ce que la diversité signifie pour eux, ce qui la rend plus adaptable et efficace pour les tâches exigeant créativité et exploration.

Des études empiriques montrent que QDHF offre des performances supérieures aux méthodes existantes pour générer des solutions diversifiées et de haute qualité. Il s'avère particulièrement efficace pour des tâches telles que la conversion de texte en image, où il améliore considérablement la variété et la qualité des images produites.

En combinant l'intuition humaine à des algorithmes avancés, QDHF offre une approche robuste pour résoudre des problèmes ouverts et complexes.

Se souvenir d'être juste : l'équité non markovienne dans la prise de décision séquentielle

Se souvenir d'être juste : l'équité non markovienne dans la prise de décision séquentielle

Parand Alizadeh Alamdari, Toryn Q Klassen, Elliot Creager, Sheila McIlraith
Séance d'affichage 4

Cette recherche explore l'équité dans la prise de décision séquentielle, qui touche de multiples intervenants au fil du temps. Les études traditionnelles sur l'équité se concentrent sur des décisions isolées, mais ce travail souligne que l'équité dans une séquence de décisions dépend de l'historique complet des décisions, la rendant intrinsèquement non markovienne (ne dépendant pas uniquement de l'état actuel). L'étude met en évidence la nécessité d'évaluer l'équité tout au long du processus, et pas seulement à son terme.

Les contributions principales comprennent :

  1. Introduction d'une équité non markovienne, tenant compte du contexte historique dans les décisions séquentielles.
  2. Identification de diverses propriétés d'équité telles que l'équité à long terme, l'équité permanente, l'équité périodique et l'équité limitée, qui offrent différentes façons de mesurer l'équité au fil du temps.
  3. Examen de la façon dont la mémoire contribue à l'élaboration de politiques équitables dans la prise de décision.
  4. Développement de FairQCM, un algorithme qui améliore l'apprentissage par renforcement en augmentant les données d'entraînement afin d'améliorer la création de politiques équitables.

Cette enquête élargit la compréhension de l'équité dans les processus décisionnels, en soulignant l'importance du contexte historique et de l'évaluation continue de l'équité.

Un regard lucide sur les LLM pour la découverte de matériaux : sont-ils réellement adaptés à l’optimisation bayésienne des molécules ?

Un regard lucide sur les LLM pour la découverte de matériaux : sont-ils réellement adaptés à l’optimisation bayésienne des molécules ?

Agustinus Kristiadi, Felix Strieth-Kalthoff, Marta Skreta, Pascal Poupart, Alan Aspuru-Guzik, Geoff Pleiss
Séance d'affichage 4

Cet article de recherche examine l'utilisation de grands modèles de langage (GML) tels que ChatGPT pour l'optimisation bayésienne (OB) dans la découverte de matériaux, en particulier de molécules. L'optimisation bayésienne est une technique permettant d'optimiser des fonctions complexes à partir de données limitées en exploitant des connaissances a priori. L'étude évalue si les GML, qui se sont montrés prometteurs dans les tâches de traitement automatique du langage naturel, sont efficaces pour faciliter ce processus d'optimisation en chimie moléculaire.

Les principales conclusions sont :

  1. Les modèles linéaires linéaires (LLM) peuvent être utiles pour l'optimisation bayésienne s'ils sont préentraînés ou affinés avec des données spécifiques au domaine.
  2. L'utilisation directe de modèles linéaires généralistes sans ajustements spécifiques au domaine donne souvent des résultats sous-optimaux.
  3. Des techniques telles que le réglage fin efficace des paramètres (PEFT) et les réseaux neuronaux bayésiens peuvent améliorer les performances des LLM dans ce contexte.
  4. Cette recherche fournit des renseignements et des outils logiciels pour exploiter les LLM dans la découverte scientifique, en favorisant l'efficacité des flux de travail de découverte de matériaux tout en reconnaissant les limites et les orientations futures.

Cette étude met l'accent sur une approche équilibrée et fondée sur des preuves pour l'intégration des LLM dans les applications scientifiques spécialisées.

Descente de gradient naturel structurée sans inverse : KFAC économe en mémoire et numériquement stable

Descente de gradient naturel structurée sans inverse : KFAC économe en mémoire et numériquement stable

Wu Lin, Felix Dangel, Runa Eschenhagen, Kirill Neklyudov, Agustinus Kristiadi, Richard E Turner, Alireza Makhzani
Séance d'affichage 5

Cet article présente la descente de gradient naturelle structurée sans inverse (SINGD), une nouvelle méthode d'optimisation pour l'entraînement des réseaux de neurones. Les auteurs visent à résoudre deux problèmes majeurs des méthodes de second ordre existantes, comme KFAC : une forte consommation de mémoire et une instabilité numérique à faible précision.

SINGD s'appuie sur la méthode de descente de gradient naturel sans inverse (INGD), en l'étendant pour une utilisation plus efficace de la mémoire et une meilleure stabilité numérique. Les principales innovations sont :

  1. Formulation d'une mise à jour KFAC sans inverse
  2. Imposer des structures aux facteurs de Kronecker pour réduire l'utilisation de la mémoire

Les auteurs démontrent que SINGD surpasse les méthodes du premier ordre comme AdamW sur diverses architectures de réseaux neuronaux (CNN, Transformers, GNN) tout en utilisant une mémoire similaire, voire inférieure. Surtout, SINGD reste stable en faible précision (demi-précision), contrairement à KFAC qui devient instable.

Ce travail comble le fossé entre les méthodes d'optimisation du premier et du second ordre dans l'entraînement moderne des réseaux neuronaux à faible précision, permettant potentiellement un entraînement plus efficace des modèles à grande échelle.

Production de musique symbolique par diffusion guidée par des règles non différentiables

Production de musique symbolique par diffusion guidée par des règles non différentiables

Yujia Huang, Adishree Ghatare, Yuanzhe Liu, Ziniu Hu, Qinsheng Zhang, Chandramouli Shama Sastry, Siddharth Gururani, Sageev Oore, Yisong Yue
Musique et audio orales (2x)

Cet article présente une nouvelle méthode, appelée Guidage par Contrôle Stochastic (SCG), pour la génération de musique symbolique (comme des rouleaux de piano) à l'aide de modèles de diffusion, tout en respectant des règles musicales non différentiables. La principale difficulté réside dans le fait que de nombreuses règles musicales, telles que la densité des notes ou la progression d'accords, ne sont pas différentiables, ce qui rend les méthodes de guidage traditionnelles inefficaces.

Les chercheurs abordent ce problème en le formulant comme un problème de contrôle stochastique. Ils développent SCG, qui peut fonctionner avec des modèles de diffusion préentraînés de manière simple et rapide, permettant un guidage sans apprentissage même avec des règles non différentiables. SCG fonctionne en échantillonnant plusieurs étapes suivantes possibles à chaque itération et en sélectionnant celle qui respecte le mieux les règles cibles.

De plus, cet article présente une architecture de diffusion latente pour la génération de musique symbolique haute résolution. Combiné à la génération de musique symbolique (SCG), ce cadre surpasse les générateurs de pointe actuels dans divers contextes, démontrant une qualité musicale améliorée et une contrôlabilité basée sur des règles.

L'importance de ce travail réside dans sa capacité à générer une musique symbolique de haute qualité, conforme aux règles, sans qu'il soit nécessaire de réentraîner les modèles pour chaque nouvelle règle, ce qui en fait potentiellement un outil précieux pour les compositeurs et les producteurs de musique.

Comprendre la capacité de raisonnement des modèles de langage du point de vue de l'agrégation des chemins de raisonnement

Comprendre la capacité de raisonnement des modèles de langage du point de vue de l'agrégation des chemins de raisonnement

Xinyi Wang, Alfonso Amayuelas, Kexun Zhang, Liangming Pan, Wenhu Chen, William Wang
Séance d'affichage 3

Cet article étudie comment les modèles linguistiques (ML) développent des capacités de raisonnement grâce au pré-entraînement. Les auteurs proposent que les ML puissent agréger les chemins de raisonnement indirects observés lors du pré-entraînement, ce qui leur permet de tirer de nouvelles conclusions. Ils testent cette hypothèse dans deux scénarios : le raisonnement logique avec des graphes de connaissances et le raisonnement par chaîne de pensée pour la résolution de problèmes mathématiques.

Concernant les graphiques de connaissances, ils montrent que les modèles de langage préentraînés sur des chemins de marche aléatoire peuvent déduire les relations manquantes. Pour les problèmes mathématiques, ils démontrent que l'entraînement sur des chemins de raisonnement aléatoires non étiquetés améliore les performances sur plusieurs ensembles de données.

L'étude révèle que les modèles linguistiques peuvent exploiter efficacement les chemins de raisonnement non étiquetés, et qu'il existe généralement une longueur de chemin optimale pour l'entraînement. Ces résultats confirment l'hypothèse des auteurs et suggèrent des pistes pour améliorer le pré-entraînement des modèles linguistiques afin d'optimiser leurs capacités de raisonnement.

Ce travail jette un éclairage sur la manière dont les LM acquièrent des compétences de raisonnement et propose des stratégies potentielles pour améliorer leur rendement dans des tâches de raisonnement complexes.