Des chercheurs de pointe de Vector présentent des travaux novateurs lors de la conférence NeurIPS (Conference on Neural Information Processing Systems) de cette année. Organisée du 10 au 15 décembre à Vancouver et en ligne, cette conférence met en lumière les travaux novateurs des professeurs, des professeurs associés, des postdoctorants et des chercheurs affiliés de Vector. Leurs recherches repoussent les frontières de l'IA et offrent des applications prometteuses susceptibles de transformer notre quotidien, de la santé au droit d'auteur.
Vous trouverez ci-dessous des résumés simplifiés de certains articles acceptés par Vector Researchers lors de la conférence principale.
Descriptions des articles rédigées par les coauteurs de l'article et/ou par une IA générative.
Optimisation bayésienne tenant compte de l'approximation
Natalie Maus, Kyurae Kim, David Eriksson, Geoff Pleiss, John Cunningham, Jacob Gardner
Résumé de l'article
Cet article présente une nouvelle approche pour l'inférence approximative de modèles de substitution utilisés dans les chaînes de traitement d'optimisation bayésienne. Les chercheurs constatent que les techniques d'inférence approximative produisent des modèles de substitution globalement fidèles, mais au prix d'une moindre utilité pour l'optimisation en boîte noire. Afin d'aligner le modèle de substitution approximatif sur l'objectif d'optimisation, les auteurs proposent d'inférer une distribution minimisant l'EULBO (Expected Utility Lower-Bound) plutôt que l'ELBO (Evidence Lower-Bound) variationnel standard. Au lieu de traiter séparément les phases d'inférence et de décision, l'EULBO les combine en une approche unique et unifiée. Les chercheurs ont testé leur méthode sur diverses tâches, notamment la conception de molécules et le contrôle de systèmes robotiques. Les résultats montrent que l'optimisation bayésienne basée sur l'EULBO surpasse systématiquement les méthodes existantes, nécessitant souvent moins d'expériences pour obtenir des résultats équivalents, voire meilleurs.
BIOSCAN-5M : un ensemble de données multimodales pour la biodiversité des insectes
Zahra Gharaee, Scott Lowe, ZeMing Gong, Pablo Millan Arias, Nicholas Pellegrino, Austin T. Wang, Joakim Bruslund Haurum, Iuliia Zarubiieva, Lila Kari, Dirk Steinke, Graham Taylor, Paul Fieguth, Angel Chang
Résumé de l'article
BIOSCAN-5M introduit un ensemble de données multimodales contenant plus de 5 millions de spécimens d'arthropodes (dont 98 % d'insectes) afin de faciliter le suivi et la compréhension de la biodiversité. Cet ensemble de données combine de manière unique des images microscopiques haute résolution, des codes-barres d'ADN, des étiquettes taxonomiques, des données géographiques et des informations sur la taille de chaque spécimen.
Les principales contributions sont :
- Échelle et exhaustivité – avec plus de 5 millions de spécimens, cette base de données est nettement plus importante que les précédentes et comprend plusieurs types de données pour chaque spécimen.
- Qualité – l'ensemble de données a subi des processus rigoureux de nettoyage et de validation, notamment pour les étiquettes taxonomiques.
- Expériences de référence – les auteurs présentent trois applications clés :
- Classification taxonomique basée sur l'ADN
- Apprentissage par transfert zéro-shot pour le regroupement d'échantillons
- Apprentissage multimodal combinant images, ADN et données taxonomiques
Cet ensemble de données vise à aider les chercheurs à développer de meilleurs outils d'IA pour le suivi de la biodiversité, notamment pour l'identification des espèces connues et nouvelles. Les auteurs démontrent que la combinaison de différents types de données (images, ADN, etc.) permet d'obtenir une meilleure précision de classification que l'utilisation d'un seul type de données. Ces travaux constituent une avancée significative dans l'application de l'apprentissage machine à la recherche sur la biodiversité, en fournissant des ressources susceptibles d'accélérer la découverte et le suivi des espèces à l'échelle mondiale.
ClavaDDPM : Synthèse de données multirelationnelles avec des modèles de diffusion guidés par grappe
Wei Pang, Masoumeh Shafieinejad, Lucy Liu, Stephanie Hazlewood, Xi He
Résumé de l'article
Cet article présente ClavaDDPM, une nouvelle approche de génération de données synthétiques pour les bases de données comportant plusieurs tables interconnectées. Alors que les travaux antérieurs se sont principalement concentrés sur la création de données synthétiques pour des tables uniques, les bases de données réelles contiennent souvent de nombreuses tables liées, ce qui complexifie la génération de données synthétiques.
Les principales innovations sont :
- Une nouvelle méthode de modélisation des relations entre les tables utilise des « étiquettes de cluster » comme intermédiaires, permettant de saisir comment les données des différentes tables sont connectées.
- Intégration avec des modèles de diffusion (un type de modèle d'IA performant en génération de données) pour créer les données synthétiques.
- Une technique de correspondance spéciale pour gérer les cas où une table est liée à plusieurs tables parentes.
Les chercheurs ont testé ClavaDDPM sur cinq ensembles de données réels et ont constaté qu'il surpassait nettement les méthodes existantes, notamment en préservant les relations entre les données de différentes tables. Par exemple, lors de la génération de données financières synthétiques, ClavaDDPM a mieux préservé les relations à long terme entre les tables, comme le lien indirect entre les données démographiques des clients et le statut des prêts, ces liens étant transmis par des tables intermédiaires.
Processus gaussiens tenant compte des calculs : sélection de modèles et inférence en temps linéaire
Jonathan Wenger, Kaiwen Wu, Philipp Hennig, Jacob Gardner, Geoff Pleiss, John Cunningham
Résumé de l'article
Les approximations de modèles « sensibles au calcul » répondent à un besoin : une augmentation du temps de calcul (et donc une approximation moindre) permet d’obtenir des estimations d’incertitude plus faibles. Les auteurs présentent le premier algorithme pratique pour obtenir des approximations de processus gaussiens sensibles au calcul, et proposent deux avancées majeures qui pallient les limites des travaux antérieurs. Premièrement, ils introduisent une méthode qui induit de manière démontrée la propriété de sensibilité au calcul dans les processus gaussiens en temps linéaire, une réduction significative par rapport aux algorithmes quadratiques proposés précédemment. Deuxièmement, ils introduisent une approche variationnelle pour la sélection de modèles sensibles au calcul – choix des hyperparamètres du processus gaussien et de l’ordre de calcul – sans risque de surapprentissage. Les chercheurs ont validé leur méthode sur plusieurs ensembles de données réels. Leurs expériences ont montré que le système peut traiter des ensembles de données contenant jusqu’à 1,8 million de points, avec un entraînement en quelques heures seulement sur un seul GPU. Il fournit des estimations d'incertitude plus fiables et égale, voire surpasse, les méthodes de pointe actuelles sur la plupart des métriques.
Relier les points : les modèles linéaires latents peuvent déduire et verbaliser la structure latente à partir de données d’entraînement disparates
Johannes Treutlein, Dami Choi, Jan Betley, Cem Anil, Samuel Marks, Roger Grosse, Owain Evans
Résumé de l'article
Cet article examine si les modèles de langage d'IA (MLIA) peuvent reconstituer des informations cachées à partir d'indices indirects présents dans leurs données d'entraînement – une capacité que les auteurs nomment « raisonnement inductif hors contexte » (RHO). Grâce à cinq expériences différentes, ils démontrent que les MLIA modernes, tels que GPT-3.5 et GPT-4, sont effectivement capables d'établir ces liens indirects. Par exemple, entraînée uniquement sur les distances entre une ville inconnue et d'autres villes connues, l'IA a pu identifier Paris comme la ville mystère et répondre à des questions sur la culture française. De même, à partir des seuls résultats de lancers de pièce, elle a pu déduire si la pièce était truquée. Cette capacité a des répercussions importantes sur la sécurité de l'IA. Si les données d'entraînement d'un système d'IA sont censurées afin de supprimer des informations dangereuses, l'IA pourrait néanmoins être capable de reconstituer ces informations à partir de schémas et d'indices subtils présents dans les données restantes. Bien que les expériences démontrent l'existence de cette capacité, elle n'est pas parfaitement fiable. Les modèles les plus simples ont rencontré des difficultés avec les schémas complexes, et même les modèles les plus avancés ont parfois commis des erreurs. Les chercheurs soulignent que cela suggère que les systèmes d'IA actuels ne sont probablement pas capables de reconstituer de manière fiable des informations complexes et dangereuses, mais cette capacité pourrait devenir plus préoccupante à mesure que les modèles s'amélioreront. Ces travaux mettent en lumière un défi potentiel : celui de contrôler les connaissances que les systèmes d'IA peuvent acquérir lors de leur apprentissage.
DistillNeRF : Perception de scènes 3D à partir d’images prises en un seul coup d’œil grâce à la distillation des champs neuronaux et des caractéristiques du modèle de base
Letian Wang, Seung Wook Kim, Jiawei Yang, Cunjun Yu, Boris Ivanovic, Steven Waslander, Yue Wang, Sanja Fidler, Marco Pavone, Peter Karkus
Résumé de l'article
Cet article présente DistillNeRF, une nouvelle méthode de compréhension des scènes 3D à partir d'images 2D limitées, dans le contexte de la conduite autonome. Son innovation majeure réside dans la combinaison de deux idées clés : d'une part, elle s'appuie sur des modèles 3D de haute qualité (appelés champs de radiance neuronaux ou NeRF) optimisés pour chaque scène de conduite. Bien que ces modèles soient trop lents pour une utilisation directe dans les véhicules autonomes, ils permettent d'entraîner un modèle plus rapide à comprendre les scènes 3D avec précision.
Deuxièmement, il intègre des fonctionnalités issues de modèles de vision par IA avancés (tels que CLIP et DINOv2) pour comprendre le sens sémantique des scènes, notamment l'identification des voitures, des bâtiments et des routes. Le système capture plusieurs images prises simultanément et les convertit en une représentation 3D capable de générer de nouvelles vues de la scène et d'identifier les objets présents. Contrairement aux approches précédentes qui nécessitaient un temps de traitement important pour chaque scène, cette méthode fonctionne en temps réel. Les tests effectués sur des ensembles de données de conduite autonome montrent que DistillNeRF offre une qualité équivalente à celle des méthodes plus lentes, tout en étant beaucoup plus rapide, et peut effectuer des tâches telles que l'estimation de la profondeur et l'identification d'objets dans l'espace 3D sans nécessiter de données d'entraînement supplémentaires. Il s'agit d'une avancée majeure pour permettre aux véhicules autonomes de mieux comprendre leur environnement de manière efficace et précise.
Le lagrangien de Doob : une approche variationnelle efficace en termes d’échantillonnage pour l’échantillonnage des trajectoires de transition
Yuanqi Du, Michael Plainer, Rob Brekelmans, Chenru Duan, Frank Noe, Carla Gomes, Alan Aspuru-Guzik, Kirill Neklyudov
Résumé de l'article
Cet article présente une nouvelle méthode, plus efficace, pour étudier les changements de conformation des molécules, notamment lors de processus importants comme le repliement des protéines ou les réactions chimiques. Le principal problème qu'ils cherchent à résoudre est que les méthodes traditionnelles nécessitent la simulation d'innombrables mouvements moléculaires pour détecter des transitions rares mais importantes, ce qui est extrêmement coûteux en ressources de calcul. Les chercheurs ont développé une approche variationnelle, basée sur les principes de la mécanique lagrangienne, qui permet de trouver plus efficacement les trajectoires de transition. Au lieu de multiplier les simulations en espérant détecter des transitions importantes par hasard, leur approche utilise l'optimisation mathématique pour identifier directement les trajectoires les plus probables qu'une molécule emprunte lors de son changement de conformation. L'équipe a testé sa méthode sur des systèmes simples et sur des molécules réelles comme le dipeptide d'alanine et la chignoline (une petite protéine). Leurs résultats montrent que leur approche permet de trouver les mêmes trajectoires de transition moléculaire que les méthodes traditionnelles, mais avec un nombre de calculs bien moindre – dans certains cas, seulement un million de calculs au lieu d'un milliard. Ce gain d'efficacité pourrait aider les scientifiques à mieux comprendre et prédire les processus moléculaires importants dans des domaines comme le développement de médicaments, la science des matériaux et l'ingénierie des protéines. Cet article combine des concepts issus de la physique statistique et de l'apprentissage machine pour résoudre un problème de calcul de longue date dans le domaine de la simulation moléculaire.
Estimation de l'effet causal de bout en bout à partir de données non structurées en langue maternelle
Nikita Dhawan, Leonardo Cotta, Karen Ullrich, Rahul Krishnan, Chris Maddison
Résumé de l'article
Les chercheurs ont mis au point une méthode utilisant l'IA pour analyser des données en langage naturel (comme les messages publiés sur les forums en ligne) afin de comprendre l'efficacité de différents traitements. Les études traditionnelles nécessitent généralement des essais cliniques coûteux, mais cette méthode permet d'estimer les effets d'un traitement en analysant des données textuelles librement accessibles.
L'équipe a testé son approche sur six ensembles de données (deux synthétiques et quatre cas cliniques réels) portant sur des traitements du diabète et des migraines. Fait remarquable, leurs estimations se sont avérées exactes, à seulement 3 points de pourcentage près, par rapport aux résultats d'essais cliniques réels, dont le coût se chiffre généralement en millions de dollars et qui durent des années.
Bien que les auteurs soulignent que leur méthode ne saurait remplacer les essais cliniques pour les décisions à enjeux élevés, elle pourrait constituer un outil précieux pour :
- Estimation rapide des effets du traitement à un coût bien moindre
- Aider les chercheurs à déterminer quels traitements méritent des essais cliniques complets.
- Recueillir des leçons tirées d'expériences réelles partagées en ligne
- Collecte de preuves à l'appui dans les cas où les procès traditionnels sont impraticables
Extension des autoencodeurs vidéo masqués à 128 images
Nitesh Bharadwaj Gundavarapu*, Luke Friedman, Raghav Goyal*, Chaitra Hegde*, Eirikur Agustsson, Sagar Waghmare, Mikhail Sirotenko, Ming-Hsuan Yang, Tobias Weyand, Boqing Gong, Leonid Sigal
* Contribution égale
Résumé de l'article
Les chercheurs se sont attaqués à une limitation majeure de l'IA vidéo : la plupart des systèmes ne peuvent traiter que de courts clips vidéo (16 à 32 images) en raison de contraintes de mémoire, ce qui rend difficile la compréhension d'actions plus longues, comme des mouvements sportifs complexes. Ils ont développé une solution appelée LVMAE (Long Video Masked AutoEncoder) qui :
- Utilise une stratégie de « masquage adaptatif » pour traiter sélectivement uniquement les parties les plus importantes des vidéos (environ 15 % du contenu).
- Offre une efficacité mémoire impressionnante, permettant le traitement de vidéos beaucoup plus longues (128 images).
- Apprend automatiquement quelles parties des vidéos sont les plus importantes, au lieu d'utiliser des règles prédéfinies.
- Surpasse les méthodes existantes sur des tâches complexes comme la classification des routines de plongée (+3,9 %) et des activités de cuisine (+2,5 %).
Les chercheurs sont parvenus à ce résultat sans recourir à des paires vidéo-texte étiquetées ni à des architectures spécialisées, ce qui rend leur approche plus simple et plus pratique que les méthodes précédentes. Une observation clé : se concentrer sur un nombre restreint de parties des vidéos, mais plus importantes, permet une meilleure compréhension que de tenter de tout traiter.
FairMedFM : Évaluation comparative de l'équité des modèles de fondation d'imagerie médicale
Ruinan Jin, Zikang Xu, Yuan Zhong, Qingsong Yao, DOU QI, S. Kevin Zhou, Xiaoxiao Li
Résumé de l'article
Les chercheurs ont créé la première approche systématique pour tester et évaluer l'équité des modèles d'IA en imagerie médicale en :
- Évaluation de 20 modèles de base différents sur 17 ensembles de données d'imagerie médicale couvrant différents types de scans (radiographies, IRM, etc.).
- Tests de dépistage des biais liés aux caractéristiques des patients telles que le sexe, l'âge et l'ethnicité
- Comparaison des performances entre différentes tâches (classification et segmentation)
- Découverte de plusieurs résultats importants :
- Ces modèles présentent des biais importants, leurs performances variant selon les groupes démographiques.
- Différents modèles et méthodes d'utilisation présentent des compromis variables entre précision et équité.
- Certains ensembles de données présentent systématiquement des schémas de biais dans différents modèles.
- Les méthodes actuelles de réduction des biais ne sont pas très efficaces avec ces modèles de base.
Ce travail propose une méthode standardisée pour évaluer l'équité dans l'IA médicale et ouvre le code source à la communauté de recherche afin de promouvoir le développement de systèmes d'IA de santé plus équitables.
Apprentissage de représentations hétérogènes de type matriochka dans un modèle fédéré
Liping Yi, Han Yu, Chao Ren, Gang Wang, Xiaoguang Liu, Xiaoxiao Li
Résumé de l'article
Les chercheurs ont mis au point une solution novatrice pour relever trois défis majeurs de l'apprentissage fédéré : l'hétérogénéité des modèles (les différentes organisations utilisent des architectures de modèles différentes), l'hétérogénéité des systèmes (les organisations disposent de ressources informatiques variables) et l'hétérogénéité des données (les organisations possèdent des données de types et de distributions différents). Cette approche introduit plusieurs innovations clés. Elle ajoute un petit modèle partagé au modèle propre à chaque organisation et utilise une « fusion adaptative des représentations » pour combiner les connaissances issues des deux modèles. Elle met également en œuvre un « apprentissage de représentations multigranulaires » pour améliorer les performances du modèle. Théoriquement, la méthode atteint un taux de convergence de O(1/T). Les résultats démontrent des améliorations significatives, avec une précision accrue allant jusqu'à 8,48 % par rapport aux méthodes de pointe, tout en réduisant les coûts de communication et de calcul. La méthode préserve la confidentialité en ne partageant que le petit modèle commun entre les organisations, et non leurs architectures ou données propriétaires. Des tests effectués sur différents types de tâches de classification d'images ont démontré une efficacité constante. Cette approche permet aux organisations de collaborer efficacement à l'entraînement de modèles d'IA tout en préservant la confidentialité de leurs architectures et données propriétaires, et en obtenant de meilleures performances que les méthodes existantes.
Les ensembles de données FineWeb : extraire du Web les données textuelles les plus fines à grande échelle
Guilherme Penedo, Hynek Kydlíček, Loubna Ben allal, Anton Lozhkov, Margaret Mitchell, Colin Raffel, Leandro Von Werra, Thomas Wolf
Résumé de l'article
Les chercheurs se sont attaqués à un défi majeur en IA : le manque de données d’entraînement de haute qualité et accessibles au public pour les grands modèles de langage. Bien que de nombreux modèles d’IA « ouverts » partagent leur code, ils conservent souvent leurs données d’entraînement privées, creusant ainsi un fossé de connaissances entre les systèmes publics et propriétaires. L'équipe a développé FineWeb grâce à une expérimentation rigoureuse, en testant différentes approches pour :
- Extraction de texte à partir de pages Web
- Stratégies de filtrage des données pour supprimer le contenu de faible qualité
- Méthodes de déduplication pour supprimer les renseignements redondants
- Filtrage du contenu éducatif pour FineWeb-Edu
Les résultats montrent des améliorations significatives par rapport aux ensembles de données publiques existants :
- Les modèles formés sur FineWeb sont plus performants que ceux formés sur d'autres ensembles de données publics.
- FineWeb-Edu affiche des performances particulièrement solides sur les tâches nécessitant une forte intensité de connaissances.
- Les auteurs publient les deux ensembles de données ainsi que leur chaîne de traitement de données complète.
Il est important de noter que l'article fait preuve d'une transparence totale quant aux limites et aux biais potentiels des ensembles de données, notamment les tendances à certaines représentations démographiques et les asymétries thématiques dans les données.
Explorer d'abord, puis exploiter : le méta-apprentissage pour résoudre les compromis difficiles entre l'exploration et l'exploitation
Ben Norman, Jeff Clune
Résumé de l'article
Dans la vie comme en intelligence artificielle, le succès repose souvent sur un équilibre entre l'exploration (prendre des risques pour apprendre) et l'exploitation (utiliser ses connaissances pour gagner). Par exemple, lors d'un tournoi, expérimenter différentes stratégies en début de partie peut favoriser les victoires ultérieures. Or, cet article met en lumière une limite majeure des méthodes actuelles d'apprentissage par renforcement : elles échouent lorsque l'exploration efficace implique de sacrifier des récompenses immédiates. Étonnamment, même des problèmes très simples mettent à mal les approches les plus performantes.
Le problème fondamental réside dans le fait que ces méthodes s'appuient sur une politique unique pour explorer et exploiter les ressources, ce qui les enferme dans une vision à court terme. Pour y remédier, les chercheurs proposent First-Explore, une solution simple mais efficace. Elle entraîne deux politiques distinctes :
- Une politique d'exploration axée exclusivement sur la collecte d'informations.
- Une politique d'exploitation axée sur la maximisation des récompenses en fonction de ces informations.
Ces politiques sont combinées en explorant d'abord un nombre défini d'épisodes, puis en exploitant les failles pour les épisodes restants. Cette séparation permet au système d'explorer efficacement sans être pénalisé par des pertes à court terme. Malgré sa simplicité, First-Explore offre des résultats remarquables : des performances 2 à 10 fois supérieures aux méthodes existantes dans trois environnements de test différents où l'exploration nécessitait des sacrifices temporaires. En relevant ce défi, First-Explore constitue une avancée significative vers la création d'algorithmes d'apprentissage par renforcement capables d'une exploration, d'une adaptabilité et de performances semblables à celles de l'humain, aussi bien dans des contextes simples que complexes.
Attention par créneaux horaires pour une modélisation efficace des séquences linéaires
Yu Zhang, Songlin Yang, Rui-Jie Zhu, Yue Zhang, Leyang Cui, Yiqiao Wang, Bolun Wang, Freda Shi, Bailin Wang, Wei Bi, Peng Zhou, Guohong Fu
Résumé de l'article
Bien que les Transformers soient des modèles d'IA puissants, leur efficacité diminue lors du traitement de longues séquences en raison de leurs besoins croissants en mémoire. Les modèles d'attention linéaire offrent une solution, mais peinent à gérer les tâches nécessitant la restitution d'informations et leur entraînement initial est coûteux.
La méthode GSA (Gated Slot Attention) proposée relève ces défis en améliorant une méthode existante (ABC) grâce à un mécanisme de contrôle qui permet au modèle de mémoriser ou d'oublier sélectivement des informations. Cela la rend plus efficace, tant lors de l'entraînement que lors de son utilisation. Les auteurs démontrent que GSA surpasse d'autres modèles similaires pour les tâches nécessitant la restitution d'informations, tout en consommant moins de mémoire. De plus, GSA fonctionne particulièrement bien pour convertir des modèles Transformer préentraînés en versions plus efficaces, ne nécessitant que 1 à 3 % du coût d'entraînement initial. Lors des tests, GSA a surpassé d'autres méthodes pour l'ajustement fin du modèle de langage Mistral-7B, démontrant ainsi son intérêt pratique pour l'amélioration de l'efficacité des grands modèles de langage.
GenAI Arena : une plateforme d'évaluation ouverte pour les modèles génératifs
Dongfu Jiang, Max KU, Tianle Li, Yuansheng Ni, Shizhuo Sun, Rongqi Fan, Wenhu Chen
Résumé de l'article
GenAI Arena est une nouvelle plateforme qui comble une lacune importante dans l'évaluation des modèles d'IA de génération d'images et de vidéos. Bien que de nombreux modèles d'IA soient capables de créer des images et des vidéos à partir de descriptions textuelles, il est difficile de déterminer lesquels sont les plus performants. Les indicateurs automatisés traditionnels ont souvent du mal à saisir ce que les humains considèrent comme attrayant ou de haute qualité.
La plateforme permet aux utilisateurs de comparer les résultats de différents modèles d'IA et de voter pour le meilleur. Après sept mois de fonctionnement, elle a recueilli plus de 9 000 votes pour trois tâches : la génération d'images à partir de texte, l'édition d'images et la génération de vidéos à partir de texte. Les résultats ont permis d'identifier les meilleurs modèles actuels dans chaque catégorie et ont révélé que même des modèles d'IA avancés comme GPT-4 ont du mal à évaluer la qualité d'une image, atteignant seulement une précision d'environ 49 % lorsqu'il s'agit de prédire les préférences humaines.
GV-Rep : un ensemble de données à grande échelle pour l’apprentissage de la représentation des variantes génétiques
Zehui Li, Vallijah Subasri, Guy-Bart Stan, Yiren Zhao, Bo Wang
Résumé de l'article
Avec la baisse des coûts du séquençage de l'ADN, les médecins sont confrontés à un défi croissant : analyser l'immense quantité de données génétiques pour identifier les variantes importantes susceptibles d'affecter la santé des patients. Si les modèles d'IA pourraient apporter une aide précieuse, il n'existe actuellement aucune méthode normalisée pour évaluer leurs performances.
GV-Rep remédie à cela en fournissant un vaste ensemble de données de 7 millions d'enregistrements de variantes génétiques, comprenant :
- Données provenant de sept grandes bases de données génétiques
- 17 548 essais d'inactivation de gènes sur 1 107 types cellulaires
- 1 808 combinaisons de variantes
- 156 variantes cliniquement vérifiées chez de vrais patients
Les auteurs ont testé plusieurs modèles d'IA sur cet ensemble de données et ont constaté que, bien qu'ils fonctionnent correctement sur les tâches de base (65 % de précision dans la classification des variantes causant des maladies), ils ont du mal avec des défis plus complexes comme la prédiction de la façon dont les variantes affectent l'expression des gènes dans des types de cellules spécifiques.
Cet ensemble de données vise à contribuer au développement de meilleurs outils d'IA pour comprendre les variations génétiques et leurs effets sur la santé humaine.
Amélioration de la reconstruction ab initio par cryo-microscopie électronique grâce à l'inférence de pose semi-amortie
Shayan Shekarforoush, David Lindell, Marcus Brubaker, David Fleet
Résumé de l'article
CryoSPIN est une nouvelle méthode de calcul qui améliore la détermination de la structure 3D des protéines et autres molécules biologiques à partir d'images de microscopie électronique. Son innovation majeure réside dans une approche en deux étapes combinant des estimations initiales et un raffinement précis. Imaginez qu'on commence par faire un croquis d'un bâtiment sous différents angles, puis qu'on peaufine minutieusement chaque perspective pour obtenir l'image finale la plus nette possible. Cette méthode surpasse les approches existantes en termes de rapidité et de précision. Elle excelle particulièrement dans les situations où les images initiales peuvent être interprétées de multiples façons, comme l'observation d'une forme complexe sous un angle où son orientation exacte est difficile à déterminer.
Intégration de modèles du monde réel dans des données synthétiques pour la segmentation d'état des matériaux sans exemple préalable
Sagi Eppel, Jolina Li, Manuel Drehwald, Alan Aspuru-Guzik
Résumé de l'article
Cette recherche s'attaque au défi d'apprendre à l'IA à reconnaître différents états de matériaux dans des images, comme les taches d'humidité sur les surfaces, la rouille sur le métal ou les zones infectées sur les plantes, sans se limiter aux matériaux spécifiques sur lesquels le système a été entraîné. Les systèmes d'IA actuels ont du mal à relever ce défi, car il est difficile d'obtenir suffisamment de données d'entraînement correctement étiquetées. Les chercheurs ont développé une solution ingénieuse qui combine les avantages des deux approches : ils extraient automatiquement des motifs d'images réelles et les utilisent pour créer des données d'entraînement synthétiques. On peut comparer cela à l'apprentissage d'une IA par la présentation d'exemples réels et d'exemples artificiels soigneusement conçus, reflétant la complexité du monde réel. Ils ont aussi créé le premier banc d'essai complet (appelé MatSeg) pour tester la capacité des systèmes d'IA à identifier les états des matériaux dans de nombreuses situations différentes, de la cuisine à la construction. Comparé à des modèles d'IA de pointe comme le Segment Anything Model (SAM) de Meta, leur approche a obtenu des résultats nettement supérieurs pour l'identification d'états de matériaux complexes. L'équipe de recherche a rendu publics son ensemble de données, son code et plus de 300 000 textures extraites, ce qui devrait permettre à d'autres chercheurs de s'appuyer sur ces travaux pour améliorer la compréhension par l'IA de l'apparence et de l'évolution des matériaux dans le monde réel.
Inférence des ensembles de données LLM : détecter les ensembles de données, et non les chaînes de caractères
Pratyush Maini, Hengrui Jia, Nicolas Papernot, Adam Dziedzic
Résumé de l'article
De récentes poursuites judiciaires contre des entreprises spécialisées en IA ont soulevé des questions quant à l'utilisation de contenu protégé par le droit d'auteur pour l'entraînement des modèles de langage. Si des recherches antérieures ont tenté d'identifier la présence d'exemples textuels spécifiques dans les données d'entraînement d'un modèle (attaques par inférence d'appartenance), cet article démontre que ces méthodes sont peu fiables et souvent aussi peu efficaces qu'une simple supposition. Les chercheurs adaptent donc l'« inférence sur l'ensemble de données » au contexte des grands modèles de langage : une méthode permettant de déterminer si un ensemble de données complet (comme un livre ou un recueil d'articles) a été utilisé lors de l'entraînement. Leur approche combine plusieurs techniques de test et atteint une signification statistique dans l'identification des ensembles de données d'entraînement, sans faux positifs. Cette approche est particulièrement pertinente dans les affaires de droit d'auteur réelles, où les auteurs affirment généralement que l'intégralité de leurs œuvres a été utilisée pour l'entraînement, et non des phrases isolées.
Processus LLM : Distributions prédictives numériques conditionnées par le langage naturel
James Requeima, John Bronskill, Dami Choi, Richard Turner, David Duvenaud
Résumé de l'article
Cet article présente les « processus LLM » (LLMP), une approche novatrice permettant aux grands modèles de langage d'effectuer des prédictions numériques à l'aide de distributions de probabilité. L'innovation majeure réside dans la possibilité de guider ces prédictions grâce à des descriptions en langage naturel du contexte du problème. Par exemple, on peut indiquer au modèle « c'est une mesure de température prise à Montréal en janvier » ou « c'est le cours d'une action qui finira par atteindre zéro », et il ajustera ses prédictions en conséquence. Les chercheurs ont démontré que les LLMP sont aussi efficaces que des outils statistiques spécialisés tels que les processus gaussiens sur diverses tâches, notamment la régression, la prévision et la reconstruction d'images. Surtout, les LLMP peuvent intégrer des indications en langage naturel pour améliorer les prédictions, ce que les méthodes statistiques traditionnelles ne permettent pas. Le modèle peut gérer les données manquantes, traiter des données multidimensionnelles et fournir des estimations d'incertitude concernant ses prédictions.
Soupes locales de qualité supérieure : un catalyseur pour la fusion de modèles dans l’apprentissage fédéré intersectoriel
Minghui Chen, Meirui Jiang, Xin Zhang, DOU QI, Zehua Wang, Xiaoxiao Li
Résumé de l'article
L'apprentissage fédéré permet à plusieurs appareils d'entraîner collaborativement des modèles d'IA tout en préservant la confidentialité des données. Cependant, ce processus nécessite généralement beaucoup d'échanges entre les appareils, ce qui peut s'avérer lent et gourmand en ressources. Les chercheurs ont développé une nouvelle méthode, « Local Superior Soups » (LSS), qui réduit considérablement le nombre d'itérations de communication nécessaires. LSS fonctionne en combinant intelligemment plusieurs versions du modèle sur chaque appareil avant de les partager. Elle repose sur deux stratégies clés : un terme de « diversité » qui garantit que les différentes versions du modèle explorent différents aspects du problème, et un terme d'« affinité » qui empêche les modèles de trop s'éloigner de leur point de départ initial. Lors d'expériences menées sur quatre ensembles de données différents, LSS a obtenu de meilleures performances avec un nombre d'itérations de communication bien inférieur aux méthodes existantes.
MAmmoTH2 : Instructions de mise à l'échelle sur le Web
Xiang Yue, Tianyu Zheng, Ge Zhang, Wenhu Chen
Résumé de l'article
Les chercheurs ont mis au point un processus en trois étapes pour recueillir 10 millions d'exemples d'instructions naturelles sur Internet. Premièrement, ils repèrent les documents pertinents ; deuxièmement, ils extraient les paires questions-réponses ; et troisièmement, ils peaufinent ces paires à l'aide de modèles d'IA open source. Cette approche évite le recours à une annotation humaine coûteuse ou à la génération de GPT-4, nécessaires à d'autres méthodes.
Lorsqu'ils ont entraîné des modèles de langage sur ces données, les résultats ont montré des améliorations significatives. Par exemple, les performances de leur modèle MAmmoTH2-7B sont passées de 11 % à 36,7 % pour les problèmes de mathématiques et de 36 % à 68,4 % pour les mathématiques de niveau primaire, sans utiliser de données d'entraînement issues de ces tests spécifiques. Le modèle a obtenu de bons résultats pour de nombreux types de tâches de raisonnement.
What makes this approach unique is that instead of creating new instruction data, it finds and cleans naturally occurring examples from the web, making it more cost-effective and scalable than existing methods.
Jailbreak à plusieurs coups
Cem Anil, Esin Durmus, Nina Panickssery, Mrinank Sharma, Joe Benton, Sandipan Kundu, Joshua Batson, Meg Tong, Jesse Mu, Daniel Ford, Francesco Mosconi, Rajashree Agrawal, Rylan Schaeffer, Naomi Bashkansky, Samuel Svenningsen, Mike Lambert, Ansh Radhakrishnan, Carson Denison, Evan Hubinger, Yuntao Bai, Trenton Bricken, Timothy Maxwell, Nicholas Schiefer, James Sully, Alex Tamkin, Tamera Lanham, Karina Nguyen, Tomasz Korbak, Jared Kaplan, Deep Ganguli, Samuel Bowman, Ethan Perez, Roger Grosse, David Duvenaud
Résumé de l'article
Nous étudions une famille d'attaques simples exploitant le contexte long sur les grands modèles de langage : l'incitation par des centaines de démonstrations de comportements indésirables. Cette approche est maintenant possible grâce aux fenêtres de contexte plus larges récemment déployées par Anthropic, OpenAI et Google DeepMind. Nous constatons que, dans diverses circonstances réalistes, l'efficacité de cette attaque suit une loi de puissance, jusqu'à plusieurs centaines d'exemples. Nous démontrons le succès de cette attaque sur les modèles à poids fermés les plus utilisés et sur différentes tâches. Nos résultats suggèrent que les contextes très longs constituent une nouvelle surface d'attaque riche pour les grands modèles de langage.
MassSpecGym : une référence pour la découverte et l’identification des molécules
Roman Bushuiev, Anton Bushuiev, Niek de Jonge, Adamo Young, Fleming Kretschmer, Raman Samusevich, Janne Heirman, Fei Wang, Luke Zhang, Kai Dührkop, Marcus Ludwig, Nils Haupt, Apurva Kalia, Corinna Brungs, Robin Schmid, Russell Greiner, Bo Wang, David Wishart, Liping Liu, Juho Rousu, Wout Bittremieux, Hannes Rost, Tytus Mak, Soha Hassoun, Florian Huber, Justin JJ van der Hooft, Michael Stravs, Sebastian Böcker, Josef Sivic, Tomáš Pluskal
Résumé de l'article
Les chercheurs ont créé MassSpecGym, la plus grande collection publique de 231 000 spectres de spectrométrie de masse étiquetés de haute qualité, représentant 29 000 molécules uniques. Ce référentiel définit trois défis majeurs pour les modèles d'IA :
- Génération de structures moléculaires à partir de zéro (génération de novo)
- Recherche de molécules correspondantes dans une base de données (extraction de molécules)
- Prédiction de l'allure du spectre d'une molécule (simulation de spectre)
Ce qui rend ce référentiel précieux, c'est qu'il standardise ces tâches et les rend accessibles à l'ensemble de la communauté d'apprentissage automatique, sans exiger une expertise pointue en spectrométrie de masse. Les auteurs ont également développé une méthode novatrice de répartition des données entre l'entraînement et les tests, garantissant ainsi que les modèles apprennent réellement à généraliser plutôt qu'à mémoriser des molécules similaires. Leur évaluation des modèles de référence montre que, malgré des performances satisfaisantes, les méthodes actuelles présentent encore un potentiel d'amélioration important, suggérant que ce référentiel pourrait contribuer aux progrès de la découverte moléculaire.
Le regret minimax de l'attribution séquentielle de probabilité, les sommes de Shtarkov contextuelles et la vraisemblance maximale normalisée contextuelle
Ziyi Liu, Idan Attias, Dan Roy
Résumé de l'article
Imaginez que vous deviez prédire de manière répétée les probabilités d'événements futurs, comme pour les prévisions météorologiques, en obtenant des informations pertinentes (le contexte) avant chaque prédiction. Dans quelle mesure pouvez-vous vous comparer au meilleur expert, rétrospectivement, d'une catégorie d'experts donnée ? Cet article étudie ce problème fondamental. Les chercheurs introduisent une nouvelle méthode pour mesurer la difficulté de telles tâches de prédiction, appelée « somme de Shtarkov contextuelle ». Ils démontrent que cette mesure saisit parfaitement les limites fondamentales de la performance de tout algorithme. Forts de cette observation, ils développent un algorithme optimal appelé Maximum de Vraisemblance Normalisé Contextuel (cNML). Leur cadre théorique étend les travaux antérieurs de deux manières importantes : il peut traiter les cas avec plus de deux résultats possibles (et pas seulement les prédictions binaires oui/non), et il fonctionne avec des experts capables d'utiliser l'historique de toutes les prédictions précédentes (et pas seulement le contexte actuel). Les chercheurs utilisent également leur nouvelle mesure pour améliorer les bornes de performance existantes, offrant une analyse plus simple et plus précise que les travaux précédents. Bien que l'algorithme optimal qu'ils développent puisse être gourmand en ressources de calcul, il fournit un point de référence théorique important et pourrait guider le développement d'approches plus pratiques.
MMLU-Pro : un banc d’essai de compréhension du langage multitâche plus robuste et plus exigeant
Yubo Wang, Xueguang Ma, Ge Zhang, Yuansheng Ni, Abhranil Chandra, Shiguang Guo, Weiming Ren, Aaran Arulraj, Xuan He, Ziyan Jiang, Tianle Li, Max KU, Wang, Alex Zhuang, Rongqi Fan, Xiang Yue, Wenhu Chen
Résumé de l'article
À mesure que les modèles de langage d'intelligence artificielle s'améliorent, de nombreux tests standards utilisés pour les évaluer perdent de leur pertinence, les meilleurs modèles obtenant des scores similaires. Cet article présente MMLU-Pro, un banc d'essai plus exigeant et fiable, conçu pour mieux distinguer les capacités des modèles. MMLU-Pro améliore le banc d'essai MMLU original de plusieurs façons : il augmente le nombre de réponses possibles de 4 à 10, ajoute des questions de raisonnement plus complexes, supprime les questions triviales et fait l'objet d'une validation par des experts. Le banc d'essai couvre 14 domaines, dont les mathématiques, la physique, le droit et la psychologie. Les tests montrent que MMLU-Pro est nettement plus exigeant : même les meilleurs modèles obtiennent des scores inférieurs de 16 à 33 % à ceux obtenus sur MMLU. Plus important encore, le banc d'essai est plus stable (moins sensible aux variations des consignes) et révèle mieux les différences réelles entre les modèles. Par exemple, alors que GPT-4 et GPT-4-Turbo obtiennent des scores presque identiques sur MMLU, un écart de 9 % apparaît entre eux sur MMLU-Pro. Les chercheurs ont également constaté que le raisonnement par enchaînement de pensées améliore significativement les performances au test MMLU-Pro, ce qui suggère qu'il évalue véritablement la capacité de raisonnement et non la simple restitution des connaissances. Même les meilleurs modèles actuels présentent une marge de progression importante sur ce test.
Lois d'échelle d'observation et prévisibilité des performances des modèles de langage
Yangjun Ruan, Chris Maddison, Tatsunori Hashimoto
Résumé de l'article
Cet article présente une méthode plus économique et plus efficace pour prédire les performances des modèles linguistiques à mesure qu'ils s'agrandissent. Au lieu de devoir entraîner de nombreux nouveaux modèles de tailles différentes (une opération très coûteuse), les chercheurs ont découvert qu'ils pouvaient faire des prédictions précises en analysant les données d'une centaine de modèles existants et accessibles au public. L'idée clé est que la performance d'un modèle de langage peut être expliquée par quelques « dimensions de capacité » fondamentales. Ces capacités évoluent de manière prévisible avec la puissance de calcul au sein de chaque famille de modèles, ce qui permet aux chercheurs d'anticiper les performances futures. Les chercheurs ont validé leur approche en prédisant avec précision plusieurs comportements complexes : le développement de nouvelles capacités par les modèles, leurs performances sur des tâches d'agent (comme GPT-4) et les avantages qu'ils tireraient de techniques d'incitation avancées. Cette nouvelle méthode est importante parce qu'elle rend l'analyse de mise à l'échelle beaucoup plus accessible aux chercheurs qui n'ont pas de budgets de calcul importants. Elle offre également des analyses plus fines, car elle peut utiliser les données d'un nombre beaucoup plus important de modèles que les approches traditionnelles qui nécessitent l'entraînement de nouveaux modèles à partir de zéro.
Sur l'efficacité de l'ER M dans l'apprentissage des caractéristiques
Ayoub El Hanchi, Chris Maddison, Murat Erdogdu
Résumé de l'article
Cet article explore la performance des algorithmes d'apprentissage machine lorsqu'ils doivent identifier les caractéristiques pertinentes et les utiliser pour faire des prédictions. Par exemple, pour prédire le prix d'une maison, on peut utiliser plusieurs caractéristiques, comme la superficie, le nombre de chambres et l'emplacement. Mais laquelle est la plus pertinente ? Les chercheurs ont fait une découverte surprenante : avec suffisamment de données, les algorithmes apprennent à choisir les caractéristiques appropriées presque aussi bien que s'ils les connaissaient dès le départ. C'est comme si l'algorithme finissait par comprendre que la superficie est plus importante que, par exemple, la couleur de la porte d'entrée. Cette constatation est particulièrement importante car elle explique pourquoi les modèles d'apprentissage automatique modernes et complexes fonctionnent mieux que prévu. Les chercheurs ont démontré mathématiquement que lorsqu'un petit nombre de caractéristiques seulement sont réellement utiles pour les prédictions, l'algorithme les identifie plus facilement, même parmi un grand nombre de caractéristiques possibles. Ces résultats pourraient nous aider à mieux comprendre quand et pourquoi l'apprentissage machine fonctionne, et potentiellement à développer des systèmes d'IA plus efficaces et plus fiables.
Un seul échantillon pour tous : approximation simultanée et efficace de toutes les valeurs probabilistes
Weida Li, Yaoliang Yu
Résumé de l'article
« Un Sample Fits All » (OFA) est une nouvelle méthode qui calcule efficacement plusieurs types de valeurs probabilistes – des outils mathématiques utilisés en IA pour évaluer l’importance des données ou des caractéristiques. Auparavant, le calcul de ces valeurs nécessitait des calculs distincts pour chaque type, ce qui était coûteux et inefficace. Leur cadre utilise un processus d'échantillonnage unique pour approximer simultanément tous les types de valeurs probabilistes, réduisant ainsi considérablement les coûts de calcul. Ils ont créé deux variantes : l’une optimisée pour une utilisation générale (OFA-A) et l’autre adaptable à des types spécifiques (OFA-S). La méthode atteint actuellement les meilleures performances pour certains types importants de valeurs probabilistes, notamment les valeurs de Beta Shapley, tout en conservant de bonnes performances pour les autres types. Ils ont aussi montré comment leur méthode s'intègre aux techniques statistiques existantes, en particulier aux problèmes de régression par les moindres carrés. Grâce à une analyse théorique approfondie et à des tests empiriques, ils ont démontré que leur approche non seulement égale, voire surpasse, les performances des méthodes existantes, mais qu’elle est en outre plus efficace en termes de calcul. Cette avancée rend l'utilisation de ces outils mathématiques importants plus concrète dans les applications d'IA du monde réel.
OSWorld : Évaluation comparative d’agents multimodaux pour des tâches ouvertes dans des environnements informatiques réels
Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Jing Hua Toh, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, Tao Yu
Résumé de l'article
Des chercheurs ont développé OSWorld, un nouvel environnement de test permettant aux agents d'IA d'interagir avec de véritables systèmes d'exploitation et applications informatiques, et non plus seulement avec des environnements simulés. Cela comble une lacune majeure des tests d'IA actuels, où la plupart des environnements sont soit non interactifs, soit limités à des applications spécifiques comme les navigateurs web. OSWorld comprend 369 tâches concrètes qui testent la capacité des agents d'IA à utiliser diverses applications telles que des feuilles de calcul, des courriels et des navigateurs Web, à l'instar des humains. Chaque tâche est accompagnée d'instructions de configuration détaillées et de scripts d'évaluation permettant de mesurer précisément sa réussite. Lors des tests effectués sur les modèles d'IA les plus performants (dont GPT-4V, Gemini et Claude-3), les résultats ont révélé des limites importantes. Alors que les humains réussissaient environ 72 % des tâches, le meilleur modèle d'IA n'a atteint que 12,24 % de réussite. Les modèles d'IA ont notamment éprouvé des difficultés à contrôler la souris avec précision, à comprendre les interfaces complexes et à interagir avec plusieurs applications simultanément. Cette recherche met en lumière l'écart considérable entre les capacités actuelles de l'IA et l'utilisation humaine des ordinateurs, tout en fournissant une plateforme complète pour le développement et le test de systèmes d'IA plus performants à l'avenir.
Amélioration des politiques grâce aux modèles de rétroaction linguistique
Victor Zhong, Dipendra Misra, Xingdi Yuan, Marc-Alexandre Côté
Résumé de l'article
Des chercheurs ont mis au point une nouvelle méthode pour améliorer le suivi des instructions par les systèmes d'IA grâce à la création de « modèles de rétroaction du langage » (LFM). Au lieu d'utiliser directement des modèles de langage complexes coûteux, ils ont conçu un système qui apprend d'abord, à partir des commentaires de ces modèles, quelles actions sont utiles, puis utilise ces connaissances pour entraîner des systèmes d'IA plus petits et plus performants. On peut comparer cela à un professeur expert qui, après avoir analysé les actions d'un élève, utilise ces rétroactions pour créer un assistant pédagogique plus accessible, capable d'aider de nombreux élèves à progresser. Le système a démontré son efficacité sur trois types de tâches : la navigation en ville, les tâches ménagères et la réalisation d'expériences scientifiques. Surtout, cette approche s'est avérée non seulement plus efficace que l'utilisation directe de grands modèles de langage, mais aussi plus économique. Le système a pu s'adapter à de nouvelles situations sans formation supplémentaire et a fourni des commentaires compréhensibles et vérifiables par l'humain. Cette recherche représente une avancée significative pour améliorer le suivi des instructions par les systèmes d'IA, tout en maîtrisant les coûts et en garantissant la transparence du processus décisionnel de l'IA.
Modèles d'équilibre profond quantique
Philipp Schleich, Marta Skreta, Lasse Kristensen, Rodrigo Vargas-Hernandez, Alan Aspuru-Guzik
Résumé de l'article
L'apprentissage automatique quantique actuel se heurte notamment à deux défis majeurs : l'accumulation d'erreurs dans les circuits profonds et la nécessité de nombreuses mesures pour l'évaluation des gradients, un nombre qui augmente avec le nombre de paramètres. Les chercheurs proposent QDEQ comme solution : une adaptation des modèles d'équilibre profond classiques à l'informatique quantique. Au lieu d'utiliser plusieurs couches de circuits explicites, QDEQ trouve des points fixes qui simulent efficacement un réseau de profondeur infinie à l'aide de circuits beaucoup moins profonds. Ils ont testé cette approche sur des tâches de classification d'images avec 4 à 10 qubits et ont constaté que QDEQ peut égaler, voire surpasser, les performances de modèles comportant cinq fois plus de couches, tout en utilisant un nombre de paramètres considérablement réduit. Ceci est particulièrement important pour les ordinateurs quantiques de demain, où la profondeur des circuits doit être minimisée.
Le bruitage de la représentation empêche efficacement le réglage fin nuisible des LLM.
Domenic Rosati, Jan Wehner, Kai Williams, Lukasz Bartoszcze, Robie Gonzales, Carsten Maple, Subhabrata Majumdar, Hassan Sajjad, Frank Rudzicz
Résumé de l'article
Les mesures de sécurité actuelles des modèles linéaires à longue portée (LLM) peuvent être facilement contournées par un réglage fin, ce qui représente un risque important lors de la publication de modèles open source. Les chercheurs proposent RepNoise comme solution : un mécanisme de défense qui consiste à « bruiter » (dégrader) délibérément les représentations internes du contenu malveillant dans le modèle, et ce, à tous les niveaux du réseau. Il devient ainsi beaucoup plus difficile pour les attaquants de récupérer des capacités malveillantes par un réglage fin, même lorsqu'ils ont un accès complet aux poids du modèle. RepNoise utilise une fonction de perte en trois parties qui : 1) réduit les informations prédictives concernant les sorties malveillantes, 2) préserve les capacités sur les tâches inoffensives et 3) rapproche les représentations malveillantes d'un bruit aléatoire. La méthode s'avère efficace pour se prémunir contre le réglage fin malveillant tout en maintenant les performances du modèle sur les tâches bénignes.
Machines à récompenser pour l'apprentissage par renforcement profond dans des environnements bruyants et incertains
Andrew Li, Zizhao Chen, Toryn Klassen, Pashootan Vaezipoor, Rodrigo Toro Icarte, Sheila McIlraith
Résumé de l'article
Les machines à récompense offrent un cadre pour représenter formellement les comportements complexes et méritant une récompense, tout en exposant la structure de la fonction de récompense afin d'accélérer l'apprentissage par renforcement (RL). Les algorithmes de machines à récompense existants ont traditionnellement ignoré l'incertitude inhérente à la survenue d'événements clés (comme atteindre un lieu souhaité ou ramasser un objet particulier), incertitude qui peut se manifester dans des situations réelles en raison de capteurs bruyants ou d'une observabilité partielle. Les chercheurs introduisent un nouveau cadre de machines à récompense pour entraîner des agents RL conscients de cette incertitude et capables d'agir en conséquence. À travers la théorie et l'expérimentation, ils mettent en évidence les pièges liés à l'ignorance ou à l'intégration naïve de cette incertitude dans la prise de décision d'un agent, ce qui peut engendrer des comportements imprévus, voire dangereux. Ils démontrent aussi comment atténuer l'impact de cette incertitude afin de former des agents RL plus sûrs et plus fiables.
SCube : Reconstruction instantanée de scènes à grande échelle à l’aide de VoxSplats
Xuanchi Ren, Yifan Lu, Hanxue Liang, Jay Zhangjie Wu, Huan Ling, Mike Chen, Sanja Fidler, Francis Williams, Jiahui Huang
Résumé de l'article
Cette recherche s'attaque au défi de la création de modèles 3D détaillés à partir de quelques photographies d'une scène. Alors que les méthodes existantes nécessitent de nombreuses photos se chevauchant ou produisent des résultats flous, cette nouvelle approche, appelée SCube, permet de créer des reconstructions 3D de haute qualité à partir de seulement trois images non superposées en 20 secondes. La clé du succès de SCube réside dans sa combinaison inédite de techniques : elle utilise une représentation hybride appelée VoxSplat qui combine l'efficacité des voxels (pixels 3D) à la qualité visuelle des points gaussiens 3D. Le système fonctionne en deux étapes : la détermination de la structure et de la géométrie de base de la scène, puis le remplissage des détails d'apparence. Les chercheurs ont testé SCube sur l'ensemble de données de la voiture autonome Waymo, démontrant sa supériorité sur les méthodes existantes en termes de qualité et de rapidité. Le système peut reconstruire des scènes à grande échelle s'étendant sur des centaines de mètres et trouve des applications pratiques dans la conduite autonome, la réalité augmentée et même la conversion de descriptions textuelles en scènes 3D. Cela représente une avancée significative dans la technologie de reconstruction 3D, rendant beaucoup plus pratique la création de modèles 3D détaillés à partir d'un nombre limité de photos.
Une distinction dans l'échantillonnage à queue lourde : oracles gaussiens vs. oracles stables pour les échantillonneurs proximaux
Ye He, Alireza Mousavi-Hosseini, Krishnakumar Balasubramanian, Murat Erdogdu
Résumé de l'article
Cet article examine les méthodes d'échantillonnage des distributions de probabilité à queue lourde, c'est-à-dire les distributions où les valeurs extrêmes sont plus fréquentes que dans les distributions normales standard. Ces distributions apparaissent dans de nombreuses applications concrètes, allant de la modélisation financière aux statistiques robustes.
Les chercheurs démontrent une différence fondamentale entre deux approches de ce problème : les méthodes basées sur des distributions gaussiennes (normales) et celles basées sur des distributions stables. Ils montrent que les méthodes gaussiennes nécessitent intrinsèquement beaucoup plus d'étapes pour atteindre une précision élevée, tandis que les méthodes stables convergent beaucoup plus rapidement. Plus précisément, pour une précision ε donnée, les méthodes gaussiennes nécessitent un temps polynomial en 1/ε (ce qui signifie qu'elles deviennent beaucoup plus lentes lorsque la précision requise augmente), tandis que les méthodes stables ne nécessitent qu'un temps logarithmique en 1/ε (ce qui signifie qu'elles restent efficaces même pour des exigences de précision élevées). Les chercheurs prouvent qu'il ne s'agit pas seulement d'une limite des techniques actuelles, mais d'une barrière mathématique fondamentale. L'article propose également des implémentations pratiques pour certains cas et établit des bornes inférieures démontrant que leurs résultats sont quasi optimaux. Ce travail théorique contribue à expliquer pourquoi certaines méthodes d'échantillonnage fonctionnent mieux en pratique et fournit des indications pour le choix d'algorithmes dans des applications réelles.
Prise de décision séquentielle avec démonstrations d'experts en présence d'hétérogénéité non observée
Vahid Balazadeh, Keertana Chidambaram, Viet Nguyen, Rahul G. Krishnan, Vasilis Syrgkanis
Résumé de l'article
Les chercheurs présentent ExPerior, une nouvelle approche bayésienne empirique pour la prise de décision séquentielle. Cette approche exploite les démonstrations d'experts tout en tenant compte des informations contextuelles non observées. L'algorithme considère ces démonstrations comme des solutions à des problèmes connexes mais légèrement différents, et les utilise pour établir une distribution a priori informative sur l'espace de décision de l'apprenant. Cette approche est particulièrement pertinente dans des applications telles que les véhicules autonomes, la santé et les finances, où les experts prennent des décisions en s'appuyant sur des informations contextuelles inaccessibles à l'agent apprenant. ExPerior emploie deux méthodes pour apprendre la distribution a priori : une approche paramétrique utilisant les connaissances existantes sur sa forme, et une approche non paramétrique d'entropie maximale pour les cas où ces connaissances font défaut. Le cadre proposé surpasse les méthodes de référence existantes pour les bandits manchots, les processus décisionnels markoviens (MDP) et les MDP partiellement observables. Pour les bandits manchots, les auteurs démontrent que le regret bayésien d'ExPerior est corrélé à l'entropie de l'action optimale sous la distribution a priori, validant ainsi théoriquement l'efficacité de l'algorithme.
Spider2-V : À quel point les agents multimodaux sont-ils proches d’automatiser les flux de travail en science des données et en génie ?
Ruisheng Cao, Fangyu Lei, Haoyuan Wu, Jixuan Chen, Yeqiao Fu, Hongcheng Gao, Xinzhuang Xiong, Hanchong Zhang, Wenjing Hu, Yuchen Mao, Tianbao Xie, Hongshen Xu, Danyang Zhang, Sida Wang, Ruoxi Sun, Pengcheng Yin, Caiming Xiong, Ansong Ni, Qian Liu, Victor Zhong, Lu Chen, Kai Yu, Tao Yu
Résumé de l'article
Spider2-V offre un banc d'essai complet pour évaluer les capacités des agents multimodaux à automatiser les flux de travail en science et génie des données. Ce banc d'essai comprend 494 tâches réelles réparties sur 20 applications d'entreprise, intégrant la génération de code et les opérations d'interface graphique dans un environnement informatique exécutable. Les tâches couvrent l'entreposage, l'ingestion, la transformation, la visualisation et l'orchestration des données, à l'aide d'outils tels que BigQuery, dbt et Airbyte. Afin d'assurer une évaluation fiable, les auteurs ont développé 170 configurations de tâches automatiques et 151 mesures d'évaluation personnalisées. Les résultats empiriques révèlent des limites importantes des modèles de pointe actuels : même GPT-4V n'atteint qu'un taux de réussite de 14,0 %, avec des performances chutant à 1,2 % pour les tâches complexes nécessitant plus de 15 étapes. L'étude identifie des difficultés majeures liées à la gestion des comptes utilisateurs authentiques (10,6 % de réussite) et aux opérations d'interface graphique fines. Les résultats suggèrent que, bien que les agents multimodaux soient prometteurs, ils sont encore loin d'automatiser de manière fiable l'intégralité des flux de données, ce qui met en évidence des domaines cruciaux d'amélioration en matière d'ancrage des actions et d'exécution de tâches complexes.
Génération d'images à partir de texte piloté par le sujet par l'apprentissage par renforcement basé sur les préférences
Yanting Miao, William Loh, Suraj Kothawade, Pascal Poupart, Abdullah Rashwan, Yeqing Li
Résumé de l'article
Cette recherche présente une nouvelle approche de génération d'images à partir de texte, axée sur le sujet, qui pallie les limites des méthodes actuelles telles que DreamBooth et SuTI. Les auteurs introduisent la fonction de récompense λ-Harmonique, qui permet un arrêt précoce et fournit des signaux de récompense fiables pour l'entraînement, associée à RPO, une méthode d'apprentissage par renforcement basée sur les préférences. Le système ne nécessite que 3 % des exemples négatifs utilisés par DreamBooth, tout en obtenant des résultats supérieurs. Contrairement aux méthodes existantes, RPO affine uniquement le composant U-Net sans nécessiter d'entraînement de l'encodeur de texte ni d'optimisation de l'embedding. L'approche atteint des performances de pointe sur DreamBench avec un score CLIP-I de 0,833 et un score CLIP-T de 0,314. Le système démontre une grande capacité à préserver l'identité du sujet tout en s'adaptant à divers contextes, ne nécessitant que 5 à 20 minutes de temps d'entraînement sur Cloud TPU V4. La fonction λ-Harmonique s'avère particulièrement efficace pour prévenir le surapprentissage et équilibrer la similarité avec les images de référence et la fidélité aux consignes textuelles.
T2V-Turbo : Lever le goulot d'étranglement de la qualité du modèle de cohérence vidéo grâce à un système de rétroaction mixte
Jiachen Li, Weixi Feng, Tsu-Jui Fu, Xinyi Wang, S Basu, Wenhu Chen, William Yang Wang
Résumé de l'article
T2V-Turbo relève le défi majeur de la génération de vidéos à partir de texte : combiner vitesse et qualité. Le système intègre les rétroactions de plusieurs modèles de récompense (image-texte et vidéo-texte) dans le processus de distillation de la cohérence des modèles de conversion texte-vidéo pré-entraînés. Contrairement aux approches précédentes, T2V-Turbo optimise les récompenses pour les générations en une seule étape, évitant ainsi les contraintes de mémoire liées à la rétropropagation par échantillonnage itératif. Le modèle obtient des résultats remarquables : ses générations en 4 étapes surpassent les modèles de pointe sur VBench, y compris les systèmes propriétaires comme Gen-2 et Pika. Les évaluations humaines confirment que les générations en 4 étapes de T2V-Turbo sont préférées aux échantillons DDIM en 50 étapes des modèles enseignants, ce qui représente une accélération de plus de 12 fois tout en améliorant la qualité. Le système ne nécessite que 3 % des échantillons négatifs utilisés par DreamBooth et son entraînement ne prend que 5 à 20 minutes sur Cloud TPU V4.
Apprentissage par différence temporelle utilisant des signaux d'erreur distribués
Jonas Guan, Shon Verch, Claas Voelcker, Ethan Jackson, Nicolas Papernot, William Cunningham
Résumé de l'article
Les chercheurs s'attaquent à une question fondamentale de l'apprentissage biologique basé sur la récompense : comment le noyau accumbens (NAc) du cerveau coordonne-t-il l'apprentissage à partir de signaux dopaminergiques distribués localement ? Ils ont développé Artificial Dopamine (AD), un algorithme d'apprentissage par renforcement profond (Q-learning) qui reproduit cette contrainte biologique en utilisant des erreurs de différence temporelle distribuées de manière synchrone et par couche. Contrairement aux approches traditionnelles utilisant la rétropropagation, les cellules AD calculent leurs propres erreurs locales et se mettent à jour indépendamment. Le système utilise des connexions directes temporelles pour relayer l'information entre les couches par le biais d'activations plutôt que de signaux d'erreur. L'algorithme a été évalué sur des jeux MinAtar, des tâches de la suite DeepMind Control Suite et des problèmes de contrôle classiques. Les résultats montrent qu'AD atteint souvent des performances comparables aux algorithmes d'apprentissage par renforcement profond standard utilisant la rétropropagation, malgré l'absence de propagation des signaux d'erreur entre les couches. Cette étude apporte la preuve computationnelle que les signaux d'erreur distribués peuvent suffire à eux seuls à un apprentissage coordonné basé sur la récompense, offrant ainsi de nouvelles perspectives sur les mécanismes d'apprentissage biologiques et de nouvelles approches pour les réseaux de neurones artificiels.
Attribution des données d'entraînement par déroulement approximatif
Juhan Bae, Wu Lin, Jonathan Lorraine, Roger Grosse
Résumé de l'article
Cet article présente SOURCE, une nouvelle technique pour comprendre comment chaque donnée d'entraînement influence le comportement d'un modèle d'apprentissage automatique. Cette compréhension est essentielle car identifier les exemples d'entraînement les plus influents aide les chercheurs à interpréter, déboguer et améliorer les modèles d'IA. Les méthodes précédentes étaient soit incapables de gérer des scénarios complexes du monde réel, soit nécessitaient une puissance de calcul trop grande pour être pratiques. SOURCE résout ce problème en divisant le processus d'entraînement en segments et en analysant l'influence des données au sein de chaque segment, grâce à des approximations mathématiques qui optimisent les calculs. Les chercheurs ont testé SOURCE sur diverses tâches, notamment la classification d'images, l'analyse de texte et la modélisation du langage. Ils ont constaté que cette technique était plus performante que les méthodes existantes pour prédire l'impact de la suppression de données d'entraînement spécifiques sur le modèle, en particulier dans des scénarios complexes comme les modèles partiellement entraînés ou les processus d'entraînement en plusieurs étapes. Cette approche est particulièrement précieuse pour les systèmes d'apprentissage machine modernes qui utilisent souvent des procédures d'entraînement complexes.
WildVision : Évaluation des modèles de vision-langage en milieu naturel avec les préférences humaines
Yujie Lu, Dongfu Jiang, Wenhu Chen, William Yang Wang, Yejin Choi, Bill Yuchen Lin
Résumé de l'article
WildVision apporte deux contributions majeures à l'évaluation des modèles d'IA vision-langage : une plateforme interactive, WildVision-Arena, permettant aux utilisateurs de comparer différents modèles dans des scénarios réels, et WildVision-Bench, un banc d'essai créé à partir de ces interactions. Les chercheurs ont recueilli plus de 20 000 conversations et 8 000 votes d'utilisateurs, constituant ainsi l'un des plus grands ensembles de données sur les préférences humaines pour les modèles vision-langage. Leur analyse a révélé que si les meilleurs modèles, comme GPT-4, excellent sur des tâches simples, ils rencontrent des difficultés face à des défis tels que les détails visuels subtils, le raisonnement spatial et les connaissances d'experts. Le banc d'essai développé présente une forte corrélation (0,94) avec les préférences humaines, ce qui suggère qu'il reflète fidèlement les performances des modèles en situation réelle. La plateforme continue de suivre les performances de plus de 20 modèles de vision-langage différents, offrant des informations précieuses sur leurs forces et leurs faiblesses. En se concentrant sur les interactions réelles plutôt que sur les bancs d'essai traditionnels, ce travail permet une compréhension plus concrète du fonctionnement de ces modèles dans des cas d'utilisation réels et met en lumière les axes d'amélioration.
Articles de recherche connexes supplémentaires
La réparation de code avec des LLM offre un compromis exploration-exploitation
Hao Tang, Keya Hu, Jin Zhou, Si Cheng Zhong, Wei-Long Zheng, Xujie Si, Kevin Ellis
Analyse approfondie de la courbe d'apprentissage dans la régression crête à noyau
Tin Sum Cheng, Aurélien Lucchi, Anastasis Kratsios, David Belius
Bo Lin, Erick Delage, Timothy Chan
Apprentissage continu des modèles de base avec des données étiquetées limitées
Shuvendu Roy, Elham Dolatabadi, Arash Afkanpour, Ali Etemad
Félix Dangel
Fusion Yilong Chen, Linhao Zhang, Junyuan Shang, Zhenyu Zhang, Tingwen Liu, Shuohuan Wang, Yu Sun
Chandramouli Shama Sastry, Sri Harsha Dumpala, Sageev Oore
Yeonsu Kwon, Jiho Kim, Gyubok Lee, Seongsu Bae, Daeun Kyung, Wonchul Cha, Tom Pollard, Alistair Johnson, Edward Choi
Adibvafa Fallahpour, Mahshid Alinoori, Wenqian Ye, Xu Cao, Arash Afkanpour, Amrit Krishnan
Estimation du barycentre entropique continu guidée par l'énergie pour les coûts généraux
Alexander Kolesov, Petr Mokrov, Igor Udovichenko, Milena Gazdieva, Gudmund Pammer, Anastasis Kratsios, Evgeny Burnaev, Aleksandr Korotin
Intégrité épistémique dans les grands modèles linguistiques
Bijean Ghafouri, Shahrad Mohammadzadeh, James Zhou, Pratheeksha Nair, Jacob-Junqi Tian, Mayank Goel, Reihaneh Rabbany, Jean-François Godbout, Kellin Pelrine
Évaluation du rendement du système RAG : impact de la limitation des connaissances et du réglage fin
Omkar Dige, John Willes, DB Emerson
Échantillonnage exactement minimax-optimal localement différentiellement privé
Parc Hyun-Young, Shahab Asoodeh, Si-Hyeon Lee
Artur Parkhimchyk, Amirreza Naziri, Laleh Seyyed-Kalantari
Veronica Chatrath, Marcelo Lotif, Shaina Raza
Équité des modèles d'IA dans les représentations vectorielles de radiographies thoraciques
Gebreyowhans Hailekiros Bahre, Hassan Hamidi, Francesco Calimeri, Andrew Sellergren, Leo Anthony Celi, Laleh Seyyed-Kalantari
FLAME : Alignement tenant compte de la factualité pour les grands modèles de langage
Sheng-Chieh Lin, Luyu Gao, Barlas Oguz, Wenhan Xiong, Jimmy Lin, Scott Yih, Xilun Chen
Modèles génératifs sensibles à la fréquence pour l'imputation de séries temporelles multivariées
XINYU YANG, Yu Sun, Yuan Xiaojie, Xinyang Chen
GaussianCut : Segmentation interactive par découpe de graphes pour le splatting gaussien 3D
Umangi Jain, Ashkan Mirzaei, Igor Gilitschenski
Alignement humain-IA aux échecs avec une attention sensible aux compétences
Zhenwei Tang, Difan Jiao, Reid McIlroy-Young, Jon Kleinberg, Siddhartha Sen, Ashton Anderson
Yang Xu, Yifan Feng, Jun Zhang, Jun-Hai Yong, Yue Gao
Yang Xu, Yihong Gu, Cong Fang
Courbure approximative à facteur de Kronecker pour les réseaux neuronaux informés par la physique
Félix Dangel, Johannes Müller, Marius Zeinhofer
L4GM : Modèle de reconstruction gaussienne 4D de grande taille
Jiawei Ren, Cheng Xie, Ashkan Mirzaei, Hanxue Liang, Xiaohui Zeng, Karsten Kreis, Ziwei Liu, Antonio Torralba, Sanja Fidler, Seung Wook Kim, Huan Ling
Hui GUO, Grace Yi, Boyu Wang
Ian Berlot-Attwell, Frank Rudzicz, Xujie Si
Effondrement linguistique : effondrement neuronal dans les (grands) modèles de langage
Robert Wu, Vardan Papyan
LogiCity : Faire progresser l’IA neurosymbolique grâce à la simulation urbaine abstraite
Bowen Li, Zhaoyu Li, Qiwei Du, Jinqi Luo, Wenshan Wang, Yaqi Xie, Simon Stepputtis, Chen Wang, Katia Sycara, Pradeep Ravikumar, Alexander Gray, Xujie Si, Sebastian Scherer
Couplage à entropie minimale avec goulot d'étranglement
Reza Ebrahimi, Jun Chen, Ashish Khisti
Jinjie Ni, Fuzhao Xue, Xiang Yue, Yuntian Deng, Mahir Shah, Kabir Jain, Graham Neubig, Yang You
Daniel Dauner, Marcel Hallgarten, Tianyu Li, Xinshuo Weng, Zhiyu Huang, Zetong Yang, Hongyang Li, Igor Gilitschenski, Boris Ivanovic, Marco Pavone, Andreas Geiger, Kashyap Chitta
Décodage spéculatif du plus proche voisin pour la génération et l'attribution de LLM
Minghan Li, Xilun Chen, Ari Holtzman, Beidi Chen, Jimmy Lin, Scott Yih, Victoria Lin
Ressources neuronales : Synthèse de scènes multi-objets 3D avec des modèles de diffusion d’images
Ziyi Wu, Yulia Rubanova, Rishabh Kabra, Drew Hudson, Igor Gilitschenski, Yusuf Aytar, Sjoerd van Steenkiste, Kelsey Allen, Thomas Kipf
Imagerie probabiliste rigoureuse utilisant des modèles de diffusion comme a priori prêts à l'emploi
Zihui Wu, Yu Sun, Yifan Chen, Bingliang Zhang, Yisong Yue, Katherine Bouman
Alignement par score de propension de données multimodales non appariées
Johnny Xi, Jana Osea, Zuheng Xu, Jason Hartford
Équité proportionnelle dans le regroupement non centroïde
Ioannis Caragiannis, Evi Micha, Nisarg Shah
QueST : Abstractions de compétences auto-supervisées pour l’apprentissage du contrôle continu
Atharva Anil Mete, Haotian Xue, Albert Wilcox, Yongxin Chen, Animesh Garg
Daniel Severo, Ashish Khisti, Alireza Makhzani
Apprentissage par renforcement – Apprentissage semi-supervisé
Marzi Heidari, Hanping Zhang, Yuhong Guo
Shaina Raza, Shardul Ghuge, Oluwanifemi Bamgbose, Deval Pandya
Améliorer agnostique efficace en termes d'échantillons
Udaya Ghai, Karan Singh
Apprentissage privé efficace en termes d'échantillons de mélanges de gaussiennes
Hassan Ashtiani, Mahbod Majid, Shyam Narayanan
Yang Xu, Yifan Feng, Jun Zhang, Jun-Hai Yong, Yue Gao
Eshta Bhardwaj, Harshit Gujral, Siyi Wu, Ciara Zogheib, Tegan Maharaj, Christoph Becker
Sri Harsha Dumpala, Aman Jaiswal, Chandramouli Shama Sastry, Evangelos Milios, Sageev Oore, Hassan Sajjad
Conception d'expériences indirectes séquentielles ciblées
Elisabeth Ailer, Niclas Dern, Jason Hartford, Niki Kilbertus
Enseigner aux étudiants en droit comment apprendre grâce à un ajustement contextuel précis
Younwoo Choi*, Muhammad Adil Asif*, Ziwen Han, John Willes, Rahul Krishnan
Vers la dynamique d'un réseau de neurones profonds apprenant les interactions symboliques
Qihan Ren, Yang Xu, Junpeng Zhang, Yue Xin, Dongrui Liu, Quanshi Zhang
Vers une compréhension des tendances évolutives dans les données séquentielles
QIUHAO Zeng, Long-Kai Huang, Qi CHEN, Charles Ling, Boyu Wang
Dernières couches variationnelles pour l'optimisation bayésienne
Paul Brunzema*, Mikkel Jordahn*, John Willes, Sebastian Trimpe, Jasper Snoek, James Harrison