Apprentissage par renforcement multi-agents en situation réelle : derniers développements et applications

31 mars 2025

Rechercher

Par Sriram Ganapathi Subramanian

La décision de l'Association for Computing Machinery (ACM) d'attribuer le prix Turing 2024 à Richard Sutton et Andrew Barto reconnaît le rôle essentiel que joue aujourd'hui l'apprentissage par renforcement (RL), un domaine qu'ils ont contribué à fonder. Certains des modèles de langage à grande échelle (LLM) les plus populaires, comme ChatGPT et DeepSeek, utilisent largement les principes et les algorithmes de l'apprentissage par renforcement. Ce domaine est également largement appliqué en robotique, dans les véhicules autonomes et dans le secteur de la santé. 

L'objectif d'un agent d'apprentissage par renforcement (RL) est de trouver des comportements quasi optimaux pour des tâches de prise de décision séquentielles, en utilisant des signaux faibles (à valeurs réelles) appelés récompenses. Ceci contraste avec l'apprentissage supervisé, où les décisions sont prises instantanément grâce à des signaux clairs indiquant la bonne réponse. Cette capacité d'apprentissage expérientiel par essais et erreurs propre au RL le rapproche des processus d'apprentissage observés chez l'humain et tous les autres animaux. Les algorithmes RL classiques supposent généralement la présence d'un seul agent apprenant dans le système, sans autres entités capables d'agir dans l'environnement. En réalité, il existe généralement plusieurs agents. Par exemple, en conduite autonome, les agents doivent constamment tenir compte des autres conducteurs sur la route.

L'apprentissage par renforcement multi-agents (MARL), un sous-domaine émergent, assouplit cette hypothèse et considère l'apprentissage dans des environnements comportant plusieurs agents autonomes. Malgré de nombreux succès obtenus avec les algorithmes MARL au cours de la dernière décennie, leur application à grande échelle aux problèmes concrets reste limitée pour deux raisons principales. Premièrement, ces algorithmes présentent une faible efficacité d'échantillonnage. Deuxièmement, ils ne sont pas adaptés aux environnements comportant un grand nombre d'agents, car leur complexité temporelle et spatiale augmente généralement de façon exponentielle avec le nombre d'agents. 

Mes recherches visent globalement à pallier ces limites et à accélérer le déploiement de la technologie MARL dans divers contextes réels, notamment la lutte contre les feux de forêt, la gestion intelligente des réseaux électriques et la conduite autonome. Mon objectif à long terme est de parvenir à un déploiement aussi large de la technologie MARL, ce qui se concrétise par la poursuite de trois objectifs à court terme :

  • Améliorer l'efficacité de l'échantillonnage MARL grâce à des conseils d'action ;
  • Mise à l'échelle de MARL à l'aide de l'apprentissage indépendant, du partage de paramètres et de la théorie du champ moyen ; et
  • Étudier l'application de MARL à certains problèmes du monde réel.

Amélioration de l'efficacité des échantillons

L'efficacité de l'échantillonnage consiste à apprendre efficacement à partir de chaque échantillon de données. En apprentissage par renforcement (RL) et en apprentissage par renforcement multi-agents (MARL), chaque échantillon représente une expérience pour l'agent interagissant avec son environnement. Les algorithmes MARL nécessitent généralement des millions d'échantillons pour atteindre le niveau de performance humain, tandis que les humains peuvent apprendre de telles stratégies avec seulement quelques échantillons. Par exemple, l' algorithme AlphaStar nécessite 200 ans de données de jeu pour apprendre des stratégies performantes. Autre exemple : l'algorithme OpenAI Five , formé sur 180 ans de données de jeu et nécessitant une infrastructure de calcul composée de 256 GPU et de 128 000 cœurs de processeur. Dans de nombreux domaines concrets, ce problème est critique : les données sont relativement rares pour permettre aux agents d'apprendre efficacement.

Des recherches antérieures ont proposé différentes approches pour améliorer l'efficacité d'échantillonnage des méthodes MARL. L'une d'elles consiste à utiliser des récompenses supplémentaires (appelées récompenses d'exploration ) pour encourager l'apprentissage de certains comportements, lesquels sont ensuite réduits au fil du temps. D'autres recommandations incluent l'ajout d'une perte d'entropie à la politique afin de décourager la convergence vers un optimum local et l'utilisation de la motivation intrinsèque pour l'exploration. Bien que ces approches présentent des avantages, des études récentes montrent que les récompenses d'exploration et la perte d'entropie peuvent modifier la politique optimale du problème initial (à moins d'être soigneusement conçues pour chaque environnement), et que la motivation intrinsèque peut s'avérer inefficace dans plusieurs scénarios multi-agents . De plus, toutes ces approches entraînent les algorithmes MARL à partir de zéro dans chaque environnement, ce qui peut être inefficace.

Mes recherches adoptent une approche différente. Il est important de noter que de nombreux environnements réels utilisent déjà, en pratique, des approches potentiellement sous-optimales, artisanales (basées sur des règles physiques) ou heuristiques pour générer des politiques. Une possibilité intéressante est de tirer le meilleur parti de ces approches en tant que conseillers afin d'améliorer l'entraînement des systèmes d'apprentissage par renforcement multiagents (MARL). Nos travaux antérieurs ont exploré l'apprentissage à partir de sources de connaissances externes dans le cadre des MARL. Cependant, ces travaux reposent sur plusieurs hypothèses restrictives qui empêchent leur application dans des environnements pratiques. Nos recherches précédentes ont fourni un cadre structuré pour intégrer les recommandations d'actions d'une classe générale de conseillers en ligne, potentiellement sous-optimaux, dans des contextes multi-agents à somme générale non restrictifs, avec ou sans conseiller unique . Nos recherches précédentes ont également fourni de nouveaux algorithmes d'apprentissage par renforcement pour le contrôle continu, capables d'exploiter plusieurs conseillers. Par ailleurs, nous avons mené des études théoriques approfondies sur cette approche, garantissant sa performance et sa stabilité. Parmi les exemples de conseillers, on peut citer les modèles de conduite pour la conduite autonome, les modèles de propagation physiques pour les feux de forêt et les modèles de marketing mathématique pour le marketing produit. Les conseillers peuvent aussi être des personnes ayant des connaissances préalables dans ces domaines. Alors que mes travaux précédents se limitaient à l'obtention de recommandations d'actions de la part des conseillers, mes travaux actuels portent sur l'étude des effets d'un large éventail de méthodes de transfert multi-agents (par le biais de conseillers), telles que le transfert par le biais de fonctions de valeur, la structuration des récompenses et les politiques publiques.

Mise à l'échelle MARL

Traditionnellement, les algorithmes MARL présentaient une complexité temporelle et spatiale exponentiellement dépendante du nombre d'agents. De ce fait, ils deviennent impraticables dans les environnements comportant un grand nombre d'agents. Dans la littérature , ce problème est appelé « malédiction de la dimensionnalité ».

Trois types de solutions ont été proposés pour la mise à l'échelle des algorithmes MARL : l'apprentissage indépendant (IL), le partage de paramètres (PS) et les méthodes de champ moyen . Chacune présente des avantages et des inconvénients. Les méthodes IL considèrent tous les autres agents comme faisant partie de l'environnement et ne les modélisent pas, ce qui leur confère une grande évolutivité. Bien que simples et efficaces dans certaines situations, ces méthodes manquent de rigueur théorique ; il est donc difficile de déterminer avec précision les environnements ou situations multi-agents les plus adaptés. Les méthodes PS utilisent un réseau unique pour la formation, dont les paramètres sont partagés entre tous les agents. Elles ne sont applicables que dans des environnements coopératifs avec un ensemble d'agents homogènes. Les méthodes de champ moyen, quant à elles, utilisent la théorie du champ moyen pour représenter les autres agents de l'environnement par un agent moyen virtuel. Bien qu'efficaces, ces méthodes reposent sur des hypothèses contraignantes, telles que l'homogénéité des agents, l'observabilité complète de l'environnement et un apprentissage centralisé, ce qui limite leur application pratique.

Mes travaux antérieurs ont contribué à l'amélioration de ces méthodes en palliant leurs limites et en élargissant leur champ d'application. Concernant l'apprentissage par l'expérience (IL), nos recherches précédentes ont fourni une analyse expérimentale approfondie mettant en lumière les forces et les faiblesses des méthodes IL dans des environnements multi-agents coopératifs, compétitifs et à motivations mixtes. Nous avons démontré que les méthodes IL sont aussi efficaces que les méthodes d'apprentissage multi-agents dans plusieurs environnements coopératifs et compétitifs, mais qu'elles sont moins performantes dans les environnements à motivations mixtes. Concernant les méthodes PS, nos travaux antérieurs ont recommandé de nouveaux protocoles de communication permettant aux agents de partager des informations tout en utilisant des réseaux distincts et indépendants pour l'entraînement. Pour les méthodes de champ moyen, nos travaux antérieurs ont assoupli chacune des hypothèses restrictives. Premièrement, nous avons assoupli l'hypothèse d'agents parfaitement homogènes en utilisant une classification par type . Ensuite, nous avons proposé de nouveaux algorithmes de champ moyen capables de fonctionner efficacement dans des environnements partiellement observables . Enfin, nous avons également proposé de nouveaux algorithmes de champ moyen capables d'apprendre de bonnes politiques grâce à des protocoles d'apprentissage entièrement décentralisés . Cependant, les méthodes de champ moyen présentent encore certaines limites, comme l'hypothèse que chaque agent influence les autres agents de la même manière, et la présentation de comportements d'apprentissage instables, que j'aborde dans mes recherches actuelles.

Applications concrètes

Mes recherches examinent l'efficacité des solutions RL et MARL dans un ensemble de domaines réels comme preuve de concept : la lutte contre les feux de forêt, la découverte de matériaux et la conduite autonome.

Combattre les feux de forêt

Dans le domaine des feux de forêt, nos recherches antérieures ont porté sur l'application de l'apprentissage par renforcement (RL) pour améliorer les modèles spatiaux de simulation d'incendies existants et élaborer de meilleures stratégies de lutte contre les incendies lors de deux importants feux de forêt en Alberta : les incendies de Fort McMurray et de Richardson . Par ailleurs, d'autres chercheurs ont publié un simulateur détaillé d'incendies de forêt , Fire Commander, qui simule l'effet des stratégies d'intervention et fournit des données sur les caractéristiques des feux. Bien que ce simulateur ait été utilisé pour tester les performances des algorithmes MARL dans des environnements d'incendies de forêt simulés, aucune étude n'avait été menée sur les performances de MARL dans des scénarios de lutte contre les incendies de forêt liés à un incendie réel. Mes travaux actuels portent sur une étude à grande échelle de ce type. De plus, nous avons publié une étude détaillée sur l'application des algorithmes d'apprentissage machine dans la lutte contre les feux de forêt, ainsi qu'une liste exhaustive des perspectives futures, soulignant le potentiel inexploité de ce domaine. Cet article de synthèse a suscité un vif intérêt et a été cité des centaines de fois en peu de temps.

Découverte de matériaux

Dans le domaine de la découverte de matériaux, des travaux antérieurs ont utilisé des techniques d'apprentissage par renforcement (RL) pour explorer le vaste espace combinatoire chimique, mais ont rencontré des difficultés pour obtenir suffisamment d'échantillons de données pour l'entraînement. Afin de pallier cette difficulté, nous avons récemment publié en open source un simulateur, Chemistry Gym, qui simule l'effet de différentes réactions chimiques et constitue un outil efficace pour l'entraînement d'algorithmes RL/MARL appliqués à la manipulation de réactifs chimiques. De plus, nous avons proposé une forme fondamentalement différente de RL, soit une formulation de récompense maximale , plus pertinente pour la découverte de matériaux que la formulation standard qui utilise les récompenses cumulatives attendues.

conduite autonome

Pour la conduite autonome, l'utilisation de techniques d'apprentissage par renforcement (RL) mono-agent présente des avantages avérés . Bien que la conduite se déroule dans un environnement multi-agents, avec plusieurs véhicules différents circulant simultanément, les travaux antérieurs se sont largement limités à l'utilisation de techniques indépendantes. Nos travaux précédents ont permis de publier en open source plusieurs bancs d'essai de conduite MARL et de développer de nouveaux algorithmes MARL pour la conduite autonome. Ces algorithmes ont largement surpassé les techniques indépendantes. De plus, nous avons mené une étude approfondie sur l'utilisation potentielle de l'apprentissage par renforcement pour l'apprentissage des contraintes sur les autoroutes allemandes et proposé de nouveaux algorithmes RL pour améliorer les décisions autonomes dans des conditions routières difficiles, telles que les zones à fort trafic, les zones à faible visibilité et les routes soumises à des conditions météorologiques difficiles. Mes travaux actuels visent à perfectionner les capacités MARL pour la conduite autonome et la découverte de matériaux, dans le but de généraliser le déploiement de MARL dans ces deux domaines.

Conclusions

Les algorithmes MARL permettent de former des agents autonomes et de les déployer dans des environnements partagés avec différents types d'autres agents. Ces agents peuvent atteindre leurs objectifs en collaborant et/ou en rivalisant avec d'autres agents (y compris ceux qu'ils n'ont jamais rencontrés lors de leur entraînement). Après un entraînement intensif dans des environnements complexes présentant une grande diversité d'adversaires, de scénarios et d'objectifs, ces agents seront capables d'apprendre à naviguer de manière autonome dans des environnements dynamiques, à généraliser efficacement à de nouvelles situations et à anticiper les résultats incertains de leurs actions et stratégies. Il est à noter que les algorithmes MARL ont également démontré leur efficacité dans des environnements partiellement observables, où ils peuvent exploiter efficacement les informations limitées captées par les capteurs de l'agent. 

Le déploiement de l'apprentissage par renforcement multi-agents (MARL) dans le monde réel présente de nombreux avantages dans un large éventail de domaines d'application. Pour des applications critiques en matière de sécurité, comme la lutte contre les feux de forêt, le déploiement fiable de plusieurs robots capables de combattre le feu de manière autonome pourrait réduire le nombre de pompiers humains sur le terrain et sauver des vies. Dans des secteurs comme la santé, où la main-d'œuvre humaine est rare, les agents autonomes peuvent contribuer à améliorer l'efficacité. Par exemple, on pourrait observer une augmentation du nombre d' interventions chirurgicales assistées par robot , de robots d'assistance aux personnes âgées et d'assistants infirmiers robotisés . De nombreux autres domaines d'application, tels que les finances, le développement durable et la conduite autonome, peuvent également bénéficier des algorithmes MARL, où les robots peuvent aider à automatiser les opérations, améliorer l'efficacité et réduire les coûts.  

D'un point de vue technique, deux limites majeures freinent le déploiement à grande échelle des algorithmes MARL dans des applications concrètes. De ce fait, le MARL s'est traditionnellement concentré sur des problèmes simples, de type « toy », impliquant deux (ou quelques dizaines) d'agents et un ensemble d'applications restreint . Mes recherches proposent des solutions novatrices à ces limites et explorent directement leur efficacité dans certaines applications concrètes, servant ainsi de preuves de concept. Elles contribuent à combler le fossé entre les réussites académiques du MARL et son déploiement dans le monde réel.