Par Jonathan Woods
29 mars 2022
Cet article fait partie de notre série sur l'IA de confiance. Dans le cadre de cette série, nous publierons un article par semaine.
- Interprétabilité
- Justice
- Gouvernance
Dans l'article de cette semaine, l'équipe Innovation industrielle de Vector examine la robustesse des modèles, en définissant son importance dans la gouvernance, en analysant cinq nouveaux problèmes que présentent les modèles d'apprentissage automatique et en proposant des lignes directrices générales pour la gouvernance de la robustesse des modèles en pratique.
Pour de nombreuses organisations, concrétiser le potentiel de l'apprentissage machine (AA) en matière de nouveaux produits et d'optimisation des opérations s'est avéré complexe. Les entreprises ont constaté que les applications d'AA diffèrent des logiciels traditionnels sur plusieurs points importants. La complexité des données, les coûts d'ingénierie et de calcul, ainsi que les nouvelles exigences de gouvernance ont tous freiné l'adoption de cette technologie. La gouvernance et les contrôles ont constitué un défi particulièrement ardu. L'incertitude liée aux nouveaux risques a été exacerbée par certains échecs retentissants d'utilisation de l'AA, et il n'est pas surprenant que les organisations soient prudentes face à cette technologie. Étant donné que les normes sont encore en développement et que les erreurs peuvent avoir de réelles conséquences financières et réputationnelles, il est judicieux de privilégier la prudence, même si le coût d'opportunité de ne pas utiliser les systèmes d'AA là où ils pourraient apporter une réelle valeur ajoutée peut être considérable.
Une bonne gouvernance du ML est essentielle pour surmonter l'incertitude et poursuivre les implémentations. Heureusement, avec quelques ajustements, les cadres de gestion des risques existants pour les modèles non-ML peuvent être adaptés aux algorithmes d'apprentissage et à leurs caractéristiques uniques.
Cet article examine un aspect de la gouvernance des risques liés aux modèles d'apprentissage automatique : la robustesse des modèles. Il en définit l'importance, analyse cinq problématiques inédites et propose des recommandations générales pour une gouvernance efficace de la robustesse des modèles. Destiné principalement aux professionnels non spécialistes, cet article vise à leur permettre de saisir les concepts clés, de participer au processus de gouvernance et de poser des questions pertinentes concernant l'application responsable de l'apprentissage automatique. Éventuellement, ces connaissances permettront aux organisations de tirer pleinement parti des systèmes d'apprentissage automatique.
Quelle est la robustesse d'un modèle ?
La robustesse d'un modèle désigne sa capacité à maintenir ses performances stables sur de nouvelles données par rapport aux données d'entraînement. Idéalement, ces performances ne devraient pas varier significativement. La robustesse est essentielle pour plusieurs raisons. Premièrement, la confiance accordée à un outil repose sur des performances fiables. Or, cette confiance peut être ébranlée lorsqu'un système d'apprentissage machine se comporte de manière imprévisible et difficile à comprendre. Deuxièmement, un écart par rapport aux performances attendues peut révéler des problèmes importants nécessitant une attention particulière. Il peut s'agir d'attaques malveillantes, de phénomènes non modélisés, de biais non détectés ou de changements importants dans les données. Afin de s'assurer qu'un modèle fonctionne conformément à son objectif, il est essentiel de comprendre, de surveiller et de gérer sa robustesse dans le cadre de la gouvernance des risques liés aux modèles.
Comprendre et surveiller cinq éléments pour maintenir la robustesse du modèle d'apprentissage machine
Assurer la robustesse d'un modèle exige de comprendre et de gérer plusieurs défis techniques. Nous définissons ci-dessous ces défis et énumérons les points à prendre en compte pour chacun d'eux. Ce document constitue une liste de vérification fiable des éléments à considérer pour assurer la robustesse du modèle.
La gestion de la robustesse des modèles nécessite la compréhension des défis spécifiques liés à :
- qualité des données
- modèle de dégradation
- stabilité des caractéristiques
- précision vs rappel
- perturbations d'entrée
Qualité des données
La qualité des données a un impact significatif sur la performance d'un modèle. Elle désigne l'exactitude, l'exhaustivité et la clarté des données fournies à un système d'apprentissage automatique. Plus la qualité des données est basse pour chacun de ces critères, plus le système risque de s'écarter de ses performances habituelles. Plusieurs problèmes peuvent affecter la qualité des données. Les ensembles de données peuvent présenter des biais, ce qui peut mener à des résultats qui favorisent ou défavorisent injustement certains groupes. Les données anciennes peuvent refléter des tendances qui ont évolué depuis, ce qui peut amener le modèle à produire des résultats obsolètes. Des scénarios importants peuvent être sous-représentés, voire absents, des données d'entraînement, ce qui peut entraîner l'omission de caractéristiques essentielles à la performance. Les praticiens soucieux de la robustesse de leurs modèles doivent commencer par la qualité des données, en s'assurant que les ensembles de données d'entraînement et les ensembles de données réels sont complets, exacts et pertinents. Négliger cette étape peut compromettre la fiabilité des résultats du modèle.
Considérations : Il est conseillé de revoir et d'affiner l'ensemble de données original avant d'utiliser un modèle afin de s'assurer que les données sont complètes, pertinentes et exactes.
Dégradation du modèle
Au fil du temps, la capacité prédictive d'un modèle peut se dégrader. Dans les secteurs dynamiques et les environnements en constante évolution, de nouvelles distributions de données peuvent apparaître, différentes des distributions historiques utilisées pour l'entraînement des modèles. Lorsque cette différence est significative, elle peut avoir un impact sur la fiabilité des prédictions d'un système. Cette différence entre les données d'entraînement et les données de test est appelée décalage des données.
Lorsque la dégradation est importante – par exemple suite à des événements majeurs du monde réel qui entraînent des changements soudains et significatifs dans les comportements – une correction s'impose. Des techniques de correction de modèle ou un réentraînement du modèle avec des données plus récentes permettent de rétablir sa précision. Une autre forme de dégradation est la dérive conceptuelle, qui survient lorsque la distribution des données reste inchangée, mais que notre interprétation de la relation entre deux ou plusieurs caractéristiques des données évolue. Dans ce cas, un modèle peut produire des résultats précis par rapport à ses entrées, mais devenus obsolètes.
Considérations : Surveillez et suivez toute modification des performances du modèle et familiarisez-vous avec les techniques de correction qui peuvent permettre un recalibrage plus rapide et moins coûteux qu'un réentraînement complet du modèle sur un ensemble de données mis à jour.
Stabilité des fonctionnalités
Une caractéristique est une propriété ou une variable individuelle utilisée comme entrée dans un système d'apprentissage automatique . Prenons l'exemple d'un modèle prédisant les prix de l'immobilier. Les caractéristiques peuvent inclure l'emplacement, la superficie, le nombre de chambres, le prix de vente précédent d'une maison ou tout autre élément . Des variations fréquentes des caractéristiques importantes peuvent affecter la stabilité du modèle. Des difficultés peuvent également survenir si des observations pertinentes, mais inédites, se situent en dehors de l'intervalle observé dans les données d'entraînement.
Considérations : Lors du suivi d'un modèle, il faut surveiller attentivement les changements de ses caractéristiques afin d'évaluer la stabilité du modèle.
Précision vs rappel
La précision mesure l'exactitude du fonctionnement d'un modèle. Le rappel, quant à lui, mesure l'exhaustivité ou la quantité des résultats. Une « haute précision » signifie qu'un modèle retourne nettement plus de résultats pertinents que de résultats non pertinents. Un « rappel élevé » signifie qu'un modèle retourne la plupart des résultats pertinents disponibles. Lors de l'entraînement d'un modèle, il existe souvent un compromis entre précision et rappel, et les praticiens doivent déterminer le meilleur équilibre pour chaque cas particulier. Un mauvais choix de cet équilibre peut nuire à la robustesse du modèle.
Considérations : En général, la précision est importante lorsqu’un faux positif peut avoir des conséquences critiques (par exemple, dans le secteur bancaire, les fausses alertes de fraude peuvent entraîner une surcharge de travail pour une équipe). Le rappel est important lorsqu'un faux négatif peut avoir des conséquences critiques (par exemple, la disqualification injustifiée de prospects marketing entraînant des pertes d'occasions de vente). Le ratio précision/rappel doit être ajusté pour chaque modèle.
Perturbations d'entrée
Dans certains cas, les modèles peuvent être trompés par des variations dans les données d'entrée. Même de petites perturbations peuvent entraîner des changements dans la sortie du système. Cette vulnérabilité peut être exploitée à des fins malveillantes. L'« empoisonnement des données » est un type d'attaque contre un système d'apprentissage automatique où les données utilisées pour entraîner un modèle sont intentionnellement contaminées afin de compromettre le processus d'apprentissage.
Considérations : Envisager des stratégies d’atténuation, notamment un échantillonnage de données approfondi (y compris les valeurs aberrantes, les tendances, les distributions, etc.) et la constitution d’un « ensemble de données de référence » – un ensemble de données validé comportant des cas sélectionnés provenant de sources connues et pour lesquels le comportement attendu est connu – afin de garantir l’intégrité des données d’entrée.
Comment les organisations peuvent gérer la robustesse du ML
Face à ces défis, comment les organisations peuvent-elles aborder et gérer la robustesse ? Voici quelques principes généraux qu’elles peuvent suivre :
- Commencez par les données. Assurez-vous que la collecte, l'étiquetage et le traitement des données sont rigoureux, complets et précis.
- Obtenez un consensus sur le compromis entre précision et rappel. Prenez conscience de ce compromis et sollicitez l'avis de toutes les parties prenantes sur les risques liés aux faux négatifs et aux faux positifs dans chaque cas d'utilisation afin d'optimiser ce compromis pour chaque application.
- Déterminez un horaire de réentraînement. Pour maintenir la précision du modèle, identifiez le calendrier de réentraînement approprié en évaluant ses performances et en surveillant sa dégradation au fil du temps.
En bref
Les caractéristiques et le fonctionnement uniques des systèmes d'apprentissage automatique présentent de nouveaux risques qui doivent être gérés et nécessitent des ajustements des éléments de la gouvernance des risques liés aux modèles, notamment leur robustesse. Heureusement, grâce à une meilleure compréhension et à une analyse approfondie des nouveaux problèmes de robustesse que posent les modèles d'apprentissage automatique, les organisations peuvent y remédier et renforcer la confiance dans les modèles qu'elles déploient.