Par Mark Coatsworth et Shaina Raza
À l'ère de l'information, l'exactitude et l'objectivité du contenu sont primordiales. Les systèmes d'IA jouent déjà un rôle essentiel dans la diffusion de l'information, ce qui augmente le risque de diffusion d'informations biaisées et erronées. Les données d'entraînement biaisées peuvent engendrer des algorithmes qui perpétuent les stéréotypes et renforcent les préjugés, et des algorithmes biaisés peuvent mener à la propagation de fausses informations. Cela a des répercussions importantes sur les médias, les médias sociaux, la conformité réglementaire, la gouvernance et d'autres domaines politiques, et peut entraîner des préjudices considérables.
Pour lutter contre ce biais et promouvoir l'utilisation éthique des grands modèles de langage (LLM), l'équipe d'ingénierie IA du Vector Institute a construit UnBIAS ( unbias-mkdocs.readthedocs.io ), un cadre d'analyse de texte de pointe qui évalue et corrige les biais dans les données textuelles grâce à la classification des biais, la reconnaissance d'entités nommées pour l'identification des biais et la correction des biais du texte.
Face à la prolifération de la désinformation et des préjugés dans l'actualité, les politiques publiques et la réglementation, la gestion des médias numériques par les moyens conventionnels s'avère impossible. La création d'UnBIAS, sous l'impulsion de Shaina Raza, chercheuse en apprentissage automatique appliqué au sein du département d'IA responsable de Vector, propose un cadre d'analyse basé sur l'IA pour identifier les biais dans les communications et une méthode simple pour remplacer les textes biaisés par un contenu neutre et objectif.
Comment ça marche ?
UnBIAS, basé sur une bibliothèque Python développée par Vector et disponible en open source, utilise les modèles linéaires linéaires (LLM) pour détecter les contenus biaisés. L'utilisateur fournit au modèle un texte (unique ou par lots), par exemple : « Les hommes sont naturellement meilleurs que les femmes en sport. » Le classificateur intégré analyse ce texte pour déterminer la présence d'un biais. Si un biais est détecté par classification binaire, le modèle renvoie un score de confiance et un texte de remplacement, tel que : « Les hommes sont naturellement meilleurs que les femmes en sport. BIAISÉ (95 %). » Le score de confiance et la séquence sont ensuite transmis à l'étape de classification des tokens. Ce classificateur est capable d'identifier et de signaler les jetons de biais, qu'ils soient flagrants ou subtils, jusqu'aux n-grammes présents dans le texte.
La dernière étape consiste à appliquer un correcteur de biais : un outil permettant de remplacer le texte initialement biaisé par un nouveau texte objectif. Dans notre exemple, le correcteur de biais remplacerait le texte suivant : « Les individus de différents genres peuvent exceller dans le sport grâce à leurs compétences uniques, leur entraînement et leur dévouement, et non seulement grâce à leur genre. »
Le correcteur de biais utilise un réglage fin basé sur les instructions, combiné à des stratégies d'optimisation des paramètres et à des techniques de quantification sur 4 bits (permettant au modèle de fonctionner même sans calculs intensifs) afin de neutraliser les textes biaisés. Lors du correcteur de biais d'un énoncé, l'objectif n'est pas d'en altérer le sens original, mais de le présenter de manière objective et sans stéréotypes. Chaque mode de la suite logicielle UnBIAS est optimisé pour une inférence efficace et agencé séquentiellement pour former une architecture pipeline simplifiée.

Préparation des données
Lors du développement de la bibliothèque Python, Raza et son équipe d'ingénierie en IA se sont heurtés à un obstacle majeur : le manque de données d'entraînement open source de haute qualité, annotées pour l'identification des biais. Pour remédier à cela, ils ont constitué des ensembles de données uniques d'articles de presse marqués pour identifier les biais ; ils ont également créé une version corrigée des biais afin d'affiner le correcteur de biais, car les modèles linéaires à longue portée (LLM) entraînés sur ces ensembles de données sont performants en matière de détection et de correction des biais.
Les ensembles de données ont été publiés sous des licences libres :
L'objectif est d'intégrer harmonieusement le cadre UnBIAS aux systèmes de recommandation et autres logiciels de recherche d'informations (applications de recrutement, bases de données documentaires, sites d'actualités) afin de produire des résultats impartiaux. À cette fin, l'équipe insiste sur l'importance de données diversifiées et de haute qualité, représentatives de plusieurs formes de biais (genre, âge, religion, sexisme), pour s'assurer que l'ensemble de données soit adapté à un large éventail de tâches d'identification des biais. Assurer la cohérence de l'étiquetage des contenus subjectifs biaisés a également été un défi, tandis que les considérations de confidentialité et d'éthique ont nécessité la protection de la vie privée des personnes et des organisations mentionnées dans les articles de presse.
Veiller à ce que les ensembles de données et les modèles soient faciles à trouver, accessibles, interopérables et réutilisables (principes FAIR) est un pilier de notre approche de préparation des données et des modèles. Les ensembles de données sont préparés à l'aide d'un étiquetage basé sur l'IA et vérifiés par de multiples itérations avec intervention humaine. Lors de ces itérations, des humains classent, identifient et évaluent les résultats biaisés, ce qui fournit une base de détection beaucoup plus robuste que celle obtenue par un entraînement de modèle classique.

Quel est l'impact sociétal ?
Cette boîte à outils fait la promotion d'une IA éthique, en accord avec les idéaux d'inclusion et d'équité. Elle est conçue pour contrer les préjugés dans divers domaines, notamment politiques, raciaux, de genre et d'âge, tout en luttant contre la désinformation dans divers secteurs tels que les changements climatiques et la politique internationale. Elle est conforme aux idéaux d'une IA éthique, notamment l'inclusion et l'équité. Elle témoigne également d'un engagement plus large à aligner en permanence les travaux de Vector sur les valeurs de la communauté de l'IA, tout en évaluant avec vigilance les éventuelles répercussions imprévues de l'IA.
Et après ?
Le cadre UnBIAS représente une avancée majeure dans l'analyse de texte et la correction des biais. Grâce à une combinaison de classificateurs sophistiqués et de techniques de débiaisement novatrices, UnBIAS répond au besoin urgent d'une diffusion d'informations exactes et objectives à l'ère numérique. Ce cadre détecte et corrige les biais dans le contenu textuel tout en préservant l'intention et le sens originaux, favorisant ainsi l'équité et des pratiques d'IA éthiques. Cette approche, conforme aux principes d'inclusion et d'équité, présente un fort potentiel pour limiter considérablement la propagation des biais et de la désinformation.
Raza et l'équipe d'ingénierie en IA veulent rendre UnBIAS accessible et convivial, tant pour les professionnels des données que pour les non-spécialistes, afin de leur permettre de détecter facilement les biais dans leurs documents et textes et, le cas échéant, de les atténuer. Ils travaillent actuellement à enrichir la trousse à outils avec des outils de formation et d'évaluation plus complets, renforçant ainsi les capacités du cadre à identifier les biais dans un large éventail de domaines, notamment juridique, médical, commerce électronique, etc.