Par Shaina Raza et Deval Pandya
L'équipe d'ingénierie en intelligence artificielle du Vector Institute a développé Newsmediabias-plus (NMB+) , un nouvel ensemble de données multimodal. Celui-ci comprend des articles en texte intégral ainsi que des renseignements détaillés sur leur publication. Il propose également une catégorisation exhaustive des biais, abordant des questions cruciales telles que les biais sexistes et raciaux, et des sujets spécifiques comme les orientations et le cadrage idéologiques, la discrimination de genre et les préoccupations environnementales.
NMB+ est conçu pour les chercheurs universitaires, les ONG et les groupes à vocation sociale. Ceci est en accord avec l'objectif de Vector de répondre aux risques à court et à long terme en fournissant des outils pratiques pour des systèmes d'IA sûrs. Exemples d'utilisation :
- S'assurer que l'IA respecte les principes de confiance et de sécurité de l'IA de Vector
- Analyse des tendances médiatiques et des styles de reportages dans différents médias
- Former l'IA à détecter et à traiter équitablement la désinformation dans les textes et les images.
Développé par Shaina Raza, scientifique en apprentissage automatique appliqué au Vector Institute et spécialiste de l'IA responsable, cet ensemble de données s'appuie sur le travail UnBIAS précédemment publié en intégrant des images aux côtés du texte.
Caractéristiques de l'ensemble de données
L’ensemble de données comprend environ 90 000 articles de presse, sélectionnés parmi un large éventail de sources fiables , notamment de grands médias du monde entier, pour la période de mai 2023 à septembre 2024. Ces articles ont été recueillis par des sources de données ouvertes à l’aide de Google RSS, dans le respect des principes éthiques de la recherche. 1, 2
Divers modèles d'apprentissage machine ont été conçus pour évaluer l'efficacité de l'ensemble de données dans la détection des biais et des contenus falsifiés, démontrant ainsi sa polyvalence et son utilité. Ce processus d'évaluation comparative montre les performances de l'ensemble de données selon différentes modalités, notamment le texte et les images, soulignant son potentiel pour l'entraînement de modèles d'IA avancés destinés à lutter contre la désinformation.
Chaque entrée de l'ensemble de données comprend le texte intégral de l'article, les détails de publication (date, revue, URL), des évaluations des biais pour le texte et les images, ainsi que des catégorisations thématiques et des descriptions et analyses d'images. Un engagement envers une gouvernance éthique de l'IA Cela exige de concevoir des systèmes d'IA transparents, compréhensibles et auditables, de responsabiliser les développeurs quant au contenu généré par leurs outils d'IA et d'établir des normes éthiques claires pour le développement et le déploiement des technologies d'IA. Les développeurs et les chercheurs doivent s'attacher à élaborer des algorithmes robustes et transparents, à intégrer les considérations éthiques et la protection des données personnelles, et à collaborer avec des experts de différentes disciplines afin d'améliorer les techniques de détection de la désinformation. Cela implique également d'adapter en permanence les outils d'IA pour contrer l'évolution des tactiques de désinformation.
Le développement et l'utilisation de NMB+ sont régis par des normes éthiques strictes afin d'harmoniser les exigences réglementaires et les travaux techniques. Des examens humains approfondis ont été mis en œuvre pour assurer l'exactitude et la fiabilité des données et de leurs étiquettes. L'ensemble de données a fait l'objet d'audits complets pour valider les méthodologies de collecte et d'étiquetage. Ces audits impliquent des examinateurs indépendants qui évaluent l'ensemble de données afin de vérifier sa conformité aux normes éthiques et son exactitude. Ils examinent les sources de données, les procédures de collecte et les critères d'étiquetage pour s'assurer que tous les éléments respectent les lignes directrices établies en matière d'intégrité et de fiabilité de la recherche. Cet examen approfondi contribue à confirmer que l'ensemble de données est à la fois robuste et fiable pour l'entraînement et l'évaluation des systèmes d'IA.
Les chercheurs, les technologues et le grand public sont invités à explorer l'ensemble de données NMB+ et à en découvrir les résultats. Cet ensemble de données est accessible sur la page Hugging Face de Vector, sous licence non commerciale. Plus de détails sont disponibles sur la page News Media Bias Plus .