L'institut Vector dévoile une évaluation exhaustive des principaux modèles d'IA

10 avril 2025

Nouvelles

En un mot :

  • L'Institut Vector du Canada a évalué 11 modèles d'IA de pointe provenant du monde entier, en utilisant 16 critères de performance, dont ceux développés par les chercheurs de Vector.
  • L'étude « État de l'évaluation » marque la première fois que des modèles à code source ouvert et fermé ont été évalués par rapport à une série élargie de points de référence, révélant les modèles les plus performants et les moins performants. 
  • Ces résultats indépendants peuvent aider les organisations à développer, déployer et appliquer l'IA de manière sécuritaire et responsable.
  • Pour la première fois dans ce type de recherche, Vector a partagé les données de référence, le code sous-jacent et les résultats en open source afin de favoriser la responsabilisation, la transparence et la collaboration, et ainsi renforcer la confiance dans l'IA. 

TORONTO (Ontario), le 10 avril 2025 — L'Institut Vector du Canada a dévoilé les résultats de son évaluation indépendante des principaux modèles de langage à grande échelle (LLM), offrant un aperçu objectif de la performance des modèles d'IA de pointe face à une série complète de tests de référence. L’étude, résumée dans un nouvel article publié sur son site Web, évalue les capacités des modèles dans des tests de plus en plus complexes portant sur les connaissances générales, la programmation, la cybersécurité et d’autres domaines critiques, fournissant ainsi des informations clés sur les forces et les faiblesses des meilleurs agents d’IA.

Les entreprises spécialisées en IA déploient à un rythme sans précédent de nouveaux modèles linguistiques plus performants, chacun promettant des capacités accrues, de la génération de texte plus proche de l'humain à la résolution de problèmes et à la prise de décision avancées. L'élaboration de référentiels largement utilisés et fiables renforce la sécurité de l'IA ; elle aide les chercheurs, les développeurs et les utilisateurs à comprendre les performances de ces modèles en termes de précision, de fiabilité et d'équité, permettant ainsi leur déploiement responsable.

Dans son étude d'évaluation de l'état de l'art, l'équipe d'ingénierie IA de Vector a analysé 11 modèles de langage naturel (MLN) de pointe à travers le monde, incluant des modèles publics (« open ») tels que DeepSeek-R1 et Command R+ de Cohere, ainsi que des modèles d'affaires (« fermés ») comme GPT-40 d'OpenAI et Gemini 1.5 de Google. Chaque agent a été testé selon 16 critères de performance, faisant de cette étude l'une des évaluations indépendantes les plus complètes réalisées à ce jour. 

« Une évaluation indépendante et objective de ce type est essentielle pour comprendre les performances des modèles en termes de précision, de fiabilité et d’équité », explique Deval Pandya, vice-président de l’ingénierie de l’IA chez Vector. « Des référentiels robustes et des évaluations accessibles permettent aux chercheurs, aux organisations et aux décideurs politiques de mieux saisir les forces, les faiblesses et l’impact concret de ces modèles et systèmes d’IA performants et en constante évolution, et, en fin de compte, de renforcer la confiance dans l’IA. »

Pour la première fois dans ce type de recherche, Vector a partagé les résultats de l'étude, les indicateurs de performance et le code source sous-jacent dans un tableau de bord interactif et à code source ouvert afin de promouvoir la transparence et de favoriser les progrès en matière d'innovation dans le domaine de l'IA. « Les chercheurs, les développeurs, les organismes de réglementation et les utilisateurs finaux peuvent vérifier les résultats de manière indépendante, comparer les performances des modèles et élaborer leurs propres indicateurs et évaluations pour stimuler l'amélioration et la responsabilisation », explique John Willes, responsable de l'infrastructure d'IA et de l'ingénierie de recherche chez Vector, qui a dirigé le projet.

Ce projet s'inscrit dans la continuité du rôle de chef de file de Vector dans le développement des référentiels désormais largement utilisés par la communauté mondiale de la sécurité de l'IA, notamment MMLU-Pro, MMMU et OS-World, développés par Wenhu Chen et Victor Zhong, membres du corps professoral du Vector Institute et titulaires des chaires d'IA du CIFAR Canada. Il s'appuie également sur les travaux récents de l'équipe d'ingénierie de l'IA de Vector, qui a développé Inspect Evals, une plateforme de test de sécurité de l'IA open source créée en collaboration avec l'Institut britannique de sécurité de l'IA (AI Security Institute) afin de standardiser les évaluations de sécurité à l'échelle mondiale et de faciliter la collaboration entre chercheurs et développeurs.

« Alors que les organisations cherchent à exploiter le potentiel transformateur de l'IA, Vector est idéalement placé pour leur fournir une expertise indépendante et fiable, leur permettant ainsi d'agir de manière sécuritaire et responsable », explique Pandya, en citant les programmes de l'institut dans le cadre desquels ses partenaires industriels collaborent avec des chercheurs experts à la fine pointe de la sécurité et des applications de l'IA. « Que ce soit dans les services financiers, l'innovation technologique, la santé ou d'autres secteurs, nos partenaires industriels ont accès à l'environnement de test unique de Vector, où ils peuvent expérimenter et tester des modèles et des techniques afin de relever leurs défis commerciaux spécifiques liés à l'IA. »

  • Pour en savoir plus sur l’« état de l’évaluation » de Vector Institute, cliquez ici .
  • Explorez le classement interactif ici .

À propos de l’Institut Vector : L’Institut Vector est un organisme indépendant sans but lucratif voué à l’avancement de l’intelligence artificielle et à l’excellence en apprentissage automatique et en apprentissage profond. Notre vision est de promouvoir l'excellence et le leadership au Canada dans le domaine des connaissances, de la création et de l'utilisation de l'IA afin de stimuler la croissance économique et d'améliorer la vie des Canadiens. L’Institut Vector est financé par la province de l’Ontario, le gouvernement du Canada par l’entremise de la Stratégie pancanadienne en IA du CIFAR et des commanditaires de l’industrie partout au Canada.

Pour plus d'informations ou pour toute demande de renseignements des médias, veuillez contacter : media@vectorinstitute.ai