Le rapport technique sur la vision par ordinateur détaille les conclusions d'un projet de collaboration entre l'industrie et le milieu universitaire.

26 mai 2022

Rechercher

26 mai 2022

L'équipe Innovation industrielle de Vector a publié le rapport technique intitulé « Vision par ordinateur : applications dans la fabrication, la chirurgie, le trafic, les satellites et la reconnaissance de données non étiquetées » . Ce rapport détaille les expériences et les conclusions du projet de vision par ordinateur (CV), un projet collaboratif industriel et académique en plusieurs phases axé sur les avancées récentes en vision par ordinateur, l'un des domaines les plus vastes et à la croissance la plus rapide de l'IA.

Ce projet illustre une fois de plus l'engagement de Vector à rapprocher le monde universitaire et l'industrie, un élément clé de son plan stratégique triennal . Face à la prolifération rapide des avancées en IA, l'équipe Innovation industrielle de Vector collabore avec des partenaires industriels sur des projets visant à approfondir la compréhension des techniques d'IA de pointe, à accélérer leur adoption et à renforcer les compétences des spécialistes afin de contribuer à la réalisation du potentiel sociétal et économique de l'IA. Parmi les projets précédents figurent des travaux sur le traitement automatique du langage naturel et la transformation des ensembles de données .

Le projet de vision par ordinateur a réuni 15 chercheurs de Vector et 14 experts techniques provenant de huit entreprises partenaires : EY, Intact, Linamar, PwC, RBC, Scotiabank et Thales. Ensemble, ils ont exploré de nouvelles applications des méthodes de vision par ordinateur afin d’aider les entreprises partenaires à appliquer les techniques les plus récentes à leurs propres cas d’utilisation, tout en permettant aux chercheurs d’évaluer l’efficacité de ces méthodes en situation réelle. 

Répartis en trois groupes de travail, les participants au projet ont conçu et réalisé des expériences utilisant trois approches de vision par ordinateur : la segmentation sémantique et par détection d’anomalies, les réseaux de neurones à deux flux et l’apprentissage par transfert. Ces approches ont été appliquées aux cinq cas d'utilisation suivants :

  • Détection d'anomalies dans la production

Les participants ont exploré l'utilisation d'auto-encodeurs entraînés sur l'ensemble de données de détection d'anomalies MVTec afin d'optimiser la détection d'anomalies sur la chaîne de production. 

  • Segmentation sémantique dans les images aériennes et routières d'obstacles

Les participants ont appliqué des techniques de segmentation sémantique à deux sources d'images : des images satellites et des séquences vidéo de caméras embarquées. Ces techniques consistent à attribuer une classe à chaque pixel d'une image et à regrouper les pixels ainsi classés afin d'identifier les objets.

  • Détection automatisée des incidents de circulation à l'aide de réseaux neuronaux à deux flux

Les participants ont appliqué des réseaux neuronaux à deux flux aux enregistrements de caméras embarquées pour détecter les images contenant des dangers, localiser ces dangers et les classer par type de danger. 

  • Identification des caractéristiques cliniquement pertinentes des interventions de cholécystectomie (chirurgie de la vésicule biliaire).

Les participants ont appliqué des techniques de segmentation sémantique et d'instance pour permettre l'identification en temps réel de régions anatomiques spécifiques (par exemple, le canal cholédoque, l'artère hépatique et la veine porte) qui sont des « zones interdites » pour les chirurgiens pratiquant une cholécystectomie laparoscopique (l'ablation chirurgicale de la vésicule biliaire). 

  • Apprentissage par transfert pour une classification et une détection vidéo efficaces

Les participants ont étudié l'efficacité de l'apprentissage par transfert pour détecter et classer les actions dans des vidéos contenant peu ou pas d'annotations. 

Les chercheurs et les commanditaires ont déjà constaté des résultats positifs . Les travaux de Linamar ont ouvert la voie à un système automatisé de détection des défauts des pièces, tandis que Thales a pu travailler sur la détection d'obstacles, en parallèle des travaux menés sur ses trains autonomes.

Deux cas d'utilisation ont été présentés par les participants au projet lors de la conférence LIKE ME 2022 (Location Intelligence and Knowledge Extraction Canada ). Il s'agit de l'étude comparative de modèles de segmentation sémantique pour l'extraction d'empreintes de bâtiments à partir d'images satellites et de la détection automatisée d'incidents de circulation à l'aide de réseaux neuronaux à deux flux. Le premier a été mis en nomination pour le prix du « Meilleur article ». Le rapport fournit une description complète des implémentations techniques et des résultats de chaque cas d'utilisation . La boîte à outils du projet comprend divers ensembles de données et des outils d'imagerie/vidéo utiles, tels que des utilitaires d'augmentation et de visualisation de données, fournis par l'équipe d'ingénierie de Vector AI. Le code du projet est disponible dans le dépôt du projet de vision par ordinateur .