Observatoire du Numérique
TechTrends 6  /  8

La vision par ordinateur

Découvrez comment les modèles analysent des images, reconnaissent des objets, segmentent des scènes et génèrent de nouveaux contenus visuels.


La vision par ordinateur permet à une machine d'analyser des images et des vidéos. Elle est utilisée pour reconnaître des objets, lire du texte, inspecter un produit ou comprendre l'organisation d'une scène.

Pour un modèle, une image est d'abord un ensemble de pixels représentés par des valeurs numériques. Pendant son entraînement, il apprend à repérer des formes, des couleurs, des contours et des relations entre les différentes zones de l'image.

Reconnaître le contenu d'une image

La classification attribue une catégorie à une image entière. Un modèle peut par exemple déterminer si une photographie représente un animal, un véhicule ou un paysage.

Il produit généralement plusieurs catégories accompagnées d'un score de probabilité. La classification indique donc ce qui apparaît principalement dans l'image, mais pas nécessairement où l'élément se trouve.

Localiser les objets

La détection d'objets identifie plusieurs éléments dans une même image et indique leur position. Chaque objet détecté est généralement entouré d'un rectangle et associé à une catégorie.

Cette technique peut servir à repérer des véhicules sur une route, des produits sur une étagère ou des défauts sur une chaîne de production. Elle peut également suivre les objets d'une image à l'autre dans une vidéo.

Découper précisément une scène

La segmentation analyse l'image pixel par pixel. Elle détermine quelles zones appartiennent à un objet, au sol, au ciel ou à un autre élément de la scène.

Elle est plus précise que la détection, qui utilise principalement des rectangles. Elle peut notamment isoler une personne de l'arrière-plan, mesurer une zone sur une image médicale ou distinguer les différents éléments d'une route.

Classification

Détermine la catégorie principale d'une image.

Détection

Identifie les objets et indique leur position.

Segmentation

Attribue une catégorie à chaque zone ou pixel.

Suivi

Observe le déplacement d'un objet dans une vidéo.

Comment les modèles apprennent à voir

Les modèles sont entraînés avec de nombreuses images accompagnées des résultats attendus. Selon la tâche, les données peuvent contenir une catégorie, la position des objets ou un masque qui délimite précisément chaque élément.

Les premières couches du réseau repèrent généralement des structures simples, comme des lignes et des contours. Les couches suivantes combinent ces informations pour reconnaître des formes et des objets plus complexes.

La qualité des résultats dépend fortement de la diversité des images d'entraînement. Un modèle peut échouer face à une luminosité, un angle ou un objet peu représenté dans ses données.

Générer de nouvelles images

La vision par ordinateur ne sert pas uniquement à analyser des contenus existants. Les modèles génératifs peuvent créer une image à partir d'une description, modifier un visuel ou compléter une partie manquante.

Les diffusion models, souvent utilisés pour cette tâche, apprennent à reconstruire progressivement une image à partir de bruit. Ils ne recherchent pas simplement une photographie existante, mais génèrent un nouveau résultat selon les structures apprises pendant leur entraînement.

La classification indique ce que contient une image. La détection précise où se trouvent les objets. La segmentation délimite chaque élément. Les modèles génératifs produisent de nouveaux contenus visuels.

Un modèle ne voit pas une scène comme une personne. Il reconnaît des structures statistiques dans les pixels. Il peut donc confondre des objets, ignorer un élément inhabituel ou produire une image visuellement crédible mais incohérente.

Les résultats importants doivent être vérifiés, en particulier dans les domaines médicaux, industriels ou liés à la sécurité.


Sources
  • IBM, présentation générale de la vision par ordinateur et de ses principales applications : www.ibm.com
  • Google AI Edge, documentation sur la classification, la détection et la segmentation d'images : developers.google.com
  • PyTorch, documentation sur la détection et la segmentation d'objets : docs.pytorch.org
  • OpenCV, documentation sur le traitement des images et la détection d'objets : docs.opencv.org
  • IBM, présentation des diffusion models utilisés pour générer des images : www.ibm.com