La vision par ordinateur permet à une machine d'analyser des images et des vidéos. Elle est utilisée pour reconnaître des objets, lire du texte, inspecter un produit ou comprendre l'organisation d'une scène.
Pour un modèle, une image est d'abord un ensemble de pixels représentés par des valeurs numériques. Pendant son entraînement, il apprend à repérer des formes, des couleurs, des contours et des relations entre les différentes zones de l'image.