robotics-and-intelligent-systems
Étude de cas : Calcul de la distance entre les objets et les objets utilisant la vision stéréo dans les robots industriels
Table of Contents
Introduction à la vision stéréo en robotique industrielle
La technologie de vision stéréo a révolutionné la façon dont les robots industriels perçoivent et interagissent avec leur environnement. En imitant la capacité du système visuel humain à percevoir la profondeur, la vision stéréo permet aux robots de mesurer avec précision les distances aux objets, de naviguer dans des espaces de travail complexes et d'effectuer des tâches de précision avec une précision sans précédent.
La vision informatique proche de la vision humaine ne peut être créée qu'à l'aide de caméras stéréo. Ce principe fondamental sous-tend l'adoption généralisée de systèmes de vision stéréo dans la robotique industrielle. L'automatisation continue de progresser, la capacité de percevoir avec précision l'espace tridimensionnel est devenue essentielle pour les robots opérant dans des environnements dynamiques et non structurés où les méthodes de détection traditionnelles sont insuffisantes.
La taille du marché mondial des capteurs robotiques était estimée à 1 819,4 millions de dollars en 2024 et devrait atteindre 3 625,8 millions de dollars d'ici 2033, soit une augmentation de 8,1 % du TCAC entre 2025 et 2033, sous l'impulsion de l'adoption croissante de l'automatisation dans tous les secteurs industriels, ainsi que du déploiement croissant de robots mobiles autonomes (RAM) et de robots collaboratifs (cobots).
Comprendre les fondements de la vision stéréo
Le principe de la vision binoculaire
Les systèmes de vision stéréo fonctionnent selon le même principe que la vision binoculaire humaine. Deux caméras positionnées à différents points de vue capturent simultanément des images de la même scène. En analysant les différences entre ces images – spécifiquement le déplacement horizontal des points correspondants – le système peut calculer des informations de profondeur pour les objets de la scène.
Le système de vision stéréo est l'une des techniques de vision informatiques populaires. L'idée ici est d'utiliser l'erreur parallaxe à notre avantage. Une scène unique est enregistrée à partir de deux angles de vision différents, et la profondeur est estimée à partir de la mesure de l'erreur parallaxe.
Configuration de la caméra et référence
L'arrangement physique des caméras dans un système de vision stéréo est crucial pour ses performances. La ligne entre les centres des caméras est appelée la ligne de base. La distance de base affecte directement la précision et la portée des mesures de profondeur. Une ligne de base plus large fournit généralement une meilleure résolution de profondeur à plus grandes distances, tandis qu'une ligne de base plus petite est plus appropriée pour des applications à proximité.
La formule de profondeur intègre sa relation inversement proportionnelle à la disparité ainsi qu'à la relation directement proportionnelle à la base de référence. La longueur focale et la base de référence sont des constantes de caméra stéréo qui sont obtenues à partir de l'étalonnage stéréo. Comprendre cette relation est essentielle pour concevoir des systèmes de vision stéréo qui répondent aux exigences spécifiques de l'application.
Les mathématiques du calcul de profondeur
Lorsque deux caméras capturent le même point dans l'espace, ce point apparaît à différentes positions dans le plan d'image de chaque caméra. PL(uL, vL) et PR(uR, vR) sont des projections du point Po dans le plan d'image gauche et droit respectivement. Cette configuration nous donne les quatre équations suivantes. Résoudre ces équations, nous obtenons x, y et z comme suit. Ici, le z est la profondeur du point de l'appareil.
Le calcul de la profondeur de Z dans un système stéréovision est basé sur la différence parallaxe d. La valeur de disparité — la différence horizontale de pixel entre les points correspondants dans les images de gauche et de droite — est inversement proportionnelle à la profondeur. Cela signifie que les objets plus proches de la caméra présentent des valeurs de disparité plus grandes, tandis que les objets éloignés montrent des disparités plus petites.
La précision de la profondeur diminue avec le carré de la distance Z; la précision de la profondeur stéréo varie de 1% de la distance à courte portée à 9% à longue portée. Cette caractéristique doit être prise en compte lors de la conception de systèmes de vision stéréo pour des applications industrielles spécifiques, car les exigences de précision varient considérablement selon les cas d'utilisation.
Étalonnage de la caméra: la fondation de l'estimation précise de la profondeur
Importance de l'étalonnage
L'étalonnage des caméras est une condition essentielle pour une vision stéréo précise. Les systèmes de vision stéréo sont l'une des méthodes les plus utilisées pour effectuer la cartographie tridimensionnelle. Ces systèmes ont plusieurs considérations pour remplir cette tâche; L'un d'eux est l'étalonnage des caméras. Sans un étalonnage approprié, les relations géométriques entre les caméras et la scène ne peuvent pas être établies avec précision, ce qui entraîne des erreurs significatives dans l'estimation de profondeur.
L'étalonnage est généralement effectué à l'aide d'un modèle connu, comme un tableau de vérification, et d'algorithmes spécialisés qui minimisent l'erreur de reprojection entre les points observés et projetés. Ce processus détermine les paramètres intrinsèques (tels que la longueur focale et le centre optique) et extrinsèques (la position relative et l'orientation entre les caméras).
Défis et solutions d'étalonnage
La dérive d'étalonnage est un véritable ennemi de la précision dans la robotique industrielle. En robotique, cela peut avoir de graves conséquences. Des facteurs environnementaux tels que les changements de température, les vibrations et les contraintes mécaniques peuvent entraîner une dérive des paramètres d'étalonnage au fil du temps, des performances du système dégradant.
Si le robot se déplace, il peut mal juger les distances, ce qui entraîne des routes inefficaces ou même des collisions. De même, dans les applications de pic-et-place, un robot doit savoir exactement où un objet doit le saisir de façon fiable. La dérive de calibration peut faire que ces pics sont hors-cible, ralentissant ainsi tout le processus.
Pour combattre la dérive de l'étalonnage, les systèmes industriels mettent souvent en œuvre des procédures de recalage périodique ou utilisent des algorithmes d'auto-étalonnage qui permettent de détecter et de compenser les changements de paramètres. Cet article propose une méthode d'étalonnage automatique basée sur la mesure de la boucle fermée de vision stéréo.
Processus de rectification
Après calibrage, les images doivent être rectifiées pour simplifier le problème de correspondance. Ceci est corrigé par correction stéréo. La rectification stéréo est la reprojection des plans d'image gauche et droite sur un plan commun parallèle à la base. La rectification transforme les images de sorte que les points correspondants se trouvent sur la même ligne de balayage horizontal, réduisant l'espace de recherche de deux dimensions à une.
Dans les images stéréo rectifiées, toute paire de points correspondants est située sur la même ligne de pixel. Les images rectifiées ont des lignes épipolaires horizontales et sont alignées en ligne. Cet alignement est essentiel pour un calcul efficace et précis des disparités, car il limite la recherche de points correspondants à une seule dimension.
Le problème de correspondance stéréo
Trouver des points correspondants
Pour calculer la disparité, il faut trouver chaque pixel de l'image de gauche et le faire correspondre à chaque pixel de l'image de droite. Ceci est appelé le problème de correspondance stéréo. Le but est d'identifier quel pixel de l'image de droite correspond à chaque pixel de l'image de gauche.
Maintenant, pour trouver ce pixel dans la bonne image, il suffit de le rechercher sur la ligne épipolaire. Il n'est pas nécessaire de rechercher 2D, le point doit être situé sur cette ligne et la recherche est réduite à 1D. Cette contrainte réduit considérablement la complexité computationnelle et améliore la précision de correspondance.
Fonctions correspondant aux algorithmes
Les algorithmes de correspondance des fonctions, tels que SIFT (Scale-Invariant Feature Transform), SURF (Speed-Up Robust Features) et ORB (Oriented FAST and Rotationd BRIEF), sont couramment utilisés à cette fin. Ces algorithmes identifient les caractéristiques distinctives des images et les correspondent à travers la paire stéréo. La disparité est ensuite calculée comme le décalage horizontal entre les points correspondants.
Chaque algorithme offre différents compromis entre précision, efficacité de calcul et robustesse des transformations d'images. SIFT et SURF offrent une excellente précision de couplage, mais sont calculables intensives, tandis que ORB offre un traitement plus rapide au prix d'une certaine précision. Le choix de l'algorithme dépend des exigences spécifiques de l'application industrielle.
Correspondance par blocs et correspondance dense
Pour les applications nécessitant des cartes de profondeur dense, on utilise couramment des algorithmes de couplage de blocs. Ces algorithmes comparent de petites fenêtres ou blocs de pixels entre les images de gauche et de droite pour trouver des correspondances. La carte de disparité, qui représente la disparité à chaque pixel, est utilisée pour générer la carte de profondeur. Cependant, les cartes de disparité contiennent souvent du bruit et nécessitent des améliorations.
Le jumelage semi-global (SGM) est devenu particulièrement populaire dans les applications industrielles en raison de sa capacité à produire des cartes de disparité de haute qualité tout en maintenant une efficacité raisonnable de calcul.
Mise en œuvre dans les systèmes de robots industriels
Exigences en temps réel en matière de traitement
Les robots industriels équipés de caméras stéréo doivent traiter les images en temps réel pour permettre une interaction réactive avec leur environnement. Le système identifie les caractéristiques clés des images et calcule les disparités, qui sont ensuite converties en mesures de distance. Ce processus permet aux robots de naviguer et de manipuler les objets avec une grande précision.
Paralléliser les algorithmes ci-dessus les rend compatibles pour fonctionner sur les GPU et surmonter la plupart des limitations de vitesse. Bien que le nombre de calculs soit presque le même, leur exécution parallèle prend beaucoup moins de temps que leur exécution en série. Cette progression ouvre des portes pour l'exécution d'algorithmes plus complexes beaucoup plus rapidement et permet donc des sorties de meilleure qualité en temps réel.
Les systèmes modernes de vision stéréo tirent parti de l'accélération du GPU et du matériel spécialisé pour atteindre les vitesses de traitement requises pour les applications industrielles, ce qui permet aux robots de prendre des décisions et d'ajuster leurs mouvements en fonction de la rétroaction visuelle avec un minimum de latence, ce qui est crucial pour des tâches telles que les opérations de pic-et-place à grande vitesse ou l'évitement dynamique des obstacles.
Intégration avec les systèmes de contrôle robot
Après avoir lu les données de la ZED2i sur la position de l'objet détecté dans le système de coordonnées de la caméra compatible avec le système de coordonnées défini dans le robot, l'ordinateur doit communiquer avec le robot industriel en utilisant le paquet RMI. La communication suit un schéma qui comprend l'établissement d'une connexion, initialisation des paramètres, configuration du système, émission des instructions de mouvement et appel des programmes de robots.
L'intégration de la vision stéréo avec les systèmes de commande robot nécessite une coordination minutieuse de plusieurs cadres de coordonnées. Le système de coordonnées caméra doit être transformé en système de coordonnées de base du robot, en tenant compte de la position et de l'orientation de la caméra.
Combiner la vision avec l'IA et la détection d'objets
Les méthodes utilisées pour détecter un objet dans l'espace comprennent l'algorithme YoloV8, qui fonctionne sur une image 2D. L'algorithme a été formé pour détecter deux groupes d'objets strictement définis (XC80 OK et XC80 NOK). Les coordonnées du centre de l'objet détecté sont utilisées pour lire la distance de l'objet mesurée dans le système de la caméra.
Ce chapitre présente une nouvelle idée en utilisant les techniques existantes pour l'estimation de profondeur. La motivation est de rendre la procédure d'estimation de profondeur beaucoup plus légère et plus rapide. En termes simples, l'intensité est d'éviter le calcul de profondeur pour les pixels qui ne sont pas nécessaires. Il est plus utilisable quand couplé avec d'autres techniques de perception comme la détection d'objets et la ségrégation sémantique. Ces étapes de perception nous aident à exclure les pixels non requis pour lesquels l'estimation de profondeur peut être évitée.
En combinant la vision stéréo et les algorithmes modernes de détection d'objets basés sur l'IA, les robots industriels peuvent atteindre à la fois la compréhension sémantique (quels objets sont présents) et la compréhension géométrique (où les objets sont situés dans l'espace 3D).
Demandes industrielles et cas d'utilisation
Picking de la boîte et manipulation aléatoire de la partie
La technique de vision stéréo de texture projetée est principalement utilisée dans les applications de sélection de bacs. La tâche de sélectionner des objets aléatoires et non triés à partir d'un conteneur ou d'un bac de stockage présente un certain nombre de défis différents.
Grâce à sa conception compacte et industrielle, à la combinaison d'une très courte distance de travail et d'un large champ de vision, l'Ensenso B convient particulièrement aux applications de cueillage de bacs, ce qui le rend idéal pour une utilisation sur un bras robot, par exemple.
Robots mobiles autonomes et navigation
Les caméras de vision 3D combinant éclairage actif et détection passive peuvent maintenir la fidélité de profondeur dans de telles conditions. Par exemple, Gemini 335Lg d'Orbbec, lancé à ROSCon 2024, comprend une interface de sérializer (GMSL2) et un connecteur robuste (FAKRA) pour fournir des données de profondeur fiables dans des environnements mobiles robustes. Cette conception permet aux AMR de maintenir la perception de profondeur tout en se déplaçant sur des surfaces inégales, à travers des environnements électromagnétiques et sur de longues longueurs de câbles.
Les systèmes stéréovisions génèrent des nuages riches en points qui peuvent être fusionnés avec des données d'odométrie et d'unité de mesure inertielle (IMU) pour créer des cartes précises et une localisation robuste. Cette capacité est essentielle pour les robots mobiles autonomes opérant dans des environnements d'entrepôt et d'usine dynamiques.
Inspection et mesure de la qualité
Les systèmes de vision stéréo excellent dans les tâches de mesure dimensionnelle et d'inspection de qualité. En générant des modèles 3D précis de pièces et d'assemblages, ces systèmes peuvent vérifier les dimensions, détecter les défauts et assurer un montage approprié.
Pour une distance de 2,5 m entre les caméras et les objets, la précision a été établie à 0,01 mm. Lorsqu'ils sont correctement étalonnés et configurés, les systèmes de vision stéréo peuvent atteindre la précision du sous-millimètre, ce qui les rend adaptés aux applications de fabrication de précision.
Robotique collaborative et interaction homme-robot
Dans les applications de robots collaboratifs (cobot), la vision stéréo offre des capacités essentielles de sécurité et d'interaction. En surveillant en permanence l'espace 3D autour du robot, les systèmes de vision stéréo peuvent détecter la présence humaine, suivre les positions des mains et permettre une collaboration humaine-robot sûre.
Dans l'usine de l'avenir, la plupart des opérations seront effectuées par des robots autonomes qui ont besoin de rétroaction visuelle pour se déplacer autour de l'espace de travail en évitant les obstacles, pour travailler en collaboration avec les humains, pour identifier et localiser les pièces de travail, pour compléter les informations fournies par d'autres capteurs pour améliorer leur précision de positionnement, etc.
Avantages de la vision stéréo en robotique industrielle
Haute précision dans la mesure de distance
Les systèmes de vision stéréo offrent des mesures de distance très précises sur une large gamme de distances de travail. La précision peut être adaptée à des applications spécifiques en ajustant les paramètres de la caméra tels que la distance de référence, la longueur focale et la résolution.
La nature passive de la vision stéréo – uniquement sur l'éclairage ambiant ou structuré plutôt que sur des capteurs actifs – la rend particulièrement robuste dans des environnements où plusieurs robots ou capteurs peuvent interférer entre eux. Contrairement aux systèmes à temps de vol ou à laser, plusieurs systèmes stéréo-vision peuvent fonctionner dans le même espace sans interférence mutuelle.
Capacités de traitement en temps réel
Les systèmes modernes de vision stéréo peuvent traiter des images et générer des cartes de profondeur à des taux d'images adaptés au contrôle en temps réel des robots. Avec l'accélération GPU et des algorithmes optimisés, les systèmes peuvent atteindre des taux de traitement de 30 images par seconde ou plus, permettant un comportement réactif des robots dans des environnements dynamiques.
Cette nouvelle caméra, annoncée chez ProMat 2025, offre une détection de profondeur améliorée, ce qui la rend idéale pour une utilisation avec des bras robotiques, des robots mobiles autonomes et des applications d'automatisation d'entrepôt. Ce développement reflète l'expansion continue d'Orbbec dans des systèmes de vision 3D de qualité industrielle.
Rentabilité par rapport aux technologies de remplacement
Les systèmes de vision stéréo offrent un rapport coût-performance attrayant par rapport aux autres technologies de détection 3D. Bien que les scanners laser et les systèmes de lumière structurés puissent fournir une excellente précision, ils sont souvent à des coûts considérablement plus élevés.
Les systèmes robotiques reposent sur plusieurs modes de détection 3D pour générer des informations spatiales et de profondeur. Stereovision utilise des paires de caméras pour trianguler des caractéristiques de correspondance et former des cartes de profondeur denses. Les caméras RGB-D (combinant la couleur et la profondeur de détection) utilisent généralement des techniques de temps de vol (ToF) ou de lumière structurée pour produire des données de point-cloud.
La mesure sans contact réduit les risques de dommages
Contrairement aux sondes tactiles ou aux jauges mécaniques, la vision stéréo peut mesurer des objets sans contact physique, éliminer le risque de détérioration de parties délicates ou de contamination de surfaces propres, ce qui rend la vision stéréo idéale pour les applications dans la fabrication électronique, la production pharmaceutique et d'autres industries où le contact doit être réduit au minimum.
De plus, la mesure sans contact permet d'inspecter les objets en mouvement et de surveiller en temps réel les processus de production sans interrompre le flux de travail.
Riche information visuelle au-delà de la profondeur
Contrairement aux capteurs à simple usage, les systèmes de vision stéréo capturent des images complètes qui contiennent à la fois des informations de profondeur et des détails visuels riches. Cela permet aux robots d'effectuer plusieurs tâches avec un système de capteur unique, y compris la reconnaissance d'objets, l'analyse de texture, l'inspection des couleurs et la lecture de codes à barres, en plus de la mesure de distance.
Défis et limites de la vision stéréo
Sensibilité environnementale
La vision stéréo est forte dans les environnements avec une texture suffisante, mais peut se battre lorsque les surfaces manquent de fonctionnalités ou l'éclairage est faible. Les capteurs ToF mesurent directement la distance, mais peuvent souffrir dans des scènes très lumineuses ou très sombres.
La précision de la profondeur peut également être affectée par des mesures aberrantes sur des surfaces homogènes ou texturées, comme les murs blancs, les écrans verts et les zones miroirs.
Occlusion et Ambiguité de correspondance
Les occlusions se produisent lorsqu'un objet visible dans une caméra est caché dans la vue de l'autre caméra. Cela crée des régions où la correspondance ne peut pas être établie, entraînant des lacunes ou des erreurs dans la carte de profondeur. Bien que les algorithmes avancés puissent partiellement traiter cela par interpolation et fusion multi-vues, les occlusions demeurent une limitation fondamentale de la vision stéréo.
Les motifs et textures répétitifs peuvent aussi causer une ambiguïté dans la correspondance, où il existe plusieurs correspondances potentielles pour une fonction donnée. Cela peut entraîner des estimations de disparité incorrectes et des erreurs de profondeur.
Complexité informatique
Une image capturée par des caméras à haute résolution a des millions de pixels. Par conséquent, elle sera très intensive en processus si nous le faisons pour l'ensemble de l'image. Heureusement, nos caméras sont calibrées, et les images sont rectifiées. Par conséquent, nous n'avons besoin de chercher que le long de la ligne horizontale où se trouve PL.
L'accélération du GPU et les algorithmes optimisés ont considérablement amélioré les vitesses de traitement, mais les exigences de calcul limitent encore la résolution maximale et le taux d'encadrement réalisables dans les applications en temps réel.
Entretien de l'étalonnage
L'étalonnage et la synchronisation de plusieurs capteurs, y compris des caméras, des IMU et de l'odométrie des roues, sont complexes et nécessitent des systèmes robustes.
Les environnements industriels soumettent les systèmes de vision stéréo aux vibrations mécaniques, aux fluctuations de température et aux impacts physiques qui peuvent dégrader l'étalonnage au fil du temps. Le maintien de la précision de l'étalonnage exige une conception mécanique robuste pour éviter la dérive des paramètres ou des procédures de réétalonnage périodiques qui ajoutent aux exigences de maintenance du système.
Techniques avancées et développements futurs
Deep Learning pour le jumelage stéréo
De plus, les cartes de profondeur peuvent être améliorées grâce à des méthodes fondées sur l'apprentissage profond qui apprennent à prédire la profondeur à partir d'images stéréo. Les progrès récents dans l'apprentissage profond ont permis d'améliorer sensiblement la précision et la robustesse des correspondances stéréo.
Les approches d'apprentissage de bout en bout forment des réseaux pour prédire directement les disparités ou la profondeur à partir des paires d'images stéréo, contournant entièrement les algorithmes de correspondance traditionnels. Ces méthodes peuvent atteindre une précision de pointe tout en maintenant des performances en temps réel lorsqu'elles sont déployées sur du matériel approprié.
Fusion multi-modales des capteurs
Pour les tâches liées aux objets, les caméras ToF ont également été utilisées avec succès pour la reconstruction des objets et des surfaces, où la portée des distances est plus petite. Combiner la vision stéréo avec des modalités de détection complémentaires peut surmonter les limitations individuelles des capteurs et fournir une perception plus robuste.
La fusion de la vision stéréo avec des caméras de temps de vol, LiDAR ou des systèmes de lumière structurés peut fournir des informations de profondeur sur une plus grande gamme de conditions et de distances. Chaque type de capteur a différentes forces et faiblesses, et les algorithmes de fusion intelligente peuvent sélectionner l'estimation de profondeur la plus fiable pour chaque région de la scène.
Stéréo actif et amélioration de la lumière structurée
Trouver la texture optimale, c'est-à-dire celle qui fournit la meilleure correspondance entre les caractéristiques des images, est un problème compliqué, influencé par les caractéristiques du projecteur, du motif et des caméras stéréo. Les techniques de vision active obtiennent l'information 3D projetant un motif visible ou infrarouge sur l'objet.
Les systèmes stéréo actifs projettent des modèles structurés sur les lieux pour améliorer la texture et la fiabilité de l'appariement. Cette approche combine les avantages des stéréo passifs (sans ambiguïté de portée, systèmes simultanés multiples) avec la robustesse de la détection active.
Amélioration du matériel et des interfaces
En 2025, Orbbec a introduit le Gemini 335LE, une caméra 3D stéréo vision équipée de connectivité Ethernet. Les caméras stéréo vision modernes intègrent des interfaces avancées, des résolutions plus élevées et une synchronisation améliorée pour répondre aux exigences exigeantes de la robotique industrielle.
Les capteurs d'obturateurs mondiaux sont devenus standard dans les caméras stéréo industrielles, éliminant les artefacts de mouvement qui peuvent dégrader la précision de correspondance lors de l'imagerie des objets en mouvement ou lorsque la caméra elle-même est en mouvement.
Étude de cas : Mise en œuvre de la vision stéréo pour la manipulation robotique
Conception et configuration du système
Pour une mise en œuvre pratique de la vision stéréo pour le guidage industriel des robots, il faut un système de conception soigné. Lors de la configuration de la caméra ZED2i à l'aide des bibliothèques fournies par Stereolabs, de nombreux paramètres peuvent être définis.
Pour les tâches de manipulation, le montage de la caméra sur l'effecteur final du robot fournit le point de vue le plus flexible, mais nécessite un calibrage manuel. Les caméras fixes offrent un calibrage plus simple mais peuvent avoir une couverture limitée de l'espace de travail.
Analyse des erreurs et optimisation des performances
Les erreurs peuvent provenir de plusieurs sources, telles que la détection par YOLO, le calcul de la profondeur de la stéréovision, l'étalonnage du système de caméra et les transformations entre les systèmes de coordonnées. La modélisation mathématique précise et l'analyse de ces erreurs sont cruciales pour améliorer la précision du système et réduire les écarts par rapport à la position réelle de l'objet.
Si les points correspondants des images de gauche et de droite sont mal alignés (par exemple, en raison du bruit), l'erreur parallaxe entraîne une erreur de profondeur. L'erreur de profondeur ΔZ, peut être calculée à partir de la relation suivante: ... Base de la stériovision B (distance entre les caméras).
Résultats et améliorations
Les résultats expérimentaux montrent que cette méthode réduit considérablement l'erreur de positionnement absolu du robot, avec une diminution moyenne de 72,12 % après étalonnage. Une bonne compensation de calibrage et d'erreur peut améliorer considérablement les performances du système, transformant la vision stéréo d'un outil de guidage rugueux en un système de mesure de précision.
Les expériences réalisées ont démontré que la méthode proposée permet d'améliorer l'estimation de la profondeur dans le système de vision stéréo, avec une amélioration de 34,15 % sur l'EAM et de 48,38 % sur la MTS par rapport à l'une des méthodes les plus couramment utilisées.
Meilleures pratiques pour la mise en œuvre de la vision stéréo industrielle
Conception de l'éclairage
Un éclairage uniforme et diffus minimise les ombres et les reflets spéculaires qui peuvent interférer avec l'appariement. L'éclairage doit être suffisamment lumineux pour fournir un bon rapport signal-bruit dans les images de la caméra, mais pas aussi lumineux pour causer une saturation ou un contraste excessif.
Pour les applications impliquant des objets brillants ou réfléchissants, l'éclairage polarisé croisé peut réduire les reflets spéculaires. L'éclairage actif avec des motifs structurés peut améliorer la texture sur des surfaces autrement inviolables. La conception de l'éclairage doit être intégrée à la conception globale du système dès le début plutôt que d'être ajoutée comme post-considération.
Sélection et positionnement de la caméra
La sélection des caméras devrait tenir compte de la résolution, du taux de trame, de la taille des capteurs et des exigences d'interface. Une résolution plus élevée permet une estimation plus précise de la profondeur, mais nécessite une puissance de traitement plus élevée.
La distance de référence doit être choisie en fonction de la distance de travail et de la précision de la profondeur requise. Une règle générale est que la précision de la profondeur est proportionnelle au rapport entre la distance de travail et la base de référence.
Architecture logicielle et pipeline de traitement
L'architecture logicielle devrait être conçue pour la modularité et la maintenance. Des modules séparés pour l'acquisition d'images, l'étalonnage, la rectification, la correspondance et le calcul de profondeur permettent de tester et d'optimiser indépendamment les composants individuels.
Les pipelines de traitement devraient être optimisés pour la plateforme matérielle cible, en tirant parti de l'accélération du GPU lorsque disponible. Un profilage attentif peut identifier les goulets d'étranglement et guider les efforts d'optimisation.
Validation et essais
La validation complète est essentielle pour assurer des performances fiables dans les environnements de production. Les essais devraient couvrir toute la gamme des conditions de fonctionnement attendues, y compris les variations de l'éclairage, de l'apparence des objets et des facteurs environnementaux.
Des erreurs ont ensuite été déterminées entre la position estimée par le système de vision fonctionnant sur les données ZED 2i et la position réelle de l'objet. Des points de mesure d'échantillons ont été placés à la fois directement devant le robot et à la portée maximale du robot, en tenant compte du positionnement vertical du poignet du robot pour assurer le bon fonctionnement du système 3DV.
Tendances de l'industrie et perspectives du marché
L'adoption croissante dans les secteurs
Le segment des capteurs de vision/caméras devrait connaître le taux de croissance le plus élevé au cours de la période de prévision. Ces capteurs aident les robots à accomplir des tâches qui exigent une vérification de position, une inspection de la qualité ou un suivi des objets.
Les industries allant de l'automobile et de l'électronique à la transformation des aliments et aux produits pharmaceutiques adoptent une vision stéréo pour améliorer la qualité, augmenter le débit et réduire les coûts. La technologie est particulièrement utile dans les applications nécessitant une flexibilité pour gérer les variations de produits sans reprogrammation ou de changement d'outillage.
Intégration avec l'intelligence artificielle
En 2025, ABB a lancé sa nouvelle génération de robots mobiles autonomes (AMR) avec des capacités de Visual SLAM (Simultaneous Localization and Mapping) et d'IA, ainsi que la suite logicielle AMR Studio. Cette nouvelle solution permet aux robots de s'adapter en temps réel à des environnements dynamiques sans compter sur une infrastructure prédéfinie.
La convergence de la vision stéréo avec l'intelligence artificielle crée de nouvelles possibilités pour la perception et la prise de décision des robots. Les algorithmes AI peuvent interpréter l'information de profondeur dans le contexte, reconnaître des scènes complexes, et prendre des décisions intelligentes sur les actions des robots.
Difficultés rencontrées pour une adoption généralisée
Les recherches du NIST font également ressortir que les fabricants sont confrontés à des obstacles importants. Son rapport 2024 du GCR du NIST identifie les coûts d'investissement, les problèmes d'intégration et le manque d'expertise interne comme des contraintes majeures en matière d'adoption.
La fiabilité et la sécurité demeurent des préoccupations centrales.Les systèmes de vision doivent être tolérants à la défaillance des capteurs, au mauvais alignement ou à l'interférence environnementale.
Pour relever ces défis, il faut continuer à mettre au point des systèmes plus robustes et plus conviviaux, de meilleurs outils d'intégration et des ressources éducatives pour renforcer l'expertise interne.
Conclusion
La technologie de vision stéréo est devenue un outil indispensable pour calculer la distance entre les objets en robotique industrielle. En exploitant les principes de la vision binoculaire et des algorithmes de traitement d'image avancés, les systèmes de vision stéréo permettent aux robots de percevoir et d'interagir avec leur environnement avec une précision et une flexibilité sans précédent.
Bien que des défis demeurent, comme la sensibilité environnementale, la manipulation de l'occlusion et la maintenance de l'étalonnage, les progrès continus dans le matériel, les algorithmes et l'intelligence artificielle continuent d'accroître les capacités et la fiabilité des systèmes de vision stéréo.
L'automatisation industrielle continue d'évoluer vers une plus grande flexibilité et autonomie, la vision stéréo jouera un rôle de plus en plus critique.De la cueillette de bacs et de l'inspection de qualité à la navigation autonome et à la collaboration entre les humains et les robots, les applications de la vision stéréo dans la robotique industrielle sont diversifiées et croissantes.
L'avenir de la robotique industrielle est visuel, et la technologie de la vision stéréo fournit la perception de profondeur dont les robots ont besoin pour naviguer, manipuler et comprendre le monde tridimensionnel dans lequel ils opèrent. Pour les ingénieurs et les organisations qui cherchent à mettre en œuvre des systèmes robotiques avancés, la compréhension et la mise à profit de la technologie de la vision stéréo est essentielle pour rester concurrentiel dans le paysage en évolution rapide de l'automatisation industrielle.
Ressources supplémentaires
Pour ceux qui souhaitent en savoir plus sur la vision stéréo et ses applications en robotique industrielle, plusieurs excellentes ressources sont disponibles en ligne. La documentation OpenCV fournit des tutoriels complets sur l'étalonnage des caméras, la rectification stéréo et le calcul des disparités. La communauté Robot Operating System (ROS) offre des paquets et des outils pour intégrer la vision stéréo dans les systèmes robotiques.
Des organisations industrielles comme Association for Advancecing Automation[ offrent des études de cas, des livres blancs et des possibilités de réseautage aux professionnels travaillant avec la robotique guidée par la vision.
En tirant parti de ces ressources et en suivant les meilleures pratiques décrites dans cet article, les ingénieurs et les organisations peuvent mettre en place avec succès des systèmes de vision stéréo qui améliorent les capacités de leurs robots industriels, améliorent l'efficacité des processus et stimulent l'innovation dans la fabrication et l'automatisation.