Table of Contents

Einführung in Stereo Vision in der industriellen Robotik

Stereovision-Technologie hat die Art und Weise revolutioniert, wie Industrieroboter ihre Umgebung wahrnehmen und mit ihr interagieren. Durch die Nachahmung der Fähigkeit des menschlichen visuellen Systems, Tiefe wahrzunehmen, ermöglicht Stereovision Robotern, Entfernungen zu Objekten genau zu messen, komplexe Arbeitsbereiche zu navigieren und Präzisionsaufgaben mit beispielloser Genauigkeit durchzuführen. Diese Technologie ist zu einem Eckpfeiler der modernen Automatisierung geworden, was Effizienz- und Sicherheitsverbesserungen in Fertigungs-, Logistik- und Qualitätskontrollanwendungen vorantreibt.

Computer Vision, das dem menschlichen Sehen nahe kommt, kann nur mit Stereokameras erzeugt werden. Dieses Grundprinzip liegt der weit verbreiteten Einführung von Stereo Vision Systemen in der industriellen Robotik zugrunde. Mit dem fortschreitenden Automatisierungsfortschritt ist die Fähigkeit, dreidimensionale Räume genau wahrzunehmen, für Roboter, die in dynamischen, unstrukturierten Umgebungen arbeiten, in denen traditionelle Sensormethoden zu kurz kommen, unerlässlich geworden.

Die globale Marktgröße für Robotersensoren wurde auf 1.819,4 Mio. USD im Jahr 2024 geschätzt und wird bis 2033 voraussichtlich auf 3.625,8 Mio. USD steigen, was von 2025 bis 2033 auf einen CAGR von 8,1% zurückzuführen ist, was auf die zunehmende Einführung von Automatisierung in Industriesektoren und den zunehmenden Einsatz autonomer mobiler Roboter (AMRs) und kollaborativer Roboter (Cobots) zurückzuführen ist.

Die Grundlagen des Stereo Vision verstehen

Das Prinzip der binokularen Vision

Stereovision-Systeme arbeiten nach dem gleichen Prinzip wie das menschliche Fernsehen. Zwei Kameras, die an verschiedenen Standpunkten positioniert sind, erfassen gleichzeitig Bilder derselben Szene. Durch die Analyse der Unterschiede zwischen diesen Bildern - insbesondere der horizontalen Verschiebung entsprechender Punkte - kann das System Tiefeninformationen für Objekte innerhalb der Szene berechnen.

Das Stereo-Vision-System ist eine der populärsten Computer-Vision-Techniken. Die Idee hier ist, den Parallaxenfehler zu unserem Vorteil zu nutzen. Eine einzelne Szene wird aus zwei verschiedenen Blickwinkeln aufgenommen und die Tiefe wird aus dem Maß des Parallaxenfehlers geschätzt. Dieser Parallaxeneffekt ist das gleiche Phänomen, das es Menschen ermöglicht, Entfernungen zu beurteilen und dreidimensionalen Raum wahrzunehmen.

Kamerakonfiguration und Baseline

Die physikalische Anordnung von Kameras in einem Stereovision-System ist für seine Leistung entscheidend. Die Linie zwischen den Kamerazentren wird als Baseline bezeichnet. Der Baseline-Abstand beeinflusst direkt die Genauigkeit und den Bereich der Tiefenmessungen. Eine größere Baseline bietet in der Regel eine bessere Tiefenauflösung bei größeren Entfernungen, während eine kleinere Baseline für Nahbereichsanwendungen besser geeignet ist.

Die Formel für Tiefe enthält sowohl die umgekehrt proportionale Relation zur Disparität als auch die direkt proportionale Relation zur Basislinie. Fokale Länge und Basislinie sind Stereokamerakonstanten, die aus der Stereokalibrierung gewonnen werden.

Die Mathematik der Tiefenberechnung

Die mathematische Grundlage des Stereo-Sehvermögens beruht auf Triangulationsprinzipien. Wenn zwei Kameras denselben Punkt im Raum erfassen, erscheint dieser Punkt an verschiedenen Positionen in der Bildebene jeder Kamera. PL(uL, vL) und PR(uR, vR) sind Projektionen des Punktes Po in der linken bzw. rechten Bildebene. Diese Anordnung gibt uns die folgenden vier Gleichungen. Wenn wir diese Gleichungen lösen, erhalten wir x, y und z wie folgt. Hier ist das z die Tiefe des Punktes von der Kamera.

Die Berechnung der Tiefe von Z in einem Stereovisionssystem basiert auf der Parallaxendifferenz d. Der Disparitätswert - die horizontale Pixeldifferenz zwischen entsprechenden Punkten im linken und rechten Bild - ist umgekehrt proportional zur Tiefe. Das bedeutet, dass näher an der Kamera liegende Objekte größere Disparitätswerte aufweisen, während entfernte Objekte kleinere Disparitäten aufweisen.

Die Genauigkeit der Tiefe nimmt mit dem Quadrat des Abstands Z ab; die Genauigkeit der Stereotiefe reicht von 1% des Abstands im Nahbereich bis 9% im Fernbereich. Diese Eigenschaft muss bei der Entwicklung von Stereovision-Systemen für spezifische industrielle Anwendungen berücksichtigt werden, da die Genauigkeitsanforderungen in verschiedenen Anwendungsfällen erheblich variieren.

Kamerakalibrierung: Die Grundlage für eine genaue Tiefenschätzung

Bedeutung der Kalibrierung

Die Kamerakalibrierung ist eine entscheidende Voraussetzung für eine genaue Stereovision. Stereovision-Systeme sind eine der am häufigsten verwendeten Methoden zur Durchführung dreidimensionaler Abbildungen. Diese Systeme haben mehrere Überlegungen, um diese Aufgabe zu erfüllen. Eine davon ist die Kamerakalibrierung. Ohne eine ordnungsgemäße Kalibrierung können die geometrischen Beziehungen zwischen Kameras und der Szene nicht genau ermittelt werden, was zu erheblichen Fehlern bei der Tiefenschätzung führt.

Die Kalibrierung erfolgt typischerweise unter Verwendung eines bekannten Musters, wie einer Schachtafel, und spezieller Algorithmen, die den Reprojektionsfehler zwischen beobachteten und projizierten Punkten minimieren, wobei sowohl intrinsische Parameter (wie Brennweite und optische Mitte) als auch extrinsische Parameter (die relative Position und Orientierung zwischen Kameras) bestimmt werden.

Kalibrierherausforderungen und Lösungen

Kalibrierdrift ist ein echter Feind der Präzision in der industriellen Robotik. In der Robotik kann dies schwerwiegende Folgen haben. Umweltfaktoren wie Temperaturänderungen, Vibrationen und mechanische Belastung können dazu führen, dass Kalibrierparameter im Laufe der Zeit driften und die Systemleistung beeinträchtigen.

Sie verlassen sich auf Stereovision, um zu navigieren und Hindernisse zu vermeiden. Wenn die Kalibrierung driftet, könnte der Roboter Entfernungen falsch einschätzen, was zu ineffizienten Routen oder sogar Kollisionen führt. In ähnlicher Weise muss ein Roboter bei Pick-and-Place-Anwendungen genau wissen, wo ein Objekt ist, um es zuverlässig zu erfassen. Kalibrierdrift kann dazu führen, dass diese Picks nicht zielgerichtet sind und den gesamten Prozess verlangsamen.

Um der Kalibrierdrift entgegenzuwirken, implementieren industrielle Systeme häufig periodische Rekalibrierungsverfahren oder verwenden Selbstkalibrierungsalgorithmen, die Parameteränderungen erkennen und kompensieren können. In diesem Beitrag wird ein automatisches Kalibrierverfahren vorgeschlagen, das auf einer geschlossenen Stereovisions-Schleifschleifenmessung basiert und darauf abzielt, eine effiziente Kalibrierung und Kompensation von Endeffektorpositionierungsfehlern durch visuelle Wahrnehmung und kinematische Optimierungsalgorithmen zu erreichen.

Berichtigungsverfahren

Nach der Kalibrierung müssen Bilder korrigiert werden, um das Korrespondenzproblem zu vereinfachen. Dies wird durch Stereo-Entzerrung behoben. Stereo-Entzerrung ist die Reprojektion der linken und rechten Bildebene auf eine gemeinsame Ebene parallel zur Basislinie. Die Entzerrung transformiert die Bilder so, dass entsprechende Punkte auf derselben horizontalen Scanlinie liegen, wodurch der Suchraum von zwei Dimensionen auf eine reduziert wird.

Bei gleichgerichteten Stereobildern befinden sich jedes Paar von korrespondierenden Punkten auf derselben Pixelzeile. Gleichgerichtete Bilder haben horizontale epipolare Linien und sind zeilenorientiert. Diese Ausrichtung ist für eine effiziente und genaue Disparitätsberechnung unerlässlich, da sie die Suche nach korrespondierenden Punkten auf eine einzige Dimension beschränkt.

Das Stereo-Korrespondenzproblem

Matching Points finden

Um die Disparität zu berechnen, müssen wir jedes Pixel aus dem linken Bild finden und es mit jedem Pixel im rechten Bild vergleichen. Das nennt man Stereo-Korrespondenzproblem. Das Ziel ist es, zu identifizieren, welches Pixel im rechten Bild jedem Pixel im linken Bild entspricht.

Um dieses Pixel im richtigen Bild zu finden, suchen Sie es einfach auf der epipolaren Linie. Es ist keine 2D-Suche erforderlich, der Punkt sollte sich auf dieser Linie befinden und die Suche ist auf 1D verengt. Diese Einschränkung reduziert die Rechenkomplexität erheblich und verbessert die Übereinstimmungsgenauigkeit.

Feature Matching Algorithmen

Dazu werden häufig Feature-Matching-Algorithmen wie SIFT (Scale-Invariant Feature Transform), SURF (Speeded-Up Robust Features) und ORB (Oriented FAST and Rotated BRIEF) verwendet, die charakteristische Merkmale in den Bildern identifizieren und über das Stereopaar hinweg abgleichen. Die Disparität wird dann als horizontale Verschiebung zwischen entsprechenden Punkten berechnet.

Jeder Algorithmus bietet unterschiedliche Kompromisse zwischen Genauigkeit, Recheneffizienz und Robustheit bei Bildtransformationen. SIFT und SURF bieten eine ausgezeichnete Übereinstimmungsgenauigkeit, sind aber rechenintensiv, während ORB eine schnellere Verarbeitung auf Kosten einer gewissen Genauigkeit bietet. Die Wahl des Algorithmus hängt von den spezifischen Anforderungen der industriellen Anwendung ab.

Block Matching und dichte Korrespondenz

Für Anwendungen, die dichte Tiefenkarten erfordern, werden Blockabgleichsalgorithmen verwendet. Diese Algorithmen vergleichen kleine Fenster oder Pixelblöcke zwischen dem linken und dem rechten Bild, um Übereinstimmungen zu finden. Die Disparitätskarte, die die Disparität bei jedem Pixel darstellt, wird zur Erzeugung der Tiefenkarte verwendet. Disparitätskarten enthalten jedoch häufig Rauschen und erfordern eine Verfeinerung. Techniken wie Blockabgleich, halbglobales Abgleichen und Graphenschnitte werden verwendet, um die Genauigkeit und Glätte der Disparitätskarte zu verbessern.

Semi-globales Matching (SGM) ist in industriellen Anwendungen besonders beliebt geworden, da es qualitativ hochwertige Disparitätskarten erstellen kann, während eine angemessene Recheneffizienz erhalten bleibt. SGM aggregiert die Matching-Kosten auf mehreren Pfaden durch das Bild und bietet eine bessere Handhabung von Okklusionen und texturlosen Regionen im Vergleich zu einfachen Block-Matching.

Implementierung in industrielle Robotersysteme

Echtzeit-Verarbeitungsanforderungen

Industrieroboter, die mit Stereokameras ausgestattet sind, müssen Bilder in Echtzeit verarbeiten, um eine reaktionsschnelle Interaktion mit ihrer Umgebung zu ermöglichen. Das System identifiziert die wichtigsten Merkmale in beiden Bildern und berechnet Disparitäten, die dann in Entfernungsmessungen umgewandelt werden. Dieser Prozess ermöglicht es Robotern, Objekte mit hoher Präzision zu navigieren und zu manipulieren.

Die Parallelisierung der oben genannten Algorithmen macht sie kompatibel, um auf GPUs laufen zu können und die meisten Geschwindigkeitsbeschränkungen zu überwinden. Obwohl die Anzahl der Berechnungen fast gleich ist, nimmt ihre parallele Ausführung viel weniger Zeit in Anspruch als ihre serielle Ausführung. Diese Weiterentwicklung öffnet Türen für die Ausführung komplexerer Algorithmen viel schneller und ermöglicht somit qualitativ bessere Ausgaben in Echtzeit.

Moderne Stereo-Vision-Systeme nutzen GPU-Beschleunigung und spezialisierte Hardware, um die für industrielle Anwendungen erforderlichen Verarbeitungsgeschwindigkeiten zu erreichen. Dies ermöglicht es Robotern, Entscheidungen zu treffen und ihre Bewegungen basierend auf visuellem Feedback mit minimaler Latenzzeit anzupassen, was für Aufgaben wie High-Speed-Pick-and-Place-Operationen oder dynamische Hindernisvermeidung entscheidend ist.

Integration mit Robotersteuerungssystemen

Nach dem Lesen der Daten aus dem ZED2i über die Position des erkannten Objekts im Kamerakoordinatensystem, das mit dem im Roboter definierten Koordinatensystem kompatibel ist, soll der Computer mit dem Industrieroboter über das RMI-Paket kommunizieren, wobei die Kommunikation einem Schema folgt, das den Aufbau einer Verbindung, die Initialisierung von Parametern, die Konfiguration des Systems, die Ausgabe von Bewegungsanweisungen und das Abrufen von Roboterprogrammen umfasst.

Die Integration von Stereovision mit Robotersteuerungssystemen erfordert eine sorgfältige Koordination mehrerer Koordinatenrahmen. Das Kamerakoordinatensystem muss in das Basiskoordinatensystem des Roboters umgewandelt werden, wobei die Einbaulage und Ausrichtung der Kamera berücksichtigt werden. Diese Transformation ermöglicht es dem Roboter, Zielpositionen, die durch das Visionsystem identifiziert werden, genau zu erreichen.

Kombination von Vision mit AI und Object Detection

Zur Erfassung eines Objekts im Raum wird der YoloV8-Algorithmus verwendet, der auf einem 2D-Bild arbeitet, wobei der Algorithmus darauf trainiert wurde, zwei streng definierte Gruppen von Objekten (XC80 OK und XC80 NOK) zu erkennen, wobei die Koordinaten des Zentrums des erfassten Objekts verwendet werden, um die im Kamerasystem gemessene Entfernung des Objekts abzulesen.

Dieses Kapitel stellt eine neue Idee vor, während es die vorhandenen Techniken zur Tiefenschätzung verwendet. Die Motivation ist, das Tiefenschätzungsverfahren viel leichter und schneller zu machen. In einfachen Worten, die Absicht ist, die Berechnung der Tiefe für die Pixel zu vermeiden, die nicht benötigt werden. Es ist am besten verwendbar, wenn es mit anderen Wahrnehmungstechniken wie Objekterkennung und semantische Segmentierung gekoppelt wird. Diese Wahrnehmungsschritte helfen uns, die nicht benötigten Pixel auszuschließen, für die Tiefenschätzung vermieden werden kann.

Durch die Kombination von Stereovision mit modernen KI-basierten Objekterkennungsalgorithmen können Industrieroboter sowohl semantisches Verständnis (welche Objekte vorhanden sind) als auch geometrisches Verständnis (wo sich Objekte im 3D-Raum befinden) erreichen. Diese Kombination ermöglicht anspruchsvolle Anwendungen wie Qualitätskontrolle, Fehlererkennung und intelligente Sortierung.

Industrielle Anwendungen und Use Cases

Bin Picking und Random Part Handling

Die Aufgabe, zufällige und unsortierte Objekte aus einem Container oder einem Lagerbehälter zu holen, stellt eine Reihe verschiedener Herausforderungen dar. Stereovision ermöglicht es Robotern, Objekte in überladenen, unstrukturierten Umgebungen zu lokalisieren und zu erfassen, in denen herkömmliche 2D-Vision-Systeme ausfallen würden.

Mit ihrem kompakten, industriellen Design und der Kombination aus einem sehr kurzen Arbeitsabstand und einem großen Sichtfeld eignet sich die Ensenso B besonders für Bin-Picking-Anwendungen. Dies macht sie ideal für den Einsatz auf einem Roboterarm, zum Beispiel. Moderne Stereokameras, die speziell für die Bin-Picking entwickelt wurden, können im Nahbereich arbeiten, während ein breites Sichtfeld erhalten bleibt, so dass Roboter in tiefe Bins sehen und eine Vielzahl von Teilegrößen handhaben können.

Autonome mobile Roboter und Navigation

AMRs müssen unter unterschiedlichen Beleuchtungs- und Geländebedingungen arbeiten, einschließlich staubiger Lagerhallen oder Außenhöfen. 3D-Vision-Kameras, die aktive Beleuchtung und passive Erfassung kombinieren, können die Tiefentreue unter solchen Bedingungen aufrechterhalten. Zum Beispiel umfasst Orbbecs Gemini 335Lg, das auf der ROSCon 2024 eingeführt wurde, eine Serializer-Schnittstelle (GMSL2) und einen robusten Stecker (FAKRA), um zuverlässige Tiefendaten in robusten mobilen Umgebungen zu liefern. Dieses Design ermöglicht es AMRs, die Tiefenwahrnehmung beizubehalten, während sie sich über unebene Oberflächen, durch elektromagnetische Umgebungen und über lange Kabellängen bewegen.

Die gleichzeitige Lokalisierung und Kartierung (SLAM) profitiert stark von dichten Tiefendaten. Stereo-Vision-Systeme erzeugen reiche Punktwolken, die mit Odometrie- und Inertialmesseinheiten (IMU)-Daten verschmolzen werden können, um genaue Karten und robuste Lokalisierung zu erstellen. Diese Fähigkeit ist für autonome mobile Roboter, die in dynamischen Lager- und Fabrikumgebungen arbeiten, unerlässlich.

Qualitätskontrolle und -messung

Stereovision-Systeme zeichnen sich bei der Messung von Dimensionen und Qualitätsinspektionsaufgaben aus. Durch die Erzeugung genauer 3D-Modelle von Teilen und Baugruppen können diese Systeme Abmessungen überprüfen, Defekte erkennen und eine ordnungsgemäße Montage sicherstellen. Die berührungslose Natur des Stereovisions macht es ideal für die Inspektion empfindlicher oder empfindlicher Komponenten, die durch physikalische Messwerkzeuge beschädigt werden könnten.

Bei einem Abstand von Kamera zu Objekt von 2,5 m wurde eine Genauigkeit von 0,01 mm festgestellt. Bei richtiger Kalibrierung und Konfiguration können Stereovision-Systeme eine Genauigkeit von unter einem Millimeter erreichen, wodurch sie sich für Präzisionsfertigungsanwendungen eignen.

Kollaborative Robotik und Mensch-Roboter-Interaktion

In kollaborativen Roboteranwendungen (Cobot-Anwendungen) bietet Stereovision wesentliche Sicherheits- und Interaktionsmöglichkeiten. Durch die kontinuierliche Überwachung des 3D-Raums um den Roboter herum können Stereovision-Systeme menschliche Präsenz erkennen, Handpositionen verfolgen und eine sichere Zusammenarbeit zwischen Mensch und Roboter ermöglichen. Dies ermöglicht es Cobots, zu verlangsamen oder zu stoppen, wenn Menschen ihren Arbeitsbereich betreten, um Unfälle zu verhindern und gleichzeitig die Produktivität zu erhalten.

In der Fabrik der Zukunft werden die meisten Operationen von autonomen Robotern durchgeführt, die visuelles Feedback benötigen, um sich im Arbeitsraum zu bewegen und Hindernisse zu vermeiden, mit Menschen zusammenzuarbeiten, die Arbeitsteile zu identifizieren und zu lokalisieren, die Informationen anderer Sensoren zu vervollständigen, um ihre Positioniergenauigkeit zu verbessern usw.

Vorteile von Stereo Vision in der industriellen Robotik

Hohe Genauigkeit bei der Entfernungsmessung

Stereovision-Systeme bieten hochgenaue Entfernungsmessungen über einen breiten Bereich von Arbeitsentfernungen. Die Genauigkeit kann durch Anpassung von Kameraparametern wie Basislinienabstand, Brennweite und Auflösung auf bestimmte Anwendungen zugeschnitten werden. Diese Flexibilität ermöglicht Stereovision für Anwendungen von Nahbereichsinspektion bis hin zu Fernbereichsnavigation.

Die passive Natur des Stereo-Sehvermögens – das sich nur auf Umgebungs- oder strukturierte Beleuchtung anstelle von Sensoren mit aktiver Entfernungsmessung stützt – macht es besonders robust in Umgebungen, in denen mehrere Roboter oder Sensoren sich gegenseitig stören können.

Echtzeit-Verarbeitungs-Fähigkeiten

Moderne Stereovision-Systeme können Bilder verarbeiten und Tiefenkarten mit Bildraten erzeugen, die für die Echtzeit-Robotersteuerung geeignet sind. Mit GPU-Beschleunigung und optimierten Algorithmen können Systeme Verarbeitungsraten von 30 Bildern pro Sekunde oder höher erzielen, was ein ansprechendes Roboterverhalten in dynamischen Umgebungen ermöglicht.

Dies ist die erste Reihe von Stereovision-Kameras des Unternehmens, die USB-, GMSL2- und Ethernet-Schnittstellen unterstützen. Die auf der ProMat 2025 angekündigte neue Kamera bietet eine verbesserte Tiefenerfassung und ist damit ideal für den Einsatz mit Roboterarmen, autonomen mobilen Robotern und Lagerautomationsanwendungen. Diese Entwicklung spiegelt die kontinuierliche Expansion von Orbbec in industrielle 3D-Vision-Systeme wider.

Kosteneffizienz im Vergleich zu alternativen Technologien

Stereo-Vision-Systeme bieten ein attraktives Kosten-Leistungs-Verhältnis im Vergleich zu alternativen 3D-Sensorik-Technologien. Während Laserscanner und strukturierte Lichtsysteme eine hervorragende Genauigkeit bieten können, haben sie oft deutlich höhere Kosten. Stereo Vision nutzt gängige Kamera-Hardware und Rechenressourcen, was sie für eine Vielzahl von industriellen Anwendungen zugänglich macht.

Robotersysteme beruhen auf mehreren 3D-Sensormodalitäten zur Erzeugung von Tiefen- und räumlichen Informationen. Stereovision verwendet Kamerapaare, um übereinstimmende Merkmale zu triangulieren und dichte Tiefenkarten zu bilden. RGB-D-Kameras (Kombination von Farb- und Tiefensensorik) beruhen typischerweise auf Time-of-Flight-Techniken (ToF) oder strukturierten Lichttechniken zur Erzeugung von Punktwolkendaten. Jede Modalität weist Kompromisse in Bezug auf Reichweite, Auflösung, Bildrate, Latenz und Umweltrobustheit auf.

Non-Contact-Messung reduziert das Schadensrisiko

Die berührungslose Natur der Stereovisionsmessung ist ein wesentlicher Vorteil in vielen industriellen Anwendungen. Im Gegensatz zu taktilen Sonden oder mechanischen Messinstrumenten kann Stereovision Objekte ohne physischen Kontakt messen, wodurch das Risiko der Beschädigung empfindlicher Teile oder der Verunreinigung sauberer Oberflächen eliminiert wird.

Darüber hinaus ermöglicht die berührungslose Messung die Inspektion von bewegten Objekten und die Echtzeitüberwachung von Produktionsprozessen ohne Unterbrechung des Arbeitsablaufs, was die Inline-Qualitätskontrolle unterstützt und die Notwendigkeit separater Inspektionsstationen reduziert.

Reichhaltige visuelle Informationen über die Tiefe hinaus

Im Gegensatz zu Einzweck-Abstandssensoren erfassen Stereovision-Systeme vollständige Bilder, die sowohl Tiefeninformationen als auch umfangreiche visuelle Details enthalten. Dies ermöglicht es Robotern, mehrere Aufgaben mit einem einzigen Sensorsystem durchzuführen, einschließlich Objekterkennung, Texturanalyse, Farbinspektion und Barcode-Lesung, zusätzlich zur Entfernungsmessung. Diese Multifunktionalität reduziert die Systemkomplexität und -kosten im Vergleich zum Einsatz mehrerer spezialisierter Sensoren.

Herausforderungen und Grenzen der Stereo Vision

Umweltsensibilität

Die Stereovision ist stark in Umgebungen mit ausreichender Textur, kann jedoch Probleme haben, wenn Oberflächen nicht ausreichend ausgestattet sind oder die Beleuchtung schwach ist. ToF-Sensoren messen direkt den Abstand, können jedoch in sehr hellen oder sehr dunklen Szenen leiden. Die Leistung von Stereovision-Systemen hängt stark von den Umweltbedingungen ab, insbesondere von der Beleuchtung und der Oberflächentextur.

Die Genauigkeit der Tiefe kann auch durch Ausreißermessungen an homogenen oder strukturierten Oberflächen wie weißen Wänden, grünen Bildschirmen und Spiegelbereichen beeinflusst werden Texturlose Oberflächen, reflektierende Materialien und transparente Objekte stellen erhebliche Herausforderungen für Stereo-Matching-Algorithmen dar, da ihnen die für eine zuverlässige Korrespondenz erforderlichen Unterscheidungsmerkmale fehlen.

Ausschluss und Korrespondenz Mehrdeutigkeit

Einschließlichkeiten treten auf, wenn ein in einer Kamera sichtbares Objekt in der Ansicht der anderen Kamera verborgen ist. Dies erzeugt Bereiche, in denen keine Übereinstimmung hergestellt werden kann, was zu Lücken oder Fehlern in der Tiefenkarte führt. Während fortschrittliche Algorithmen dies teilweise durch Interpolation und Multi-View-Fusion beheben können, bleiben Einschlüsse eine grundlegende Einschränkung des Stereo-Sehvermögens.

Wiederholte Muster und Texturen können auch zu Korrespondenzmehrdeutigkeiten führen, bei denen mehrere potenzielle Übereinstimmungen für ein bestimmtes Merkmal bestehen, was zu falschen Disparitätsschätzungen und Tiefefehlern führen kann. Ausgeklügelte Matching-Algorithmen und -Einschränkungen helfen, diese Probleme zu mildern, können sie jedoch nicht vollständig beseitigen.

Computational Complexity

Die dichte Stereoabstimmung ist rechenintensiv, insbesondere für hochauflösende Bilder. Ein Bild, das von hochauflösenden Kameras aufgenommen wird, hat Millionen von Pixeln. Daher wird es sehr prozessintensiv sein, wenn wir es für das gesamte Bild tun. Zum Glück sind unsere Kameras kalibriert und Bilder werden korrigiert. Daher müssen wir nur entlang der horizontalen Linie suchen, wo PL liegt.

Während GPU-Beschleunigung und optimierte Algorithmen die Verarbeitungsgeschwindigkeiten deutlich verbessert haben, beschränken die Rechenanforderungen immer noch die maximale Auflösung und Bildrate, die in Echtzeitanwendungen erreichbar sind. Systementwickler müssen Auflösung, Genauigkeit und Verarbeitungsgeschwindigkeit sorgfältig abwägen, um die Anwendungsanforderungen zu erfüllen.

Wartung der Kalibrierung

Die Kalibrierung und Synchronisation mehrerer Sensoren, einschließlich Kameras, IMUs und Rad-Odometrie, ist komplex und erfordert robuste Systeme, die unter Vibrationen, Temperaturänderungen und Bewegungen stabil bleiben müssen, was bei mobilen Robotern besonders schwierig ist.

Industrielle Umgebungen setzen Stereovision-Systeme mechanischen Vibrationen, Temperaturschwankungen und physikalischen Einwirkungen aus, die die Kalibrierung im Laufe der Zeit beeinträchtigen können.

Fortgeschrittene Techniken und zukünftige Entwicklungen

Deep Learning für Stereo Matching

Darüber hinaus können Tiefenkarten mit Deep-Learning-basierten Methoden weiter verbessert werden, die lernen, die Tiefe aus Stereobildern vorherzusagen. Jüngste Fortschritte im Deep Learning haben zu erheblichen Verbesserungen der Genauigkeit und Robustheit des Stereoabgleichs geführt. Neuronale Netzwerke können lernen, mit herausfordernden Szenarien wie texturlosen Regionen, Okklusionen und Beleuchtungsvariationen effektiver umzugehen als herkömmliche Algorithmen.

End-to-End-Learning-Ansätze schulen Netzwerke, um Disparitäten oder Tiefe von Stereobildpaaren direkt vorherzusagen, wobei traditionelle Matching-Algorithmen vollständig umgangen werden. Diese Methoden können eine hochmoderne Genauigkeit erreichen und gleichzeitig die Echtzeitleistung bei Einsatz auf geeigneter Hardware beibehalten. Sie erfordern jedoch große Trainingsdatensätze und sorgfältige Validierung, um eine zuverlässige Leistung in verschiedenen industriellen Szenarien zu gewährleisten.

Multimodale Sensorfusion

Kuhnert und Netramai kombinierten einen ToF-Sensor und ein Stereosystem für die Umweltrekonstruktion. Für objektbezogene Aufgaben wurden ToF-Kameras auch erfolgreich für die Objekt- und Oberflächenrekonstruktion eingesetzt, bei der der Abstand kleiner ist. Die Kombination von Stereovision mit komplementären Sensormodalitäten kann individuelle Sensorbeschränkungen überwinden und eine robustere Wahrnehmung ermöglichen.

Fusion von Stereovision mit Time-of-Flight-Kameras, LiDAR oder strukturierten Lichtsystemen können Tiefeninformationen über einen größeren Bereich von Bedingungen und Entfernungen liefern. Jeder Sensortyp hat unterschiedliche Stärken und Schwächen, und intelligente Fusionsalgorithmen können die zuverlässigste Tiefenschätzung für jede Region der Szene auswählen.

Aktives Stereo und strukturierte Lichtverstärkung

Die optimale Textur zu finden, d.h. diejenige, die die beste Übereinstimmung zwischen den Merkmalen der Bilder bietet, ist ein kompliziertes Problem, das durch die Eigenschaften des Projektors, des Musters und der Stereokameras beeinflusst wird.

Aktive Stereosysteme projizieren strukturierte Muster auf die Szene, um die Textur zu verbessern und die Übereinstimmungszuverlässigkeit zu verbessern. Dieser Ansatz kombiniert die Vorteile passiver Stereosysteme (keine Entfernungsmehrdeutigkeit, mehrere gleichzeitige Systeme) mit der Robustheit aktiver Wahrnehmung. Infrarot-Projektionsmuster sind besonders nützlich, da sie die Bildgebung im sichtbaren Licht oder das menschliche Sehen nicht beeinträchtigen.

Verbesserte Hardware und Schnittstellen

Im Jahr 2025 stellte Orbbec die Gemini 335LE vor, eine Stereovision-3D-Kamera, die mit Ethernet-Konnektivität ausgestattet ist. Moderne Stereovision-Kameras verfügen über fortschrittliche Schnittstellen, höhere Auflösungen und eine verbesserte Synchronisierung, um die anspruchsvollen Anforderungen der industriellen Robotik zu erfüllen. Ethernet-Konnektivität ermöglicht eine einfachere Integration in Fabriknetzwerke und unterstützt längere Kabelläufe im Vergleich zu USB-Schnittstellen.

Globale Verschlusssensoren sind in industriellen Stereokameras Standard geworden und eliminieren Bewegungsartefakte, die die Übereinstimmungsgenauigkeit bei der Abbildung von bewegten Objekten oder bei der Kamera selbst in Bewegung beeinträchtigen können. Höhere Bildraten und Auflösungen ermöglichen detailliertere Tiefenkarten und schnellere Reaktionszeiten von Robotern.

Fallstudie: Implementierung von Stereo Vision für robotische Manipulation

Systemdesign und -konfiguration

Eine praktische Umsetzung von Stereovision für die industrielle Roboterführung erfordert ein sorgfältiges Systemdesign. Bei der Konfiguration der ZED2i-Kamera mit den von Stereolabs bereitgestellten Bibliotheken können viele Parameter eingestellt werden. Einer der wichtigsten Aspekte des Prüfstandes ist die Konfiguration des Koordinatensystems, in dem die Position von erfassten Objekten gemessen wird.

Die Position der Kameramontage muss so gewählt werden, dass sie den Arbeitsbereich des Roboters ausreichend abdeckt und gleichzeitig die für die gewünschte Genauigkeit erforderlichen Arbeitsabstände einhält. Bei Manipulationsaufgaben bietet die Montage der Kamera am Endeffektor des Roboters die flexibelste Sicht, erfordert jedoch eine Kalibrierung mit der Hand. Feste Kameras bieten eine einfachere Kalibrierung, können jedoch nur eine begrenzte Abdeckung des Arbeitsbereichs haben.

Fehleranalyse und Performance-Optimierung

Fehler können aus mehreren Quellen stammen, wie z. B. der Erkennung durch YOLO, der Stereovisionstiefenberechnung, der Kalibrierung von Kamerasystemen und Transformationen zwischen Koordinatensystemen, wobei eine präzise mathematische Modellierung und Analyse dieser Fehler entscheidend ist, um die Genauigkeit des Systems zu verbessern und Abweichungen von der tatsächlichen Position des Objekts zu verringern.

Sind die entsprechenden Punkte im linken und rechten Bild falsch ausgerichtet (z.B. durch Rauschen), führt der Parallaxenfehler zu einem Tiefenfehler. Der Tiefenfehler ΔZ kann aus folgender Beziehung berechnet werden: ... B-Stereovisionsbasis (Abstand zwischen Kameras).

Ergebnisse und Verbesserungen

Experimentelle Ergebnisse zeigen, dass diese Methode den absoluten Positionsfehler des Roboters deutlich reduziert, wobei der durchschnittliche Positionsfehler nach der Kalibrierung um 72,12% abnimmt. Eine richtige Kalibrierung und Fehlerkompensation kann die Systemleistung dramatisch verbessern und Stereovision von einem groben Führungswerkzeug zu einem Präzisionsmesssystem verwandeln.

Die durchgeführten Experimente zeigten, dass die vorgeschlagene Methode zu einer verbesserten Tiefenschätzung im Stereovisionssystem führt, mit einer Verbesserung von 34,15% beim MAE und 48,38% beim STD im Vergleich zu einer der am häufigsten verwendeten Methoden.

Best Practices für die Implementierung von Industrial Stereo Vision

Beleuchtungsdesign

Die richtige Beleuchtung ist für die Leistung von Stereovisions von entscheidender Bedeutung. Eine gleichmäßige, diffuse Beleuchtung minimiert Schatten und spiegelnde Reflexionen, die die Übereinstimmung stören können. Die Beleuchtung sollte hell genug sein, um ein gutes Signal-Rausch-Verhältnis in den Kamerabildern zu erzeugen, aber nicht so hell, dass Sättigung oder übermäßiger Kontrast entstehen.

Bei Anwendungen mit glänzenden oder reflektierenden Objekten kann die kreuzpolarisierte Beleuchtung spiegelnde Reflexionen reduzieren, aktive Beleuchtung mit strukturierten Mustern kann die Textur auf ansonsten funktionslosen Oberflächen verbessern. Das Beleuchtungsdesign muss von Anfang an in das Gesamtsystemdesign integriert und nicht nachträglich hinzugefügt werden.

Kameraauswahl und -positionierung

Die Kameraauswahl sollte die Auflösung, die Bildrate, die Sensorgröße und die Schnittstellenanforderungen berücksichtigen. Eine höhere Auflösung ermöglicht eine genauere Tiefenschätzung, erfordert jedoch mehr Rechenleistung. Globale Verschlusssensoren sind für die Abbildung von bewegten Objekten oder wenn die Kamera in Bewegung ist, unerlässlich.

Die Grundlinie sollte auf der Grundlage des Arbeitsabstands und der erforderlichen Tiefengenauigkeit gewählt werden. Eine allgemeine Faustregel besagt, dass die Tiefengenauigkeit proportional zum Verhältnis von Arbeitsabstand zu Grundlinie ist. Breitere Grundlinien bieten eine bessere Tiefenauflösung, erhöhen jedoch den Mindestarbeitsabstand und die Wahrscheinlichkeit von Okklusionen.

Software-Architektur und Processing Pipeline

Die Softwarearchitektur sollte auf Modularität und Wartbarkeit ausgelegt sein. Separate Module für Bildaufnahme, Kalibrierung, Korrektur, Abgleich und Tiefenberechnung ermöglichen es, einzelne Komponenten unabhängig voneinander zu testen und zu optimieren. Standardschnittstellen zwischen Modulen erleichtern die Integration und zukünftige Upgrades.

Verarbeitungspipelines sollten für die Ziel-Hardwareplattform optimiert werden, wobei die GPU-Beschleunigung, soweit verfügbar, genutzt wird. Sorgfältiges Profiling kann Engpässe erkennen und Optimierungsbemühungen leiten. Für Echtzeitanwendungen sollten adaptive Algorithmen in Betracht gezogen werden, die Verarbeitungsparameter auf der Grundlage der verfügbaren Rechenressourcen und der Komplexität der Szene anpassen.

Validierung und Prüfung

Um eine zuverlässige Leistung in Produktionsumgebungen zu gewährleisten, ist eine umfassende Validierung unerlässlich. Die Prüfungen sollten die gesamte Bandbreite der erwarteten Betriebsbedingungen abdecken, einschließlich der Schwankungen der Beleuchtung, des Erscheinungsbilds des Objekts und der Umweltfaktoren. Quantitative Genauigkeitsmessungen mit kalibrierten Referenzobjekten liefern objektive Leistungskennzahlen.

Anschließend wurden Fehler zwischen der vom Vision-System geschätzten Position, die mit ZED 2i-Daten arbeitet, und der tatsächlichen Position des Objekts ermittelt: Probenmesspunkte wurden sowohl direkt vor dem Roboter als auch innerhalb der maximalen Reichweite des Roboters platziert, wobei die vertikale Positionierung des Handgelenks des Roboters berücksichtigt wurde, um den korrekten Betrieb des 3DV-Systems zu gewährleisten.

Branchentrends und Marktausblicke

Wachsende Adoption in allen Sektoren

Das Segment Vision-Sensoren/Kameras wird voraussichtlich die höchste Wachstumsrate im Prognosezeitraum erfahren, die Roboter bei der Ausführung von Aufgaben unterstützen, die eine Positionskontrolle, Qualitätskontrolle oder Objektverfolgung erfordern. Die zunehmende Raffinesse der Fertigungsprozesse und der Drang nach flexibler Automatisierung treiben die Nachfrage nach fortschrittlichen Vision-Systemen voran.

Industrien von Automobil- und Elektronikindustrie bis hin zu Lebensmittelverarbeitung und Pharmaindustrie übernehmen Stereovision, um die Qualität zu verbessern, den Durchsatz zu erhöhen und Kosten zu senken. Die Technologie ist besonders wertvoll in Anwendungen, die Flexibilität erfordern, um Produktvariationen ohne umfangreiche Umprogrammierung oder Werkzeugwechsel zu bewältigen.

Integration mit Künstlicher Intelligenz

Im Jahr 2025 startete ABB seinen autonomen mobilen Roboter (AMR) der nächsten Generation mit Visual SLAM (Simultaneous Localization and Mapping) und KI-Funktionen sowie die AMR Studio-Softwaresuite. Diese neue Lösung ermöglicht es Robotern, sich in Echtzeit an dynamische Umgebungen anzupassen, ohne auf vordefinierte Infrastruktur angewiesen zu sein. Diese Einführung bekräftigt die Strategie von ABB, hochflexible und intelligente Automatisierungslösungen für die Fertigungs- und Logistikbranche bereitzustellen.

Die Konvergenz von Stereovision mit künstlicher Intelligenz schafft neue Möglichkeiten für Roboterwahrnehmung und Entscheidungsfindung. KI-Algorithmen können Tiefeninformationen im Kontext interpretieren, komplexe Szenen erkennen und intelligente Entscheidungen über Roboteraktionen treffen. Diese Integration ist für die nächste Generation autonomer Industrieroboter unerlässlich.

Herausforderungen für eine weit verbreitete Adoption

NISTs eigene Forschung stellt weiter fest, dass Hersteller mit erheblichen Hindernissen konfrontiert sind. Sein NIST GCR-Bericht 2024 identifiziert Kapitalkosten, Integrationsprobleme und mangelndes internes Fachwissen als wesentliche Einschränkungen bei der Einführung. Trotz der klaren Vorteile begrenzen mehrere Hindernisse immer noch die Einführung von Stereovision in einigen industriellen Umgebungen.

Die Zuverlässigkeit und Sicherheit bleiben zentrale Anliegen. Sehsysteme müssen tolerant gegenüber Sensorfehlern, Fehlausrichtungen oder Umwelteinflüssen sein, Fehlwahrnehmungen können zu Navigationsfehlern oder unsicherem Verhalten führen, insbesondere in menschenbewohnten Umgebungen.

Um diesen Herausforderungen zu begegnen, müssen wir weiterhin robustere und benutzerfreundlichere Systeme, bessere Integrationswerkzeuge und Bildungsressourcen entwickeln, um internes Fachwissen aufzubauen.

Schlussfolgerung

Stereovision-Technologie ist zu einem unverzichtbaren Werkzeug für die Berechnung der Entfernung zu Objekten in der industriellen Robotik geworden. Durch die Nutzung der Prinzipien des binokularen Sehens und fortschrittlicher Bildverarbeitungsalgorithmen ermöglichen Stereovision-Systeme Robotern, ihre Umgebung mit beispielloser Genauigkeit und Flexibilität wahrzunehmen und mit ihr zu interagieren. Die Technologie bietet erhebliche Vorteile, darunter hohe Genauigkeit, Echtzeit-Verarbeitungsmöglichkeiten, Wirtschaftlichkeit und berührungslose Messung.

Während Herausforderungen wie Umweltsensitivität, Okklusionshandling und Kalibrierungswartung bestehen bleiben, erweitern die kontinuierlichen Fortschritte in Hardware, Algorithmen und künstlicher Intelligenz die Fähigkeiten und die Zuverlässigkeit von Stereovision-Systemen. Die Integration von Deep Learning, multimodaler Sensorfusion und verbesserter Kameratechnologie erweitert die Grenzen dessen, was diese Systeme erreichen können.

Da sich die industrielle Automatisierung weiter zu größerer Flexibilität und Autonomie entwickelt, wird Stereo Vision eine immer wichtigere Rolle spielen. Von der Bin-Picking und Qualitätskontrolle bis hin zur autonomen Navigation und Mensch-Roboter-Kollaboration sind die Anwendungen von Stereo Vision in der industriellen Robotik vielfältig und wachsend. Unternehmen, die Stereo Vision-Systeme implementieren, sollten sich auf das richtige Systemdesign, eine umfassende Kalibrierung, eine robuste Softwarearchitektur und eine gründliche Validierung konzentrieren, um eine optimale Leistung zu erzielen.

Die Zukunft der industriellen Robotik ist visuell, und die Stereovision-Technologie bietet die Tiefenwahrnehmung, die Roboter benötigen, um die dreidimensionale Welt, in der sie tätig sind, zu navigieren, zu manipulieren und zu verstehen. Für Ingenieure und Organisationen, die fortschrittliche Robotersysteme implementieren möchten, ist das Verständnis und die Nutzung der Stereovision-Technologie unerlässlich, um in der sich schnell entwickelnden Landschaft der industriellen Automatisierung wettbewerbsfähig zu bleiben.

Zusätzliche Mittel

Für diejenigen, die mehr über Stereovision und ihre Anwendungen in der industriellen Robotik erfahren möchten, sind online mehrere hervorragende Ressourcen verfügbar. Die OpenCV-Dokumentation bietet umfassende Tutorials zur Kamerakalibrierung, Stereokorrektur und Disparitätsberechnung. Die Robot Operating System (ROS) Community bietet Pakete und Tools zur Integration von Stereovision in Robotersysteme. Akademische Ressourcen wie die IEEE Xplore Digital Library enthalten Spitzenforschung zu Stereovision-Algorithmen und -Anwendungen.

Branchenorganisationen wie die Association for Advancing Automation bieten Fallstudien, Whitepapers und Networking-Möglichkeiten für Fachleute, die mit vision-gesteuerter Robotik arbeiten. Kamerahersteller und Vision-Systemintegratoren bieten oft technische Dokumentation, Anwendungshinweise und Schulungsprogramme an, um Benutzern bei der Implementierung erfolgreicher Stereovision-Lösungen zu helfen.

Durch die Nutzung dieser Ressourcen und die Einhaltung der in diesem Artikel beschriebenen Best Practices können Ingenieure und Organisationen erfolgreich Stereovision-Systeme implementieren, die die Fähigkeiten ihrer Industrieroboter verbessern, die Prozesseffizienz verbessern und Innovationen in der Fertigung und Automatisierung vorantreiben.