Table of Contents

Introduzione alla Stereo Vision in Robotica Industriale

La tecnologia di visione Stereo ha rivoluzionato il modo in cui i robot industriali percepiscono e interagiscono con il loro ambiente. Mimitando la capacità del sistema visivo umano di percepire la profondità, la visione stereo consente ai robot di misurare con precisione le distanze agli oggetti, navigare in spazi di lavoro complessi e svolgere compiti di precisione con precisione senza precedenti.

La visione del computer vicina alla visione umana può essere creata solo utilizzando telecamere stereo. Questo principio fondamentale è quello di sottoporre a larga diffusione sistemi di visione stereo in robotica industriale. L'automazione continua a progredire, la capacità di percepire con precisione lo spazio tridimensionale è diventata essenziale per i robot che operano in ambienti dinamici e non strutturati dove i metodi di rilevamento tradizionali cadono a corto.

La dimensione del mercato dei sensori robotici globali è stata stimata a 1.819,4 milioni di dollari nel 2024 e si propone di raggiungere 3,625,8 milioni di dollari entro il 2033, con una crescita dell'8,1% da 2025 a 2033, guidata dall'adozione crescente dell'automazione nei settori industriali, insieme all'aumento della distribuzione di robot mobili autonomi (AMR) e robot collaborativi (cobots).

Comprendere i Fondamenti di Stereo Vision

Il principio della visione binoculare

I sistemi di visione stereo funzionano sullo stesso principio della visione binoculare umana. Due telecamere posizionate a diversi punti di vista catturano simultaneamente immagini della stessa scena.Analizzando le differenze tra queste immagini, in particolare lo spostamento orizzontale dei punti corrispondenti, il sistema può calcolare le informazioni di profondità per gli oggetti all'interno della scena.

Il sistema di visione stereo è una delle tecniche di visione computerizzata più popolari. L'idea qui è quella di utilizzare l'errore parallax a nostro vantaggio. Una singola scena è registrata da due diversi angoli di visione, e la profondità è stimata dalla misura di errore parallax. Questo effetto parallax è lo stesso fenomeno che permette agli esseri umani di giudicare le distanze e percepire lo spazio tridimensionale.

Configurazione della fotocamera e Baseline

La disposizione fisica delle telecamere in un sistema di visione stereo è cruciale per le sue prestazioni. La linea tra i centri delle telecamere è chiamata linea di base. La distanza di linea di base influisce direttamente sull'accuratezza e sulla gamma delle misurazioni di profondità. Una linea di base più grande generalmente fornisce una risoluzione di profondità migliore a distanze più lunghe, mentre una linea di base più piccola è più adatta per applicazioni a distanza ravvicinata.

La formula per la profondità incorpora il suo rapporto inversamente proporzionale alla disparità e la relazione direttamente proporzionale alla linea di base. La lunghezza focale e la linea di base sono costanti della fotocamera stereo che si ottengono dalla calibrazione stereo. Capire questo rapporto è essenziale per la progettazione di sistemi di visione stereo che soddisfano specifiche esigenze di applicazione.

La matematica della Calcolo della Profondità

Quando due telecamere catturano lo stesso punto nello spazio, quel punto appare in posizioni diverse nel piano di immagine di ogni fotocamera rispettivamente. PL(uL, vL) e PR (uR, vR) sono proiezioni del punto Po nel piano di immagine sinistro e destro, rispettivamente. Questa configurazione ci dà le seguenti quattro equazioni.

Il calcolo della profondità di Z in un sistema stereovisionale si basa sulla differenza di parallasse d. Il valore di disparità, la differenza di pixel orizzontale tra i punti corrispondenti nelle immagini di sinistra e di destra, è inversamente proporzionale alla profondità, il che significa che gli oggetti più vicini alla telecamera presentano valori di disparità maggiori, mentre gli oggetti distanti mostrano differenze più piccole.

La precisione della profondità diminuisce con il quadrato della distanza Z; la precisione della profondità stereo varia dall'1% della distanza a breve distanza al 9% a lungo raggio. Questa caratteristica deve essere considerata quando si progettano sistemi di visione stereo per applicazioni industriali specifiche, in quanto i requisiti di precisione variano significativamente in diversi casi di utilizzo.

Calibrazione della fotocamera: La Fondazione di stima accurata della profondità

Importanza della calibrazione

La calibrazione della fotocamera è un presupposto fondamentale per una visione stereo accurata. I sistemi di visione stereo sono uno dei metodi più utilizzati per eseguire la mappatura tridimensionale. Questi sistemi hanno diverse considerazioni per soddisfare questo compito; uno di essi è la calibrazione della fotocamera. Senza una corretta calibrazione, le relazioni geometriche tra le telecamere e la scena non possono essere accuratamente stabilite, portando a errori significativi nella stima della profondità.

La calibrazione viene eseguita in genere utilizzando un modello noto, come un checkerboard, e algoritmi specializzati che minimizzano l'errore di riproiezione tra punti osservati e proiettati. Questo processo determina sia i parametri intrinseci (come la lunghezza focale e il centro ottico) che i parametri estrinseci (la posizione relativa e l'orientamento tra le telecamere).

Sfide e soluzioni di calibrazione

La deriva della calibrazione è un vero nemico della precisione nella robotica industriale. In robotica, questo può avere gravi conseguenze. I fattori ambientali come i cambiamenti di temperatura, le vibrazioni e lo stress meccanico possono causare i parametri di calibrazione alla deriva nel tempo, degradando le prestazioni del sistema.

Se la calibrazione si allontana, il robot potrebbe danneggiare le distanze, portando a percorsi inefficienti o anche collisioni. Allo stesso modo, nelle applicazioni pick-and-place, un robot deve sapere esattamente dove un oggetto è quello di afferrarlo in modo affidabile. La deriva della calibrazione può causare che quelle scelte siano fuori tiro, rallentando l'intero processo.

Per combattere la deriva della calibrazione, i sistemi industriali spesso implementano procedure di ricalibrazione periodica o utilizzano algoritmi di autocalibrazione che possono rilevare e compensare i cambiamenti dei parametri.Questo documento propone un metodo di calibrazione automatico basato sulla misurazione a ciclo chiuso della visione stereo. Il metodo mira a raggiungere una calibrazione efficiente e una compensazione degli errori di posizionamento degli effetti finali attraverso la percezione visiva e gli algoritmi di ottimizzazione cinematica.

Processo di rettifica

Dopo la calibrazione, le immagini devono essere rettificate per semplificare il problema della corrispondenza, fissata mediante rettifica stereo. La rettifica stereo è la riproiezione dei piani di immagine di sinistra e di destra su un piano comune parallelo alla linea di base. La rettifica trasforma le immagini in modo che i punti corrispondenti si trovino sulla stessa linea di scansione orizzontale, riducendo lo spazio di ricerca da due dimensioni a uno.

Nelle immagini stereo rettificate si trovano sulla stessa riga pixel qualsiasi coppia di punti corrispondenti. Le immagini rettificate hanno linee epipolari orizzontali e sono riga-allineate. Questo allineamento è essenziale per un calcolo efficiente e preciso della disparità, poiché limita la ricerca di punti corrispondenti a una singola dimensione.

Il problema della corrispondenza di Stereo

Trovare punti di corrispondenza

Per calcolare la disparità, dobbiamo trovare ogni pixel dall'immagine sinistra e corrisponderlo ad ogni pixel nell'immagine destra. Questo è chiamato Stereo Correspondence Problem. L'obiettivo è quello di identificare quale pixel nell'immagine destra corrisponde a ogni pixel nell'immagine sinistra.

Ora, per trovare questo pixel nell'immagine giusta, semplicemente cercarlo sulla linea epipolare. Non c'è bisogno di una ricerca 2D, il punto dovrebbe essere situato su questa linea e la ricerca è ristretta a 1D. Questo vincolo riduce significativamente la complessità computazionale e migliora la precisione di corrispondenza.

Caratteristica corrispondenza Algoritmi

Gli algoritmi di corrispondenza caratteristica, come SIFT (Scale-Invariant Feature Transform), SURF (Speed-Up Robust Features), e ORB (Orientato FAST e Rotated BRIEF), sono comunemente utilizzati per questo scopo. Questi algoritmi identificano le caratteristiche distintive nelle immagini e le corrispondono attraverso la coppia stereo. La disparità viene poi calcolata come spostamento orizzontale tra i punti corrispondenti.

Ogni algoritmo offre diversi trade-off tra precisione, efficienza computazionale e robustezza alle trasformazioni di immagine. SIFT e SURF forniscono un'eccellente precisione di corrispondenza ma sono computazionalmente intensivi, mentre ORB offre un'elaborazione più rapida a costo di una certa precisione. La scelta di algoritmo dipende dalle specifiche esigenze dell'applicazione industriale.

Correspondenza di corrispondenza del blocco e Dense

Per applicazioni che richiedono mappe di profondità dense, sono comunemente impiegati algoritmi di corrispondenza dei blocchi. Questi algoritmi confrontano piccole finestre o blocchi di pixel tra le immagini di sinistra e di destra per trovare le corrispondenze. La mappa disparità, che rappresenta la disparità a ogni pixel, è utilizzata per generare la mappa di profondità. Tuttavia, le mappe di disparità spesso contengono rumore e richiedono raffinatezza.

L'accoppiamento semi-globale (SGM) è diventato particolarmente popolare nelle applicazioni industriali grazie alla sua capacità di produrre mappe di disparità di alta qualità pur mantenendo una ragionevole efficienza computazionale.

Attuazione nei sistemi robot industriali

Requisiti di elaborazione in tempo reale

I robot industriali dotati di telecamere stereo devono elaborare immagini in tempo reale per consentire l'interazione reattiva con l'ambiente. Il sistema identifica le caratteristiche chiave sia nelle immagini che nelle disparità di calcolo, che vengono poi convertite in misurazioni a distanza.

Parallelamente agli algoritmi sopra elencati, sono compatibili con le GPU e superano la maggior parte dei limiti di velocità. Sebbene il numero di calcoli sia quasi uguale, la loro esecuzione parallela richiede molto meno tempo rispetto alla loro esecuzione seriale.

I moderni sistemi di visione stereo sfruttano l'accelerazione GPU e l'hardware specializzato per raggiungere le velocità di elaborazione richieste per le applicazioni industriali, consentendo ai robot di prendere decisioni e regolare i loro movimenti in base al feedback visivo con latenza minima, che è fondamentale per attività come operazioni di pick-and-place ad alta velocità o evitare ostacoli dinamici.

Integrazione con i sistemi di controllo robot

Dopo aver letto i dati dello ZED2i sulla posizione dell'oggetto rilevato nel sistema di coordinate della telecamera compatibile con il sistema di coordinate definito nel robot, il computer dovrebbe comunicare con il robot industriale utilizzando il pacchetto RMI. La comunicazione segue uno schema che include la creazione di una connessione, l'inizializzazione dei parametri, la configurazione del sistema, l'emissione di istruzioni per il movimento e la chiamata di programmi robot.

L'integrazione della visione stereo con sistemi di controllo robot richiede un attento coordinamento di più frame di coordinate. Il sistema di coordinate della fotocamera deve essere trasformato nel sistema di coordinate base del robot, che tiene conto della posizione di montaggio e dell'orientamento della fotocamera.

Combinazione di Visione con AI e Rilevazione degli Oggetti

I metodi utilizzati per rilevare un oggetto nello spazio includono l'algoritmo YoloV8, che funziona su un'immagine 2D. L'algoritmo è stato addestrato per rilevare due gruppi di oggetti strettamente definiti (XC80 OK e XC80 NOK). Le coordinate del centro dell'oggetto rilevato sono utilizzate per leggere la distanza dell'oggetto misurata nel sistema della fotocamera.

Questo capitolo presenta una nuova idea, utilizzando le tecniche esistenti per la stima della profondità. La motivazione è quella di rendere la procedura di stima della profondità molto più leggera e più veloce. In parole semplici, l'intensione è di evitare il calcolo della profondità per i pixel che non sono necessari.

Combinando la visione stereo con moderni algoritmi di rilevamento degli oggetti basati su AI, i robot industriali possono raggiungere sia la comprensione semantica (che gli oggetti sono presenti) che la comprensione geometrica (dove gli oggetti si trovano nello spazio 3D).

Applicazioni industriali e casi di utilizzo

Raccoglitore e gestione di parti casuali

La tecnica di visione stereo con texture proiettata viene utilizzata principalmente nelle applicazioni di raccolta di contenitori, il compito di raccogliere oggetti casuali e non selezionati da un contenitore o da un contenitore di stoccaggio presenta diverse sfide.

Grazie al suo design compatto e industriale, la combinazione di una distanza di lavoro molto breve e di un ampio campo visivo, Ensenso B è particolarmente adatta per le applicazioni di raccolta dei contenitori, per esempio, ideale per l'uso su un braccio robot. Le moderne telecamere stereo progettate appositamente per la raccolta dei contenitori possono operare a distanza ravvicinata mantenendo un ampio campo visivo, permettendo ai robot di vedere in contenitori profondi e gestire una varietà di dimensioni dei pezzi.

Robot e navigazione autonome

Le telecamere a visione 3D che combinano l'illuminazione attiva e il rilevamento passivo possono mantenere la fedeltà della profondità in tali condizioni. Ad esempio, le telecamere Gemini 335Lg di Orbbec, lanciate a ROSCon 2024, includono un'interfaccia serializzatore (GMSL2) e un connettore robusto (FAKRA) per fornire dati di profondità affidabili in ambienti mobili robusti.

La localizzazione e la mappatura simultanee (SLAM) beneficiano di dati di profondità densi. I sistemi di visione stereo generano nubi a punta ricchi che possono essere fusi con dati di oometria e unità di misura inerziale (IMU) per creare mappe accurate e localizzazione robusta. Questa capacità è essenziale per robot mobili autonomi che operano in ambienti di magazzino e di fabbrica dinamici.

Ispezione e misurazione della qualità

Grazie alla generazione di modelli 3D precisi di parti e assemblaggi, questi sistemi possono verificare le dimensioni, rilevare i difetti e garantire un corretto assemblaggio. La natura incontatta della visione stereo lo rende ideale per ispezionare componenti delicati o sensibili che potrebbero essere danneggiati da strumenti di misura fisica.

Per una distanza di 2,5 m, la precisione è stata rilevata per 0,01 mm. Quando è stata calibrata e configurata correttamente, i sistemi di visione stereo possono raggiungere l'accuratezza dei sottomillimetri, rendendoli adatti per applicazioni di produzione di precisione.

Robotica collaborativa e interazione umana-robot

Attraverso il monitoraggio continuo dello spazio 3D intorno al robot, i sistemi di visione stereo possono rilevare la presenza umana, tracciare le posizioni della mano e consentire una collaborazione sicura con gli robot, permettendo ai cobot di rallentare o arrestarsi quando gli esseri umani entrano nel loro spazio di lavoro, impedendo agli incidenti mantenendo la produttività.

Nella fabbrica del futuro, la maggior parte delle operazioni saranno eseguite da robot autonomi che hanno bisogno di feedback visivo per muoversi nello spazio di lavoro evitando ostacoli, per lavorare in collaborazione con gli esseri umani, per identificare e individuare le parti di lavoro, per completare le informazioni fornite da altri sensori per migliorare la loro precisione di posizionamento, ecc.

Vantaggi della Stereo Vision in Robotica Industriale

Alta precisione nella misurazione a distanza

I sistemi di visione stereo forniscono misurazioni a distanza molto accurate su una vasta gamma di distanze di lavoro. L'accuratezza può essere adattata a specifiche applicazioni regolando parametri della fotocamera come distanza di base, lunghezza focale e risoluzione. Questa flessibilità consente alla visione stereo di servire applicazioni che vanno dall'ispezione a distanza ravvicinata alla navigazione a lungo raggio.

La natura passiva della visione stereo – solo su illuminazione ambientale o strutturata piuttosto che su sensori di allestimento attivi – lo rende particolarmente robusto in ambienti in cui più robot o sensori potrebbero interferire tra loro.

Capacità di elaborazione in tempo reale

I moderni sistemi di visione stereo possono elaborare immagini e generare mappe di profondità a frame rate adatti al controllo robot in tempo reale. Con l'accelerazione GPU e algoritmi ottimizzati, i sistemi possono raggiungere i tassi di elaborazione di 30 frame al secondo o superiore, consentendo un comportamento robot reattivo in ambienti dinamici.

Questo segna la prima linea di telecamere a visione stereo dell'azienda per supportare le interfacce USB, GMSL2, e Ethernet. Annunciato a ProMat 2025, la nuova fotocamera offre una maggiore sensibilità alla profondità, rendendolo ideale per l'uso con armi robotiche, robot mobili autonomi e applicazioni di automazione del magazzino.

Costo-efficacia rispetto alle tecnologie alternative

I sistemi di visione Stereo offrono un rapporto di prestazioni di costo interessante rispetto alle tecnologie alternative di rilevamento 3D. Mentre gli scanner laser e i sistemi di luce strutturati possono fornire un'eccellente precisione, spesso arrivano a costi notevolmente più elevati.

I sistemi robotizzati si basano su modalità di rilevamento 3D multiple per generare informazioni di profondità e di spazio. Stereo-vision utilizza coppie di telecamere per triangolare le caratteristiche corrispondenti e formare mappe di profondità dense. Le telecamere RGB-D (combinando il colore e la profondità di rilevamento) tipicamente si basano su tempi di volo (ToF) o su tecniche di luce strutturata per produrre dati di punta.

La misura non collegata riduce il rischio di danno

La natura non contaminata della misurazione della visione stereo è un vantaggio significativo in molte applicazioni industriali.A differenza di sonde tattili o di manometri meccanici, la visione stereo può misurare oggetti senza contatto fisico, eliminando il rischio di danneggiare parti delicate o contaminare superfici pulite.Questo rende la visione stereo ideale per applicazioni nella produzione elettronica, produzione farmaceutica e altre industrie in cui il contatto deve essere minimizzato.

Inoltre, la misurazione non contatto consente l'ispezione di oggetti in movimento e il monitoraggio in tempo reale dei processi produttivi senza interrompere il flusso di lavoro, supportando il controllo della qualità in linea e riducendo la necessità di stazioni di ispezione separate.

Ricco informazioni visive oltre la profondità

A differenza dei sensori di allestimento monofunzionali, i sistemi di visione stereo catturano immagini complete che contengono informazioni di profondità e dettagli visivi ricchi. Questo consente ai robot di eseguire più attività con un unico sistema di sensori, tra cui riconoscimento oggetti, analisi della texture, ispezione del colore e lettura del codice a barre, oltre alla misurazione della distanza.

Sfide e limitazioni della Stereo Vision

Sensibilità ambientale

La visione stereo è forte in ambienti con una texture sufficiente ma può lottare quando le superfici non hanno caratteristiche o illuminazione è debole. I sensori ToF misurano direttamente la distanza ma possono soffrire in scene molto luminose o molto scure. Le prestazioni dei sistemi di visione stereo dipendono fortemente dalle condizioni ambientali, in particolare l'illuminazione e la texture superficiale.

La precisione della profondità può essere influenzata anche da misure più omogenee o con superfici texture, come pareti bianche, schermi verdi e aree specchiate. Le superfici senza texture, materiali riflettenti e oggetti trasparenti rappresentano sfide significative per gli algoritmi di corrispondenza stereo, in quanto mancano delle caratteristiche distintive necessarie per una corrispondenza affidabile.

Occlusione e corrispondenza Ambiguità

Occlusioni si verificano quando un oggetto visibile in una telecamera è nascosto nella vista dell'altra telecamera. Questo crea regioni in cui la corrispondenza non può essere stabilita, con conseguente lacune o errori nella mappa di profondità. Mentre algoritmi avanzati possono parzialmente affrontare questo attraverso la fusione interpolazione e multi-view, le occlusioni rimangono una limitazione fondamentale della visione stereo.

I modelli e le texture ripetitive possono anche causare ambiguità della corrispondenza, dove esistono molteplici potenziali corrispondenze per una data caratteristica, che possono portare a stime disparità errate e errori di profondità.

Complessità computazionale

Un'immagine catturata da telecamere ad alta risoluzione ha milioni di pixel. Quindi, sarà altamente intensivo di processo se lo facciamo per l'intera immagine. Fortunatamente, le nostre telecamere sono calibrate e le immagini sono rettificate. Pertanto, dobbiamo solo cercare lungo la linea orizzontale dove si trova PL.

Mentre l'accelerazione GPU e gli algoritmi ottimizzati hanno migliorato significativamente le velocità di elaborazione, i requisiti computazionali ancora vincolano la massima risoluzione e frame rate realizzabili in applicazioni in tempo reale.

Manutenzione di calibrazione

La calibrazione e la sincronizzazione di sensori multipli, tra cui telecamere, IMU e oometria della ruota sono complessi e richiedono sistemi robusti. Tale calibrazione deve rimanere stabile sotto vibrazione, cambiamento di temperatura e movimento, che è particolarmente impegnativo nei robot mobili.

Gli ambienti industriali subiscono sistemi di visione stereo a vibrazioni meccaniche, fluttuazioni di temperatura e impatti fisici che possono degradare la calibrazione nel tempo. Mantenere la precisione di calibrazione richiede una robusta progettazione meccanica per prevenire la deriva dei parametri o procedure di ricalibrazione periodica che aggiungono ai requisiti di manutenzione del sistema.

Tecniche Avanzate e sviluppi futuri

Apprendimento profondo per Stereo Matching

Inoltre, le mappe di profondità possono essere ulteriormente migliorate utilizzando metodi basati sull'apprendimento profondo che imparano a prevedere la profondità dalle immagini stereo. I recenti progressi nell'apprendimento profondo hanno portato a miglioramenti significativi nella precisione e nella robustezza dell'accoppiamento stereo. Le reti neurali possono imparare a gestire scenari difficili come le regioni senza texture, le occlusioni e le variazioni di illuminazione più efficacemente rispetto agli algoritmi tradizionali.

L'apprendimento end-to-end si avvicina alle reti dei treni per prevedere direttamente la disparità o la profondità delle coppie di immagini stereo, bypassando completamente gli algoritmi di corrispondenza tradizionali. Questi metodi possono raggiungere l'accuratezza all'avanguardia, mantenendo le prestazioni in tempo reale quando vengono utilizzati su hardware appropriato. Tuttavia, richiedono grandi set di dati di formazione e una validazione accurata per garantire prestazioni affidabili in diversi scenari industriali.

Fusione del sensore multi-modulare

Per le attività connesse agli oggetti, le telecamere ToF sono state utilizzate con successo anche per la ricostruzione di oggetti e superfici, dove la gamma di distanze è più piccola. Combinando la visione stereo con modalità di rilevamento complementari può superare i limiti dei singoli sensori e fornire una percezione più robusta.

La fusione della visione stereo con telecamere a tempo pieno, LiDAR, o sistemi di luce strutturati può fornire informazioni di profondità su una vasta gamma di condizioni e distanze. Ogni tipo di sensore ha diversi punti di forza e di debolezza, e algoritmi di fusione intelligenti possono selezionare la stima di profondità più affidabile per ogni regione della scena.

Miglioramento della luce e dello stereo attivo

Trovare la texture ottimale, cioè quella che fornisce la migliore corrispondenza tra le caratteristiche delle immagini, è un problema complicato, influenzato dalle caratteristiche del proiettore, del modello e delle telecamere stereo.

I sistemi stereo attivi proiettano modelli strutturati sulla scena per migliorare la texture e migliorare l'affidabilità corrispondente. Questo approccio combina i vantaggi dello stereo passivo (senza ambiguità di gamma, sistemi multipli simultanei) con la robustezza del rilevamento attivo.

Hardware e interfacce migliorate

Nel 2025 Orbbec ha introdotto il Gemini 335LE, una telecamera 3D con visione stereo dotata di connettività Ethernet. Le moderne telecamere con visione stereo incorporano interfacce avanzate, risoluzioni più elevate e una sincronizzazione migliorata per soddisfare le esigenze più esigenti della robotica industriale. La connettività Ethernet consente una più facile integrazione nelle reti di fabbrica e supporta le più lunghe operazioni di cavi rispetto alle interfacce USB.

I sensori di tapparelle globali sono diventati standard nelle telecamere stereo industriali, eliminando i manufatti di movimento che possono degradare l'accuratezza corrispondente quando si spostano oggetti o quando la fotocamera stessa è in movimento.

Case study: Implementing Stereo Vision per la manipolazione robotica

Progettazione e configurazione di sistema

Una pratica implementazione della visione stereo per la guida robot industriale richiede un'attenta progettazione del sistema. Quando si configura la fotocamera ZED2i utilizzando le librerie fornite da Stereolabs, si possono impostare molti parametri. Uno degli aspetti più importanti del supporto di prova è la configurazione del sistema di coordinate in cui viene misurata la posizione degli oggetti rilevati.

Per le operazioni di manipolazione, il montaggio della fotocamera sull'effetto finale del robot fornisce il punto di vista più flessibile ma richiede la calibrazione degli occhi a mano. Le telecamere fissa offrono una calibrazione più semplice ma possono avere una copertura limitata dello spazio di lavoro.

Analisi degli errori e Ottimizzazione delle prestazioni

Gli errori possono provenire da fonti multiple, come il rilevamento di YOLO, il calcolo della profondità di stereovisione, la calibrazione del sistema della fotocamera e le trasformazioni tra i sistemi di coordinate.

Se i punti corrispondenti nelle immagini di sinistra e di destra sono disallineati (ad esempio, a causa del rumore), l'errore parallax si traduce in errore di profondità. L'errore di profondità ΔZ, può essere calcolato dalla seguente relazione: ... B—base di stereovision (distanza tra le telecamere).

Risultati e miglioramenti

I risultati sperimentali dimostrano che questo metodo riduce significativamente l'errore di posizionamento assoluto del robot, con l'errore di posizionamento medio in diminuzione del 72.12% dopo la calibrazione.

Gli esperimenti eseguiti hanno dimostrato che il metodo proposto porta a una stima più approfondita del sistema di visione stereo con un miglioramento del 34,15% sul MAE e del 48,38% sullo STD rispetto ad uno dei metodi più comunemente utilizzati.

Migliori Pratiche per l'implementazione di Stereo Vision Industrial

Progettazione illuminotecnica

Un'illuminazione uniforme e diffusa minimizza ombre e riflessi speculari che possono interferire con l'accoppiamento. L'illuminazione dovrebbe essere abbastanza luminosa per fornire un buon rapporto segnale-rumore nelle immagini della fotocamera ma non così luminosa da causare saturazione o contrasto eccessivo.

Per applicazioni che coinvolgono oggetti lucidi o riflessivi, l'illuminazione polarizzata può ridurre i riflessi speculari. L'illuminazione attiva con modelli strutturati può migliorare la texture su superfici altrimenti senza caratteristiche. Il design dell'illuminazione deve essere integrato con il design del sistema complessivo dall'inizio piuttosto che aggiunto come un ripensamento.

Selezione e posizionamento della macchina fotografica

La selezione della fotocamera dovrebbe considerare la risoluzione, la velocità del telaio, la dimensione del sensore e i requisiti di interfaccia. La risoluzione più alta consente una stima più accurata della profondità, ma richiede una maggiore potenza di elaborazione. I sensori di scatto globali sono essenziali per l'imaging di oggetti in movimento o quando la fotocamera è in movimento.

Una regola generale del pollice è che la precisione della profondità è proporzionale al rapporto di distanza di lavoro con la linea di base. Le basi di Wider forniscono una risoluzione migliore della profondità, ma aumentano la distanza di lavoro minima e la probabilità di occlusioni.

Architettura del software e lavorazione della tubatura

L'architettura software dovrebbe essere progettata per la modularità e la manutenbilità. I moduli separati per l'acquisizione, la calibrazione, la rettifica, la corrispondenza e il calcolo della profondità consentono di testare e ottimizzare in modo indipendente i singoli componenti.

Le tubazioni di lavorazione devono essere ottimizzate per la piattaforma hardware di destinazione, sfruttando l'accelerazione GPU dove disponibile. L'attenta profilazione può identificare i colli di bottiglia e gli sforzi di ottimizzazione delle guide. Per applicazioni in tempo reale, si consideri l'implementazione di algoritmi adattativi che regolano i parametri di elaborazione in base alle risorse computazionali disponibili e alla complessità della scena.

Validazione e test

La validazione completa è essenziale per garantire prestazioni affidabili negli ambienti produttivi. La prova dovrebbe coprire l'intera gamma di condizioni operative previste, comprese le variazioni di illuminazione, aspetto degli oggetti e fattori ambientali.

Gli errori sono stati poi determinati tra la posizione stimata dal sistema di visione che opera sui dati ZED 2i e la posizione effettiva dell'oggetto. I punti di misura del campione sono stati posizionati sia direttamente di fronte al robot che all'interno della massima portata del robot, tenendo conto del posizionamento verticale del polso del robot per garantire il corretto funzionamento del sistema 3DV.

Tendenze dell'industria e Outlook di mercato

Adozione crescente nei settori

Il segmento dei sensori/camera di visione è progettato per sperimentare il tasso di crescita più elevato durante il periodo previsto, e questi sensori aiutano i robot a svolgere attività che richiedono il controllo della posizione, l'ispezione della qualità o il monitoraggio degli oggetti.

Le industrie che vanno dall'automotive all'elettronica alla lavorazione alimentare e farmaceutica stanno adottando una visione stereo per migliorare la qualità, aumentare il rendimento e ridurre i costi. La tecnologia è particolarmente preziosa nelle applicazioni che richiedono flessibilità per gestire le variazioni di prodotto senza cambiamenti di riprogrammazione o di utensili.

Integrazione con l'intelligenza artificiale

Nel 2025 ABB ha lanciato il suo robot mobile autonomo di nuova generazione (AMR) con le funzionalità di Visual SLAM (Simultaneous Localization and Mapping) e AI, insieme alla suite software AMR Studio, che consente ai robot di adattarsi in tempo reale agli ambienti dinamici senza contare su infrastrutture predefinite, rafforzando la strategia di ABB per fornire soluzioni di automazione altamente flessibili e intelligenti per i settori manifatturieri e logistici.

La convergenza della visione stereo con intelligenza artificiale sta creando nuove possibilità per la percezione robotizzata e il processo decisionale. Gli algoritmi AI possono interpretare le informazioni di profondità in contesto, riconoscere scene complesse e prendere decisioni intelligenti sulle azioni robotizzate. Questa integrazione è essenziale per la prossima generazione di robot industriali autonomi.

Sfide per l'adozione di Widespread

La sua ricerca NIST nota inoltre che i produttori devono affrontare barriere sostanziali, il rapporto 2024 NIST GCR identifica i costi di capitale, le questioni di integrazione e la mancanza di competenze interne come vincoli di adozione importanti.

I sistemi di visione devono essere tolleranti di guasti dei sensori, disallineamento o di interferenze ambientali. Il mancato percepimento può causare errori di navigazione o comportamenti non sicuri, soprattutto negli ambienti popolati dall'uomo. I costi di adattamento e la complessità tecnica pongono barriere ad alcune aziende.

Affrontare queste sfide richiede un continuo sviluppo di sistemi più robusti e facili da usare, strumenti di integrazione migliori e risorse educative per costruire competenze interne.

Conclusioni

La tecnologia della visione di Stereo è diventata uno strumento indispensabile per calcolare la distanza tra gli oggetti della robotica industriale. Grazie alla sua visione binoculare e agli algoritmi avanzati di elaborazione delle immagini, i sistemi di visione stereo consentono ai robot di percepire e interagire con il loro ambiente con una precisione e flessibilità senza precedenti. La tecnologia offre vantaggi significativi, tra cui elevata precisione, capacità di elaborazione in tempo reale, efficienza dei costi e misurazione non contatto.

Mentre rimangono sfide come la sensibilità ambientale, la gestione dell'occlusione e la manutenzione della calibrazione, i progressi in corso in hardware, algoritmi e intelligenza artificiale continuano ad espandere le capacità e l'affidabilità dei sistemi di visione stereo. L'integrazione di deep learning, fusione multi-modale dei sensori e la tecnologia della fotocamera migliorata sta spingendo i confini di ciò che questi sistemi possono raggiungere.

Dal momento che l'automazione industriale continua ad evolversi verso una maggiore flessibilità e autonomia, la visione stereo gioca un ruolo sempre più critico: dal rilevamento e dall'ispezione della qualità del bin alla navigazione autonoma e alla collaborazione con il robot umano-robot, le applicazioni della visione stereo nella robotica industriale sono diverse e in crescita.

Il futuro della robotica industriale è la tecnologia visiva e stereo vision fornisce la percezione profonda che i robot devono navigare, manipolare e comprendere il mondo tridimensionale in cui operano.Per gli ingegneri e le organizzazioni che cercano di implementare sistemi robotici avanzati, la comprensione e la leva della tecnologia di visione stereo è essenziale per rimanere competitivi nel panorama in rapida evoluzione dell'automazione industriale.

Risorse aggiuntive

Per coloro che sono interessati a conoscere la visione stereo e le sue applicazioni nella robotica industriale, sono disponibili online diverse risorse eccellenti. La documentazione OpenCV] fornisce tutorial completi sulla calibrazione della fotocamera, la rettifica stereo e la computazione della disparità.

Organizzazioni di settore come il Associazione per l'Acquisizione dell'Automazione[] fornire studi di casi, white paper e opportunità di networking per i professionisti che lavorano con robotica vision-guided.

Levando queste risorse e seguendo le migliori pratiche delineate in questo articolo, ingegneri e organizzazioni possono implementare con successo sistemi di visione stereo che migliorano le capacità dei loro robot industriali, migliorare l'efficienza del processo e guidare l'innovazione nella produzione e nell'automazione.