Table of Contents

L'intégration de LIDAR avec des capteurs complémentaires est devenue une pierre angulaire des systèmes modernes de cartographie et de perception.Les systèmes de fusion multicapteurs impliquant la détection et le ranging de la lumière (LiDAR), les caméras et les unités de mesure inertielles (UMI) ont été largement adoptés dans des domaines tels que la conduite autonome et la robotique en raison de leurs capacités de perception complémentaires.

Comprendre les fondamentaux de la fusion des capteurs

La fusion de capteurs est une approche sophistiquée de la perception environnementale qui tire parti des forces de multiples modalités de détection tout en compensant leurs faiblesses individuelles. La fusion de capteurs fait partie du module Perception. Nous voulons fusionner les données de nos capteurs de vision pour ajouter de la redondance, de la certitude, ou pour profiter de l'utilisation de plusieurs capteurs.

Les caméras fournissent des informations sémantiques à haute résolution mais sont sensibles aux changements d'éclairage, aux ombres et aux conditions météorologiques défavorables comme le brouillard ou la forte pluie. LiDAR offre une structure géométrique 3D précise, mais ses performances peuvent se dégrader sur des surfaces réfléchissantes ou à longue portée. Les capteurs radar, par contre, maintiennent la fiabilité dans une visibilité faible mais ont une faible résolution spatiale et un bruit de mesure plus élevé. En intégrant ces capteurs complémentaires, les systèmes peuvent maintenir des performances robustes dans des conditions environnementales variables.

Types de capteurs couramment intégrés avec LIDAR

Les systèmes modernes de cartographie et de perception intègrent généralement LIDAR avec plusieurs types de capteurs complémentaires, chacun apportant des capacités uniques à la performance globale du système.

Capteurs de caméras

Les capteurs de caméra représentent l'un des compléments les plus communs et les plus précieux aux systèmes LIDAR. Les systèmes de perception modernes adoptent de plus en plus des suites de capteurs hétérogènes intégrant des capteurs de vision monoculaire avec des modules LiDAR pour surmonter les limitations spécifiques aux modalités.

La caméra fournit des informations sémantiques denses mais manque d'informations précises sur la distance avec la cible, tandis que LiDAR fournit des informations précises sur la profondeur mais avec une résolution clairsemée. Cette relation complémentaire rend la fusion caméra-LIDAR particulièrement efficace pour la détection des objets et la classification des tâches.

Kyocera Corporation a annoncé le développement de son capteur de fusion Camera-LIDAR unique, le premier LIDAR au monde qui aligne les axes optiques de l'appareil et de LIDAR en un seul capteur. Ce design unique permet l'acquisition en temps réel de données superposées sans parallaxe, un exploit qui était auparavant inaccessible.

Capteurs radar

Les capteurs radar, particulièrement les systèmes radar 4D modernes, fournissent des informations complémentaires cruciales à LIDAR. La fusion du radar LiDAR et 4D est apparue comme une solution prometteuse pour une détection d'objets 3D robuste et précise dans des conditions complexes et défavorables.Les chercheurs se sont tournés vers LiDAR avec fusion radar 4D, en tirant parti des forces complémentaires de ces deux modalités.

Contrairement à LIDAR, qui peut être considérablement dégradé par les particules atmosphériques, le radar maintient une performance constante dans des conditions météorologiques difficiles. De plus, le radar peut mesurer directement la vitesse des objets par le déplacement de Doppler, fournissant des informations de mouvement qui complètent les mesures spatiales de LIDAR. Ces données de vitesse sont particulièrement utiles pour prédire les trajectoires des objets et évaluer les risques de collision dans des applications autonomes de conduite.

Un cadre modulaire de la dernière fusion intègre les modalités Camera, LiDAR et Radar pour la classification des objets dans la conduite autonome. L'intégration des trois types de capteurs – caméra, LIDAR et radar – crée un système de perception très robuste capable de fonctionner de manière fiable dans diverses conditions environnementales.

Modules GPS et GNSS

Les modules Global Positioning System (GPS) et Global Navigation Satellite System (GNSS) fournissent des informations de positionnement absolues qui complètent les mesures spatiales relatives de LIDAR. LIDAR excelle dans la création de cartes locales détaillées et la détection d'objets voisins, mais GPS/GNSS fournit des coordonnées de référence globales qui permettent au système de comprendre sa position dans un contexte géographique plus large.

L'intégration du GPS à LIDAR est particulièrement importante pour les applications nécessitant une cartographie géoréférencée, comme le levé, l'inspection des infrastructures et la navigation autonome sur de longues distances. Les données GPS aident à initialiser les algorithmes de localisation basés sur LIDAR et empêchent la dérive dans les estimations de position sur de longues périodes d'exploitation.

Unités de mesure inertielles (UMI)

Les unités de mesure inertielles sont des composants essentiels des systèmes de cartographie basés sur LIDAR, fournissant des mesures de mouvement à haute fréquence qui complètent les observations spatiales de LIDAR. En tirant parti des capacités complémentaires de capteurs hétérogènes tels que les caméras, la détection de lumière et le ranging (LiDAR) et les unités de mesure inertielle (UMI), les chercheurs ont développé des cadres de perception multimodales qui améliorent considérablement la robustesse du système et la compréhension des scènes.

Les IMU mesurent l'accélération et la vitesse angulaire, permettant au système de suivre son mouvement entre les balayages LIDAR. Ceci est particulièrement utile car les capteurs LIDAR fonctionnent généralement à des fréquences relativement basses (10-20 Hz pour de nombreux systèmes), tandis que les IMU peuvent fournir des mesures à des centaines ou des milliers de Hertz.

Les recherches futures pourraient intégrer davantage de capteurs de véhicules, comme les radars à ondes millimétriques, les unités de mesure d'inertie (UMI) et les caméras infrarouges, pour recueillir des données environnementales plus riches. La combinaison de données IMU avec les mesures LIDAR est fondamentale pour les algorithmes Simultanée de localisation et de cartographie (SLAM), qui permettent aux robots et aux véhicules autonomes de construire des cartes tout en suivant simultanément leur position au sein de ces cartes.

Caméras infrarouges thermiques

Les caméras infrarouges thermiques représentent un type de capteur spécialisé mais de plus en plus important pour les systèmes de fusion LIDAR. Un système de fusion de capteurs combinant une caméra infrarouge thermique et un capteur LiDAR peut détecter et identifier de façon fiable des objets même dans des environnements peu visibles, comme le jour ou la nuit.

Contrairement aux caméras RGB classiques qui utilisent la lumière visible réfléchie, les caméras thermiques détectent les radiations infrarouges émises par des objets en fonction de leur température. Elles sont particulièrement efficaces pour détecter les piétons, les animaux et les véhicules, quelles que soient les conditions d'éclairage.

Architectures et niveaux de fusion de capteurs

La fusion des capteurs peut être mise en œuvre à différents niveaux architecturaux, chacun avec des caractéristiques, des avantages et des exigences informatiques distincts.

Fusion précoce (fusion de faible niveau)

La fusion précoce, aussi appelée fusion de niveau bas ou de niveau de données, combine les données de capteur brut avant tout traitement de haut niveau. La fusion précoce (fusion de capteur de bas niveau) est une fusion de données brutes. La fusion tardive est une fusion des objets (fusion de capteur de niveau intermédiaire) ou des pistes (fusion de capteur de haut niveau) Lorsque nous faisons la fusion de capteur précoce, nous voulons faire l'association entre les nuages de point et les pixels ou les boîtes.

Les techniques de fusion varient considérablement; certaines méthodes utilisent la fusion précoce pour combiner les données brutes de capteur avant de les alimenter en un seul modèle, tandis que d'autres utilisent la fusion tardive, combinant les sorties individuelles de capteur au stade de la décision.

En concevant un bloc de fusion de fonctions croisées pour connecter les branches de traitement de la profondeur et du RGB, la stratégie de fusion de la couche de caractéristiques est appliquée pour intégrer les données de multimodalité. Cette approche permet à l'algorithme de fusion de tirer parti des corrélations dans les données brutes et peut potentiellement extraire plus d'informations que de traiter chaque flux de capteur indépendamment.

Les avantages de la fusion précoce sont notamment la capacité d'exploiter les corrélations fines entre les modalités des capteurs et une précision potentiellement plus élevée lorsque des données suffisantes sont disponibles. Cependant, la fusion précoce présente également des défis : elle nécessite un calibrage spatial et temporel précis entre les capteurs, peut être intensive en calcul et peut être sensible aux défaillances des capteurs ou à la qualité des données dégradées d'une seule modalité.

Fusion de niveau intermédiaire (fusion de niveau de caractéristiques)

La fusion au niveau moyen fonctionne au niveau des caractéristiques, combinant des représentations intermédiaires extraites de chaque modalité de capteur. MS-Occ, un nouveau cadre de fusion multi-étapes LiDAR-camera qui comprend la fusion au niveau moyen et la fusion au stade avancé, est proposé, intégrant la fidélité géométrique de LiDAR à la richesse sémantique basée sur la caméra via la fusion modal hiérarchique.

Dans la fusion de caractéristiques, les données de chaque capteur sont traitées par les étapes initiales d'extraction de caractéristiques avant la fusion. Par exemple, les nuages de points LIDAR peuvent être traités par la voxélisation et les couches de convolution clairsemées, tandis que les images de caméras passent par les couches de réseau neuronal convolutionnel.

L'algorithme fusionne adaptativement les caractéristiques géométriques et les caractéristiques sémantiques de la caméra LiDAR par la pondération de l'attention par canal, en améliorant la représentation des fonctionnalités multimodales en priorisant dynamiquement les canaux d'information.

La fusion de type caractéristique offre un équilibre entre l'intégration à grain fin de la fusion précoce et la modularité de la fusion tardive. Elle permet de traiter chaque modalité de capteur avec des architectures spécialisées optimisées pour ce type de données, tout en permettant de riches interactions modal au niveau des fonctionnalités.

Fusion tardive (fusion de haut niveau)

La fusion tardive, aussi appelée fusion à haut niveau, combine les sorties d'algorithmes de détection ou de suivi indépendants fonctionnant sur chaque modalité de capteur. Les résultats montrent que la fusion tardive légère peut atteindre une fiabilité élevée tout en restant efficace sur le plan informatique, ce qui le rend adapté aux systèmes de conduite autonomes embarqués en temps réel.

Dans les architectures de fusion tardive, chaque capteur fonctionne indépendamment pour détecter des objets, estimer des positions ou effectuer d'autres tâches de perception. Les résultats de ces pipelines de traitement indépendants sont ensuite combinés à l'aide d'algorithmes d'association. Lors de la fusion de capteur tardif, nous voulons faire l'association entre les résultats (boîtes de regroupement) et donc avoir des algorithmes tels que l'algorithme hongrois et les filtres Kalman pour le résoudre.

Notre approche s'appuie sur des techniques de fusion tardive, permettant des modèles de capteurs indépendants et permettant des stratégies de fusion flexibles. La nature modulaire de la fusion tardive offre plusieurs avantages : des capteurs peuvent être développés et optimisés indépendamment, le système est plus robuste aux défaillances individuelles des capteurs, et il est plus facile d'ajouter ou de supprimer des capteurs sans remodeler l'ensemble du pipeline de perception.

La fusion tardive est particulièrement adaptée aux systèmes à capteurs hétérogènes qui peuvent fonctionner à différentes fréquences ou avoir des champs de vision différents. L'échange est que la fusion tardive peut ne pas saisir les corrélations à grain fin entre les modalités de capteur aussi efficacement que les approches de fusion antérieures, ce qui pourrait entraîner des performances légèrement inférieures dans des conditions idéales.

Approches de fusion hybride

Les systèmes modernes de fusion de capteurs utilisent de plus en plus des approches hybrides qui combinent plusieurs niveaux de fusion pour tirer parti des avantages de chacun. Les méthodes de fusion hybrides ont tendance à atteindre la plus grande robustesse, mais leur complexité, leur coût d'entraînement et leur exigence pour des ensembles de données multicapteurs synchrones peuvent limiter le déploiement pratique.

Une architecture de fusion hybride pourrait utiliser la fusion précoce pour des paires de capteurs étroitement couplés (comme LIDAR et caméra montée dans le même boîtier), tout en utilisant la fusion tardive pour intégrer des capteurs supplémentaires comme le radar ou le GPS. Cette approche multi-niveaux permet aux concepteurs de systèmes d'optimiser la stratégie de fusion pour chaque combinaison de capteurs en fonction de leurs caractéristiques, exigences de synchronisation et contraintes de calcul.

Techniques de fusion et algorithmes de base

La mise en œuvre d'une fusion efficace des capteurs nécessite des algorithmes sophistiqués qui peuvent relever les défis de la combinaison de sources de données hétérogènes.

Filtrage Kalman et filtrage Kalman étendu

Le filtre Kalman représente l'un des algorithmes les plus fondamentaux et les plus utilisés dans la fusion des capteurs. Il fournit une méthode optimale pour estimer l'état d'un système dynamique à partir de mesures bruyantes, ce qui le rend idéal pour combiner des données de plusieurs capteurs avec des caractéristiques de bruit différentes et des taux de mise à jour.

Dans les systèmes de fusion basés sur LIDAR, les filtres Kalman sont couramment utilisés pour suivre les objets en mouvement en combinant les mesures de position de LIDAR avec les informations de vitesse provenant du radar ou des prévisions de mouvement à partir des données IMU. Le filtre maintient une estimation probabiliste de l'état de l'objet (position, vitesse, accélération) et met à jour cette estimation à mesure que de nouvelles mesures arrivent de différents capteurs, pondérant chaque mesure en fonction de sa précision estimée.

Le filtre Kalman étendu (EKF) étend le filtre Kalman de base pour gérer les modèles de dynamique et de mesure non linéaires, qui sont courants dans les applications réelles. Par exemple, la relation entre les mesures LIDAR et la position du véhicule implique des transformations géométriques non linéaires, faisant d'EKF un choix naturel pour la fusion LIDAR-IMU dans les systèmes de navigation.

Filtre Kalman sans parfum

Le filtre Kalman non parfumé (UKF) offre une approche alternative à la manipulation de systèmes non linéaires qui surpasse souvent le filtre Kalman étendu. Un filtre Kalman non parfumé est utilisé pour prédire avec précision l'état de mouvement des objets non linéaires, et des informations de mouvement d'objets sont ajoutées au module de correspondance IoU pour améliorer la précision de correspondance dans le processus d'association de données.

Au lieu de linéariser les fonctions non linéaires comme le FCE, le FCE utilise une technique d'échantillonnage déterministe pour saisir la moyenne et la covariance de la distribution de l'état par un ensemble de points d'échantillonnage soigneusement choisis. Cette approche fournit généralement des estimations plus précises pour les systèmes hautement non linéaires tout en maintenant l'efficacité computationnelle comparable au FCE.

Dans le contexte de la fusion LIDAR, UKF est particulièrement utile pour suivre les objets avec des motifs de mouvement complexes, tels que les véhicules faisant des virages ou les piétons changer de direction. L'amélioration de la précision dans la prévision de mouvement améliore la capacité du système à maintenir des voies cohérentes, même lorsque les objets sont temporairement occultés ou lorsque les mesures de capteurs sont bruyantes.

Filtre de particules

Les filtres à particules, également appelés méthodes séquentiels Monte Carlo, représentent la distribution de l'état à l'aide d'un ensemble d'échantillons pondérés (particules) plutôt qu'une distribution paramétrique, ce qui rend les filtres à particules particulièrement adaptés pour la manipulation de systèmes hautement non linéaires, le bruit non gaussien et les distributions multimodales qui peuvent survenir dans des scénarios complexes de fusion de capteurs.

Dans la localisation et la cartographie basées sur LIDAR, les filtres à particules sont couramment utilisés pour les problèmes de localisation globale où la position initiale est inconnue ou très incertaine. Chaque particule représente une hypothèse sur l'état du système (comme la position du robot), et les particules sont pondérées en fonction de la façon dont elles expliquent les mesures du capteur observé.

La flexibilité des filtres à particules est à un coût de calcul, car ils nécessitent généralement des centaines ou des milliers de particules pour représenter avec précision des distributions complexes.

Fusion fondée sur l'apprentissage profond

L'apprentissage profond a révolutionné la fusion des capteurs au cours des dernières années, permettant d'apprendre de bout en bout les stratégies de fusion directement à partir de données. Cet examen analyse les techniques actuelles d'harmonisation et de prétraitement des données, les différents niveaux de fusion des données et le rôle transformateur des algorithmes d'apprentissage automatique et d'apprentissage profond, y compris les modèles de fondation émergents.

Les architectures réseau neuronales pour la fusion des capteurs peuvent apprendre des relations complexes et non linéaires entre différentes modalités de capteurs qui seraient difficiles ou impossibles à modéliser avec des approches traditionnelles. Les réseaux neuronaux convolutionnels (RNC) sont particulièrement efficaces pour le traitement des nuages point LIDAR et des images de caméras, tandis que les réseaux neuronaux récurrents (RNN) et les transformateurs peuvent modéliser les dépendances temporelles dans les données de capteurs séquentielles.

Une autre approche de fusion moderne, DifFUSER, exploite des modèles de diffusion pour fusionner des fonctionnalités multimodales et générer des représentations BEV robustes. En utilisant le raffinement génératif, le modèle peut récupérer des informations de modalité manquantes ou corrompues, améliorant la stabilité de perception sous la dégradation.

Les mécanismes d'attention sont devenus particulièrement importants dans la fusion fondée sur l'apprentissage profond. Ces mécanismes permettent au réseau de peser dynamiquement la contribution de différents capteurs en fonction de leur fiabilité et de leur pertinence dans des contextes spécifiques. Par exemple, un réseau de fusion pourrait apprendre à compter plus fortement sur LIDAR dans des conditions de faible luminosité où la performance de la caméra se dégrade, tout en mettant l'accent sur les données de la caméra dans des environnements bien éclairés où elle fournit de riches informations sémantiques.

Théorie du dempster-Shafer

La théorie des preuves de Dempster-Shafer fournit un cadre mathématique pour combiner les données provenant de sources multiples avec différents degrés d'incertitude. Une stratégie d'appariement d'intersection-d'union (IoU) de boîte cible, basée sur la probabilité de distance entre le centre et le point de coordonnées et la théorie améliorée de Dempster-Shafer (D-S), est utilisée pour effectuer la fusion de confiance de classe pour obtenir le résultat final de détection de fusion.

Contrairement aux approches bayésiennes qui exigent des distributions de probabilité précises, la théorie Dempster-Shafer peut représenter explicitement l'incertitude et l'ignorance, ce qui la rend particulièrement utile pour les scénarios de fusion de capteurs où différents capteurs peuvent avoir des niveaux de confiance variables dans leurs mesures ou où certains capteurs peuvent ne pas être en mesure de fournir des informations sur certains aspects de l'environnement.

Dans la fusion LIDAR-camera pour la détection d'objets, la théorie Dempster-Shafer peut combiner les confiances de classification des deux modalités, en tenant compte des cas où un capteur est incertain ou fournit des informations contradictoires. Les règles de combinaison de la théorie garantissent que les preuves cohérentes provenant de plusieurs capteurs renforcent la confiance globale, tandis que les preuves contradictoires sont traitées de manière fondée sur des principes.

Étalonnage : la fondation d'une fusion efficace

L'étalonnage précis entre capteurs est absolument essentiel pour une fusion efficace. Cette application généralisée a conduit à une demande croissante d'étalonnage précis des capteurs. Sans une connaissance précise des relations spatiales et temporelles entre capteurs, les algorithmes de fusion ne peuvent pas associer correctement les mesures de différentes modalités, conduisant à des performances dégradées ou à une défaillance complète du système.

Étalonnage spatial (paramètres extrinsèques)

Le développement de la technologie de fusion utilisant des caméras et LiDAR dans des véhicules autonomes nécessite une position relative précise (y compris des informations de posture et de direction) de la caméra et du capteur LiDAR comme une nécessité absolue. Ceci peut être accompli en trouvant la matrice de conversion entre des capteurs hétérogènes comme problèmes de paramètres extrinsèques.

Pour la fusion LIDAR-caméra, l'étalonnage extrinsèque consiste à déterminer la matrice de rotation et le vecteur de traduction qui transforment les points du cadre de coordonnées LIDAR en un cadre de coordonnées de la caméra. Cette transformation permet de projeter les points LIDAR sur des images ou des pixels de la caméra en relation avec les mesures LIDAR 3D.

On prend plusieurs nombres de données d'échantillonnage pour calculer les paramètres d'étalonnage intrinsèques et extrinsèques de sorte que la fusion fonctionne sur les données en temps réel avec une erreur de projection minimale. L'étalonnage consiste généralement à capturer des données de cibles d'étalonnage spécialement conçues qui sont visibles par les deux capteurs, puis à résoudre un problème d'optimisation pour trouver les paramètres de transformation qui permettent le mieux d'aligner les observations.

Les méthodes modernes d'étalonnage comprennent des méthodes basées sur des cibles utilisant des tableaux de vérification ou des marqueurs 3D spécialisés, des méthodes sans cibles qui exploitent des caractéristiques naturelles dans l'environnement et des techniques d'étalonnage automatiques qui améliorent continuellement les paramètres d'étalonnage en cours de fonctionnement normal. Les capacités de détection RGB sont alignées en usine avec le LiDAR, avec une capacité d'assurer une géométrie précise et cohérente entre les unités de production.

Étalonnage temporal (synchronisation du temps)

Certaines études de fusion de capteurs nécessitent des chronomètres très précis et bien alignés pour les mesures par caméra et par IMU. Cependant, ces chronomètres sont affectés par de multiples facteurs, notamment les différences dans les sources d'horloges, les mécanismes de déclenchement, les retards de transmission, la congestion des données, les embrouillements et la dérive.

Pour les plates-formes mobiles, même les décalages horaires peuvent causer des erreurs importantes dans la fusion. Si un véhicule voyage à 30 mètres par seconde, un décalage horaire de 10 millisecondes entraîne un décalage spatial de 30 centimètres entre les mesures des capteurs.

Idéalement, un système matériel dédié peut déclencher synchronement l'acquisition de données pour tous les capteurs, une solution déjà adoptée dans des applications exigeant un alignement temporel de haute précision, comme la fusion multicapteurs de LiDAR, des caméras et des radars à ondes millimétriques en conduite autonome. La synchronisation matérielle fournit le timing le plus précis, mais les méthodes de synchronisation basées sur le logiciel peuvent également atteindre des performances acceptables en estimant et en compensant les décalages temps.

Étalonnage intrinsèque

En plus de l'étalonnage extrinsèque entre capteurs, chaque capteur doit être étalonné individuellement pour corriger les distorsions internes et les inexactitudes. Pour les caméras, l'étalonnage intrinsèque détermine des paramètres tels que les coefficients de focale, de point principal et de distorsion de lentille.

L'étalonnage intrinsèque précis est une condition préalable à un étalonnage et à une fusion extrinsèques efficaces. Les erreurs dans les paramètres intrinsèques se propagent à travers le pipeline de fusion et peuvent dégrader considérablement les performances globales du système.

Applications de la fusion de capteurs LIDAR

L'intégration de LIDAR avec des capteurs complémentaires permet de réaliser des performances robustes dans un large éventail d'applications, chacune avec des exigences et des défis uniques.

Véhicules autonomes

La conduite autonome représente peut-être l'application la plus exigeante et la plus visible de la fusion des capteurs LIDAR. Les progrès de la technologie des capteurs et la croissance substantielle de la puissance informatique ont suscité un intérêt croissant pour la fusion multi-capteurs pour des applications telles que la conduite autonome.

La conduite autonome a été largement appliquée dans les applications commerciales et industrielles, ainsi que la mise à niveau des systèmes de sensibilisation à l'environnement. Les tâches telles que la planification du chemin, le suivi de la trajectoire et l'évitement des obstacles dépendent fortement de la capacité à effectuer la détection en temps réel d'objets et la régression de la position.

La fusion multicapteurs fournit la redondance et la robustesse nécessaires pour des applications de conduite autonome et critique en matière de sécurité, garantissant que le véhicule peut maintenir une conscience de la situation même si les capteurs individuels échouent ou fournissent des données dégradées dans des conditions difficiles.

Dans les environnements urbains où la circulation est complexe, la fusion caméra-LIDAR excelle dans la détection et la classification des différents usagers de la route, y compris les véhicules, les piétons et les cyclistes. Sur les routes, la combinaison de LIDAR et de radar permet une détection fiable à longue distance et une mesure de vitesse pour la régulation adaptative des croisières et l'évitement des collisions.

Robotique et plateformes mobiles

Les robots mobiles de service opérant dans les environnements intérieurs utilisent la fusion LIDAR-caméra pour détecter les obstacles, reconnaître les objets et naviguer en toute sécurité autour des personnes. Les robots mobiles industriels dans les entrepôts et les usines utilisent la fusion de capteurs pour la localisation précise et l'évitement des collisions dans des environnements dynamiques avec des équipements et du personnel mobiles.

L'intégration de LIDAR à l'IMU est particulièrement importante pour la navigation des robots, permettant une estimation précise du mouvement et la construction de cartes à travers les algorithmes SLAM. LIDAR fournit des mesures spatiales de l'environnement, tandis que les données IMU aident à suivre le mouvement du robot entre les scans LIDAR, améliorant la précision et la cohérence des cartes résultantes.

Les robots humanoïdes et les systèmes de manipulation avancés bénéficient de la fusion LIDAR-caméra pour la reconnaissance des objets et la planification des saisies. La caméra fournit des informations sémantiques sur l'identité et l'apparence des objets, tandis que LIDAR fournit une géométrie 3D précise nécessaire pour planifier un mouvement sans collision et des saisies stables.

Systèmes aériens sans pilote (UAS)

L'utilisation des systèmes aériens sans pilote se développe rapidement dans les applications civiles, militaires et scientifiques. Le déploiement de drones à proximité des zones urbaines devient de plus en plus courant, en particulier lors de missions menées au-delà de la visibilité visuelle (BVLOS) ou en mode totalement autonome.

Ce travail présente l'intégration matérielle et logicielle des capteurs LiDAR et radar avec un pilote automatique Pixhawk et un ordinateur compagnon Raspberry Pi, visant à développer des applications de détection d'obstacles. Pour les drones opérant dans des environnements complexes, la fusion de capteurs permet une navigation sûre en détectant des obstacles tels que les bâtiments, les lignes électriques, les arbres et d'autres avions.

Les contraintes de poids et de puissance des plates-formes aériennes rendent la sélection et l'intégration des capteurs particulièrement difficiles. Les capteurs LIDAR légers combinés avec des caméras et IMU offrent une solution pratique pour la détection des obstacles et la cartographie sur les petits drones.

Agriculture de précision

Pour remédier à l'insuffisance des méthodes traditionnelles de navigation monocapteurs dans les environnements de plantation denses de vergers à grenade, cet article propose une méthode d'extraction de la ligne de navigation basée sur la vision et la fusion LiDAR pour les environnements de verger. La méthode proposée intègre un modèle de détection du tronc YOLOV8-ResCBAM, un algorithme de fusion de projection par rayon inverse et des techniques géométriques de fixation de la ligne de navigation par contrainte.

Des expériences sur le terrain démontrent que la méthode de navigation basée sur la fusion proposée améliore la précision de navigation par rapport aux méthodes à capteur unique et aux méthodes de séparation sémantique, réduisant l'erreur latérale moyenne à 5,2 cm, donnant une erreur latérale moyenne de SRM de 6,6 cm et atteignant un taux de succès de navigation de 95,4 %. Ces résultats confirment l'efficacité de la vision et de l'approche basée sur la fusion 2D LiDAR dans des environnements de verger complexes et fournissent une voie viable vers la navigation autonome pour les robots de verger.

Au-delà de la navigation, la fusion LIDAR-caméra permet une surveillance détaillée des cultures, y compris la mesure de la hauteur des plantes, l'estimation du volume de la canopée et la détection des fruits. La combinaison des mesures 3D précises de LIDAR avec l'analyse de la couleur et de la texture par caméra fournit des informations complètes pour les applications agricoles de précision telles que l'application à taux variable d'engrais et de pesticides, la prédiction du rendement et la détection des maladies.

Systèmes d'information géographique et cartographie

Si les données de télédétection à source unique offrent des capacités importantes, des limites inhérentes telles que l'interférence du couvert nuageux (optique), le bruit de la mouche (radar) ou des informations spectrales limitées (LiDAR) empêchent souvent de caractériser de façon complète et robuste les surfaces des terres.

La fusion de LIDAR avec des images optiques et des données radar permet des applications complètes de surveillance et de cartographie des terres. Les systèmes LIDAR aéroportés et terrestres combinés à des caméras haute résolution produisent des modèles 3D détaillés de terrain, de bâtiments et d'infrastructure.

Les systèmes de cartographie mobiles intégrant LIDAR, caméras, GPS et IMU sur les véhicules permettent une collecte efficace de données 3D géoréférencées le long des réseaux routiers. Ces systèmes soutiennent des applications telles que l'évaluation de l'état des routes, la gestion des actifs et la création de cartes haute définition pour les véhicules autonomes.

Automatisation industrielle et contrôle de la qualité

Les opérations de fabrication et de logistique utilisent la fusion de capteurs LIDAR pour l'inspection automatisée, le contrôle de qualité et la manutention des matériaux. La combinaison des mesures dimensionnelles précises de LIDAR et l'inspection visuelle par caméra permet une évaluation complète de la qualité des pièces fabriquées, en détectant les écarts géométriques et les défauts de surface.

Les véhicules guidés automatisés (AGV) dans les entrepôts et les usines utilisent la fusion LIDAR-caméra pour la navigation et la détection des obstacles, transportant en toute sécurité des matériaux dans des environnements dynamiques avec des travailleurs humains et d'autres équipements.

La sélection des bacs et la dépallétisation des applications bénéficient de la fusion LIDAR-camera pour la localisation des objets et l'estimation des poses. LIDAR fournit des positions 3D précises des objets dans les bacs encombrés, tandis que les caméras permettent la reconnaissance des objets et la sélection de points de saisie basée sur des caractéristiques visuelles.

Défis techniques dans la fusion des capteurs LIDAR

Malgré des progrès importants, la fusion des capteurs LIDAR continue de faire face à plusieurs défis techniques que les chercheurs et les ingénieurs doivent relever.

Association des données et correspondance

L'établissement de correspondances correctes entre les mesures de différents capteurs reste un défi fondamental dans la fusion des capteurs. Les points LIDAR doivent être associés aux pixels correspondants dans les images de la caméra, ou les détections de différents capteurs doivent être appariées aux mêmes objets physiques.

Le problème d'association de données devient particulièrement difficile dans les environnements encombrés avec de nombreux objets similaires, ou lorsque les objets sont partiellement occultés. Des ambiguïtés dans la correspondance peuvent survenir lorsque plusieurs objets sont rapprochés ou lorsque les mesures de capteurs sont bruyantes.

Manipulation des défaillances du capteur et des données dégradées

Les systèmes de capteurs du monde réel doivent faire face aux défaillances des capteurs, à la dégradation de la qualité des données et à des conditions environnementales variables.Les défis tels que le bruit radar dû à la pluie, la dégradation de l'image basse lumière et l'impact des intempéries sur les performances des capteurs n'ont pas été étudiés de façon approfondie.

Les algorithmes de fusion doivent détecter lorsque des capteurs individuels fournissent des données peu fiables et ajuster leur stratégie de fusion en conséquence. Cela nécessite de surveiller la santé des capteurs, de détecter les anomalies dans les sorties des capteurs et de repondre dynamiquement les contributions des capteurs en fonction de la fiabilité estimée.

Complexité informatique et performance en temps réel

Les algorithmes de fusion des capteurs doivent traiter de grandes quantités de données provenant de plusieurs capteurs en temps réel, ce qui présente des défis informatiques importants. Les capteurs LIDAR peuvent générer des millions de points par seconde, tandis que les caméras produisent des images haute résolution à 30-60 images par seconde ou plus.

La méthode proposée a maintenu des temps d'inférence stables, en moyenne 147 ms par cadre, avec seulement des retards occasionnels plus élevés. Fait important, aucune dérive cumulative du temps n'a été observée pendant une exploitation prolongée, ce qui indique la stabilité temporelle.

L'équilibre entre précision et efficacité de calcul exige une architecture soignée, des techniques d'optimisation telles que la taille et la quantification des modèles, et la mise à profit d'accélérateurs matériels spécialisés comme les GPU et les processeurs AI dédiés.

Entretien et étalonnage

Les paramètres d'étalonnage des capteurs peuvent changer au fil du temps en raison de vibrations mécaniques, de variations de température, de vieillissement des composants et d'impacts physiques.Cette dérive d'étalonnage dégrade progressivement les performances de fusion si elle n'est pas détectée et corrigée.

Les méthodes d'étalonnage en ligne doivent faire la distinction entre les changements d'étalonnage réels et les anomalies de mesure temporaires, en mettant à jour les paramètres d'étalonnage de façon prudente pour éviter l'instabilité.

Disponibilité des données et adaptation du domaine

La formation et la validation des algorithmes de fusion basés sur l'apprentissage profond nécessitent de gros ensembles de données synchronisées et calibrées à partir de plusieurs capteurs, ainsi que des annotations de vérité au sol. Les méthodes de fusion hybride ont tendance à atteindre la plus grande robustesse, mais leur complexité, leur coût de formation et leur exigence pour les ensembles de données multicapteurs synchrones peuvent limiter le déploiement pratique.

De plus, les algorithmes de fusion formés sur les données d'un environnement ou d'une configuration de capteur peuvent ne pas se généraliser bien à différentes conditions.

Techniques de fusion avancées et tendances émergentes

Le domaine de la fusion des capteurs LIDAR continue d'évoluer rapidement, avec plusieurs techniques et tendances émergentes qui façonnent les développements futurs.

Représentations visuelles des oiseaux (VCE)

Les représentations visuelles d'Oiseaux sont apparues comme une approche puissante de la fusion multicapteurs dans les applications de conduite autonomes. BEV représente des données de capteurs de projets de différentes modalités en vue aérienne commune, fournissant un cadre spatial unifié pour la fusion qui traite naturellement les différentes perspectives et systèmes de coordination de différents capteurs.

Bien que les méthodes centrées sur la vision souffrent d'inexactitudes géométriques, les approches basées sur LiDAR manquent souvent d'informations sémantiques riches. Pour remédier à ces limitations, MS-Occ, un nouveau cadre de fusion multi-étapes LiDAR-camera qui comprend la fusion intermédiaire et la fusion en phase terminale, est proposé, intégrant la fidélité géométrique de LiDAR à la richesse sémantique basée sur la caméra via la fusion modal hiérarchique.

Les représentations BEV simplifient de nombreuses tâches de perception, telles que la détection d'objets, le suivi et la prédiction du mouvement, en fournissant un cadre de référence spatiale cohérent, et facilitent l'intégration des informations cartographiques et permettent un raisonnement efficace multi-objets dans le contexte des scénarios de conduite.

Architectures de fusion basées sur les transformateurs

Les architectures de transformateurs, initialement développées pour le traitement du langage naturel, ont connu un succès remarquable dans la vision informatique et sont de plus en plus appliquées à la fusion des capteurs. Les mécanismes d'attention des transformateurs permettent une modélisation flexible des relations entre les différentes modalités de capteurs et les emplacements spatiaux, apprenant à se concentrer sur les informations les plus pertinentes pour chaque tâche.

Les mécanismes d'attention croisée permettent aux transformateurs de fusionner efficacement les informations provenant de capteurs hétérogènes en apprenant les corrélations entre les caractéristiques de différentes modalités, ce qui permet de saisir des dépendances complexes qui seraient difficiles à modéliser avec les techniques traditionnelles de fusion, ce qui pourrait améliorer les performances sur les tâches de perception difficiles.

Adaptive et Contexte-Contexte Fusion

Un pipeline de fusion radar LiDAR + 4D proposé introduit un mécanisme de gage adaptatif qui module les contributions radar en fonction des conditions de scène. Cela augmente la robustesse lorsque l'une ou l'autre modalité devient peu fiable.

La fusion contextuelle ne tient pas seulement compte des mesures actuelles des capteurs, mais aussi du contexte de situation plus large, y compris le type de scène, les conditions météorologiques, l'éclairage et les performances historiques. En adaptant la stratégie de fusion au contexte spécifique, ces systèmes peuvent maintenir des performances robustes dans un plus grand nombre de conditions de fonctionnement que les approches de fusion fixe.

Solutions matérielles intégrées

Innoviz Technologies a annoncé la première longue gamme de couleurs LiDAR avec caméra dans son InnovizThree LiDAR récemment annoncé, créant un module de fusion de capteurs compacts conçu pour réduire significativement la complexité d'intégration d'OEM. La solution combine la détection LiDAR et RGB dans un module de perception unique compact, conçu pour les installations derrière le pare-brise, les drones, les micro-robotiques et les humanoïdes. La consolidation d'une caméra RGB à l'intérieur d'InnovizTrois renforce l'engagement d'Innoviz à des solutions de perception de la fusion de capteurs évolutives et adaptées aux OEM conçues pour la production de séries et le déploiement à long terme avec le potentiel de permettre un déploiement et une économie de coûts plus rapides.

Les solutions matérielles intégrées offrent plusieurs avantages : intégration mécanique simplifiée, calibrage en usine qui reste stable sur toute la durée de vie du produit, synchronisation matérielle pour un timing précis et réduction de la complexité du système.

Modèles de base et apprentissage de transfert

Les modèles de base à grande échelle formés à divers ensembles de données commencent à avoir un impact sur la fusion des capteurs. Ces modèles apprennent des représentations générales qui peuvent être ajustées pour des tâches de fusion spécifiques avec des quantités relativement faibles de données spécifiques à chaque tâche.

Les techniques d'apprentissage de transfert permettent d'appliquer les connaissances acquises dans un domaine de configuration ou d'application de capteurs à d'autres, ce qui peut accélérer le développement et réduire le besoin de collecte de données et d'annotation pour chaque nouveau scénario de déploiement.

Meilleures pratiques pour la mise en œuvre de la fusion des capteurs LIDAR

La mise en œuvre réussie des systèmes de fusion de capteurs LIDAR exige une attention particulière à de nombreuses considérations pratiques au-delà des algorithmes de base.

Sélection et configuration du capteur

Le choix des capteurs appropriés et leur configuration sont essentiels aux performances du système de fusion. Les capteurs doivent être sélectionnés en fonction de leurs caractéristiques complémentaires, compte tenu des exigences spécifiques de l'application, de l'environnement de fonctionnement et des contraintes telles que le coût, la taille, le poids et la consommation d'énergie.

Le placement du capteur doit tenir compte du chevauchement des champs de vision, des effets d'occlusion et de la stabilité du montage. Un chevauchement suffisant entre les champs de vision est nécessaire pour une fusion efficace, mais une redondance excessive peut gaspiller les ressources.

Procédures d'étalonnage systématiques

L'établissement et le maintien d'un étalonnage précis sont essentiels pour la performance de la fusion. Les procédures d'étalonnage doivent être systématiques, répétables et bien documentées. L'étalonnage initial doit être effectué dans des conditions contrôlées et des cibles d'étalonnage de haute qualité, et la précision de l'étalonnage doit être vérifiée au moyen de mesures indépendantes.

Des vérifications d'étalonnage régulières devraient être effectuées pour détecter la dérive, en particulier après toute perturbation mécanique ou exposition environnementale. Les procédures de vérification automatisées d'étalonnage peuvent aider à déterminer quand un recalibrage est nécessaire sans intervention manuelle.

Architecture logicielle robuste

Les architectures modulaires permettent de développer et de tester indépendamment les pipelines de traitement des capteurs individuels avant leur intégration, en simplifiant le développement et le débogage.

La manipulation des erreurs et la tolérance aux défauts sont essentielles pour les systèmes opérationnels. Le logiciel devrait détecter les défaillances des capteurs, les problèmes de qualité des données et les erreurs de traitement, en répondant de manière appropriée pour maintenir la fonctionnalité du système.

Validation et essais

Une validation complète est nécessaire pour garantir que les systèmes de fusion répondent aux exigences de performance dans toutes les conditions d'exploitation prévues. Les essais devraient porter sur les conditions nominales ainsi que sur les cas de bord, les défaillances des capteurs et les conditions environnementales difficiles.

Pour les tâches de perception, les mesures peuvent comprendre la précision de détection, les taux faux positifs et faux négatifs, l'erreur de localisation et la latence de traitement. Les tests devraient utiliser les ensembles de données enregistrés pour la reproductibilité et le fonctionnement en direct dans des environnements représentatifs.

Amélioration et surveillance continues

Les systèmes de fusion déployés devraient comprendre des capacités de surveillance pour suivre les performances au fil du temps et identifier les possibilités d'amélioration. Les données des capteurs de jour, les sorties de fusion et les mesures de performance permettent une analyse hors ligne pour comprendre le comportement du système et identifier les modes de défaillance.

Les commentaires du déploiement opérationnel devraient éclairer les améliorations itératives des algorithmes de fusion, des procédures d'étalonnage et de la configuration du système. Ce cycle d'amélioration continue est essentiel pour atteindre et maintenir des performances élevées dans les applications réelles.

Orientations futures et possibilités de recherche

Le domaine de la fusion des capteurs LIDAR continue de présenter de nombreuses possibilités de recherche et de développement qui façonneront les systèmes futurs.

Robuste améliorée dans les conditions défavorables

L'amélioration des performances des systèmes de fusion dans des conditions environnementales difficiles demeure une importante orientation de recherche. Bien que les systèmes actuels fonctionnent bien dans des conditions nominales, les performances peuvent se dégrader de façon significative dans des conditions de pluie abondante, de brouillard, de neige ou d'éclairage extrême.

Les possibilités de recherche comprennent l'élaboration de meilleurs modèles de dégradation des capteurs dans des conditions défavorables, la création de stratégies de fusion adaptative qui répondent aux conditions changeantes et l'exploration de nouvelles modalités de détection qui complètent les capteurs traditionnels dans des environnements difficiles.

Algorithmes efficaces pour les plateformes de formation aux ressources

De nombreuses applications nécessitent la fusion de capteurs sur des plateformes avec des ressources informatiques limitées, comme les petits drones, les robots mobiles ou les systèmes automobiles embarqués. Le développement d'algorithmes de fusion qui atteignent des performances élevées avec des exigences de calcul minimales reste un défi important.

Les directions de recherche comprennent la recherche d'architecture neuronale pour des réseaux de fusion efficaces, la distillation du savoir pour compresser les grands modèles et les approches hybrides qui combinent des algorithmes traditionnels efficaces avec des composants d'apprentissage approfondi ciblés.

Fusion explicable et interpretable

À mesure que les systèmes de fusion deviennent plus complexes, en particulier grâce à des approches d'apprentissage approfondi, il devient de plus en plus important de comprendre pourquoi les systèmes prennent des décisions particulières.

Les possibilités de recherche comprennent le développement de techniques de visualisation pour la fusion multicapteurs, la création d'architectures de fusion interprétables et l'établissement de méthodes pour quantifier et communiquer la confiance et l'incertitude du système de fusion.

Normalisation et benchmarking

La communauté de la fusion des capteurs bénéficierait de repères normalisés, de ensembles de données et de protocoles d'évaluation qui permettent une comparaison équitable des différentes approches. Bien que les ensembles de données comme KITTI, nuScenes et Waymo Open Dataset aient été précieux, le développement continu de repères diversifiés et difficiles couvrant différents capteurs, environnements et tâches va conduire au progrès.

Les efforts de normalisation des interfaces de capteurs, des procédures d'étalonnage et des formats de données peuvent réduire la complexité de l'intégration et faciliter le transfert de technologie entre les systèmes de recherche et de production.

Intégration à la planification et au contrôle de haut niveau

La plupart des recherches actuelles traitent la fusion de capteurs comme un problème de perception distinct de la planification et du contrôle en aval. L'intégration plus étroite entre la perception, la planification et le contrôle pourrait permettre une performance globale plus efficace du système en permettant aux exigences de planification d'influencer les stratégies de fusion et l'incertitude de fusion pour éclairer les décisions de planification.

Les approches d'apprentissage de bout en bout qui optimisent conjointement la perception, la planification et le contrôle constituent une orientation pour cette intégration, bien que des défis importants subsistent dans la formation de tels systèmes en toute sécurité et dans l'interprétation.

Conclusion

L'intégration de LIDAR avec des capteurs complémentaires grâce à des techniques de fusion sophistiquées est devenue essentielle pour une cartographie et une perception robustes dans de nombreuses applications. En combinant les mesures spatiales 3D précises de LIDAR avec la richesse sémantique des caméras, la capacité de tous les temps du radar, le suivi des mouvements de l'IMU, et le positionnement global des systèmes de fusion GPS, multicapteurs permettent d'atteindre des performances qui dépassent de loin ce que tout capteur peut fournir.

Le domaine a progressé de simples approches de fusion précoce à des architectures d'apprentissage approfondi sophistiquées qui peuvent combiner adaptativement les modalités de capteur basées sur le contexte et la fiabilité. Les systèmes de fusion modernes utilisent des techniques allant du filtrage classique Kalman aux architectures de transformateurs de pointe et modèles de diffusion, chacun avec des avantages spécifiques pour différentes applications et contraintes.

La réussite de la fusion des capteurs exige une attention particulière à la sélection, à l'étalonnage, à la conception d'algorithmes et à la validation des capteurs. Les défis liés à l'association des données, à la manipulation des défaillances des capteurs, au maintien des performances en temps réel et à la robustesse dans diverses conditions continuent de stimuler la recherche et le développement sur le terrain.

À mesure que les systèmes autonomes deviennent plus répandus dans les domaines du transport, de la robotique, de l'agriculture et des applications industrielles, l'importance de la fusion fiable des capteurs ne fera qu'augmenter.

Pour les praticiens qui souhaitent mettre en œuvre des systèmes de fusion de capteurs LIDAR, la clé est de comprendre les forces et les limites complémentaires des différents capteurs, de choisir des architectures de fusion adaptées aux exigences et aux contraintes d'application, d'investir dans l'étalonnage et la validation précis, et de concevoir des systèmes avec robustesse et maintenabilité à l'esprit.

Pour plus d'informations sur la technologie et les applications LIDAR, consultez la American Society for Photogrammetry and Remote Sensing. Pour explorer les systèmes autonomes de perception des véhicules, voir les ressources de SAE International. Pour les applications robotiques, la IEEE Robotics and Automation Society[ fournit des ressources techniques précieuses.