Table of Contents
Introduction aux réseaux neuronaux profonds dans l'interaction homme-machine
Les réseaux neuronaux profonds (RND) représentent une classe d'architectures d'apprentissage automatique modélisées de façon souple sur les structures neuronales des cerveaux biologiques.Depuis la résurgence de l'apprentissage profond au début des années 2010, les RDN ont entraîné des progrès transformatifs dans l'interaction homme-machine (HMI). En permettant aux systèmes d'apprendre les représentations hiérarchiques directement à partir de données brutes, les RDN ont permis aux machines d'interpréter le langage parlé et les gestes physiques avec une précision sans précédent.
Les formes d'ondes audio, les cadres vidéo et les données de capteurs de profondeur contiennent tous des modèles temporels et spatiaux complexes que les caractéristiques traditionnelles de fabrication artisanale ont du mal à capturer.Avec des architectures profondes comprenant des dizaines ou même des centaines de couches, les DNN modernes peuvent automatiquement apprendre des représentations robustes qui généralisent les haut-parleurs, les environnements et les variations des utilisateurs. Cet article explore les deux piliers de l'ICM&mdash alimenté par DNN; la reconnaissance automatisée de la parole et de la reconnaissance des gestes— et examine comment ces technologies convergent pour créer des systèmes d'interaction véritablement multimodales.
Reconnaissance automatisée de la parole (ASR)
Les systèmes ASR convertissent les signaux sonores en texte. L'avènement de l'apprentissage profond a considérablement amélioré les performances de l'ASR, abaissant les taux d'erreur de mots à des niveaux de parité humaine dans des domaines spécifiques.
Architectures profondes pour la modélisation acoustique
Les systèmes ASR de réseau de neurones profonds ont remplacé les modèles de mélange gaussien par des DNN de modélisation acoustique. Ces réseaux prennent des cadres de fonctions audio (comme les coefficients ceptral de fréquence mél) comme probabilités d'entrée et de sortie sur les états phonèmes dépendants du contexte. L'introduction de réseaux neuronaux convolutionnels (CNNs) améliore encore l'extraction des fonctionnalités en apprenant les modèles locaux invariants de changement dans le domaine spectral.
Les réseaux neuronaux récurrents (RNN), particulièrement les longues unités de mémoire à court terme (LSTM) et les unités de répétition sécurisées (GRU), sont devenus le cheval de bataille de l'ASR parce qu'ils peuvent modéliser les dépendances séquentielles de longueur variable. Les RNN bidirectionnelles entrent en avant et en arrière, donnant ainsi au système accès au contexte futur.
L'architecture de transformateur , développée à l'origine pour la traduction automatique, a largement supplanté les RNN dans l'ASR de pointe. Les transformateurs s'appuient sur des mécanismes d'auto-attention qui pèsent sur l'importance de chaque étape de temps par rapport à chaque étape de temps, permettant un traitement parallèle et une modélisation de dépendance à longue distance supérieure.
Pipelines ASR de bout en bout
Les systèmes ASR traditionnels comprennent des modèles acoustiques, linguistiques et prononciation séparés formés indépendamment. Les approches de bout en bout effondrent ces composants en un seul réseau neuronal formé directement sur des paires audio-texte. Il existe trois architectures de bout en bout prédominantes :
- Classification temporelle connectique (CTC): Introduit une étiquette vide pour permettre au modèle de produire des séquences de longueur arbitraire. CTC est utilisé dans DeepSpeech et de nombreux systèmes ASR intégrés.
- RNN Transducteur (RNN-T)[: Prolonge la CCT avec un réseau de prédiction qui modélise les dépendances, permettant la diffusion en continu sans avoir besoin de la pleine expression.
- Encodeur-décodeur basé sur l'attention (Écoute, Assiste et Spell)[: Utilise un mécanisme d'attention pour aligner les états audio de l'encodeur avec les caractères de sortie. Cette architecture excelle à la transcription longue, mais est plus difficile à déployer dans les paramètres à faible latence.
Applications pratiques et systèmes de référence
Au-delà des assistants virtuels, ASR permet le sous-titrage automatique sur YouTube, la transcription en temps réel dans les soins de santé, la navigation vocale dans les automobiles et le logiciel de dictée pour l'accessibilité. En 2023, le test de référence LibriSpeech a signalé des taux d'erreur de mots inférieurs à 2% à l'aide de modèles de Transformer d'ensemble, tandis que le jeu de données de dîners de terrain CHiME-6 plus difficile voit encore des taux supérieurs à 30%, soulignant le gap restant pour la parole bruyante et se chevauchant.
Principaux défis de la réforme de la sécurité sociale
- Diversité de l'accent et du dialecte: Les DNN ont besoin de grands corps de formation diversifiés pour manipuler les variétés régionales.
- La robustesse sonore: Les sons de fond, la musique et la réverbération dégradent les performances. Les techniques comme l'entraînement multi-conditions, les front-ends d'amélioration de la parole et l'apprentissage des fonctionnalités invariantes de bruit sont des domaines actifs.
- Couverture linguistique: Plus de 7 000 langues existent dans le monde, mais seulement quelques dizaines d'entre elles possèdent des données suffisantes pour former des ASR de haute qualité.
- Coûts informatiques: Les modèles de gros transformateurs nécessitent plusieurs GPU pour l'inférence. La compression, la quantisation et les accélérateurs matériels des modèles (p. ex., Google’s TPU, Apple’s Neural Engine) permettent le déploiement sur les appareils.
Pour un aperçu complet des techniques modernes de RSA, les lecteurs peuvent consulter le sondage de Nassif et al. dans IEEE Access (DOI: 10.1099/ACCESS.2019.2942026.
Technologies de reconnaissance des gestuelles
La reconnaissance de la gestuelle permet aux machines d'interpréter les mouvements du corps humain et les mouvements de la main, les mouvements des bras, les clins d'oeil ou les poses de corps entiers et les mouvements de la tête, comme commandes ou entrées.
Reconnaissance visuelle des Gestes avec les CNN et les CNN 3D
La méthode la plus courante utilise un réseau neuronal convolutionnel (CNN) pour classer les gestes statiques à partir d'images RGB simples. Les systèmes comme le cadre MediaPipe de Google utilisent des CNN légers basés sur MobileNetV3 pour la détection de repères de gestes et la classification des gestes à la main en temps réel sur les appareils mobiles. Pour les gestes dynamiques (p. ex., swips, pinches ou ondulation), un seul cadre est insuffisant. 3D CNN prolonge le fonctionnement de la convolution dans la dimension temporelle, le traitement de courts clips vidéo pour capturer les motifs de mouvement.
De nombreux systèmes modernes adoptent un pipeline en deux étapes : premièrement, un 2D ou un estimateur de pose 3D extrait les coordonnées des points-clés (par exemple, les articulations de la main, le squelette corporel), puis un classificateur séquentiel tel qu'un LSTM ou Transformer interprète les trajectoires des points-clés. Cette approche basée sur le squelette réduit considérablement la dimensionnalité des entrées et fournit une invariance au fond et à l'éclairage.
Reconnaissance de la Gesture par capteur
Au-delà des caméras, la reconnaissance gestuelle peut tirer parti des capteurs de profondeur (Microsoft Kinect, Intel RealSense), radar (Google Soli) ou des unités de mesure inertielles portables (IMU). Les capteurs de profondeur fournissent des nuages de point 3D qui peuvent être traités avec des CNN 3D ou des réseaux pointus comme PointNet. Les systèmes à base de radar, comme Soli, utilisent des signatures micro-Doppler codées en spectrogrammes et classées par CNNs—permettent la détection gestuelle par le tissu ou dans des conditions de faible luminosité.
Applications dans les industries
- Réalité virtuelle et augmentée: Le suivi manuel dans Oculus Quest et HoloLens utilise des CNN sur des flux de caméras stéréo pour une interaction naturelle.
- Gaming: Le Nintendo Switch Joy-Con et Sony PlayStation Move utilisent des capteurs d'inertie pour le contrôle en mode mouvement.
- Reconnaissance de la langue des signes: Les systèmes utilisant des GNN ou des Transformateurs à base de squelettes peuvent traduire l'American Sign Language (ASL) en texte ou en discours.
- Automotive: Les caméras en cabine surveillent les gestes du conducteur pour contrôler les systèmes d'infodivertissement sans mains et détecter la somnolence.
- Santé[ : Les systèmes aident la physiothérapie en suivant les exercices de réadaptation, en fournissant des commentaires en temps réel sur la justesse des mouvements.
Pour un examen approfondi de l'apprentissage profond pour la reconnaissance des gestes, voir le travail de Kormouschev et de ses collègues dans le Journal of Machine Learning Research ( Lien PDF.
Intégration multimodale: Unification du discours et de la gestuelle
Dans la communication naturelle humaine, la parole et le geste sont étroitement liés. Pointer tout en disant “la mettre ” ou le houppier tout en répondant “yes” sont des exemples communs. Les systèmes multimodal qui fusionnent des signaux audio et visuels peuvent obtenir une plus grande précision et une interaction plus naturelle que les approches unimodales seules.
Stratégies de fusion
- Fondation précoce: Les caractéristiques brutes ou quasi-bruts des deux modalités sont concaténées avant d'entrer dans un réseau commun.Cela permet au modèle d'apprendre les interactions modales dès le départ mais risque de dominer une modalité sur l'autre.
- Fusion intermédiaire : Les encodeurs séparés extraient les représentations pour la parole et le geste, et elles sont ensuite combinées (par exemple, par concaténation ou attention) avant le classificateur final.
- Fusion tardive : Deux classificateurs produisent des prédictions indépendantes, qui sont fusionnées par une règle de décision (p. ex., moyenne pondérée).
- Une attention modale de type brutal: Les architectures basées sur les transformateurs peuvent calculer l'attention sur les modalités, permettant au modèle de s'occuper des caractéristiques gestuelles lorsque le signal de la parole est ambigu et vice versa.
Exemple : Assistants virtuels multimodals
Les systèmes embarqués fusionnent de plus en plus la voix et le regard de façon à dire “ montrer de l'information sur ce building” tout en regardant un point de repère déclenche les données pertinentes. Des prototypes de recherche comme le MIT “Multimodal Deep Neural Network for Human-Robot Interaction” intègrent l'ASR, la reconnaissance des gestes et l'analyse de l'expression faciale pour permettre aux robots de suivre des instructions complexes.
Un cas notable est le ASR multimodal de bout en bout pour le dialogue humain-robot publié dans IEEE Robotics and Automation Letters (DOI: 10.1099/LRA.2021.3065195. Le système utilise une fusion tardive de la parole et du geste (d'une caméra de profondeur) pour résoudre des ambiguïtés comme “there” ou “quo; et a obtenu une réduction relative de 12 % des erreurs de compréhension de commande par rapport à la seule parole.
Défis et orientations futures
Malgré des progrès rapides, plusieurs obstacles subsistent avant que l'IMH multimodale ne devienne omniprésente.
Rareté et annotation des données
Bien que les données de la parole soient relativement abondantes pour les langues principales, les ensembles de données de gestes sont plus petits et moins normalisés. Les ensembles de données multimodales combinant des informations de la parole, du geste et de la scène contextuelle synchronisées sont rares. L'apprentissage autosupervisé et préformation sur des données non marquées (p. ex., prédiction masquée pour la parole et l'apprentissage contrasté pour la vidéo) offrent un chemin pour atténuer les coûts d'étiquetage.
Personnalisation et adaptation
Les systèmes futurs devront effectuer une adaptation de quelques images ou une seule image pour les utilisateurs individuels, peut-être par méta-apprentissage ou par réglage fin sur des données personnelles minimales. L'apprentissage sur l'appareil préserve la vie privée, mais doit faire face à une puissance de calcul et de batterie limitée.
Contraintes de latence et de temps réel
Pour les applications comme la conversation, la conduite autonome ou le contrôle de jeu, la latence doit être bien en dessous de 100 millisecondes. Les modèles de flux ASR (p. ex. RNN-T, attention monotonique) et les modèles de gestes légers (p. ex. MobileNet, EfficientNet) sont maintenant standard, mais la fusion multimodale ajoute des frais généraux de calcul. La taille, la quantification et la distillation des connaissances seront essentielles pour déployer des systèmes multimodaux complets à la périphérie.
La robustesse du changement de domaine
Pour l'ASR, les techniques d'adaptation de domaine comme l'alignement des couches CORAL ou l'aide de dé-correlation de caractéristiques antagonistes. Pour la reconnaissance des gestes, la randomisation du domaine pendant l'entraînement (horizons variables, éclairage, angles de caméra) améliore la généralisation. L'adaptation du temps de test est une tendance émergente où les modèles ajustent leurs propres paramètres à la volée pour correspondre à la distribution entrante.
Considérations éthiques et de protection de la vie privée
Les systèmes futurs devraient prioriser le traitement sur appareil et veiller à ce que les flux audio/vidéo bruts soient traités de façon éphémère sans transmission de nuage. De plus, les biais dans la formation des données (p. ex. sous-représentant certains accents, genres ou cultures) peuvent conduire à des performances inégales.
Conclusion
Des réseaux neuronaux profonds qui ont fondamentalement remodelé la reconnaissance automatique de la parole et des gestes, permettant aux machines d'écouter et de voir de façon scientifique il y a une décennie seulement. De l'ASR basée sur les transformateurs à la précision quasi humaine aux modèles de gestes basés sur les squelettes permettant un contrôle sans contact, ces technologies sont tissées dans l'électronique grand public, les soins de santé, l'automobile et la robotique. L'avenir se situe dans une intégration multimodale transparente qui respecte les différences individuelles et fonctionne avec robustesse dans des conditions réelles.