İnsan-Makine Etkileşiminde Derin Neural Ağlara Giriş

Deep sinir ağları (DNNs) bir makine öğrenme mimarisi sınıfını temsil eder, doğrudan çiğ veriden dolayı DNNs, dil ve fiziksel yeteneklerin ilk 2010'larda yorumlanması için mümkün kıldı. Bu yetenekler sadece artımlı gelişmeler değildir; daha önce sezgisel, duyarlı ve doğal görünen arayüzler için temelsel olarak tasarlanmıştır.

HMI'deki DNN'lerin temel avantajı, onlarca veya yüzlerce katman içeren derin mimarlıkları ile, modern DNN'ler otomatik olarak konuşmacılar, ortamlar ve kullanıcı varyasyonları ile ilgili olarak bu makale, DNN-güçlü HMI&mdash'in iki sütununu inceler; konuşma ve tanıma ve yorumlama ile ilgili derin tasarımlarla mücadele eder; bu teknolojileri gerçekten de bu teknolojileri çok sayıda konuşmacılar, ortamlar ve kullanıcı etkileşimini inceleyebilir.

Otomatik Konuşma Tanımlaması (ASR)

ASR sistemleri akustik konuşma sinyalleri metin haline getirir. Derin öğrenmenin gelişi dramatik bir şekilde ASR performansını geliştirdi, belirli alanlarda insan parite seviyelerinin düşüklüğüne doğru bir kelime hatası oranları.Bugün’ ticari ASR motorları, DNN mimarisinin bir yelpazesini gürültülü ortamlar, çeşitli aksanları ve gerçek zamanlı işleme kısıtlamalarıyla ele almak için kullanmaktadır.

Aoustic Modeling için Derin Mimarlıklar

Erken derin sinir ağı tabanlı ASR sistemleri Gaussian karışım modellerini yemleme ile değiştirdi (CNNs))[Döneticileri) [CNNs))[Döneticileri)[Döneticileri / iletişimleri) · giriş ve çıkış noktalarında anlık dinamikleri kullanarak daha iyi gelişmiş özellikler.

[FONT:0) Mevcut sinir ağları (RNNs)), özellikle uzun kısa süreli bellek (LSTM) birimleri ve kapılı recurrent birimleri (GRUs), ASR'nin çalışmalarından dolayı değişken uzunlukta değişkenliklere sahip olabilirler. Biy RNNs süreci her iki ileri ve geriye doğru, sistem erişimini gelecekteki bağlamda verir.

[FONT=0)Transformer mimarisi[Dönetici:0], makine çevirisi için geliştirilmiş olan, muhtemelen Wav2Vec 2.0 gibi, HuBERT ve Whisper OpenAI kullanımı Transformer encoders her zaman adıma karşı her zaman adımın önemini ölçmüş, paralel işleme ve uzun vadeli bağımlılık modellemeye olanak sağlayan.

End-to-Bit ASR Boruları

Geleneksel ASR sistemleri ayrı akustik, dil ve telaffuz modelleri bağımsız olarak eğitilmiştir. End-to-end yaklaşımlar bu bileşenleri doğrudan sesli metin çiftlerinde eğitilmiş tek bir sinir ağına çökertme. Üç ağırlıklı son mimari var:

  • [FONT=0)Bağlantıcı Temporal Sınıf (CTC))[değiştir | kaynağı değiştir], modelin rastgele uzunluktaki sıralarını yayınlamasına izin vermek için boş bir etiket sunar. CTC DeepSpeech ve birçok gömülü ASR sistemlerinde kullanılır.
  • [FONT=0)RNN Transducer (RNN-T))[değiştir | kaynağı değiştir], ASR'yi tam olarak belirtmeksizin yayınlayabilmeli olan bir tahmin ağı ile genişletin.
  • [FONT:0)Attention-based encoder-decoder (Listen, Join, and Spell))[FONT=C)[FONT=Göneticileri, ses encoder durumlarını uzun süreli transkriptle eşleştirmek için bir dikkat mekanizmasına sahip olmak daha zordur.

Pratik Uygulamalar ve Benchmark Systems

Modern ASR, Amazon’s Alexa, Apple ’s Siri, Google Asistan ve Microsoft’s Cortana tüm derin sinirsel ASR. Sanal asistanlar, ASR güçleri otomatik olarak sağlık hizmetlerinde otomatik olarak sıralanırken, otomobillerde sesli-kontrollü navigasyonlar ve erişilebilirlik için yazılımlar % 2023'te, LibriSpeech testi-teprasyonel karşılaştırması, en zorlanan CHiME-6'nın üzerindeki hatalarının altında % 2'nin altında bildirilen hata oranlarına güvenir.

ASR'de Anahtar Meydanları

  • [FONT=0)Accent ve lehçe varyasyonu[DÜDÜT:1): DNNs bölgesel çeşitleri ele almak için geniş, çeşitli eğitimlere ihtiyaç duyar.Küçük miktar aksan veri yardımı ile iyileştirici, ancak genellikle pratik değildir.
  • [FONT:0] Katılık [[Dönetici: Arka plan sesleri, müzik ve tekrarlama dagrad performansı. Çok-şarkırlık eğitimi, konuşma geliştirme cepheleri ve gürültü-yan özelliği öğrenme aktif alanlardadır.
  • [FONT:0] Dil kapsamı[[Dönemli: 7] Dünya çapında 7.000 dil var, ancak sadece birkaç düzine yüksek kaliteli ASR. Self-kontrollü yaklaşımlar ve çapraz geçiş öğrenme umut verici.
  • [FONT:0)C ⁇ maliyeti[Dönem: Büyük Transformer modelleri, kontraksiyon için birden fazla GPU gerektirir. Model sıkıştırma, ölçümleme ve donanım hızlandırıcıları (örneğin Google’s Seiko, Apple’ Neural Engine) takip eden dağıtım dağıtımını sağlar.

Modern ASR tekniklerinin kapsamlı bir genel bakış için, okuyucular Nassif ve al. in IEEE Access ([Dönetici:0) tarafından yapılan araştırmaya başvurabilirler.([0).10109/ACCESS.2019.2942026[FLT]

Gesture Recognition Technologies

Gesture tanıma, makinelerin insan vücut hareketlerini yorumlayabilmelerine izin verir; el jestleri, kol hareketleri, kafa nods, ya da tam-body pozlar— komutlar veya girişler. Deep sinir ağları kamera yemleri, derinlik sensörleri ve giyilebilir kontrol paradigmaları ile sağlam, gerçek zamanlı jest sınıflandırmasına olanak sağlar.

Görsel Gesture CNNs ve 3D CNNs ile Tanınıyor

En yaygın yaklaşım, Google tarafından hafif MobileNetV3-based CNNs for real-time hand minute algılama ve jest sınıflandırma için [CNN)[Döneticileri sınıflandırmak için) için statik el jestlerini tek RGB görüntülerin sınıflandırmak için [FONTDD) için, tek bir çerçeve, Google tarafından işletilen hafif MobileNetV3-based CNNs[DDDd|Dd|Dd|Dd|Dd|D D D the D D D the D D D D D D FONT FONT

Birçok modern sistem iki aşamalı bir boru hattı benimsemektedir: ilk olarak, aİLFLT:0)2D veya 3D pozlama cihazı[D) önemli noktaları koordinatlar (örneğin, el eklemleri, vücut iskeleti), o zaman bir LSTM veya Transformer gibi bir sınıflayıcısı anahtar noktayı yorumlar.[G]Bu iskelet tabanlı yaklaşım büyük ölçüde giriş boyutlarını azaltır ve arka plan ve aydınlatmaya uygun hale getirir.

Sensöre Dayalı Gesture Recognition

Kameraların ötesinde, jim algılama derinlik sensörlerinden yararlanabilir (Microsoft Kinect, Intel RealSense), radar (Google Soli), veya CNNs&mdash tarafından kodlanabilir ve 3D CNN veya noktalı sistemlerle işlenebilir IMU'lar ve jimoskoplar ile sınıflandırılabilir; RNN'ler ve jiroskoplar ile sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık sık görülür.

Uygulamaları Across Industries

  • [FONT:0]Virtual ve artırılmış gerçeklik[DÜT:1): Oculus Quest ve HoloLens'te takip edilen Hand izleme, CNN'leri doğal etkileşim için kullanıyor.
  • [FONT:0)Gaming[DÜT:1): Nintendo Switch Joy-Con ve Sony PlayStation hareket temelli kontrol için uygun sensörleri çalıştırıyor.
  • [FONT=0) Dil tanıma[[[Dönetici tabanlı GNNs veya Transformers kullanarak sistemler Amerikan İşaret Dili (ASL) metin veya konuşma için tercüme edebilir.The popular ASL-lexicon dataset and models like SignBERT push doğruluk% 90'ın ötesinde, sürekli cümle düzeyindeki tanıma zorlukla karşı karşıya kalır.
  • [FONT:0)Automotive[[DÜT:1): In-cabin kameralar, bilgi sistemleri için sürücü jestlerini izler ve drowsiness algılayın.
  • [FONT:0)Sağlık bakımı[[DÜT:1): Sistem rehabilitasyon egzersizlerini takip ederek fiziksel terapiye yardımcı olur, hareket doğruluğu konusunda gerçek zamanlı geri bildirim sağlar.

Aklın tanıma için derin bir öğrenme için derin bir inceleme için, Kormushev ve meslektaşları tarafından Makine Öğrenme Araştırması Dergisi'nde ()PDF bağlantı).

Multimodal Entegrasyon: Konuşma ve Gesture

Doğal insan iletişiminde, konuşma ve jestler sıkıca çiftleşmiştir.Performe veldquo'ı söylerken; cevap veldquo'ya cevap verirken veya nodding var; genel örnekler. Multimodal sistemler, ses ve görsel cues'lar tek başına daha yüksek doğruluk ve daha doğal etkileşim elde edebilir.

Fusion Strategies

  • [FONT:0]Early füzyon[DÜDÜT:1): Her iki modadan gelen Raw veya yakın çizer ortak bir ağ girmeden önce konkatenjan edilir. Bu, modelin diğerinden bir modality öğrenmesine izin verir.
  • [FONT:0] Intermediate füzyon[Dönetici: Ayrı kodlayıcılar konuşma ve jest için temsiller çıkarır ve bunlar daha sonra bir araya gelir (örneğin, son sınıflandırıcı veya dikkat)
  • [FONT:0)Late füzyon[[DÜDÜT:1): İki sınıflayıcılar karar kuralı ile bir araya getirilen bağımsız tahminler üretir (örneğin, ağırlıkta ortalama).
  • [FONT:0]Cross-modal dikkat[[[Döneticiler): Transformer tabanlı mimariler, konuşma sinyali belirsiz ve tersi olduğunda jestlere katılma modeline izin verebilir.

Örnek: Multimodal Sanal Asistanlar

Apple’ Siri, ses komutlarını ekrandaki dokunuş jestleriyle birleştirebilir (örneğin, “ bu restoran ve isimko gibi bir dizi çizim; İnsan-Robot Interaction&rdquo için çok yönlü ağ; ASR, jest ve sağımdaki bilgileri kullanarak, robotların karmaşık talimatları takip etmesini sağlar.

Önemli bir durum, IEEE Robotics ve Otomasyon Mektuplarında ([Dönemli:2) yayınlanan,109/LRA.3065195[D][/Dönetici: 10/01/36] sistem konuşma ve jestliklerin ve anahtarlamalarının geç bir füzyonunu kullanır.

Meydanlar ve Gelecek Yollar

Hızlı ilerlemeye rağmen, çok yönlü HMI HMI'nin tamamen sorunsuz olması için birkaç engel kalır.

Data Scarcity ve Annotation

ASR ve jestin tanıma için sağlam DNN'ler büyük etiketli bir fiziksela ihtiyaç duyarken, konuşma verileri oldukça iyi durumda, jestler daha küçük ve daha az standartlaştırılmış. Multimodal veri setleri senkronize edilen konuşma, jest ve bağlamsal sahne bilgileri ile ilgili bilgi nadirdir. [...]0Kendini denetim altına almak için bir yol sunar.[Dönetmemiş verilerle ilgili olarak).[Döneticileri kontrol altına almak için).[Döneticileri kullanarak web sitesi hakkında bilgi sahibi olun.[tr|s.g., maskelenmiş bir video için tahmin)

kişiselleştirme ve Adaptasyon

Kullanıcıya özel değişiklikler (ses akışı, konuşma oranı) ve jest (ternasyon uzunluğu, tercih edilen hareket yarısı) genel modellerin performansının düşmesi gerekir. Future sistemleri sınırlı hesaplama ve batarya gücü ile olmalıdır.

Latency ve Real-Time Constraints

Konuşma, otonom sürüş veya oyun kontrolü gibi uygulamalar için, geç kalmışlık 100 milisans. Streaming ASR modelleri (e.g., RNN-T, monoton dikkat) ve hafif jest modelleri (e.g., MobileNet, VerimliNet) şu anda standarttır, ancak multimodal füzyon hesaplamalı yük.ENGT:0)Pruning, niceleştirme ve bilgi kesintisi[FLT, monotonluk dikkat)

Robustness to Domain Shift

Bir ortamda eğitim gören modeller (örneğin, stüdyo, laboratuar) gerçek dünyada bozuluyor. ASR için, KORAL tabakası hizalama veya geri dönüşüm gibi alan adaptasyon teknikleri), jest tanıma için, [[0|domain randomizasyon eğitim sırasında (varlık arka planları, aydınlatma, kamera açılarını) genelleştirmeyi geliştirir. ”

Etik ve Gizlilik

Her zaman mikrofonlar ve kameralar gizlilik kaygılarını yükseltmelidir. Future sistemleri önceliklendirmeli:0)on-device işleme[[Döneticiler) ve ham ses / video akışlarının bulut iletimi olmadan işlendiğini garanti eder. Ek olarak, eğitim verilerinin önyargıları (örneğin, belirli aksanları, cinsiyetleri veya kültürler) eşitsiz performansa yol açabilir. Fairness-aware modelleme eğitimi ve veri kümesi eğriliği devam eden gereklilikleri.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Deep sinir ağları temel olarak otomatik konuşma ve jest tanımayı yeniden şekillendirdi, makineleri dinlemek ve bilim kurgunun sadece on yıl önce olduğu şekillerde görmesini sağladı. Transformer-based ASR, dokunsuz kontrole olanak sağlayan yakın bir inovasyona sahip oldu, bu teknolojiler tüketici elektroniklerine, sağlık, otomotive ve robotikliğe yakın bir şekilde dokunulmaktadır.