Table of Contents
מבוא ל-Deep Neural Networks in Human-Machine Interaction
רשתות עצביות עמוקות (DNNs) מייצגות שיעור של ארכיטקטורות למידת מכונה, אשר עוצבו באופן חופשי על המבנים העצביים של המוח הביולוגי.מכיוון שהתחדשות הלמידה העמוקה בתחילת 2010s, DNNs הניעו התקדמות טרנספורמטיבית באינטראקציה אנושית-מכונה (HMI) על ידי כך שמערכות מאפשרות ללמוד ייצוגים היררכיים ישירות מהנתונים הגולמיים, DNN הפכו את זה אפשרי לפירוש מכונות טבעיות וצלילות לא פחות או יותר, הן רק לממשקים, כלומר, הן לא פחות או יותר, הן יכולות פיזיות, הן לא פחות מדויקות, אלא רק יכולות לא פחות או יותר מאשר יכולות פיזיות, אלא גם יכולות לא מדויקות, אלא גם יכולות לא מדויקות, הן יכולות אחרות.
היתרון העיקרי של DNNs ב HMI הוא ביכולת שלהם מודל מורכב, מערכות יחסים לא לינאריות בזרמים חושיים רב-ממדיים. Audio Waveforms, מסגרות וידאו, ונתוני חיישן עומק מכילים תבניות temporal ומרחביות מורכבות כי תכונות מסורתיות בעלות יד נאבקות ללכוד. עם ארכיטקטורות מרובות כולל עשרות או אפילו מאות שכבות, DNN מודרניים יכולים ללמוד באופן אוטומטי ייצוגים חזקים כי הם זיהוי כללי וגילויי תקשורת, 2.
הכרה אוטומטית בדיבור (ASR)
מערכות ASR להמיר אותות דיבור אקוסטיים לטקסט.ההופעת של למידה עמוקה שיפרה באופן דרמטי את ביצועי ASR, הורדת שיעורי שגיאה מילה לרמות של שוויון אנושי בתחומים ספציפיים. Today ’ מנועים ASR המסחריים ממנף טווח של ארכיטקטורות DNN כדי להתמודד עם סביבות רועשות, מבטאים מגוונים, ומגבלות עיבוד בזמן אמת.
אדריכלות עמוקה למודלים אקוסטיים
מערכות ASR מבוססות רשת עצביות עמוקות החליפו מודלים של תערובת גאווססית עם DNNs עבור מודלים אקוסטיים.רשתות אלה לקחת מסגרות של תכונות אודיו (כגון mel- ⁇ cepstral coefficients) כמו קלט ופלט פרוספקפטיים על פני מדינות טלפון תלויות הקשר.המבוא של רשתות עצביות FLT:0convolutional (CNN)LTF1s) משופר על ידי מיצוי מחדש של רשתות למידה מקומיות.
(FLT:0) רשתות עצביות חוזרות ונשנות (RN) ,RN) , במיוחד זיכרון לטווח קצר ארוך (LSTM) יחידות ויחידות חוזרות שערו (GRUs), הפכו לסוס העבודה של ASR כי הם יכולים מודל של תלות משתנה באורך זמן (Squential quential s) בתהליך קלט קדמית ומאחורי הקלעים, נותן את הגישה להקשר עתידי, אך הוא סובל מאימונים יקרים מאוד מרצף גבוה.
האדריכלות הטרנספורמטיבית (FLT:0) של Transformer ArchitectFLT:1, שפותחה במקור לתרגום מכונה, שוללה בעיקר RNs ב-state-of-the-art ASR. Transformers מסתמכים על מנגנונים בעלי כוונות עצמיות שמשקלו את החשיבות של כל צעד נגד כל צעד אחר צעד, המאפשר עיבוד מקביל ומודלים ארוכי טווח גבוה יותר של VO2ec 2.0, והשגת שימוש משמעותי ב-AI-Ed על פני אפס-uptt-upt-upt-upt-upt-upt-upt-upt-D-D פתוח עם ביצועים בלתי-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-D-קודמתאמן-D-D-קודמתאמת-קודמתאמתי-קודמתאמת-קודמתאמתי-קודמתאמתי
סוף סוף ASR Pipelines
מערכות ASR מסורתיות כללו מודלים אקוסטיים, שפה, והיגוי שהוכשרו באופן עצמאי.ה גישות קצה-לקצה ממוטטות את הרכיבים האלה לרשת עצבית יחידה שהוכשרה ישירות על זוגות אודיו-לטקסט.
- (FLT:0)Connectionist Temporal Classification (CTCIRLT) 1:1: מציג תווית ריקה כדי לאפשר את המודל לתפוקה של רצף של אורך שרירותי.CTC משמש עמוקSpeech ומערכות ASR משובצות רבות.
- (FLT:0)RNN Transducer (RN-Trea)FLT:1: Extends CTC עם רשת חיזוי כי מודלים תוויות תלויות, המאפשר הזרמת ASR ללא צורך באמירות מלאה. Google ’s עוזר ורבים על-device ASR מנועים להשתמש RN-T.
- (FLT:0) encoder-decoder (שמע, נוכחות וכישוף)Esve)FLT:1: מעסיק מנגנון תשומת לב כדי ליישר את מדינות קוד אודיו עם דמויות פלט.אדריכלות זו עולה בתעתיק ארוך-form אבל קשה יותר לפרוס בהגדרות בעלות נמוכה.
יישומים מעשיים ו- Benchmark Systems
ASR מודרני הוא ubiquitous. Amazon ’ אלכסה, Apple ’s Siri, Google assistant, ו- Microsoft ’ Cortana כל להסתמך על ASR עצבי עמוק מעבר לעוזרים וירטואליים, ASR Power באופן אוטומטי כיפוף ב- YouTube, מתיל בזמן אמת ב-Time , ניווט מבוקר קולי ברכבים, ותוכנה ל נגישות ב-2023, הפונקציה LiSFcleCen-R רואה יותר מ-Rate נתונים של 26% מעל ל-Rateerpcuppcuppcuppcupit, בעוד שדווחו-2% יותר מ-Cuppcuppcupp-Cupit-Cupitance, בעוד שדווח על ידי מודלים מאתגר יותר מ-Cupp-2% יותר מ-Cupp-Cupp-Cupp-Cupp-Cupp-CDC-Cupp-Cupp-Cupp-Cupp-upp-Cupp-Cupp-Cupp-Cupp-C, בעוד שדווחו-Cupp-2% יותר מ-Cate, בעוד שדווחו-I-C
אתגרים מרכזיים ב-ASR
- (FLT:0) וריאציות דיאלקטיות ו- DNNs זקוקים לקורפוס הכשרה גדול ומגוון כדי לטפל בזנים אזוריים.כוונון עדין עם כמויות קטנות של נתונים מודגשים עוזר אך הוא לעתים קרובות לא מעשי.
- (FLT:0) Noise EnvesFLT:1: קולות רקע, מוזיקה, ושיקום ביצועים מדרגת שוליים.טכניקות כמו אימון רב-תנאי, שיפור דיבור לפניות, ולמידה של רעש הם אזורים פעילים.
- (FLT:0) סיקור הכיסוי של TLVuage (FLT:1: מעל 7,000 שפות קיימות ברחבי העולם, אך רק כמה עשרות יש מספיק נתונים כדי להכשיר גישות בעלות על עצמי ולמידה של מעבר בין-לשוני מבטיח.
- (FLT:0) חישוביות עלות גבוהה של LT:1: מודלים גדולים של Transformer דורשים מספר GPUs עבור הדחיסה מודל, לכמת, ו מאיצים חומרה (למשל, Google ’s TPU, Apple ’s Neural Engine) מאפשרים פריסה על-ידי device.
עבור סקירה מקיפה של טכניקות ASR מודרניות, הקוראים יכולים להתייעץ עם הסקר על ידי Nasif et al. ב IEEE Access (FLT:0DOI: 10.1109/ACCESS2019.2926262603FLT:1).
טכנולוגיות לזיהוי
הכרה בGesture מאפשרת למכונות לפרש תנועות גוף אנושיות ו-mdash; מחוות יד, תנועות זרוע, נוודים ראש, או תנוחות גוף מלאות; כמו פקודות או קלטות. רשתות עצביות עמוקות אפשרו סיווג חזק, בזמן אמת מהזנת המצלמה, חיישנים עומק, ועובי לבוש, פתיחת פרדיגמות שליטה ללא מגע.
זיהוי חזותי של GSture עם CNN ו- 3D CNN
הגישה הנפוצה ביותר משתמשת ברשת עצבית (CNN)FLT:1 כדי לסווג מחוות יד סטטיות מתמונות RGB יחיד.מערכות כמו מסגרת MediaPipe על ידי גוגל להעסיק MobileNetV3 מבוסס CNN עבור ציוני דרך בזמן אמת וגילוי ומחווה על מכשירים ניידים.
(ב) , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
זיהוי מבוסס חיישן
מעבר למצלמות, זיהוי מחווה יכול למנף חיישנים עומק (Microsoft Kinect, Intel RealSense), מכ"ם (Google Soli), או יחידות מדידה לא רצויות (IMUs) לספק ענני נקודה 3D שניתן לעבד עם 3D CNN או רשתות חכמות נקודה כגון PointNet. Radar-MU, כגון Soli, להשתמש בחתימות מיקרו-Dopplers מקודדות לתוך ספקטרום וסווג על ידי תנועות חכמות (Ixic) באמצעות תנועות מכוונות ל-cos) ו-co-co-co-co-cos (מסוגמותרפיות) הן לעתים קרובות; שימוש ב-cogicial) באמצעות תנועות חכמות (Ixed) ו-co-coretial) באמצעות תנועות (מסוגמותרפיות) ו-co-co-co-co-co-co-co-co-co-Ratching) הן לעתים קרובות; שימוש בתנועות חכמות (מסוגיות (מסוגיות (מסוגמותרפיות) הן לעתים קרובות; שימוש בתנועות חכמות (מסוגמותרפיות) באמצעות תנועות חכמות (מסוג של , כגון: Ixed) ו-co-co-Ratcher) ו-Ratcher)
יישומים בתעשיות
- (FLT:0) וירטואלי והגדילה מציאות: מעקב אחר Oculus Quest ו HoloLens משתמש ב-CNN על הזנת מצלמה סטריאו עבור אינטראקציה טבעית.
- (FLT:0)GamingveFLT:1: Nintendo Switch Joy-Con ו-Sony Switch Switch מופעל חיישנים בלתי חוקיים לשליטה מבוססת תנועה.
- (FLT:0Sign Language Recognize FLT:1): מערכות באמצעות GNNs מבוסס של השלד או Transformers יכולות לתרגם את שפת הסימנים האמריקנית (ASL) לטקסט או דיבור.הפופולריות הפופולרית ASL-lexicon Dataset ומודלים כמו Sign דוחקים דיוק מעל 90% על סימנים מבודדים, אם כי הכרה ברמת המשפט מתמשכת נותרה מאתגרת.
- (ב) [ה]:0] מנוע מנועים (AutomotiveFLT:1: מצלמות In-cabin לפקח על מחוות הנהג עבור שליטה ללא ידיים על מערכות מידע וזיהוי ריקנות.
- (FLT:0)HealthcareveFLT:1: מערכות מסייעות לטיפול פיזי על ידי מעקב אחר תרגילי שיקום, מתן משוב בזמן אמת על תיקון התנועה.
עבור סקירה מעמיקה של למידה עמוקה עבור הכרה מחווה, ראה את העבודה על ידי Kormushev ועמיתיו ב- Journal of Machine Learning Research (FLT:0PDF linktureFLT:1).
אינטגרציה רב-ממדית: איחוד דיבור וג'ים
בתקשורת האנושית הטבעית, הדיבור והמחווה הם בעלי חשיבות רבה בעת אמירת וולדקו; הניחו אותו שם ” או מבלי להתמסר בזמן שתשובה וולדקו; כן ” הם דוגמאות נפוצות. למערכות מרובותמודולליות שממזגות אודיו ורמזים חזותיים יכולים להשיג דיוק גבוה יותר ואינטראקציה טבעית יותר מאשר גישות לא-מונאליות בלבד.
אסטרטגיות Fusion
- (FLT:0) מוקדם היתוך 1:1; Raw או ליד תכונות משני המודולים הם concatenated לפני הכניסה לרשת משותפת.זה מאפשר המודל ללמוד אינטראקציות בין-ממדיות מההתחלה אבל סיכונים השולטים על אחד המודוליות על השני.
- (FLT:0) התחדשות בינונית (FLT:1): מפיץ קודים נפרדים ייצוגים לדיבור ולמחווה, ואלה משולבים מאוחר יותר (למשל, על ידי התכנסות או תשומת לב) לפני המגדיר הסופי.זוהי האסטרטגיה הנפוצה ביותר וההיתר באמצעות רכיבים לא מאומנים מראש.
- (ב) [ה]: שני מחוקקים מייצרים תחזיות עצמאיות, אשר מתמזגות על ידי כלל החלטה (למשל, ממוצע משקל).
- (FLT:0Cross-modal AttentionFLT:1): אדריכלות מבוססת Transformer יכולה לשים לב על פני שיטות, ומאפשרת למודל להשתתף בתכונות מחווה כאשר אות הדיבור הוא מעורפל ולהיפך.
המונחים: Multimodal VirtualVirtual assistants
Apple ’ סירי על אייפון יכול לשלב פקודות קוליות עם מחוות מגע על המסך (למשל, “call מסעדה זו ” תוך כדי לחיצה על רשימה) מערכות בתוך-העצמיות יותר ויותר ממזגות קול ומבט למעקב כך אומר “ להציג מידע על בניין זה ” תוך התבוננות ציוני דרך של נתונים רלוונטיים, כגון: Abbo-Ab-Ab-Fal Analytics ו-Ab-Ab-Fal Analytics, לאחר מכן, לאחר מכן, זיהוי של תקשורת מורכבת; , NCTFal; , NCTVal; , NCTD; שילוב של תקשורת עם זיהוי פנים; , NCTOb-Fed; , NCTFal; , , NCTOSTD; , , , , , , , , , , , , , NCTD.comD.comdquo; , מעקב אחר הוראות למידה של תקשורת עם , , , NCTO , , , , , , , , , , , NCT
אחד המקרים הבולטים הוא The End-to-End Multimodal ASR for Human-Robots הדיאלוגFLT:1 שפורסם ב- IEEE Robotics ו- Automation Letters (ראה:2DOI: 10.1109/LRA.2021.30695FLT 3: 3) המערכת משתמשת במיזוג מאוחר של דיבור ומחווה (ממצלמת עומק) לפתרון ambiities & aquoalquo; 1 ו-quo-quo-quo-up; 1; 1 ו-updus-updus-upaldus; 1; 1; 1 ו-quo-quo-III) לעומת 1; 1; 1; 1; 1 ו-quo-quo-quo-quo-quo-quo-quo-quo-updus-updus-quo-quo-quo-quus-quus-quus; 1; 1; 1; 1 (ב-quo-quo-quo-quus-quus-quo-quus-quo-III) לעומת פיזור ו-updus-quo-updus-quo-dus-updus-
אתגרים וכיוונים עתידיים
למרות התקדמות מהירה, כמה מכשולים נותרו לפני חלק גדול מאוד HMI הופך להיות כלוביקוויטי.
מחסור בנתונים ואינטואיציה
(הופנה מהדף ASR ו-מחווה הכרה דורש נתונים גדולים מתוייגים, בעוד שנתוני דיבור הם בשפע יחסית עבור שפות גדולות, נתונים מחוות הם קטנים ופחות סטנדרטיים. ⁇ ⁇ ⁇ ⁇ דיבור מסונכרן, מחווה, ומידע סצינה קונטקסטואלית הם נדירים.FLT:0Sel-supervised LearningFLTFalrated ו-Freave:2Finting וידאו:
התאמה והתאמה
שינויים ספציפיים של המשתמש בדיבור (חשבון, קצב דיבור) ומחווה (אורך הזרוע, רדיוס תנועה מועדפת) ביצועים של מודלים גנריים.מערכות עתידיות יצטרכו לבצע FLT:0few-shot או one-shot הסתגלות הסתגלות 1 עבור משתמשים בודדים, אולי באמצעות מטא-learning או כוונון עדין על נתונים אישיים מינימליים.
שקיפות וזמן אמת
עבור יישומים כמו שיחה, נהיגה אוטונומית או שליטה במשחק, השקיפות חייבת להיות גבוהה מתחת 100 מילישניות.סטרימינג מודלים ASR (למשל, RN-T, תשומת לב מונוטונית) ומודלים של מחווה קלה (למשל, MobileNet, EfficientNet) הם כעת סטנדרטיים, אך רב-ממדי היתוך מוסיף חישוב מעל פני.
המונחים: domain Shift
מודלים שהוכשרו בסביבה אחת (למשל, סטודיו, מעבדה) מידרדרים בעולם האמיתי.עבור ASR, שיטות עיבוד דומיין כמו היערכות של שכבת קוריאל או תכונות סטיות של דה-קורלציה.עבור הכרה במחווה, FLT:0domainizationFLT:1 במהלך אימון (רקע מתמשך, תאורה, זוויות) משפר את ההכללה.
שיקולים אתיים ופרטיים
תמיד על מיקרופון ומצלמות להעלות את החששות הפרטיות.מערכות עתידיות צריכות להעדיף את עיבוד ה-FLT:0on-device עיבוד FLT:1 ולהבטיח כי זרמי אודיו / וידאו מעובדים ללא שידור ענן.בנוסף, הטיות בנתוני אימון (למשל, ייצוג מבטאים מסוימים, מגדרים או תרבויות) יכולות להוביל לביצועים בלתי שוויוניים.
מסקנה
רשתות עצביות עמוקות יש ביטוי אוטומטי בצורת והכרה בתנועה, המאפשר מכונות להקשיב ולראות בדרכים שהיו מדע בדיוני רק לפני עשור. מ-ASR מבוסס רובוטר להשיג דיוק אנושי קרוב למודלים המבוססים על השלדטון המאפשרים שליטה ללא מגע, טכנולוגיות אלה ממשיכות להיות זורקות לאלקטרוניקה צרכנית, בריאות, רכב ורובוטיקה.