עיבוד אותות דיגיטליים (DSP) הוא עמוד השדרה של עוזרי וירטואליים מודרניים ובוטים קוליים, המאפשר להם לשמוע, להבין, להגיב דיוק יוצא דופן.מ-Siri ו-Aams Alexa של Apple כדי לבוטים קוליים ארגוניים טיפול בשירות לקוחות, טכניקות DSP להפוך אודיו לנתונים הניתנים לפעולה, לסנן רעש סביבתי, ותשובות מדהימות טבעיות.זה מסביר את התפקיד של DSP בטכנולוגיה קולית, לבחון כיצד מיומנויות קוליות מתקדמות יותר, כיצד לספק חוויות DSP מתקדמות יותר, כדי לספק חוויות מחשבי זמן אמתיות ולמידה.

מה זה Digital Signal Processing ב- Voice Technology?

בגלי אודיו האנלוגיים הפשוטים ביותר שלה, עיבוד אותות דיגיטליים ממיר את גלי אודיו אנלוגיים – האותות האקוסיביים המתמשכים שנוצרו על ידי קול אנושי – לזרם של דגימות דיגיטליות דיסקרטיות.הדגימות הללו מתפעלות מתמטיות כדי לחלץ תכונות, להפחית את הרעש, ולהכין את האות לניתוח נוסף על ידי דגמי זיהוי דיבור.DSP כרוך בכמה שלבים קריטיים:

  • (FLT:0) דגימה והגדרה 1 (FLT:1), מה שהופך את גל השמע רציף לשורה של מספרים בקצב קבוע (למשל 16 kHz לקול) ומעט עומק (בדרך כלל 16 ביטים) כדי לשמור מספיק פרטים על הבנת דיבור.
  • (FLT:0)FiteringFLT:1 - יישום אלגוריתמים להסיר תדרים לא רצויים (למשל, מסננים נמוכים-pass כדי להסיר שלו גבוה) או לבודד את הלהקה התדירות שבה חיו נאומים אנושיים (ב-300 הרץ ל- 3.4 kHz).
  • (FLT:0) מיצוי חומרים (FLT:1) - תכונות מונעות כגון מל- ⁇ cepstral coefficients (MFCC) שלוכדות את המאפיינים האקוסטיים הייחודיים של דיבור תוך מחיקת מידע לא רלוונטי.
  • (ב) ⁇ :0) ,ההתמדה והנורמליזציה של ה- 1:1 ; כרך מכוונן, הסרת קליקים ופופים, ושווה את האות ליצירת קלט נקי ועקבי למנועי דיבור-לטקסט.

ללא DSP, הקלטה של מיקרופון גולמי יוכרד עם רעש רקע, התחדשות, וצלילות לא עקבית, מה שהופך אותו כמעט בלתי אפשרי עבור בוטים לפרש פקודות במדויק. DSP לכן פועל בתור קו ההגנה הראשון, אודיו לפני עיבוד לפני כל מודל למידה מכונה נוגע בנתונים.

יישומי מפתח של DSP ב-Virtual assistants ו- Voice Bots

1 רעש ניכוי ותיקון דיבור

אחת האפליקציות הגלויות ביותר של DSP בטכנולוגיית קול היא צמצום רעש.המכרים וירטואליים משמשים במטבחים, מכוניות, משרדים עסוקים ומרחבים ציבוריים, שכל אלה מלאים בצלילים מתחרים – טרף, שיחה, מכשירי מוסיקה.DSP כגון תת-קרקעית ספקטרלית, מסנן Wiener וביטול רעש אדפטי יכול להפחית את הרקע עד 20B תוך שמירה על איכות של דוברי הקול.

(ההתבויות המודרניות משלבות לעיתים קרובות DSP מסורתיים עם למידה עמוקה.לדוגמה, גישה ⁇ :0spectral gatingphingFLT:1 ראשית מנתחת את האות הרעה להעריך את רצפת הרעש, ואז משנה אותו מהספקטרום הכולל של מערכות מתקדמות יותר להשתמש ב-DVID:2re הנוכחי רשתות עצביות FLT 3:2re הנוכחי (RN) מאומנים על אלפי זוגות רועשים-קלים כדי לשפר את הדיבור האמיתי של ימינו.

2 ביטול

הד אקוסטי מתרחש כאשר פלטו של עוזר וירטואלי (למשל, תגובות או מוסיקה) הוא שנאסף על ידי המיקרופון שלו, יצירת לולאות משוב המבלבלות את מערכת זיהוי הדיבור. ביטול הד מבוסס DSP משתמש במסננים אדפטיים כדי מודל הדרך האקוסית מרמקול למיקרופון ולצמצם את האות הזה מהאוב הנכנס.

רוב הדוברים החכמים של הצרכנים מעסיקים מערך רב-מיקרופוני בשילוב עם beamforming – טכניקת DSP מרחבית המתמקדת בכיוון הקול של המשתמש תוך התעלמות מצלילים מזווית אחרת.על ידי היגוי קרן וירטואלית כלפי הדובר, המערכת עוד יותר מקטין את הסיכוי שמהדהד או רעשי רעשים מחוץ ל-Axis יפריע. עבור בוטים קול מורכבים מלאים (שם שני הצדדים יכולים לדבר בו-זמנית), ביטול חיוני לדיבור שלו.

זיהוי קולי (VAD)

זיהוי פעילות הקול קובע כאשר אדם מדבר וכאשר רעש רקע או שקט שולט באלגוריתמים מבוססי DSP מנתח את רמות האנרגיה, שיעורי אפס-קרוסה, ודירות ספקטרליות כדי להחליט אם מסגרת של אודיו מכילה דיבור.זה חיוני משתי סיבות: זה מקטין את העומס על מודלים זיהוי דיבור במורד הזרם (הם רק תהליכים עם דיבור), ומאפשר את העוזר הווירטואלי לעצור את המשתמש, למנוע הפסקות חיוביות או צלילים כוזבים.

מערכות VAD מתקדמות משלבות כעת את רשתות עצביות עמוקות של ההרחבה:1 כדי לשפר את הדיוק, במיוחד במקרים שבהם רעש הרקע אינו יסטריון (למשל, רוח, ניירות חלודה) עם זאת, ההחלטה הראשונית עדיין מסתמכת על תכונות זיהוי DSP כגון MFCCs ו-Low-spectrograms.

4.התייעלות הדיבור עבור Output

DSP לא רק על האזנה - זה גם משפר את האופן שבו עוזרים וירטואליים מדברים. טקסט-to-speech (TTS) משתמשים בטכניקות DSP כדי לייצר אודיו ברור, טבעי-צליל.

  • (ב) ,0) שינוי פרוזודי (FLT:1) - התאמת המגרש, משך ועוצמה לחקות את החדירה והדגשה האנושית.
  • (ב) ויקרא י"א): "הִנְטַהְטַה רָאִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִיתִית" (ב"ב"ב"ב"ב"ב"ב"ב"ב"ב"ב"ב"ב, כ"ב).
  • (ב) ⁇ :0) ,התמדה והגבלת ה- 1:1 , הבטחת נפח עקבי ומניעת עיוות כאשר עוזר מדבר ליד הקול הגבוה ביותר שלו.

במנועי TTS מודרניים כמו אמזון פולי או Google Cloud Text-to-Speech, DSP משולב עם קוד זדוני עצבי שיוצר גלפורים מתכונות אקוסטיות.התוצאה היא קול שנשמע פחות רובוטי ויותר אנושי, כולל צלילים טבעיים וצלילים רגשיים.

5.יושב ראש דיאריזציה והזדהות

בסביבות מרובות משתמשים - כגון חדר מגורים משפחתי או שיחת כנס - עוזרי וירטואלי צריכים להבחין מי מדבר. אלגוריתמים של דובר DSP מנתחים מחסניות, טווח המגרש, ושיעור הדיבור כדי לפרט זרמי אודיו על ידי הדובר. ברגע שכל קטע מודגם, הקול יכול ליישם העדפות מותאמות אישית או הגבלות אבטחה (למשל, רק הבעלים של ביצוע רכישות קוליות).

זיהוי הדובר משתמש בדרך כלל (FLT:0i-vectorssveph:1 ; או LT:2x-vectorssFLT 3: 3, אשר הם ייצוגים קומפקטיים של קולו של הדובר מופק באמצעות DSP ולמידה מכונה. רכיב DSP הראשון מנרמל את אודיו עבור נפח ומשך, ולאחר מכן תמצית תכונות כגון MFCCs מוזנים אלה הם לרשת עצבית אשר מייצרת דיוק חיוני כדי להטמיעה, לעומת רמקולים של קידודים, אשר מתואמים את התקני דיוק גדול, אשר מקודמת.

DSP ושילוב של Machine Learning

ההתקדמות המשמעותית ביותר בטכנולוגיית קול היא ההיתוך של DSP המסורתית עם למידה עמוקה. במקום לתכנן באופן ידני מסננים עבור כל תרחיש רעש אפשרי, מהנדסים עכשיו להכשיר רשתות עצביות לבצע משימות כמו denoising, היפרדות מקור והכרה בדיבור בסופו של דבר.עם זאת, DSP נשאר חלק חיוני של הצינור מסיבות רבות:

  • (FLT:0) ביצועים בזמן אמת FLT:1 אלגוריתמי DSP מסורתיים (למשל, FFT, סינון) הם אור חישובי וניתן לבצע על שבבים DSP בעוצמה נמוכה במילימטרים.
  • דרישות שקיפות (FLT:0) דרישות פיזור:1 - בוטים קוליים חייבים להגיב בפחות מ-300 מ"מ כדי להרגיש טבעי.כל עיכוב בשלב DSP מפוסל דרך המערכת כולה. חומרת DSP ייעודית במיקרובקרים או מעבדי אותות דיגיטליים יכולים לעבד אודיו עם עצלות דו-מיליתית, תת-מילות.
  • (FLT:0) להפקת תכונות תכונה יעילה 1FLT) - בעוד מודלים מקצה לקצה יכולים ללמוד תכונות ישירות מ אודיו גולמי, הם לעתים קרובות דורשים יותר נתונים חישוב. A DSP מראש החזית-end אשר מייצרת MFCCs או ספקטרום של אבטיח להפחית את המימדליות באופן משמעותי, ומאפשר רשתות קטנות יותר ומהירות יותר.

לדוגמה, ההרחבה הנידורית של גוגל (RN-T) Recurrent Network Transducer (RN-T) Re-Stock 1: עבור זיהוי דיבור על-ידי ניתוק משתמש בצנרת DSP כדי לעבד אודיו לפני-אפקטים של 128-אל לפני האכלה אותם לתוך המודל.עיצוב זה מאפשר תהליך ההכרה כולו לרוץ על סמארטפון ללא קישוריות בענן, השגת שיעורי שגיאה מתחת ל-5%.

אתגר 1: כוח ושילוב

עוזר וירטואלי על רמקולים חכמים, לבישים, ומכשירי IoT פועלים על כוח סוללה ומחזורי מעבד מוגבלים. הפעלת אלגוריתמי DSP מתוחכמות - במיוחד אלה הכרוכים בשינויי FFT, מחלחלים וסינון הסתגלות - יכולים לנקז את הסוללה במהירות.

פתרון אחד הוא להשתמש ליבות DSP מיוחדות המשולבות במערכת-על-צ'יפ (SoC) לדוגמה, ה- Hexagon DSP של Qualcomm מיועד במיוחד לעיבוד חיישן כוח נמוך והוא יכול להתמודד עם גילוי פעילות קול ודיכוי רעש ללא התעוררות ה- CPU הראשי של בוטים קוליים המפעילים מגבלות שונות של השרת: הם חייבים לטפל באלפי זרמי אודיו במקביל ללא עלות מופרזות של Cloud, אך עדיין להסתמך על מודלים של אודיו, אך ורק על מודלים קלים על גבי קבצי אודיו, אך ורק על גבי קובצי Cookie, אך ורק על גבי קובצי Cookie, אך ורק על גבי קובצי Cookie, אך ורק על גבי קובצי DPU.

אתגר 2: פרטיות וקידום

חששות פרטיות הובילו לשינוי בעיבוד על-ידי DSP, ניתן לבצע משימות רבות הקשורות לקול - זיהוי וייק-מילה, זיהוי פיקוד מקומי, ואפילו תגובות שיחה פשוטות - מבלי לשלוח אודיו גולמי לענן.סי. של Apple, למשל, משתמש גלאי DSP מבוסס תמיד על מילת-על אשר פועל בשקט על מנוע העצבי של ה- iPhone.

DSP ממלא תפקיד מפתח בטכנולוגיית הקול של שמירת הפרטיות על ידי מתן אנונימיזציה ברמת החיישן. Algorithms יכול להפשיט מאפיינים זיהוי אישי תוך שמירה על התוכן לשוני, או ליישם הצפנה הומומורפית לתכונות השמע לפני השידור.למרות שעדיין אזור פעיל של מחקר, גישות כאלה מסתמכות על DSP כדי לחלץ תכונות שהם רק עשירות מספיק עבור הכרה אך לא מספיק עבור זיהוי.

כיוונים עתידיים: מה הלאה עבור DSP בבוטים קוליים?

זמן רב-זמן רב-לאנגואז והתאמה יעילה

תחזיות החזית של DSP נועדו לעתים קרובות לשפה מסוימת או למבטא.מערכות עתידיות ישתמשו ב-DSP אדפטיבית שיכול לזהות את השפה והמבטא של הדובר בזמן אמת, ולאחר מכן לעבור למערך אופטימלי של מסננים וספקים תכונה.זה ידרוש שילוב הדוק עם מודלים זיהוי שפה ויהיה בעל ערך במיוחד באזורים רב לשוניים שבהם משתמשים קודים מתכופפים בין שפות.

מודעות סביבתית וקונטקסטואלית

DSP מתקדם יעבור רק לנקות את אודיו - זה ינתח את הסביבה אקוסטית כדי להסיק ההקשר.לדוגמה, לאחר גילוי הדים וזמן התחדשות גבוה, בוט הקול עשוי להניח שהמשתמש נמצא בחדר גדול (כמו אולם ישיבות) ולהתאים את קבלת התגובה שלו בהתאם.אם DSP מזהה רעש חזק זמני (למשל, אמבולנס חולף), המערכת יכולה לעצור ולשאול את השימוש חוזר על ידי שימוש רציונלי יותר, במקום זאת, ליצור פרשנות וירטואלית יותר.

● ACE AI עם Integrated DSP Accelerators

אנחנו כבר רואים התכנסות של DSP ו AI מאיצים על שבב יחיד. מעבדי קול הדור הבא משלבים ליבה DSP מותאם אישית עם מאיץ רשת עצבית קטנה, המאפשר משימות כמו ביטול רעש הסתגלות, הסרת הד, מילת מפתח המצביע על ביצוע לחלוטין על קצה עם מינימום של שקיפות.זה יאפשר קולות במכוניות, עוזרי בית, ואפילו מכשירי שמיעה כדי להבין מיד את פקודות רקע.

מוטציות וגילוי מתח

DSP יכול לחלץ תכונות פרוזודיות - pitch variability, קצב דיבור, אינטנסיביות הקולית - אשר מתואמות עם המצב הרגשי של המשתמש.על ידי ניתוח תכונות אלה, עוזרים וירטואליים עתידיים יכולים להתאים את הטון שלהם, להציע אמפתיה, או להסלים בעיה תמיכה למפעיל אנושי.לדוגמה, בוט שמגלה תסכול בקול הלקוח (למשל, גבוה יותר, דיבור מהיר יותר, נשימת) עשוי להיות יותר, כמו גם יותר, מתנגן קול חזק יותר, כמו גם, כמו גם, הוא כנראה, כמו אלגוריתמים, הוא מסוגל להיות יותר, כמו אלגוריתמים, כמו אלגוריתם DSP.

מסקנה

עיבוד אותות דיגיטליים רחוק מטכנולוגיית מורשת - הוא הבסיס הבלתי נראה שגורם לעוזרים וירטואליים ולבוטים קוליים מעשיים, אמינים וידידותיים למשתמש, מרגע שהמשתמש מדבר, DSP פועל מאחורי הקלעים כדי לנקות, לנתח, להכין את השמע לפרשנות. בעוד שלמידה מכונה מודרנית דוחפת את הגבולות של מה שמערכות אלה יכולות להבין ולומר, DSP ממשיכה לספק את האינטראקציה בזמן אמתי, נמוך, שמירה על יכולות פרטיות, כמו גם על פני מחשב מודרני, אך לא נתאים יותר, אלא גם את הגבולות של כל אחד, אלא גם את האופן שבו אנו יכולים להיות מודעים לטכנולוגיות קוליות, אלא גם את הגמישות, אלא גם את עצמנו, כמו גם את הגבולות של חשיבה, כמו גם את הגבולות של חשיבה, כמו גם את עצמנו, כמו גם את הגבולות של חשיבה, אם כימותקטיביות, אם כימותק, כמו גם את הגבולות של טכנולוגיות קוליות, אם כימות, אם כימותרפיות, כמו גם את הגבולות של טכנולוגיות קוליות, אך ורק על פני מחשבתית, כמו גם את הגבולות של טכנולוגיות קוליות, אם כימותרפיות, אם כימותרפיות, אם כימותרפיות, אם כימותרפיות, אם כימותרפיות, אם כימותרפיות, אם כימות