המונחים: Digital Signal Processors

מעבדי אותות דיגיטליים, או DSPs, הם מיקרומעבדים מיוחדים אשר פיתחו במיוחד לטיפול אותות בעולם האמיתי כגון אודיו, וידאו, טמפרטורה, לחץ ומיקום. בניגוד יחידות עיבוד מרכזיות מטרות כלליות (CPUs) כי הגדיל מגוון רחב של משימות, DSPs הם תכלית-התכלית-הבנה עבור מהירות גבוהה, פעולות מתמטיות חוזרות הנדרשות כדי לעבד אותות רצופים.

DSP טיפוסי כולל מכפיל חומרה ייעודי, אוטובוסים זיכרון מרובים לגישה לנתונים בו-זמנית, ותנאי טיפול מיוחדים המאפשרים טיפול יעיל של זרמי נתונים.תכונות אלה מאפשרות DSP לעבד דגימות אודיו בזמן אמת עם ביצועים מינימליים וקביעתניים.FLT:0Texas InstrumentsFLT:1, אחד היצרנים המובילים של DSPs, מייצרת משפחות של מעבדים שנעים ממכשירים אולטרה-נמוכים למכשירים ל-שבבים ל-שבבים ל-שבבים.

תכונות טכניות עיקריות של DSPs

  • (FLT:0) אדריכלות הארוורד: 1.FLT 1 בנפרד תוכנית אוטובוסים זיכרון נתונים מאפשרים למעבד להביא נתונים הדרכה וגישה בו זמנית, הכפלת דרך חישוב עבור לולאות עיבוד אותות.
  • (FLT:0) Hardware מכפיל-accumulate: ההרחבה 1 (Auto) יכולה להכפיל שני מספרים ולוסיף את התוצאה ל accumulator במחזור שעון אחד, המאפשר יישום יעיל של מסננים דיגיטליים ו- Fourier הופך.
  • (FLT:0)Circular buffering:FLT:1 מיוחד חומרה מתייחס אוטומטית עוטפת סביב גבולות חיץ, חיסול הצורך בחלוקת מותנית בעיבוד מדגם-על-ידי-הפשט.
  • (FLT:0)Zero-overhead הלולאה: FIRLT:1) המעבד יכול לבצע לולאה ללא הגבלת מחזורים על סף פיזור או הוראות סניף, קריטי עבור המשך באמצעות חישוב פעולות סינון.
  • גישה זיכרון (DMA): ההרחבה 1 (DMA): נתונים יכולים לנוע בין היקפים וזיכרון ללא התערבות CPU, שחרור הליבה ל חישוב בעוד I / O פועל במקביל.

התפקיד הקריטי של DSPs בזיהוי דיבור

צינורות זיהוי דיבור מודרני תלויים DSPs בשלבים מרובים, מלכידת אודיו גולמי באמצעות מיצוי תכונה למודל אקוסטי הקצוץ.היכולת של המעבד להתמודד עם זרמי אודיו רצופים, בזמן אמת עם קוצר ראייה הופך אותו הכרחי עבור מוצרים הניתנים לקול, שבו חווית המשתמש תלויה בהיענות מיידית.

ביטול רעש ואקו אקוסטי

לפני מנוע זיהוי דיבור יכול לפרש מילים, אות השמע חייב להיות ניקוי של רעש סביבתי והדהד אקוסטי.DSPs לבצע אלגוריתמים מסנן פילטרים מתאימים כגון ריבועים ממוצעים (NLMS) ו subtraction to הסר רעש ממעריצים, תנועה, עוזר הקהל, ומכשירי רדיו מחוץ לשדה, כגון רמקולים חכמים, DSP לנהל מיקרופון רב-מסוגים, להופיע קול אמין:

ביטול הד אקוסטי הוא פונקציה קריטית נוספת.כאשר עוזר קול מנגן מוסיקה או מדבר תגובה, המיקרופון אוסף את אודיו זה כמו הד.DSP משנה את אות ההתייחסות הידוע מן המיקרופון קלט, למנוע את המערכת לנסות לזהות את הפלט שלה כפקד משתמש. עיבוד זה חייב להתרחש ברציפות בזמן אמת, עם עצלות נמדדת במליכי שניות, משימה שעבורה ארכיטקטורת DSP הם אידיאליים.

צילום: Speech Models

ברגע שהאות אודיו הוא ניקוי, את תכונות DSP תמצית המייצגות את התוכן הדיבור בצורה קומפקטית, אינפורמטיבי.התכונות הנפוצות ביותר הן מל- ⁇ cepstral coefficients (MFCCs), אשר מחקה את החלטת התדר של האוזן האנושית על ידי יישום בנק מסנן שטח על פי סולם מל.DSP קובע את השינוי המהיר (FF) על מסגרת קצרה של אודיו, בדרך כלל 20 מ"מ"ל, לוקח דיסקרטינים אחרונים, ואז מ"מאטים, הופך את ה- 30 שניות.

העומס החישובי של MFCC החילוץ הוא משמעותי במכשיר תמידי.רמקול חכם טיפוסי מעבד 50 עד 100 מסגרות לשנייה, כל אחד הדורש FFT, סינון יישום בנק, ו- trigonometric משנה. A כללי מטרה CPU יכול להתמודד עם משימה זו, אבל במחיר כוח גבוה הרבה יותר. ASP משיג את אותה העבודה באמצעות שבריר של האנרגיה, אשר מתורגמת ישירות לחיים ארוכים יותר ומוצרים ניידים יותר.

דרישות עיבוד בזמן אמת

זיהוי דיבור הוא ביסודו יישום בזמן אמת.אוזן האדם קולטת עיכובים גדולים מ -100 מילישניות כמו lag בולט, ועיכובים מעבר 200 מילי שניות מקטין את חוויית המשתמש באופן משמעותי. DSPs מספקים ביצוע פחת נמוך, כי צינורות שלהם נועדו לתזמון הוראה צפוי ללא התחזיות והעמודים הנפוצים במעבדים למטרות כלליות.

מכשירים קצה, שרשרת עיבוד הדיבור של מיקרופון קלט טקסט מוכר חייב להשלים בתוך תקציבי זמן קפדניים. A DSP תהליכים אודיו בלוקים מתפתלים, בדרך כלל 10 עד 20 מילי שניות אורך, והצנרת פועלת עם שקיפות קבועה ידועה.

יעילות חשמל ב- Always-On מכשירים

אולי היתרון המשכנע ביותר של DSPs בהכרה בדיבור הוא יעילות הכוח שלהם.תמיד רשימת עוזרי הקול חייבים לפקח על זרם אודיו ברציפות, גם כאשר המכשיר במצב עמידה. ADSP המוקדש לגילוי מילים יכול לפעול עם תקציב כוח של כמה מילימטרים, בהשוואה לעשרות או מאות מילימטרים עבור CPU ביצוע המשימה זה מושג באמצעות הוראה מיוחדת, מינימלית, וספקית לחץ דם איטי יותר, מאשר גישה ביקורתית על פני נתונים.

אדריכלות DSP מובילה מ-FLT:0 (הה-HexagonFelo) של HexagonFLT:1 ו-FLT:2CEVAFLT 3) כוללת מאיצים חומרה עבור רשת עצבית, המאפשר להם להפעיל מודלים אקוסטיים קטנים ישירות על DSP ללא התעוררות מעבד היישום הראשי.אדריכלות זו מאפשרת סמארטפונים ואוזני אלחוטיים לשמור על עוזרות קוליות תוך מתן מענה לכל חיי הסוללה.

כיצד DSPs להשוות עם מעבדים כלליים-Purpose

בעוד CPUs ויחידות עיבוד גרפיקה (GPUs) יכול מבחינה טכנית לבצע עיבוד אותות דיבור, DSPs מציעים יתרונות ברורים עבור החזית-end ו בזמן אמת חלקים של הצינור. CPUs לספק גמישות וקלות של תכנות אבל לצרוך יותר כוח לפעולה בשל מורכבות שלהם מחוץ להוצאה להורג צינורות ו caches גדולים. GPUs להצטיין מקבילות מסיבי אבל בעקביות מסיבית של נתונים והעברות אודיו כי עושה אותם מורכבים לעיבוד.

DSPs כובש קרקע בינונית: יעיל מאוד עבור הזרמת נתונים עם מקבילות צנועות, אבל פחות גמיש מ CPU עבור קוד שרירותי. בפועל, עיצובי מערכת מודרנית על שבב משלבים את כל שלושת סוגי המעבדים. ADSP מטפל בקצה הקדמי אודיו, CPU מנהל את לוגיקה יישום וערומה רשת, ו- GPU או יחידת עיבוד עצבי מאיץ מודלים אקוסטיים גדולים כאשר צריך זה הואגני משלב את הגישה של כל אחת של חולשות מרתיעה.

יישומים מרכזיים בתעשיות

מכשירים ניידים ולבוש

סמארטפונים שילבו DSPs לעיבוד קול מאז תחילת שנות ה -2000, אבל התפקיד התרחב באופן דרמטי עם עליית עוזרי דיגיטלי.ידיים מודרניים להשתמש DSPs עבור הפחתה של רעש במהלך שיחות טלפון, להיות מוקרן עבור מצב רמקולים, ועוזר קולי תמיד על הפעלת קול. Wireless אוזן וסיועי שמיעה מייצגים מקרה קיצוני שבו מגבלות כוח הם חמורים עיבוד אודיו חייב להתבצע לחלוטין על מצב זעיר, מופעלת, כמו DSP פעיל, כגון אופטימיזציה של אפל.

מכשירים חכמים הביתה ו-IoT

רמקולים חכמים, תרמוסטטים, ומרכזי אוטומציה ביתיים מסתמכים על DSPs כדי לאפשר שליטה קולית ללא ידיים בסביבה מאתגרת מבחינה אקוסטית.דובר חכם במטבח חייב להכיר פקודות קוליות על רעש של מים זורמים, אוהדים ממצה וקולות בישול.העיבוד הרב-ערוצי של DSP והתאמה של סלקציה של קול המשתמש תוך דיכוי מקורות מתחרים.

מערכות קול

מערכות זיהוי קוליות בתוך הרשת הפנים כמה מהתנאים האקוסיביים התובעניים ביותר: רעש כביש, רעש רוח, רום מנוע, ונוסעים מרובים מדברים בו זמנית.DSPs לנהל מיקרופון מבוזר ברחבי התא, ביצוע ביטול הד לשיחות טלפון ללא ידיים וקודות קוליות עבור ניווט, בקרת אקלים, בידור.

בריאות וטכנולוגיות מסייעות

זיהוי דיבור כוח במערכות דיקטציה רפואית, המאפשר לרופאים לתעד מטופלים נתקלות ללא ידיים.בטכנולוגיה המסייעת, DSPs מעבדים פקודות קוליות עבור בקרת גלגלים, ממשקי אוטומציה ביתית עבור אנשים עם ניידות מוגבלת, ומכשירי תקשורת עבור משתמשים מעצורים דיבור. צריכת הכוח הנמוכה של DSPs חשובה במיוחד במכשירים רפואיים מופעלים סוללות שבו אמינות ותפקוד ארוך הם חיוניים.

יישומים תעשייתיים וארגוניים

סביבות אחסון וייצור משתמשים בזרימות עבודה מונחות קול, שבו עובדים לובשים ראשי תיבות ומקבלים הוראות מדברות.DSPs מאפשרות זיהוי דיבור חזק בהגדרות תעשייתיות בעלות גבוהה, ומאפשרות הפעלה ללא ידיים של ניהול מלאי, פיקוח איכותי ומערכות לוגיסטיות.חדרי כנס ארגוניים משתמשים במערכות אודיו DSP-e מאובזרות לפגישות זיהוי דיבור אוטומטיות במהלך, המאפשרות תזמון בזמן אמת וארכיון ישיבות חיפוש.

אתגרים טכניים ופתרונות

למרות היתרונות שלהם, פריסת DSPs עבור זיהוי דיבור מציג אתגרים הנדסיים.קוד DSP יעיל דורש מיומנויות מיוחדות כי מתכנתים חייבים לנהל זיכרון נתונים במפורש, לוחות זמנים צינורות באופן ידני, ולעבוד עם סטויינט קבוע כדי למנוע צף נקודה מעל הראש. [+] סביבות הפיתוח המודרני שיפרו את המצב הזה עם ספריות אופטימיזציה, כלי תכנות גרפיים, וקוד אוטומטי ממודלים MATLAB ו-Slink.

מגבלות זיכרון על DSPs יכולות גם להיות מגבילות.DSPs רבים יש מוגבל על זיכרון שבב, הדורש ניהול זהיר של מציצים נתונים ואחסון התוכנית. אלגוריתמי עיבוד דיבור יש לכתוב כדי למזער את טביעת הרגל הזיכרון תוך שמירה על ביצועים בזמן אמת.טכניקות כגון עיבוד מבוסס מסגרת, חישוב, ואבטחת נתונים יעילה לעזור למפתחים מתאימים לאלגוריתמים מורכבים לתקציבי זיכרון מוגבלים.

שילוב עם שירותי דיבור מבוססי ענן מציג אתגר נוסף.מוצרים קול רבים מבצעים עיבוד ראשוני מקומי על DSP אבל לשלוח אודיו לשרתי ענן להבנה מלאה שפה.DSP חייב לדחוס ולארז את זרם אודיו מעובד להעברת רשת תוך שמירה על איכות השמע מספקת עבור זיהוי ענן מדויק.התאמה קידוד והפסדי החבילה מסתירים אלגוריתמים פועל על DSP להבטיח הפעלה אמינה על תנאי רשת משתנים.

עתיד ה-DSPs בזיהוי דיבור

אינטגרציה למידת מכונות

המגמה המשמעותית ביותר בזיהוי דיבור היא שילוב של למידת מכונה ישירות על DSPs. דיבור מסורתי השתמש במודלים תערובת Gaussian ומודלים מוסתרים של Markov שיכולים לפעול ביעילות על ארכיטקטורות DSP קלאסיות.מערכות מודרניות משתמשות ברשתות עצביות עמוקות הדורשות דפוסים חישוביים שונים, כולל מברקציות ותפקודי הפעלה.DSP מגיבים על ידי הוספת מאיצים ברשת עצביים, יחידות עיבוד והנחיות מיוחדות לפעילות למידה עמוקה.

DSP היברידיים אלה יכולים להפעיל רשתות עצביות קטנות עבור גילוי מילים ו מילת מפתח המצביע על שימוש בכוח מינימלי, בעוד מודלים גדולים יותר להבנה דיבור מלאה יכולים להיות מומס לשרתי ענן או מעבדים חזקים יותר. ההתקדמות האחרונה בהתאמת מודל דחיסה מאפשרים רשתות עצביות מורכבות יותר להתאים בתוך הזיכרון ותקציבי תואמים של DSP משובצים, המאפשרים זיהוי דיבור לא הילוך שעובד ללא קישוריות.

Edge מחשוב ופרטיות

מודעות גוברת של חששות הפרטיות היא הפעלת עיבוד זיהוי דיבור מן הענן עד קצה. משתמשים מצפים יותר ויותר פקודות קוליות להיות מעובדות מקומית במקום מועבר לשרתים מרוחקים. DSPs הם מרכזיים לשינוי זה כי הם יכולים לבצע את כל צינור זיהוי הדיבור, מלכידת אודיו ועד לפלט טקסט, ללא גישה לרשת.על-דטרי מבטלת את הגמישות מנסיעות עגולות ומבטיח כי נתונים אודיו רגישים לעולם לא עוזב את המכשיר.

אדריכלות הדור הבא של DSP כוללת תכונות אבטחה חומרה כגון רעלות מאובטחות, מסלולי זיכרון מוצפנים, ומנגנוני עדות המגינים על נתוני קול לאורך שרשרת העיבוד.יכולות אלה מאפשרות למוצרים קוליים לציית לתקנות הפרטיות המתעוררות וציפיות המשתמשים תוך שמירה על הביצועים ויעילות הכוח שמספקים DSPs.

פיתוח תקנים ומערכת אקולוגית

תעשיית זיהוי הדיבור מתמזגת סביב ממשקים משותפים וערימות תוכנה המפשטות את אינטגרציה DSP.The Arm Cortex-M המשפחה הפכה לסטנדרט דה- Facto עבור microcontrol-class DSPs, בעוד ליבות מורשה של קדנס, CEVA, ו-Synopsys כוח ביצועים גבוהים יותר. מסגרות תוכנה כגון TensorFlow Lite עבור Microcontrollers ו- Arms-CMS-D.

הפיתוח של רשת עצבית פתוחה (ONNX) פורמט וייצוג מודל סטנדרטי מאפשר מודלים זיהוי דיבור מאומן בסביבות ענן להיות פרוס ישירות על DSPs עם מאמץ המרה מינימלי.זה interoperability להפחית את זמן הפיתוח ומאפשר צוותי המוצר לבחור את החומרה DSP המתאימה ביותר עבור היישום שלהם מבלי להינעל לתוך שרשרת כלי של מוכר יחיד.

מסקנה

מעבדי אותות דיגיטליים נשארים טכנולוגיה בסיסית עבור זיהוי דיבור, מתן עיבוד אותות בזמן אמת, נמוך כוח ערך שהופכ ממשקי קול מעשי במכשירים צרכניים, מערכות רכב, ציוד רפואי וסביבות תעשייתיות שלהם מאפשר הפחתה של רעש, מיצוי תכונה, וביטול אקוסטי של דאטנס ויעילות כוח כי מעבדים למטרות כלליות אינם יכולים להתאים.