למידת המכונה עברה במהירות מפריסות ממוקדות ענן לקצה, שבו מערכות משובצות חייבות לספק אינטליגנציה בזמן אמת תחת כוח קפדני תקציבי שקיפות. בלב הטרנספורמציה הזו שוכנת מעבד האות הדיגיטלי (DSP) - מיקרומעבד מיוחד שהפך בשקט לאבן עבור משימות למידה מוטבעות בסביבות ניהול משאבים, בעוד גרפיקה כללית CPUs ויחידות עיבוד (GPU) שולטות לעתים קרובות סביב ביצועים , כלומר, באופן אידיאלי של ביצועים מדויקים של מערכת למידה, הוא מציעות של ביצועים מדויקים של יעילות גבוהה, כלומר, כלומר, באופן אידיאלי, באמצעות ביצועים מדויקים של ביצועים מדויקים של חומרת, כלומר, הוא מציעות, באופן אידיאלי של חשיבה יעילה, כלומר, כלומר, באופן אידיאלי, באמצעות ביצועים אידיאלי של חשיבה יעילה, כלומר, באופן אידיאלי, באמצעות ביצועים מדויקים של ביצועים מתקדמים, כלומר, היא מערכת יעילה, באמצעות ביצועים מדויקים של ביצועים מדויקים של ביצועים מדויקים של חשיבה יעילה, כלומר, באמצעות ביצועים מדויקים של יעילות גבוהה, באמצעות ביצועים מתקדמים, כלומר, היא יעילה של חשיבה יעילה של חשיבה יעילה, באמצעות ביצועים מדויקים של מערכת למידה מהירה יותר, היא יעילה של מערכת יעילה של מערכת ההפעלה DSP, באמצעות ביצועים מדויקים של חשיבה יעילה של מערכת למידה, באמצעות ביצועים, באמצעות ביצועים, היא לעתים קרובות, היא לעתים קרובות, היא יעילה, היא מערכת למידה מהירה יותר, היא

מרמקולים חכמים בעלי ביצועים קוליים ועד לרחפנים אוטונומיים וחיישנים תעשייתיים של IoT, DSPs מאפשרים למכשירים אלה להפעיל רשת עצבית בהקצאה מקומית ללא ניקוז סוללות או הדורשות קישוריות בענן קבועה.היכולת לבצע פעולות מתמטיות מורכבות - במיוחד רצף רב-תכליתי (MAC) - באופן מקביל ויעיל באנרגיה עושה DSPs כלי חיוני עבור AI.זה חוקר את הארכיטקטורה, יתרונות מעשיים, יישומים מעשיים ויישומים של יישומי DSPel בתוך מערכות למידה מוטבעת.

הבנת מעבדי DSP

מעבדי אותות דיגיטליים הם מחלקה של מעבדים במיוחד שאדריכלים לטפל חישובים נומרניים במהירות גבוהה הנדרשים לעיבוד אותות בזמן אמת.בניגוד מעבדים למטרות כלליות, אשר אופטימיזציה להחלפת משימות וחיזוי סניף, DSPs לפני ביצוע קביעה של פעולות קידודיות. ערכות ההוראה שלהם וארכיטקטורה הזיכרון שלהם מותאמים לעיבוד מהיר, צפוי של נתונים כגון דגימות אודיו, וידאו, פיקסלים וחיישנים קריאה.

תכונות ארכיטקטוניות חשובות המגדירות DSP מודרני כוללות:

  • אדריכלות:0 (Harvard Architecture) או שונה אדריכלות הרווארד FIRLT:1) - תוכנית נפרדת ואוטובוסים זיכרון נתונים מאפשרים כניסה סימולטנית וגישה לנתונים, הכפלה באמצעות חישוב.
  • (FLT:0) Hardware מכפיל-אקומציה (MAC)IRLT:1 - הוראה אחת יכולה להכפיל שני מספרים ולוסיף את התוצאה למולטור במחזור שעון אחד, ביצוע הפעולה הליבה של מהפכות ורבומים ממטריקס.
  • (FLT:0Single-instruction, מספר רב של נתונים (SIMD) יכולות 1Figt1LT - DSPs יכולים לפעול על אלמנטים נתונים מרובים עם הוראה אחת, מאיץ וקטורת ממטריקס מרכזי ל-ML.
  • (FLT:0)Zero-overhead לולאות חומרה 1 (Feloph) - פעולות חוזרות ונשנות (כגון לולאות מהפכת) מטופלים ללא עונש של הוראות סניף, שמירה על הצינור המלא.
  • (FLT:0)Low-latency להפריע לטיפול ב-FIRLT:1) - קריטי עבור יישומים בזמן אמת שבו חסר מדגם יכול להשחית את התפוקה.

אפשרויות עיצוב אלה מאפשרות DSPs להשיג ביצועים גבוהים בשבריר של מהירות השעון של CPU, צריכת פחות כוח באופן משמעותי.לדוגמה, DSP טיפוסי פועל ב 500 MHz יכול להוציא 2 GHz CPU עבור קבוצה מסוימת של משימות עיבוד אותות תוך כדי ציור רק כמה מאות מילימטרים.יעילות זו היא הסיבה העיקרית DSPs כבר מוטבע במיליארדי של עשרות שנים, מסיוע לתחנות סלולר.

תפקיד ה-DSPs ב- Machine Learning Workloads

למידת מכונה מודרנית – במיוחד רשתות עצביות עמוקות – היא אינטנסיבית מבחינה מתמטית.המבצעים הנפוצים ביותר במהלך ההיקף כוללים מהפכת, מריצה רב-כפלה, פונקציות הפעלה (למשל, ReLU, sigmoid), בריכות ונורמליזציה.כל אלה מסתמכים במידה רבה על פעולות מכפלות-ממדן. שכבה אחת במערך עצבי עשויה לדרוש מיליוני MAC לכל ההיקף ב-DSP בנויות על מנת לבצע פעולות מינימליות אלה.

DSPs יכול להתמודד עם נקודות קבועות ⁇ , אשר הוא יתרון גדול עבור רשתות עצביות משובצות ML. Quantized - אלה באמצעות ייצוגים integer או קבוע נקודות במקום צף - להפחית באופן דרמטי רוחב פס זיכרון צריכת חשמל תוך שמירה על דיוק מקובל. רבים DSP מודרניים כוללים תמיכה חומרה ייעודית עבור פעילות MAC teger, מה שהופך אותם אידיאלי עבור מודלים מכוומים כמו TensFlow עבור מיקרו-בקר או ריצה.

יתר על כן, DSPs לעתים קרובות כוללים הוראות מיוחדות שמילאות ישירות פרימיטיבי רשת עצביים נפוצים, כגון מסננים אבולוציה עם צעדים ודילולציה, מהפכות עומק, ויישומים של הפונקציה הפעלה.זה מקטין את מספר המחזורים הנדרשים לכל שכבה ומפשט את הנתיב אופטימיזציה התוכנה.

יתרונות מרכזיים של DSPs עבור ML ב- Edge

  • (FLT:0) ביצועים גבוהים עבור וואט:FLT:1 המדד העיקרי עבור קצה AI הוא TOPS / W (פעולות טרה לשנייה לכל וואט) DSPs לספק באופן עקבי יותר TOPS / W מאשר שני CPUs ו GPUs עבור עומסי עבודה טיפוסי ML. עבור מכשירים מופעלים סוללות, זה מתורגם לחיים תפעוליים יותר ותקציב תרמי נמוך יותר.
  • התנהגות אמיתית של זמן אמת: חליל 1 (בניגוד CPUs עם מפספסים בלתי צפויים וטענות של סניף, DSPs לספק תזמון ביצוע רציונאלי.זה קריטי עבור יישומים כמו שליטה סגורה רובוטיקה או עיבוד אודיו בזמן אמת שבו חסר מועד יכול לגרום כשל מערכת.
  • התנועה לנתונים יעילה:0 (FLT:1) DSPs נועדו להעביר נתונים ביעילות בין יחידות זיכרון וקידוד. Multi-banked זיכרונות ומנועי גישה ישירה לזיכרון (DMA) מאפשרים לנתונים לזרום לתוך המעבד ללא דוע הצינור, חיוני לעיבוד זרמי חיישן רצופים.
  • (FLT:0)Low latency:FLT:1 כי DSPs לפעול קרוב החיישן, הם יכולים לעבד נתונים וליצור תוצאות במיקרו-שניות.העקביות התת-מילונית הזו חיונית עבור מערכות אוטונומיות שצריכים להגיב באופן מיידי, כגון הימנעות מהתנגשות ברחפנים.
  • (FLT:0) Maturity andsystem:FLT:1DSPs אינם חדשים; עשרות שנים של פיתוח Toolchain יצרו משווקים בוגרים, מטבולים, וספריות מייעלות.חברות כמו Texas Instruments, Analog מכשירים, NXP ו- Cadence מספקים מחסני תוכנה נרחבים עבור פריסת רשת עצבית, צמצום זמן לשוק.

חידושים אדריכליים במיוחד ללמידה של מכונות

בעוד ש-DSPs מסורתיים כבר מתאימים לעומסי עבודה של ML, הדורות האחרונים שילבו תכונות במפורש להאצת למידה עמוקה. חידושים אלה טשטשים את הקו בין DSP לבין יחידת עיבוד עצבית (NPU).

מילים ארוכות מאוד (VLIW) אדריכלות

רבים מודרניים DSPs, כגון אלה של TI של C6000 משפחה או סדרת NeuPro של CEVA, להשתמש בעיצובים VLIW. מספר חריצים תפעול עצמאי בהוראה אחת מאפשר את המדור לקבוע MACs, לטעון / חנות, ולשלוט פעולות במקביל. בשילוב עם צינורות עמוקים, VLIW DSPs יכול להשיג מקבילה גבוהה ללא הסדר המורכב של לוגיקה, חיסכון כוח.

למידה עמוקה Coprocessors

כמה DSPs משלבים חזק מאצלי חומרה משותפים עבור רשתות עצביות מהפכתיות.לדוגמה, קדינס Tensilica Vision 5 DSP כולל מערך מחשוב של עשרות או מברקים, מנוע convolution ייעודי, ותמיכה חומרה פונקציות הפעלה ובריכת. בלוקים אלה פועלים בשיתוף עם הליבה DSP, תוך המרת את הנוסחאות הניתנותנות ביותר תוך כדי לולאה DSP ומשימות טרום עיבוד.

תמיכה במודלים מוסמכים וספאנים

ML יעיל על DSPs מסתמך במידה רבה על קוונטיזציה.Newer DSPs לספק הוראות ממוזגות לשמונה סיביות או אפילו 4 סיביות, הכפלת או quadrupling באמצעותput בהשוואה ל 16 סיביות או 32 סיביות פעולות.הם גם תומכים אופטימיזציה של אפס אפס, שבו פעולות מכפלות כי כרוך אפס קלט הם לחלוטין - מקרה נפוץ ב-reactr זה יכול להיות מופחתת רשתות יעילות.

השוואת DSPs עם ML Accelerators אחרים

כדי להבין היכן DSPs מתאים, זה עוזר להשוות אותם לאפשרויות חומרה פופולריות אחרות עבור ML משובצ: CPUs, GPUs, FPGAs ו NPUs.

DSP לעומת CPU

CPUs למטרות כלליות גמישים אך לא יעילים עבור פעולות MAC חוזרות ונשנות של רשתות עצביות. A CPU עשוי לדרוש עשרות מחזורים עבור סיקס צינורות וצווארי בקבוק זיכרון. DSPs לבצע MAC במחזור אחד ולעתים קרובות לכלול הוראות SIMD עבור מספר רב של MAC למחזור. עבור עומסי עיבוד אותות רצופים, DSP יכול לבצע CPU על ידי 10-50 תוך צריכת חשמל פחות.

DSP לעומת GPU

GPUs מצטיינים המקבילה מסיבית עם מאות ליבות, אבל הם לצייר עשרות עד מאות וואט. עבור מערכות משובצות עם תקציב כוח של כמה וואט, GPUs הם בדרך כלל לא מעשי.בנוסף, מנהלי GPU מציגים שקיפות כי הוא בלתי מתקבל על הדעת עבור שליטה בזמן אמת. DSPs מציעים יחס ביצועים הרבה יותר טוב יותר עבור משימות טיפוסיות, למרות שהם לא יכולים לנפח באמצעות ערכת עיבוד גדול.

DSP לעומת FPGA

FPGAs יכול להיות reconfigured ליצור נתונים מותאמים אישית עבור ML, המציע יעילות גבוהה מאוד עבור מודל ספציפי. עם זאת, פיתוח FPGA דורש מומחיות בשפות תיאור חומרה והוא פחות נייד. DSPs, להיות מעבדים קבועים פונקציונליים, קל יותר לתכנן (C / C + או אפילו עיצוב מבוסס מודל גרפי) ויש להם מערכת אקולוגית עשירה יותר.עבור פריסת על חומרה קיימת, DSP הם לעתים קרובות יותר מעשי.

DSP לעומת NPU (Neural Processing Unit)

NPUs הם מאיצים מיוחדים שעוצבו בלעדית עבור רשת עצבית ההיקף.הם בדרך כלל להשיג את היעילות הגבוהה ביותר עבור קבוצה קבועה של סוגים שכבתיים.עם זאת, NPUs עשויים להיות חסר יכולות עיבוד אותות כללי של DSP. מערכות רבות מוטבעות לא רק ML ference, אלא גם pre-מעבדה (למשל, סינון, FFT, מיצוי אודיו) ולאחר עיבוד פוסט-מעבד, ניתן לפשט את כל משימות DSP.

יישומים במערכות Embedded

הגמישות של DSPs הופכת אותם מתאימים למגוון רחב של יישומים ML מוטבעים על פני תעשיות.המקרים הבאים להשתמש ממחישים כיצד DSPs מאיצים משימות למידת מכונה בפועל.

עיבוד קולי וסאונד

רמקולים חכמים, מכשירי שמיעה ומערכות רכב ללא ידיים מסתמכים על DSPs עבור מילת מפתח, פקודות קוליות, שיפור אודיו. צינור טיפוסי כולל beamforming (עיבוד מיקרופוני), ירידה רעש (מסנן אמפיבי), מיצוי תכונה (MFCCs או spectrograms), ולאחר מכן רשת עצבית קטנה עבור התעוררות מילה. DSPs להתמודד עם הנתיב כולו עם microII עם microII, תמיד להשתמש דינמיקה של 10Wx דחיסות, כלומר, כלומר, כלומר, כלומר, פחות דחיסות קוליות של 10 פעמים, 000 זמן דחיסה של פחות מאשר דחיסה של דחיסה של טקסט באופן נרחב יותר מאשר דחיסה של 10 דקות.

חזון מחשב ב- Edge

DSPs משולבים לתוך מודולים מצלמה עבור זיהוי אובייקטים, זיהוי פנים, ובקרת מחווה במצלמות חכמות, מזל"טים ורובוטים תעשייתיים. Vision DSPs מ Cadence ו CEVA כוללים חומרה ייעודית לעיבוד אותות תמונה (ISP) - השמדה, איזון לבן, תיקון gamma - בשילוב עם מאיץ למידה עמוק.זה מאפשר שבב יחיד כדי לנפח את כל הדרך להורדת תוצאות ב- DPU החכם עבור מערכות אבטחה 225 שימוש ב- CERC.

חיישנים במערכות אוטונומיות

כלי רכב אוטונומיים ומערכות ניהול מתקדמות (ADAS) ממזגים נתונים ממצלמות, מכ"ם, לידר וחיישנים לא מקצועיים. היתוך חיישן כרוך עיבוד אות כבד (סינון, תזמון, קיטור) ו- ML מבוסס גילוי/חקירת אובייקטים.DSPs לספק חישוב חד-פעמי, נמוך-מיש הנדרש לתפקודים קריטיים בטיחותיים.

תחזוקה חיזוי ב-IoT תעשייתי

בייצור, רטט וחיישנים טמפרטורה לפקח על בריאות מכונות.DSPs לנתח FFTs ו-Time-series נתונים כדי לזהות aomalies באמצעות מודלים לזיהוי סימפומטיים קלים (למשל, autoencoders) את היכולת לרוץ בהקצאה מקומית על חיישן אין ירידה בנתונים מעלה ומאפשר התראות מיידיות. אנליסטיםog מכשירים ADSP-CMx משמש בשליטה מוטורית ו ניטור, שניהם שילוב של עיבוד שבב יחיד.

מכשירים רפואיים

ECG לפקח, מנטרפי כושר ללבוש, ומכשירים אולטרסאונד נייד ממינוף DSPs לניתוח ביו-signal בזמן אמת. ML מודלים יכולים לסווג את arrhythmias, לזהות נשימה בשינה, או להעריך את קצב הלב פנויות. צריכת חשמל נמוכה וטביעה קטנה הם קריטיים - DSPs מאפשרים מכשירים לרוץ במשך שבועות על סוללה מטבע תוך ביצוע מתמשך.

« « אינטגרטיבי DSP לתוך Embedded ML Pipelines

חלוקת מודל למידת מכונה על DSP כוללת צינור מקצה לקצה המשתרע מעבר למנוע הסימון.זרימת העבודה הטיפוסית כוללת:

  1. (FLT:0) רכישת נתונים FLT:1 ; חיישנים (מיקרופונים, מצלמות, IMUs) להאכיל נתונים גולמיים באמצעות ADC או ממשק מקבילה. DSPs כוללים לעתים קרובות היקפיים ייעודיים כגון I2S עבור אודיו או MIPI CSI עבור מצלמות.
  2. (FLT:0) עיבוד מראש FLT:1 - נתוני רול מותנים: סינון להסרת רעש, חלון עבור FFT, נורמליזציה, או מיצוי תכונה (למשל, ספקטרום של אבטיח עבור אודיו, חידוש מסגרות עבור חזון). DSPs מצטיינים כאן בשל הוראות עיבוד אות שלהם.
  3. (FLT:0) InferenceveFLT:1) - הנתונים המעובדים מועברים לרשת העצבית.DSPs להפעיל את המודל הקוונטי, שכבה על ידי שכבה, באמצעות האצה חומרה עבור מהפכות ושכבות מחוברות לחלוטין.
  4. (FLT:0)Post-מעבדותFLT:1 - עשרות פריטים מומרים לתוצאות משמעותיות: רך מקס עבור סיווג, קידוד קופסה עבור גילוי אובייקטים, סף גילוי אנומלי.
  5. (התוצאה:0) ענישה / קומוניקציה 1:1 - התוצאה היא הפעלתו (למשל, להדליק אור, לשלוח התראה) או מועברת אלחוטית.

ספקים רבים של Semiconductor מספקים ערכות כלי תוכנה כי משווקת הרבה של צינורות זה.לדוגמה, CDN של CEVA (Deep Neural Network) ערכת כלי לוקח מודלים של TensorFlow או PyTorch, חל הקוונטיזציה, ומייצר קוד C מותאם עבור הליבה DSP שלהם.

אתגרים ושיקולים

למרות היתרונות שלהם, DSPs הם לא כדור כסף עבור כל תרחיש ML מוטבע מהנדסים צריך לנווט כמה אתגרים:

  • (FLT:0) עדיפות לעומת דיוק מסחר-offscioFLT:1; קוונטיזציה אגרסיבי (למשל, משקל 4bit) יכול באופן משמעותי לזלזל דיוק אם לא נעשה בזהירות.
  • (FLT:0) מגבלות מזכרות FLT:1: DSPs בדרך כלל מוגבל על שבב SRAM (כמה מאות קילוביטים לכמה מגהביטים) סטוד מודל רשת עצבי מלא ופעולות ביניים שלו יכול להיות מאתגר.טכניקות כמו זיכרון, אריזה מודל, שטף מודל, וזרימת הפעלה של פלאש חיצוני נדרשים.
  • (FLT:0) מורכבות Software מורכבת FLT:1: בעוד DSPs קל יותר לתכנן מאשר FPGAs, הם עדיין דורשים מערכים מיוחדים וספריות. Port מודל ממסגרת ברמה גבוהה קוד DSP-אופטימי לעתים קרובות כרוך כוונון ידני או שימוש ב- SDKs ספציפיים ספקים.מפתחים צורך היכרות עם סטוינקט קבוע וניהול זיכרון.
  • (FLT:0) מערכת אקולוגית עבור סוגים מסוימים של מודל מסוגים: כמה שכבות מתקדמות (למשל, מנגנוני תשומת לב, מתכנתים, רשתות חוזרות עם רצפים דינמיים) עשויים לא להיות ממופים ביעילות לאדריכלות DSP המסורתית. Newer DSPs מוסיפים תמיכה, אבל מערכות אקולוגיות מאחורי GPUs.
  • (FLT:0) פיתוח ודה-בולג'ר (DSP debug Tools) הם פחות מבוגרים מאלה עבור CPUs. Profiling מחזורי ביצוע ברמה של מערכות משובצות בזמן אמת יכול להיות קשה, הדורש יכולות מעקב חומרה.

מגמות עתידיות

האבולוציה של DSPs ללמידה מכונה היא מאיצה.כמה מגמות מעצבות את הדור הבא של AI מוטבע:

  • (FLT:0RISC-V עם הרחבות DSPsveFLT:1: ארכיטקטורת הקוד הפתוח RISC-V כוללת כעת את P-extension (packed SIMD) ו וריאציות וקטורות שדומים באופן הדוק לתכונות DSP. מעצבים שבבים רבים יוצרים ליבות סטנדרטיות RISC-V עם יחידות MAC דמויות DSP ו-LG עבור האצה, מבטיחות מותאמות אישית ועלויות יעילות מאוד ל-D חלופות קנייניות.
  • (FLT:0) שילוב heterogeneous אינטגרציה 1FLT: System-on-chips (SoCs) יותר ויותר משלב מיקרובקר (MCU), DSP, NPU ו GPU על אחד למות.DSP מטפל עיבוד אותות וכוח נמוך תמיד-on ML, בעוד ה-NPU מתמודד עם יותר כבד בהקצאות.
  • (FLT:0) דחיסה מתקדמת וספארסיות FLT:1: DSPs יאמצו טכניקות מתוחכמות יותר כגון קידוד מובנה, שיתוף משקל, ומתמטיקה ממטריקס מפריצת כדי לנצל את הספגות הגוברת של רשתות עצביות מטובות.
  • (FLT:0) על-ידי למידה למידה (FLT) 1: בעוד נשלט כיום על ידי הקצינה, כמה DSPs מתפתחים כדי לתמוך קל משקל על אימון שכפול או כוונון עדין.תכונות כמו האצה חומרה לאחור והורדת דיוק ⁇ ⁇ יאפשר הצטברות הסתגלות מודלים לשיפור לאורך זמן ללא קישוריות בענן.
  • (FLT:0)אנרגיה קצירת כוח אפס-עוצמה MLFLT:1: מחקר דוחף DSPs שיכולים לפעול על תקציבי כוח תת-מיליאט, המאפשר ML הפחתה ממקורות אנרגיה-ההארכוסים.

מסקנה

מעבדי אותות דיגיטליים הוכיחו להיות פתרון חזק ומעשי עבור מאיץ משימות למידת מכונה במערכות משובצות.המסורת האדריכלית שלהם - מותאם לעיבוד מספרארי של זמן אמת, כוח נמוך - מתאים באופן מושלם לדרישות של רשת עצבית מודרנית הניתוק בקצה. על ידי מתן ביצועים גבוהים עבור וואט, ביצוע דטרמיוני, ושרשרת כלים מבוססת, DSPs מאפשר דור חדש של מכשירים אינטליגנטיים הפועלים ביעילות, באופן עצמאי, ומאובטח.

בעוד ML מוטבע ממשיך להתרבות בתעשיות מאלקטרוניקה צרכנית לבריאות ולרכב, התפקיד של DSP רק להתרחב.מהנדסים אשר מבינים כיצד למנף ארכיטקטורות DSP עבור ML עומסי עבודה - כולל קוונטיזציה, אופטימיזציה זיכרון ושילוב עם צינורות עיבוד אותות - יהיה היטב להציב מוצרים מתקדמים שדוחפים את הגבולות של מה אפשרי בחוד החנית, עם חידושים מתמשכים ב- RISCVr, תישאר תמיכה אנרגטית, והוא עדיין תומך באינטליגנציה מלאכותית.