measurement-and-instrumentation
אישור למידה עמוקה על תהליכי Dsp: אפשרויות ומגבלות
Table of Contents
למידה עמוקה הפכה תעשיות החל מחזון מחשב להכרה בדיבור, אבל הדרישות החישוביות של רשתות עצביות מודרניות ממשיכות להוציא את CPUs קונבנציונליים.כדי לטפל בזה, מאיצים חומרה - GPUs, FPGAs, ASICs ו DSPs - הם מופעלים על ידי שימוש ב- DSPs- עם זאת, מעבדי אותות דיגיטליים (DSPs) תופסים נישה ייחודית: הם מציעים יעילות גבוהה וקביעת דרישות למידה עמוקה, ו-אמת עבור דרישות עיבוד נתונים אטרקטיביות, אך ורקמות, אך ורקמות, לא מושכות של פונקציות למידה, אך ורקמותרפיות, אך ורקמותרפיות, הן דורשות עבור פונקציות עיבוד נתונים אלה, אך ורקמותרפיות של פונקציות למידה, הן דורשות, אך ורקמותרפיות, הן דורשות, הן דורשות עבור פונקציות עיבוד נתונים אטרקטיביות מאוד.
הבנת מעבדי DSP
מעבדי אותות דיגיטליים הם מיקרומעבדים מיוחדים אופטימיזציה לפעילות חוזרת, אינטנסיבית מתמטית - במיוחד מכפלת חלקיקים (MACs) - המהווים את עמוד השדרה של עיבוד אותות.בניגוד מעבדים למטרות כלליות, DSPs מעסיקים ארכיטקטורות הרווארד שמשתנה המאפשרת הוראה והנתונים בו זמנית להביא, צמצום דוכנים הצינור.
- (FLT:0) יחידות בעלות ערך רב: אנדרל 1 (Moultiply-accumulate Unit:cioFLT:1 חומרה ייעודית שיכולה לבצע להכפיל ותוספת במחזור יחיד, לעתים קרובות עם משיכה או לוגיקה עגולה.
- (FLT:0VLIW (הרבה זמן הוראה) צינורות: FLT 1:1 פעולות מרובות ניתן להוציא במקביל, כגון MAC בתוספת שני עומסים או חנויות.
- (ב) [15] ,התחסין: ⁇ : ⁇ : 1) תמיכה קשה בפעולת מודולולו, חיונית למהפכת וסינון.
- (ב) [15] (הלימודים של מספר נתונים)(FLT) 1 הרחבות עבור פעולות וקטורות על Integers או נתונים קבועים.
- (ב) עיצוב כוח-כוח:0 (Low-powerהמחשה: 1) רבים DSP צורכים מתחת לוואט אחד, מה שהופך אותם אידיאליים עבור מערכות המופעלות על ידי סוללות.
DSPs התפתחו הרבה מעבר למקורם באדיו ובטלקום. מרכזי DSP מודרניים (למשל, טקסס מכשירים C66x, Qualcomm Hexagon, CEVA-XM) משלבים יחידות צף, צ'יפים גדולים יותר ואפילו מעבדי רשת עצביים מיוחדים.עדיין, הכוח העיקרי שלהם נשאר מכריע, נמוך ביצוע של זרם של דגימות נתונים.
המקרה של DSPs ב Deep Learning
אנרגיה ותקציבי חשמל
בתרחישים משובצים ו-IoT, מגבלות תרמיות ועוצמה הן מכריעות.DSPs בדרך כלל להשיג את ה- 010-100 × יעילות אנרגיה טובה יותר חסכוניתFLT:1 (ב- TOPS/W) בהשוואה ל- CPUs למטרות כלליות, ולעתים קרובות יותר טוב מ-GPU להפחתה בגדלים נמוכים יותר.
עיבוד בזמן אמת
יישומים רבים קצה - כגון ביטול רעש פעיל, עיבוד מכ"ם, או היתוך חיישן אוטונומי - חיוני כדי לטפל בנתונים הזרמה ללא ה- Cacheist latencyFLT:1 תחת 1 מילישניות.DSPs להצטיין כאן, שכן צינורות שלהם נועדו לטפל בנתונים הזרמת ללא הפרעה caches בלתי צפויה להחמיץ מודלים למידה עמוקה להחליף בלוקים מסורתיים עיבוד אותות (למשל, עם מסנן עצבי קטן) ניתן לפשט תכונות אבטחה אופייניות.
עלויות ושילוב יתרונות
DSPs משולבים לעתים קרובות בתוך מערכת-על-כיפס (SoCs) לצד microcontrollers, RF חזית קצה, או מעבדי יישומים.אינטגרציה זו מפחיתה עלויות חוק-of-חומרים, שטח PCB ומורכבות הפצת חשמל. שבב יחיד כמו Qualcomm Snapdragon מכיל מספר רב של Hexagon DSP לצד CPU ו- GPU; באמצעות DSP עבור תמיד מסחרר של סוללות חינם, יותר מאשר חלקי סוללה.
התאמה ואופטימיזציה
ספקי DSP מספקים ספריות תוכנה נרחבות אופטימיזציה לפעולות משותפות (FIR מסננים, FFTs, matrix multiplication) עבור למידה עמוקה, אלה יכולים להיות מוגדלים עם FLT:0neural NetworkelsssFLT:1 אשר ניצול מקבילות VLIW ו- SIMD. לדוגמה, ספריית CMS-N עבור ARMx-M microcontrols (אשר לעתים קרובות מספק גישה היברידית) ו-D.
שיקולים טכניים ל-DSP-מבוססים על הקצאות
מטריקס תפעול ומהפכות
הליבה של למידה עמוקה ההיקף הוא ה- convolution או שכבת מחובר לחלוטין. מערך ה- MAC של ASP יכול להתמודד עם הפעולות האלה ביעילות אם הנתונים מתאימים על שבב. כי DSPs בדרך כלל יש FLT:0 זיכרונות מקומיים קטנים קטנים קטנים יותר FLT:1 (מעל למאות קילוביטים), מעצבים חייבים בזהירות אריח ומשקלות buwise והפעלה.
המונחים: Precision
רוב DSPs תמיכה בקידוד קבוע (integer או שברירי) עם אורך מילים תצורה: 8, 16, או 32 סיביות. רבים גם לתמוך נקודת צף (IEEE 754 חד פעמי, וכמה חצי מודעות) עבור למידה עמוקה, FLT: 08-bit integerization integerization 1FLT הוא המתוק כי זה מקום עבור תכונות כפולות עבור תכונות של DRM-D2D.
מסגרת ותמיכה ב- Toolchain
בעוד ש- TensorFlow, PyTorch, ו- ONNX Runtime הם GPU-centric, כמה מסגרות מוטבעות היעד DSPs: TensorFlow Lite עבור Microcontrollers (TFLM), Arm CMSIS-N, TensorFlow Lite עם XNPACK בחזרה (עבור DSPs ב-DSPs על מעבדים ניידים), ו- SDKs (למשל, מעבדי תיבות של NEX) של NEXS (NEX) הם לעתים קרובות, מעבדים מתקדמים של NEXS.NEXS, NOSPIEXOLS, NOEXOL) , NOSPIEXS, NOEXS, NOEXOD.NEX, ללא תשלום עבור מעבדים מתקדמים, NOSPIEX, NOEXS, ללא ספק PDF, NOEX, NOEXS, ללא ספק, NOEXS, IOD.N, ללא טיפול ב-NEX, ללא ספק, ללא ספק, IOD.NEXS.NEXS.NEXS.NEXS.NEX, D.NEXS.NEXS, ללא ספק, ללא ספק, ללא ספק, IOL.N
גבולות ואתגרים
מקבילות מוגבלת
GPUs להשיג מקבילות מסיבית באמצעות אלפי ליבות פשוטות שבוצעו ב- SIMT (Single הוראה, Multiple Author) אופנה. DSPs, לעומת זאת, בדרך כלל יש בין 2 ל 8 קשקשים או SIMD יחידות. אפילו כאשר משתמשים ב-VLIW, ה- MACs תיאורטית שיא למחזור הם לעתים קרובות שני הזמנות של גודל פחות מ- GPU מודרני. לדוגמה, DSP גבוה כמו CE-X1, כלומר, כלומר, רק 10 GHz נמוך יותר מ- 10.
זיכרון Bandwidth Constraints
DSPs בדרך כלל מסתמכים על זיכרון חיצוני משותף (DDR3/4, LPDDR) גישה דרך אוטובוס יחיד, עם מוגבלות על שבב cache. רוחב הפס לזיכרון חיצוני הוא לעתים קרובות 4-8 GB /s, בעוד GPU משתמש אוטובוסים רחבים (למשל, 512-bit עם HBM המספק מעל 1 TB /s).
מסגרת ו- Ecosystem Gaps
מסגרות למידה עמוקות גדולות יש תמיכה GPU ברמה הראשונה עם הבחנה אוטומטית, הכשרה מבוזרת וספריות מפעיל נרחבות. עבור DSPs, הכלי שרשרת הוא לעתים קרובות FLT:0proprietary, מפורש, ופחות בוגרFLT:1 מפתחים עשויים צריך לכתוב נהגים מותאם אישית, להתמודד עם עצלות להפריע, ולנהל באופן ידני נתונים בין זיכרון משותף וזיכרון DSP-Lal, יתר על פני מודלים אלה.
עדיפות ודמוקרטיה נומרית
בעוד הקוונטיזציה עובדת היטב עבור מודלים רבים, כמה ארכיטקטורות (למשל, מהפך מבוסס תשומת לב) רגישים לדיוק מופחת.DSPs עם רק סטויינט קבוע עשוי לדרוש זרמי עבודה או ירידה בנקודת צף על בסיס משותף (בנוסף, FLT:0saturation ו-סבבים של מצבי LT:1FLT שונה על פני DSP, גורם לגרסאות דומות של טכניקות מדידה, כנראה, כלומר, עבור מודלים של טיפול רפואי).
השתמש במקרים והפגנות
למרות המגבלות, DSPs הוכיחו את יעילותם של כמה משימות הקצאה מוטבעת היטב:
- (FLT:0Keyword Spotting (KWS)FIRLT:1) - מודל אבולוציה קטן או חוזר (56-500K פרמטרים) פועל ברציפות על DSP יכול לזהות מילים כמו "היי סירי" מתחת 10 מ'W, עם עצלות מתחת ל -100 מ'.
- (FLT:0)Person Detection on microcontrollersFearLT:1) - שימוש ב- MobileNet v1 (0.25 מכפיל עומק) עם INT8 קוונטית, קורטקס-M7 עם הרחבות DSP יכול לזהות אדם בתמונה בגודל 96×96 אפור ב 3-5 FPS תוך כדי צריכת 30 מ"ר.
- (FLT:0) גילוי אנומלי עבור חיישנים תעשייתיים FLT:1 ; DSPs יכול לעבד רטט או אותות אקוסטיים באמצעות אוטונקוד קטן כדי לזהות תקלות מכונה בזמן אמת, מפוצץ את ה- CPU הראשי.
- (FLT:0)Sensor היתוך ברחפנים של LT:1) - שילוב IMU, מצלמה ונתוני מכ"ם עם מודל רב-ממדי קטן מספיק כדי להתאים לזיכרון DSP על שבב, המאפשר הימנעות ממכשולים בתדירות נמוכה.
דוגמאות אלה חולקות תכונות משותפות: גודל מודל קטן, גודל אצווה 1, דיוק נמוך מקובל, וכבדות ⁇ סטית קריטית.
השוואה עם אחרים Accelerators
בחירת בין DSP, GPU, FPGA, או ASIC תלוי ביישום היעד. להלן סיכום של חילופי הסחר:
- (FLT:0GPU: ⁇ FLT:1 , תומך באימונים ובערכת אצווה גדולה, אך כוח גבוה (10-300+ W) ועלות.לא מתאים למכשירים המופעלים על ידי סוללות או מוגבלים באופן תרמי.
- (FLT:0)FPGA:IRLT:1 , יעילות אנרגיה גבוהה ויעילה מחדש של נתונים, אבל מורכבות פיתוח עולה באופן משמעותי.
- (בדוגמא, NPUIRECT): 1 מציע ביצועים שיא עבור וואט, עם מנועי ממטריקס קבועים, אך אובדן של יעילות כללית.
- (FLT:0)DSP:IRFLT:1) איזון טוב של יכולת, כוח נמוך ויכולות בזמן אמת, אבל מקבילות מוגבלת ורוחב רוחב פס זיכרון הטוב ביותר עבור מודלים קטנים, תמיד על גבי מערכות משובצות.
- (FLT:0)CPU: ⁇ FLT:1; יעילות גבוהה ביותר ללמידה עמוקה.עם זאת, מעבדים מודרניים עם AVX-512/VNNI יכולים לגשת לביצועים דמויי DSP עבור INT8.
במערכות רבות, DSPs משמשים כמעבדים לצד CPUs או FPGAs, טיפול בסימן עיבוד האות בעת מאיץ אחר מפעיל את הרשת העצבית.
מחקר מתמשך וכיוונים עתידיים
מערכת החומרה והתוכנה ללמידה עמוקה מבוססת DSP מתפתחת.מגמות מפתח כוללות:
- (FLT:0) ארכיטקטורות מחשוב heterogeneous מחשוב LT:1 ; שבו DSPs משולבים בקפידה עם מאיצים רשת עצביים קטנים.לדוגמה, סדרת TDA4x של TI משלבת DSP, מאיץ רשת CNN (C7x), ו מאיץ למידה עמוקה (C66x) כדי לכסות עבודות שונות.
- (FLT:0)Imroved ToolchainsFLT:1 עם קוונטיזציה אוטומטית, חלוקת מודלים ודור קוד עבור DSPs. , TensorFlow Lite עבור Microcontrollers עכשיו מטרות ARMx-M עם הוראות DSP, ומאמצים הם להמשיך לתמוך הרחבות RISC-V.
- (FLT:0) מודל האטה האצה של מודל ה-FLT:1 - DSPs עם תמיכה ב- Zero-skipping יכול להפחית חישוב עבור מודלים מקודמים, אבל זה דורש הוראות מותאמות אישית או מעבדים משותפים, אזור פעיל בחברות כמו Synopsys ו- Cadence.
- (FLT:0)Low-precision מעבר INT8cioFLT:1) - קוונטיזציה תת-בייט (4-bit, 2-bit) ו- בינאריות נחקרות; כמה DSPs יכולים לכלול מספר רב של 4bit למלה אחת 32 סיביות, השגת גבוה יותר באמצעות חישוב לרשתות מעוות מעוות מאוד.
כמו קצה AI ממשיך לדרוש גם עצלות נמוכה וכוח נמוך, DSPs - במיוחד עם יחידות מותאמות עצבית קלות - עשויים להישאר אפשרות מעשית עבור זנב ארוך של משימות בזמן אמת.
מסקנה
מעבדי אותות דיגיטליים מציעים נתיב משכנע עבור למידה עמוקה ההיקף בסביבה מחוסמנת משאבים, רגישה לעוצמה שלהם ביעילות אנרגיה, ביצוע דטרמיניסטי, ועלויות נמוכות להפוך אותם אידיאליים עבור תמיד על, יישומים קטנים מודל על קצה, עם זאת, את הגבולות של מקבילות וזיכרון למנוע השקעה מטיפול במודלים בקנה מידה גדול או עבודה עומסים עתידיים של פיתוח DSPal - נחשב לפשט כלי סטנדרטי של תוכנה זדונית של תוכנה זדונית של חומרה.