Table of Contents
מבוא
זיהוי דיבור בזמן אמת הפך אבן הפינה של אינטראקציה מודרנית מחשב, עוזרי קול כוח, ממשקי רכב ומערכות בקרה תעשייתיות.הביקוש לתגובה מיידית, דיוק חזק, צריכת חשמל נמוכה דוחפת ארכיטקטורות סטנדרטיות למגבלות שלהם.שדה בעיצוב מחדש של שערים עמידים (FPGAs) התפתחה כחלופה משכנעת, המציעה שילוב ייחודי של מקבילות ברמת חומרה ותוכנה כמו סימולציה של מערכת הפעלה משולבת באופן ישיר של אלגוריתמית של אלגוריתמית של אלגוריתמית של אלגוריתמית של אלגוריתמית של אלגוריתמית יעילה יותר, כמו אלגוריתמית CPU2.
מה הופך את ה-FPGA שונה?
FPGA הוא מעגל משולב בנוי סביב ממטריקס של בלוקים לוגיים הניתנים להגדרה, חסום RAM ו עיבוד אותות דיגיטליים (DSP) פרוסות, הכל מחובר דרך בד מבוזרת מוקרן תוכנית, בניגוד CPU המבצע סט קבוע של הוראות quentially, FPGA מגדיר את ההתנהגות שלו עצמו באמצעות חומרת חומרה באמצעות תיאור חומרה כמו Verlog או VS - שימוש באופן קבוע יותר ויותר מקבילה של מערכת הפעלה של חומרה (CV) באופן קבוע של חומרה של חומרה של מערכת הפעלה באופן קבוע של חומרה (מערכת הפעלה) באופן קבוע של מערכת הפעלה חלקית של מערכת הפעלה FPGA (CVal-R) באופן קבוע של מערכת הפעלה מחדש של מערכת הפעלה מחדש של מערכת הפעלה מחדש של מערכת הפעלה באופן קבוע של מערכת הפעלה מחדש של מערכת הפעלה באופן קבוע של מערכת הפעלה מחדש של מערכת אבטחה CHD) מגדירה-R.
פרופיל ייחודי של הכרת דיבור
רגישות
משתמשים מצפים פקודה קולית להניב תוצאה ללא עיכובים חד-משמעיים.המערכת הכוללת של מיקרופון ללכוד לפעולה חייבת לעתים קרובות להישאר מתחת ל-200-300 מ"ג שניות. בתוך התקציב, לכידת אודיו, ניתוק מראש, ניקוד רשת עצבית, ודהמת כל הביקוש למחזורי בקרה קבועים של כלי רכב.FPGAs יכול לעבד מסגרות אודיו בודדות באופן קבוע, כמו שהם מגיעים ללא התזמון וההקשרים של מערכת הפעלה רצינית של שעון-CC (Cend) באופן קבוע, במיוחד, אשר עשויה ל-Cendicial של ציוד אבטחה.
שקיפות ופנים
מערכות זיהוי דיבור אוטומטי מודרני (ASR) מסתמכות על רשתות עצביות עמוקות עם מיליוני פרמטרים. A יחיד הקצוץ של LSTM דו-כיווני או קוד מבוסס Transformer עשוי לדרוש אלפי פעולות מרובות-מצטברות למסגרת אודיו. CPUs להתמודד עם נתונים ספציפיים באופן קבוע עבור ליבת CPU, בעוד GPUs להאיץ אותם דרך ליבות קטנות אבל לסבול מאופטימיזציה של PGAs מצטיין כאן על ידי מיפוי אוטומטי של נתונים גרף יחיד.
אנרגיה יעילה
מכשירים רבים הקשורים לדיבור לרוץ על כוח סוללה או תקציבים תרמיים קפדניים. כי FPGA מיידיות רק את ההיגיון המדויק הדרוש לאלגוריתם - לא הוראה, קוד, או הוצאה להורג של קידוד - זה לעתים קרובות משיג ביצועים גבוהים יותר עבור וואט מאשר CPU או GPU עבור אותם רמות עבודה עצביות רשת.יעילות זו נובעת מחיסול יחידות פונקציונליות תחת השפעה נמוכה ויכולת לפעולת עמוק, למעט היררכיה של כוח פעיל של מנועי אבטחה לטווח ארוך.
ASRPilines ASR
אודיו Front-End and Feature Extraction
הצינור מתחיל עם ממשק אודיו אשר מזרם את המודולציה של הדופק (PCM) לתוך שרשרת זיהוי ייעודית FPGA, ביצועים לוגיים חלון, קצר זמן קצר ארבעהייה (FFT), מסנן חישוב אנרגיה בנקאית, ו דרוג דינמי - כל זה בזמן אמת, ספקיות FPGA רבות לספק ליבות אופטימיזציה מאוד עבור FFT כי ניצול החומרה DSP בלוקים וכתוצאה מכך קומפקטיים אלה הם בדרך כלל microHCD מקבילה.
DNN Acceleration for Acoustic Modeling
מודלים אקוסטיים להמיר וקטורים להסתברות על פני טלוויזיות או יחידות תלויות קונטקסט: על FPGAs, מעצבים לעתים קרובות ליישם מזון קדימה, מהפכת או רשתות חוזרות באמצעות ארכיטקטורת מערך סינתיות.לדוגמה, שכבת LSTMtimmate יכולה להיות סגורה באופן דרסטי לתוך מכונה ממשלתית שלוכדת את שערי המעבר בתוך משקל יחיד.
שפה צוה
ציוני אקוסטי להאכיל קודר אשר מחפשים את רצף המילה הסביר ביותר באמצעות הגה lexicon ומודל שפה. Weighted-state Transducers (WFSTs) הם פורמליזם פופולרי שניתן לצרף לתוך גרפים סטטיים וחצוב בסגנון beam-search. על FPGA, הרכב WFST, קביעת ואלגוריתמים מינימיזציה יכולים להיות מיושם כמו דפוס קבוע, מקודמת על ידי ניקוי עצבי, ניתן לנגב.
מודלים של End-to-End על Hardware
פיתוח ארכיטקטורות קצה מקצה לקצה כמו RN-Transducer ו- Transformer-Transducer לפשט את המודל על ידי צריכת תכונות אודיו ופלט של מילות ישירות.המבנה הקודר שלהם מפות באופן טבעי צינורות FPGAmple. קידוד הוא בדרך כלל ערימה של שכבות תגובה עצמית שניתן למקבילה על פני עמודות DSP.
High-Level Synthesis and Development Toolchains
(הופנה מהדף FPGA דרש מומחיות חומרה עמוקה כיום, HLS מיצרנים מרכזיים יאפשרו למפתחים לכתוב קוד אלגוריתם ב C++ ו-Samstation for Openilog.FLT:0Xilinx Vitis HLSFLT 1 ו-FLT:2 Intel FPGA עבור OpenFLT 3 משמשים נרחב עבור פרויקטים של עיבוד דיבור.
שיקולים עיצוביים מעשיים
נקודה קבועה Arithmetic
פעולות נקודתיות צורכות משאבים FPGA משמעותיים ולעתים קרובות כואבות מהירות השעון.זיהוי דיבור DNNs לסבול דיוק מופחת באופן בולט היטב.שימוש 8 סיביות integer (INT8) משקלים והפעלה יכול לחתוך את השימוש ב-DSPnum על ידי גורם של ארבעה בהשוואה ל-FP32, תוך שמירה על קצב שגיאות בתוך שולי ניקוי סלקטיביים.
זיכרון Bandwidth Optimization
גישה חיצונית DRAM היא צוואר בקבוק נפוץ.על בלוק RAM יכול לאחסן ערכות משקל שלמות עבור מודלים קטנים של מילות מפתח ניתוק מילות מפתח, אבל מודלים דיבור רציף גדול יותר חייב לייעל משקל מן הזיכרון החיצוני. מעצבs אופטימיזציה של זרימת הנתונים על ידי שימוש רב-אפקטיבי של שימוש בפרמטרים מתקדמים יותר של זיכרון CR) באמצעות קידוד RAM רב-פורט כדי להטעינה עם טביעת רגל יעילה.
מודל קומפרסוציה טכניקות
לוחצים, שיתוף משקל, ועומס נמוך להפחית את טביעת הרגל הזיכרון וספירת DSP. רשת מחוספסת מכילה הרבה אפס משקל שניתן לדלג על ידי הוספת לוגיקה פשוטה במניעת FPAs, מותאם אישית למנועי מטריקס מרובים ניתן לבנות כדי לנצל את דפוס אחסון ספא קבוע זה ללא ראש כי CPUs ו GPUs בחשבון הסקטורים בתוך מעבר משינוי זה הופך את המודל ידידותי במיוחד.
חומרה-Software Partitioning
לא כל חלק של המערכת מרוויחה מביצוע חומרה.שליטה-כבד משימות כמו חיפוש באם הסופי או תוצאה לאחר עיבוד עשוי לפעול ביעילות רבה יותר על הליבה ARM קשיח מוטבע במערכת FPGA-על שבב (SoC) כמו ציוני Zynq UltraScale + או Agilex SoC. העיצובים הטובים ביותר משתמשים אינטראקציה מבוססת אירוע: הלוגיקה המפריעה למעבד כאשר תוצאה חדשה זמינה עבור מחזור אחסון חלקי של אבטחה, כולל לחץ דם חלקי, כולל של ממשק הבית.
השוואה עם פלטפורמות חלופיות
CPUs נשאר ברירת המחדל עבור ענן ASR, אבל שלהם per-core דרךput הוא מוגבל ואמת ערבויות בזמן אמת קשה לשמור על עומס. GPUs לספק ערכת השקעות מעולה עבור תמליל לא מקוון, אבל להוסיף שקיפות מוגזמת כאשר מסגרות חייב להיות מעובד אחד על ידי אחד; כוח שלהם לצייר גם עושה אותם unractical עבור התקנים קצה, כמו אלה של TPU או דיבור מותאם אישית, אבל לא יכול להיות שונה הפונקציונליות זמן קצר לאחר ניתוח מוקדם יותר.
מחסומים אמיתיים ומקריות
מערכות פיקוד קוליות של כלי רכב אימצו את FPGAs כדי לענות על בטיחות פונקציונלית מחמירה דרישות בעלות נמוכה בזמן השימוש רעש קומפקטיות , ממשקי אינטרנט תעשייתיים מבוססי PFPN, תוך כדי הפעלת FPGA, ללא זיהוי מילים על ידי מערכת הפעלה מהירה של מערכת דיבור נמוכה יותר, אשר מאפשרת ל- FPGAs דיבור אולטרה-מרפאים של חולים עם dysarthria, הפעלת מודלים מותאמים אישית שניתן לתקן באמצעות שימוש באמצעות שימוש ב-Creperation באופן ברור של ספקי דיבור של אבטחה של אבטחה של אבטחה לשימוש ב-Rep.com.
המונחים: growth
בנוסף, עקומת הלמידה התלולה של עיצוב חומרה מסורתי מושתחת על ידי מערכת אקולוגית הולכת וגוברת של מסגרות, ליבות IP ותמיכה קהילתית. קורסים מקוונים מ-FPGA ספקים ופלטפורמות כמו קורסה היעד ASR האצה במיוחד.אדריכלות טרום בנויות על פני Python, כגון יחידת עיבוד Deep Learningulation (DPU) מ-Sillinx, ניתן לשלב ללא כתיבת קו של HDL. יתר על ידי קוד פתוח של מהנדסי-Reposito-Repodows של זמן קצר יותר מאשר להתחיל מודלים של זמן קצר יותר מאשר מודלים של פורמטים מהירים.
כיוונים עתידיים ב-FPGA דיבור הכרה
כמה מגמות השרתים מצביעים על אימוץ רחב יותר. Edge-cloud אדריכלות היברידית ישתמשו FPGAs בקצה הרשת כדי לבצע את המעבר הראשון של ASR, הסרת התחדשות מורכבת לענן רק כאשר האמון הוא נמוך.ההופעתן של פלטפורמות מחשוב הסתגלות אשר לערבב את ה-FPGA עם מנועי AI קשיחים (כמו סוף סוף ACAP) יפר את היעילות עם afunctional-accelers, בעוד ש-FGrepertatives-Rempreativesssssss-Rempreatives-uption מאפשר ל-uption פונקציות הפעלה באופן ישיר של מערכת הפעלה מחדש של מערכת הפעלה מחדש של מערכת הפעלה מחדש של מערכת הפעלה מחדש של מערכת הפעלה של מנועי AI פתוח באופן ישיר עם מנועים עם מנועים).
מסקנה
FPGAs מביא יכולת ייחודית להכרה בדיבור בזמן אמת: היכולת ליצור מותאמים אישית, מקבילה מאוד נתונים כי לשמור על אודיו הזרמה תוך צריכת חשמל באופן דרמטי פחות מאשר מעבדים קונבנציונליים.עם כלים מתקדמים HLS, גדל מסגרות מודלים-להקשים, והיסטוריה עשירה בעיבוד אותות, FPGA התפתח ממכשיר נישה לתוך פלטפורמה מבוזרת עבור ממשקי קול, כמו גם מיומנויות זיהוי מהיר, ולהוביל של מערכות אבטחה, לא יהיה מסוגלות של אבטחה, ומיומנויות חומרה גבוהה יותר, 000 מודעות מיידיות, ולא יכולות חומרה, להמשיך להתמקד יותר, ומיומנויות חומרה, ולא יכולות אבטחה, להמשיך להתמקד יותר, AI- AI- AI, להמשיך להתמקד יותר, ומיומנויות חומרה גבוהה של מערכות אבטחה, כמו גם על ידי מערכות אבטחה, 000 יעיל יותר, 000 יעיל יותר, 000, 000 יעיל יותר, 000 יעיל של מערכות אבטחה, 000 מודעות, 000 יעיל יותר, 000 מודעות, 000, 000, 000 יעיל יותר, 000 מודעות, 000 יעיל יותר, 000 יעיל יותר, 000 מודעות, 000 מודעות, 000 מודעות, 000 מודעות, 000 יעיל יותר, 000 מודעות, 000, 000, 000, 000, 000 מודעות, 000, 000, 000 מודעות, 000 יעיל יותר, 000 יעיל יותר, 000 מודעות, 000 יעיל יותר, 000 מודעות,