Table of Contents
מדוע להשתמש במיקרו-בקרים עבור זיהוי קולי?
טכנולוגיית זיהוי קול מוטבעת יותר ויותר באלקטרוניקה לצרכנים, בקרות תעשייתיות ומכשירי IoT.בעוד שמעבדים מתקדמים ומעבדי אותות דיגיטליים ייעודיים (DSPs) שולטים בנוף, מיקרו-בקרים PIC מציעים איזון משכנע של עלות, יעילות חשמל, וקלות פיתוח עבור יישומים הדורשים זיהוי שליטה פשוט ולא עיבוד שפה טבעית.
היתרונות של PICs עבור זיהוי קולי מרחיבים מעבר לכלכלה.המערכת האקולוגית העצומה של מדפים, מתכנתים, וספריות קהילתיות מקטין את זמן הפיתוח. גירסאות PHz רבות כוללות ממירים אנלוגיים-לספרטיים משולבים (ADCs), מקבצים ואפילו מאובנים, ומאפשרות חיבור ישיר של חיישנים אודיו עם מעגלים מינימליים.
עם זאת, אתגרים נשארים.מגבלה הליבה היא חישובית דרך מחשב. A טיפוסי PIC18 פועל ב- 64 MHz יכול להופיע סביב 16 MIPS, הרבה פחות מאשר ARM Cortex-M4 או DSP. זה מגביל את המורכבות של אלגוריתמים מזהים שיכולים לרוץ בזמן אמת.בנוסף, על-chip RAM מוגבל לעתים קרובות כמה קילויביות, אשר מגבילים את המספר ואת הגודל של תבניות קוליות יכול להיות אלגוריתמים כגון מחשבי (כלומר, כלומר, כלומר, כלומר, כלומר, כגון אחסון RAM) הוא לעתים קרובות מוגבל לאחסון נתונים חיצוני (לדוגמה, אחסון RAM על-מתאים) אלגוריתמים של אלגוריתמים של אלגוריתמים כגון אחסון על-מתאים לשימוש מסד נתונים חיצוניים.
למרות מגבלות אלה, מיקרו-בקרים PIC הם בחירה פרגמטית עבור מערכות אשר לזהות פחות מ-20 פקודות נפרדות עם דיוק מקובל בתנאים אקוסטיים מבוקרים. יישומים כגון מנורות שולחן, אוהדים חכמים, ממשקי אוטומציה בית בסיסיים נהנים מהתגובה ה ⁇ של PIC ותגובה מהירה של התעוררות בשינה.
דרישות אבטחה קוליות על PIC
בחירת מיקרופון ו-Pre-amplifier
מיקרופון באיכות גבוהה של photoret condenser (ECM) או מיקרופון MMS ממיר גלים אקוסטיים לתוך מתח אנלוגי. עבור מערכות מבוסס PIC Hz, ECM עם רגישות של -44 dBV /Pa הוא טיפוסי. המיקרופון חייב להיות יחד עם מוצץ טרום-מדגם כדי להביא את רמת האות עד טווח קלט של ADC (למשל, 0-3.3 או 0.2 גרם) עם רמת דיוק נמוך (D2D) עם 0.
עבור מערכות מרובות-מוממנות או סביבות רועשות, לשקול מערך מיקרופון שונה ו-Pre-amplifier עם שליטה אוטומטית על רווח (AGC) כדי לשמור על בידוד עקבי.
המונחים: Analog-to-Digital Conversion
ADC הפנימי של PIC חייב להיות מוגדר עבור דגימה מתמשכת בקצב לפחות פעמיים את התדירות הגבוהה ביותר של עניין (משפט Nyquist) עבור דיבור, שיעור דגימה של 8 kHz (8-bit) הוא המינימום עבור אי יכולת למידה; 16 kMA להפריע CDC באופן קבוע הוא מומלץ עבור זיהוי.
זיכרון ואחסון
תבניות קוליות דורשות אחסון מתמשך.זה יכול להתבצע עם SPI EEPROM חיצוני (למשל, 25LC256) או SPI פלאש הרץ (למשל, W25Q64) מתוכנת עם פקודות מוקלטות מראש בשלב אימון. מודול כרטיס SD הוא חלופה עבור אבטיפוס.עבור מערכות עם פקודות רבות, S חיצוני או PSRAM עשוי להיות נחוץ במהלך ההכרה להחזיק את ההשוואה עבור 8 סיביות.
זיהוי קולי של אלגוריהם מתאים ל-PIC
עיצוב: Cross-Correlation
האלגוריתם הפשוט ביותר עבור זיהוי מילים הוא תבנית מבוססת אנרגיה תואם.ה-PIC לוכד מסגרת אודיו באורך קבוע (למשל, 500 מ's הראשונים לאחר זיהוי פעילות הקול) ומנרמל את ה amplitude.התבניות מראש מוזמנות גם הן לנרמלות (pIC-correlation) בין האות שנתפס וכל תבנית מוקטת.
מגבלות כוללות רגישות לשינויים במהירות הדיבור ועוצמה רקע מוגבלת.עדכון כמו הסרת שתיקה ונורמליזציה אנרגיה מסייע.עבור דיוק משופר, האלגוריתם יכול גם להשתמש בקצב של אפס-קרוסה ואנרגיה קצרה כמו תכונות לפני קורלציה.
דינמי זמן מלחמה (DTW) עבור מהירות משתנה
DTW היא טכניקה ידועה המיישרת שתי סדרות של אורכו שונים כדי למצוא את המשחק הטוב ביותר.זה חישובי כבד יותר מאשר קורלציה פשוטה אך חיוני עבור יישומים דיבור רב-קולאריים או חינם-לייטים. חישוב בסיסי עבור תהליך של 4000-הטווח נגד תבנית של 4000 מ"ר (Savine) כולל בניית ממטרת עלות של 4000x4000, אשר אינה מעשית על פני PIC, התאמות של זמן קצר (R) ו-Apample) ו-ample) עם זאת, אך ניתן להפחית את משך זמן קצר של 2, אך ורק 2, 000 גרם ל-Tratexi) של סגסוגת APTi) של 2, אך ורק 2, 000 max2 (R.
ניתוח תדירות השימוש ב-FFT
מלא- ⁇ cepstral coefficients (MFCC) הם התכונה הסטנדרטית עבור זיהוי דיבור.מיצוי MFCC דורש שינוי מהיר של ארבעה יותר (FFT), אשר מאתגר על PIC. עם זאת, גישה פשוטה היא להשתמש 64 נקודות או 128 נקודות אמת FFT כדי לחלץ אנרגיה ספקטרלית בכמה להקות קריטיות (למשל, 0-1 k, 1-2-2, כלומר, לדוגמה, מספר גרסאות של FIC).
מערכת זיהוי פקודות פשוטה
מערכת אדריכלות
מערכת שלמה כוללת את המיקרופון ואת המפיץ המחובר לקלט ADC על PIC. The PIC שולט LED סטטוס, azer עבור משוב, ואת ממסר פלט או ממשק סידורי כדי לעורר פעולות. כפתור דחיפה נכנס למצב אימון.הקושחה מזהה מכונה המדינה: מזהה, אלגוריתם קידוד, RECORD, RECING, RECING, NDPO במהלך דגימות אנרגיה 2 אינץ ', ולאחר מכן הקלטה הוא ממשיך רזולוציה של 200 שניות.
שלב אימון נגד הכרה
בשלב ההכשרה, המשתמש אומר שכל פקודה (למשל, "על", "off", "dim") מספר פעמים.האמירות הנתפסות נשמרות בזיכרון חיצוני יחד עם תווית.עבור מערכות פשוטות, התבנית היא כל גלפורת הגלם הגולמי (לאחר הנורמליזציה) עבור יישום מתקדם יותר, תכונות PICs לחלץ (למשל, אפס קרוס ואנרגיה למסגרת) וחנויות למסגרת) וניתן לכלול את התבניות של מערכת אימונים מרובות.
שיקולים מעשיים
זיהוי פעילות קול (VAD) חייב להיות אמין כדי להימנע מגורמים מזויפים.סף אנרגיה פשוט עשוי להיות לא מספיק בסביבה רועשת; לשקול שימוש באלגוריתם דו-צדדי עם estimation רעש רקע מעודכנים במהלך תקופות שתיקה.בנוסף, המערכת צריכה לפענוח כפתור האימון ולספק מהירות ראייה או ויזואלית בהתאם לאימון (למשל, "לדוגמא עכשיו פקודה" באמצעות ® מראש WAV או תבנית מבוססת היטב עם דיוק).
הרחבת הקיבולת עם מעבדים חיצוניים ושירותי ענן
שימוש ב- Voice Recognition ICs
כאשר כוח העיבוד של PIC אינו מספיק, שילוב שבב זיהוי קול ייעודי כמו FLT:0HM2007igtureFLT 1 או FLT:2Elechouse V3uaFLT 3 מודול מפשט את הפיתוח. אלה ICs להתמודד מראש עיבוד והכרה במצב לא מקוון, תקשורת עם PIC באמצעות מערכת יחסים מקבילה או מקבילה.
פיזור לענן באמצעות Wi-Fi
הוספת מודול Wi-Fi (למשל, ESP8266 או ESP32) ל- PIC פותח גישה לשירותי דיבור בענן כגון Google Speech-to-Text, Amazon Alexa Voice Service, או נקודות קצה ענן מותאמות אישית.ה-PIC לוכד את ה-Selows ושולח אותו על UART למודול ESP, אשר מזרם אותו לענן על MQTT או HTTP.
גישה היברידית ל- Edge AI
(הופנה מהדף TinyML מאפשר מודלים פשוטים ברשת עצבית (למשל, מחובר לחלוטין או Conv1D) לרוץ על מיקרובקרים מסוג PIC-class על ידי שימוש בשרשרת כלים כמו FLT:0TensorFlow Lite MicrovinFLT 1D, מפתחים יכולים להכשיר מודל של מילת מפתח ב- MicroCLT2, ולהפיץ אותו כספרייה C++ מגובשת ל-PLTIC דורש רק כמה מאות זיהוי של IF2, ללא קשר עם C2, עם C2.
יישום אמיתי בעולם ושיקולי עיצוב
שליטה בבית חכם
מתג אור מבוקר קולי באמצעות PIC18 ותבנית מאומנים מראש שנקבעה ל"on" ו-"off" יכול להחליף מתג קיר מסורתי.היחידה יכולה להיות מופעלת סוללות (באמצעות מצב שינה בין פקודות) ולתקשר עם ממסר באמצעות transistor.עבור פעולה אמינה, יש לתת שיקול לביטול אקוסטי (אם המיקרופון קרוב לרמקולים) ולמנוע הכרה מקרית של צלילים.
מכשירים נגישים למשתמשים
PICs כבר בשימוש בטכנולוגיה עזרית כגון כסאות גלגלים מבוקר קול או יחידות בקרה סביבתיות עבור משתמשים quadriplegic. ביישומים כאלה, בטיחות היא רבתי; PIC חייב ליישם צעד אישור ( ⁇ המילה או להשתמש בהגר שני) כדי למנוע חיובי. a חומרה שעון כלב שמירה על חומרה מבטיח את המערכת לאפס אם התוכנה תולה עבור משתמשים מרובים, טכניקות הסתגלות ניתן להוסיף על ידי תבניות מרובות עבור פקודות.
מערכות ללא ידיים
עבור מודולי רכב לאחר שוק, PIC24 עם אוטובוס יכול לקבל פקודות קוליות כדי לשלוט חלונות, אורות, או מידע.מודול מתחבר ל -12 V אספקת רכב ומשתמש מקדמה של רעש כדי לדכא מנוע ורעש כביש. Commands כמו "אורות על" או "רדיו" מוכרים, ואת PIC שולח הודעות מתאימות יכול כי טווח טמפרטורות רכב מ -40 מעלות ל -2C לטמפרטורה / C.
מגמות עתידיות: רשתות קטנות ונואל על PIC
שילוב של למידת מכונה לתוך מיקרו-בקרים מאומצים משאבים הוא מאיץ חברות כמו Microchip עכשיו להציע ספריות ייעודיות עבור בינה מלאכותית ורשתות עצביות. משפחות PIC עתידיות עשויים לכלול מאיצים חומרה עבור רב-תכליתי של ממטריקס או פורטל, מה שהופך את הקול בזמן אמת עם למידה עמוקה עד אז, מפתחים יכולים להשתמש ב pruning,ization, וידע כדי להפיץ מודלים קטנים (Ficifchip 32) עבור פתרונות LT2.
מסקנה
מיקרו-בקרים PIC נשארים פלטפורמה מעשית ויעילה להטמעת יכולות זיהוי קולי בסיסיות למכשירים ייעודיים.המפתח להצלחה הוא התאמת המורכבות האלגוריתמית למשאבים של המיקרובקר, חומרה לקניית אודיו נקייה, ושימוש בתמיכה חיצונית (המוכרת ICs או שירותי ענן) כאשר המשימה גדלה מעבר למערך פקודות פשוט.