Table of Contents
מבוא ל-Nural Networks in non-Liנארי control
בעיות בקרה לא לינאריות להנדסה מודרנית על פני הרובוטיקה, המרחב, הרכב, תעשיות תהליכים ומערכות אוטונומיות.בניגוד מערכות לינאריות, התפוקה של מערכת לא לינארית היא FLT:0 לא פרופורציה ל-FLT 1 ולא מחזיקה במורכבות העל-חושית זו הופכת את הטכניקות המסורתיות של בקרה לינאריות כגון בקרים של PID או המדינה ללא הגבלה, אפילו כאשר מחוץ לאזור הפעילואלי, יש להם בעיות לוואי (N) ממערכות למידה אוניברסליות, כמו אלה, כמו אלה, כמו אלה, כמו אלה, כמו אלה, או שיטות בקרה אוניברסליות, כמו אלה, כמו אלה, כמו מנגנונים אוניברסליות, כמו מנגנוני בקרה).
רשתות נילי אטרקטיביות במיוחד משום שהן יכולות מודל מיפוי לא ליניארי מורכב ללא צורך במודלים מתמטיים מפורשים של המערכת.זה חיוני כאשר הפיזיקה הבסיסית היא לא מובן, לא בטוח מאוד, או זמן-מה-מהמרוע. על ידי למידה הדינמיקה של המערכת באינטרנט או לא מקוון, בקרים מבוססי רשת עצבית יכולים להתאים, להכלל, ולשמור על הביצועים שבהם שיטות קונבנציונליות נכשלות.
יסודות של שליטה לא ליניארית ולמה רשתות ריאה?
הקושי של מערכות לא לינאריות
מערכות לא ליניאריות מציגות התנהגויות כגון נקודות איזון מרובות, מחזורי גבולות, דופורציות, ותוהו ובוהו. מטרות שליטה כמו ייצוב, מעקב והפרעה דחייה להיות הרבה יותר קשה כי התגובה של המערכת משתנה עם תנאי הפעלה. בקרה ליניארית קלאסית מסתמכת על לינאריזציה סביב נקודה הפעלה קבועה, אבל זה מחיאות מקומיות מתפרק כמו המערכת מתרחקת מנקודת מבט זו.
יתר על כן, צמחים רבים בעולם האמיתי יש דינמיקות ידועות או חלקית ידוע.גם כאשר מודל ראשוני של עקרונות קיים, פרמטר אי-וודאויות, אפקטים לא מתודגמים, והפרעות סביבתיות דורשות גישה הסתגלות או מבוססת למידה.
למה רשתות לוגיות?
לרשתות נילי יש כמה תכונות שהופכות אותם מתאימים במיוחד לשליטה לא ליניארית:
- (FLT:0) נספח בלתי-רגיל: ⁇ 1) רשת עצבית להאכיל עם לפחות שכבה נסתרת אחת ומספר מספיק של נוירונים יכול להיות משוער כל פונקציה רציפה על פני תחום קומפקטי לכל דיוק הרצוי, כפי שנקבע על ידי המשפט האוניברסלי של התוספתן.
- (FLT:0) ,Adaptability and Learning:FLT:1 באמצעות למידה מבוקרת, לא מפוקחת, או חיזוק, רשתות עצביות יכולות לעדכן את הפרמטרים הפנימיים שלהן (משקלים והטיות) כדי לשקף שינויים בדינמיקה של המערכת.זה מאפשר הסתגלות מקוונת ללא צורך במערכת שלמה של זיהוי מחדש.
- עיבוד:0 (Parallel: FLT:1) האופי המופץ של חישוב עצבי מאפשר הערכה מהירה של מזון קדימה, אשר קריטי עבור שליטה בזמן אמת שבו מרווחים דגימה יכול להיות קצר כמו מילימטרים.
- (FLT:0) רובוטות ל Noise:FreaLT:1 עם הכשרה נכונה, רשתות עצביות יכולות לסנן רעש מדידה ולהגיש נתונים חלקיים או מושחתים, תכונה חיונית עבור לולאות חיישן מעשי.
תכונות אלה הניעו מחקר נרחב על שליטה מבוססת רשת (NNC)BuildFLT:1, ויצרו שדה עשיר בצומת של למידת מכונה ותאוריה שליטה.
אדריכלות רשת ערפילית של שליטה
רשתות ניאל (FN)
האדריכלות הפשוטה ביותר בשימוש נרחב בשליטה היא ההמולה הרב-שכבתית (MLP) עם אחד או שניים שכבות מוסתרות. FNs בדרך כלל מועסקים עבור היערכות פונקציה סטטית, כגון למידה הדינמיקה המעוותת של מניפולטור רובוטי. בשליטה ישירה בפסורים הפוכה, הרשת מאומנת למפות הרצויות (למשל, זוויות משותפות) לשליטה הנדרשת (Nque), לא רק ערכים נוכחיים, אלא גם על גבי מיפוי נכון, אלא על גבי למערכות זיכרון נוכחיות (N) או על גבי למערכות הקודמות).
Recurrent Neural Networks (RNNs) וזיכרון לטווח קצר ארוך (LSTM)
עבור מערכות עם דינמיקות - שבו המדינה מתפתחת לאורך זמן ותלויה קלטות קודמות ומדינות - רשתות חוזרות הן בחירה טבעית. RNs יש חיבורי משוב פנימיים שנותנים להם זיכרון של אותות העבר.זה הופך אותם יעילים לזיהוי מערכת (לימוד תפקוד המעבר של צמח) ועבור בקרת מודל חיזוי שבו יש לחזות תפוקה עתידית על פני אופק.
רשתות ערפיליות אבולוציה (CNN) ומודלים היברידיים
בעוד ש-CNN משמשים בעיקר לעיבוד תמונות, הם מצאו יישומים בשליטה כאשר משוב חזותי מעורב.לדוגמה, CNN יכול לעבד תמונות מצלמה כדי להעריך את המדינה (למשל, מיקום של אפקט קצה של מנדר), ולאחר מכן רשת שנייה או בקר סטנדרטי מייצר את אות הבקרה.
Reservoir מחשוב / Echo State Networks (ESN)
עבור הכשרה מהירה מאוד ושליטה בזמן אמת, רשתות מצב הד (סוג של מחשוב מאגר) צברו מערכתיות.הרעיון הוא להשתמש במאגר קבוע חוזר אקראי כי המפות אותות קלט לתוך שטח רב-ממדי, ורק להכשיר שכבת פלט ליניארית פשוטה.אימון הוא יעיל מאוד (פתרון של נסיגה ליניארית), מה שהופך ESN מתאים לשליטה מתאימה להתאמה מקוונת ביישומים כמו דיכוי רעטרנטי בסיוע רובוטי או שליטה בזמן אמת.
כל אדריכלות מביאה את החילופים המסחריים בין כוח ייצוגי, מורכבות אימונים, ועלות חישובית.הבחירה תלויה בבעיה הספציפית של שליטה ובמשאבים חישוביים הזמינים.
אסטרטגיות שליטה מבוססת רשת
החוקרים פיתחו כמה פרדיגמות שמשלבות רשתות עצביות לתוך הלולאה השלטת: שלושת הבולטים ביותר הם (FLT:0) שליטה ישירה FLT:1,FLT:2neural Modelductionive control (NM)FLT 3: ו-FLT:4adaptive controlFLT:5 כל אחד מהם הוא דנו בפירוט להלן.
בקרה ישירה
בשליטה ישירה, הרשת העצבית לוקחת על עצמה את התפקיד של הבקר עצמו.הרשת מקבלת את המצב הקיים (או קבוצה של מדידות רלוונטיות) ותוצרת ישירות את אות השליטה.האימון יכול להתבצע ללא הפרעה באמצעות איסוף נתונים של מיפוי המדינה-לשליטה הרצוי (למשל, ממומחה אנושי או בקר אופטימלי), או באמצעות חיזוק מקוון (RL).
דוגמה קלאסית אחת היא:0neuro-controlFearLT:1 [של מעקב אחר זרוע רובוטית: רשת להאכיל קדימה מאומנת ללמוד את הדינמיקה הפוכה של הזרוע: בהתחשב האצה הרצויה, הרשת מפצה את התוספת המשותפת.לאחר אימון, הרשת יכולה ליישר פקודות בשבריר של מ"ט שנייה", המאפשרת שליטה גבוהה על פני השטח (האתגר העיקרי עשוי להיות מאופק או מפלט) של ג'ייקוב, או אלגוריתמים מיוחדים, כלומר, ייתכן שצריכים להיות בעל השפעה על ידי מיפוי (אך).
בלמידה חיזוקית, הרשת העצבית פועלת כתוכנית מדיניות של ⁇ .הסוכנת אינטראקציה עם הסביבה, אוספת תגמולים (או עלויות), ומעדכנת את משקלה כדי למקסם את הפרס המצטבר. שליטה עצבית ישירה מבוססת RL הוכח בהצלחה בייצוב, מניפולציה רובוטית ומשחק (למשל, AlphaGo).
בקרת מודל נידור (NMPC)
בקרת מודל (MPC) פותרת בעיית אופטימיזציה מקוונת בכל שלב: בהתחשב במודל של הצמח, היא קובעת רצף של פעולות שליטה עתידיות הממזערות את תפקוד העלות על פני אופק חיזוי, בכפוף למגבלות.איכות MPC תלויה במידה רבה דיוק המודל.רשתות נילי משמשות כדי ללמוד מודל זה מהנתונים, החלפת המודל המסורתי מבוסס הפיזיקה.
היתרונות הם משמעותיים: מודל הרשת העצבי יכול ללכוד דינמיקות מורכבות, לא ליניאריות שקשה להפיק מבחינה אנליטית.לדוגמה, בשליטה בתהליך כימי, מודל רשת עצבי של כור יכול לחזות ריכוזים עתידיים וטמפרטורות, המאפשר MPC לחדד עמדות שסתום אופטימליות תוך שמירה על מגבלות בטיחות.היד חישובית היא עלות חישובית - פתרון אופטימיזציה בכל מדגם יכול להיות תובעני, במיוחד עם רשתות מתקדמות בתהליכים יעילים ומאובטחים כמו GCCSPU יעיל אפילו תהליכים אוטונומיים.
גרסה פופולרית היא רשת LT:0 â € â € ¢ â ¢ ¢ â ¢ ¢ â ¢ ¢ ¢ â ¢ ¢ â ¢ ¢ ¢ ¢ ¢ ¢ ¢ ¢ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
בקרה נורמטיבית
שליטה הסתגלותית יש מסורת ארוכה בתיאוריה של שליטה, שבו הפרמטרים של בקר (גינס) מותאמים באינטרנט כדי להתמודד עם וריאציות פרמטרים. רשתות נילי לשדרג את הרעיון הזה על ידי מתן התאמה של פרמטרים לא לינאריים.יש שתי גישות עיקריות:
- (FLT:0) בקרה עצבית אדפטית: 1.10.10.הבקר הוא רשת עצבית שמשקלותיה מחוונן באינטרנט כדי למזער כמה מעקב או מידה של יציבות.לדוגמה, חוקי הסתגלות המבוססים על ליפסנוב נגזרים על מנת להבטיח שמערכת ה-DLP סגורה תישאר יציבה בעוד הרשת לומדת.זה נפוץ ביישומים כמו אקסוקטונים רובוטיים, שם שינוי אינטראקציה אנושי-בוטי באופן דרסטי.
- (FLT:0) בקרה עצבית אדפטיבית: FLT:1 שתי רשתות משמשות: אחת פועלת כמזהה (מודל של הצמח) והשנייה כמו הבקר.ה המזההה מעודכנת באינטרנט בהתבסס על נתונים של קלט- ⁇ , והבקר הוא חישוב מחדש (או מעודכן) בהתבסס על המודל המזוהה.
בקרה עצבית הסתגלותית הוכיחה יעילות עבור מערכות עם פרמטרים של זמן, כגון בקרת טיסה מטוסים, שבו חסכוניים אווירודינמית משתנים עם גובה ואך מספר, או עבור בקרת מגרש טורבינות רוח תחת מהירויות רוח שונות.האתגר העיקרי הוא להבטיח כי הסתגלות אינה מובילה לאי יציבות או מאמץ שליטה מופרז - ניתוח יציבות קפדני נדרש, לעתים קרובות באמצעות תורת ליפסנוב או טיעונים חולפים.
רשתות נריות לשליטה
אימון עם Machine Learning
כאשר קיימת גישה מספקת של נתונים המייצגים זמין, מודלים ברשת העצבית יכולים להיות מאומן באמצעות למידה מבוקרת סטנדרטית.עבור זיהוי מערכת, נתונים של קלט- ⁇ נאספים מהצמח, והרשת מאומנת לחזות תפוקה עתידית.טכניקות כמו טיפת, עצירה מוקדמת, וסיוע להגדלת נתונים כדי למנוע התאמה.לאחר אימון, הרשת יכולה להיות ממוקדת ומשמשת כמודל (למשל, ב- NMP) או בקר ישירות.
הכשרה מקוונת והתאמה בזמן אמת
אימון Offline לבד הוא לעתים קרובות לא מספיק כי המערכת עשויה לפעול באזורים שאינם מכוסים במהלך אימון, או הפרמטרים שלה עשויים סחף.אימון מקוון מאפשר לרשת להתאים ברציפות.זה יכול להיעשות באמצעות שיטות מבוסס ⁇ (למשל, ירידה ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ עם מומנטום) או recursive לפחות ריבועים, אבל יש ליישם בזהירות כדי למנוע הקרנה של הצמח.
בלמידה חיזוקית, הכשרה היא מקוונת (או אצווה-online כמו ב- Deep Q-Networks) הסוכן חוקר את הסביבה באמצעות אסטרטגיה של חיפוש (למשל, epsilon-greedy) תוך עדכון רשת המדיניות. שיקול חשוב הוא יעילות הדגימה: אלגוריתמים רבים של RL דורשים מיליוני אינטראקציות עבור מערכות מורכבות, אשר אינו מעשי עבור חומרה אמיתית.
יישומים של רשתות נילי בשליטה לא ליניארית
רובוטיקה
הרובוטיקה היא אזור היישום הגדול ביותר. נביחות רשת נדור משמשים לשליטה משותפת של טורק, מניפולציה של גוף שלם, ו- locomotion.לדוגמה, FLT:0 עמוק חיזוק למידה FLT:1 שימש כדי להכשיר quadrupeds ללכת לרוץ ולרוץ על שטח מורכב.הרשת העצבית לוקחת קורא (מסורות, IMU) ופלטים כדי לדחוף כל הסימולציות למידה ופעולות באופן בלתי נמנע.
רכב אוטונומי
נהיגה מקצה לקצה - שבו רשת עצבית ממפה תמונות מצלמה ישירות להיגוי ולבקר פקודות - היא יישום בקרה עצבי ישיר.פיוני על ידי מערכת ALVINN בסוף שנות השמונים, גרסאות מודרניות משתמשות ב-CNN עמוקים (למשל, NVIDIA's PilotNet) והופגנו בתנועות אמיתיות.
בקרת תהליכים והנדסה כימית
דינמיקות לא לינאריות טעונות בכורים כימיים, עמודות זיקוק, וחילופי חום.מודלים Nural MPC הראו ביצועים מצוינים במעקב נקודות ודחיית הפרעות, לעתים קרובות outperforming מסורתית ליניארי MPC. לדוגמה, רשת עצבית יכולה מודל הקינטיקה המורכבת של כור אצווה, המאפשרת בקרת טמפרטורה אופטימלית למקסם את התשואות תוך הימנעות תנאים לא בטוחים.
מערכות אוויריות וחילוניות
מטוסים ורחפנים פועלים תחת כוחות אווירודינמיקה לא ליניאריים ורגעים.בקרים ניאוליטיביים נבדקו על מנת לשלוט בסובלנות לקויה, כגון ניתוק על פני השטח של שליטה תקועה על ידי לימוד יעילות השליטה שנותרה. בכלי רכב ימיים, רשתות עצביות משמשים לעמדה דינאמית של כלי שיט תחת מדינות ים שונות.
אתגרים ובעיות פתוחות
למרות הצלחות מרשים, יש להתגבר על מספר מכשולים לפני שבקרי רשת עצביים הופכים לסטנדרט במערכות קריטיות בטיחות.
- (FLT:0) אחריות ו- Robustness:cioFLT:1) להוכיח כי בקר רשת עצבי לא יסיע את המערכת לא יציבה תחת כל התנאים האפשריים הוא קשה מאוד בשל אי-הלינאריות של הרשת עצמה. בעוד שגישות מבוססות לימפונוב קיימות עבור ארכיטקטורות מסוימות, הם לעתים קרובות להטיל הנחות מגבילות.
- (FLT:0) מורכבות חישובית:FLT:1 רשתות עמוק דורשות קידוד משמעותי עבור מעברים קדימה ואחורה. בבקרים מוטבע בזמן אמת עם מגבלות חריפות מחמירות, רשתות פשוטות יותר (למשל, שני שכבות ⁇ -layer) מועדפים.
- דרישות נתונים: דרישות ההרחבה: ElementFLT:1 (מודלים עצביים בעלי אופי גבוה) דורשות נתונים גדולים ומגונים.עבור מערכות יקרות לפעול או בלתי אפשריות להרגשת בטווח התפעול המלא (למשל, כור גרעיני), מחסור בנתונים הוא מחסום מרכזי.עבר למידה ורשתות עצביות מיודעות פיזיקה (PINNs) במטרה להפחית את צרכי הנתונים על ידי הטמעת ידע פיזי קודם.
- (FLT:0) יחסיות: 1.FLT:1 רשתות ניאל לעיתים קרובות נתפסות כקופסאות שחורות.לאישור רגולטורי ואבחון מוטעה, מהנדסים צריכים להבין מדוע בקר קיבל החלטה מסוימת.
- מחקר:0 (FLT:1) בלמידה מקוונת (במיוחד RL), הבקר עשוי לחקור פעולות שמובילות למדינות מסוכנות או מזיקות. אלגוריתמים של RL בטוחים אשר לאכוף מגבלות בטיחות במהלך אימון הם גבול מחקר חשוב.
כיוונים עתידיים
במבט קדימה, כמה מגמות יעצבו את הדור הבא של שליטה מבוססת רשת עצבית:
- (FLT:0) רשתות נילי מתקדמות (PINNs): PH1 על ידי שילוב משוואות שונות חלקית לתוך תפקוד אובדן, PINNs יכול מודל מערכות עם נתונים דליקים תוך שמירה על חוקים פיזיים.זה מבטיח לשלוט במערכות פרמטר מבוזרות כמו מבנים גמישים או זרימה.
- (FLT:0) למד ומעט מאוד הסתגלות:FLT:1 רשתות שיכולות להסתגל לדינמיקה חדשה עם קומץ תצפיות רק יפחיתו מאוד את הצורך באימון לא מקוון נרחב.
- (FLT:0) אינטגרציה עם שיטות פורסטל: אנדרל 1 (שלב בקרים עצביים עם כלי אימות (למשל, ניתוח יכולת, תעודות מחסום) יכול לספק ערבויות גרועות, לנוע לקראת הסמכה של מערכות בקרה מבוססות למידה.
- (FLT:0) Accelerators:FIRLT:1 ייעודי מעבדי רשת עצביים ייעודיים (NPUs) ו- FPGA יהפוך בזמן אמת להיקף של רשתות עמוקות שניתן במערכות משובצות בעלות כוח נמוך, הרחבת יישומים במיקרו-רוטנס ורובוטיקה לבישה.
ככל שהטכנולוגיות הללו בוגרות, רשתות עצביות יהפכו למרכיב סטנדרטי יותר בתיבת הכלים של מהנדס הבקרה, המשלים שיטות קלאסיות ולא להחליף אותן לחלוטין.הסינרגיה בין תיאוריית הבקרה ללמידה של מכונות תמשיך לדחוף את הגבולות של אילו מערכות אוטונומיות יכולות להשיג.
מסקנה
רשתות נילי הפכו את הנוף של שליטה לא ליניארית, המאפשר פתרונות לבעיות שהיו בעבר בלתי-מחושים עם שיטות ליניאריות.היכולת שלהם לדינמיקה מורכבת משוערת, להסתגל באינטרנט, וללמוד מהנתונים הופכת אותם הכרחיים עבור הרובוטיקה המודרנית, כלי רכב אוטונומיים, ובקרת תהליכים מתקדמת.בזמן אתגרים הקשורים ליציבות, עלות חישובית, ופירושיות להישאר התקדמות מהירה באלגוריתמים, חומרה והבטחות להתגבר על מחסומים ופעולות חכמות אלה.
(ב) ראו את העבודה הבסיסית על זיהוי רשת עצבית לשליטה על ידי FLT:0Narandro ו- Parthasarathy (1990), סקר מקיף על למידה עמוקה של חיזוק על ידי שליטה על ידי FLT:2Mnih et al.archía (2015), ו-Ranigive Revisions to MPC על ידי LT:4L.