Table of Contents
הקדמה: ההסכמה של למידה עמוקה ושליטה אופטית
תיאוריית הבקרה האופטימית כבר אבן הפינה של הנדסה מודרנית, מתן מסגרות מתמטיות להיגו מערכות דינמיות להתנהגויות הרצויות תוך צמצום עלות או מקסימום ביצועים.מסלול חלליות תכנון לאוטומציה של תהליכים תעשייתיים, שליטה אופטימלית תחת אינספור יישומים.עם זאת, שיטות מסורתיות כגון פתרונות למידה דינמית, עיקרון המינימום של פונטידמיין בעבר, או תמליל ישיר - לעתים קרובות סובלים מצוואר חישובי חישובי, במיוחד כאשר מערכות גבוהות, כגון מגבלות למידה, כגון יעילות, אך ורק לטווח קצר, אך ורק לאחרונה, אך ורק לטווח קצר, הן מורכבות, כגון תכנות, אך ורק לטווח קצר, כגון תכנות, אך ורק לטווח קצר יותר, אך ורק לטווח קצר יותר, כמו תכנות, כמו תכנות, באופן דרמטי, כמו תכנות, או למידה, באופן דרמטי, או למידה, באופן דרמטי, באופן משמעותי, או למידה, באופן בלתי-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח קצר-טווח-טווח למידה, כמו, החלומי, כמו, כמו, כמו, כמו
מאמר זה בוחן כיצד טכניקות למידה עמוקות מעצבות מחדש את השליטה האופטימלית, המפרטות את העקרונות הבסיסיים, יתרונות מרכזיים, יישומים בעולם האמיתי, ואת האתגרים שנשארים.המטרה היא לספק סקירה מקיפה, סמכותית עבור מהנדסים, חוקרים ומתרגלים המעוניינים במינוף רשתות עצביות כדי לפתור בעיות שליטה ביעילות רבה יותר.
הבנה של שליטה אופטית: קיצור של Primer
שליטה אופטית עוסקת במציאת חוק בקרה הממזער (או ממקסים) קריטריון ביצועים לאורך אופק זמן, בכפוף לדינמיקה של מערכת ומגבלות.
(ב) ⁇ (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
כאן, x(t) הוא המדינה וקטור, u(t) קלט הבקרה, ו- J את העלות פונקציונלי. Solving בעיה זו בדרך כלל דורש שיטות מספריות כי כרוך להפיץ את המערכת קדימה בזמן ופתרון משוואות אדמד לאחור - תהליך המכונה "פתרון" שיטה. עבור מערכות ממדיות גבוהות, קללה של מימד הופכת את התכנות דינמיות, כמו המרחב המהיר עם מספר אקספונמיטיבי של מספר בלתי-פונקטיבי.
גישות מסורתיות כמו מיקום ישיר או ירי מרובים יכול להתמודד עם ממדים בינוניים אבל עדיין לדרוש משאבים חישוביים משמעותיים, הגבלת השימוש שלהם ביישומים שבהם יש לבצע החלטות במילי השניות, כגון נהיגה אוטונומית או מניפולציה רובוטית.
למה מהירות העניינים בשליטה
במערכות זמן רבות בזמן אמת, הפער בין מדידה המדינה לבין פעולת בקרה חייב להיות קטן לחלוטין.לדוגמה, quadrotor חייב להתאים את מהירויות המסתובבות שלו בתדרים מעל 100 הרץ כדי לשמור על טיסה יציבה.פתור בעיה שליטה אופטימלית מאפס בכל שלב הוא בלתי סביר.במקום, מהנדסים לעתים קרובות פתרונות precompute או שימוש במודלים פשוטים - של הקרבה אופטימלית או יכולת למידה עמוקה לאחר מכן לבצע חסימה מינימלית זו עם מדיניות מסחר ללא הפרעה מקוונת.
למידה עמוקה ב- Nutshell
למידה עמוקה היא תת-קבוצה של למידת מכונה המשתמשת ברשתות עצביות מלאכותיות עם שכבות רבות (החשיבות "עמוקה") לדגם מערכות יחסים מורכבות ולא לינאריות.בהתחשב במשאבים איכותיים ומדישובים, רשת עצבית עמוקה יכולה להיות בעלת תפקוד מתמשך לדיוק שרירותי – נכס הידוע כמשפט החיזוי האוניברסלי (International approximation Trial). בהקשר של שליטה, הפונקציה להיות משוערת ממערכות ועד לפעולות בקרה אופטימליות, הנקראות לעתים קרובות "מדיניות LT-0-Ftimopal: 1.
אימון כזה בדרך כלל כרוך למידה מבוקרת (באמצעות נתונים שנוצרו מפתריים מסורתיים) או חיזוק למידה (שם הרשת לומדת על ידי אינטראקציה עם סימולציה של המערכת). שתי הגישות שימשו בהצלחה, כל אחת עם כוחות משלה ונקודות מסחר.
למידה מבוססת על מדיניות Approximation
בלמידה מבוקרת, אחד אוסף נתונים גדולים של זוגות ממשלתיים-פעולה על ידי פתרון בעיות שליטה רבות-לשוניות אופטימליות ללא קשר.רשת העצבית מאומנת למזער את השגיאה החיזוי, מחקה ביעילות את הבקר האופטימלי לאחר אימון, הרשת יכולה לייצר פעולות שליטה כמעט-אופטימיות עבור מדינות חדשות כמעט באופן מיידי, מה שהופך אותו מתאים לפריסת בזמן אמת.
Reinforcement Learning for Direct Policy Search
Reinforcement למידה (RL) עקפה את הצורך בנתונים מראש על ידי סוכן לחקור את החלל המדינה וללמוד באמצעות ניסוי וטעייה. Algorithms כגון Deep Q-Networks (DQN), Proximal Policy Optimization (PPO), ו Soft Actor-Critic (SAC) הראו הצלחה יוצאת דופן במשימות בקרה, החל ממשחקים ב-Atari למניפולגישוריינת אסטרטגיות מורכבות, אשר יכולות לעבור בקרה אנליטית או למנוע הסתברותיות.
כיצד Deep Learning Accelerates Optimal control Computations
מנגנון האצה הליבה הוא (FLT:0) פונקציונלי approximationFLT ( 1:1 פתורים מסורתיים דורשים אופטימיזציה רציונטיבית בכל שלב - הערכה של יעקבים, ביצוע חיפושים קו, או שילוב משוואות שונות לאחור בזמן.רשת עצבית מאומנת, לעומת זאת, פשוט מבצע מעבר קדימה: סדרה של מברקציות מרובות ופעולות לא לינאריות.
מעבר למהירות הגלם, למידה עמוקה מאפשרת גם ל-FLT:0adaptive וחיזוי שליטה על פיתוי:1 [במקום לנסח מסלול מאפס כאשר התנאים משתנים, רשת יכולה להכללת מצבים בלתי נראים, בתנאי שתחום ההכשרה הוא רחב מספיק.יכולות הכללה זו היא מה שהופך את הלמידה העמוקה במיוחד עבור מערכות עם דינמיקות משתנות, כגון מל"ט נושאת תשלום לא ידוע או עומס אינטראקציה עם אובייקטים חד-formיים.
Offline לעומת Online Computation
הבחנה חיונית אחת היא המקום שבו מאמץ חישובי שוכן.שליטה אופטימלית המסורתית מציבה את החישוב הכבד באינטרנט: כל שלב בקרה דורש פתרון תכנית לא לינארית גדולה. למידה עמוקה משנה את רוב החישוב לא מקוון: אימון הרשת הוא אינטנסיבי מבחינה חישובית, אבל הקצוב הוא אידיאלי עבור יישומים בזמן אמת שבו משאבים חישוביים מקוונים מוגבלים אבל הכשרה לא מקוונת ניתן לבצע על רבבים חזקים.
יתר על כן, פעם אימון, אותה רשת ניתן לפרוס על מערכות משובצות עם יכולות זיכרון ומעבד צנועות.לדוגמה, בקר הטיסה של קוואטור יכול לרוץ על מיקרובקר עם צריכת חשמל מינימלית, אך לייצר פעולות שמקבילות למדיניות אופטימלית מלאה.
יתרונות מרכזיים של שליטה עמוקה ללמידה – המבוססת על אופטימאלית
- (ב) ⁇ :0) ביצועים בזמן אמת: 1FLT 1 אי-השוויון במגוון התת-מילי השני מאפשר לולאות שליטה בתחום הקילורץ.
- (ב) ⁇ :0) יכולת לממדים גבוהים: רשתות ניאל יכולות לעבד חללים של מדינה רב-ממדית (למשל תמונות ממצלמות, עננים נקודתיים לידר) שיעלו את הפתנים המסורתיים.
- (FLT:0) ,Adaptability and transfer Learning:FreaLT:1 Networks ניתן לתקן היטב עבור משימות חדשות או סביבות מבלי לאימון מאפס, להפחית את זמן הפיתוח.
- (FLT:0) ניצול של אי-לינאריות: FIRLT:1) מודלים עמוקים מצטיינים בלכידת מיפוי מורכב, לא-קונבוקס המפריך פתרונות סגורים.
- (FLT:0) , מודל תלויות: FLT:1 שיטות RL ללא מודל יכול ללמוד שליטה אופטימלית גם כאשר הדינמיקה הבסיסית ידועה באופן לא מושלם, להסתמך במקום על נתונים.
יישומים אמיתיים
ההיתוך של למידה עמוקה ושליטה אופטימלית כבר נכנע תוצאות מרשימות על פני תחומים מרובים. להלן כמה דוגמאות בולטות.
רכב אוטונומי
מכוניות אוטונומיות חייבות לקבל החלטות מפוצלות שנייה תוך כדי ניווט סביבות דינמיות.מודל מסורתי שליטה חיזוי (MPC) עובד טוב אבל יכול להיות כבד חישובי בעת שימוש במודלים נאמנות גבוהה. חוקרים פיתחו רשתות עצביות לחקות את הפעולות האופטימליות של MPC, השגת ביצועים דומים בשבריר של עלות חישובית חברות כמו Waymo ו- טסלה משלבים למידה עמוקה לא רק עבור תפיסה אלא גם עבור תכנון ובקרת, כדי לייעלת שליטה, כדי לייעלות נתונים כדי לייעלות.
לדוגמה, מחקר משנת 2020 מ-FLT:0 (UC ברקליימירל 1) הראה בקר מבוסס למידה עמוק שיכול להחליף מעבורת MPC מלאה במסלולי הרכב, תוך צמצום זמן חישובי של יותר מ -100 פעמים תוך שמירה על בטיחות.
רובוטיקה ומניפולציה
זרועות רובוטיות שמבצעות את ההרכבה, בחירת מקום, או משימות כירורגיות ליהנות משליטה אופטימלית למזער את האנרגיה והזמן.ד-ה-RL כבר הוחל ללמוד מדיניות מניפולציה עשירה מגע, כגון הוספת peg לתוך חור או פתח דלת.דוגמה בולטת אחת היא העבודה על ידי FLT:0 OpenAIFLT:1 על אימון יד רובוטית לפתרון קוביות של רוביק, שבו מיוצר עמוק עם דומיינים אקראיים עם מדיניות חומרה כללית.
בתרחישים אלה, הרשת העצבית לומדת לחזות לא רק אסימונים משותפים אלא גם לתפוס נקודות ופרופילי כוח, כל הזמן האמיתי.האצה מגיעה מביצוע חישובים דינמיקה הפוכה ומיפוי ישיר של תצפיות ממשלתיות ברמה גבוהה (למשל, זוויות משותפות, משוב טקטי) כדי לשלוט בתפוקה.
מערכות אנרגיה ורשתות חכמות
רשתות חשמל מורכבות יותר ויותר, עם מקורות מתחדשים המציגים סטיות.שליטה אופטית משמשת לאיזון היצע וביקוש, להסדיר את המתח, ולוח הזמנים אחסון, עם זאת, פתרון בעיית זרימת החשמל האופטימלית מלאה הוא NP-Hard עבור רשתות גדולות.Deep Learning-based גישות, כגון למידה מדיניות המשלוח האופטימלית של ניהול אנרגיה מהנתונים ההיסטוריים, יכול ליישר פעולות כמעט-אופטימיות במילימטריים השני: 20A2FR: 20A זמן מוכח באמצעות רשת למידה אופטימחדשת של זמן כדי להפחית את מערכת חישובית של אנרגיה אופטימחדשה אופטימלית של זמן של מערכת חישובית של מערכת חישובית של מערכת חישובית של זמן יעילה יותר מ- 2.
אווירי ודרס
Quadrotors וכלי רכב אוויריים אחרים דורשים לולאות שליטה גבוהה כדי לשמור על יציבות.מודל שליטה חיזוי משמש בדרך כלל אבל לעתים קרובות רץ 50-100 הרץ בשל מגבלות חישוביות.על ידי החלפת המפתור עם רשת עצבית, החוקרים השיגו שיעורי שליטה מעל 1 k. לדוגמה, מחקר מ-FLT:0 ציריך ETHFLT:1 מאומנים עמוק לתפוקה מוטורית ישירות מפסים, כמו מסלולים אגרסיביים.
אתגרים ומגבלות
למרות הבטחתו, למידה עמוקה בשליטה אופטימלית אינה תרופת פלאמה.יש לטפל באתגרים משמעותיים לפני הפריסה הנרחבת במערכות קריטיות בטיחות.
בטיחות ורובוסטנס
(הרשתות הנידוריות יכולות להתנהג ללא ספק מחוץ להתפלגות האימונים.התרעה קטנה במדינה – בין אם מרעש החיישן, קלט רציונאלי, או שינויים סביבתיים בלתי צפויים – עלול לגרום לרשת לתפוקה של פעולה מבוקרת המפרה מגבלות או מערערערת את המערכת: חוסר ערבויות פורמליות הוא מחסום מרכזי לאימוץ יישומים כמו נהיגה אוטונומית או חוקרי רובוטיקה.
יכולת
בקרה אופטימלית מסורתית מספקת תובנה ברורה: הפתרון ניתן לעקוב לאחור אל הפונקציה העלות, המגבלות והדינמיקה.רשתות עמוק, לעומת זאת, הם ⁇ .הבנת מדוע רשת בחרה פעולה מסוימת היא קשה, אשר מסבך את debugging, הסמכה, אישור רגולטורי. גישות המשלבות מודלים המבוססים על פיזיקה עם רכיבים למדים במטרה לשמור על הפרשות במקום החשוב ביותר.
דרישות נתונים ותקנות כלליות
למידה על-ידי פיקוח דורשת התחלה גדולה, מייצגת של פתרונות אופטימליים.יצירת נתונים כאלה יכול להיות יקר חישובי, ואת הרשת המתקבלת עשוי להופיע רק על מדינות דומות לאלה בקבוצת האימונים.הלימוד של הכחשת מידע נמנע מהנתונים מראש אך יכול לדרוש מיליוני אינטראקציות עם סימולטור, אשר עשוי להיות איטי או לא מדויק.
עלויות אימון
בעוד שהקצאה זולה, הכשרת רשתות עמוקות למשימות שליטה יכולה להיות זמן רב וכבדות משאבים.אימון מדיניות אחת למערכת מורכבת עשוי לדרוש ימים של זמן GPU.עלות זו מקובלת על מוצרים המיוצרים על ידי המונים (למשל, בקרים אוטונומיים לרכב) אבל עשוי להיות אוסר על מערכות הפעלה אישית, חד פעמיות.
עמדות עתידיות וגישות היברידיות
הדרך המבטיחה ביותר קדימה טמונה בשילוב של נקודות הכוח של תורת הבקרה המסורתית והלמידה העמוקה, במקום להתייחס אליהן כבלעדיות הדדית.כמה מגמות מתעוררות ממחישות את הסינתזה הזו.
N-MPC מודל חיזוי שליטה (N-MPC)
במקום להשתמש ברשת עצבית כדי להפיץ את פעולת הבקרה באופן ישיר, ניתן להשתמש ברשת עצבית כמודל דינמיק משוער או כמאצת עבור המפת עצמה.לדוגמה, מודל נלמד יכול לספק רמה מדויקת אך מהירה עד כדי כך לתפיסה חלופית עבור הדינמיקה האמיתית, המאפשר MPC לרוץ עם אופקים הדוקים יותר חישוב נמוך יותר.
למידה עבור Constraint Satisfaction
אחת מהמכשולים העיקריים היא אכיפת מגבלות (למשל, הימנעות ממכשולים, מגבלות נזילות) במדיניות עצבית.העבודה האחרונה משלבת את המגבלות:0 מחסום מתפקדת כ-FLT:1 או FLT:2projection LayersFLT:3 לתוך הארכיטקטורה של הרשת, ומבטיחה כי התפוקה של הרשת תמיד מספקת מגבלות בטיחות מוגדרות מראש אלה.
למידה בטוחה
אלגוריתמים הנוכחיים מתייחסים לעתים קרובות לבטיחות רק כעונש רך.שיטות עתידיות ישלבו אכיפה קשה במהלך חקר ואופטימיזציה, המאפשרת ל-RL לשמש בתרחישים של נקיטת-יתר.טכניקות כמו FLT:0consמוגבלות תהליכי החלטות מארקוב החלים את תהליכי FLT:1 ו-FLT:2 בטוח ,3, הם תחומי מחקר פעילים עם פוטנציאל לתוכנות תעשייתיות.
למידה מקצה לקצה מחיישנים ל- Actuator
במקום להיות מודולים נפרדים לתפיסה, הערכה המדינה, ושליטה, למידה מקצה לקצה שואפת למפות נתוני חיישן גולמי ישירות לפקודות ברמה נמוכה. בעוד מאתגר, גישה זו יכולה לפשט את ארכיטקטורת המערכת ולבטל שגיאות מורכבות.הצלחה במירוצים במל"טים ובנסיעה אוטונומית מציע כי שליטה מקצה לקצה יכולה להתאים או לעלות על הביצועים של מערכות מודולריות, לספק נתונים מספיק וסימולציה הם זמינים.
מסקנה
למידה עמוקה הופכת את השליטה האופטימלית ממשמעת אינטנסיבית אינטנסיבית לתוך מאפשר בזמן אמת עבור מערכות אוטונומיות. על ידי מינוף של יישום הפונקציה, רשתות עצביות יכול לשכפל מדיניות אופטימלית עם שיפורים מהירות דרמטי, פתיחת אפשרויות רובוטיקה, אוויר, אנרגיה, ומעבר לכך, אך הדרך לאימוץ מלא סוללת עם אתגרים: בטיחות, נוסחאות, ויעילות נתונים להישאר קריטיים של מהנדסים מוצלחים ביותר, סביר להניח, כי אין אפשרות לשלוט על ידי הדור הבא של מערכות למידה אינטראקטיבית, הוא יותר, עם יכולת חיים גבוהה יותר, הוא מסוגלות גבוהה יותר, עם התפתחות גבוהה, עם התפתחות, עם התפתחות, עם התפתחות גבוהה יותר, עם התפתחות גבוהה יותר, היא, כמו גם עם התפתחות של פתרונות למידה, כמו גם עם התפתחות גבוהה יותר, עם יכולת חיים, היא גבוהה יותר, עם התפתחותית, עם התפתחות גבוהה יותר, עם התפתחות גבוהה של טכנולוגיות אינטראקטיבית של טכנולוגיות אינטראקטיבית של מערכות למידה, עם התפתחותית, עם התפתחות גבוהה, עם יכולת למידה, עם התפתחות גבוהה יותר, עם התפתחות גבוהה יותר, עם התפתחות גבוהה יותר, היא גבוהה יותר, עם התפתחות גבוהה יותר, עם התפתחות גבוהה יותר, ללא יכולת למידה, היא גבוהה יותר, עם התפתחות, עם התפתחות גבוהה יותר, כמו גם עם התפתחות, כמו גם עם התפתחות גבוהה יותר, כמו גם עם
לקריאה נוספת, שקול את ספר הלימוד "תיאורית בקרת אופטית: מבוא" מאת דונלד קירק או מאמר הסקר (FLT:0) "Deep Learning for Optimal control" (אנ') שפורסם במגזין IEEE Control Systems.