Table of Contents

Reinforcement Learning: A New Paradigm for Fitive Optimal control

Reinforcement למידה (RL) התפתחה כמתודולוגיה רבת עוצמה לעיצוב בקרים אופטימליים הסתגלותיים שיכולים לפעול בסביבות מורכבות, לא בטוח, ושעה-varying. על ידי כך שמערכות ללמוד התנהגויות אופטימליות ישירות מאינטראקציה עם הסביבה - מבלי לדרוש מודלים מתמטיים מפורשים -RL מגשרת את הפער בין תיאוריית הבקרה הקלאסית לבין הלמידה המודרנית.

הבנה מחדש של Reinforcement Learning

מתוך Supervised Learning to Trial-and-Error

למידה מחדש של למידה שונה באופן יסודי מלמידה מבוקרת.בלמידה מבוקרת, האלגוריתם מאומן על תחילת נתונים קבועה של זוגות קלט- ⁇ , למידה כדי למפות קלטות לתוויתות נכונות. RL, לעומת זאת, פועל בסביבה שבה אין פלט נכון מסופק; במקום זאת, סוכן מקבל אות גמול מדרג לאחר כל פעולה.המטרה היא למקסם את הפרס על פני זמן באמצעות ניסוי וטעמה זו היא בהשראת איך בעלי חיים ולמידה מכישלון.

מסגרת ההחלטה של Markov

הבסיס המתמטי של RL הוא תהליך ההחלטה של מארקוב (MDP), המוגדר על ידי מכלול (S, A, P, R, ⁇ ) S מייצג את מערכת המדינות (הגדרות מערכת), מערכת של פעולות (החלים שליטה), P(s's,a) ההסתברות המעבר למצב הבא נתון ופעולה, R(s), פרס מיידי, ו- קידוד (היתר דיוקים) אשר נועד לייעל את מטרות בקרה אופטימליות.

פונקציות ערך ואופטימיזציה של מדיניות

אלגוריתמים של RL בדרך כלל לומדים את הפונקציה הערך או מדיניות ישירות. הפונקציה ערכי המדינה V(s) מעריך את ההחזר הצפוי החל מ- s המדינה ולאחר מדיניות ⁇ . הפונקציה Q(s,a) מעריך את ההחזר לאחר הפעלת פעולה ב- s. Optimal Control מבקש את הפונקציה הערך האופטימלי V * ו- Q*, שממנו מדיניות אופטימלית יכולה להיות נגזרת שיטות כגון Q-Q-DIVE, כגון פונקציות מדיניות למידה עמוקה, כגון: ⁇ tative (D-D-D-D-D-D-Dip) ו-D-Divs (Dip) ו-Divs (Divative מדיניות ⁇ P).

בקרת אופטית הסתגלות: תפקיד הלמידה

בקרה קלאסית נגד שליטה מבוססת RL

טכניקות בקרה מותאמות מסורתיות, כגון בקרת מודלים (MRAC) ו הרגולטורים עצמיים, להסתמך על זיהוי מערכת וערכת פרמטר מקוון estimation. שיטות אלה מניחים מבנה מודל ידוע (למשל, ליניארי עם פרמטרים לא בטוחים) ודורשות מתמשכת עבור התכנסות. לעומת זאת, בקרים אדפטיים המבוססים על RL הם ללא מודל: הם לומדים מדיניות בקרה ישירה מהנתונים ללא מודל ספציפי, לעתים קרובות, מודלים ספציפיים, או מודלים לא יעילים יותר, אך ורק עבור מודלים לא יעילים יותר, אלא מודלים לא יעילים יותר, אלא מודלים.

שילוב עם שיטות מבוססות מודל

מגמה הולכת וגוברת היא ארכיטקטורות בקרה היברידית המשלבות את RL עם טכניקות מבוססות מודל.לדוגמה, מודל רשת עצבית עמוקה של דינמיקת המערכת ניתן להשתמש במסגרת בקרת מודל חיזוי (MPC) שבו אלגוריתמים של RL לייעל את תפקוד העלות MPC באינטרנט. לחלופין, RL יכול לנקם את הפרמטרים של בקר PID קלאסי כדי להתאים לתנאים המשתנים.

מפתח RL Algorithms for Adaptive control

Q-Learning and Deep Q-Networks

Q-learning הוא אלגוריתם פוליטי למחצה שלמד את הפונקציה Q אופטימלית באמצעות מגפיים. עבור חללים ממשלתיים רצופים, Q-networks עמוק (DQN) להשתמש ברשתות עצביות כדי ל-Q(s,a), בשילוב עם ניסיון חוזר ורשתות היעד לייצוב אימון.DQN כבר מיושם בהצלחה כדי לשלוט במשימות כגון מניפולציה רובוטית ומשחקת בשליטה, DQN יכול לטפל בפעולות דיוק גבוה, אבל ייתכן שהוא דורש קיבולת גבוהה.

שיטות מדיניות מתקדמות ושחקן-קריטי

שיטות מדיניות ⁇ ישירות אופטימיזציה מדיניות פרמטריזציה, מה שהופך אותם טבעיים עבור חללים פעולה רצופים חיוני בשליטה. אלגוריתם וניל REINFORCE סובל החלנות גבוהה, אבל גרסאות מודרניות כגון PPO ואופטימיזציה של מדיניות אזורי אמון (TRPO) מציג מגבלות כדי להבטיח עדכונים יציבים.-ביקורתיים משלבים מדיניות (actAC) עם ערך (ביקורת) כדי להפחית את השחלות תוך שמירה על הטיה נמוכה ופתרון מדיניות PGS) הם נרחב של יעילות שליטה (actist).

מודל מבוסס מודל: תכנון ולמידה

מבוסס מודל RL לומד מודל מפורש של הסביבה (למשל, תהליך Gaussian או רשת עצבית) ומשתמש בו לתכנון, לעתים קרובות באמצעות MPC או תכנות דינמי.מודל הנלמד יכול להיות מעודכן באינטרנט, המאפשר לבקר להסתגל כמידע חדש מגיע. Algorithms כמו חיפוש מדיניות מודרך (GPS) ורכבים פרוביולוגיים עם מזרקת דגימה (ETS) לדגם נוסף, אך לאנטיבות מודלים המבוססים על מודלים.

היתרונות של Reinforcement Learning in Adaptive Optimal control

הסתגלות חופשית מודל

אולי היתרון המשכנע ביותר הוא שבקרי ה-RL יכולים להתאים לשינויים במערכת מבלי לדרוש מודל מפורש או זיהוי מערכת ממצה.לדוגמה, למידת זרוע רובוטית כדי לתפוס חפצים עם מסה וחיכוך לא ידועים יכולים להתאים באופן אוטומטי את הכוח התופס באמצעות ניסוי וטעייה. התאמה זו אינה ראויה לתרחישים אמיתיים שבהם פרמטרים במערכת או להשכימו לאורך זמן.

אופטימיות וביצועים ארוכים-Horizon

מטבעו RL מאמת את הפרס המצטבר על אופקים ארוכים, אשר מיישר עם מטרות שליטה רבות כגון צמצום צריכת האנרגיה הכוללת על מסלול או הבטחת יציבות אסימפטוטית.בניגוד לאסטרטגיות שליטה מינופיות, מדיניות RL יכולה לאזן מאמץ מיידי נגד הטבות עתידיות.עם עיצוב הפרס הנכון, RL מתכנס למדיניות אופטימלית (או קרוב לאופטימי) במובן של מקסימום הגדרה אובייקטיבית.

עקבו אחרי nonlinear and High-Dimensional Dynamics

עיצוב בקרה מסורתי דורש לעתים קרובות לינאריזציה סביב נקודות הפעלה, אשר נכשלת מאוד לא ליניארי או דינמיקה בלתי פוסקת. RL, במיוחד עם אדמירטורים של תפקוד עצבי עמוק ברשת עצבית, יכול ללמוד מדיניות לא ליניארית ישירות ממדכאות מדינה גולמית (למשל, תמונות מצלמה או זוויות משותפות) יכולת זו פותחת שליטה על מערכות מורכבות כמו רובוטים רכים, מבנים גמישים, ותהליכים ביולוגיים.

אתגרים ומייגים

דוגמאות יעילות ומציאות-Time Constraints

אחד המכשולים הגדולים ביותר בהפצה של RL לשליטה הסתגלותית הוא יעילות הדגימה. אלגוריתמים רבים של RL דורשים אלפי או מיליוני אינטראקציות סביבתיות כדי ללמוד מדיניות סבירה.בשליטה בזמן אמת, כל אינטראקציה תואמת לצעד זמן, וחיפוש מוגזם יכול להוביל להתנהגות לא בטוחה או לא יציבה.טכניקה לשיפור יעילות הדגימה כוללת העברה, הכשרה פשוטה-מציאותית, ומינוף הידע לפני אימון דיגיטלי או אימון אופטימנטלי מאפשר לסימולציה גבוהה, לאחר מכן, לאחר מכן, לסימולציה גבוהה, לאחר מכן, לסימולציה באינטרנט, לאחר מכן, לסימולציה גבוהה, כדי לשפר את הסימול-אופטימית, לאחר מכן, לסימולציה גבוהה, לאחר מכן, כדי לשפר את יעילות הדגימה גבוהה, כדי לשפר את יעילות הדגימה, כדי לשפר את יעילות הדגימה, כדי לשפר את יעילות הדגימה באינטרנט.

יציבות ובטיחות במהלך הלמידה

תורת הבקרה הקלאסית מציבה פרמיה גבוהה על יציבות מדיניות RL, במיוחד במהלך אימון מוקדם, יכול לייצר פעולות שליטה לא נכונות או משבשות.בטיחות הבטחת בטיחות היא קריטית ביישומים כמו נהיגה אוטונומית או בקרת רשת חשמל.

  • (ב) ⁇ :0) ⁇ -lave: 1:1 , חקר אזורי בטיחות מובטח, לעתים קרובות באמצעות פונקציות מחסום או הערכת ערך שמרנית.
  • Lyapunov מבוסס RL:03F:03:03: 1] שילוב תנאי יציבות לימפונוב לתוך הפרס או כמגבלות במהלך אופטימיזציה למדיניות.
  • (ב) ⁇ :0) ⁇ : ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

תוצאות חיפוש > Exploitation Dilemma

סוכני RL חייבים לאזן את הניסיון של פעולות חדשות (ההסברה) כדי לגלות מדיניות טובה יותר מול שימוש בפעולות ידועות (התחילה) כדי למקסם את הפרס.בשליטה אדפטיבית, חקירה גרועה יכולה לגרום לסוכן להיות תקוע במדיניות תת-אופטימית, בעוד יותר מדי חיפוש יכול לזלזל בביצועים וחוסר יציבות סיכון.טכניקות כמו בחירה epsilon-greed פעולה, חיפוש בולטימני, ומניעים קוסמטיים (Foltrinicing) הוא עוזרות נוספות לעיסוק בסקרנות.

קריקטורה של Dimensionality

ככל שמרחבי המדינה והפעולה גדלים, המורכבות של קשקשים למידה במהירות.עבור מערכות ממדיות גבוהות (למשל, רובוט הומניאיד עם דרגות רבות של חופש), רשתות עצביות עמוקות יכולות להפחית את הקללה של מימדיות על ידי למידה ייצוגים קומפקטיים.עם זאת, רשתות אלה דורשות כוונון זהיר ויכולות להתאים לסביבות ספציפיות.תרגילות, ירידה, ושיטות הרכב משמשים לשיפור כללי.

יישומים אמיתיים

רובוטיקה ומניפולציה

הרובוטיקה היא אולי התחום הפעיל ביותר לשליטה אדפטיבית מבוססת RL.משימות כמו לתפוס, במניפולציה יד, ו locomotion כרוכה בדינמיקה גבוהה ממדים, עשירי מגע שקשה לדגמן באופן אנליטי. אלגוריתמים של RL, במיוחד שיטות מדיניות עמוקות ⁇ , הוכיחו מניפולציה דהקסרטית על פלטפורמות כמו צל יד ושקפת על הרובוטים המילוליים.

נהיגה אוטונומית

נהיגה אוטונומית, בקרים של RL לומדים להסתגל לתנאי כביש שונים, דפוסי תנועה, ודינמיקה של כלי רכב. RL יכול לייעל שליטה ארוכת טווח (למשל, בקרת שיוט אדפטיבית) ושליטה מאוחרת (לשמירה) בו-זמנית, תוך התחשבות ביעילות, נוחות ובטיחות.סוף-לקצה מדיניות נהיגה כי תהליך תמונות ישירות הוכחו, אבל רוב מערכות הייצור מסתמכות על היררכיה גבוהה של הרגעה או החלטות ברמה נמוכה).

בקרת תהליכים ואוטומציה תעשייתית

תעשיות תהליכים כגון צמחים כימיים, ייצור חשמל, ומאגרי שמן פועלים בתנאים משתנים ללא הרף.שיעורי-integral-integral-derivative (PID) בקרים ובקרת תהליכים מתקדמים (APC) עשויים להיות תחת השפעה כאשר מתמודדים עם אי-ליניאנס או סחף. RL יכול לכוון פרמטרים בקריפטפטטיים בזמן אמת, או אפילו להחליף את האסטרטגיה של שליטה מלאה עבור יחידות מורכבות של שימוש ב-GRL עם תהליכים המשולבים.

מערכות אנרגיה ורשתות חכמות

טורבינות רוח, חוות סולאריות ומיקרו-צמחים דורשים שליטה מתאימה כדי למקסם את האנרגיה לכידת תוך שמירה על יציבות. RL יכול לייעל את השליטה על טורבינות הרוח בהתבסס על פרופילי רוח סוערים, טעינות אחסון סוללות ופריאות, או לנהל תגובה הביקוש.Deep RL כבר הוחלה בניהול אנרגיה ביתי, למידה למים חום או מטען חשמלי באמצעות אותות בזמן שימוש.

קווי עתיד וגבולות מחקר

למידה עמוקה והערכה מחדש

שילוב של RL עם למידה עמוקה מאפשר מדיניות שפועלת על קלטות חושיות ברמה גבוהה (vision, lidar, tactile) מחקר עתידי יתמקד יותר חסכונית מדגם ופירושה ארכיטקטורות עמוקות.זהים מבוססי תשומת לב מודלים עולמיים שחיזוי מדינות עתידיות יכול לשפר באופן דרסטי את תכנון וחשיבה ביישומים שליטה.

בטוח ורובוסט

בטיחות היא חובה לשליטה בעולם האמיתי.מסגרות מתפתחות כגון תהליכי החלטה משוחררים של מרקוב (CMDP), RL רגישה לסיכון, ו-RL חזקה במטרה לספק ערבויות רשמיות.אינטגרציה עם כלים שליטה-אורטיים כמו פונקציות לימפונוב ותפקודי מחסום יעזרו להבטיח כי מדיניות RL מכבדת מגבלות בטיחות גם במהלך חיפוש.

שליטה מרובה-החכמה ומפולגת

מערכות מודרניות רבות כרוכות בסוכני אינטראקציה מרובים (למשל, רובוט נחיל, רשתות תנועה, רשתות חשמל) Multi-agent RL (MARL) מרחיב את מסגרת ה-RL להגדרות שיתופיות או תחרותיות. אתגרים כוללים אי-סטיות, הקצאת אשראי ותקשורת על פני ראש.שליטה אופטימלית במערכות כאלה דורשות מדיניות מבוזרת שיכולה לתאם ביעילות התקדמות אחרונה ב-RL-R.

שילוב עם Neuromorphic ו- Edge Computing

מינוף בקרים ב-RL על מכשירים מאומצים משאבים (למשל, מיקרובקרים עבור IoT) דורש אדריכלות קלה ואלגוריתמים יעילים ללמידה. שבבי נוירומורפיים אשר מחקים רשתות עצביות ספירות יכול לאפשר כוח נמוך, בזמן אמת RL הקצינה האלגוריתם של ON-policy שאינם דורשים מכופים גדולים הם יותר מחקר מתאים עבור מכשירים מתקדמים שיטות למידה כי למנוע חיים סטראומטיים עבור בידוד.

מסקנה

(הלימוד של Reinforcement מעצב מחדש את השליטה האופטימלית על ידי מתן מסגרת מאוחדת שלמד מניסיון, להסתגל לדינמיקה המשתנה, ואופטימיזציה של ביצועים לאורך אופקים ארוכים, בעוד אתגרים הקשורים יעילות מדגם, יציבות וביטחון נשארים אזורי מחקר פעילים, קצב ההתקדמות הוא צמצום של שיטות בקרה היברידיות (RandF) ל-SuLT2, אשר משלבים את ה-RHDR1 עם בקרה קלאסית, יחד עם התקדמות למידה עמוקה, בטוחה, ותיאום רב-מחדש, ותיאום, ל-ACT: