Reinforcement Learning and PID Control: A New Paradigm

הבקרים של PID-Integral-Derivative (PID) נשארים עבודת מערכות בקרה תעשייתיות, בשימוש בכל דבר מתקנה טמפרטורה למקם את שלוש ההטבות (Kp, KD) כדי להשיג גישה יציבה, תגובה היא אתגר הנדסי קלאסי ללא גישה מתאימה, כגון Ziegler-Nhols, Cohen-Co-on, מודל מדויק יותר של שיטות טיפוליות, באופן סביר, או מדויק יותר, על בסיס קבוע, על ידי מודלים מדויקים של שיטות טיפול פסיכולוגיים, באופן ספציפי.

מה זה מודל חינם Reinforcement Learning?

למידה של כוח היא ענף של למידת מכונה שבו סוכן לומד לעשות רצף של החלטות על ידי אינטראקציה עם סביבה.הסוכן נוקט פעולות (למשל, התאמת רווחים PID), צופה המדינה וכתוצאה מכך אות פרס, ומעדכן את המדיניות שלו כדי למקסם את הפרס המצטבר לאורך זמן. ב-RL ללא מודל, הסוכן אינו מנסה ללמוד מודל של מעבר הסביבה או דינמיקת תפקוד באופן ישיר, במקום ניסיון.

זה בניגוד ל-RL מבוססת מודל, שבו הסוכן הראשון בונה מודל פנימי של הסביבה ולאחר מכן משתמש במודל זה לתכנן או לדמות פעולות עתידיות. בעוד שגישות המבוססות על מודלים יכולות להיות יעילות מדגם, הם סובלים מטיה מודל ויכולים להיכשל באופן קטסטרופלי כאשר המודל הוא לא מדויק.מודל שיטות ללא מודל, כגון Q-learning, Deep Q-Networks (DQ-Networks), מדיניות ⁇ (IN-CDD), ביצועים מתקדמים, ביצועים מתקדמים של תפקידים, ו-CDCID (ACT)

למה עבודה חופשית למודל לשליטה

מערכות בקרה, במיוחד אלה הנשלטים על ידי PID, חיים במרחב פעולה מתמשך: הרווחים יכולים להיות כל המספרים האמיתיים בתוך גבולות. אלגוריתמים ללא מודל כמו דירק-דינטיסטים מדיניות Gradient (DDPG) או אופטימיזציה למדיניות פרוטקסימית (PPO) נועדו לטפל בדיוק במקומות כאלה.הם לומדים מדיניות שמצפות מדינות (עיכובים, נגזרות או פלט) כדי להשיג התאמות מתמטיות, כי הם לא יכולים לתפוס סימולציות קלאסיות, כגון פשטות, כגון פשטות, או מוטציות מתמטיות, כגון פשטות, או מוטציות מתמטיות, כגון פשטות, כגון פשטות, או פשטות, כגון מוטציות מתמטיות, או פשטות, כגון פשטות, כגון פשטות, או פשטות, או מוטציות מתמטיות, או מוטציות מתמטיות, כגון מוטציות.

היתרונות של מודל חינם RL עבור PID Tuning

הסתגלות בזמן אמת

בתרחישים מעשיים רבים, הדינמיקה של צמח משתנה לאורך זמן בשל ללבוש, שינויים סביבתיים, או תנאי עומס משתנים. A PID מכוון לא מקוון עם שיטות מסורתיות הופך תת-אופטימי ואף עלול להיות לא יציב. pRL ללא מודל מצטיין בהסתגלות מקוונת: הסוכן ממשיך אינטראקציה עם המערכת וחדד את המדיניות שלה.

ביטול מודל המערכת

בניית מודל מתמטי מדויק של תהליך תעשייתי מורכב - כגון כור כימי, זרוע רובוטית גמישה, או טורבינות רוח - יכול לקחת שבועות או חודשים של מאמץ מומחה.מודל הוא אף פעם לא מושלם, ואת הפשטות שלו לעתים קרובות degrade ביצועים שליטה.עם מודל ללא מודל, הדרישה היחידה היא היכולת להפעיל את המערכת הפיזית (או סימולטור נאמנות גבוהה) ולבחון קשקשים ברמה גבוהה זה מאפשר להפחית את העלות הדרמטית של מהנדסי חשמל לפני כן, כלומר, כלומר, כדי למנוע אותות כדי להתמודד עם עלויות הנדסיים, כדי להתמודד עם השפעה קשה יותר מדי, כדי למנוע את המהנדסים.

מינוף של חוסר לינאריות וגילויים

כוונון מסורתי מסתמך לעתים קרובות על לינאריזציה סביב נקודת הפעלה.כאשר המערכת היא מאוד לא ליניארית - כגון במשט מגנטי, מחוללי הידראולי, או מכשירים ביו-רפואיים - ההיתר ליניארית מצטברת מחוץ לאזור צר.פל ללא מודל אינו מניח תגובה ליניארית.על ידי לימוד מדיניות באמצעות פרקים רבים של אינטראקציה, הסוכן RL לומד באופן בלתי פתירטי כדי לטפל בהיסטריה, חיכוך ארוך, כמו גם עם תופעות לוואי קשות, כמו גם על ידי רטיבות, כמו גם על ידי ניסיון קשה.

אופטימיזציה אוטומטית, End-to-End Optimization

כוונון PID הוא בעיה רב-אובייקטיבית: אדם רוצה זמן עלייה מהיר, מינימלי overshoot, שגיאות מצב קבוע, ועוצמה להפרעות.שיטות מסורתיות דורשות מהמעצב לסחור באופן ידני מהיעדים האלה.מודל-חופשי RL יכול לשלב את כל המטרות האלה ישירות לתוך הפונקציה הגמול.לדוגמה, הפרס יכול לחדור זמן, שגיאה מוחלטת (IAE), אנרגיה, שליטה ומאמץ בו-זמנית, עם אותו תהליך לא מוגדר באופן יעיל.

יישום מודל חינם RL עבור אופטימיזציה PID

Defing the State and Action Spaces

ייצוג המדינה צריך ללכוד את כל המידע הדרוש כדי לקבוע רווחים טובים.הבחירות נפוצות כוללות את הדוגמאות האחרונות של טעות מעקב, השגיאה אינטגראלית, ואת נגזרת השגיאה, יחד עם אולי הנוכחי PID מרוויח את עצמם.בכמה יישום, המדינה היא פשוט טעות נורמלית, אינטגרטיבי, נגזרת (שלושת המרכיבים פועל PID) היא בדרך כלל התאמות - או ערכים מוחלטים או דלה, שינויים סבירים, הוא לשמור על תפוקה.

עיצוב תגמול

הפונקציה הפרסית היא ככל הנראה ההיבט הקריטי ביותר של RL מבוסס PID כוונון (תגמול שתוכנן בצורה גרועה יכול להוביל לתנודות, התנהגות תוקפנית, או כישלון להתכנסות.תרגול טוב הוא להגדיר פרס שהוא סכום משקל של עונשים שליליים: FLT:0r(n) = - [i] t.

אלגוריתאם בחירה

עבור חללי פעולה מתמשכים, האלגוריתמים הנפוצים ביותר הם:

  • Deep Deterministic Policy Gradient (DDPG)FLT:1: שיטה ביקורתית שחקן לומדת מדיניות ⁇ סטית ו Q-function.זה מדגם-יעילות ועובד היטב במרחבים נמוכים-ממדיים טיפוסיים לכוונון PID.
  • (FLT:0) אופטימיזציה למדיניות הפרוקסימית (PPO)IRLT:1: שיטה מדיניות-קידוד שמגבילה את עדכון המדיניות כדי למנוע שינויים גדולים הרסניים.PPO יציב יותר בטווח רחב יותר של היפרפרמטרים והוא לעתים קרובות מועדפים עבור מערכות בעולם האמיתי שבו המהימנות חשובה.
  • (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

עבור מקרים פשוטים יותר, נמוכים ממדים, לשונית בסיסית Q-learning או SARSA ניתן להשתמש אם המדינה ומרחבי הפעולה הם disretized, אבל זה רק לעתים רחוקות מעשי עבור כוונון מתמשך.

אימון בסימולציה לעומת Real Hardware

אימון סוכן RL ישירות על מערכת פיזית נושאת סיכונים של נזק ודורש פרקים רבים (אלפי) כדי לתכנס.הגישה הסטנדרטית היא לרכבת הראשונה בסימולטור נאמנות גבוהה - שימוש במנוע פיזיקה כמו MujoCo, Gazebo, או תאום דיגיטלי - ולאחר מכן להעביר את המדיניות של למד למערכת האמיתית (העברה מעשית).

שיקולים של רשת נידור

עבור PID להשיג כוונון, מדיניות ורשתות ערך הם בדרך כלל קטנים - שניים או שלושה שכבות מוסתרים עם 64-256 נוירונים כל אחד. שכבת קלט מתאימה לממד המדינה (לעתים 3-10, ושכבה הפלט יש שלושה נוירונים ( ⁇ Kp, ⁇ Ki, ⁇ Kd) ReLU הפעלה נפוצים בשכבות נסתרות, עם שיזוף או הפעלה ליניארית על הפלט.

אתגרים ושיקולים

זמן יעילות ושקיפות

מודל-חופשי RL בדרך כלל דורש עשרות אלפי עד מיליוני צעדים כדי לתכנס למדיניות טובה.עבור תהליך תעשייתי איטי שבו שנייה של זמן אמיתי תואמת לשלב אחד, הכשרה יכולה לקחת שעות או ימים.זהו מחסום גדול להכשרה מקוונת ישירה.פתרונות כוללים שימוש בסימולציה מהירה (המפשט יכול לרוץ מהר יותר מאשר זמן אמיתי), סביבות הכשרה מקבילות, או העברה ממשימה דומה.

בטיחות במהלך חקר

במהלך אימון, הסוכן של ה-RL חייב לחקור את מרחב הפעולה כדי למצוא מדיניות טובה יותר.מחקר אקראי של רווחי PID יכול לגרום לבקר להיות לא יציב, oscillating פרוע או נהיגה המערכת לאזורים לא בטוחים. חיוני ליישם מגבלות בטיחות: פעולה, עונשים מתגמל עבור גבולות בטוחים יותר, ו resetting תקופתיים למדיניות בסיס יציבה.

הנדסת פרסים ו- Multi-Objective Trade-offs

תכנון פונקציה מתגמלת הניב את ההתנהגות הרצויה ללא תופעות לוואי בלתי צפויות הוא קשה לשמצה.הסוכן עשוי לנצל את הפונקציה הפרסית בדרכים שהמעצב לא צפה - למשל, על ידי גרימת תנודות מהירות כי רק להפחית את השגיאה אבל להזיק את המתרגל לאורך זמן.זה חיוני לבחון ניסוחים שונים בסימולציה ולעקוב אחר מדדים נוספים במהלך אימון.

משאבים משותפים

עם זאת, סוכני RL עמוקים דורשים כוח חישובי משמעותי (GPU לעדכוני רשת עצבית) עם זאת, כי המדינה ומרחבי פעולה עבור כוונון PID הם קטנים, הביקוש המנציח נמוך הרבה יותר מאשר משחק או רובוטיקה עם קלטות ראייה ממדיות גבוהה.מחשב מודרני עם מעבד לטווח בינוני יכול להכשיר סוכן PPO בתוך כמה שעות עבור צמח פשוט יחסית עבור רחב, פריסה תעשייתית, עדיין יכול לבצע פעולות ניקוי זעירות, אך ורקמות עם מעבדים גמישים עם סימולטורים גמישים.

חוסר יכולת ואימות

שיטות כוונון קלאסיות לתת תובנות מתמטיות ברורות: רווח שולי, שולי שלב, שורש, וכו 'מדיניות מבוססת RL, מצד שני, הוא רשת עצבית של ארגז שחור. מהנדסים עשויים להיות מסרבים להאמין לו ללא אימות נרחב. כדי לטפל בזה, אחד יכול לנתח את המדיניות של למד על ידי סחף בתנאי הפעלה ולוודא כי התגובות וכתוצאה מכך הם טוב מאוד החוקרים מפרשים את הביטחון הראשוני או רק כדי לעזור לך לבנות כללים מדגימים.

יישומים אמיתיים ומקריות

כוונון מבוסס מודל-מודל PID הוכח במספר תחומים:

  • (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • (הפסקה:0) דרישות שליטה: 1FLT 1 אופטימיזציה של לולאות PID לטמפרטורה, לחץ וזרימה בצמחים כימיים שבהם דינמיקת הצמח נסחף עם הזדקנות זרז:2Work שפורסם ב- IEEE עסקאות על אינפורמטיקה תעשייתית אינפורמטיקהFLT:3 החל PPO על כור גרור מתמשך, ובכך להשיג 30% נמוך יותר IAE מאשר Ziegler-Nholics.
  • (FLT:0)Power Electronics:BuildFLT:1 Tuning PID בקרים עבור DC-DC ממירים וכוננים מנועים שבו תנאי עומס משתנים משתנים משתנים ביצועים מדרגת ביצועים.
  • (FLT:0) מנוע אוטומטי: 1FLT) בקרת שיוט הסתגלות ומערכות השעיה אשר לומדות להתאים את הפרמטרים PID בהתבסס על תנאי הכביש ועל סגנון הנהיגה.

מסקנה

למידה ללא מודלים מספקת נתיב משכנע עבור אופטימיזציה פרמטר PID, במיוחד במערכות מאופיין על ידי אי-לינאריות, אי ודאות, וחילופי דינמיקות. על ידי הסרת הצורך במודלים צמחיים מפורשים ומאפשרת הסתגלות בזמן אמת, RL יכול להפחית באופן משמעותי את המאמץ הנדסי ולשפר את ביצועי השליטה ביישומים תובעניים.עם זאת, מתרגלים חייבים לנהל בזהירות אתגרים הקשורים יעילות, בטיחות, עיצוב, ודרישות חישוביות.

(ב) ראו את הסקר המקיף על RL על השליטה על ידי FLT:0)Busoniu et al. (2018) (FLT:1 ו-FLT:2a מדריך מעשי ל-RL עבור PID tuningFLT 3 מתוך קהילת הבקרה והאוטומציה.