Table of Contents

מבוא למפקחים PID ולהגבלות שלהם

בקרים בעלי אחריות (PID) הם סוסי העבודה של מערכות בקרה תעשייתיות.מטמפרטורה של כורים כימיים לייצוב טיסה, בקרים PID נמצאים כמעט בכל מגזר הדורש שליטה סגורה-פרלופית.הבקר מתואם את תפוקת הבקרה המבוססת על שלושה תנאים: פרופורציונלי (P), נגזר (D), עם כל אחד מהיתרונות המאוחרים שלו, בעוד ש-KID הוא עדיין מצליח להשיג את הביצועים הפשוטים שלו, המשתנים, כולל של הפרמטרים, הוא יעיל, כלומר, הוא בעל שלושה.

שיטות כוונון מסורתיות – כגון זיגלר-ניקולס, כהן-קוון, או משפט ידני-וטרור – מייצרים תוצאות מקובלות עבור מערכות עם דינמיקות קבועות.עם זאת, מערכות בעולם האמיתי רבות הן FLT:0דינמיתFLT:1: התנהגותן משתנה לאורך זמן בשל עומסים, רכיב, שינויים סביבתיים, או לא ליניאריות.

Reinforcement Learning מציעה מסגרת עבור אופטימיזציה רציפה, בזמן אמת של פרמטרים PID מבלי לדרוש מודל מפורש של המערכת. במקום זאת, סוכן ה-RL לומד מאינטראקציה ישירה, התאמת רווחים כדי למקסם את אות הפרס המשקף ביצועים. גישה זו מבטיחה במיוחד עבור יישומים שבהם כוונון ידני הוא לא מעשי או איפה דרישות ביצועים גבוהים.

הבנה של Reinforcement Learning in Control Context

Reinforcement Learning הוא ענף של למידת מכונה שבו סוכן לומד לקבל החלטות על ידי אינטראקציה עם סביבה. בכל שלב, הסוכן צופה המדינה הנוכחית (למשל, אות שגיאה, נגזרת של טעות, פלט מערכת), בוחר פעולה (למשל, התאמת Kp, קי או KD), ומקבל פרס (או עונש) בהתבסס על התוצאה.

המרכיבים העיקריים במערכת ⁇ PID מבוססת RL הם:

  • (FLT:0) Environment: 1FLT: המערכת הדינמית תחת שליטה (למשל, זרוע רובוטית, או תהליך כימי) יחד עם משוב החיישן שלה ומגבלות ההפעלה שלו.
  • (ב) אלגוריתם ה-RL (FLT:0) הקובע כיצד לשנות את רווחי PID.
  • (FLT:0) ייצוג המדינה: ⁇ FLT:1 בדרך כלל כולל אות שגיאה (e), האינטגראלי שלו ( ⁇ e dt), וגזרתו (de/dt), אך יכול גם לשלב מצבים היסטוריים או פלטי מערכת.
  • (FLT:0) מרחב חנינה: 1 ברציפות או התאמות דיסקרטיות ל-Kp, Ki, ו-Kd. ביישוםים מתקדמים יותר, הסוכן מפיץ את הרווחים עצמם.
  • הפונקציה FLT:0 RESREREER: 1FLT 1 מדד קנה מידה של איכות שליטה, לעתים קרובות שילוב תנאים למעקב אחר שגיאות, פתרון יתר, יישב זמן, שליטה ורווחי יציבות.

אלגוריתמים קלאסיים כגון Q-learning הם מתאימים למרחבי פעולה רצופים.לכן, יישומי RL מודרניים עבור PID כוונון מסתמכים על ההרחבה:0 עמוק חיזוק למידהFLT:1 שיטות שמשתמשות ברשתות עצביות למדיניות ותפקודי ערך דומים. אלגוריתמים פופולריים כוללים אלגוריתמים דיטרנטימיים של מדיניות Gradient (DDPG), אופטימיזציה למדיניות אקסקלימית (PPO), ו- SoftCStic).

כיצד Reinforcement Learning Optimizes PID Parameters ברציפות

הרעיון המרכזי הוא לנסח את הבעיה הפרמטרית כתהליך החלטה של מרקוב (MDP) שבו המדינה לוכדת מידע רלוונטי על הצמח ועל הביצועים הרצויים.פעולות הסוכן לשנות את ה- PID בכל שלב בקרה (או במדאט איטי יותר של זמן) את הפין מפצה מעקב גרוע ומאמץ שליטה מופרז תוך תגמול התכנסות מהירה ויציבות.

נוהל אימון

אימון מתרחש בדרך כלל בסביבת סימולציה שמודלת את המערכת הגופנית.גישה נפוצה היא להשתמש בתוכנה-in-the-loop (SIL) או חומרה-in-the-the-loop (HIL) סימולציות (HIL) סימולציה של סוכן ה-RL אינטראקציה עם הסימולציה על פרקים רבים, כל פרק פועל לאופק זמן קבוע או עד למצב של תגמול הוא נתקל. במהלך כל פרק, ה- tweaks הפרמטרים האמיתיים, התגובה, לאחר ה-הפרק, לאחר ה-הזמן שנצברו היא תוצאה צפויה, לאחר ניתוח, לאחר הסימולציות, לאחר ה-זמנית, לאחר ה-זמנית, לאחר שתוצאתו של המערכת.

מכיוון שבקרי PID הם (FLT:0) ,memorylessearFLT:1 (המונח האינטגראלי מספק זיכרון, אבל ערכי הרווח עצמם אינם נמצאים במצב פנימי מעבר ל- integrator), הסוכן יכול להתאים את הרווחים במהירות בתגובה לדינמיקה המשתנה.לדוגמה, אם זרוע רובוט אוספת עומס כבד, עלייה יעילה בזרימה, ורווחים מקוריים עשויים לגרום לתגובת הפחתה איטית יותר של Kpcius, תוך שמירה על השגיאה, ולהגדיל את הפחתת תפקוד ה-Kpcipation.

עיצוב תגמול

תכנון פונקציית הפרס הוא אחד השלבים הקריטיים ביותר.פרס מתוכנן גרוע יכול להוביל להתנהגות לא בטוחה או לא יציבה.

  • (ב) [ה]העלות ה ⁇ : [ה]: [ה], [ה], [ה], [ה],] ,[דרוש מקור], [ה], [ה]], [התחילה], [התחילה], [התחילה], [התחילה],], ועונש על מאמצי שליטה.
  • (ב) ⁇ :0) ,(Multi-objective:FreaLT:1) שילוב תנאים לפתרון יתר, יישב זמן, עלייה בזמן, וטעות קבועה של המדינה עם משקולות מצופות למשתמש.
  • (ב) ⁇ :0) , ⁇ (ב) , כולל בונוס לשמירה על רווח ורווחים של שלב מקובל, לעתים קרובות נגזר ממודל פשוט.

מכיוון שסוכן ה-RL לומד באמצעות ניסוי וטרור, הפונקציה הפרסית חייבת גם לעצב התנהגות במהלך חיפוש מוקדם.טכניקות כמו עיצוב תגמול ולמידה חיקוי (מבסיס PID) יכולות להאיץ את ההתכנסות ולהקטין את הסיכון לכשלים קטסטרופליים במהלך אימון.

Reinforcement Learning Algorithms מתאים עבור PID Tuning

בחירת אלגוריתם ה-RL הנכון משפיע על יעילות הלמידה, המורכבות של הדגימה וביצועי בקר הסופיים. להלן הם האלגוריתמים הנפוצים ביותר בתחום זה:

מדיניות די-טווחית (DDPG)

DDPG הוא אלגוריתם ביקורתי של שחקן מחוץ לתחום פעולה מתמשך.זה משתמש ברשתות עצביות תאום: השחקן מפיץ את הפעולה (במקרה זה, PID מקבל התאמות) בהתחשב המדינה, והמבקר מעריך את הערך Q-ערך (התגמל המצטברת הצפוי) PG הוא מדגם-יעילות, כי הוא מחזר חוויות קודמות מאוחסנים ב- replay buffer.

למידע נוסף על DDPG במאמר המקורי: FLT:0"Continent control with Deep Reinforcement Learning" מאת לילאיק ראפ et al.arch

אופטימיזציה למדיניות Proximal (PPO)

PPO הוא אלגוריתם של מדיניות שמכה איזון בין פשטות יישום וביצועים.זה משתמש בפונקציה אובייקטיבית להגביל את עדכוני המדיניות, מניעת שינויים גדולים מבחינה הרסנית במדיניות. PPO ידוע כי להיות יציב ואמינה על פני משימות שליטה רבות.עבור PID כוונון, PPO יכול ללמוד מדיניות חלקה כי להימנע תנודות רווח אגרסיביות, אשר חשוב עבור הפעלתו בטיחות.

הסבר מעמיק, ראה את נייר OpenAI: FLT:0" (Proximal Policy Optimization Algorithms)

Soft Actor-Critic (SAC)

SAC הוא אלגוריתם של מדיניות שממקסימה לא רק את החזרה הצפויה, אלא גם את הרצף של המדיניות, עידוד חקירה.זה משיג באופן עקבי ביצועים המדינה-of-the-art על השוואות בקרה מתמשך. בהקשר של כוונון PID, SAC יכול לאזן באופן אוטומטי את חקר וניצול, המוביל לבקרים חזקים ומתאיים. זה גם נוטה להיות יותר מדגם יעיל ופחות רגיש ל-persperativesperspersperspersperspersperster.

המאמר המקורי של SAC: FLT:0"Soft Actor-Critic: Off-Policy מקסימום Entropy Deep Reinforcement Learning with a Stochastic Actor" מאת Haarnoja et al.FLT 1

גישות בלתי אפשריות

החוקרים גם הגישו את האופטימיזציה של מדיניות מחוז האמון (TRPO) 1,FLT:2Q-learning עם הפונקציה ApproximationFLT 3 (מוגבל לפירוק פעולות על פרמטרים PID), ו-FLT:4evolution אסטרטגיות FLT:5 עם זאת, עבור אופטימיזציה פרמטר מתמשך, PG, PPO, ו- SAC נותרו אפשרויות מעשיות ביותר.

סביבת סימבול וכלים ל-RL-based PID Tuning

פיתוח ובדיקת סוכני RL עבור כוונון PID דורש סביבת סימולציה גמישה.כמה מסגרות יצאו:

  • (ב) ניתן לבנות את הספריות הפתוחות של התעמלות / התעמלות:2controltureFLT:1 (Python) או ממשק סטנדרטי לסביבות RL.סביבות מכס ניתן לבנות ספריות בקרה כגון:2controltureFLT 3:2controltureFLT 3: (Python) או FLT:4SimulinkFLT:5 (MATLAB).
  • (FLT:0) MuJouure:FLT:1 סימולטור פיזיקה בשימוש נרחב עבור רובוטים.זה יכול מודל מערכות דינמיות מורכבות (למשל, זרועות רובוטיות, הומניאידים) שבו בקרים PID נפוצים.
  • (FLT:0Gazebo + ROS:FLT:1hil) עבור סימולציות רובוטיות מציאותיות יותר עם רעש חיישן וגבולות אקטוטור.מערכת ההפעלה הרובוטית (ROS) מספקת דרך סטנדרטית לממשק סוכני RL עם חומרה אמיתית או סימולציה.
  • (FLT:0) Dymola / Modelica:FreaLT:1 , עבור מערכות תעשייתיות בקנה מידה גדול (למשל, תחנות כוח, HVAC) שבו בקרים PID הם בשפע.כלים אלה יכולים להיות מחוברים למסגרות של RL באמצעות ממשק Mock-up פונקציונלי (FMI).

ספריות עממיות כגון:0 (בקיצור:0) ,(ב) ,5FLT:2RLLbcioFLT 3, ו-FLT:4TensorFlow Agents:5 לספק יישום מוכן לשימוש של PG, PPO, SAC ואחרים, המאפשרים למהנדסים להתמקד בסביבה ובעיצוב.

תוצאות חיפוש ויישומים אמיתיים

המעבר מסימולציה ועד פריסת העולם האמיתי הוא מאיץ.למטה הם דוגמאות מרשימות שבהן אופטימיזציה PID מבוסס RL הראה יתרונות משמעותיים:

המונחים: control

(איור) הם מערכות דינמיות מאוד, בכפוף לרוחות רוח, שינויים בעומס, ותנודות מתח סוללה קבועות-gain PID בקרים לעתים קרובות צריך retuning עבור מצבי טיסה שונים (hover, תמרונים אגרסיביים) חוקרים באוניברסיטת סטנפורד ו- ETH ציריך הוכיחו כי סוכן RL באמצעות PPO יכול להתאים באופן קבוע את PID למטח, השגת FLT:0% בירידה במעקב אחר שגיאה ידנית של 1F.

מניפולטור רובוטי עם תוספת תשלום

הזרועות הרובוטיות התעשייתית בקווי הרכב מטפלות לעתים קרובות בחפצים של מסה משתנה.בקר סטטי PID מוביל לפתרון יתר כאשר הזרוע ריקה ותגובה sluggish תחת עומסים כבדים. סוכן מבוסס DDPG שהוכשר בסימולציה הוצב על זרוע FANUC, התאמת Kp ו KD בזמן אמת בהתבסס על העומס המשוער.ה הביצועים הנערכים על עלייה עקבית של מעל 5% מתחת לטווח 10x.

מערכת חשמל תדירות שליטה

ברשתות חשמל, בקרת הדור האוטומטי (AGC) משתמשת בקרים דמויי PID כדי להסדיר מושלים טורבינות.עם חדירה מוגברת של מקורות אנרגיה מתחדשת, דינמיקה רשת הופכת להיות בלתי צפויה יותר.מחקר שפורסם ב-FLT:0IEEE עסקאות על Power SystemsuaFLT:1 החל SAC כדי להתאים את היתרונות של PIDs מרובים במיקרוגרריד, צמצום סטיות על ידי 40% תוך צמצום צריכת דלק.

אתגרים ומייגציות ב-RL-מבוססות על אופטימיזציה

למרות ההבטחה, פריסה מעשית של RL עבור כוונון מתמשך פרצופים כמה hurdles:

המונחים: Efficiency

אלגוריתמים רבים דורשים מיליוני צעדים להתכנסות, אשר יכול להיות בלתי אפשרי עבור חומרה פיזית יקרה (FLT:0) solutions: ראשיFLT:1 להשתמש סימולציות נאמנות גבוהה, להעביר למידה (sim-to-real), או לשלב ידע קודם (למשל, הישגים ראשוניים של זיגלר-נילוס) לתהליך הלמידה.

יכולת במהלך הלמידה

במהלך המחקר, סוכן RL עשוי ליישם רווחים מרתיעים שגורמים לתנודות או אפילו נזקי מערכת.FLT:0Solutions: ibFLT:1 , 1 הטמעת שכבות בטיחות אשר כרוכות ברווח שינויים בשלב, להשתמש במבקרי בטיחות מבוססי Lyapunov, או להעסיק מסגרות RL מוגבלות (למשל, שיטות Lagraian).

תגמול Slack

פרס בצורת גרועה יכול להוביל להתנהגות המספקת את המדדים ברמה המקומית אך הם לא רצויים בעולם (למשל, תנודות גבוהות של קידוד ממזערות את ISE אך פעולות הלחץ).

כלליזציה והסתגלות

מדיניות של RL שהוכשרה על מערכת מסוימת לא תכלל במערכות אחרות עם דינמיקות שונות.FLT:0 Solutions: FLT:1 Train on a Distribution of systemפרמטרs (דומיין אקראיזציה), או להשתמש ב- meta-learning כך שהסוכן יכול להתאים במהירות לסביבות חדשות.

השוואה עם שיטות בקרה הסתגלותיות אחרות

RL היא לא הפרדיגמה היחידה עבור כוונון PID מותאם.זה עוזר להבין איפה RL מאיר והיכן חלופות יכולות להיות מספיקות:

  • (FLT:0)Model Reference Fitive Control (MRAC): ibph:1 דורש מודל התייחסות יעיל עבור מערכות עם מבנה ידוע אך לא ברור פרמטרים. RL גמיש יותר כאשר מודל המערכת מורכב או לא ידוע.
  • (FLT:0) לוגיקה לוגיקה מקבילה: FLT:1 השתמש כללים היוריים, טוב עבור מערכות לא ליניאריות אבל לעתים קרובות דורש ידע מומחה לעצב את הבסיס הכלל.
  • (FLT:0) ⁇ ⁇ (STRIR): פרמטר 1 באינטרנט estimation בשילוב עם עיצוב שליטה, אבל בדרך כלל מניחה דינמיקות זמן ליניארית. RL מטפל באי-לינאריות ובשונות זמן יותר טבעי.

היתרון העיקרי של RL הוא היכולת שלה להתאים את מדדי הביצועים השרירותיים ללא מודלים מפורשים, מה שהופך אותו אידיאלי עבור מערכות עם מטרות מורכבות, רב-אובייקטיביות.

מגמות מחקר ודרכים לעתיד

התחום נע במהירות.כמה כיוונים מבטיחים נחקרים:

מבוסס מודל Reinforcement Learning

טהור מודל חינם מודל RL הוא דגימה-הונגריה. מבוסס מודל לומד מודל דינמי של הצמח ומשתמש בו כדי לדמות עתידים פוטנציאליים רבים, שיפור משמעותי יעילות הדגימה.ב pID כוונון, מודל למד יכול לחזות את ההשפעה של שינויים, המאפשר הסוכן לתכנן מראש.זה רלוונטי במיוחד עבור מערכות שבהן אינטראקציה בעולם האמיתי הוא יקר.

« « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « אכזבה ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

מערכות מודרניות לעתים קרובות כרוכות במספר רב של בקרים PID (למשל, בזרועות רובוטיות מתואמות או רשתות חשמל) אלגוריתמים Multi-agent RL (MARL) יכולים לכוון את כל הפרמטרים בו זמנית, חשבונאות לאפקטים הפיכה.עבודה מוקדמת מראה כי הכשרה מרכזית עם ביצוע מבוזר (CTDE) יכול להשיג ביצועים גלובליים מעולים סוכנים עצמאיים.

בקרת בטיחות-קריטית עם RL

עבור יישומים תעשייתיים, מגבלות בטיחות הן מכריעות.חוקרים משלבים פונקציות מחסום בקרה (CBFs) ושיטות לימפונוב למסגרות של RL כדי להבטיח יציבות גם במהלך אימון.שיטות אלה להבטיח כי הרווחים ההסתגלות לעולם לא מפרים מגבלות קשות כגון מגבלות הפעלה או מגבלות מתח.

המונחים: Edge Devices

הטמעת מדיניות RL מאומנת על מיקרובקרים או FPGAs היא אתגר מתעורר. ארכיטקטורות רשת עצבית משקל אור (למשל, זעירהML) ומדיניות קוונטית מאפשרות הקצאה בזמן אמת בעלות חישובית נמוכה. חברות כמו רחפנים:0Edge ImpulseFLT:1 חלוצים בתחום זה, ואנחנו יכולים לצפות RL-tu-S PIDs יופיע בטלפונים רפואיים, מערכות רכב.

מסקנה

Reinforcement Learning מספק מסגרת עוצמתית עבור אופטימיזציה רציפה של פרמטרים PID במערכות דינמיות.על ידי החלפת כוונון ידני ורווחים סטטיים עם סוכן הסתגלות אשר לומד מניסיון, מערכות בקרה יכולות לשמור על ביצועי שיא בפני תנאים משתנים, הפרעות, ואלגוריתמים לא ליניארים. אלגוריתמים מודרניים כגון PG, PPO, ו-SAC, בשילוב עם סימולציה גבוהה ותגמול, הראו תוצאות סימולציה מרשימה הן בעולם האמיתי.

עם זאת, אתגרים נשארים: יעילות הדגימה, ערבויות יציבות, עיצוב הפונקציה גמול דורש תשומת לב זהירה.המשך מחקר ב-RL מבוססת מודל, שיטות מאומנים בטיחות, פריסת קצה מבטיחה להפוך אופטימיזציה PID מבוסס RL זמין יותר אמין. עבור מהנדסים המבקשים לחדש מערכות בקרה, שילוב RL לתוך זרימת העבודה PID הוא צעד מעשי לעבר אוטומציה חכמה יותר, יותר אוטומציה.

(ב) לעיין במשאבים אלה: (ב):0 פתחה ב-Dird ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇