בקרת מזון חינם מודל

הנדסה מודרנית נתקלה לעתים קרובות במערכות שהדינמיקה שלהן היא לא-לינית, או כפופה להפרעות בלתי צפויות.טכניקות בקרה מסורתיות המבוססות על מודלים - כגון PID כוונון, עיצוב חלל המדינה, או שליטה אופטימלית - דורש ייצוגים מתמטיים מדויקים מדויקים של הצמח.כאשר מודלים אלה אינם זמינים, יקרים כדי להסיק, או שינוי מהיר, מהנדסים זקוקים לגישות חלופיות לשליטה חופשית במודל זה על ידי למידה ישירה או הסתגלות של פעולות מבוססות-ידי שימוש, הדורשות, ללא מרשם, ללא מרשם, ללא שימוש, דורשות, ללא מרשם, מודלים מדויקים של שיטות מחקר, ללא מרשם, וטכניקות בקרה מדויקות, ללא מרשם, ללא שימוש, ללא שימוש, ובדיקה מדויקת, ללא שימוש, ללא שימוש, ללא שימוש, וטכניקות בקרה, ובדיקה מדויקת של מודל.

שליטה ללא מודל אינה אלגוריתם יחיד, אלא משפחה של שיטות החולקים פילוסופיה משותפת: להשתמש במדידות קלט בזמן אמת כדי להניע את המערכת לכיוון התנהגות הרצויה.שיטות אלה הן בעלות ערך רב בתחומים כמו רובוטים, כלי רכב אוטונומיים, אוטומציה תעשייתית ומערכות ביו-רפואיות, שבו מודלים מדויקים הם לא מעשיים או בלתי אפשריים להשיג.

ניהול מזון חינם מודל

בליבתו, בקרת משוב ללא מודל מתייחסת למפעל כקופסא שחורה.הבקר מתבונן בשגיאה בין נקודת המוצא הרצויה לבין הפלט בפועל, ואז מאמת את אות הבקרה המבוססת רק על טעות זו ועל ההיסטוריה האחרונה.בניגוד לבקרים המבוססים על מודלים, אין ידע מפורש על העברת פונקציות, משוואות ממשלתיות, או פרמטרים. במקום זאת, הבקר לומד או מאמת את התנהגותו באמצעות אינטראקציה.

התובנה המרכזית היא שכל המידע הדרוש על תגובת המערכת נכלל בזרם הנתונים של קלט- ⁇ .על ידי עיבוד הנתונים האלה בזמן אמת, בקר ללא מודל יכול להסיק את ההשפעה של פעולותיו ולשנות את המדיניות שלו בהתאם. גישה זו מטפלת באופן מהותי בדינמיקה של זמן, לא לינאריות, והפרעות לא ממודלות, כי הבקר מבוסס על תצפיות טריות.

ישנם שלושה קטגוריות עיקריות של בקרת משוב ללא מודל: שליטה הסתגלות, למידה חיזוק (RL), ובקרת מצב סליעה (SMC) כל אחד מציע יתרונות נפרדים ומסחר-offs, והבחירה תלויה בדרישות היישום, מגבלות חישוביות ושיקולי בטיחות.

בקרה הסתגלות

טכניקות בקרה הסתגלותיות להתאים את הפרמטרים של בקר באינטרנט כדי לשמור על ביצועים הרצויים, גם כאשר הדינמיקה הצמח משתנה.בשליטה אדפטיבית ללא מודל (MFAC), הבקר אינו דורש מודל מטאמטרי אלא משתמש בגישה לינאריזציה דינמית - לעתים קרובות באמצעות נגזרות פסאודו-פרטיות - להעריך את היחסים בין עדכוני בקרה ושינויים משפטיים מצטברים.

טכניקה נוספת בשימוש נרחב הסתגלות היא בקרת למידה רציונטיבית (ILC), אשר מנצלת את האופי החוזר של משימות רבות (למשל, רובוטית בחירה ומיקום, סריקה רוטט) כדי לחדד את אות השליטה של אחד היררציה ל- ILC נחשב ללא מודל כאשר חוק הלמידה אינו תלוי במודל צמחי מפורש, אם כי לעתים קרובות הוא מניח זמן ליניארי על מערכת מעקב קרוב יותר, כי הוא יכול להתאים את הדינמיקה של בקר, ולא ידוע.

Reinforcement Learning (RL)

הלמידה של Reinforcement התפתחה כאסטרטגיה חדשנית ללא מודל עבור משימות שליטה מורכבות.In RL, סוכן (הבקר) לומד מדיניות אופטימלית באמצעות אינטראקציות ניסוי וטרור עם הסביבה.הסוכן צופה מדינה, בוחר פעולה, מקבל פרס, ומעדכן את תפקידו קבלת ההחלטות כדי למקסם את הפרס המצטבר על פני זמן.

אלגוריתמים מרכזיים בשימוש בבקרת משוב כוללים עומק Q-Networks (DQN) עבור פעולות דיסקרטיות, מדיניות די-טרנטית Gradient (DDPG) ו- Soft Actor-Critic (SAC) עבור פעולות רציפות, ואופטימיזציה של מדיניות Proximal (PPO) לאימון יציב.A יתרון קריטי של RL היא היכולת שלה לגלות אסטרטגיות בקרה לא-איטיות כי מודל מבוסס על ידי אימון, אך דורשות, אך ורק על ידי פיתוח של יעילות אבטחה מוקדמת של זמן אמתית (FSD) עבור פיתוח, אך ורק לאחר מכן, אך ורק לאחר מכן, אך ורק לאחר מכן דורש אופטימיזציה של שיטות בקרה על ידי שימוש ב-FCR-FSD, אך ורק לאחר מכן, יעילות אבטחה קפדנית של יעילות אבטחה מבוססת על ידי שימושית (FSD) עבור פיתוח של יעילות אבטחה מבוססת על ידי ניתוח יעיל של אבטחה מראש.

בקרת מצב (SMC)

בקרת מצב סליד היא טכניקת בקרה חזקה המציגה בכוונה פעולות שליטה בלתי פוסקות כדי לכפות את מסלול המדינה של המערכת על פני משטח מוגדר מראש.פעם על פני השטח, המערכת מציגה דינמיקה רצויה (למשל, התכנסות אקספוננציאלית) הוא ללא מודל במובן זה כי זה רק דורש ידע של גבולות העליונים של אי-ודאות והפרעות, לא המבנה המדויק שלהם מורכב בדרך כלל תקופת בקרה שווה ערך עבור תקופות של מגבלות לא-וודאות.

האתגר העיקרי עם SMC קונבנציונלי הוא צ'אט-מאטים - oscillations גבוה בסימן הבקרה הנגרמת על ידי תקופת המעבר. צ'אטטרינג יכול להרגשת דינמיקות לא מתוכננות ופעולות נזק. וריאנטים ללא מודל, כגון מצבי זיווג גבוה יותר ולהפחית אלגוריתמים על-ידי צ'אט, תוך הקטנת הפעולה לנגבות גבוהות יותר של המשתנים:

יתרונות אסטרטגיות ללא מודל

בקרת משוב ללא מודל מציעה כמה יתרונות משכנעים על פני גישות מסורתיות המבוססות על מודלים:

  • מודל LT:0 [המודל] לא נדרש: 1.10.10.1 מבטל את תהליך הסימון והטעייה של זיהוי מערכת.זה חשוב במיוחד עבור מערכות עם פיזיקה לא ידועה או מוכרת חלקית, כגון רובוטים רכים, רקמות ביולוגיות, או תהליכים כימיים עם קינטיקה תגובה מורכבת.
  • (FLT:0) רובווט לחוסר ודאות: FIRLT:1 כי הבקר מתאמת באופן קבוע או משתמש בהחלפת שמרנית, הוא יכול להתמודד עם פרמטרים, רעש, והפרעות חיצוניות ללא השפלה בביצועים.
  • (FLT:0) lexibility עבור מערכות לא לינאריות: שיטות ללא מודל לא מסתמכות על לינאריזציה, מה שהופך אותם מתאימים באופן טבעי למפעלים לא לינאריים חזקים.זה כולל היסטריה, חיכוך, חיכוך, חיכוך, משיכה ואזורים מתים.
  • (FLT:0Simplified tuning:FLT:1) בקרים רבים ללא מודל יש פחות פרמטרים מוגדרים למשתמש (למשל, שיעורי למידה, שכנוע) שניתן לתקן או להגדיר באופן היצילין, צמצום הצורך בהתערבות מומחה.
  • (FLT:0) ,Ul למידה פוטנציאל: ⁇ 1:1 , בקר ללא מודל מאומן בסימולציה יכול לעתים קרובות להיות מועבר למערכת האמיתית עם שינוי מינימלי, במיוחד כאשר השימוש בתיקון דומיין נעשה שימוש.

המונחים

בעוד ששליטה חופשית מודל מבטלת את הצעד הדוגמנות, היא מציגה אתגרים חדשים שמהנדסים חייבים לטפל בהם כדי להשיג פריסה אמינה.למטה הם שיקולים קריטיים של יישום, מאורגנים על ידי רכיב מערכת הבקרה.

רכישת נתונים ועיבוד

נתונים בזמן אמת הם הדם של כל בקר ללא מודל. גבוה, מדידה נמוכה של פלטי צמחים (למשל, מיקום, מהירות, טמפרטורה, לחץ) הוא חיוני.חיישנים חייב להיות calibrated ופילטר כדי להפחית את הרעש. עבור בקרים אדפטטיביים ו-RL, שיעור הדגימה חייב להיות מהיר מספיק כדי ללכוד דינמיקה ללא תרגולים, אולי מוקרן מראש.

יציבות ושקיפות

יציבות היא מאתגרת יותר ללא מודל. .בקרים הסתגלותיים יכולים להיות לא יציבים אם רווח ההסתגלות נקבע גבוה מדי או אם יש עיכוב זמן לא מוגדר. שיטות מבוסס ליפסנוב ועקשנות של תנאי ציטוט יכולים להבטיח יציבות עבור שיעורים מסוימים של שליטה הסתגלות.עבור RL, יציבות היא לעתים קרובות מאומת באמצעות טכניקות חקירה בטוחות (למשל, פונקציות בקרה, תפקודים, ליאון-סוב) ופעולות מונעות שליטה אגרסיביות על פני השטח.

המונחים: constraints

לולאות בקרה בזמן אמת כוויות בלוח זמנים קפדני - תקופות הדגימה הצמיגים נע בין microIIs (Power אלקטרוניקה) ל- מילימטרים (זרועות מסחריות) , נביחות מבוססות רשת RL עשוי להיות איטי מדי עבור מערכות מהירות אלא אם כן מואצ באמצעות GPUs, FPGAs, או מיוחד בהקצאת אלגוריתמים עם אלגוריתמים מחדש או ריבועיים פחות או משקל עצבי (reativeal) הוא דורש גם גישה חיצונית פשוטה יותר.

בטיחות ואמינות

בקרים ללא מודל עשויים לחקור פעולות לא בטוחות במהלך הלמידה, במיוחד סוכני RL.הגבלות בטיחות ניתן לאכוף על ידי הוספת שכבת פיקוח (למשל, מסנן בטיחות כי מעל בקר הלמידה כאשר אותות עולה על סף), או באמצעות אלגוריתמים מאובטחים של RL המשלבים מגבלות לתוך אופטימיזציה.עבור בקרה אדפטיבית, פרמטר ושינויים דליפות למנוע מניתוחים של בקר מסחף לערכים לא מציאותיים.

דרישות של בקרת מודל-חינם

בקרת משוב ללא מודל כבר הוצב בהצלחה על פני תחומים מגוונים.התתתתות הבאות מדגישות מקרים של שימוש נציג וטכניקות ספציפיות החלות.

רכבים רובוטיים ואוטונומיים

מניפולטורים רובוטיים עם מטען לא ידוע או חיכוך משותף ליהנות משליטה הסתגלות כדי לשמור על דיוק מעקב אחר מסלול.מודל-חופשי RL אפשר quadcopters לבצע תמרונים זריזים (flips, צלילה) ורובוטים ל- leye to learn gaits חזק עד שטח בלתי אחיד.FLT:0A דוגמה בולטת היא השימוש עמוק של RL כדי ללמד רובוט מסוים כדי ללכת מודל MPFreic.

בקרת תהליכים תעשייתיים

כורים כימיים, עמודות זיקוק, ומילימטרי נייר לעתים קרובות להפגין התנהגות לא ליניארית, זמן-varying. שליטה הסתגלות ללא מודל כבר הוחל על שמירה על איכות המוצר תוך דחיית הפרעות משינויים בהזנה.לתהליכים אצווה, בקרה למידה קפדנית משפרת את הביצועים של ערכת אחד למשנהו, צמצום הפסולת והצריכת האנרגיה.

מערכות אנרגיה מתחדשת

בקרת לוח השמש נקודת מעקב (MPPT), ומערכות ניהול סוללות כל להתמודד עם דינמיקות לא בטוחות, זמן-מה. שיטות MPPT ללא מודל (למשל, טורף והתבונן, התנהגות מצטברת) משמשים נרחב, אבל מתקדם יותר MPPT מבוסס RL יכול לשפר את קציר האנרגיה תחת גילוח חלקי.

מכשירים ביו-רפואיים

אספקת Anesthesia, משאבות אינסולין, ו קוצני לב חייבים לפעול באופן אמין למרות סבלנות למטופל-לטיפול. שליטה אדפטיבית ללא מודל של עומק ההרדמה הוכח בניסויים קליניים, באופן אוטומטי התאמת שיעורי ההיתוך המבוססים על EEG או סימנים חיוניים.Deep RL נחקרה עבור בקרת גלוקוז סגורה מסוג 1 סוכרת, באמצעות מעקבים רציפה של גלוקוז למשאבות אינסולין.

אתגרים ומגבלות

למרות ההבטחה שלהם, אסטרטגיות ללא מודל אינן אתגרים מרכזיים כוללים:

  • (FLT:0) יעילותו של אלגוריתמים: FLT:1 אלגוריתמים לעתים קרובות דורשים מיליוני אינטראקציות ללמוד מדיניות טובה, אשר עשוי להיות בלתי אפשרי עבור מערכות יקרות או איטיות (למשל, צמחים כימיים). Offline RL ו- SIM-to-real transfer יכול להקטין את זה אבל להציג פער מציאות.
  • (FLT:0)Lack של הסברה: FLT:1, בקרים מבוססי רשת נילדור הם ארגזים שחורים, מה שהופך את זה קשה לאבחן התנהגות בלתי צפויה או לאשר בטיחות.
  • (FLT:0) ביצועי פודור עם דינמיקות מהירות:FLT:1 ככל שפס רוחב פס המערכת עולה, חישוב ונתוני עלייה להיות צווארי בקבוק.עבור מערכות מהירות מאוד (למשל, ממירי חשמל עוברים ב -100 kHz), שיטות ללא מודל בדרך כלל מוגבלות כדי להתאים פשוט או מסלקת לולאות מצב.
  • (FLT:0) ,Initial Transient:FLT:1 החלים הסתגלות עשויים להציג גדול overshoot או oscillations במהלך הסתגלות ראשונית אם שיעור הלמידה הוא אגרסיבי. בטוח ראשונית (למשל, החל עם PID שמרני) הוא לעתים קרובות הכרחי.

כיוונים עתידיים

מחקר בשליטה על משוב ללא מודל הוא מאיץ, מונע על ידי התקדמות בלמידה מכונה וחומרה מחשוב.

  • (FLT:0) שיטות מבוססות מודל / מודלים: FLT:1 גישות משולבות להשתמש מודל משוער פשוט עבור חיזוי ורכיב ללא מודל עבור פיצוי של אי-ודאות.
  • (FLT:0)Safe חיזוק למידה:FLT:1 integrating certificates, ניתוח יכולת להגיע, אימות רשמי להבטיח בטיחות במהלך חקירה ולאחר התכנסות.
  • (FLT:0) למידה של הסתגלות מהירה: קיד 1 (FLT:1) מאמנת בקר להסתגל במהירות לדינמיקה חדשה עם רק כמה אינטראקציות באינטרנט, המאפשר פריסה מהירה על פני סביבות שונות.
  • (FLT:0)Edge AI והאוצה משובצת:FIRLT:1) , Deploying Cal RL או בקרים אדפטיים על מיקרובקרים באמצעות רשתות עצביות קוונטיות ומערכות הפעלה יעילות בזמן אמת.

מסקנה

אסטרטגיות בקרת משוב ללא מודל מספקות ערכת כלים רבת עוצמה לשליטה במערכות עם דינמיקות לא ידועות או לא ברורות.מפרמטר מקוון של שליטה הסתגלות מדיניות של למידה וניתוק של שינוי חזק של שליטה במצב, מהנדסים עכשיו יש חלופות רבות קיימא לשיטות מסורתיות המבוססות על מודלים.כל טכניקה מגיעה עם כוחותיה שלה הנדסה ומגבלות, והבחירה הטובה ביותר תלויה בקנה מידה של זמן של בטיחות, דרישות, זמין כמו גם ביצועים תיאורטיים יותר של ניהול יעיל יותר.