ניהול אופטימאלי ללא מודל

שליטה אופטימלית ללא מודל מייצגת שינוי פרדיגמטי בהנדסת בקרה, במיוחד עבור מערכות דינמיות מאוד שבו גישות המבוססות על מודלים מסורתיים נופלות קצרות. במערכות כגון מזל"טים אוטונומיים, ממניפולטורים רובוטיים בסביבה לא מובנת, או תאים תעשייתיים גמישים, קבלת מודל מתמטי מדויק של דינמיקת הצמח היא לעתים קרובות לא מעשית או בלתי אפשרית.מודל ללא טיפול זה על ידי למידה של מדיניות בקרה אופטימלית ישירות מאינטראקציה נתונים או בזמן אמת, ללא משוב, ללא משוב, ללא צורך במהירות של מערכת זיהוי.

היתרון העיקרי של שליטה ללא מודל הוא ביכולתו להסתגל לדינמיקה לא ידועה.במקום להסתמך על מודל מראש, הבקר חוקר את המרחב של המדינה-פעולה ומשתמש בתצפיות לשיפור ביצועים באופן מצטבר. גישה זו המונעת נתונים תואמת היטב עם יכולות רגישות ומחשוב מודרניות, המאפשר אופטימיזציה בזמן אמת בהגדרות שנחשבו בעבר מורכב מדי עבור תורת הבקרה המסורתית.

טכניקות ליבה בשליטה חופשית מודל

כמה מתודולוגיות נפרדות נופלות מתחת למטריה של שליטה אופטימלית ללא מודל.כל אחד מציע נקודות חוזק ייחודיות ומסחריים, ובחירת הטכניקה תלויה לעתים קרובות בטבע המערכת, המשאבים החישוביים הזמינים, ואת דרישות הביצוע.

Reinforcement Learning

Reinforcement Learning (RL) התפתחה כמסגרת דומיננטית לשליטה ללא מודל.In RL, סוכן לומד להגביל מדיניות אופטימלית על ידי אינטראקציה שוב ושוב עם הסביבה, קבלת תגמולים או עונשים על מעשיו.הרעיון המרכזי הוא למקסם את הפרס המצטבר לאורך זמן ללא צורך מודל מעבר התקדמות, Algorithms כגון Q-learning, Deep Q-Networks (DQ-Networks) מדיניות ®, ו- סימולציה כמו אופטימיזציה יעילה יותר של שחקן בקרה יעילה יותר.

תכנות דינמי

תכנות דינמי הסתגלותי (ADP) הוא שיעור של שיטות כי קרוב באופן יחסי לתפקוד הערך האופטימלי ומדיניות בקרה. ADP טכניקות לעתים קרובות להשתמש ברשתות עצביות או מוליכים אחרים לתפקוד לייצג את הפונקציה הערך ואת הבקר.תהליך הרציני כרוך בערכת מדיניות (עדכון הפונקציה המבוססת על מדיניות נוכחית) ושיפור מדיניות (הפחתת המדיניות המבוססת על הפונקציה החדשה).

אבולוציה אלגורית

אלגוריתמים אבולוציוניים (EAs) מציעים גישה מבוססת אוכלוסייה לאופטימיזציה ללא מודל.טכניקות כגון אלגוריתמים גנטיים, אבולוציה שונה, ואסטרטגיה להתאמה של מטריקס (CMA-ES) לפתח מערכת של מדיניות בקרת מועמדים על פני דורות.בכל דור, מדיניות מוערכת על המערכת האמיתית או סימולטור, והמבצעים הטובים ביותר נבחרים ומומרים ליצירת הדור הבא הם בדרך כלל לא דינמיקה מתאימה, כאשר הם לא צריכים פונקציות פשוטות של שינוי או קידודים, בדרך כלל, כאשר הם בדרך כלל מתאימים לפונקציות קידודים, או למערכות לא רלוונטיות, או למערכות לא רלוונטיות, כאשר הם בדרך כלל, כאשר הם בדרך כלל, כאשר הם דורשים קידודיות, או למערכות מורכבות יותר מאשר למערכות לא רלוונטיות עבור מערכות לא רלוונטיות עבור מערכות לא רלוונטיות עבור מערכות לא קידודיות.

יישום אתגרים ואסטרטגיות מיגציה

חלוקת שליטה חופשית במודל במערכות דינמיות מאוד מציגה מערך אתגרים שיש לטפל בהם כדי להבטיח ניתוח בטוח, יציב ויעיל.התתת הבאה מפרטת את הנושאים הדוחקים ביותר ואת חוקרי האסטרטגיות והמהנדסים להשתמש כדי להתגבר עליהם.

בעיות יציבות ושקיפות

אלגוריתמים ללא מודל לעתים קרובות חסרים ערבויות יציבות פורמליות, במיוחד בשלב הלמידה. במערכות דינמיות, בקר לא יציב יכול לגרום לכשלונות קטסטרופליים.כדי להפחית את זה, מתרגלים משתמשים בטכניקות כגון אופטימיזציה חזקה (למשל, הוספת מגבלות חזקות ליעד הלמידה), תוך שימוש בשיטות מבוססות לייפנוב כדי לאכוף יציבות, או הכשרה בסימולציה עם סימולציה לפני פריסת המערכת האמיתית.

דוגמאות יעילות וחקירה

מערכות דינמיות גבוהות פועלות לעתים קרובות במהירות של זמן, הגבלת מספר האינטראקציות הזמינות ללמידה. שיטות ללא מודל הן דוגמאות-הונגריה לשמצה.כדי לשפר את יעילות הדגימה, טכניקות כגון ניסיון לשחזר (אחסון מעברים קודמים ושימוש בהן), מודלים המבוססים על מודלים חמים (באמצעות מודל משוער כדי ליצור מדיניות ראשונית), ולמידה מחוץ לתחום (למידה מהנתונים שנוצרו על ידי מדיניות שונה) הם גם יכולים להשתמש אותות מתמטיים או למנוע מודלים מונחה של שיטות חקירה.

זמן אמת-התאמת

הדרישות החישוביות של אלגוריתמים ללא מודל - במיוחד אלה המשתמשים ברשתות עצביות עמוקות - יכולות להיות כבדות. במערכות משובצות או לולאות שליטה גבוהות של שליטה בקידוד גבוה, יש להשלים בתוך מיקרו-שניות. Solutions כוללים שידור רשת, קוונטיזציה, והאצה חומרה (למשל, באמצעות GPUs או FPGTime) עבור יישומים מסוימים, ארכיטקטורות קלות כגון רשתות פונקציה רדיוארית או יישום פונקציה ליניארית הם מספיקים כדי להשיג התאמה טובה (לאחר מכן) עם מערכות חישובית זמן טוב יותר (לאחר מכן) עם סימולציה מקוונת עם ביצועים מתקדמים) ותיקון מוקדם יותר מאשר ביצועים מתקדמים (מערכת מעקב אחר (מערכת חישובית) עם סימולציה מתקדמת) עם סימולציה מתקדמת (מערכת מעקב אחר (מערכת מעקב אחר (מערכת מעקב אחר).

גישות היברידיות מתקדמות

כדי לשלב את החוזקות של שיטות מבוססות מודל ומודל ללא מודל, החוקרים פיתחו אדריכלות היברידית.לדוגמה, מרכיב מבוסס מודל יכול ליצור פעולות בקרה ראשוניות או לספק תחזית לטווח קצר, בעוד מרכיב ללא מודל לומד לתקן עבור מודלים של אי דיוקים מודל או להתמודד עם הפרעות ללא זיכיונות ללא מרשם.כל פופולרי נוסף הוא השימוש "חופשי" מודל של תכנון (למשל, מודלים ללא מרשם) אבל שיטות למידה הן מהירות יותר מאשר אופטימיזציה של מערכת פשוטה יותר מאשר אופטימיזציה של נתונים.

תוצאות חיפוש עבור Model-Free Optimal control

הגמישות של גישות ללא מודל הובילה לאימוץ שלהם על פני תעשיות רבות. להלן הן דוגמאות מורחבות של יישומים בעולם האמיתי.

רכב אוטונומי ודנונס

כלי רכב אוטונומיים הפועלים בתנועה בלתי צפויה, שינוי מזג אוויר, או על פני השטח המחוספסים מאוד משליטה ללא מודל. אלגוריתמים של RL שימשו כדי להכשיר מדיניות נהיגה מקצה לקצה מקלטי מצלמה, המאפשרים לרכבים לטפל במצבים שלא נתקלו במפורש במהלך אימון. Quadrotors באמצעות בקרת ללא מודל הוכיחו זריזות בסביבות דינמיות, כגון טיסה דרך יערות או הסתגלות להפחתה של שינויים ללא ניתוח אוטומטי של חוקרים השתמשו גם בתבניות למידה יעילות.

רובוטיקה בסביבה לא מאורגנת

מניפולטורים רובוטיים שנקטו בתפיסת חפצים לא ידועים, ההרכבה בתנאים משתנים, או נפיחות על שיטות ללא בסיס אפילו שימוש מודל-מודלים כדי להסתגל בזמן אמת.אלגוריתמים אבולוציוניים מצאו הצלחה בדפוסי הגאה מתפתחים עבור רובוטים לרגליים, בעוד ש-RL מאפשרת מניפולציה דה-קסטרנזית עם חישה מגע רב-ממדית. במסגרות תעשייתיות, בקרת מודל-חופשית מאפשרת לשמור על רובוטים למרות כלי דיוק או כלי בגאומטריה חלקית.

אנרגיה ומערכות כוח

ברשתות חכמות ובמיקרואורגניזמים, האופי הדינמי של הדור המתחדש וביקוש העומס הופך את השליטה האופטימלית ללא מודל אטרקטיבי. Algorithms כמו ADP כבר מיושם לניהול אחסון סוללות, זרימת כוח אופטימיזציה, ותדירות ייצוב בזמן אמת. Wind טורבינות שלט ובניית מערכות HVAC נהנה גם מאסטרטגיות ללא מודל הסתגלות אשר משפרות יעילות אנרגיה ללא צורך מודלים תרמיים או אווירודינמיים.

בקרת תהליכים והנדסה כימית

תהליכים כימיים לעתים קרובות להפגין התנהגות לא ליניארית, זמן-מה שקשה מודל מעקרונות ראשונים.בקרת ללא מודל שימשה לשליטה בטמפרטורה של כור אצווה, אופטימיזציה בעמודה, ובקרת איכות פולימרית.יישומים אלה ממנפים את היכולת של שיטות ללא מודל ללמוד ממעבד נתונים ולהתאים לניתוק זרז או הפחתת הריאציות.

כיוונים עתידיים

התחום של בקרת אופטימלית ללא מודל מתפתח במהירות. .Promising שדרות כוללות שילוב אי הוודאות קוונטית החלטות חזקות לתוספת ללא מודלים, שילוב למידה מקוונת לא מקוונת עבור הסתגלות לכל החיים, ופיתוח ערבויות תיאורטיות לבטיחות ולהתכנסות במרחבים של המדינה-פעולה רציף.תיבת גבול נוספת היא השימוש בשליטה חופשית מודל במערכות מרובות-מקודמות, שבו בקרים מרובים אינטראקציה וחייבים אינטראקציה מתואמת ללא כלי תקשורת יעיל יותר, כמו גם כן, כמו גם יעיל יותר סטנדרטי, הופך להיות יעיל יותר סטנדרטי של כלי בקרה סטנדרטיים, כמו גם יעיל יותר סטנדרטיים, כמו גם אלגוריתמים יעיל יותר, כמו גם אלגוריתמים יעיל יותר, כמו גם שיטות בקרה סטנדרטיים, כמו גם אלגוריתמים יעיל יותר, כמו גם יעיל יותר, כמו גם אלגוריתמים סטנדרטיים, כמו גם יעיל יותר, כמו גם יעיל יותר, כמו גם יעיל יותר, כמודל יעיל יותר, כמו גם שיטות בקרה סטנדרטיים יעיל יותר, כמו גם יעיל יותר, כמו גם שיטות בקרה סטנדרטיים יעיל יותר, כמו יעיל יותר, כמו גם שיטות בקרה סטנדרטיים סטנדרטיים סטנדרטיים סטנדרטיים, כמו גם שיטות בקרה סטנדרטיים, כמו גם שיטות בקרה סטנדרטיים, כמו גם שיטות בקרה סטנדרטיים, כמו גם שיטות בקרה סטנדרטיים, כמו יעיל יותר, כמו יעיל יותר, כמו

(ב) ראו (ב) (ב) , ראה (ב) , ראה (ב) , עיין בסקירה של הסקירה של ה-FLT:2research) על מנת לחזק את הלמידה עבור רחפנים שליטה ב-FLT 3, וסקר של שיטות תכנות דינמיות הסתגלות:5