למה לפטור את העניינים

מערכות הנדסה מודרניות פועלות תחת איום מתמיד של כשל רכיב.בין אם בחלל, תקשורת, רשתות חשמל או מרכזי נתונים, היכולת לשמור על פונקציונליות למרות ההידרדרות במערכת חלקית אינה אופציונלית & mdash; זהו דרישה עיצובית בסיסית. נקודה אחת של כשל במערכת תשתיות קריטית יכולה לקפל לשיבוש נרחב, עלייה של מיליוני הכנסות אבודות, מוניטין מזיק, ובמקרה הגרוע ביותר, מסכנת חיים אנושיים.

האתגר הוא איזון אמינות נגד עלות.להגביר את כל רכיב להיות עמיד בפני כישלון הוא יקר באופן בלתי נמנע.במקום, מהנדסים זקוקים לשיטות שיטתיות כדי לקבל החלטות חכמות על הקצאת משאבים, התחדשות ואסטרטגיות התאוששות.זהו המקום שבו תכנות דינמי מופיע מסגרת מתמטית חזקה לעיצוב מערכות סובלניות לקויות הפועלות קרוב אופטימלית תחת אי ודאות.

על ידי מחיקת בעיות החלטה מורכבות של היתכנות ל- subproblems, תכנות דינמי מאפשר למהנדסים לנסח מדיניות אופטימלית עבור מערכת תיקון מחדש, תיקון תזמון, וחלוקת יתר של עומס.התוצאה היא שיעור של מערכות שחותמות בחסד ולא להיכשל באופן קטסטרופלי, כל זאת תוך שמירה על מגבלות תקציב ומגבלות תפעוליות.

מה זה דינמי תכנות?

מקורות ועקרונות הליבה

תכנות דינמי (DP) פותח על ידי ריצ'רד בלמן בשנות החמישים כאמצעי לפתרון בעיות אופטימיזציה מורכבות המציגות את ה-FLT:0optimal subBuildFLT:1 ו-FLT:2 (מעלה) ל- 2 (ראהים) לפתרונות אופטיים (optimal subproblems) מאשר למקם את הפתרונות היעילים שלהם, מאשר למקם אותם מחדש, מאשר למקם אותם מחדש את אותם פעמים מרובות, מאשר למקם אותם מחדש, מאשר לפתרונות יעילים יותר מאשר למקם אותם.

בלבו, DP מבוסס על משוואה FLT:0Bellmanische משוואה 1FLT:1, מערכת יחסים חוזרת המגדירה את הערך של להיות במדינה מסוימת כמו הפרס המיידי בתוספת הערך המוזנח של מדינות עתידיות.משוואה זו יוצרת עמוד השדרה של רוב האלגוריתמים העקורים ומרחיבת באופן טבעי לסביבות סטושבסטיות שבו התוצאות הן פרוביסטיות.

עבור הנדסה לא-סובלנית, משוואה בלמן מספקת דרך להעריך את ההשלכות ארוכות הטווח של החלטות שהתקבלו היום. החלטה לדחות תיקון עשויה לחסוך כסף עכשיו, אבל זה מגביר את ההסתברות של כשל קטסטרופלי מחר. DP מגדיר את הסחר הזה באופן קפדני.

מסגרת ההחלטה של Markov

בעיות תכנות דינמיות בהנדסה הן בדרך כלל מודל לתהליכי החלטות של 0 ממארקוב (MDPs)BuildFLT:1.

  • (ב) ⁇ :0 מדינות: ⁇ 1:1 ; כל התצורה האפשריים או רמות הבריאות של המערכת.
  • (ב) ⁇ :0) החלטות: ⁇ 1 (ב) ליוצר, כגון תיקון, תחליף או שינוי.
  • (ב) ,0) הסתברות של העברת מדינה אחת לאחרת.
  • (ב) [ה]ההעברות או העלויות: ערכים נומריים הקשורים לכל זוג פעולה, משקפות ביצועים, אמינות או השפעה כספית.

לאחר שה- MDP מוגדר, אלגוריתמים של DP מייחסים ל-FLT:0 (policyFeloph:1 — מיפוי ממדינות לפעולות ו-mdash; הממקסים את הפרס המצטבר (או ממזער עלות מצטברת) על פני אופק סופי או אינסופי.

שימוש ב- Dynamic Programming to Fault Tolerance

מדוע DP הוא טבעי

מערכות סובלניות הן בעיות בהחלטה מהותיות תחת אי ודאות.אירוע כישלון גורם רצף של תגובות אפשריות: לאבחן את האשמה, לבודד את הרכיב המושפע, לנתב תנועה, ליזום תיקון, או אולי לא לעשות דבר ולקבל ביצועים מוזנחים.כל החלטה משפיעה על ההסתברות והתיקון העתידיים.

יתר על כן, מערכות סובלניות פועלות לעתים קרובות בסביבות FLT:0 ריאליות-Timesual-Timesual-Timesual-Timesualסביבות 1:1 שבו יש לבצע החלטות במהירות. כי DP precomputes מדיניות אופטימלית לא מקוון (או עדכונים אותם באופן מצטבר), ביצוע מקוון מקטין לתצפית שולחן פשוטה.יעילות חישובית זו היא קריטית עבור מערכות משובצות במטוסים, כלי רכב אוטונומיים, ובקרים תעשייתיים.

דוגמה קונקרטית ממחישה את כוחו של DP.חשבו על אשכול שרתים במרכז נתונים בענן.כל שרת יכול להיות בריא, מחוספס, או נכשל.המפעיל יכול לבחור להחליף שרת מחוספס באופן מיידי (בדרך כלל אך מונע זמן השבת), לאפשר לו להמשיך לרוץ (אין עלות מיידית אך סיכון גבוה יותר), או להפיץ את העומס שלו לשרתים אחרים.

מודלים של מדינות ועברות

מהנדסים מתחילים על ידי הגדרת המרחב הממלכתי.עבור מערכת סובלנית, מדינות ללכוד את הבריאות של רכיבים בודדים ואת התצורה הכוללת של מערכת.מדינה יכולה להיות מיוצגת כקטור:0(סטטוס של רכיב A, מעמד של רכיב B, רמת עומס, זמן מחלף מאז תחזוקה אחרונה)

המעבר בין מדינות מתרחש בשל:

  • (ב) [15] ⁇ : ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • (ב) ,0) ,Repairs: 1A נכשלה או מופרעת רכיב משוחזר למצב בריא יותר לאחר התערבות.
  • שינויים מהותיים (FLT:0) שינויים: FLT:1 גורמים חיצוניים כגון טמפרטורה, רטט או מתקפות סייבר משנים את שיעורי הכשל.
  • (ב) ,0) פעולות: החלטות 1FLT 1:1 כדי להחליף מצבי ריצוף, להפעיל יכולת לחסוך או לשפוך עומסים.

ההסתברות לשינוי מוערכת בנתונים היסטוריים של כשל, מפרטים של היצרן, או ניטור בזמן אמת. DP אינו דורש התחייבויות מדויקות; אפילו מודלים משוערים מניבים מדיניות חזקה שגישות ירומיות.

הרחבה אחת היא תהליך קבלת ההחלטות של מארקוב (POMDP)FLT:1, שבו מדינת המערכת האמיתית אינה ידועה לחלוטין.לדוגמה, חיישן עשוי לדווח על רכיב בריא כאשר הניצול הפנימי כבר החל. POMDP משלבת אמונה וחרדה; הסתברות להפצת מצב אמת ומערכת לא אמינה (אך היא מערכת לא אמינה) עם מדיניות זו או אחרת (תיקון) היא יעילה יותר עם מדיניות אבחון רלוונטית (למשל, במיוחד עם מדיניות אבחון).

עלויות ומטרות אופטימיזציה

בחירת תפקוד העלות משפיעה עמוקות על האסטרטגיה של חוסר סובלנות.מבנה עלות משותפת כולל:

  • (ב) ,0) ,התמדה המצטברת: FLT:1 , מינימלית את הזמן הכולל שהמערכת אינה זמינה באופק תכנון.
  • (FLT:0) עלות מופרזת של כישלונות בתוספת תיקונים: ⁇ 1) ,הסימן ערכים כספיים לאירועים ותיקון פעולות, כולל עבודה, חלקי חילוף, והפסד הכנסות.
  • (FLT:0Weightedסכום של מדדי אמינות: אנדרל 1) שלב פירושו זמן בין כשלים (MTBF), פירושו זמן לתקן (MTTR), וזמינות למטרה אחת.
  • (ב) קריטריונים רגישים ל- 0Risk: FLT:1 Penalize נמוך-הסתברות, אירועים בעלי ערך גבוה יותר מאשר הערך הצפוי בלבד יציע.

מהנדסים חייבים גם להחליט על בעיות של ההרחבה:0 (התוצאה של ההרחבה:0) עבור בעיות ללא הפסקה (FLT:0) עבור בעיות ללא הכרעתון אינסופיות (FLT:0) עבור גורם הנחה קרוב ל-1 נקודות מצביע על כך שעלויות עתידיות חשובות כמעט כמו אלה המיידיות, מה שמוביל לאסטרטגיות שמשקיעות בתחזוקה מונעת.

עבור מערכות עם מטרות מרובות (למשל, למקסם את האמינות בעת צמצום העלות), DP יכול להיות מורחב ל-FLT:0multi-objective OptimizationFLT:1 על ידי דרוג המטרות או מחשוב גבול Pareto של מדיניות לא מזוהמת.

אסטרטגיות של Algorithms and Implementation אסטרטגיות

ערך

הכדאיות היא האלגוריתם הנפוץ ביותר של DP עבור מערכות סובלניות לקויות.זה מעדכן שוב ושוב את הפונקציה הערך עבור כל מדינה באמצעות משוואה בלמן עד ההתכנסות.

  • התכנסות מובטחת לתפקוד הערך האופטימלי עבור מוזנח וסופי-horizon MDPs.
  • מורכבות חישובית לריגול (לאריני במספר המדינות והפעולות).
  • באופן טבעי במקביל, המאפשר פריסה על אשכולות GPU עבור אזורי מדינה גדולים.

עבור מערכות עם אלפי מדינות או עשרות אלפי מדינות, הכדאיות מתתכנסת בתוך שניות על חומרה מודרנית.עם זאת, עבור מערכות עם חללי מדינה משולבים (למשל, 20 מרכיבים מחוסנים כל אחד עם 3 רמות בריאות מייצרות 3 ² & #8304; מדינות), ערך הופך להיות בלתי נשלט ללא טכניקות של חיזוי.

מדיניות Iteration

מדיניות ההסרה היא אלטרנטיבה כי לעתים קרובות מתאחדת בפחות היחלשות מאשר הכדאיות ערך, אם כי כל איטרציה היא יקרה יותר חישובית.זה משתנה בין הערכת מדיניות (קביעת הפונקציה הערך למדיניות קבועה) ושיפור מדיניות (הרחבת המדיניות להיות חמדנית ביחס לתפקוד הנוכחי).

לבעיות של בעיות של בעיות של בעיות חסרות תקדים עם חללים קטנים עד בינוניים, הכדאיות של מדיניות היא לעתים קרובות המועדפת כי היא מייצרת ישירות את המדיניות האופטימלית מבלי לדרוש סף התכנסות מפורש.זה גם מסתיים בדיוק לאחר מספר סופי של היחלשות, בעוד שערך זה רק מתקרב לערך האופטימלי כפייתיתית.

תכנות דינמי עבור מערכות גדולות

מערכות הנדסה בעולם האמיתי יכולות להיות חללים מדינה גדולים אסטרונומיים.למטוס מודרני יש מיליוני רכיבים; מרכז נתונים מכיל מאות אלפי שרתים. Exact DP הוא בלתי אפשרי עבור מערכות כאלה.מהנדסים פונים ל-FLT:0approximate תכנות דינמי (ADP)FLT:1 שיטות:

  • (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • (FLT:0Function approximation: FIRLT:1) מייצג את הפונקציה הערך באמצעות רשת עצבית, שילוב ליניארי של פונקציות בסיס, או עץ החלטות.
  • (ב) אלגוריתמים של אלגוריתמים:0) השתמש בסימולציה מונטה קרלו כדי להעריך את ערך הפעולות, לעקוף את הצורך במודל מעבר מלא של המדינה.
  • (ב) DP:0) Hierarchical DP:FLT:1 (ה) נניח את המערכת ל- subsystems, לפתור כל תת-מערכת באופן עצמאי, ולתאם באמצעות מדיניות ברמה גבוהה.

שיטות אלה להקריב ערבויות אופטימליות אבל לעתים קרובות לייצר מדיניות כי הם קרוב לאופטימלי בפועל.לדוגמה, גוגל משתמשת בשיטות DP דומות עבור אופטימיזציה קירור במרכזי הנתונים שלה, השגת 40% חיסכון באנרגיה תוך שמירה על מטרות סובלנות לקויה.

גישה חופשית מודל: Q-Learning and Beyond

כאשר ההסתברות של המעבר אינה ידועה או יקרה מדי לאמודה, (FLT:0) למידה חופשית של חיזוקים מודלי (FLT:1) מספקת אלטרנטיבה. Q-learning, אלגוריתם בשימוש נרחב, לומד את הפונקציה אופטימלית של פעולה-ערך ישירות מניסיון מבלי לדרוש מודל מערכת.הסוכן אינטראקציה עם המערכת, צופה תגמולים, ומעדכן את ערכי Q באמצעות חוק פשוט:

(ב) ויקרא י"א): "וַיְהַה (בְּהָעָה אִתָּבְהַה הוּא הוּא הוּא הוּא הוּא הוּא הוּא הוּא הוּא הוּא ; אִתָּבְתָּבְאֶתָּבְתָּבְאֶתִּיִם הוּא" (ב"ב"ב"ב"ב"ב"ב, כ"ב"ב"ב"ד).

איפה α הוא שיעור הלמידה ו γ הגורם הנחה.עם הזמן, Q-learning מתאחד למדיניות האופטימלית עבור MDPs עם שטח מדינה סופי ופעולה.עבור סובלנות לקויה, זה אומר שהמערכת יכולה ללמוד אסטרטגיות התאוששות יעילות לחלוטין באמצעות ניסיון, מבלי לדרוש מודלים מפורשים של שיעורי כישלון או תיקון עלויות.

עמוק Q-networks (DQN) מרחיב Q-learning למרחבים גדולים באמצעות רשתות עצביות עמוקות.ביישומים בולטים אחד, החוקרים השתמשו ב- DQN כדי לפתח מדיניות של סובלנות לאשמה עבור חטיפות רחפנים אוטונומיות.המדיניות של המלומדים יצאה לאור כיוות ידניות בעלות 23% בשיעור ההשלמה תחת תקלות במערכת חלקית.

מחקרים: DP in Action

כוח שיקום

רשתות חשמל הן בין המערכות המורכבות ביותר, עם אלפי גנרטורים, מהפךים, קווי שידור, ו substations. כאשר מתרחשת תקלה, מפעילי חייב להחליט במהירות כיצד לשנות את הרשת כדי לשחזר את הכוח תוך הימנעות עומסים על רכיבים הנותרים.הבעיה שיקום מתאים באופן טבעי ניסוח MDP: מדינות מייצגות אילו רכיבים הם רמות עומס מבצעיות ועומס נוכחי; פעולות מקבילות או סגירת מעגל והתאמות גנרטורים.

חברת החשמל של טוקיו יישמה מערכת שיקום מבוססת DP אשר הפחיתה את משך ההוצאה הממוצע ב- 35%.המערכת מקדמת רצף שיקום אופטימלי עבור מאות תרחישים של תקלות באמצעות הכדאיות, ואז שולחת את הרצף המתאים כאשר מתרחשת תקלה אמיתית.התבנה העיקרית הייתה שמדיניות ה-DP יכולה להסביר את הטבע הפרוביביליטי של כשלים מכובשים, משהו שמערכות שלטון דטרמיניסטיות לא יכולות להתמודד איתו.

ניהול מטוסים

נאס"א למדה באופן נרחב DP עבור ניהול תקלות בחלליות.הרובים המאדים, למשל, חייבים לפעול באופן אוטונומי לתקופות ארוכות ללא התערבות בשליטה הקרקעית. כאשר רכיב מנוע גלגלים או מערכת חשמל מראה סימנים של השפלה, על הרובר להחליט אם להמשיך את הפעולות הנוכחיות, לעבור למערכת מחוסמת, או לעצור עבור אבחון.

על ידי גיבוש זה כ- MDP ופתרון עם מדיניות ההסרה, מהנדסים פיתחו מערכת ניהול לקויה (ה-FLT:0maximize נתונים מדעיים החזרה FLT:1), תוך שמירה על כוח ומגבלות תרמיות.המדיניות נחשבת להסתברות של כשלים קריטיים המשימה בהתחשב בבריאות הרכיב הנוכחית, הערך של נתונים מדעיים שניתן לאסוף, ועלות פעולות אבחון זה משך את החיים התפעוליים של הזדמנות מהפכנית של עיצובו הרבה מעבר לתכנון המקורי.

קרא עוד על נאס"א ’ יישום MDPs in aerospace:0NASA אוטומטית סיבה ו Synthesis PublicationsFLT:1

מרכז נתונים Allocation

ספקי ענן בקנה מידה גדול כגון אמזון Web Services ו- Microsoft Azure מפעילים מרכזי נתונים המכילים מאות אלפי שרתים.כל שרת חווה כשלים בשיעורים צפויים עקב הזדקנות חומרה, טמפרטורה ודפוסי עומס עבודה.המפעילים עומדים בפני החלטה רציפה: האם הם צריכים להחליף באופן פעיל שרת המציג סימנים מוקדמים של כישלון, או לתת לו לרוץ עד שהוא נכשל לחלוטין?

באמצעות DP, ספק ענן גדול מודל מרכז הנתונים כ- MDP שבו מדינות הן חלוקת הבריאות על פני צי השרת, ופעולות הן חלוקות והחלטות הגירה עומס עבודה.המדיניות האופטימלית הפחיתה את העלות הכוללת של בעלות ב-12% בהשוואה להחלפה תגובתית, בעיקר על ידי הימנעות מהביצועים על עומס חירום של חלוקת חירום במהלך כשלים לא מתוכננים.

לצליל עמוק יותר על ניסוחים של MDP בניהול מרכז נתונים, ראה עסקאות FLT:0 (IEEE על ענן מחשוב מיוחד בנושא הונאה סובלנות FLT:1).

רשת התקשורת Survivability

רשתות תקשורת חייבות לשמור על קישוריות גם כאשר קישורים מרובים או צמתים נכשלים.התכנות דינמיות מסייעות לתכנן את הרשת (FLT:0survivable לרשת כדי להתנצלות על כך ש-FLT:1 עם מיקום אופטימלי של יכולת לחסוך.

החוקרים ניסחו זאת כבעיה DP סטוכיסטית שבה המדינה כוללת את עומסי הקישור הנוכחיים ואת ההיסטוריה של הכישלונות, ופעולות מקבילות למתן החלטות שהתקבלו במהלך תכנון רשת.המדיניות האופטימלית שהושגה 99.999% זמינות עם 18% פחות יכולת לחסוך בהשוואה לגישות מסורתיות.זה מתורגם לעשרות מיליוני דולרים בהשקעה הון עבור חברות מובילות.

היתרונות והחסרונות של DP עבור Fault Tolerance

יתרונות מפתח

  • (FLT:0) באופן תיאורטי מושרש: FLT:1 DP מספק ערבויות אופטימליות רשמיות תחת מודל MDP.מהנדסים יודעים כי המדיניות המתקבלת היא הטובה ביותר בין כל המדיניות, בהתחשב במודל הנחות.
  • (ה)הההתמדה של אי הוודאות: FLT:1, DP באופן טבעי משלב כשלון ותהליכי תיקון פרוברליסטים, בניגוד לשיטות ⁇ סטיות החושבות ידע מושלם.
  • (FLT:0) אופטימיזציה לטווח ארוך: 1FLT) רואה תוצאות עתידיות של החלטות נוכחיות, הימנעות אסטרטגיות מינופיות המופיעות בזול היום, אך מובילות לעלויות גבוהות מחר.
  • (FLT:0)Modularities: FLT:1 ברגע שמסגרת MDP הוקמה, שינויים במערכת (מרכיבים חדשים, שיעורי כישלונות מעודכנים) דורשים רק לעדכן את הפרמטרים של המודל, לא לעצב מחדש את ההיגיון של ההחלטה מאפס.
  • (ב) [ה]הסברים: [ה] [ה] [ה]] [ה] [ה]] שלא כמו שיטות למידת מכונה שחורה, ניתן לבחון מדיניות DP ולנתח.מהנדסים מבינים את FLT:2 מדוע LT:3 המדיניות ממליצה על פעולה מסוימת במדינה נתונה.

אתגרים ומערת

  • (FLT:0)Curse of Dimensionality:FLT:1, מרחב המדינה גדל באופן אקספוננציאלי עם מספר הרכיבים. Exact DP הופך בלתי נשלט עבור מערכות עם יותר מ -20 רכיבים מחוברים.
  • דיוק:0 (Model דיוק: FLT:1 DP הוא רק טוב כמו מודל MDP הבסיסית.If הסתברות לכישלון מוערכת בצורה גרועה או ייצוג המדינה משתנה באופן ביקורתי, המדיניות המקובעת עשויה להופיע בצורה גרועה במערכת האמיתית.
  • ההנחה של DP:0 [העיקרון]: ההנחה: FLT:1eur DP מניחה כי מעבר להסתברות ותפקודי תגמול הם זמן-invariant. בפועל, הזדקנות רכיב, שינויים סביבתיים, ושינויים עומס העבודה מפרים הנחה זו, הדורש עדכוני מודל תקופתיים.
  • (FLT:0) חישוב זמן: 1.FLT) אפילו שיטות DP דומות יכולות לדרוש משאבים משמעותיים עבור מערכות גדולות.הסתגלות בזמן אמת באמצעות למידה מקוונת עשויה להיות הכרחית עבור סביבות דינמיות מאוד.
  • (FLT:0)Cold מתחיל בעיה: 1 כאשר פריסת DP למערכת חדשה ללא נתונים היסטוריים, יש להתחיל את ההסתברות של המעבר על בסיס שיפוט הנדסי, אשר עשוי להיות לא מדויק עד איסוף נתונים תפעוליים מספיק.

כיוונים עתידיים ומגמות מתפתחות

שילוב עם תאומים דיגיטליים

תאומים דיגיטליים ו-mdash; העתקים וירטואליים של מערכות פיזיות המתעדות כל הזמן עם נתוני חיישן ו-mdash; לספק פלטפורמה טבעית עבור DP.התאום הדיגיטלי שומר על אמונה עדכנית על מצב המערכת, אשר ניזינה ישירות לתוך מסגרת MDP. כמו התאום הדיגיטלי מתפתח, מדיניות DP יכולה להיות recomputed או מותאם כדי לשקף את המצב הנוכחי של התעללות ומערכת כבר יש כמה בעיות ייצור.

Multi-Agent Dynamic Programming

כאשר סובלנות לקויה חייבת להיות מתואמת על ידי סוכנים עצמאיים רבים (למשל, צי של כלי רכב אוטונומיים, קבוצה של מיקרו-צמחים, או חילול של מזל"טים), הDP המסורתי צריך הרחבה כדי ל-FLT:0 מ"מבולטי-מנטן" (MDPsuaFLT:1). אלגוריתמים DP Reentralized אלגוריתמים מאפשרים לכל סוכן לבצע מדיניות אופטימלית מקומית תוך כדי תקשורת רק כדי לתאם מטרות סטטיסטיקות.

Real-Time Approximate DP on Edge Hardware

ההתקדמות בכוח מחשוב מוטבע מאפשרת הפעלת אלגוריתמים משוערים של DP ישירות על מכשירים שדה.במקום להסתמך על שרת מרכזי למדיניות חישובית, כל חיישן או פועל יכולים לעדכן את המדיניות המקומית שלו באמצעות DP מצטבר.זה מפיץ את העומס חישובי ומבטל נקודות בודדות של כשל במערכת קבלת ההחלטות עצמה.

למידה DP Models

במערכות ברמה צינית (מטוסי טיס, כלי רכב או רובוטים תעשייתיים), ניתן לשפר את המודלים באמצעות DPFLT:0federated LearningFLT:1 ; כל יחידה אוספת נתונים תפעוליים, מעדכנת את הערכות ההסתברות של המעבר המקומי שלה, ומשתף רק את עדכוני המודל (לא נתונים גולמיים) עם מארגן מרכזי של תוקפנות, השרת המרכזי מארגן מדיניות משופרת ומפיץ אותה חזרה לצי זה.

לקבלת מידע נוסף על חיזוק וסובלנות אשמה, מתייחס ל-FLT:0 [התחילות] על רצף של קונסולת ה-ArXivFLT:1.

מסקנה

תכנות דינמי מספק מסגרת קפדנית, גמישה ורבת עוצמה לעיצוב מערכות הנדסיות לא-סובלניות.על ידי מודל המערכת כתהליך החלטה מארקוב ומחשוב מדיניות אופטימלית באמצעות הכדאיות ערך, הסתה מדיניות או שיטות משוערות, מהנדסים יכולים לקבל החלטות עקרוניות על הקצאת משאבים, תיקון תזמון, ומערכת מחדש תחת אי הוודאות.

היתרונות הם מוחשיים: זמינות גבוהה יותר, עלויות תפעול נמוכות יותר, ומערכות שמצמצמצמות בחסד ולא להיכשל באופן קטסטרופלי. בעוד DP ניצב בפני אתגרים עם חללים גדולים ומודלים, מחקר מתמשך בשיטות דומות, תאומים דיגיטליים ותיאום רב-חושך ממשיך לדחוף את הגבולות של מה הוא מעשי.

עבור מהנדסים לבניית תשתיות קריטיות, מערכות אוטונומיות, או פלטפורמות מחשוב בקנה מידה גדול, שילוב תכנות דינמי לתוך תהליך עיצוב לקוי של ניהול לקוי הוא לא רק תרגיל אקדמי & mdash; זוהי מתודולוגיה מוכחת שמשפרת ישירות את אמינות המערכת וביצועים הכלכליים. כמו מערכות צומחות המורכבות ועלות הכשל עולה, המקרה עבור סובלנות מבוססת DP רק מתחזק.

כדי לחקור עוד, להתייעץ עם אזכורים סטנדרטיים כגון FLT:0Bertsekas “ תכנות דינמי ו- Optimal Control ” ibph:1 ו-FLT:2Sutton & Barto “ Reinforcement Learning: An Introduction; An Introductiondquo; FLT 3: (שניהם מספקים טיפול נרחב של שיטות DP) להנדסת חשמל רלוונטיות.