יסודות של תיאוריית משחק שונה בשליטה תחרותית

תורת המשחק שונה מספקת מסגרת מתמטית קפדנית לניתוח אינטראקציות אסטרטגיות שבו מספר מקבלי החלטות, שחקנים ידועים בדרך כלל, להשפיע על מערכת דינמי על אופק זמן מתמשך. משמעת זו עומדת בצומת של תורת הבקרה אופטימלית ותאוריית המשחק הקלאסי, המאפשר אנליסטים מערכות מודל שבו פעולות של משתתף אחד משפיע ישירות על מסלול של הסביבה כולה.

(ב) משחק שונה טיפוסי, כל שחקן בוחר רצף של פעולות שליטה (FLT:0ucioalph:1iFLT:2(t) רצף של פעולות שליטה (FLT: 3) והמטרה של תגמול אישי, לעתים קרובות ביטוי כחלק מהחלטות מיידיות או עלות (ULT) , 7) התפלגות חלקית או חלקית של משוואה: 4(F)

תפיסה יסודית של תורת המשחק השונה דורשת היכרות עם כמה מושגים מתמטיים מרכזיים.המילטון-ג'קובי-Bellman (HJB) משוואה משחק שונה, למשל, היא האנלוגיה הדינמית לשליטה אופטימלית בזמן מתמשך.כאשר המורחבת להגדרות מרובות משתתפים, היא הופכת למערכת של משוואות תלת-צדדיות שונות, אשר פתרוןן פונקציות עבור כל שחקן.

משחק שונה הוא בעיה אופטימלית של שליטה עם יותר מבקר אחד, כל אחד עם מטרות סותרות." ~ רופוס אייזקס, חלוצים של משחקים שונים.

עבור הקוראים המבקשים טיפול מתמטי עמוק יותר, משאבים כגון:0INFORMS מחקר מחקר מחקר הוראה 1 ו- FLT:2SIAM Journal על שליטה ואופטימיזציה של FLT 3: מציעים מחקר עמיתים אשר מרחיב את היסודות האלה לתחומים מיוחדים.

המונחים: Competitive control Dynamics

כדי ליישם את תיאוריית המשחק השונה לתרחישים של שליטה מעשית, יש לפנים כמה אלמנטים מבניים המגדירים את המשחק.אלמנטים אלה קובעים את הדקדוק לתיאור המערכת והאינטראקציות בין השחקנים.

מגוון מדינות ו-P Dynamics

[] משתנים מעצימים את המידע החיוני הדרוש כדי לתאר את מצב המערכת בכל נקודה בהקשר תחרותי, משתנים אלה עשויים לכלול רמות מלאי משאבים (למשל, עתודות שמן, מטען סוללות), לתאם מיקום: (1) מיקומים שדה הקרב, נתח שוק; או מדדי ביצועים (למשל, טמפרטורה, אורך) את המשתנים הללו על ידי משוואות של 2F) אשר עשויים להכיל את רמות הבקרה האסטרטגית של 2F (p) ל- CD2x4x) או LT (למשל, כלומר, כלומר, כלומר, כלומר, כולל משוואות בקרה (p) של כל אחד מ-p) של LT2 (p) {\displaystyle DV) {\displaystyle DVD2 (p) או LT2 (p) או קונסולהחומרים שונים (p) של קונסולהאפקטים שונים (p) או קונסולהספקים (p) של קונסולהספקית (p) של קונסולהכולל מדדיבית (p) של קונסולהכולל מדדיבית (p) של קונסולהכולל מדדי משנה של LT2 (p) {\displaystyle D.

אפשרויות ל-Exitible אסטרטגיות

משתנים הם הנימוקים שכל שחקן יכול להתאים את המערכת.הם חייבים להיות שייכים למערך של פעולות בלתי ניתנות לחיוב, לעתים קרובות מרוסנות על ידי מגבלות פיזיות, כלכליות או רגולטוריות.עבור תוקף במשחק שונה של אבטחת סייבר, המשתנה יכול להיות העוצמה של התקף הכחשה של שירות; עבור המגן, זה יכול להיות שיעור פריסת הסימון או מידע עדכני על פעולות שליטה (כימות) באופן כללי על אסטרטגיות קבועות יותר (כימות) על אסטרטגיות סגורות) באופן כללי יותר סגורות (כימות) על בסיס אסטרטגיות קבועות (כיפות סגורות) באופן כללי יותר) על אסטרטגיות קבועות יותר סגורות יותר סגורות (אפקטיביות) על בסיס אסטרטגיות קבועות יותר) על בסיס אסטרטגיות קבועות (שיטות) על בסיס אסטרטגיות סגורות יותר סגורות יותר) על בסיס אסטרטגיות סגורות (אפקטיביות יותר) על בסיס אסטרטגיות קבועות (אפקטיביות)

תשלום פונקציות ומטרות

לכל שחקן יש פונקציונאלי תשלום כי הם שואפים למקסם או למזער.בדרך כלל לבטא כאינטגראלי לאורך זמן האופק בתוספת פרס מסוף, התגמול עשוי לייצג רווח מצטבר, נזק מוחלט שנגרם, צריכת דלק, או כמה מדד אחר. במשחקים שונים אפס-סיום, סכום המשכורות על פני שחקנים הוא קבוע - רווח של שחקן אחד הוא בדיוק הפסד של לא אפס, לאפשר משחקים משותפים עבור אובדן משמעותי או הפסד משמעותי של אובדן.

המונחים: Nash and Beyond

מושג הפתרון המאומץ ביותר עבור משחקים לא-פעיליים שונים הוא ה-FLT:0Nash BalanceveFLT:1, המוגדר כמערך של אסטרטגיות שבהן אף שחקן לא יכול לשפר את שכרם באופן חד-צדדי. הרעיון הזה מבטיח יציבות במובן שאסטרטגיה של כל שחקן כוללת תגובה טובה יותר למשחקי אפס-um, את שיווי המשקל עם פתרון מיני-תועלתי, בעוד שלעתים קרובות דורש משוואות קבועות (Ricmates) של משחקים).

מקור השראה להבנת חישובי שיווי משקל במסגרות דינמיות הוא הטקסט (FLT:0reave: 1) מוצרים מועילים: תיאוריה מתמטית עם יישומים ללוחמה ולטיהור, בקרה ואופטימיזציה:2FLT 3:2FLT 3: על ידי Rufus אייזקs, אשר מספק את התיאוריה הבסיסית עם דוגמאות רבות של עבודה.

יישום תיאוריית משחק שונה כדי תחרותית בקרה Scenarios

היישום המעשי של תיאוריית המשחק השונה מתקדם באמצעות סדרה של מודלים, ניתוח ופעולות פתרון.אם בעיות בקרה תחרותיות בעולם האמיתי כמו משחק שונה דורש מופשט זהה: יש להגדיר את זמן אופק, לזהות את השחקנים ואת הבקרות העמידות שלהם, לציין את הדינמיקה של המערכת כמערכת של משוואות זמן שונות, ולהקצות פונקציונליות כי ללכוד את המטרות האמיתיות הוא תיאור מתמטי שניתן לחקור עבור שינויים פרמטריים, כדי לבחון כדי לשנות פרמטרים אמיתיים.

שלב 1: מערכת מודלים ובחירה משתנה

החל על ידי סקיצה של מערכת פיזית, כלכלית או סייבר תחת שיקול דעת.זהה אשר כמויות מתפתחות ברציפות לאורך זמן, אשר יכול להיות מושפע השחקנים.לדוגמה, נניח ששני כלי רכב אוטונומיים צריכים לנווט תרחיש מיזוג על כביש מהיר.המשתנה המדינה עשוי לכלול כל מיקום ארוך של רכב ומהירות.הבקרות הם קלטות.ה עבור כל רכב יכול לשלב זמן נסיעה חלקה בשוליים של פעולות אסטרטגיות אחרות.

שלב 2: בניית פונקציות Payoff

כל תשלום של שחקן חייב לשקף את המטרה האמיתית שלהם, לעתים קרובות סחרחורת בין תשוקות מתחרות.בגזע פרסום בין שתי חברות, התשלום עשוי להיות סך ההכנסות המצטברות מינוס עלויות פרסום, המשולבות על אופק תכנון סופי. במשחק של רדיפה-החלדה, התשלום עבור רודף יכול להיות הזמן ללכוד, בעוד המפלט מבקש למקסם את אותו הזמן - אינטראקציה ברורה של אפסום חייב להיות להתעלם מסימולציות אסטרטגיות של המתחרים.

שלב 3: פתרון המשחק

ברגע שהמודל מוגדר, תהליך הפתרון מתחיל.עבור משחקים לינאריים-quadratic, פתרונות אנליטיים קיימים באמצעות משוואות Riccati.באופן כללי יותר, יש להסתמך על שיטות מספריות. גישה נפוצה היא לפירוק התחום הזמן ולפתור רצף של משחקים סטטיים Nash לאחור בזמן (תוכנית דינמית) יכול להשתמש ב"משחקים" נטולי סרטן" או תכנות מיידי "מוגדר" עם עלויות מיידיות" (inal) של תכנות) עם יעילות, לפעמים, הנקראות, "מות" (תוכנות עמוקות" (תוכנות חישוביות) ו" (intcurial) ו" (תוכנות עמוקות, "משלב ישיר, "משלב" (תוכנות עמוקות, "מתאים).

דוגמה: תחרות כלכלית בדינמיקה אולטגופויה

(ב) [17] , [17] , [17] , [17] , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

(ב) ניתן לפתור את המשחק באופן אנליטי תחת הנחות לינאריות-קלוריות מסוימות, מה שהופך את אסטרטגיות האיזון הסגורות של Nash ל-DVate:0uFLT:1iph:2known) ל-αFLT2: 3,4174

דוגמה: רכב אוטונומי

ב נהיגה אוטומטית, הבעיה הממזגת יכולה להיות מודלד כמו משחק שני שחקנים לא אפס-סם שונה.המדינה כוללת פער ארוך טווח של כל רכב ומהירות יחסית.שליטה הם פקודות האצה. Payoffs לשלב נוחות (קטן je), יעילות (זמן למיזוג), ובטיחות (הימנעות משמירת איזון פתוח) עשויה לרשום צולל עבור הפער המוביל, התנהגות תוקפנית, תוך כדי שימוש חוזר (מחדש) על ידי שימוש חוזר על ידי שימוש חוזר על ידי למידה).

עבור סקירה עכשווית של יישומים כאלה, ראה את המאמר:0in IEEE עסקאות על בקרת בקרה אוטומטיתFLT:1, אשר לעתים קרובות מפרסם התקדמות בשליטה משחק-תיאורטית עבור מערכות סייבר-פיזיות.

אתגרים במימוש מעשי

למרות האלגנטיות התיאורטית שלו, יישום תורת המשחק השונה לתרחישים של שליטה תחרותית אמיתית מציג מכשולים עצומים.אתגרים אלה לעתים קרובות למנוע שימוש ישיר של פתרונות ספרי לימוד וביקוש חדשנות הן מודלים והן חישוביים.

מורכבות

פתרון משחק שונה דורש טיפול בו זמנית של מסלולים ואסטרטגיות ברחבי שחקנים מרובים.משוואות HJB שני הם משוואות דיפרנציאליות חלקיות תלת-ממדיות שאינן ניתנות לעתים רחוקות מעבר לשתיים או שלוש מדינות.קל של ממדיות שולט במהירות: הוספת משתנה מדינה אחת יותר יכול להכפיל את דרישות אופטימיזציה חישוביות על ידי פקודות של חוקרים גדולים ליישם בקרת מודל חיזוי (MPC) אופטימיזציה של בעיה כי הוא פותרת בעיה מבוזרת של המשחק.

מבנה מידע

שחקנים אמיתיים לעתים רחוקות יש משוב המדינה המושלם.הם עשויים לצפות מדידות רועשות, אותות מעוכבים, או רק סטטיסטיקות מצטברות.הרעיון של "מערכת מידע" הופך קריטי: הוא המשחק פתוח-loop, מדינה מושלמת, או מדינה סגורה-לא מושלמת?כל אחד מבני מידע מוביל לאופי איזון שונה.למשל, במשחק מצב לא מושלם, שחקנים חייבים לבנות הערכות של המדינה האמיתית באמצעות מסנן (כמו קלמנטציה של משוואות HJourtcreme-B) ו-Hy) לסיבוכים באופן משמעותי של השגיאה נוספת של משוואות המשתנים אלה.

מודלים של חוסר ודאות וסטוצ'סטיות

מערכות בקרה תחרותיות רבות הן סטוצ'סטיות מטבען: זעזועים אקראיים משפיעים על הביקוש, מזג האוויר משבש פעולות מזל"טים, או פעולות יריבות בלתי צפויות להתרחש. Extending differential game Theory to ⁇ chastic Settings דורש להפוך את המשוואה המבדילה ה ⁇ סטית למשוואה שונה לחלוטין (SDE) בעוד שתפקוד הערך המקביל הוא גם מספק PDE השני (המילטון-Jacoman-Bellman-Isalricial Games) בעודם מושכים יותר משאבים מפוחכמים יותר.

אימות ואימות

גם כאשר יימצא פתרון איזון אלגנטי Nash, יש לאמת אותו נגד התנהגויות בעולם האמיתי.הנחות של רציונליות מושלמת וידע משותף של מבנה המשחק הן לעתים רחוקות מרוצה.כלכלת התנהגות מצביעה על כך ששחקנים אנושיים מתפוגגים באופן שיטתי מתחזיות Nash. במערכות רב-אנטן אוטונומיות, אמון באסטרטגיות אלגוריתמיות חייב להיבנות באמצעות סימולציה קפדנית ובדיקה. פער זה בין תיאוריה ופרקטיקה נותר תחום פעיל של מחקר, כמו פונקציות שונות (למידה)

נושאים מתקדמים ודרכים מתפתחות

תחום תיאוריית המשחק השונה ממשיך להתפתח, מונע על ידי התקדמות במחשוב, בינה מלאכותית ותחומים חדשים של יישומים.נושאים רבים מבטיחים במיוחד עבור תרחישים בקרה תחרותית.

משחקי מחשב

כאשר מספר השחקנים גדל גדול (למשל, אלפי כלי רכב אוטונומיים לשיתוף אופניים, או אינספור סוחרים בשוק פיננסי), המורכבות של מעקב אחר אינטראקציות בודדות הופכת בלתי-מחייבת.משחק שדה-שדה (MFG) קרוב למשחק של שחקן רבים על ידי סוכן נציג יחיד אינטראקציה עם הפצה סטטיסטית של כל סוכני LGLT באופן דרמטי להפחית את הנטל חישובי: במקום לפתור עבור פונקציות רבות, אחד מהם פותחו מחדש של אסטרטגיות מסחר אלקטרוניות בהצלחה.

משחקים שונים עם מידע סימטרי

תרחישים תחרותיים רבים כרוכים במידע פרטי כי שחקן אחד מחזיק ביכולות או מטרות משלו.לדוגמה, מגן לא יכול לדעת את יעד היעד המועדף של התוקף.משחקים כאלה נופלים תחת המטרייה של "משחקים אדישים עם מידע לא שלם" הניתוח לעתים קרובות מסתמך על אות או בדיקת שוויון, שבו פעולות לחשוף מידע פרטי לאורך זמן.המתמטיקה הופכת למורכבת, תוך שימוש באמונות מסננים ומשוואות, אך השכר המשמעותי יכול להיות משמעותי.

למידה במשחקים שונים

עבודה חדשה משלבת את תורת המשחק השונה עם למידה רב-עוצמה (MARL) במקום אסטרטגיות איזון טרום-ביקורתית במפורש, סוכנים לומדים מדיניות אופטימלית באמצעות אינטראקציות חוזרות ונשנות, לעתים קרובות באמצעות תחזיות רשת עצביות. גישה זו מבוססת נתונים יכולה לעקוף את הקללה של ממדיות כאשר המרחב הממלכתי הוא גדול.אימון אלגוריתמים המבטיחים התכנסות ל- Nashquabria בהגדרות קבועות נשאר אתגר פתוח, אך אסטרטגיות שחקן מבטיח הוא מדיניות הוא גדול.

Hardware-in-the-Loop and Real-Time Implementations

המטרה הסופית של יישום תיאוריית המשחק השונה היא להטמיע את האסטרטגיות הנובעות לבקרים הפועלים בזמן אמת.עבור יישומים כמו נהיגה אוטונומית, מרוצי מזל"טים או כדורגל רובוטי, הבקר חייב לתת מענה הטוב ביותר בתוך מילימטרים.זה דורש לא רק פתרון לא מקוון אלא גם מדיניות משוב שניתן להעריך במהירות את מדיניות הרשת נילי אשר מאומנים לחקות את הפתרון מציע גישה אחרת.

ניסיון מעשי עבור Analysts ומהנדסים

עבור מתרגלים המבקשים ליישם את תיאוריית המשחק השונה לתרחיש בקרה תחרותי, גישה שיטתית היא חיונית.כאן הם כמה צעדים מעשיים:

  • (FLT:0) ,Start Smallua.FLT:1 מודל הגירסה הפשוטה ביותר של הבעיה - שני שחקנים, ממד מדינה אחד, דינמיקות ליניאריות, ותשלומים quadratic. Solve אנליטית או עם מספריים מינימליים כדי להשיג אינטואיציה לפני הוספת מורכבות.
  • (FLT:0) ו-Verify נגד גבולות ידועים.FLT:1 בדוק אם הפתרון מקטין את בעיית הבקרה אופטימלית של שחקן אחד כאשר השליטה של שחקן אחד נקבעת.
  • (FLT:0) בחרוז בין אסטרטגיות פתוחות וסגורות ל-FLT ( 1:1) השתמש ב-Open-loop אם השחקנים לא יכולים לצפות במדינה בזמן אמת (למשל, החלטות השקעה לטווח ארוך) להשתמש ב-Auto-loop אם הסתגלות רציפה היא אפשרית (למשל, כלי רכב אוטונומיים).
  • (FLT:0) Exploit סימטריה.FLT:1 אם השחקנים הם סימטריים (דינמיקה זהנית ותשלומים), שיווי המשקל כרוך לעתים קרובות אסטרטגיות סימטריות, צמצום מימד של מרחב החיפוש.
  • (FLT:0) אי הוודאות בהדרגה.FLT:1 התחל עם דינמיקות ⁇ , ולאחר מכן להוסיף הפרעות סטוצ'סטיות באמצעות מסגרת SDE או ניסוח חזק (worst-case).
  • (FLT:0)Validate עם סימולציה.FLT:1rea, ברגע שמאזן המועמדים או מדיניות נמצא, לדמות את מערכת ה-Open-loop עם מודל רעש רגישות לפרמטר שינויים.
  • (FLT:0) סקירת הספרות.E.FLT:1 עבור יישומים ספציפיים לתחום, לחפש מודלים קודמים בספרות. הרבה בעיות בקרה תחרותיות בכלכלה, אקולוגיה, רובוטיקה והגנה עוצבו באמצעות משחקים שונים; הפתרונות שלהם יכולים לשמש החל נקודות התחלה.
  • (FLT:0) כלי מספר מספרי (Consider numerical Tools.archerical Tools.E.ve.E.R.E.R) השתמש בקוד פתוח או בתוכנה מסחרית לפתרון משחקים שונים.חבילות כמו FLT:2COMSOL MultiphysicsFLT 3: (עבור גישות לתפקוד מבוסס PDE) או תיבת אופטימיזציה של MATLAB (לעת תמליל ישיר) יכול להאיץ את ה-Ftotyping.

המונחים: Synthesis

תורת המשחק השונות מספקת שפה רבת עוצמה ומסגרת אנליטית להבנת תרחישים בקרה תחרותיים שבהם החלטות מתפתחות לאורך זמן.על ידי נישואי הדינמיקה של מערכות זמן רצוף עם ההיגיון האסטרטגי של תורת המשחק, היא מעשירה הן שדות ומציעה כלים קונקרטיים לחיזוי ועיצוב תוצאות בשווקים הכלכליים, מעורבות צבאית, נהיגה אוטומטית וסכסוכים מקוונים.

בעוד האתגרים של מורכבות חישובית, סימטריה מידע וחוסר ודאות מודלים נמשכים, התקדמות בשיטות מספרריות, תחזיות שדה חוצות, ולמידה מכונה הם בהתמדה צמצום המחסומים ליישום. מהנדסים ואנליסטים משקיעים בהבנת תורת הליבה והרחבות המודרניות שלה יוכלו לעצב מערכות בקרה חכמות יותר, הסתגלותיות ואסטרטגיות יותר.

כהערה סופית, על מתרגלים לגשת לתיאורית המשחק השונה כמחשבה כמו ערכת כלים.כוחות המסוכסנים לחשוב באופן שיטתי: "ההחלטה שלי משפיעה על ההחלטות העתידיות של יריבי, אשר מחלחלות לאחור כדי להשפיע על האפשרויות העתידיות שלי."