Table of Contents

מערכות מרובות-אgent (MAS) מורכבות מסוכנים אוטונומיים מרובים המתקשרים בסביבה משותפת להשגת מטרות אישיות או נפוצות. סוכנים אלה יכולים להיות רובוטים, תוכנות תוכנה, רחפנים או כלי רכב, כל אחד מצויד ברגישות, תקשורת ויכולות קבלת החלטות.התיאום של סוכנים כאלה הוא בסיסי לטלטלטל משימות מורכבות, אשר מעל יכולת שיתוף פעולה יחיד - מאוטומציה וחיפוש אחר משימות יעילות, אפילו לאסטרטגיות בקרה דינמית, ומאובטחות, הן יכולות של אבטחה יעילות, ואסטרטגיות בקרה, אשר יכולות של אבטחה, ופעולות אוטומטיות, יכולות של אבטחה, ואסטרטגיות יעילות, ופעולות אוטומטיות, ופעולות דינמית, ופעולות אוטומטיות, ומאפשרות, ואסטרטגיות בקרה, הן למשימות אבטחה יעילות, וגמישות, הן למשימות בעלות יכולת פעולה, יכולות למשימות בעלות יכולת פעולה דינמית, ופעולות יעילות, והן למשימות אבטחה, יכולות של אבטחה, ופעולות סודיות, והן למשימות אבטחה יעילות, יכולות של אבטחה יעילות, והן למשימות מתקדמות, יכולות של אבטחה, ופעולות אוטומטיות, אשר יכולות של אבטחה יעילות, יכולות של אבטחה, יכולות של אבטחה, יכולות של אבטחה, אשר יכולות של אבטחה, אשר יכולות של אבטחה, הן יכולות של אבטחה, אשר יכולות לשיטות בקרה, יכולות של אבטחה, הן לשיטות בקרה דינמית

יסודות מערכות מרובות-אgent

(ב) לפני צלילה לשליטה אופטימלית, חיוני להבין את אבני הבניין הליבה של מערכות מרובות-הטרגנטיות (סוכנים) ניתן יהיה לייחס:0homogeneousFLT:1 (זההה ביכולת ובהתנהגות) או (FLT:2heterogeneousFLT 3:0 (דלהלן: מנגנונים מרכזיים) או תפקידים פולשים (Digitalen) הם לעתים קרובות יותר גמישים, אך ורק מנגנונים סטנדרטיים של מנגנונים של מנגנונים יחידניים.

ייצוג גרפי-אורטי

כלי מתמטי משותף לחיקוי של אינטראקציה להתנצלות במערכות מרובות-אנטנט הוא תורת גרפים.סוכני מיצגים כנקודות בגרף, ותקשורת או חישה קישורים הם הקצוות.המטריקס המודע של הגרף הוא לכידת אשר סוכנים יכולים להחליף נתונים, בעוד הממטריקס Laplacian משמש לנתח קונצנזוס ותכונות סינכרונוניזציה.

קריטריונים ל- Multi-agentתיאום

(ב) ניתן לסווג מספר קטגוריות: (ב) ⁇ (הידועים ב) ב[[1924]]: [[1924]]]]]], [[1924]]]], [[1924]]]]]], [[1924]]]]]]]], [[1924]]]]]]]]]]]], [[1924]]]]]]]] ו[[1924]], [[1924]]]]]]]], [[1924]]]]]]]]]]]]]]]]]], [[1924]]]]]], [[1924]]]]]]]]]]]]]]]]]]

המונחים: Optimal control

(ה) ,השליטה של מערכות מרובות-הטרנטית היא מציאת קלטות שליטה הממזערות את תפקוד המכשול:0 Costlements FLT 1:1, בעודן מספק דינמיקה ומגבלות בין-מדבקות (הכוללת אופטימיזציה מוגבלת) של כל אחת מ- 1:2iFLT3; 7) LTiFIRD) כולל את כל LTiFIRDER (D) ו-TERD.

ה-FLT:0 ,cooperative factorFLT 1 מופיע בתפקיד העלות והמגבלות: סוכנים חייבים לשתף מידע כדי למזער מטרה גלובלית, להימנע מהתנגשות אחד עם השני, או לשמור על היווצרות.האתגר הוא שהאופטימיזציה הופכת לזוגות על פני סוכנים, המוביל להיקף גדול, לעתים קרובות בעיות לא-convex הדורשות הדבקה או טכניקות אופטימיזציה מבוזרות.

אתגרים בשליטה אופטית של מערכות מרובות-אנטנט

בעוד היתרונות של שיתוף פעולה רב-מנטלי הם ברורים, השגת שליטה אופטימלית בפועל ניצבת בפני כמה אתגרים בסיסיים.אלה לא רק טכניים אלא נובעים מהמורכבות הטבועה של קבלת החלטות מבוזרת תחת אי ודאות.

סקלאה

נטל החישוב והתקשורת גדל באופן דרמטי עם מספר הסוכנים.הפתרונות המרכזיים, שבו בקר אחד פותר את כל אופטימיזציה רב-אgent, עשוי להיות בלתי-מעורר לצוותים של מאות או אלפי סוכנים.מרחב המדינה מתפוצץ, והזמן הנדרש כדי למקם את פעולות השליטה האופטימליות בעולם יכול לעלות על מגבלות בזמן אמת.

תקשורת Constraints

(ה) החלפת מידע בלתי צפויה אינה מובטחת בפריסה של העולם האמיתי, ייתכן שסוכני הסוכן יחווה את ה-FLT:0communicationעיכובים FLT:1,FLT:2packet LossFLT 3, FLT:4 מוגבל רוחב פס FLT:5, או I לסירוגין אסטרטגיות שליטה חייב להיות חזק לא מושלם אלה.

פיזור ופרטיות

ביישומים רבים, בקר מרכזי אינו רצוי בשל חששות פרטיות, סיכונים ביטחוניים או מגבלות תשתיות.שליטה ממוקדת דורש שכל סוכן יעמיד את פעולת השליטה שלו בהתבסס על מידע מקומי ועדכונים שכנים מוגבלים.זה דורש תפוצה:0 אלגוריתמי אופטימיזציה מבוזרים מופץ 101 אשר מתאחדים לאופטימום גלובליים (או קרוב ל-Optimum) ללא שיתוף מידע ממשלתי מלא.

הטרוגניות

כאשר סוכנים יש דינמיקות שונות, יכולות או מגבלות, בעיית הבקרה הופכת מורכבת יותר.לדוגמה, צוות של מזל"טים קבועים ו quadcopters דורש חוקים ואסטרטגיות בקרה שונות, כי המודלים שלהם הם שונים באופן משמעותי.תפקיד העלות חייב לקחת בחשבון את ההבדלים הללו, ואלגוריתמים הקצאת המשימה חייבים להתאים משימות ליכולות הסוכן בצורה אופטימלית.

רוב הסיכויים ל unquity

סביבות אמיתיות הן סטוצ'סטיות: חיישנים מייצרים מדידות רועשות, פועלים יש חוסר דיוקים, והפרעות חיצוניות (wind, שטח, פעולות אנושיות) משפיעים על התנהגות הסוכן.מדיניות בקרה אופטימלית הנקובת למודל נומינאל עשויה להופיע בצורה גרועה תחת אי-ודאות אלה.FLT:0Robust controlFLT:1 ו-FLT:2stostic control of אופטימלית שליטה 3FLTstoisticstostostostoisticstostostostoistic אופטימלית, או דרישות מבטיחות למינימום פונקציות מורכבות, או מגבלות על בסיס קבועות, גם כן, כלומר, כדי למזעריות.

אסטרטגיות בקרה אופטית

מגוון רחב של שיטות פותח כדי להתמודד עם האתגרים לעיל.בחירה של אסטרטגיה תלויה בגודל הצוות, יכולות תקשורת, דרישות משימה, ומשאבים חישוביים זמינים.

בקרת מודל (MPC)

(הופנה מהדף חיזוי מודל) הפך אבן הפינה לתיאום רב-הגנטי, משום שהוא מטפל באופן טבעי במגבלות ויכול לכלול תחזיות של מדינות עתידיות (FLT:0centralized MPCeloFLT:1, בקר אחד פותר בעיה אופטימיזציה על פני אופק מבוזר כדי ליצור אלגוריתמים של שליטה עבור כל סוכני ה-DMPC; בעוד גישה זו אינה בקנה מידה גדול:2DFREFREDRICR (כוללת-D) עם MPDFDFDERCDERCDFDFDERCERCDERCDERCDERCDERCDERCERC: 4DERCDERDER (Comit) כולל אלגוריתמים: 4D4DFDFDFDFDFDFDERCDFDERCDERCDFDERCDERCDFDFDERCDERDDDERCDERDERCDERCDFDFDERCDICDICDFDFDFDICDICD) כולל אלגוריתמים: 4DERCDDDDDDDDDDDDDDD

לדוגמה, במודולציה של כלי רכב אוטונומיים, כל אחד ממודולי MPC של כלי רכב מצמיד פקודות כי לשמור מרחקים בין-תחומיים בטוחים תוך צמצום צריכת הדלק.על ידי החלפת פרופילים האצה על קישור תקשורת לטווח קצר ייעודי, ה-platoon משיג יציבות מיתר.

אופטימיזציה

כאשר ניתן לפסל את תפקוד העלות הגלובלית כסכום של עלויות מקומיות בתוספת תנאי הפיכה, שיטות אופטימיזציה מבוזרות כגון FLT:0Alternating כיוון שיטת Multipliers (ADMM) irFLT:1 ו- FLT:2dual decompositionFLT 3 מבוזרת יעילות.

למידה מבוססת שליטה

(ב) בדינמיקה או בדוגמנות גרועה, גישות מבוססות למידה מציעות גמישות. Multi-agent חיזוק למידה (MARL)igFLT:1 מאפשר לסוכנים ללמוד מדיניות אופטימלית באמצעות אינטראקציה עם הסביבה, אחד לשני. Algorithms כגון: 16:2MAPGFLT 3 (Multi-Agent Deterministic Policy) ו-Governanced) נדרשים על ידי ניהול משותף של MPFerdance (מ-Fertials: 2.

ניווט גרעיני של מזל"ט בסביבות קלוטריות הוא מקרה שימוש ראשוני: סוכנים לומדים להימנע מהתנגשות ונשארים יחד בעת חקר חללים לא ידועים.FLT:0A דוגמה בולטת היא בקרת הטיסה המפיצה של חתך של 10 רחפנים באמצעות למידה חיזוקית FLT:1.

שליטה מבוססת על Consensus

אלגוריתמים מספקים שיטה נקייה, מדרגית לסוכנים להגיע להסכם על משתנה משותף (למשל, מיקום, כותרת או מהירות) בקביעת שליטה, פרוטוקולים קונצנזוס משולבים עם שדות פוטנציאליים מקומיים כדי לשמור על מרחקים בין-ארציים הרצויים.

ביקורת משחק-Theoretic control

כאשר סוכנים יש אינטרסים סותרים או מידע מוגבל, תורת המשחק מספקת מסגרת לניתוח ולעיצוב אסטרטגיות אופטימליות.עבור משימות שיתופיות, FLT:0potential GamesFLT:1 מבטיח קיום של איזון Nash טהור, וסוכנים יכולים לשפר באופן רציונאלי את המדיניות שלהם כדי להגיע לתצורה אופטימלית של תצורה חברתית.

דרישות של בקרת אופטימאלית Cooperative Optimal

ההתקדמות התיאורטית בשליטה אופטימלית רב-אgent יצרה מגוון רחב של יישומים בעולם האמיתי על פני תעשיות.כאן אנו מדגישים מספר תחומים שבהם שליטה שיתופית הופכת השפעה מוחשית.

משימות חיפוש והצלה באזורי אסון נהנים מחוטי הרובוט שיכולים לכסות אזורים גדולים במהירות.אלגוריתמים של שליטה אופטימאלית חייבים לאזן את חקר (הסתרת קרקע חדשה) עם תחזוקה תקשורת (הבטחה של הנחילה נשאר מחובר) לדוגמה, אלגוריתם בקרת כיסוי מבוזר יכול להניע כל רובוט לעמדה ניטור אופטימלית, צמצום האזור הכולל של אי הוודאות.

רכב אוטונומי

בתחבורה, platooning של משאיות כבדות-דואט מפחית את הגרור האווירודינמיקה, צריכת הדלק ופליטות.הרכב המוביל קובע את המהירות, ולאחר כלי רכב לשמור על פער הדוק באמצעות בקרת שיוט אדפטיבית המוגברת על ידי תקשורת בין-גופית.

רשתות חיישן

רשתות של חיישנים קבועים או ניידים לשתף פעולה כדי לפקח על הפרמטרים הסביבתיים (למשל, טמפרטורה, זיהום, פעילות סיסמית) שליטה אופטימאלית של עמדות חיישן או שיעורי דגימה יכול למקסם את רווח המידע תוך צמצום צריכת האנרגיה.FLT:0Consensus-based Kalman מסננים FLT:1 לאפשר חיישנים להעריך את מצב של שדה סביבתי ללא היתוך מרכזי בחקלאות, חיתולים, ולהפחית חומרי הדברה בדיוק את השימוש ביבול כימי.

תצורת Drone Formations

מראה אור מל"טים מסחרי (למשל, רחפנים של אינטל כוכבים) מסתמכים על מסלולים מתוכננים מראש, אך יישומים מתקדמים יותר דורשים חידושים מקוונים. טפסים למעקב, משלוח חבילה, או תקשורת הטבות משליטה אופטימלית המקיימת צורה תוך הימנעות מכשולים והגבלת סוללות לשימושים אחרונים.

דרכים עתידיות ובעיות פתוחות

למרות התקדמות מהירה, אתגרים רבים נשארים.הדור הבא של שליטה אופטימלית רב-עצנית ככל הנראה ישלב למידה ושליטה יותר חזק, ערבויות בטיחות עבור מדיניות מבוססת בינה מלאכותית, ופועלות תחת מגבלות משאבים קיצוניות.

שילוב של בינה מלאכותית

למידה עמוקה של חיזוק מציעה את ההבטחה של טיפול בקלטות חושיות עשירות (למשל, תמונות מצלמה) שקשה מודל אנליטית.עם זאת, שיטות MARL הנוכחיות נאבקות באפקטים של הדגימה וחוסר ערבויות בטיחות פורמליות.שלב למידה עם שליטה מודל חיזוי - באמצעות רשתות עצביות כדי לחזות דינמיקה או אופטימיזציה של כוכבים חמים - הוא כיוון מבטיח.

⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

עבור חרוזים של מאות או אלפי סוכנים (למשל, מיקרו-קטונים או רובוט נחילים לבנייה), תקשורת חישוב חייב להיות מאוד קל משקל. תורת משחק שדה-שדה-שדה מחליפה אוכלוסיות גדולות עם גבול מתמשך, צמצום בעיית הבקרה לפתרון משוואות שונות חלקית.גישה זו עדיין בחיתוליה עבור הרובוטיקה מעשית, אך יש לה יסודות תיאורטיים חזקים בכלכלה.

אינטראקציה אנושית-Swarm

כמו מערכות מרובות-אgent מופרסות לצד בני אדם, אסטרטגיות בקרה חייבות לקחת בחשבון את מפעילי האדם שנותנים פקודות ברמה גבוהה או עובדים בסמיכות.עיצוב ממשקים אינטואיטיביים ותכניות בקרה משותפות (למשל, "משחק" או התנהגויות "לאד") הוא קריטי.שליטה אופטימאלית יכולה לסייע באמצעות אוטומט תיאום ברמה נמוכה תוך עזיבת החלטות אסטרטגיות לבני אדם.

רובוסטנס וטיהור פורמאלי

יישומים קריטיים כגון מוניות אוויר אוטונומיות או רובוטים כירורגיים דורשים שליטה נכונה באופן בולט.(FLT:0 Barrier פונקציות FLT:1 ו-FLT:2 שליטה Lyapunov functionFLT:3 יכול להשתלב בשליטה אופטימלית לאכיפת בטיחות והתכנסות. אימות פורמלי של אלגוריתמים מבוזר נשאר אתגר פתוח בשל התפוצצות שטח המדינה.

לסיכום, שליטה אופטימלית של מערכות מרובות-אנטנט היא שדה תוסס, חוצה תחומי המשלב את התיאוריה, אופטימיזציה, למידת מכונה ורובוטיקה.הכלים היסודות - מתיאוריה גרפית ומופץ MPC ל MARL - ממשיכים להתפתח, המאפשרים התנהגויות מתוחכמות יותר ויותר.כפי שכוח חישובי גדל ותקשורת הופכת יותר ויותר לכל מקום, אנו יכולים לצפות במערכות מרובות-טרגנטיות לשנות תעשיות תגובה מדעית ואסון.