הקדמה: קהילה עירונית והבטחה של שליטה הסתגלות

עומס התנועה הפך לאתגר מוגדר של החיים העירוניים המודרניים.על פי ה-FLT:02023 INRIX Global Traffic ScorecardsFLT:1, נהגים בארצות הברית איבדו בממוצע 51 שעות בשנה כדי ליישב, עלות הכלכלה מעל 81 מיליארד דולר, מעבר לזמן מבוזבז, כלי רכב מסלקים כמויות בלתי פרופורציונליות של פליטות מזיקות, איכות אווירית, ולתרום לזיהום לא מודע – כמו גם לתאי תנועה קשים יותר, שלא יכלו לפעול באופן קבוע, לא סדיר, לא סדיר, כמו גם לתאי תנועה, כלומר, לא סדירים, לא ניתן לדגמי חירום, לא מסוגלים להגיב על פני זמן נהיגה קבועים, כמו גם אם לא סדירים, כלומר, כלומר, כלומר, לא סדירים, לא סדירים, לא ניתן לדגמי תנועה, כלומר, לא סדירים, כלומר, לא ניתן לדגמי רכב, לא סדירים, לא סדירים, לא הצליחו לתדונות של זמן נהיגה, לא סדירים, לא סדירים, לא סדירים, לא סדירים, לא סדירים, לא סדירים, מאשר לדגמי רכב, כמו גם כן, לא סדירים, כמו גם כן, מאשר לדגמי תנועה, לא ניתן לדגמי תנועה, לא ניתן להפעיל את רמות קבוע, לא סדיר

Reinforcement למידה (RL), תת-תחום של למידת מכונה המלמדת סוכנים לקבל החלטות ⁇ על ידי משפט וטעייה, מציעה פתרון משכנע.במקום להסתמך על כללים סטטיים או פרמטרים מכווננים ידניים, מערכות מבוססות RL תמיד מתבוננות בתנאי תנועה, לבחור תזמוןי אותות, וללמוד מהתוצאות כדי להתאים את המדדים כגון עיכוב ממוצע, אורך, ולוח דרך מאמר זה, כיצד היא מתפשטת למנגנוני תנועה אמיתיים, לתזמון, לתזמון, למנגנוני תנועה, לתזמון, ולסמן את התזמון, למנגנוני תנועה, ועדכונים, למנגנוני קצה, למנגנוני תנועה, לחיקוי, למנגנוני קצה, לחיקוי, למנגנוני התזמון, למנגנוני התזמון, ולת, לחיקוי, לחיקוי, למנגנוני תנועה, למנגנוני קצה, למנגנוני קצה, למנגנוני קצה הדרך הנוכחיים.

מה זה Reinforcement Learning? A Deeper Dive

בליבתו, למידה חיזוק היא מסגרת ללמידה של התנהגות אופטימלית באמצעות אינטראקציה עם הסביבה.הסוכן - במקרה זה, בקר אות התנועה - נוקט פעולות שמשנות את מצב הסביבה.לאחר כל פעולה, הסוכן מקבל פרס מספרי (חיובי או שלילי) ומעברים למדינה חדשה.

באופן פורמלי, RL הוא לעתים קרובות מודל תהליך החלטה של מארקוב (MDP), המוגדר על ידי קבוצה של מדינות, פעולות, התחייבויות מעבר, ותגמולים. פרדיגמות מפתח RL כוללים:

  • (FLT:0)Model-free RLFLT:1 (למשל, Q-learning, Deep Q-Networks): הסוכן לומד ישירות פונקציה ערך או מדיניות מבלי מודל מפורש של הדינמיקה של הסביבה. גישה זו מתאימה היטב לתחומים התנועה שבהם מודלים סימולציה מדויקת הם קשים לבניית.
  • (FLT:0)Model-based RLFLT:1: הסוכן לומד לראשונה מודל של הסביבה (למשל, כיצד התנועה זורם שינוי תגובה שינויים אות) ולאחר מכן משתמש במודל זה כדי לתכנן פעולות.זה יכול להיות יותר מדגימה אך דורש טיפול זהיר של חוסר דיוקים מודל.
  • (FLT:0) שיטות ⁇ Policy ⁇ eurs 1 (למשל, PPO, A2C): אלה ישירות אופטימיזציה של המדיניות על ידי התאמת התחייבויות פעולה בהתבסס על פרסים מנוסים.הם באופן טבעי להתמודד עם חללים פעולה מתמשך ולעתים קרובות משמשים בהגדרות מרובות-אנטנט מורכבות.

העלייה ב-RL העמוק – שילוב רשתות עצביות עם אלגוריתמים של RL – הייתה משתנה במיוחד.רשתות עצביות עמוקות יכולות להיות חללים של מדינה רב-ממדית, כגון הזנות וידאו גולמיות ממצלמות תנועה או נתוני חיישן מצטברים ממאות גלאי גלאיים. לנדמרק עובד כמו FLT:0 [DeepMind] במחקר של RL לעיכובי תנועה בלונדוןFLT:1 הראו כי סוכנים עמוקים יכולים להתאים ל-15% ממערכות רגילות.

כיצד Reinforcement Learning Optimizes Traffic Signaling

מערכת בקרת אותות תנועה מבוססת RL פועלת במחזור מתמשך של פעולה (FLT:0) , 000 observation) תגמול על למידה FLT:1 בכל צומת, המערכת מפקחת על הנוכחי FLT:2stateFLT 3: אשר עשוי לכלול:

  • מספר כלי רכב מחכים בכל נתיב (אורך הנסיעה)
  • הזמן חלף מאז השינוי האחרון
  • מהירות ודיקור של כלי רכב קרובים
  • שאילתות מעבר פשטניות
  • זמן של ימים ודפוסי היסטוריה

בהתבסס על מצב זה, הסוכן בוחר שלב אחר, או מציג מרווח שחרור אדום: 2rewardph 3: 3) הוא עשוי לבחור להרחיב את השלב הירוק הנוכחי, לעבור לשלב אחר, או להציג מרווח שחרור אדום לחלוטין.

מעל אלפי פרקים מדומים או אמיתיים, סוכן ה-RL מאמת את הפרמטרים הפנימיים שלו (למשל, המשקל של רשת עצבית) כדי למקסם את הפרס המצטבר הצפוי.בדרך כלל, המערכת לומדת לא רק לוח זמנים קבוע אלא לוח זמנים קבוע, אלא גם לוח זמנים קבוע:0context-dependent PolicyFLT:1: במהלך עלייה פתאומית של תנועה מאיצטדיון אירוע, הסוכן יקצץ יותר זמן ירוק עד מאוחר, בעוד שהוא עשוי למזער את הזמן הלא-מפרק זמן קצר יותר, בעוד שהוא עלול למזערי יותר, בעוד שהוא עלול למזערי יותר, בעוד שהוא עלול למזערי יותר, בעוד שהוא אינו מוגבל יותר, בעוד שחלף שעות ארוכות יותר, בעוד שבקושי מוגבל יותר, בעוד שהוא עלול למזערי יותר, בעוד שהוא עלול למזערי יותר, בעוד שנמנע, בעוד שהוא עלול למזערי זמן קצר יותר, בעוד שבקושי מוגבל יותר, בעוד שלעתים רחוקות יותר, בעוד שלעתים רחוקות יותר, בעוד שלעתים קרובות, בעוד שנמנע, תוך פרק זמן קצר יותר, בעוד שהוא עלול למזערי זמן קצר יותר, בעוד שחלף זמן קצר יותר, בעוד שנמנע, בעוד שלעתים קרובות יותר, בעוד שלעתים קרובות יותר, בעוד שנמנע, בעוד שלעתים קרובות יותר, בעוד שנמנע, זמן קצר

עיצוב המדינה בפרקטיקה

איכותו של סוכן RL תלויה במידה רבה כיצד המדינה מיוצגת.מושגים של Discrete כמו "queues" ו "זמני המתנה" חייב להיות מקודד לתכונות מספריות.היישום המתקדם משלב:0 גרפים עצביים גרפיםFLT:1 כדי מודל הטופולוגיה של צמתים וקונספירציה, ומאפשר לסוכן ליחסי מרחבי ברשת.

חללי פעולה: אכזבות מול רציפות

מערכות התנועה של RL השתמשו בפעולות דיסקרטיות - לדוגמה, בחירת אחד מארבע רצפי שלב אפשריים.עם זאת, גישות מודרניות לעתים קרובות להשתמש FLT:0continent ActionspacesFLT:1, שבו הסוכן מפיץ ישירות את משך כל שלב.זה מספק שליטה דקירה יותר ויכול להתאים לריאציות עדינות בעומס התנועה.

Multi-Agent and Hierarchical RL

(ה-Slaing RL לרשתות העיר דורש יותר מסוכנים עצמאיים בכל צומת. סוכנים לא מתואמת יכולים ליצור מדיניות סותרת - סוכן אחד מרחיב שלב ירוק בעוד סוכן מטה הזרם יוצר צוואר בקבוק.כדי לטפל בזה, החוקרים פיתחו (FLT:0multi-agent Access Learning) ו-MarL)FLT:1 מסגרות, שבו סוכנים משתפים מידע או לומדים מדיניות שיתופית, לדוגמה, ב-FRMI-F2, מחליט החלטות נוספות באלגוריתם מאובטחות ברמה גבוהה יותר:

היתרונות העיקריים של Reinforcement Learning for Traffic Signals

היתרונות של RL על זמן קבוע מסורתי או שליטה אקטוated הם רבים, והם אומתו בשני סימולציה וניסויים שדה.

תגובה יעילה ומציאותית

בניגוד לבקרים לפני זמן, סוכני RL להסתגל באופן דינמי לתנאי זמן אמת.הם יכולים להגיב לאירועים מיוחדים, כגון קונצרטים, תאונות או אטה הקשורים למזג אוויר, ללא התערבות ידנית.בפרויקט טייס בFLT:0Pittsburgh באמצעות מערכת SURTRACFLT:1, בקרת הסתגלות מבוססת-RL מופחתת על ידי 25% והמתנה על ידי 40% לבסיס קבוע.

צמצום ה-Comestion and Delays

מכיוון ש-RL מייעלת עבור מדדים כמו אורכו של עיכוב ואורך תור, היא מגלה באופן עקבי את ההיגיון מבוסס הכלל.סקירה מקיפה שפורסמה ב-FLT:0) מחקר טרנספורטציה חלק CIRFLT:1 מצא כי מערכות מבוססות RL השיגו שיפור אמצעי של 18% בעיכוב ממוצע של 30 תרחישים מדומים.

הישגים סביבתיים וכלכליים

פחות idling פירושו צריכת דלק נמוכה יותר ופליטות.משרד האנרגיה של ארה"ב מעריך כי בקרת אותות הסתגלות יכולה להפחית את צריכת הדלק עד 15% ברשתות העירוניות צפופות. RL לוקחת את זה הלאה על ידי אופטימיזציה פעילה עבור תגמולים הקשורים פליטה. לדוגמה, סוכן RL יכול להיות מאומן כדי להפחית את פליטות CO2 ו- NOx על ידי תמיכה תזמון כי להפחית את התנועה להפסיק-נגוגו אלה מתרגמים ישירות לערים שיפור חיובי עבור חיסכון ציבורי.

סקלאלה ושקיפות

ברגע שמדיניות RL מאומנת בסימולציה, זה יכול לעתים קרובות להיות מנווט היטב ופורצת על פני צמתים דומים עם רזולוציה מינימלית. דחיסות זו היא יתרון גדול על מערכות הסתגלות ידניות הדורשות כיור נרחב לכל מיקום. יתר על כן, מודלים של RL יכולים לשלב מקורות נתונים נוספים, כגון מסלולים מחוברים או GPS סלולרי, כדי לשפר ביצועים נוספים ללא חומרה יתר.

אתגרים ומגבלות

למרות הבטחתו, פריסת RL עבור בקרת אות התנועה בקנה מידה ניצבת בפני מכשולים משמעותיים.

דרישות נתונים וחיישנים

סוכני RL דורשים תצפיות אמינות גבוהה, רוב הערים חסרות כיסוי חיישן מקיף; גלאי לולאה עשויים להיות מלוחים או מיושן, ומצלמות יכולות להיות מושפעות ממזג אוויר או תאורה.אימון סימלוטי יכול לפצות חלקית, אבל ה-FLT:0sim-to-realrFLT:1 נשאר אתגר מקוון. סוכן מאומן בסימולציה מושלמת עלול להיכשל כאשר הוא נתקל ברעש ריאלי, או ירידה, נדיר, כמו מקרים של דלקת חירום או הדבקה או הדבקה, לעתים קרובות, כמו כלי רכב אקראיים.

בטיחות ורובוסטנס

אותות תנועה יש השלכות בטיחות חיים. סוכן RL שעושה פעולה שגויה - כגון קביעת שלב הליכה הולכי רגל או שינוי אדום עבור נתיבים סותרים - עלול לגרום לתאונות.בטיחות מרגיעה במהלך למידה ופריסה היא רבת ערך.

  • (FLT:0) הבטחת RLIRLT:1: שילוב מגבלות בתהליך אופטימיזציה (למשל, באמצעות שיטות Lagrangian) כדי להבטיח כי סף מסוים (למשל, זמן אדום מקסימלי) אינם מופרים.
  • (ב) [15] ,9) ,[[1924]]: [[1924]]]]]], [[1924]]]], [[1924]]]]]], [[1924]]]]]], [[1924]]]]]]
  • (ב) ,0) אימותים קדמוניים: שימוש בכלים מתמטיים כדי להוכיח כי מדיניות המחקר לא תייצר מצבים לא בטוחים בתוך מודל סביבתי נתון.

תקשורת ותקשורת Overhead

מודלים עמוק של RL, במיוחד אלה המשתמשים ברשתות עצביות עם מיליוני פרמטרים, דורשים משאבים משמעותיים עבור הכשרה והפרעה. הפעלת הקצינה כל כמה שניות במאות צטלבות דורשות מכשירים קצה עם מספיק כוח עיבוד.בנוסף, תיאום רב-אgent מסתמכ על תקשורת בתדירות נמוכה בין בקרים, אשר לא יכול להיות זמין בתשתיות מורשת.

חוסר יכולת ואמון

מהנדסי תחבורה ואנשי עיר הם לעתים קרובות זהיר של מערכות AI שחור-box. להבין מדוע סוכן RL בחר תזמון אות מסוים קשה, אך האמון חיוני לאישור.מחקר עדכני לתוך FLT:0 הסביר RLFLT 1 נועד לייצר מפות סלפיות או הסברים נגדיים המדגישים את תכונות התנועה השפיעו על ההחלטה.

כיוונים עתידיים ומחקרים עתידיים

התחום מתפתח במהירות.כמה דרכים מבטיחות נחקרות כדי להתגבר על המגבלות הנוכחיות.

אינטגרציה עם תקשורת של כלי רכב לכל דבר (V2X)

כלי רכב מחוברים יכולים לשדר את עמדתם, מהירותם, ואת היעד בזמן אמת.סוכני RL יכולים להשתמש בנתונים הגרניטאריים אלה כדי לצפות בדפוסי תנועה שניות קדימה, המאפשר תזמון אותות פרואקטיביים המקנה את העבודה המוקדמת של הפרט מן העבודה המוקדמת של ה-FLT:0 University of Michigan's V2X TestbedFLT:1 הראה כי RL עם V2X מופחתת צמת ב-35% לעומת הראייה בלבד.

מודלים המבוססים על מודל ואדריכלות היברידית

מודל טהור ללא מודל RL דורש לעתים קרובות מיליוני אינטראקציות לפני הדבקה.מודל מבוסס RL, אשר לומד מודל סביבה פשוטה ותוכניות בתוך זה, יכול להפחית באופן דרמטי את המורכבות של הדגימה.אדריכלות היברידית המשלבת מודל למד עבור חיזוי עם מדיניות ללא מודל עבור ביצוע מראה תוצאות המדינה-of-the-art במודולים כמו FLT:0CARLAFLT1 תנועה סימולטור 1 יכול להפוך את שיטות הפעלה יקרות.

אדג'י ו-Ferated Learning

הפעלת RL הניתוק על מכשירים קצה (למשל, Raspberry Pi או NVIDIA Jetson המצורפת לכל ארון תנועה) מבטלת את תלות בענן ולהפחית את הכדאיות. בנקאות פדרated מאפשר סוכנים מרובים כדי להכשיר מודל משותף ללא מרכזי נתונים של תנועה גולמית, שמירה על פרטיות. גישה זו היא אטרקטיבית במיוחד עבור ערים עם מדיניות קפדנית של ניהול נתונים.

העברה למידה ו- Meta-Learning

במקום להכשיר כל צומת מאפס מאפס, למידה העברה יכולה להפוך מדיניות מצומת אחד למשנהו עם גיאומטריה דומה ודפוסי תנועה. מטא-learning (למידה ללמוד) לוקח את זה קדימה: סוכן מאומנים על פני עשרות צמתים מדומים כך שהוא יכול להתאים לצומת חדש עם רק כמה דקות של נתונים חיים.זה חותך באופן דרסטי את זמן ההשחה הנדרש עבור פריסה חדשה.

מערכות פיקוח ו-Oversight

כדי לטפל בדאגות בטיחות, מערכות עתידיות עשויות לכלול מפעיל אנושי שיכול לעקוף פעולות של RL כאשר יש צורך ממשקי משתמש מתקדמים ידמיין את ההיגיון של הסוכן (למשל, חיזוי התפתחות התנועה תחת פעולות שונות) ולאפשר למהנדסים לקבוע מגבלות רכות.

מסקנה

למידה של חיזוק מייצגת שינוי פרדיגמטי בתזמון אות התנועה - החל מתכניות סטטיות וכללים תגובתיים פשוטים להתאמה, מדיניות המונעת נתונים שמשפרת כל הזמן.הראיות מסימולציות, פרויקטים של טייסים, ופריסה מוקדמת משכנעת: RL יכולה לקצץ עיכובים, להפחית את פליטות ולשפר את היעילות הכוללת של רשתות תחבורה עירוניות.אך, אך הדרך לאימוץ נרחב מסוללת עם אתגרים סביב בטיחות נתונים, חישובית, דרישות חישוביות, , , , , דרישות חישוביות, ופירוש.

ככל שהמחקר מתקדם – במיוחד בתיאום רב-מנטלי, למידה מבוססת מודלים, ושילוב עם כלי רכב מחוברים – המחסומים האלה יורדים בהתמדה.ערים שמשקיעות היום בתשתיות החיישן ההכרחיות, יכולות מחשוב קצה, ומומחיות של RL תהיה בעלת נטייה טובה לקצור את התגמולים של שליטה על תנועה חכמה באמת.החזון של עיר שבה התנועה זורם בצורה חלקה למרות השטף אינה מרוחקת; אוטופיה היא מטרה ירוקה יותר ויותר.