Table of Contents
פרויקטים הנדסיים סביבתיים, במיוחד אלה המתמקדים בניהול פסולת, הם יותר ויותר נתונים-רגישים מערכות פסולת מודרנית לייצר זרמים מסיביים של מידע - מ-Shares מצויד חיישן וכלי רכב איסוף מהירים GPS לצפי גז ואפליקציות דיווח אזרחיות.לעבור נתונים אלה ביעילות כדי לחלץ שיטות פעולה יעילות של ניהול פסולת הוא אתגר כי כלי ניהול יחיד מסורתיים נאבקים כדי לענות על Apache התפתחה כמסגרת ייחודית לחיקוי ל-periciallyerationerationeration in actioneives, כדי לאפשר עיבוד נתונים מהיר יותר, כגון אופטימיזציה מהירה יותר, לחץ איכות סביבה, כגון אופטימיזציה מהירה יותר, לחץ על ידי עיבוד נתונים, לחץ דם, לחץ דם, ו-APIQremed, כדי לספק טיפול פסיכולוגי, כדי לספק טיפול מהיר יותר, כדי לספק טיפול פסיכולוגי, כדי לספק טיפול מהיר יותר, כדי לספק טיפול יעיל יותר, כדי לספק טיפול יעיל יותר, כדי לספק טיפול פסיכולוגי, כדי לספק טיפול פסיכולוגי, כדי לספק טיפול יעיל יותר, כדי לספק טיפול יעיל יותר, כדי לספק טיפול יעיל יותר, כגון אופטימיזציה מהירה יותר, לחץ על ידי אופטימיזציה מהירה יותר, לחץ נתונים קומפקטית, כגון אופטימיזציה של נתונים קומפקטית, כגון אופטימיזציה מהירה יותר, כדי לספק טיפול יעיל יותר, כדי לספק טיפול יעיל יותר, כדי לספק טיפול יעיל יותר, כגון אופטימיזציה מהירה
הבנה של Apache Spark בקונטקסט של הנדסה סביבתית
(א) Spark היא מערכת מחשוב פתוחה, מבוזרת המספקת ממשק עבור אשכולות שלמים עם מקבילות נתונים בלתי פתירה וסובלנות לקויה.בבסיסה, Spark משתמשת בהפשטה נתונים הנקראת Resilient Distributed Dataset (RDD), אך העבודה המעשית ביותר מתבצעת באמצעות מאגרי מידע מתקדמים: FLT:0Spark SQLFIRECT 1 עבור נתונים מובניים,F:2033GRE עבור גרפים
בניגוד Hadoop MapReduce, אשר כותב תוצאות ביניים לדיסק, Spark מפחית את I / O overhead.זה חשוב במיוחד עבור פרויקטים הנדסיים סביבתיים שבו נתונים לעתים קרובות לשלב כמויות זמן ארוכות של חיישנים של IoT עם נתונים GIS בנוי למחצה ו יומני טקסט. ניתוח פסולת טיפוסי עשוי לכלול קריאה של קבצי CSV ממשאיות איסוף, להצטרף אליהם עם נתונים מאוחסנים גיאוגרפית, ולאחר מכן איסוף נתונים מהירים יותר מאשר אלגוריתם הפעלה של זיכרון רגיל.
עבור מהנדסים סביבתיים חדשים כדי להפיץ מחשוב, עקומת הלמידה היא מנוהלת על ידי DataFrame API של Spark (דומה ל pandas) וממשק SQL מוריד את המחסום, בעוד את אשכול הבסיסי ניתן לנהל באמצעות YARN, Kubernetes, או שירותי ענן כמו Databricks. גמישות זו מאפשרת מחלקות הנדסיות להתחיל קטן עם אשכול יחיד-לא-דה והיקף אופקי כמו נתונים לגדול.
מקורות נתונים ואתגרים בניהול פסולת
מערכות ניהול פסולת מודרניות הן חיישנים של הסביבה העירונית.מקורות נתונים אופייניים כוללים:
- (ב) חיישנים בינאריים:0 (בקיצור:0) חיישנים בינאריים: 1 ⁇ אולטרה סגול או גלאי אינפרא אדום מלא משדרים קריאה באמצעות רשת לורWAN או הסלולר.
- (FLT:0GPS Trackers on Collection Vehicle:FIRLT:1 , Real-time Location, Speed ונתוני דבקות בתוואי.
- (ב) [13] ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (FLT:0) לנדפיאל והובלת קשקשים: ההרחבה 1 (Inbound/outbound Waste tonnage, חיישנים של הרכב (למשל, קרוב ל-infrared עבור חומר).
- (ב) תחנות ניטור סביבתיות: נפת' 1 (מאטאן) מאן, רמות של נטייה, איכות אוויר ליד אתרי שירות.
- (FLT:0) פלטפורמות משוב: FLT:1 תלונות, בקשות שירות, ורגשות של מדיה חברתית או יישומים ייעודיים.
מקורות אלה מייצרים נתונים עם שפעות שונות, כרכים וזנים. קוראי חיישנים עשויים להגיע כל כמה דקות, יצירת מיליוני רשומות ביום, בעוד דוחות קרקעיים לעתים קרובות ארוזים מדי שבוע.איכות נתונים היא אתגר מתמשך: ערכים חסרים מחיישנים מתים, סחף GPS, ופעמים לא עקביות דגימות.בנוסף, חששות הפרטיות עולות כאשר נתונים קשורים למשקי בית בודדים.
מסדי נתונים מסורתיים ומודל עיבוד מקביל של Spark, בשילוב עם תמיכה מובנה לקריאה מאגמים נתונים (S3, HDFS) וזרימת ingestion, מספק את התשתית הנדרשת כדי להתמודד עם זרימת נתונים הטרוגניים ביעילות.
שימוש ב- Spark for Waste Dataאינטגרציה and Processing
מידע על הזרמת Structured
הזרמת המבנה ב Spark מאפשרת עיבוד של זרמי נתונים מתמשכים כ-DataFrame ללא מעצורים, כלומר מהנדסים יכולים להגדיר צינור שקורא עדכונים של חיישן מקפא או MQTT, מבצע שינויים בזמן אמת (למשל, המרת קבוצות של מתח גולמי לקרוא כדי למלא את אחוזי ה-Sams), וכותב מדדים מצטברים למערכת לוח זמנים או התראות.
ניקוי נתונים וטרנספורמציה
נתוני פסולת Raw הם לעתים רחוקות ניתוח קריאה. Spark מספק פעולות רבות של DataFrame לניקוי: סינון ערכים מחוץ לטווח, בין קריאות חיישן נעדר באמצעות פונקציות החלון, סטנדרטיזציה של פורמטים של פעמים בכל אזורי זמן, וכתובות גיאוגרפיות כדי לתאם באמצעות UDFs.עם הערכה עצלנית של Spark, כל הטרנספורמציות ממוטבות לתוכנית לוגית לפני ביצוע, אפילו ניקוי מורכב ביעילות על פני ה-FID (DSamtextextextation) של פונקציות הפעלה מחדש של פונקציות ניהול קריטיות של Microsoft) של פונקציות ניהול קריטיות (Dschel) של אחסון: CRADNS) של אחסון (DNS) של Microsoft) של Microsoft).
ניתוח נתונים עם Spark SQL
לאחר שהמידע נקי, Spark SQL מאפשר למהנדסים לחקור במהירות את דפוסי הפסולת באמצעות שאילתות סטנדרטיות של SQL.לדוגמה, הצטרפות ל-Bal מלא רמות עם מסלולי איסוף מגלה אילו שכונות מוחלשות.קבוצות שפכים באמצעות סוג חומרי ועונה חושפת מגמות כמו פסולת בנייה מוגברת באביב.התוצאות ניתנות לראייה ישירה באמצעות מחברות (למשל, Zeppelin, Jupyter עם PySpark) או לייצא באמצעות דינמיקה אינטראקטיבית של שאילתות של שאילתות JD.
Machine Learning for Predictive Analytics
ספריית MLlib של Spark מספקת יישום מדרגי של אלגוריתמים משותפים: k-means המקבץ לזיהוי אזורי ייצור פסולת, יערות אקראיים לחיזוי שיעורי מילוי המבוססים על מזג אוויר ויום בשבוע, וניתוח רכיב עיקרי לצמצום המימדיות בנתונים של חיישן.עבור תחזיות זמן, מהנדסים יכולים להשתמש ב-S Spark's Built-in ARMA או לשלב אותו עם ספריות כמו פנדה באמצעות ® UDFs חשוב איסוף נתונים של צריכת דלק, כמו גם כן, הוא תומך ברזולוציה גבוהה של צריכת דלק אופטימנטלית, כמו גם ברזולוציה אופטימנטלית, ולהפחית את השינויים אופטימלית, ולהפחית את תהליכי אבחון צריכת דלק אופטימנטלית, כמו גם את תהליכי טיפול.
שימוש במקרים של הנדסה סביבתית
מעקב בזמן אמת של פעולות איסוף
עיר בגודל בינוני פרסה את Spark Structured הזרמת כדי לפקח על 15,000 הבזנים החכמים שלה.חיישנים העבירו מעמד מלא כל 10 דקות.היישום הזרמה ערך קצב ממוצע של 30 דקות מתגלגל לפח ולכופף כל בן שבו הממוצע עלה על 85% וקצב השינוי היה מעל סף (ציון התראות מילוי מהירות) נשלחו לשולחים, אשר כוונו מחדש משאיות איסוף דינמיות במהלך שישה חודשים, הניסוי הצטמצם על ידי 40 אחוזים בלבד, והמכירות התפעוליות ישירות על ידי איסוף.
אופטימיזציה באמצעות GraphX
תכנון נתיב איסוף פסולת הוא בעיה קלאסית של כלי רכב עם חלונות זמן (VRPTW) בעוד ספריית GraphX של Spark אינה מיועדת עבור פתרונות אופטימיזציה מלאים, זה יכול לעבד מראש מבנים גרף גדול (למשל, רשתות כביש עם נתוני תנועה) כדי לזרז מרחקים קצרים ביותר נסיעה בין אלפי צמתים לפני זמן, ניתן להאכיל אותם לתוך כלי סטרימינג של Google או מחשב ניידת של מערכת הפעלה מחדש של מחשב ניידת, או מחשבת של 1.5 אינץ 'אוקס.
מודלים חיזויים של הדור של פסולת
תחזית מדויקת של ייצור פסולת ברמת השכונה מאפשרת לרשויות להקצות משאבים ביעילות.שימוש בנתונים לאיסוף היסטוריים בשילוב עם נתונים דמוגרפיים, מזג אוויר ואינדיקטורים כלכליים, מהנדסים בנו מודל עץ מלוטש ספארי.המודל חזה מאגרי פסולת שבועיים עם 91% דיוק (R2) על פני 200 אזורים.התחזיות הודיעו על תקציב עבור חללי קרקע ותכניות מחזור, וכן נתמך "מחירים שבועיים" כמו מודלים עונתיים, ללא שינוי ידניים מורכבים, כי ניתן להחליף מודלים חדשים, ללא שינוי ידניים חדשים, כי הם יכולים להיות מתואמים, כי הם יכולים להיות מתואמים מודלים חדשים, כי הם יכולים להיות מודלים חדשים, כי הם יכולים להיות מתואמים מודלים חדשים של מודלים חדשים, כי הם יכולים להיות מודלים עונתיים, כי הם יכולים להיות מתואמים על פני 200 אזורים.
ניתוח בנושא: Civil Feedback
הנדסה סביבתית אינה טכנית בלבד - תפיסה ציבורית חשובה.היכולת של Spark לעבד נתוני שפה טבעית מאפשרת לנתח אלפי פוסטים ברשתות החברתיות, בקשות שירות 311, והערות סקרים.שימוש בתוקפנות הלוגיסטית של MLlib או מודל NLP מראש שהוצב באמצעות Spark UDFs, צוותים יכולים לסווג משוב לקטגוריות (למשל, פספס, לשפוך, ריח, ריח) ומגמות מתקדמות יותר עם ניתוח בטיחותי חירום זה עשוי להתאים את המצב עם בעיות נשימה.
שיקולים אדריכליים להפקה
Cluster Setup וניהול משאבים
עבור פרויקטים לניהול פסולת, אשכולות Spark ניתן לפרוס על גבי תעריפים באמצעות חומרה של סחורות או בענן עבור שירותי ענן גמישים, כגון אמזון EMR, Google Dataproc, או Databricks לפשט ניהול אשכול ולספק מדיניות חסכונית המבוססת על קבוצות תצורה של עבודה (Sparkt) כולל גם microgency לשפוך 10.com-Fcatspark.
בחירת פורמטי אחסון
פורמטים טוראר כמו Apache Parkt מומלץ מאוד עבור נתונים פסולת. דחוסים ביעילות (עד 75% חיסכון בחלל על CSV) ותומכת בדחף predicate לאחור, כך ספארקס רק קורא את העמודות הדרושות לשאילתה.עבור עומסים הדורשים עסקאות ACID ונסיעות זמן, דלתא מוסיפה אמינות נוספת.עירוניות רבות נעות לכיוון בתי נתונים המשלבים את האכיפה של נתונים עם גמישות של אגם טבעי זה הוא מתאים.
היכרות עם אגמי נתונים ב- Edge
בפריסה מסוימת, זה לא מעשי לייעל את כל הנתונים הגולמיים אל אשכול מרכזי בשל מגבלות רוחב פס. חלופה היא להפעיל עבודות ספאר קלות על נקודות קצה (למשל, שערים מבוססי ARM בתחנות העברה) כדי preprocessprocessor ולסכם נתונים באופן מקומי לפני שליחת תוצאות מצטבר לענן. Spark יכול לרוץ במצב מקומי על מכשירים אלה, ביצוע ניקוי בסיסי וחלון של ניתוח prepreprepations לאחר מכן כדי להפחית את הנתונים מראש כדי להפחית את המשתנים לתוך דפוסים.
אתגרים ופתרונות
למרות כוחו, Spark אינו כדור כסף.אתגר משותף הוא (FLT:0data skewveFLT:1 - כאשר דור הפסולת מרוכז מאוד במספר אזורים, מחיצות מסוימות הופכות גדולות יותר מאחרים, מה שגורם למשימות סטרלינג יותר. Solutions כוללים מפתחות מלחים במהלך פעילות משותפת ושימוש במחלקים מותאמים אישית בקוד מבוסס RDD (למרות ש-DataFrame מטפל ב-Afirme API ברמה מסוימת של שימוש באופן אוטומטי ב-Squat2Flat)
ניהול עלויות חשוב לפרויקטים סביבתיים במימון ציבורי.ריצה אשכול גדול 24/7 יכול להיות יקר.שימוש במקרים טרום-אופטימיים או מקום יכול לקצץ עלויות על ידי 60–80%, אבל הם באים עם סיכון של הפרעה.S Spark's מחסומים וביצועים של אופטימיזציה להפחית את הסיכון הזה.בנוסף, הפחתה אוטומטית על בסיס תור להפחית את עלויות החמצמה.
פער המיומנויות הוא עוד hurdle מהנדסים סביבתיים הם בדרך כלל מאומן במדעי התחום, לא מבוזר מחשוב. להשקיע הכשרה עבור PySpark וניהול אשכול בסיסי, או שיתוף פעולה עם צוותים הנדסיים נתונים, הוא חיוני.ספקי ענן רבים מציעים שירותים ספארויים מנוהלים כי הסרת תשתיות, ומאפשר למהנדסים להתמקד בניתוח לוגיקה ולא בתצורה של אשכול.
שיטות עבודה הטובות ביותר עבור צוותי הנדסה סביבתית
- (FLT:0)Start with aפיילוט ProjectFLT:1hil - בחר זרם פסולת אחד (למשל, מחזור מסחרי) ומקור נתונים יחיד כדי לבנות הוכחה של תפיסה לפני הגדלה של העיר.
- (FLT:0)Use גרסה שליטה עבור Spark WorkFLT:1) - מטפל במחברות כקוד; השתמש ב- Git ו- CI /CD כדי לבדוק ולפרוס צינורות.
- (FLT:0) אבולוציה של צ'מה אבולוציה 1 (FLT:1) - השתמש באגם דלתא או אברו כדי להתמודד עם שינויים בתבניות נתונים של חיישן לאורך זמן.
- (ב) ,0) שילוב נתונים ממשל מילואים (FLT:1) - תג שדות PII (למשל, מיקום GPS בדירות בודדות) וליישם מסיכה או ggregation לפני האחסון.
- (FLT:0) מוניטור תפעולי מדדים של LT:1 - לעקוב אחר משך העבודה, נפח נתונים ושיעורי שגיאות; להגדיר התראות עבור תקלות צינור.
- (FLT:0) colaborate עם מומחי דומיין FLT:1) - כרוכים מפעילי ניהול פסולת בהגדרת KPIs משמעותיים ואימות תפוקה מודל.
- (FLT:0)Benchmark נגד מערכות בסיסיות FLT:1) - השוו את הביצועים של Spark לגישה הקיימת (למשל, מסד נתונים PostgreSQL) כדי לכמת שיפורים.
מסקנה
Apache Spark מציעה פלטפורמה חזקה, מדרגית ויעילה לעיבוד הנתונים המגוונים והגבוהים שנוצרו על ידי מערכות ניהול פסולת מודרניות.על ידי מתן אפשרות בזמן אמת, ETL גמיש, ניתוח אינטראקטיבי ולמידה מכונה בקנה מידה, Spark מעצימה צוותים סביבתיים כדי להפוך את תצפיות שומן ו יומני ניהול תפעוליים לתובנות יעילות.
מקורות נוספים (בתרגום חופשי:0)
- (ב) [ה]הרש"י]: [ה], [ה], [ה], [ה], [ה'], [ה'], [ה'], [ה'], [ה'], [ה'], [ה'], [ה''], [ה']
- (FLT:0) ניהול בזבוז זמן אמיתי באמצעות IoT ו Spark (נייר IEEE)FIRLT:1 - מחקר מקרה מחקר על מערכת חכמה עם זורמת Spark.
- (FLT:0) Databricks Blog: Smart City Waste ReductionveFLT 1 - מחקר מקרה שפורסם על ידי שימוש ב- Delta Lake ו-MLlib עבור אופטימיזציה של נתיב.
- (FLT:0) EPA Waste Management Engineeringeur Research Research: ידע בסיסי על זרימת נתונים והקשר רגולטורי.