הקדמה: צורך בזרימות עבודה אוטומטית של נתונים בהנדסה

צוותי הנדסה עומדים כיום בפני שיטפון חסר תקדים של נתונים מחיישנים, סימולציות, מכשירי IoT ומערכות תפעוליות.העיבוד הנתונים באופן ידני זה כבר לא אפשרי - הוא מציג עיכובים, שגיאות וצוואר בקבוק אשר מאטים את החדשנות.כדי להישאר תחרותיים, ארגונים חייבים להתאים את צינורות הנתונים שלהם, ושני כלים יצאו כעמוד השדרה של הנדסה מודרנית: Apache ו-Airflow. כאשר הם משולבים, הם יכולים להתאים שילוב חזק של אסטרטגיות מעקב אמיתי, כדי לבדוק את כל דבר טוב יותר, כדי לבצע בדיקות עבודה, ועדכונים, כדי לצפות, כדי לצפות את הסוללות עבודה, ואסטרטגיות בזמן אמת, ואסטרטגיות עיבוד, ועדכונים, כיצד ניתן לבצע בדיקות מהירות, כדי לצפות את זה, כדי לצפות את הטוב ביותר, כדי לצפות בטכניקות עיבוד בזמן אמתיות, וטכניקות עיבוד, ועדכונים של עבודת צוות.

הבנה: Apache Spark

Apache Spark הוא קוד פתוח, מנוע ניתוח אחיד המיועד לעיבוד נתונים בקנה מידה גדול.בניגוד למפות המסורתיות, Spark שומרת נתונים בזיכרון, מה שהופך אותו ל 100 פעמים מהר יותר עבור עומסי עבודה מסוימים.הוא תומך במספר שפות (Python, Scala, Java, R) ומספק ספריות עבור SQL, הזרמת, מכונות עיבוד גרף.עבור צוותים הנדסיים, Spark הוא אידיאלי לביצוע שינויים מסיביים על נתונים כגון סימולציות, כגון סימולציה או סימולציה של זמן, סימולציה, סימולציה של סימולציה או עיבוד.

תכונות עיקריות של Spark for Engineering Workloads

  • עיבוד:0 (בקיצור: FLT:1) מצמצם את הדיסק I/O, מאיץ אלגוריתמים ושאילתות אינטראקטיביות.
  • (ב) ,0) פריטים שאינם ניתנים למניעה (Ds): אוספים 1FreaLT:1-Fault-סובלנות שניתן לבנותם אם תבטל חלוקה.
  • (FLT:0)Spark SQL:FLT:1 Enables שאילתה נתונים מובנים באמצעות SQL או DataFrames, אשר מהנדסים יכולים למנף לניתוח אד-הוק.
  • (ב) ⁇ :0) ,(התחילה: 1FLT) מספק עיבוד קצר-מציאותי עבור מקורות נתונים מתמשכים כגון חיישני קצה או קווי ייצור.
  • (ב) ,0) MLlib: ®Aperable Machine Learning Library forנבאive Maintenance, זיהוי ואופטימיזציה.

ניתן לפרוס אשכולות על גבי אתרים או בענן (AWS EMR, Azure HDInsight, Databricks) מהנדסים בדרך כלל כותבים עבודות ספארקס כיישומים המכילים עצמיים אשר מוגשים אל המקבץ באמצעות FLT:0 או באמצעות API.

הבנה של זרימת האוויר של Apache

זרימת האוויר של Apache היא פלטפורמת פיתוח קוד פתוח של יצירת קוד פתוח.זה מאפשר למהנדסים להגדיר זרמי עבודה כמו Acyclic Graphs (DAGs) באמצעות קוד Python.כל צומת ב DAG מייצג משימה, ו הקצוות מגדירים תלותיות. Airflow מטפל לוח זמנים, retries, ניטור, ואזהרה, מה שהופך אותו כלי עבור צינורות נתונים מורכבים, בניגוד לסדרת משימות, כגון ויזואליות, משימות פשוטות, או לוחות זמנים, ויזואליות, ויזואליות, משימות ויזואליות, ויזואליות, ויזואליות, ויזואליות, ויזואליות, לוחות זמנים, ויזואליות, ויזואליות, ויזואליות, ויזואליות, עיבוד, ויזואליות, עיבוד, עיבוד, ויזואליות, עיבוד, ויזואליות, ויזואליות, ויזואליות, ויזואליות, ויזואליות, מעקב, משימות, משימות ויזואליות, ויזואליות, ויזואליות, עיבוד, ויזואליות, מעקב, ויזואליות, ויזואליות, מעקב, ויזואליות, ויזואליות, ויזואליות, ויזואליות, ויזואליות, מעקב, ביצוע, ביצוע, ביצוע, ביצוע, ביצוע, ביצוע, שידור, ביצוע, שידור

המונחים: Airflow

  • (FLT:0)DAG (המנהל את Acyclic Graphcio): 1:1 אוסף של משימות עם תלות מוגדרת.
  • (ב) ויקרא י"א: "וַיֹּאמַר עַמֶר עַמֶר עַמֶרְתָּבְתָּבָה" (בראשית כ"ד, כ"ד).
  • (ב) ⁇ :0) ,1 משימות מיוחדות המתכות לאירועים חיצוניים (למשל, הגעת קבצים, תגובת API).
  • (ב) ,0)XComs: FLT:1 מנגנון תקשורת הצלב כדי להעביר כמויות קטנות של נתונים בין משימות.
  • (ב) ,0) ,Pools & מוציאים להורג: קיד 1 (ב) מנהלים ביצוע מקבילה הקצאת משאבים והוצאות.

זרימת אוויר יכולה להיות פרוסה בשרת יחיד, במקבץ Kubernetes, או באמצעות שירותים מנוהלים כמו Google Cloud Composer או Amazon Managed Workflows עבור Apache Airflow (MWAA).

היתרונות של Integrating Spark ו- Airflow

כאשר Spark ו- Airflow משולבים, הם מתייחסים לכל מחזור החיים של צינור נתונים – החל מעומס נתונים לשינוי, טעינה ו ניטור.השילוב מניב כמה יתרונות מרכזיים:

אוטומציה ואמפ; Orchestration

Airflow מעביר את ההגשה, ניטור, ודחייה של עבודות ספארי במקום להפעיל ידנית (FLT:4 פקודות או תזמון אותם באמצעות cron, מהנדסים מגדירים DAG אשר גורם ל- Spark יישומים על אשכול.זה מבטל טעות אנושית ומבטיח כי נתונים מעובדים באופן עקבי, גם במהלך החגים או מחוץ לשעה.

Scalability & ניהול משאבים

Spark מטפל בהסרת הכבדה של חישוב מבוזר, הגדלה אופקית כדי לעבד terabytes של נתונים.זרימה אוויר משלימה זאת על ידי ניהול זרימת העבודה הכוללת, הבטחת כי משימות תלויות (למשל, בדיקות איכות נתונים, טעינה) רק לאחר ש- Spark משרות מצליחות. Airflow יכול גם להשתלב עם מנהלים (YARN, Kubernetes) כדי להקצות משאבים דינמיים לכל משימה Spark.

אמינות ואמפ; Observability

זרימת האוויר מספקת תשואות בנויות, התראות דוא"ל, ונוף גרפי של ביצוע.אם עבודה ספארקס נכשל עקב טעות חולפת (למשל, מחסור במשאב, זרימת האוויר יכולה לנסח אותה עם backoff. מהנדסים יכולים לבדוק יומני ישירות מהזרימה האווירית UI, צמצום זמן הפחתת הפחתת הפחתת הפחתת הנפיחות.

גמישות & התאמה אישית

השילוב מאפשר למהנדסים לעצב זרמי עבודה מורכבים הכוללים לא רק משימות ספארקס אלא גם מיצוי נתונים (למשל, מ- APIs או מסדי נתונים), אימות וצעדי הודעה.DAG מבוססי פייתון יכול לשלב כל היגיון, בעוד ספריות העיבוד של Spark מטפלות בשינויים ספציפיים לתחום. גמישות זו פירושה כי הצינור יכול להתאים מקורות נתונים חדשים או כללי עסקים ללא רישום מחדש של השכבה.

יישום האינטגרציה

קביעת Spark ו- Airflow יחד מחייבת תכנון זהיר בכל תשתיות, מבנה קוד ופעולות. להלן היא גישה של צעד אחר צעד.

שלב 1: הכינו את התשתית

אתה צריך גם אשכול ספאר פועל וסביבת זרימת אוויר.לפיתוח, אתה יכול להשתמש בדוגמה אחת-נודה Spark (מצב מקומי) ומתקן אוויר מקומי. לייצור, לשקול שירותים מבוססי ענן: Databricks for Spark and Cloud Composer או MWAA עבור זרימת אוויר.

שלב 2: התקנת ספקי אוויר דרושים

זרימת האוויר משתמשת בחבילות הספק כדי לממשק עם מערכות חיצוניות.עבור Spark, להתקין את חבילת ה-FLT:6.זה כולל מפעילי כמו FLT 7 ו-FLT:8 אם אתה משתמש ב-Databricks, להתקין את ה-FLT:9.

pip install apache-airflow-providers-apache-spark

שלב 3: חיבורים

בזרימת האוויר UI, ללכת Admin > חיבור ולהוסיף חיבור Spark.You תצטרך לציין את כתובת האתר (למשל, FLT:11 או FLT:12), מצב פריסה וכל אימות הכרחי. עבור Databricks, לספק את כתובת האתר של סביבת העבודה ואת הגישה האישית אסימונים.

שלב 4: כתוב קוד יישום Spark Application Code

לפתח את העבודה Spark כתסריט Python (או Scala / Java JAR) הקורא נתונים הנדסיים גולמיים, חל שינויים, וכותב את התוצאות למערכת מטרה (למשל, קבצי פארקט ב-S3, מסד נתונים) לשמור על הקוד מודולרי וניתן להגדרה באמצעות טיעונים או משתנים סביבתיים.

שלב 5: תצורת אוויר DAG

יצירת DAG אשר לוח זמנים ותזמורת את העבודה Spark להלן היא דוגמה פשוטה לשימוש ב-FLT:13:

from airflow import DAG
from airflow.providers.apache.spark.operators.spark_submit import SparkSubmitOperator
from datetime import datetime

default_args = {
 'owner': 'engineering',
 'depends_on_past': False,
 'retries': 2,
 'retry_delay': timedelta(minutes=5),
}

with DAG(
 dag_id='engineering_data_pipeline',
 start_date=datetime(2024, 1, 1),
 schedule_interval='0 2 * * *', # daily at 2 AM
 catchup=False,
 default_args=default_args,
) as dag:

 extract_sensor_data = BashOperator(
 task_id='extract_sensor_data',
 bash_command='python /path/to/extract.py',
 )

 transform_sensor_data = SparkSubmitOperator(
 task_id='transform_sensor_data',
 application='/path/to/spark_job.py',
 conn_id='spark_default',
 conf={'spark.executor.memory': '4g'},
 java_class=None,
 )

 load_to_warehouse = BashOperator(
 task_id='load_to_warehouse',
 bash_command='python /path/to/load.py',
 )

 send_notification = EmailOperator(
 task_id='send_notification',
 to='[email protected]',
 subject='Pipeline Complete',
 html_content='<h3>Engineering data pipeline finished successfully.</h3>',
 )

 extract_sensor_data >> transform_sensor_data >> load_to_warehouse >> send_notification

שלב 6: מבחן ו Deploy

הפעל את DAG באופן ידני בזרימת אוויר כדי לאמת כל צעד.עקוב אחר יומני העבודה Spark באמצעות Airflow UI או Spark's History Server. onceאומתd, הציב את ה-DAG פעיל ולתת לו לרוץ על לוח הזמנים.

Best Practices for Spark + Airflow Pipe Pipelines

לאורך שנים של ניסיון ייצור, צוותי הנדסה פיתחו קבוצה של שיטות טובות ביותר כדי להבטיח ביצועים, אמינות ושמירה על יכולת.

ארכיון תגיות: Allocation & Tuning

  • (ב) ,(א) , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • (ב) [15] הקצאה דינמית:0) הקצאה דינמית: FLT:1 EnableFLT:19 כדי לאפשר ל- Spark scale executors up/down בהתבסס על עומס עבודה.
  • (FLT:0) בריכות משאבים בזרימת אוויר: ראט' 1) לסביבות עם DAGs מרובים, להגדיר בריכות להגביל את מספר משימות ספארי הנוכחי ולמנוע עומס יתר של אשכול.

טעות Handling & Retries

  • (ב) [15] , [17] , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • (ב) אם הצנרת שלך תלויה בנתונים חיצוניים המגיעים, השתמש בחיישן (למשל, FLT:22) במקום בלוח זמנים קבוע.
  • (FLT:0Addבוד in Spark:FLT:103) עבור עבודות ארוכות, לחסוך מעת לעת תוצאות ביניים.אם המשימה נכשלת וחזור, Spark יכול לחזור מהמחסום האחרון ולא לעבד מחדש את כל הנתונים.

מעקב ואמפ; התראה

  • (ב) ,0) אזהרת זרימת האוויר: ההרחבה 1 (Conformance) או הודעות Slack עבור כשלים המשימה ו-SLA מתגעגע.
  • (FLT:0Log Aggregation:FLT:1 Ship Spark יומניs (נהג ומבצע) למערכת מרכזית כמו אלסטיקווסט מחקר או CloudWatch. Airflow יכול לקשר ללוגים אלה באמצעות מטפלי לוגים מותאמים אישית.
  • (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

מבנה קוד ואמפ; גרסה

  • (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • (FLT:0)Use DAGing:FLT:1 מאוחסנים קבצים ב- Git repository ופריס באמצעות CI /CD. Tag כל גרסה DAG כדי להתאים את גרסת הקוד Spark.
  • (FLT:0)Parametrize סביבות: FLT:1 השתמש במשתנה זרימת אוויר או משתנה סביבה כדי להגדיר נתיבי קבצים, חיבורי מסד נתונים, נקודות קצה אשכול - אף פעם לא קשה לקוד אותם.

אתגרים וכיצד להתגבר עליהם

גם עם שיטות טובות, קבוצות נתקלות באתגרים.כאן הן נקודות כאב נפוצות ופתרונות.

Data Skew & Performance Bottlenecks

עבודות ספארקס יכולות לסבול מהנתונים המקובצים (חלק מהמחלקות גדולות יותר מאחרים) זה מוביל למשימות ממושכות וזמני ביצוע ארוכים. Mitigate באמצעות טכניקות מלח, שידור טבלאות קטנות, או החלפת הנתונים.זרימה אווירית יכולה לעזור על ידי פיצול עבודה ספארקסית גדולה לתוך מספר DAGs קטנים יותר לרוץ במקביל, כל אחד מהם מטפל במצע של נתונים.

תלות במערכות חיצוניות

נתונים הנדסיים חיים לעתים קרובות במערכות מורשת או אחסון בענן שעשויות להיות מגבלות קצב או בזמניות. השתמש בחיישנים של זרימת האוויר עם אימוני זמן כדי להימנע מלכות לא מוגדרות.ליישם חזרה אקספוננציאלית בלוגיקה של השבעה כדי למנוע פטישים.

המונחים: Complexity

ככל שהצנרת גדלה, DAGs יכול להיות מסובך, לעקוב אחר עקרון האחריות של ה-FLT: ליצור DAGs נפרדים עבור אי-העת נתונים, טרנספורמציה, טעינה.

מקרים אמיתיים לשימוש

מספר דיסציפלינות הנדסה נהנים משילוב Spark-Airflow.

מכשיר: Real-Time Analytics

יצרנית רכב אוספת טרה-ביאטים של נתוני חיישן ממכשירי בדיקה.אוויר זרימת אוויר לוח זמנים של DAG:

  1. בדיקה עבור קבצים חדשים בדלי S3 (באמצעות ההרחבה מקוצרת).
  2. משיק עבודה זורמת Spark, אשר מצמידת ממוצעים של טמפרטורה, רטט ולחץ.
  3. החנויות תוצאות במסד נתונים של זמן עבור לוחות נתונים חיים.
  4. שלח אימייל אם קריאה אנונימית עולה על סף.

אנרגיה – תחזוקה חיזוי

מפעילת חוות רוח משתמשת בנתונים טורבינות היסטוריים כדי לחזות כישלונות.

  • הורידו את ה-SCADA מדי יום באמצעות Airflow'sFLT:25
  • פועל עבודה מודל Spark MLlib כדי לעדכן את משקל החיזוי.
  • תואם את המודל להמלצות חדשות של נתונים ומוצרים של תחזוקה.
  • יש הודעה לצוות שדה אם טורבינת טורבינות דורשת בדיקה.

ניהול איכות - Quality control

fab Semiconductor משתמש ב- Spark כדי לעבד תמונות ממכונות בדיקה אופטיות.זרימה אווירית מתזמרת צינור אצווה לילה:

  1. תמונות של אחסון פנימי
  2. Runs Spark OpenCV-basedפגום גילוי
  3. יוצר דוח סיכום ומאחסן אותו באגם נתונים.
  4. מזהיר את צוות האיכות אם שיעורי הפגם עולים על גבולות מקובלים.

שיקולים לענן ולסביבה היברידית

קבוצות הנדסיות רבות לרוץ Spark על אשכולות אמפיריים (למשל, אמזון EMR, Databricks) כדי להפחית את העלויות.זרימה אווירית יכולה להשתלב בצורה חלקה באמצעות FLT:26 או FLT:27 (זה מאפשר לך לסובב אשכול, להפעיל את העבודה, ולסיים אותה - כל זה בתוך אותו DAG. עבור סביבות היברידיות (על-על-ידי ענן נוסף), כמו גם זרימת האוויר יכול לפעול על בסיס קבוצות שונות כדי ל-ידי Sparks על בסיס מקומות עבודה.

מגמות עתידיות באוטומציה

הנוף של הנדסת נתונים מתפתח.כאן מגמות לצפייה:

  • (FLT:0) צינורות ראשונים: Spark Structuredסטרימינג ו- Airflow'sFLT:28 מפעיל יהיה נפוץ יותר עבור מקרים של הנדסה במשרה חלקית (למשל, תחזוקה חיזוי על נתוני הזרמה).
  • (ב) [ה]ההוצאה להורג: [ה][דרוש מקור]] [ה]], הן ספארקס והן האוויריות, מאמצות את קובראנטס.
  • (FLT:0) אינטגרציה למידה של Machine: FLT:1 MLlib של Spark מוזג עם אינטגרציה של MLflow של זרימת האוויר עבור צינורות ML מקצה לקצה המכסים אימון, הערכה ופריסה.
  • (FLT:0) הוגים מודרך: FLT3:1 Airflow תומך כעת ב-FLT:30 (בתוקף: 30) באמצעות מפעילי Deferrable, המאפשרים לדפוס להיות מופעל על ידי אירועים חיצוניים (למשל, אירוע השלמת עבודה ספארקס מ-AWS Lambda).

מסקנה

חידושים אוטומטיים של נתוני הנדסה עם Apache Spark ו- Apache Airflow כבר לא מותרות - זה הכרחי עבור צוותים שרוצים לדרג את פעולות הנתונים שלהם ללא להקריב אמינות. Spark מטפל בהסרת הכבדה של חישוב מבוזר, בעוד זרימת האוויר מספקת את האינטליגנציה לתזמורת, לוח הזמנים, לפקח על הצינור כולו.על ידי ביצוע השלבים הנדסיים ושיטות הטובות ביותר המפורטות במאמר זה, צוותי הנדסה יכולים לבנות מערכות מדרגיות, בר-קיימא, ללא יכולת לנבאת נתונים, או להאיץ את התחזוקה גבוהה יותר, או להאיץ את התחזוקה של החידושים של החידושים של ויזואליים, או עיבוד הנתונים.

(ב) לעיין בתיעוד הרשמי של ה-FLT:0 (Apacheische SparkFLT:1 ו-FLT:2Apache AirflowFLT 3:0;0) ,Apache SparkFLT 1:5 עבור עדכוני ספק, ובלוג FLT:6 Databricks על עריכת עבודות SparkFLT-4 Airflow 7.