Table of Contents
מהו אגם נתונים של Event-Driven?
אגם נתונים מונחה אירוע הוא מאגר מרכזי של ingests, תהליכים, ומאחסן נתונים בתגובה לאירועים - שינויים במדינה, כניסות נתונים חדשות, או פעולות משתמשים - במקום בלוח זמנים קבוע. בניגוד אגמים נתונים קונבנציונליים הנשען על עבודות אצווה תקופתיות, אדריכלות מונחת אירוע מגיבה בזמן אמת או קרוב בזמן אמת, ומאפשרת זמינות מיידית של נתונים לניתוח, למידה, החלטות תפעוליות.
הרעיון המרכזי הוא שכל פיסת נתונים חדשה גורמת לשרשרת של פונקציות ללא שרת שמאמתות, הופכות, העשרה, ודוחקת את הנתונים לאגם.תבנית זו מתאימה באופן טבעי לחנויות אובייקט בענן (כגון אמזון S3 או Azure Blob Storage) ושירותי compute Serverless (כגון AWS Lambda, Azure Functions, או Google Clouds).
תמונות של Event-Driven Data Lakes
- עיבוד:0 (Asynchronous Processing:FLT:1eur Events מעובדים באופן עצמאי, ומאפשרים למערכת לעלות אופקית ולעמוד בספיקים בנפח הנתונים ללא התערבות ידנית.
- (FLT:0) מפיצים: ההרחבה: (מקורות נתונים) והצרכנים (מעבדים ואנליטיקה) מתמזגים באופן חופשי באמצעות ברוקרים אירועים או גורמים.זה משפר את הסובלנות והפשטות של תחזוקה.
- (FLT:0) בזמן אמת התחדשות נתונים: 10) נתונים נע ממקור לאגם בתוך שניות או דקות, תמיכה במקרים של שימוש רגיש בזמן כמו זיהוי, ניטור IoT, ולוחמי זמן אמיתיים.
- (FLT:0) שילוב ישיר עם שירותי ענן:FLT:1Build פלטפורמות ענן מודרניים מספקים טריגרים אירוע מובנה (למשל, S3 Event Notifications, Azure Event Grid) שהופכים אותו קל לשירותי שרשרת ללא מודעות בינונית אישית.
Event-Driven vs. Batch-Driven Data Lakes
באגם נתונים מסורתי מונחה, נתונים נאספים מעל החלון (למשל, שעה או יום) ולאחר מכן מעובדים ברובם.בעוד פשוט יותר ליישם, מצבי אצווה מציגים עצלות ויכולים להחמיץ דפוסים טרנספורמטיביים. גישה מונחת אירוע לפני זמן ותגובה, לעתים קרובות באמצעות תורי הודעות (כמו Amazon SQS או Azure Event Hubs) כדי לטבול באירועים מתקדמים לפני איסוף של מערכות מסחר זה ואילך, אנו דורשים טיפול זה ואילך.
תפקידה של Serverless Technologies
מחשוב ללא שרת מפשט את ניהול תשתיות, ומאפשר לצוותים להתמקד בלוגיקה של קוד ועסקים. בהקשר של אגמים נתונים, שירותים ללא שרת לספק את סביבת הביצוע עבור צינורות עיבוד המופעלים על ידי אירועים.
סקלאה
פונקציות ללא שרת באופן אוטומטי בקנה מידה מאפס לאלפים של מקרים במקביל המבוססים על נפח האירוע.גמישות זו חיונית לאאגמים נתונים שחווים דפוסים לא צפויים של צלקות, כגון ספייקטים ממדיה חברתית, קליקים, או מכשירים מחוברים.אתה אף פעם לא צריך לנחש יכולת או לנהל קבוצות של הרכב.
עלויות יעילות
ללא שרת, אתה משלם רק עבור זמן ואחסון אתה לצרוך.כאשר אין נתונים נכנסים לאגם, אין פונקציות לרוץ, ועלויות יורדות ליד אפס.זה ניגוד כוכבים תמיד על VMs או מכולות כי לא לתקן את ההאשמות אפילו כאשר idle.
המונחים: Operational Overhead
פלטפורמות ללא שרת מטפלות בתיקון, בלחיצת, ניטור, וסובלנות אשמה מחוץ לקופסה. DevOps צוותים חופשיים מניהול מערכות הפעלה, בריצה, או מתווך.זה מאיץ מחזורי פיתוח ומפחית זמן לשוק עבור צינורות נתונים חדשים.
גמישות ואינטגרציה
רוב ספקי הענן מציעים פונקציות ללא שרת המשלבות באופן מקורי עם עשרות שירותים: מסדי נתונים, ברוקרים הודעה, אחסון אובייקטים, מכונות למידת APIs וכלים SaaS של צד שלישי.לדוגמה, אירוע S3 מעלה יכול לגרום לתפקוד Lambda המכנה אמזון הכרה כדי לתייג תמונות, ואז מאחסן את metadata במסד נתונים - ללא מתן שרת.
עם זאת, ללא שרת הוא לא כדור כסף.הקור מתחיל, ביצוע מגבלות זמן (למשל, 15 דקות עבור AWS Lambda), ומגבלות עיצוב ללא תנאי אומר כי שינויים ארוכים, מורכבים עשויים עדיין לדרוש אפשרויות חלופיות להתאמה כמו AWS Fargate או Azure Container Instances.
מפתח של אדריכלות ללא תשלום של Microsoft
אגם נתונים בר-ארכיאולוגי מורכב מספר שכבות בין-מינים.כל שכבה יכולה להתבצע באמצעות שירותי ענן מנוהלים, והטבע המונע על ידי האירוע מבטיח כי הנתונים זורמים בצורה חלקה ביניהם.
מקורות אירועים
כל מערכת שיוצרת נתונים יכולה לשמש מקור אירועים.
- (FLT:0) שכפול יומני ו- metricsherFLT:1) הנפלטים על ידי שרתי אינטרנט, יישומים ניידים או מיקרו-שירותים (למשל, באמצעות אמזון CloudWatch, Azure Monitor או סוכני צד שלישי).
- (FLT:0) מכשירים וחיישנים של IoT (ImualFLT) 1 סטרימינג טלמטורי באמצעות פרוטוקולים כמו MQTT, לעתים קרובות נחיתה ב-AWS IoT Core או Azure IoT Hub.
- (FLT:0Database Change FlowsFLT:1 ממאגרי מידע על עסקאות (באמצעות כלים כמו Debezium או Native Change Dataלוכדים נתונים) אשר מפרסמים שינויים ברמת השורה.
- (FLT:0User InteractionsigFLT:1) שנרשמה על ידי ניתוח Front-end Analytics SDKs ושלחה לשירות צבירת אירועים כמו אמזון Kinesis או Google Cloud Pub/Sub.
אירועים Ingestion ו- Queuing
באופן ישיר הפעלת פונקציות ללא שרת מכל אירוע יכול להיות מכריע ולא יעיל.במקום, אירועים בדרך כלל מוצפים באמצעות תור הודעה, זרם או אוטובוס אירועים.זה מקלקל ייצור נתונים מצריכה, מספק מבול, ומאפשר רטיבות.
- (ב)אמזון SQSigsFLT:1 - תור פשוט עבור רכיבים decoupling, תומך משלוחים ב-least-once תורים מתים.
- (FLT:0) אמזון KinesisFLT:1 - זרם בזמן אמת עבור נתונים עתירי גבוה, עם צרכנים ללא שרת באמצעות Lambda.
- (ב) ,0אזור אירוע הניברסFLT:1 - אירוע מלא מנוהל, מדרג עבור מיליוני אירועים בשנייה.
- (ב) ,0אזור אירוע גריידלד' 1 - שירות אירועים עבור פאב / סובב על שירותי Azure.
- (FLT:0) Google Cloud Pub/SubFLT:1) - Global, עמידות עם דרוג קשקשים אוטומטיים ומשלוח בדיוק על גבי חתונות (אופציונלי).
המונחים: processing Layer
פונקציות ללא שרת מהוות את לב שכבת העיבוד.הם מופעלים בתגובה לאירועים המגיעים לתור או לזרם, והם מבצעים משימות כגון אימות נתונים, סינון, טרנספורמציה (ETL), העשרה עם ממשקי API חיצוניים, וניתוק לאחסון.
- (ב) [ה]ב[[1724]]]]]], [[1924]]]]]], [[1924]]]]]], [[1924]]]]]], [[1924]]]]]]]]
- (ב) תוכנית ההרחבה (FLT) עם תוכנית הצריכה או תוכנית פרמיה לשעות ריצה ארוכות יותר.
- (ב) ,0) Google Cloud FunctionseursFLT:1 או Cloud Run for Contained Process.
- (FLT:0) ,StepseursFLT:1 או פונקציות דוריות כדי לזמר זרמי עבודה רב-שלב, להתמודד עם כישלונות, ולנהל את המדינה על פני פונקציות מרובות.
אחסון שכבת
אחסון אובייקטים הוא הבסיס של כל מוצר של Lake. Services כמו אמזון S3, Azure Blob, ו-Google Cloud Storage מספקים יכולת מדרגות אינסופית, עמידות גבוהה ומדיניות מחזור חיים לקשור נתונים לשיעורי אחסון זולים יותר ככל שהוא מתבגר.תבנית נפוצה היא לארגן את האחסון לאזורים או לשכבות:
- (FLT:0)Raw / Landing ZoneFLT:1 - נתונים בלתי מתוחכמים, מאוחסנים בפורמטים ילידים (JSON, CSV, Avro, Parkt).
- (ב) ,0) , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (FLT:0) Aggregregated / Analytics ZoneFLT:1) - נתונים המובנות לשאילתה, לעתים קרובות בפורמטים טורים (Parquet) ומצמצמצו עד תאריך או מפתח.
גורמים מונעים אירועים (למשל, הודעות אירוע S3) יכולים לסמן את הגעתם של אובייקטים חדשים, שיגור פונקציות עיבוד במורד הזרם.
Analytics וויזואליזציה
לאחר שהנתונים שוכנים בשכבת האחסון, מנועי השאילתה ללא שרת מאפשרים לאנליסטים ולמדענים נתונים לחקור אותו ללא מתן אשכולות:
- (FLT:0)AWS AthenaveFLT:1) - שירות מבוסס Presto, תשלום-per-query עבור הפעלת SQL ישירות על נתונים ב- S3.
- (ב) [15] , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (FLT:0) Google BigQuireryFLT:1 - מחסן נתונים ללא שרת שיכול לשאול טבלאות חיצוניות על אחסון בענן.
- (ב)אמזון רדוף ספקטרום 1:1 (אמזון) - אישורים לנתוני השאילתה ב-S3.
כלי ויזואליזציה כגון אמזון QuickSight, Power BI, או Looker להתחבר למנועי אלה עבור לוחות נתונים.הצנרת המונעת אירוע מבטיחה כי לוחות נתונים משקפים את הנתונים האחרונים עם שקיפות מינימלית.
תבניות אדריכלות עבור Event-Driven Data Lakes
מספר דפוסים חוזרים משלבים את הרכיבים לעיל, בחירת התבנית הנכונה תלויה במהירות נתונים, נפח, ואת הצורך של משחק היסטורי.
Fan-Out עם פונקציות ללא Server
בתבנית זו, אירוע יחיד בתור נצרך על ידי פונקציה ללא שרת, אשר לאחר מכן שולח את הרשומה מעובדת למספר מערכות מטה הזרם (למשל, אחסון של האגם נתונים ולוחם בזמן אמת).
אדריכלות: Serverless Layers
אדריכלות מסורתית Lambda משתמשת שכבת אצווה עבור דיוק היסטורי ושכבה מהירה עבור עדכונים נמוכים.ב יישום ללא שרת, שכבת אצווה יכולה להיות פונקציה קבועה ללא שרת (למשל, עבודה יומיומית AWS Lambda) כי recomputes מצטברים, בעוד השכבה המהירות היא מעבד זרמי ללא אירועים.דוגמה היא שילוב אמזון Kine Analytics נתונים (זרם) עם לוחמת) מתוכנן ל-Slat Park3 מקומות עבודה.
אדריכלות: (Pureסטרימינג)
עבור צוותים שרוצים להימנע משמירה על שני בסיסי קוד, אדריכלות קפפא מתייחסת לכל הנתונים כזרם.שרת לקוחות מעבדים את הזרם בזמן אמת, והתוצאות המעובדות מאוחסנות באגם הנתונים.הזרם עצמו (התקבל בלוג כגון קפקא או Kinesis) משמש כמקור לאמת.
יישום אגם נתונים Event-Driven Data Lake
בניית אגם נתונים ללא שרת ייצור דורש תכנון זהיר על פני מספר שלבים. להלן היא גישה של צעד אחר צעד בהשראת יישום בעולם האמיתי.
שלב 1: זיהוי מקורות נתונים ואירוע Define Schema
רשימה של כל יצרני הנתונים הפוטנציאליים ואת פורמטי הפלט שלהם. סטנדרטיזציה על אירוע משותף schema (למשל, באמצעות Cloudevents) כדי לפשט את עיבוד הזרם.עבור נתונים מובנה, להגדיר סוגים שדה ו metadata נדרש כמו פעמיםtamps ו מזהה מקור.
שלב 2: הגדרת אירוע
בחר תור או שירות זר שמתאים לדרישות שלך דרך לוח זמנים ועקביות. מקורות אירוע קוהנציה לפרסם את הנתונים שלהם ל-buffer זה.לדוגמה, לאפשר הודעות S3 לשלוח אירועים ליצירת אובייקטים תור SQS, אשר לאחר מכן גורם לתפקוד Lambda.לוודא ל תור מת (DQ) לטיפול בכישלונות.
שלב 3: עיצוב ארכיטקטורת האחסון
ההחלטה על מבנה תיקיה עבור אגם הנתונים.ההיררכיה האופיינית כוללת: (FLT:0) ,(FLT:1 , ו-FLT:2 שימוש בחלוקת (למשל, עד תאריך, אזור או אירוע) כדי לייעל את ביצועי השאילתה. הגדר מדיניות מחזור חיים כדי להעביר נתונים ישנים יותר לאחסון ארכיטיבי (S3 או קרחונים) באופן אוטומטי.
שלב 4: יישום פונקציות עיבוד נתונים
לכתוב פונקציות ללא שרת כי לצרוך אירועים מן התור, לבצע לוגיקה טרנספורמציה (למשל, parsing JSON, המרת CSV ל-Parkt, deduplication), ולכתוב את התוצאות לאזור הנחיתה באגם הנתונים.עבור ETL מורכב, פונקציות מרובות שרשרת באמצעות שירות תזמורת של זרימת עבודה (Step Functions) להבטיח חסימה: אותו אירוע צריך להיות מעובד בבטחה מספר פעמים במקרה של Reriest.
שלב 5: הקמת ביטחון וממשל
החל לפחות תפקידים IAM לכל פונקציה ללא שרת.נתוני הצפנה במנוחה (באמצעות S3 SSE-KMS או Azure Storage Service הצפנה) ובמעבר (TLS) להשתמש בקרדי גישה מפורשת היטב (למשל, טופס אגם AWS, Azure Purview) כדי לנהל הרשאות בטור או ברמת השורה.
שלב 6: קביעת מעקב ואזהרה
מעקב אחר מדדים מרכזיים: תפקוד במטרות, שיעורי שגיאה, שקיפות ועומק התור. השתמש בכלים דמויי ענן כמו אמזון CloudWatch, Azure Monitor, או Google Cloud Operations. Conforms עבור אנומליות, כגון ספייק פתאומי במסרים DLQ או ירידה בעיבוד באמצעות לוח.
Best Practices for Serverless Data Lakes
עיבוד בלתי אפשרי
מאחר שפלטפורמות ללא שרת עשויות לנסח מחדש את הבקשות, ודאו כי כתיבה לאגם הנתונים היא idempotent. השתמש בתעודות זהות אירוע ייחודיות כדי לדלג על כפיות, או להשתמש בפעולות כתיבה אטומיות (למשל, S3 מצביות).
אופטימיזציה ל- Cold Starts
כאשר משתמשים ב-AWS Lambda, צמצם את החדירה הקרה על ידי:
- בחירת זמן ריצה עם תחילתה מהירה יותר (Node.js, Python) על Java / C#.
- שימוש במטבע מבוזר עבור פונקציות קריטיות.
- שמירה על תלות קטנה ושימוש בשכבות.
השתמש ב-Compression andעמודות
המרת נתוני הזרמת לפארקט או ORC בהקדם מעשי.זה מקטין את עלויות האחסון ומשפר באופן דרמטי את ביצועי השאילתה במנועי SQL ללא שרת.עבור קבצים קטנים, אצווה אותם באמצעות מנגנון ריצוף (למשל, רשומות buffer למשך דקה או 1000 רשומות, ולאחר מכן לכתוב קובץ יחיד).
ניהול Lock-In
בעוד שירותים נורמטיביים בענן הם נוחים, שקול להשתמש במרכיבים קוד פתוח שבו ניתן.לדוגמה, להשתמש ב-Apapapa כאוטובוס האירוע (באמצעות ענן מושפע או עצמי) ולא בשירות קנייני. השתמש באחסון אובייקטים עם ממשקי API תואמים S3 (MinIO) עבור מתקנים היברידיים או רב עננים.זה משמר יכולת עמידה.
אתגרים ושיקולים
אין ארכיטקטורה ללא סחרחורת.האתגרים הבאים נפוצים באגמים נתונים מונעים על ידי השרת ודורשים הפחתה פעילה.
שקיפות והזמנות
במערכות מבוזרות, מונעות אירועים, אירועים מחוץ לסידור ומשלוחים כפולים הם בלתי נמנעים. השתמש בזמן אירוע (זמן אירוע מוטבע בעומס) ולא עיבוד זמן עבור הזמנת אירוע. ליישם שכבת שכפול באמצעות מטמון (למשל, Redis או DynamoDB) שעוקבת לאחרונה תעודות זהות מעובדות.
ניהול עלויות
עלויות ללא שרת יכולות להיות בלתי צפויות כאשר נפח הנתונים עולה באופן בלתי צפוי.קביעת תקציבים וליישם עלות זיהוי אנומלי. השתמש במגבלות מסחר שמורות כדי לכווץ את המקרים המקסימליים של הפונקציה. בחר את שכבת האחסון הזולה ביותר עבור נתונים גולמיים ולהאיץ רק במידת הצורך.
סיכון אבטחה
לפונקציות ללא שרת יש לעתים קרובות הרשאות רחבות לאינטראקציה עם שירותים אחרים.עקוב אחר העיקרון של זכות מינימלית: להעניק רק את הפעולות הספציפיות הדרושות על משאבים ספציפיים. השתמש באישורים זמניים באמצעות תפקידי IAM.עבור נתונים רגישים, השתמש הצפנה וסימון. שקול באמצעות כלי ניהול יציבה ללא שרת כדי לזהות עיוותים.
המונחים: Lock-In
כאמור, התלות בשירותים קנייניים (כמו הודעות אירוע S3, Lambda טריגר, או Event Grid) יכולה להקשות על הגירה. Mitigate על ידי הסרת שכבת עיבוד האירועים מאחורי ממשק (למשל, באמצעות רישום schema של EventBridge) ובאמצעות שימוש בסטנדרטים פתוחים (Cloudevents).
« « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « « «
עבור דרישות בעלות נמוכה (sub-500ms), מתחיל קר יכול להיות בעייתי. פונקציות טרום המלחמה עם pings מתוכנן או שימוש במטבע מבוזר. לחלופין, שירותי מכולה ללא שרת (AWS Fargate, Cloud Run) שיש להם טביעת רגלים קלה יותר מאשר Lambda או פונקציות.
מקרים אמיתיים לשימוש
המונחים: clickstream Analytics
חברת מסחר אלקטרוני אוספת נתונים של משתמשים Clickstream מהאתר שלהם באמצעות AWS Kinesis. Lambda פועל parse ולהעשיר אירועים עם metadata מוצר, ולאחר מכן לכתוב אותם ל-S3 בפורמט Parkt. a נפרדתlessשא שאילתת השרת (Athena) מעצימה לוחות נתונים אינטראקטיביים המציגים כיפי המרה בזמן אמת.הטבע המונעת על ידי האירוע מאפשר להם לזהות ולהגיב לשינויים בהתנהגות המשתמש בתוך שניות.
IoT טלמטורי ותחזוקה חיזוי
חברת ייצור מקבלת קריאות חיישן מאלפי מכונות באמצעות Azure IoT Hub. Events נשלחות ל- Event Hubs, שם Azure Functions filter for anomalies וחנות נתונים גולמיים ב- Blob Storage. An ML Model פועל על Azure ML (מופץ על ידי פונקציה של זמן) צופה כשלים בציוד ושולחת התראות חזרה לקומה של החנות.
גילויים כספיים
חברת פינטק מעבדת אירועים בזמן אמת באמצעות Google Cloud Pub/Sub. Cloud Functions Score כל עסקה באמצעות מודל מומן מראש שהוצב על עסקאות מחוקקות של Vertex AI מחויבת ל- BigQuery לדיווח, בעוד שמומחים חשודים מצופים בסקירה ידנית.אדריכלות המונעת על ידי האירוע מבטיחה כי אין עסקה מתעכבת יותר מכמה מאות מ"ח.
מסקנה
בניית אגמים נתונים מונעים אירוע עם טכנולוגיות ללא שרת מספקת שילוב חזק: ההיקף של אחסון אובייקט בענן ואת האגרה של קידוד מותש אירוע.על ידי אימוץ אדריכלות זו, ארגונים יכולים לחסל עיכובים עיבוד אצווה, להפחית את ניהול תשתיות מעל פני הקרקע, לשלם רק עבור מה שהם משתמשים. as Server פלטפורמות בוגרות, תכונות כמו זמני ביצוע ארוכים יותר, שקיפות קלה יותר, וניהול המדינה טוב יותר הם פערי סגורה עם אפשרויות קבועות מסורתיות.
עם זאת, הצלחה דורשת תכנון זהיר סביב idempotency, עקביות, ניטור ושליטה עלות.דפוסים ושיטות הטובות ביותר המפורטים במאמר זה מספקים בסיס מוצק עבור צוותים המבקשים לחדש את תשתיות הנתונים שלהם.אם אתה הזרמת קלסטרים, מטריקס IoT, או עסקאות פיננסיות, מודל נתונים ללא תחרות השרתים של האגם מציע דרך מוכחת בעתיד להפוך נתונים לתובנות.
(בקריאה נוספת, חקרו את התיעוד הרשמי על FLT:0 בניית אגם נתונים Event-Driven באמצעות AWS Lambda ו- Amazon S3cioFLT:1,FLT:2 Microsoft Event-Driven Data Lake ArchitectureFLT 3, ו-FLT:4 ו-Google Cloud's Data Lake SolutionsFevolver:5