הבנת אדריכלות Lakehouse

ההפרדה המסורתית בין אגמים נתונים ומחסני נתונים אילצו ארגונים לתוך עסקאות קשות.אגמים נתונים הציעו אחסון זול וגמיש עבור נתונים גולמיים אך חסר ערבויות עסקה, schema אכיפה, ובקרת איכות נתונים.מחסני נתונים בתנאי ניתוח SQL עם תאימות ACID אבל הטלת schemas קשיחה ועלויות גבוהות לאחסון נתונים למחצה או לא מבנים.

בליבתו, Lakehouse משתמש עותק אחד של נתונים - בדרך כלל מאוחסנים במערכת קבצים פתוחה-פורמטית כמו Apache Parkt או Apache ORC על אחסון אובייקט בענן - ושכבות על metadata, indexing, caching, ומנגנונים העסקה.זה מאפשר גישה ישירה עבור שני כלי BI מסורתיים ומסגרות ניתוח מתקדמות (Spark, Presto, TensorFlow).

ראשי תיבות של Key Architectural Pillars

  • (FLT:0)Object Storage as the Foundation: ההרחבה של Cloud Store (Amazon S3, Azure Blob Storage, Google Cloud Storage) מספקת כמעט בלתי מוגבלת, עמידות גבוהה (99.999999999999999999% עבור S3), ותמחור שימוש בתשלום.כל הנתונים - זרמי גלם, תוצאות ביניים, טבלאות מחוספסות - חיים בהיררכיה חדירת אחסון אחת.
  • (FLT:0) פורמטי שולחן פתוחים: FLT:1 Technologies כמו FPLT:2Delta LakeFLT 3, Apache Iceberg, ו- Apache Hudi להוסיף עסקאות ACID, צילומי נסיעה בזמן, schema Evolution, ו- Upserts יעילים על גבי שטח אחסון.
  • (FLT:0) קטלוג מבוזר ו-Governance:veof:1 ; A קטלוג metadata מרכזי (למשל, קטלוג AWSe, Apache Hive Metahouse, או Databricks Unity Catalog) עוקב אחר schemas, מחיצות, מדיניות גישה ושורה נתונים.קטלוג זה הוא המקור היחיד לאמת עבור מהנדסים ואנליסטים.
  • (FLT:0)Multi-Engine Access:Figal1) אותו נתונים מאוחסנים בבית האגם ניתן לקשור באמצעות מנועי SQL (אמזון אתנה, Presto/Trino, Snowflake), DataFrame APIs (Apache Spark, Pandas), או מחברות אינטראקטיביות. Serverless compute שכבות מאפשרות ניתוח רב-מודולאלי אמיתי ללא אספקת זמן מראש.

מקור: Serverless Technologies

מחשוב ללא שרת מפשט את ניהול השרת, תכנון היכולת, ומבצעי יתר על המידה.כאשר החלים על מאגר נתונים, טכנולוגיות ללא שרת מאפשרות לצוותים להתמקד בלוגיקה נתונים ולא בתשתיות.כל רכיב – אחסון, גירוד, גידור ושאילתה – ניתן לנהל באופן מלא על ידי ספק הענן, החלפה אוטומטית לאפס כאשר idle ומדפיכות מיידי כדי לטפל בספי עומס זה מתאים במיוחד עבור שאילתות נתונים אנליטיות, , שאילתות נתונים , צינורות.

אחסון ללא תשלום Serverless Storage

שירותי אחסון אובייקטים כמו אמזון S3, Google Cloud Storage ו- Azure Blob Storage הם חסרי שרת באופן מוחלט.אין שרתים לספק, אין גבולות לדאגות (במגבלות סבירות של חשבון רך), וחיוב מבוסס רק על נתונים מאוחסנים ותפעול שבוצעו.חנויות אובייקטים מודרניות גם תמיכה בתכונות כגון עניבה חכמה (העברה באופן בלתי צפוי נתונים גישה לקור, חומרי גלם) ואובייקטיביים עבור כל שכבות אחסון חד-גופיות (G)

המונחים: Compute

שירותים ללא תשלום כגון AWS Lambda, פונקציות ענן של Google ו- Azure פונקציות מאפשרות עיבוד נתונים מונע אירועים עם תצורה מינימלית.פונקציות אלה יכולות להיות מופעלות על ידי העלאת קבצים חדשה לאחסון (למשל, אירוע S3 PUT), עבודות המבוססות על לוח זמנים, או הודעות מתור. עבור שינויים קלים - schתקפים, המרת נתונים, העשרה באמצעות ממשקי API חיצוניים - הם פונקציות גבוהות יותר עבור שרת ללא תשלום באופן אוטומטי, או פונקציות הפעלה של Microsoft יכולות להיות יעילות (S) באופן אוטומטי, אך ורק לאחר מכן, אך ורק לאחר מכן, אם כי יש לבצע פעולות יעילות של Microsoft מנוהלות הפעלה ללא הגבלת זמן הפעלה (AWS).

Serverless Spark (למשל, AWS Glue Serverless Spark, Google Dataproc Serverless, Azure Synapse Spark) מסיר את הצורך לנהל אשכולות Spark.You להגיש חבילות או הזרמת משרות, ואת הספק הוראות דינמיות וקשקשים של משאבים מותחים המבוססים על עומס העבודה.זה אידיאלי עבור השלבים המרה הכבדה בצנרת Lakehouse, כגון dedu,plications, תוספות ומדורגים על נתונים גדולים.

תגית: Serverless Data Orchestration

הצגת צינור נתונים רב-שלבי - הרחיק ממקור, אימות, שינוי, איכות לבדוק, עומס לאזורים מחוסנים - לעתים קרובות דורש מכונות ממשלתיות עם סניף, פיגורות וטיפול שגיאות.שירותי זרימת עבודה ללא תשלום כמו AWS Step Functions, Google Cloud Workflows, ו- Azure Logic Apps לספק דרך ברורה לתאם פונקציות, מכולות, ו- API ללא ניהול כל תשתית תזמורתית הם משלבים עם מעקב והופכים לכשלים פשוטים, והופכים לכשלים.

מנועים ללא תשלום

מנועי SQL Serverless כגון אמזון אתנה, Google BigQuery (על פי דרישה tier), ו- Azure Synapse Serverless מאפשרים לאנליסטים להפעיל את SQL ישירות נגד נתונים מאוחסנים באחסון אובייקטים, משלמים רק על מנת לסרוק את השאילתה.מנועי אלה מטפלים באופן אוטומטי מקבילה, חיבור בריכות, וכתוצאה מכך הדבקה. כאשר הם תואמים פורמטים פתוחים שולחן, הם תומכים ב- ACID קורא (read-commit בידוד) ו-pruning, המאפשרים אינטראקטיביים, המאפשרים על ידי טפטוף בלגן בלגן אינטראקטיביים, אפילו על פני אגם עם משטחים.

יישום: Serverless Data Lakehouse

בניית בית אגם ללא שרת ברמת הייצור כוללת מבחר זהיר של שירותים ודבקות בפרקטיקה הטובה ביותר סביב ארגון נתונים, אבטחה וביצועים.צעדים הבאים מתווה דפוס יישום טיפוסי.

עיצוב שכבת האחסון

צור דלי אחסון בענן או מיכל עם מבנה תיקיה שמפריד בין צמת שומן, נתונים ממריצים, ומבנה metadata פנימי.

  • (FLT:0) – נתונים מחוסנים כ-CSV, JSON, Avro) מחולקים על ידי מקור וזמני צבירת.
  • (ב) [ב]: אזור נחיתה זמני לכישלונות או עיבוד שכפול.
  • (FLT:2) - ניקוי, מועשר וטבלאות מטובישות מאוחסנים ב-Parkt עם אגם דלתא או מדננים של Iceberg.
  • (ב) ,(FLT 3: 3) - תצוגות מצטברות וצילומים ממוחזרים לדיווח.

גרסה אמינה להגנה על נתונים, קביעת מדיניות מחזור חיים כדי לפוג גרסאות שאינן קיימות לאחר תקופת שימור, וליישם הצפנה לצד השרת עם מפתחות מאומתים של לקוחות (KMS) לציות.

מידע על Serverless Pipelines

השתמש אדריכלות מונחה אירוע כדי לעורר עיבוד ברגע שהמידע מגיע.לדוגמה, להגדיר הודעה S3 אשר מפעילה פונקציה Lambda עבור אימות קבצים (בדיקה של צ'מה, גודל הקובץ, ספירת שורות) הפונקציה ולאחר מכן מציב הודעה תור SQS עבור טרנספורמציה במורד הזרם.עבור זרמי עבודה גבוהים (IoT, חיישניים), השתמש אמזון Kinesis Data Firehose (לא פחות) כדי לספק נתונים בודדים של ספירת שטח אחסון של Microsoft.

3. Transform and Load with Medallion Architecture

[הפסקה] טבלאות זהב באמצעות Sparkless.The ברונזה שומרת את הנתונים הגולמיים עם שינוי מינימלי.שכבת Silver חלה על deduplication, הקלדה, ונתוני ההתייחסות מצטרפים.שכבת הזהב בונה אגרגציות ברמה עסקית, קוביות, וממדי Silver-schema המתאימים לבדיקות מקודדות.כל אחת מהן כותבת חזרה לאחסון באמצעות ה-FLT:0Del Laketa LakeFLT1, ומאפשרת פונקציות יעילות ו-Fireatives:

4.קטלוג ו-Govern

רשום את כל הטבלאות המחוספסות בחנות מטבול מאוחדת.עם AWS, השתמש בקטלוג הנתונים של Glue כדי לאחסן schemas שולחן, מחלקות מיקומים, וכן מידע serde.צר המצורף AWS Lake Formation כדי לגשת לחיוב ב-Singe Data Catalog או ברמת העמודה.עבור קטלוג קוד פתוח, פריסת פלטפורמת Hive Metahouse כאלטרנטיבה של AWSe Data Cataloge או להשתמש ב-Databs Unity.

המונחים: Enable Serverless Queries

Conform אמזון Athena לשאול את טבלאות שכבת הזהב באמצעות קטלוג גלול.עבור שאילתות גבוהות יותר ושאילתות מהירות יותר על עומסי עבודה אינטראקטיביים, לאפשר את Athena מנוע גירסה 3 ולהשתמש קבוצות עבודה עם מגבלות עלות לכל קווירי.עבור צוותי למידת מכונה, לחשוף את שולחנות Silver ו- Gold ישירות באמצעות מחשבי ספארקס על EMR Serverless או Databricksless Server. for real-Times, להתחבר ל-Timesight אמזון Quicker (באמצעות לוח זמנים אוטומטיים) ו-Directer) באמצעות לוח זמנים ידני (לוח זמנים ללא תשלום ידני).

יתרונות של Lakehouses ללא תשלום

השילוב של אדריכלות האגם וטכנולוגיות ללא השרת מספק הטבות תפעוליות וכלכליות נפרדות.

עלויות יעילות

מחסני נתונים מסורתיים גובים לכל צומת לשעה ללא קשר לפעילות עומס העבודה.חשבונות בית האגם ללא שרת עבור ג'יגה-ביוטה סריקות (Athena) או לכל DPU-II (Glue Spark) זה אידיאלי עבור תבניות השאילתה משתנה: לשלם רק כאשר אנליסטים להפעיל דוחות או מהנדסים לרוץ צינורות.Idletime עולה $ 1 $ עבור מיצוי נתונים של ML, שרת ללא ספק יכול לספין יכול לנפח מאות משימות סגורות ומיד לאחר השלמת פסולת.

שירותים ללא שרת להתמודד עם קנה מידה באופן אוטומטי. דלי אחסון יחיד יכול לזרז את terabytes במשך שעה ללא מתן הוראה.אתנה יכולה להפעיל אלפי שאילתות במקביל ללא תכנון יכולת.

המונחים: Operational Overhead

ללא שרתים לתיקון, אין אשכולות כדי לשנות את גודלם, ואין אחסון למתן, צוותי נתונים יכולים להקדיש יותר זמן למודל נתונים, בדיקות איכות וניתוח מתקדם.ספק הענן מטפל בסובלנות, שכפול ועדכוני אבטחה.זה חשוב במיוחד עבור קבוצות קטנות או ארגונים עם משאבי DevOps מוגבלים.

גישה לנתונים בלתי מזוהים

ניתן לגשת ל-ETL יחיד של Lakehouse על ידי אנליסטים של SQL, מדעני נתונים המשתמשים ב- Python/Pandas, ו- Spark-based ETL משרות.אין תנועה של נתונים או שכפול העתקה.איחוד זה מבטל את הגמישות וחוסר עקביות של מורדים נתונים נפרדים ומפחית את העלות הכוללת של ניהול נתונים.

אתגרים ושיקולים

למרות היתרונות, אימוץ בית אגם ללא שרת דורש תשומת לב למספר תחומים שיכולים להשפיע על אמינות, אבטחה ועלות.

אבטחת מידע וביטוח

אחסון אובייקטים הוא רב-עוצמה; מדיניות דלי לא נכונה יכולה להוביל לחשיפה של נתונים. ליישם לפחות תפקידים IAM עבור כל שירות ללא שרת. השתמש במדיניות דלי כי להכחיש גישה אלא אם כן שימוש במקור ספציפי VPC Endpoint הוא בשימוש. אירועים נתונים ענן-טרידיים עבור ביקורת גישה נתונים.עבור תעשיות מוסדרות (HIPAA, PCI-DSS), להבטיח את ההצפנה של החנות תומכת במנוחה עם HSM-Resback ו-Res, כדי לעמוד בדרישות שמירה משפטיות.

המונחים: Lock-in

כל שירותי השרת של ספק ענן הם קנייניים: Lambda vs. Cloud Functions vs. Azure Functions, Glue vs. Dataproc, Athena vs. BigQuery. Writing Code, אשר תלוי במידה רבה בגורמים של ספק אחד, פורמטים, או API יכולים להפוך את ההגירה ליקרה. Mitigate זה באמצעות פורמטים פתוחים (Delta or Iceberg) שפועלים על פני עננים, ופריד בין תשתיות עסקיות מחייבות באמצעות תקע (dams) עם לוגיות מופשטות) באמצעות לוגיות (Delta) או צינורות מורכבים (Delta) עם לוגיות מופשטים עם לוגיות).

עקבו אחרי Tuning

ללא ספק מופשט את התשתית הבסיסית, אבל זה מופשט יכול להסתיר צווארי בקבוק ביצועים.ללא חשיפה לתוכן משאבים אשכול, שאילתות בכתב גרועה או משרות ETL יכול לרוץ לאט יותר מאשר צפוי.שימוש בכלים observability המסופקים על ידי ספק (AWS CloudWatch metrics, Athenaשאת ביצוע, Glue Workmetrics) כדי לזהות נתונים, חלוקת נתונים, הפצה ב-effencies, 128 $, כדי להבטיח טבלאות גבוהות יותר ו-S.

ניהול עלויות

תמחור ללא שרת יכול להפתיע צוותים אם שאילתות לסרוק כמויות גדולות של נתונים שוב ושוב.ללא עלות שולטת, שאילתות בורחות יכולות לצרף חשבונות.יישם את הגבולות התקציביים של Athena Workgroups, להגדיר את גבולות זמן העבודה של Glue, ולקבוע עלות עלות התראות חריגות. השתמש בחלוקת, פורמטים קבצים (Parquet/ORC), ו- דחיסה בעמודה כדי למזער נתונים ממוסכלילים.

מגמות עתידיות

המערכת האקולוגית של Lakehouse ממשיכה להתפתח במהירות.שלוש מגמות בולטות:

אינטגרציה מלאכותית / ML

Lakehouses הופכים לפלטפורמה העיקרית ללמידה מכונה, אחסון טבלאות תכונה, עריכת נתונים ורישום מודל.שירותי ML ללא מרשם כמו אמזון סייג'ר ללא תנאי או Azure ML Serverless Endpoints מאפשרים תחזיות בזמן אמת ישירות מהנתונים של Lakehouse. מצפה שילוב עמוק יותר בין קטלוגים של Lakehouse וכלי מעקב של ML, ומאפשר למדענים למצוא ולנצלים מחדש ללא העתקה של נתונים.

זמן אמיתי

שירותי הזרמת שתן ללא שרת כגון AWS Lambda עם Kinesis Data Streams, Google Cloud Pub/Sub עם פונקציות ענן, ו- Azure Stream Analytics מאפשרים לעסקים ל- ingest ולצטרף לאירועים עם שולחנות בית האגם ההיסטורי בזמן הקרוב.ההפרדה של compute ו- Storage פירושה צינורות הזרמת שתן יכולה להגיע להיקף של מיליוני אירועים בשנייה בעוד שולחנות קיימים נשארים זמינים לניתוח היסטורי.

Multi-Cloud ואדריכלות היברידית

פורמטים פתוחים של שולחן ושירותים קטלוג בענן (למשל, Apache Iceberg עם ניסי) להפוך אותו אפשרי להפעיל את עבודות האגם ברחבי AWS, GCP, ו- Azure בו זמנית.שכבות ללא תשלום של Server מופשטות ספק הענן הבסיסי, ומאפשרות לנתונים להישאר בחנות אחת בסיסית תוך כדי עיבוד על ידי זמני ריצה ללא שרת באזור אחר או ספק זה להפחית את הסיכון של כישלונות ומאפשר נתונים.

ארגונים אשר מאמצים אדריכלות ללא שרת של Lakehouse כיום הם בעלי יכולת להתמודד עם צמיחה של נפח נתונים עתידיים ומורכבות אנליטית ללא תשתית קבועה reengineering.ההתכנסות של אחסון אובייקטים בעלות נמוכה, פורמטים פתוחים, ו- compute מנוהל במלואו מציעה נתיב לפלטפורמת נתונים גמישה באמת.