measurement-and-instrumentation
Azure Data Lake Analytics לעיבוד נתונים בקנה מידה גדול
Table of Contents
מה זה Azure Data Lake Analytics?
Azure Data Lake Analytics הוא שירות אנליטיקה מבוסס ענן, מבוזר שנבנה על Apache YARN המאפשר לארגונים לעבד נתונים מסיביים ללא תשתית ניהולית.זה מפשט את המורכבות של הקמת אשכול, דחיסה ותזמון עבודה, ומאפשר מהנדסי נתונים ואנליסטים להתמקד בשאילתות כתיבה ומחיקת תובנות.השירות תומך במודל בתשלום, מה שהופך אותו גם קומפקטי וגם יעיל עבור עומסי נתונים גדולים החל מ- terates.
בניגוד לשיטות מסורתיות על-premises Hadoop, Azure Data Lake Analytics באופן אוטומטי הוראות compute משאבים המבוססים על דרישות עבודה, פועל במקביל על פני נקודות וירטואליות, ומשחרר משאבים כאשר עיבוד משלים.גמישות זו היא בעלת ערך במיוחד עבור ארגונים עם צרכי עיבוד נתונים משתנים, כגון שיאי דיווח עונתיים או שאילתות אנליטיות אד-הוק.
אדריכלות Underlying Architecture
בליבתו, Azure Data Lake Analytics ממינוף Apache YARN לניהול משאבים ותזמון עבודה.כאשר משתמש שולח עבודה, השירות מסמן את השאילתה לתוך גרף ציליקלי מכוון (DAG) של משימות.משימות אלה מופצות על פני מספר רב של צמתים, כל פעולה על חלוקת הנתונים המאוחסנים ב- Azure Data Storage (ADLS).השירות מטפל בסובלנות על ידי הפעלת משימות באופן אוטומטי, אפילו דידיכה יעילה, אפילו חסכונית משימות נכשלות, תוך הבטחת עיבוד חסכוני, אפילו חסכוני, אפילו חסכוני, תוך הבטחת עיבוד לא מבוטל, אפילו חסכוני.
שפת השאילתה העיקרית עבור Azure Data Lake Analytics היא U-SQL, שפה המשלבת את הכוח הברור של SQL עם התגברות של C# U-SQL מאפשרת למפתחים להטמיע קוד C# מותאם אישית עבור שינויים מורכבים, מה שהופך אותו מתאים גם אנליסטים ומהנדסי תוכנה של SQL.בנוסף, השירות תומך Python ו- .NET לפונקציות מוגדרות למשתמש ומפעילים מותאם אישית, המציע גמישות עבור תרחישים עיבוד נתונים מגוונים.
תכונות עיקריות של Azure Data Lake Analytics
סודיות וסקרטיות
Azure Data Lake Analytics מקנה את המשאבים המוערכים או מטה על בסיס עומס העבודה.כל עבודה מוקצה מספר יחידות של FLT:0Analytics Units (AUs) VEFLT:1, המייצג את כוח העיבוד שהוקצה במהלך ביצוע, השירות יכול להוסיף יותר AUs אם העבודה היא I/Obound או להסיר אותם אם עומס העבודה יורד, ביצוע וביצועים ועלויות זה קורה ללא שימוש ידני.
מחיר מודל עלויות
עם Azure Data Lake Analytics, אתה משלם רק עבור הכוח המתואם הנצרכים במהלך ביצוע העבודה, נמדד ב-FLT:0 (Analytics Unit-שעהsssualFLT:1 ).אין עלות גבוהה או עלות תשתית של שומן.מודל מבוסס הצריכה הזה אידיאלי עבור עומסי עבודה ספירודיים, ניתוחי מחקר ופיתוח סביבות.
שילוב עמוק עם Azure Ecosystem
(א) , Azure Data Lake Analytics משלבת את ה-FLT:0.come Database Lake StorageFi StorageFLT:1 for data ingestion and Storage, FLT:2Zonee DatabaseFLT:3 for Treatmental Catalogal Catalog, and (FLT:4e Data Factory for data FactoryFplition andתזמון) , הוא פועל גם עם 6LTFseples for Analytics and Analpends.
תמיכה במספר שפות ושעות ריצה
בעוד U-SQL היא השפה העיקרית, משתמשים יכולים גם לכתוב קוד ב-FLT:0 (PythonFLT:1 ו-FLT:2.NETFLT 3 עבור מצרכי מזון, מעבדים, ופלטים. גמישות זו מאפשרת לצוותים למנף מיומנויות תכנות קיימות וספריות.עבור זרימת עבודה מכונה, משתמשים יכולים לקרוא ל- Azure Machine Learnings ישירות מתסריטים של U-SQL, המאפשרים להבקיע מודלים של תכנות וקודמת.
Enterprise-Grade Security
Azure Data Lake Analytics יורש את תכונות האבטחה של Azure Active Directory, תמיכה בשליטה מבוססת תפקידים (RBAC) ובקרת גישה מבוססת תכונות (ABAC) במנוחה מוצפנת באמצעות Azure Storage Service Encryption, ונתונים במעבר מוגנים על ידי TLS. Jobs ניתן לבקר באמצעות Azure Monitor ו- Analytics, מתן חשיפה מלאה לפעילות גישה ועיבוד נתונים.
כיצד Azure Data Lake Analytics Works
זרימת העבודה הטיפוסית כוללת ארבעה שלבים: אי-שיוט נתונים, יצירת עבודה, ביצוע וצריכה תוצאה.
- (FLT:0 Ingestrated DataFLT:1 לתוך Azure Data Lake Storage (ADLS) באמצעות כלים כמו Azure Data Factory, AzCopy, או Azure Event Hubs. Data יכול להיות בכל פורמט - מובנה למחצה, בנוי למחצה, או ללא מבנה - כגון CSV, JSON, Parkt, Avro, או טקסט.
- (FLT:0)Create avylabFLT:1 באמצעות U-SQL, Python, או .NET. Jobs כתובים כתסריטאים המגדירים מקורות נתונים קלט, שינויים ויעדים פלט.לדוגמה, תסריט U-SQL עשוי לקרוא קבצים יומני מ ADLS, מסנן, ספירות מצטברות, ולכתוב תוצאות למסד נתונים של SQL.
- (FLT:0) ,Submit the JobFLT 1 בשירות Azure Data Lake Analytics.השירות מנתח באופן אוטומטי את התסריט, יוצר תוכנית ביצוע אופטימלית, ומקצה משאבים מותנים (AUs) על פני קבוצה של נודים וירטואליים.
- (FLT:0) לגלות את העבודה של קונסול 1 באופן מקביל מסיבי.כל אחד ממעבד חלוקת הנתונים, ותוצאות ביניים מצטמצם בין צמתים כנדרש.השירות עוקב אחר התקדמות ומבצע מחדש כל משימה לא נכשלה כדי להבטיח השלמת.
- (FLT:0) תוצאות של Retrieve (FLT:1) פעם העבודה מסתיימת. Output ניתן לאחסן בחזרה ל- ADLS, טעון לתוך מסד הנתונים של Azure SQL, או מוצג בלוחות נתונים של Power BI.התהליך כולו הוא סינכרוני, המאפשר למשתמשים לנהל מספר עבודות במקביל.
אופטימיזציה וביצועים
(הופנה מהדף ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
שימוש ב- Azure Data Lake Analytics
מידע אמיתי-Time Data Analytics for IoT
ארגונים הפורסים חיישני IoT מייצרים זרמים עצומים של נתוני טלמטרי. Azure Data Lake Analytics יכולים לזרז ולעבד את הנתונים האלה במשרה מלאה בזמן אמת, כאשר בשילוב עם Azure Event Hubs ו- Stream Analytics.
עיבוד נתונים גדול ל- Machine Learning
מדעני נתונים לעתים קרובות צריכים להפוך נתונים גולמיים, לא מאורגנים לתכונות נקיות לפני דגמי אימון. Azure Data Lake Analytics יכול ליישם ETL מורכב (extract, Turn, לטעון) פעולות על פני קטבים של נתונים, הכנת מאגרי מידע עבור כלים כגון FLT:0 ,00e Machine LearningFLT:1 או FLT:2DatabsLTFalsalsples, לדוגמה, הדמיה רפואית לרשומות כדי להטמיעו כדי להטמיעו את הנתונים המטבול אותם כדי לחיקוי, כדי לקבצי נתונים הקשורים ל-DILDL.
מודיעין עסקי ודיווח
צוותי ה-BI ארגוניים יכולים להפעיל שאילתות אד-הוק על נתונים גדולים ללא טרום-הרשמה או אינדקס. Azure Data Lake Analytics פועל כגשר בין נתונים גולמיים וכלי דיווח כמו Power BI. חברה קמעונאית עשויה לנתח שנים של עסקאות מכירות על פני אלפי חנויות כדי לזהות מגמות עונתיות, לייעל מלאי וחיזוי.
טרנספורמציה וניקוי
איכות נתונים היא אתגר מתמשך. Azure Data Lake Analytics יכול להתאים את שגרות ניקוי הנתונים - הסרת משוכפלות, פורמטים סטנדרטיים, מילוי ערכים חסרים ואימות של מגבלות. עבור שירותים פיננסיים, זה מבטיח תאימות לסטנדרטים של דיווח רגולטורי על ידי הפיכת יומני עסקאות גולמיות לנתוני מידע הניתנים לביקורת, נקי.
ניתוח ואבטחה
מרכזי פעולות אבטחה (SOCs) יכולים להשתמש ב- Azure Data Lake Analytics כדי לעבד ג'יגה-ביאטים של יומני אבטחה מדי יום. ג'ובס יכול לקשור אירועים ממקורות מרובים (מרכז האבטחה האזורי, Azure Sentinel, חומת אש של צד שלישי) כדי לזהות דפוסים חשודים, כגון ניסיונות כוח רוטט או תנועה מאוחרת יותר.
היתרונות של חינוך וסטודנטים
Azure Data Lake Analytics מספק פלטפורמה נגישה להוראה מושגים נתונים גדולים ללא פני השטח של איסוף אתרים.סטודנטים יכולים להירשם עבור Azure for Education מנוי (אשר לעתים קרובות כולל זיכויים חינם) ולהתחיל עיבוד נתונים תוך דקות.מודל העבודה בתשלום פירושו תלמידים בעלות מינימלית אפילו בעת בדיקת שאילתות בקנה מידה גדול.
מחנכים יכולים לעצב משימות שמחקות תרחישים אמיתיים בעולם: ניתוח נתונים מעוכבים טיסה, עיבוד זרמי מדיה חברתית, או בניית צינורות נתונים עבור ערים חכמות.על ידי עבודה עם U-SQL ו- Python, התלמידים מקבלים מיומנויות מעשיות במחשוב מבוזר, אופטימיזציה של שאילתה, ו- Azure Cloud Services.FLT:0 ,אזור Data Lake AnalyticsFLT:1 מציע גם תיעוד מקיף ומדריכים, הורדת המחסום לכניסת כניסה ללומדים וגם ללומדים וגם ללומדים וגם ללומדים וגם ללומדים וגם למדריכים.
שיטות היעילות והאופטימיזציה הטובות ביותר
איסוף מידע עבור מקבילות
כדי להשיג מקבילה מקסימלית, לאחסן נתונים בקבצים קטנים רבים (למשל, 50-200 MB כל אחד) ולא כמה קבצים גדולים. Azure Data Lake Analytics עובד הכי טוב כאשר הוא יכול להקצות משימה אחת להתפלגות קבצים.
שימוש ב-Appropriate Data Format
בחר פורמטים כגון FLT:0 (ParquetphFancy:1 או (FLT:2ORCFLT 3: 3 על פורמטים מוכווני שורות (CSV) עבור עומסי עבודה אנליטיים. פורמטים אלה דחוסים טוב יותר ומאפשרים לדחוף מראש, הפחתת I / O ושיפור ביצועים.
עלויות הפיקוח והתקציב
Set up Azure Cost Management alerts to track AU-hour consumption. For development environments, limit the maximum AUs per job to avoid accidental overspend. Use Azure Policy to enforce tagging and restrict job submission to authorized users only.
Leverage Built-In Functions and Libraries
U-SQL כולל מגוון רחב של פונקציות בנויות למניפולציה, טיפול תאריך וניתוח סטטיסטי.לפני כתיבת קוד C# מותאם אישית, סקירה על פונקציות הזמינות - הם לעתים קרובות מספיקים וממוטבים מאוד. עבור תרחישים מתקדמים, ה-FLT:0: Microsoft.AnalyticsFLT:1 ), שם מסגרת שם מספק ספריות נוספות לעיבוד מכונות וגאופטי.
יישום מדיניות לכישלונות טרנספורמטיביים
(ב) כאשר קוראים שירותים חיצוניים (למשל, Azure SQL Database, Cosmos DB) מתוך U-SQL, הוסיפו לוגיקה חוזרת כדי להתמודד עם סדקים או גליונות רשת.TheFLT:0REATEFLT:1 ו-FLT:2MAXREIESveFLT 3FLT אפשרויות בהגדרה חיצונית של מקור הנתונים יכול לשפר את האמינות.
הגבלות ואלטרנטיבה
בעוד Azure Data Lake Analytics הוא חזק, ייתכן שלא יתאימו לכל תרחיש, הוא מיועד ל-FLT:0batch ProcessingFLT:1 - לא סטרימינג בזמן אמת.עבור לנטיות תת-שניות, לשקול FLT:2e StreameursFLT 3 או FLT:4 פונקציות האזור:5 עם גורמים מונעים, בנוסף שירות מקסימלי של 250 ימים (אשר יכול להיות יותר ויותר מוגבל)
(הופנה מהדף Azure) כולל את ה- Azure:0 (אזורי:0) DatabricksFLT ( 1:1 for Interactive Spark-based analytics, FLT:2אזור סיינטפסה ללא הגבלה של SQLFLT 3 עבור שאילתות SQL-on-the-data-lake, ו-FLT:4InsightFLT:5 for Custom Hadoop או אשכולs Azure, GoogleFLTs.
מתחילים עם Azure Data Lake Analytics
כדי להתחיל, ליצור חשבון Azure Data Lake Analytics דרך פורטל Azure. Associate It with a Azure Data Lake account (Gen1 or Gen2) ולהגדיר מסד נתונים של Azure SQL עבור הקטלוג. InstallFLT:0Data Lake Tools for Visual Studio 10LT:1 או השתמש בעורך של Azure Portal. Upload data – כגון Open-of Taxi Taxi או ב- CSV שלך - ו-US Write a SimpleSQL:
(ב) .
הגישו את העבודה ומפקחים על ההתקדמות שלה.עיין בגרף העבודה בפורטל כדי להבין כיצד המשימות היו מבוזרות.ניסוי עם נתונים גדולים יותר ושינויים מורכבים יותר כדי לחקור את מלוא הפוטנציאל של השירות.
מסקנה
Azure Data Lake Analytics נותרה בחירה חזקה לארגונים הזקוקים לעיבוד נתונים גדול ללא שרת, ללא תשתית ניהולית.שילוב עמוק עם מערכת האקולוגית של Azure, תמיכה בשפות מרובות, ומדפיות אוטומטיות הופכות אותו למגוון רחב של מקרים של שימוש - מ-IoT אנליטיקה ועד למידת ההכנה של נתונים.עבור מחנכים וסטודנטים, היא מציעה סביבת ארגז חול ללמידה של עקרונות מחשוב מבוזרים.