measurement-and-instrumentation
Azure Analytics עבור Big Data ו-Data Warehousing
Table of Contents
עליית פלטפורמות Analytics בלתי ified
ארגונים מודרניים מייצרים כמויות עצומות של נתונים ממערכות עסקה, מכשירים IoT, מדיה חברתית ויישומים תפעוליים.מחסני נתונים מסורתיים נאבקים לטפל במגוון ומהירות של מידע זה, בעוד שבלעדיות נתונים גדולים יוצרים פערים ואתגרי ממשל. Azure Synapse Analytics מטפלות בפיצות זו על ידי מתן שירות ניתוח אחיד שמביא יחד עיבוד נתונים גדול ועידוד נתונים תחת שכבת ניהול אחת.
אפשרויות ל- Azure Synapse Analytics
Azure Synapse מיועד שירות ניתוחי ללא הגבלת גבולות שמפריד בין אחסון, המאפשר דרוג עצמאי של משאבים.זה משלב מנועי נתונים גדולים כמו ספאק עם מלחמת נתונים ארגונית באמצעות בריכות SQL ייעודיות ללא שרת SQL. התכנסות זו פירושה מהנדסים ואנליסטים יכולים לעבוד באותה סביבה באמצעות שפות כמו T-SQL, Python, ו- NET הפלטפורמה כוללת גם אינטגרציה של נתונים זעירים ו-BISlindowsindows (מחדש) עם תובנות עמוקות של Azure).
עיבוד נתונים גדול עם Apache Spark
Azure Synapse מספק בריכות ספארי ספארי צ'אפ שניתן להעביר תוך שניות.ריכות אלה לתמוך בשינויים בקנה מידה גדול של נתונים, ניתוח הזרמת ואימון מודל למידת מכונה. מהנדסי נתונים יכולים לכתוב PySpark או Scala בתוך סביבת העבודה של Synapse Studio, תוך מתן מינוף ספריות מוכרות של Spark for ETL משרות.הה הדוקה עם Azure Data Storage Gen2 מאפשר גישה לנתונים ללא העברה, צמצום של עיבוד נתונים והתאמה אישית, וקידום מידע זה יהיה מגביל את התקני עיבוד מאובטח.
אספקת מידע ייעודית עם קובצי SQL ייעודיים
עבור נתונים מובנים וניתוח ביצועים גבוהים, Azure Synapse מציעה בריכות SQL ייעודיות (לשעבר SQL Storage) בריכות אלה להשתמש אדריכלות מקבילה מסיבית עיבוד (MPP) להפיץ ביצוע שאילתה על פני מספר רב של צמתים, המאפשרת תגובות חתרנות תת שנייה על terabytes של נתונים.You יכול לבחור בין compute-opified ו-Data-timized tirsed, ו-Break/ume את הבריכה כדי לשלוט על עלויות מסד הנתונים הקיים עם ממשק SQL הוא באופן מלא.
SQL for On-Demand Queries
מעבר לריכות ייעודיות, Azure Synapse כולל נקודת קצה ללא שרת שמאפשרת לך לשאול נתונים ישירות מקבצים ב- Azure Data Lake או Blob Storage באמצעות תקן T-SQL.אין צורך במתן או לנהל שרתים; אתה מחויב רק עבור כמות הנתונים סריקות.זה אידיאלי לניתוח אדן-hoc, חיפוש נתונים, וטרנספורמציה של נתונים גולמיים באגם ללא העברתו לשרת גמיש, כמו JVt, תומך גם בקבצי נתונים, כמו אחסון למחצה, כגון קובץ נתונים, אחסון, אחסון, אחסון, עיבוד נתונים, עיבוד נתונים, עיבוד נתונים גמישים, ו-JVD.
תכונות מפתח בפירוט
המאמר המקורי מציג כמה תכונות ברמה גבוהה.למטה, כל אחד הורחב עם השלכות מעשיות ופרטיות טכניים.
Unified Platform
Azure Synapse מספק סביבת עבודה אחת הנקראת Synapse Studio, המשלבת את הדחיסות של נתונים, מחקר, טרנספורמציה, שאילתה, הדמיה וניהול.בניגוד לדורות קודמים שבהם אתה צריך כלים נפרדים עבור ETL, אבטחת מידע, עיבוד נתונים גדול, Synapse Studio מציעה גם קוד-קוד ראשון ונמוך ממשקים.
סקלאה
סלינג ב Azure Synapse מתרחשת ברמות מרובות. עבור בריכות SQL ייעודיות, אתה יכול להגדיל את המשאבים compute עד למטה בתוך דקות דרך פורטל Azure, T-SQL, או PDF, להסתגל לשינויים דרישות עומס עבודה.אדריכלות נפרדת compute מאחסון, כך שדרגות לא דורשות תנועה נתונים. עבור ספארקס, אתה יכול להגדיר את מספר של נוודים ללא גודל, ותצורה של מיקום על בסיס קבוע, ותצורה זו באופן אוטומטי.
אינטגרציה נתונים
Azure Synapse כולל Synapse Pipelines, שירות מבוסס ענן ETL /ELT הנגזר מ- Azure Data Factory. עם מעל 100 מחברים מובנה, אתה יכול להזיז נתונים ממאגרי נתונים על-ידי מאגרי מידע, יישומי SaaS (SAPforce, Dynamics 365), שירותים (Blob, Data Lakes DB), ומקורות ענן של צד שלישי (Amazon S3, Google BigQu) יכולים תמיד להפעיל את אותם אירועים של תכנות נתונים, אשר ניתן להפעיל את המשתנים, כולל תחליפים, כגון:
Advanced Analytics
שילוב Native עם (FLT:0)אזור Machine LearningFLT:1 מאפשר לך להכשיר, לפרוס, וניהול מודלים ישירות מ-Synapse Studio.You יכול להשתמש במחברות Synapse כדי לחקור נתונים ולבנות מודלים באמצעות Python או R, ולאחר מכן לרשום את המודל הטוב ביותר ב-ML Workspace ולפרוס אותו כנקודת קצה.
אבטחה וממשל
אבטחה ב- Azure Synapse הוא שכבתי ו- ארגונית נתונים מוצפנים במנוחה באמצעות Azure Storage Service הצפנה ובמעבר באמצעות אינטגרציית Active Directory מאפשרת שליטה חד-על-על-על-ידי כניסה מבוססת-על (RBAC) ב- Azure Storage Service הצפנה, מסד הנתונים ורמות הנתונים של Azure.com.com-line ברמת האבטחה ואבטחת ה-Squarepe-S מאפשרת מסיכה נתונים ל-D רגישה ל-ACTC.
אדריכלות עמוקה
הבנת הארכיטקטורה של Azure Synapse מסייעת בקידוד ביצועים ועלויות.השירות בנוי על שכבה מבוזרת של compute המתקשרת עם שכבת אחסון מתמשכת (אזור אחסון נתונים אגם אחסון Gen2 או Blob Storage) במאגרי SQL ייעודיים, הנתונים מחולקים על פני 60 התפלגות באמצעות חידה, עגול-רובין, או אסטרטגיית שכפול של שליטה מקבל שאילתות T-SQL, מאגד אותם, ומייצרת תוכניות לביצועים ללא כל שנייה של MPa.
עבור ספארקס עבודה, הארכיטקטורה דומה: המאסטר Spark פועל על צומת הבקרה, ואת נקודות עבודה תואמים צומת tdes. נתונים קורא ישירות משכבת האחסון, ממינוף טרמפטה לאחור ו caching כדי להאיץ את הביצועים.הפסק דין חסר השרת משתמש חנות metadata משותף ונספח שאילתות על-fly על ידי סריקה מקבילים בכל שלושת מנועי שיתוף פעולה (דכאי לחץ נתונים) עם אבטחה רב-אזור מאפשר גישה נתונים ו-ידי אבטחה חד-צדדית (ד) עם מדיניות אבטחה חד-צדדית (D) עם אבטחה חד-צדדית) עם אבטחה חד-צדדית עם אבטחה חד-צדדית (DNS) עם אבטחה חד-צדדית של אבטחה (Dacktexpertconsopertexit Storage) עם , ללא גישה נתונים, ללא , עם אבטחה חד-צדדית) עם , ללא גישה נתונים מרובים-צדדית של נתונים ו-צדדית של נתונים, ללא גישה נתונים, ללא .
שימוש במקרים שמפגינים את הערך
Azure Synapse הוא פרוס על פני תעשיות עבור מגוון רחב של תרחישים:
- (FLT:0Log Analysis: ElementFLT:1) חברה קמעונאית ששוקלת מיליארדי אירועים של Clickstream מפלטפורמת המסחר האלקטרוני שלה ל- Azure Data Lake. Using Synapse Sparks, הם נקיים ומצטברים את הנתונים בשעה. Serverless מאפשר לאנליסטים שלהם לשאילת דפוסי התנהגות של משתמשים בזמן אמת ללא מתן compute, בעוד מאגרים ייעודיים יומיים עבור קבוצות שיווק.
- חברת ייצור A אוספת נתוני חיישן ממכשירי מפעל.Sapse Pipelines מזרימה את הנתונים לתוך מושב ספארי שבו פועלת מודל זיהוי אנומליות.התפוקה מאוחסנת בבריכה ייעודית של SQL המשמשת דוחות Power BI, אשר מזהירים את צוותי תחזוקה כאשר ציוד מראה סימנים של כשל.
- חברת שירותים פיננסיים מתמזגת נתוני CRM, רשומות עסקאות וניתוח אינטרנט למודל נתונים יחיד. Azure Synapse’s Pools מאפשר להצטרףות מורכבות ואגורגות על פני מיליארדי שורות, בעוד ללא שרת SQL מאפשר למדענים לחקור מקורות נתונים חדשים במהירות.
- (FLT:0) בזמן אמת Analytics: FLT:1 ספק פתרון IoT משתמש ב- Azure Synapse עם Azure Stream Analytics עבור הזרמת זמן אמת. data זורם ממכשירים לתוך מרכז אירועים, ולאחר מכן הוא הופך ב- Sparkסטרימינג, ונכתב לתוך מאגר ייעודי של SQL שבו לוח נתונים Power BI מראה מדדים חיים עם שקיפות תת-שנית.
טכניקות אופטימיזציה
כדי להפיק את המרב מ- Azure Synapse, יש לשקול את השיטות הטובות ביותר:
- (FLT:0Distribution Choices:FLT:1eur for ייעודי SQL Pools, בחר התפלגות hash על עמודה עם קרדינליות גבוהה (למשל, מזהה לקוחות) כדי לאזן עומסי נתונים על פני הפצה. השתמש בסבב כדי לטבלאות ממריצים ומשכפל שולחנות עבור טבלאות ממד קטנות כדי להימנע מתנועה.
- (FLT:0) Indexing and Partitioning:FreaLT:1) השתמש באינדקסים מעמודות מקובצי עמודה מקובצים של שולחנות גדולים כדי להשיג דחיסה גבוהה וביצועי סריקה מהירים יותר.
- (FLT:0) Result Set Caching:FLT1 תוצאה אפשרית להגדיר צ'ינג בבריכה ייעודית של SQL כדי להשתמש בתוצאות השאילתה עבור שאילתות הפעלה לעתים קרובות, צמצום השימוש המכוון ושיפור זמני התגובה.
- (FLT:0) ניהול עומס: 1FLT) השתמש בסיווג עומס עבודה וחשיבות כדי לתעד שאילתות קריטיות.בלות SQL ייעודיות לתמוך בקבוצות עומס עבודה שמקצות זיכרון וחריצים מטבעיים, מונעות שאילתות מפלט מהשפעה על ETL או ביצועי לוח המחוונים.
- (FLT:0Data Skew Mitigation:FLT:1 שתף עמודות מפתח עבור סקייוונים באמצעות מערכת DMVs. אם הפצה אחת מחזיקה בנתונים לא פרופורציונליים יותר, ביצועים טבלאות. ReBuild with a different Distribution key or use ב-Fre-robin staging לפני העברת נתונים לתוך שולחן מבוזר.
שילוב עם Azure Ecosystem
Azure Synapse אינו פועל בבידוד.זה משלבת עמוקות עם שירותים אחרים של Azure כדי ליצור פלטפורמה מקיפה של נתונים:
- (FLT:0Zonee Data Lake Storage Gen2:FearLT:1) האחסון העיקרי של Synapse, מתן שם היררכי ו-POSIX הרשאות. נתונים באגם ניתן לקשור על ידי Spark, Serverless SQL, או בריכות SQL ייעודיות ללא העתקה.
- (FLT:0Zonee Data Factory:FLT:1 ,Synapse Pipelines נבנות על מפעל נתונים, כך שתוכל גם להשתמש בשירות מפעל נתונים עומד עבור תעבורת נתונים היברידית.
- (FLT:0)Power BI:BuildFLT:1) , DirectQuery ו-ייבוא חיבורים במצב תמיכה.You יכול גם להשתמש ב- Power BI Datasets כדי לבנות מודלים מורכבים המשלבים נתונים סינפסים עם מקורות אחרים.
- (FLT:0Zonee Purviewmia: 1) עבור ניהול נתונים, Purview סריקות Synapse Workspaces כדי למפות קטלוג נתונים, מעקב אחר קואז', ואכיפת מדיניות סיווג נתונים.בעלים נתונים יכולים להגדיר תוויות רגישות שזורם לתוך Power BI וכלים אחרים לצרוך.
- (FLT:0Zonee DevOps ו- GitHub:BuildFLT:1 , Synapse Studio תומך באינטגרציה בקרת מקור באמצעות repositories, המאפשרת CI/CD עבור צינורות, מחברים ותסריטים של SQL.זה קריטי עבור קבוצות ארגוניות הדורשות בקרת גרסאות ופריסות אוטומטיות.
עלויות ניהול ומודלים
Azure Synapse מציע כמה רכיבי תמחור שניתן לייעל:
- (FLT:0) ,DWU (יחידת אחסון נתונים) עבור נספח compute.You יכול לעצור את הבריכה כאשר לא בשימוש כדי לעצור את ההאשמות, ולהעלות / באופן דינמי.
- (FLT:0) תבניות ללא תשלום: SQL:FLT:1 Pay per TB של נתונים מעובדים.אם יש לך דפוסים בלתי צפויים או ad-hoc שאילתה, השרת הוא יותר כלכלי מאשר בריכה ייעודית.
- (FLT:0)Apache Spark Pool:FLT:1hil לשלם עבור שעות פנויות של compre-שעה של compute.You יכול לבחור cal-scaling ולהגדיר מינימום / מקסימום בלוטות.
- (FLT:0Synapse Pipelines:FLT:1 בילד מבוסס על מספר פעילות רץ ושילוב שעות ריצה. Orchestration על נתונים גדולים ניתן לייעל באמצעות זרימת נתונים רק כאשר יש צורך.
- (FLT:0) אחסון נתונים: ההרחבה 1 של Azure Data Lake גובהו דמי אחסון נפרדים (per GB/חודש) באמצעות שכבת אחסון מגניבה או ארכאונית עבור נתונים היסטוריים יכולה להפחית עלויות, אך להבטיח כי היא נגישה במידת הצורך.
מתחילים עם Azure Synapse
שיגור עומס העבודה האנליטי הראשון שלך כרוך כמה שלבים.התחל על ידי מתן סביבת עבודה של Azure Synapse Analytics מ- Azure Portal.You יכול לבחור אזור, אחסון האגם, הגדרות בריכה של SQL. ברגע שמרחב העבודה מוכן, פתח את Synapse Studio כדי להתחיל לבנות. השתמש בגלריית הדרכות המשולבת כדי ללמוד על ידי דוגמה: עומס נתונים, הפעלת מחברת Spark, ליצור תצוגת T-SQL, ולבנות דוח Power Server ללא תיקון, כדי להגדיר מחדש של Azure.
מסקנה
Azure Synapse Analytics התפתחה ממחסן נתונים פשוט לפלטפורמת ניתוח מאוחדת, העומדת בדרישות של ארגונים מודרניים המונעים על ידי נתונים.על ידי שילוב של עיבוד נתונים גדול, תהלוכה ארגונית, ושאילתה ללא שרת בשירות יחיד, היא מבטלת את החיכוך בין הנדסה לנתונים מודרניים וניתוח נתונים.שילוב עמוק שלה עם מערכת האקולוגית, יציבה ביטחונית חזקה, מודלים גמישים, הופכת אותה לבחירה משכנעת עבור ארגונים בקנה מידה הגולמי שלהם, בין אם אתה מספק את הנתונים האסטרטגיים, או את הביצועים האישיים, או את הביצועים האסטרטגיים, או את ה-ה, או את ה-ידי Azure, או את ה-ה, מאפשר מחסנים, כדי לאפשר את ה-ה, או את ה-ה של Azure, לספק את הביצועים האסטרטגיים, או את ה-ה, לספק, או את ה- Microsoft, לספק את היכולת של Azure, לספק את הביצועים האסטרטגיים, או את הקבצים שלנו, לספק, או את המערכת של Azure, לספק, לספק את המערכת האקולוגית של מערכת הנתונים הסטרקורד, לספק את האינטגרציה העמוקה שלה עם מערכת הנתונים המודרניים, או את המחסן עם מערכת הנתונים המודרניים, לספק, אחסון, עם מערכת הנתונים של Azure, לספק, או את המחסן עם מערכת הנתונים של Azure, אחסון נתונים מתקדמים, אחסון
כדי לחקור עוד, התייחס לתבניות הפריסה הרשמיות של Microsoft (QeldueFLT) 1 למדריכי אדריכלות, שיטות טובות ביותר ומדריכים מהירים של פורה בעולם האמיתי, לבדוק את ה-FLT:2Zonee Architects Architects (ראה להלן:2PSK) ו-FLT:4Power BI אינטגרציה:5 עם תכנון קפדני ואופטימיזציה, Azureseapse יכול לטפל בנתונים הגדולים ביותר שלך, תוך שמירה על עלויות עבודה גדולות.