Table of Contents
מה זה Azure Data Factory ולמה זה משנה
Azure Data Factory (ADF) הוא שירות אינטגרציה מנוהל לחלוטין, ענן-קניט של נתונים מ- Microsoft שמאפשר לך לבנות, לקבוע, לתנורי נתונים של תזמורות בקנה מידה.זה מתחבר ליותר מ-90 מחברים ללא תחזוקה - גילוי על מסדי נתונים של טעינה, יישומים SaaS ופלטפורמות ענן אחרות - כך שתוכל להעביר ולשנות נתונים ללא כתיבת קוד.ADF תומך הן ב- ETL (ct, הפעלת תבניות למידה), ו-recontra, להפוך את ה-recont), ולהפוך את ה-reative Data ל-reative, ולהפוך את ה-reative, ו-reative, ולהפוך את ה-reative Cloud, ולהפוך את ה-reative Analytics, ולהפוך את ה-reative Analytics, ולהפוך את ה-reative, ולהפוך את ה-reative Cloud, ולהפוך את ה-reative Analytics, ופלטפורמות ענן, ו-reative Analytics, ולהפוך את ה-reative Analytics, ולהפוך את ה-reative Analytics, ו-reative, ולהפוך את ה-reative Analytics, ופלטפורמות ענן אחרים, ו-retra-retra-reative Analytics, ו-retra-retra-retra-retra-aLT) ל-retra-retra-retra
ארגונים מודרניים אוספים נתונים מעשרות מקורות: מסדי נתונים של עסקאות, מערכות CRM, זרמי IoT, הזנות מדיה חברתית, ו API חיצוני. Bringing נתונים אלה יחד לצורך ניתוח או שימוש תפעולי הוא אתגר גדול. ADF פותר זאת על ידי מתן ממשק חזותי לתכנון זרמי עבודה, מנוע ללא שרת אשר מקנה באופן אוטומטי, ושילוב עמוק עם מערכת ההפעלה Azure (Synse, Power, Azure, Azure, Machine Learning, ו- Azure, גם כדי ליצור קשר עם תרחישים היברידיים עם , אחסון של Microsoft-APICloud-APT3, ו-ACloud, ו-APTAPTAPTAPTAPTAPTAPTS).
השירות מיועד למהנדסי נתונים, מפתחי ETL ואנשי מקצוע אנליטיים הזקוקים לכלי אמין, ברמה ארגונית כדי להתאים את התנועה לנתונים ולטרנספורמציה.עם התמחור שלה, אתה נמנע מהעלות והמורכבות של ניהול התשתית שלך.בסעיפים הבאים, אנו נבחן את הרכיבים שהופכים את ADF טייפ, כיצד להשתמש בהם ביעילות, ואת התרגילים הטובים ביותר כי מפרידים צינור בנוי היטב משריר אחד.
מפעל נתונים של Azure Data Factory
כדי לעצב פתרונות אינטגרציה נתונים יעילים, עליך להבין את אבני הבניין ש-ADF מספק.לכל רכיב יש תפקיד ספציפי, ויחד הם יוצרים מסגרת גמישה, חוזרת על עצמה עבור זרימת עבודה של נתונים.
המונחים:
צינור הוא יחידת עבודה הגיונית המכילה פעילות אחת או יותר.זה מגדיר את רצף המשימות הדרושות כדי לזרז, לשנות ולטעום נתונים.קווים ניתן לקבוע, מופעל על ידי אירועים, או לרוץ על הביקוש.הם הם המנגנון העיקרי עבור זריקת נתונים, ואתה יכול לשרשרת צינורות מרובים יחד באמצעות FLT:0Execute PipeFLT 1 כדי לבנות פעילות מורכבת, מורכב, מורכב עבודה.
פעילות
(ה) פעולות הן פעולות בודדות בתוך צינורות.התרגילים הנפוצים כוללים:0 (Copy DataFeloph:1; (עבור העברת נתונים בין חנויות), FLT:2Data FlowFLT 3 (עבור שינויים ללא קוד), מקבילות ל-FLT:4Stored ApplicationsFLT:5 (להפעלה של לוגיקה), FLT:6Webves 7 (לשימוש ב-AP) ו-SLCDIRSTFIRST)
Dataset
נתונים נקראים הפניות שמצביעים על הנתונים שברצונך להשתמש בפעילויות שלך.הם לא מחזיקים את הנתונים עצמם; במקום זאת, הם מתארים את המבנה (שema, פורמט, מיקום) וקישוריות. לדוגמה, נקודת נתונים עלולה להצביע על קובץ ספציפי ב- Azure Data Lake Storage או בטבלה ב-SQL.הפשטה זו מאפשרת לך להשתמש באותן נתונים על פני צינורות ופעילויות רבות.
שירות מקושר
שירותים מקושרים מחזיקים את פרטי החיבור - כתובות, אישורי אימות והגדרות אבטחה - נדרש גישה לחנויות נתונים חיצוניות.שירות מקושר הוא למעשה מחרוזת חיבור על סטרואידים.אתה יכול להתחבר ל- Azure SQL, על גבי פרסומות Oracle, Amazon Redshift, Salesforce ועוד. על ידי הפרדת הגדרות נתונים מחיבור, באפשרותך לעדכן את האישורים במקום אחד ללא נגיעה בכל צינורות.
אינטגרציה Runtime
(ה) ,השילוב מספק את הסביבה הנישאת שבה מבצעים פעולות ADF מציע שלושה סוגים של IR:FLT:0ZoneeofLT:1 (ללא תשלום, עבור פעולות ענן-לענן), FLT:2Self-HostedFLT 3: (התקנה על גבי הרשת שלך, לגישה על-ידי שימוש מראש או נתונים פרטיים), ו-FISLondowed for הפעלת חבילות אבטחה קריטיות (RIS)
טריגר
(ב) ⁇ (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
המונחים: runtime Types
זמן האינטגרציה הוא המנוע שמניע את צינורותיך.בחירת הסוג הנכון היא החלטה בסיסית המשפיעה על קישוריות, אבטחה ועלות.
Azureאינטגרציה Runtime (אזור IR)
Azure IR היא ברירת המחדל עבור רוב התרחישים המתקדמים בענן.It פועל בסביבה מנוהלת, ללא שרת שמדרגת באופן אוטומטי על בסיס עומס עבודה.You לא צריך לספק VMs או להתמודד עם עדכוני תוכנה. Azure IR הוא אידיאלי עבור העתקת נתונים בין חנויות נתונים בענן (למשל, Azure Blob ל- Azure) ולביצוע זרימת נתונים.זה תומך ב-concurrency הגבוה ביותר בין כל סוגי ה-remecreative ו-remetexitated to behaviortrated your own to Azure.
עבור פעילויות העתקה, אתה יכול לשלוט מקבילות על ידי הגדרת FLT:0 Data אינטגרציה יחידות (DIUs) אינטגרציה (DIU) מייצג את כוח העיבוד שהוקצה למבצע עותק.על ידי ברירת מחדל, ADF משתמש באוטומטיות, אך באפשרותך להגדיר באופן ידני את מספר DIUs כדי להתאים את העבודה לעומת עלות.
אינטגרציה עצמית: Runtime
כאשר מקורות הנתונים שלך חיים מאחורי חומת אש - במרכזי נתונים של חברות, רשתות פרטיות וירטואליות, או על גבי מאגרי מידע - אתה צריך IR שמור עצמי זה זמן ריצה מותקנת כיישומים קלים על מכונת Windows (או VM) בתוך הרשת שלך.זה יכול להיות פרוס במקבץ זמינות גבוהה לאמינות ותומכת הן תנועה נתונים והן בנתונים והוצאה להורג.
IR פועל כגשר בין ADF לבין הנתונים הפרטיים שלך.It מצפין את כל התנועה ומשתמש תקשורת ממוקדת בלבד, כך שאתה לא צריך לפתוח נמלים בשפע.מקרים של שימוש משותף כוללים העתקת נתונים מ- SQL Server לשימוש ב- Azure, שילוב מערכות קצה-של מכירות עם ניתוח ענן, והובלת קבצים בין מניות פנימיות ו- Azure Data Lake.
Azure-SSIS אינטגרציה Runtime
אם יש לך קיימות שירותי אינטגרציה של SQL Server (SSIS) חבילות, Azure-SSIS IR מאפשר לך להרים ולהעביר אותם ל- Azure עם שינויים מינימליים.זמן ריצה זה הוא אשכול מנוהל לחלוטין של Azure VMs המפעילים את מנוע ה-SSIS.You יכול לפרוס את הקבצים שלך ישירות, והם יבצעו על המקבץ בדיוק כפי שהם היו על שרת מראש.
Azure-SSIS IR תומך בכל מחברי ה-SSIS הסטנדרטיים ויכול להשתלב עם Azure SQL Managed Instance, Azure SQL Database, וב-premises מקורות באמצעות IR. Microsoft מציעה עד 88% חיסכון בעלויות עם Azure SQL Managed Instance, אם יש לך רישיון SQL Server קיים.זהו שירות SSIS תואם רק בענן, מה שהופך אותו נתיב הגירה טבעי עבור ארגונים עם השקעות כבדות ב-אס.
Mapping Data Flows: Code-Free Transformations
זרימת נתונים ממפה מאפשרת לך לעצב שינויים מורכבים בנתונים באופן חזותי, ללא כתיבת קו אחד של קוד. הם רצים על אשכולות ספאקי המנוהל על ידי ADF, כך שאתה מקבל עיבוד מבוזר בקנה מידה. זרימת נתונים מוכתבים על בד אינטראקטיבי שבו אתה מוסיף שלבים טרנספורמציה, תוצאות תצוגה מקדימה בזמן אמת, ו debug לוגיקה לפני הפריסה.
חווית עיצוב חזותית
מעצב זרימת הנתונים כולל בד (שם אתה גרר ומחבר טרנספורמציה), פאנל תצורה (להגדרת נכסים כמו מיפוי עמודה וביטויים), ומחבת תצוגה מקדימה של נתונים בזמן אמת.אתה יכול לבדוק את התפוקה לאחר כל צעד, מה שהופך אותו קל לזהות שגיאות מוקדם.החוויה דומה לבניית רצף זרימה: אתה מתחיל עם מקור, ליישם סדרה של שינויים, ואת הקרקע כתוצאה של כיור.
קטגוריות טרנספורמציה
ADF מארגן שינויים בקבוצות המסייעות לך למצוא את הכלי הנכון:
- (FLT:0) ,Multiple קלטs/ ⁇ s:cioFLT:1) הצטרף, פיצול תנאי, קיים, האיחוד, ה- Lookup, ו- הזרוע החדשה מאפשרת לך לשלב או לחלק זרמי נתונים.
- (ב) ⁇ :0) מאמת: (FLT:1; עמוד דרבירד, בחר, Aggregate, Pivot, Unpivot, Window, and Rank, תן לך לעצב מחדש את המבנה והתכנים של הנתונים שלך.
- (ב) [15] , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ⁇ :0) ⁇ : ⁇ : 1 (ב"ד) ⁇ , ⁇ , ⁇ , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
כל שינוי כולל בונה ביטוי מותאם אישית התומך במחרוזת, תאריך, מתמטיקה ולוגיקה מותנית.You יכול להשתמש בפונקציות בנויות או לכתוב ביטויים משלך באמצעות שפת ביטוי הנתונים ADF.
ביצועים ו Scalability
מאחורי הקלעים, מיפוי נתונים מאגד את ההיגיון החזותי שלך למשרות ספאריות מותאמות.ADF מטפל חלוקת, מקבילות והקצאת משאבים.You יכול לשלוט בביצועים על ידי בחירת הסוג המנציח (המטרה הכללית או הזיכרון מותאם) ומספר ליבות עבור אשכול.ADF משתמש כיום Spark 3.3, אשר מביא שיפורים ביצועים וגישה לתכונות האחרונות Spark. for Larges, חלוקת אסטרטגיות (Ferd) , כלומר, מהירות LT-Ferd.
יצירת צינור נתונים במפעל Azure Data Factory
בניית צינור נתונים מקצה לקצה כוללת שישה שלבים מרכזיים.כל צעד בונה על הקודם, מה שהופך את לוגיקה שילוב הנתונים שלך לתהליך חוזר ואוטומטי.
שלב 1: Define Linked Services
ראשית, יצירת שירותים מקושרים עבור כל חנות נתונים הצינור שלך יהיה לגעת.לדוגמה, שירות מקושר עבור Azure Blob Storage עשוי להשתמש באימות מפתח חשבון, בעוד שירות מקושר עבור שרת SQL Server ישתמש אימות SQL ונקודת ציון עצמי נשמר IR. השתמש בזהויות מנוהלות או Azure Key Vault כדי לאחסן אישורים בבטחה במקום להקשות עליהם.
שלב 2: יצירת נתונים
הבא, להגדיר נתונים המייצגים את המבנים הספציפיים של הנתונים שאתה עובד עם. a Dataset מתייחס שירות מקושר ומוסיפה פרטים כמו מסלולי קבצים, שמות שולחן, אפשרויות פורמט (CSV, Parkt, JSON) לדוגמה, אתה יכול ליצור נקודת נתונים עבור קובץ CSV ב- Blob Storage ועוד עבור שולחן ב- Azure.
שלב 3: עיצוב צינור
השתמש בבד הצינור כדי להוסיף פעילויות.ד.ד.ד.ד.ד.ק.ד.מ.ק.ד.ר.ק.ד.ר.ק.ד.ר.ק.ד.ההההההההפעילות של נתונים מדרגה ראשונה, הציבה את מקורו ואת שוק ה-FiphsFLT:3 אשר מתייחס לפעילות מבוססת נתונים מראש.
שלב 4: שינוי טריגר
בחר כיצד לבעוט את הצינור שלך.גורם לוח הזמנים יכול לרוץ כל בוקר בשעה 6 AM. A ttling חלון גורם יכול לעבד אצילות שעה.גורם אירוע יכול לירות ברגע שקובץ חדש נוחת בתיקיה מסוימת. טריגר יכול לעבור פרמטרים (למשל, החלון מתחיל זמן) לצנרת, מה שהופך אותם דינמיים.
שלב 5: מבחן ווויכוח
לפני פרסום, השתמש במצב debug של ADF כדי להפעיל את הצינור באופן אינטראקטיבי.אתה יכול להגדיר נקודות, לבדוק נתונים ביניים, ולבחון יומני ביצוע. Debug רץ לא דורש צינור שפורסם, כך שתוכל להסס במהירות.פעם מרוצה, לפרסם את הצינור לשירות ADF, שבו הוא הופך זמין עבור ביצוע מתוכנן או ידני.
שלב 6: מעקב ואופטימיזציה
לאחר פריסה, לפקח על הצינור שלך פועל בתצוגת ניטור ADF.You יכול לראות מעמד, משך, נתונים לקרוא / כתוב, ו יומני ברמת פעילות מפורטת. להגדיר התראות (באמצעות Azure Monitor) להודיע לצוות שלך כאשר צינור נכשל או עולה על סף. השתמש בנתונים אלה כדי לזהות שלבים איטיים, להתאים את DIU או הגדרות, וייעל עלויות ניטור קבוע הוא חיוני לשמירה על פעולות אמינות.
היתרונות של Azure Data Factory
Azure Data Factory מספק מגוון רחב של יתרונות שהופכים אותו למטען חזק עבור כל עומס עבודה של אינטגרציה נתונים.
סקלאלה וביצועים
ADF בנוי בקנה מידה.זה יכול להתמודד עם קטבים של נתונים על ידי מתן משאבים מותאמים אוטומטית על בסיס הביקוש.אין תכנון יכולת מעלה: אתה מגדיר את צינורות שלך, ו- ADF מנהל את הסדקים, הרשתות, ו retries. גישה זו השרת מבטיח שיש לך מספיק משאבים עבור התפרצויות נתונים גדולות ללא תשלום עבור יכולת idle בין ריצות.
אפשרויות לאינטגרציה
עם למעלה מ-90 מחברים שנבנו, ADF יכול לעיין בנתונים מכל מקור: חנויות נתונים גדולות (אמזון רדופה, Google BigQuery, HDFS), מחסני נתונים ארגוניים (Oracle Exadata, Teradata), יישומים SaaS (Saleforce, Marketo, ServiceNow), ו- Fileshares. Allors נשמרים על ידי Microsoft, אז אתה לא צריך להתקין נהגים או לנהל שיחות API , אם לא יכול להשתמש ב-Fin, אם אתה יכול להשתמש ב-Fin, אם אתה יכול להשתמש ב-T.
אוטומציה ותזמורת
ADF מצטיין בזרימות עבודה מרובות שלבים.אתה יכול לקבוע צינורות, לגרום להם על בסיס כניסות קבצים, או להפעיל אותם באמצעות REST API. מנוע התזמורת תומך מקבילה, סניף מותני, לולאות, ולטפל שגיאות. לדוגמה, אתה יכול לעצב צינור שמנסה להעתיק נתונים, ואם הוא נכשל, שולח דוא"ל ו retries פעמיים.
פיקוח מקיף ואזהרה
כל צינור פועל לייצר יומני מפורטים שניתן לסקור בפורטל ADF או לייצא ל- Azure Monitor ו- Log Analytics.You יכול לעקוב אחר קואז' על פעילויות, למדוד ביצועים של תנועת נתונים, ולהגדיר התראות יזום עבור כישלונות או עיכובים חשודים.השילוב עם Azure Monitor מאפשר לך ליצור לוחות בקרה ומדיניות שימור אישית עבור עמידה.
מחיר מודל עלויות
ADF משתמש במודל תמחור מבוסס הצריכה.You משלמת עבור פעילות, תנועת נתונים (DIU שעות), שינויים (שעות עבודה עבור זרימת נתונים), וקריאה תפעולית / כתבי יד.אין תשלום חודשי קבוע, כל כך עומסי עבודה קטנים עולים מעט מאוד.עבור פרמטרים צפויים של עבודה גבוהה, אתה יכול להתאים עלויות על ידי אופטימיזציה של הגדרות DIU, המאפשרות TTL עבור זרימת נתונים, כולל תמחור של 1FD.
תמיכה היברידית ורב-ענן
עם IR, אתה יכול להתחבר מקורות נתונים על בסיס עקרונות מאחורי חומות אש, מה שהופך ADF התאמה טבעית עבור אדריכלות היברידית.זה גם תומך תנועת נתונים חוצה עננים: אתה יכול להעתיק נתונים מ-AWS S3 ל- Azure Data Lake, או מ-Google Cloud Storage ל- Azure Blob, כל זאת בתוך צינור אחד.
Enterprise-Grade Security and Compliance
אבטחה מוטבעת בכל שכבה. ADF תומך בזהויות מנוהלות (אשר מבטלות ניהול רציונאלי), Azure Key Vault אינטגרציה, וראשי שירות עבור אימות. כל הנתונים במעבר מוצפנים עם TLS 1.2.עבור קישוריות פרטית, אתה יכול להשתמש ב- Azure Private Link כדי לשמור על התנועה בתוך רשת Microsoft. ADF תואם ISO 27001, SOC 2, HIP, וסטנדרטים אחרים, מה שהופך אותו לתעשיות בריאות כמו גם כן, כמו מימון רפואי.
Azure Data Factory מסביר
הבנת האופן שבו חיובים ADF עוזרים לך תקציב וייעל עלויות.מודל התמחור הוא גרניט, עם כמה ממדים מצטברים על בסיס השימוש.
תזמורת פיקטיבית והוצאה להורג
אתה מחויב לפעילות ריצה בתוספת שעות האינטגרציה הנצרכים במהלך ביצוע.פעילות היא האחראית על ביצוע (למשל, הפעלת פעילות של העתק נתונים פעם עולה סכום קטן) שעות ריצה משתנות על ידי סוג: Azure IR חיובים עבור החיוב המשמש, בעוד עצמית-מארחת רק עבור התזמורת (מכונה הבסיסית היא באחריותך).
עלויות התנועה
פעילויות העתקה לצרוך יחידות אינטגרציה נתונים (DIUs) Microsoft גובה $ 025 לשעה DIU (כמו התמחור הזמין לציבור האחרון) מספר DIUs הנדרש תלוי נפח נתונים, מקור / sink ביצועים, ואם נתונים חוצה אזורים.לדוגמה, העתקה של 10 GB בתוך אותו מרכז נתונים עשוי להשתמש בפחות DIU שעות מאשר העתק של 100 GB ביבשות.
הוצאה להורג של Data Flow
זרימת נתונים ממפה נקבעת על ידי vCore-שעה.You בוחר את הסוג הניך (המטרה הכללית או הזיכרון מותאם) ומספר ה- vCores (למשל, 8, 16, 16, 32) העלות הכוללת שווה את ה- vCore-שעה הנצרכים מוכפל על ידי השיעור החל.You יכול להפחית עלויות על ידי הפעלת TTL על IR, אשר שומר על החי לתקופה קצרה לאחר שימוש חוזר, הוא פועל על ידי שימוש נמוך יותר.
פעולות ו ניטור
תפעול קריאה / כתיבת עלויות $50 ל-50,000 ישויות משתנות או נתייחסות (נתונים, שירותים מקושרים, צינורות) ניטור פעולות (retrieving רשומות לרוץ) עולה $ 025 לרשומות.עלויות אלה בדרך כלל רשלנות בהשוואה עלויות ביצוע, אבל הם יכולים להוסיף אם הצוות שלך בונה מאות צינורות ומפעיל שאילתות ניטור עמוקות.
אסטרטגיות אופטימיזציה
- השתמש ב-FLT:0 תעריף קלקולטורלייט 1 (FLT:0) כדי לבנות עלויות מודל לפני בניית צינורות.
- צינורות קטנים, חוזרים לתוך פרמטרים, תבניות ניתן לשחזר.
- הגדר TTL על Azure IR עבור זרימת נתונים כדי לשמור על אשכולות חמים (הכוללים 10 דקות לפחות לייצור).
- הקצאת DIU בגודל הנכון לפעילויות העתק: להתחיל עם קנה מידה אוטומטי ולהתאים בהתבסס על יומני ביצועים.
- לוח זמנים צינורות לא קריטיים בשעות מחוץ ל-peak אם אתה באזור עם תמחור משתנה.
- באופן קבוע ביקורת ומחק צינורות לא בשימוש, נתונים, וגורמים.
Azure Data Factory vs. AWS Glue: A השוואה
ADF ו-AWS הם שירותי ה- ETL המובילים בענן, אך הם שונים בפילוסופיה ובחוזקות.
אדריכלות ועיצוב פילוסופיה
AWS Glue נשענת על גישה קוד-ראשון: אתה כותב PySpark או Scala תסריטים כדי להגדיר שינויים. ADF, לעומת זאת, מדגיש חוויה חזותית, קוד נמוך, אם כי הוא תומך קוד באמצעות פעילויות או מחברים מותאמים אישית.אם הצוות שלך נוח כתיבה Spark, Glue עשוי להרגיש טבעי יותר.אם אתה מעדיף גרור-anddrop עם ויזואלים עשירים, מיפוי נתונים של ADF הם מתאימים יותר.
מודל
Glue משתמש במודל פשוט של DPU שעות (יחידות עיבוד נתונים) ADF יש מספר מרכיבים עלות (או צ'סטרציה, DIU, vCore, תפעול) אשר יכול להפוך אותו מורכב יותר להעריך אבל גם גמיש יותר עבור עומסי עבודה פשוטים. לדוגמה, עבודה קטנה, בלתי צפויה ב-ADF עשויה לעלות פחות מעבודה גלוט כי אתה לא משלם עבור מלא עבור פעילות מורכבת, אם לא יכול להיות אופטימיזציה של עבודה מורכבת.
שילוב ומערכת אקולוגית
אם הארגון שלך כבר משתמש בכלים של Microsoft (SQL Server, Active Directory, Power BI, Azure Synapse), ADF מציע את האינטגרציה העמוקה ביותר.AWS Glue באופן טבעי מתאים למערכת האקולוגית של AWS (S3, Redshift, Athena, Glueקטלוג) הבחירה לעתים קרובות מגיעה אליו ספק הענן הוא הפלטפורמה העיקרית שלך.
חבילת תמיכה
ADF מספק תמיכה Native עבור חבילות SSIS באמצעות Azure-SSIS IR, כך שתוכל להעביר קוד קיים ללא כתב מחדש. AWS Glue לא מציע תאימות SSIS; תצטרך להמיר חבילות לתסריטים באמצעות מאמץ ידני או כלים של צד שלישי. עבור ארגונים עם השקעות SSIS גדולות, ADF היא הבחירה ברורה.
סקלאלה וניהול עומס עבודה
גלוקוז הוא מלא השרתים ובאופן אוטומטי סולמות אשכולות Spark.ADF מסתמכת על אינטגרציה Runtimes שנותנות לך שליטה ידנית על תצורה של הסביבה (אזורים, סוג compute, ספירת הליבה) שליטה זו הופכת את ADF מתאים יותר עבור מתקנים היברידיים שגשרים על ענן ועל מערכות טרום-יסוד.שניים יכולים להתמודד עם terabytes של נתונים, אבל את הפעולות התפעוליות.
Best Practices for Using Azure Data Factory
לאחר שיטות עבודה מבוססות מבטיח צינורות שלך הם חזקים, שמירה, וחסכוני.
עיצוב מודולרי ו- Reusable Pipelines
בנה צינורות קטנים, מטרה אחת במקום מונוליטיים. השתמש פרמטרים כדי להפוך אותם ניתנים לניתוק.לדוגמה, ליצור צינור אחד פרמטרים כי העתק נתונים מכל שולחן, עם שם השולחן וחיבור המקור עבר כפרמטרים.זה מקטין את מספר צינורות אתה צריך לשמור ומבטיח לוגיקה עקבית.
יישום שגיאות Robust Handling
פעילויות קריטיות בתבניות לנסות-קטך באמצעות פעילויות פייפרליין של הוצאה להורג.המדיניות של קו מחדש (למשל, נסה פעמיים עם מרווח של 5 דקות) עבור כישלונות טרנסים. הוסף ענף "Failure" אשר שולח התראה באמצעות דוא"ל או Slack. Log הודעות שגיאה מפורטות בטבלה או קובץ עבור ניתוח לאחר המוות.
המונחים: divy content
השתמש בפרמטרים עבור נתיבי קבצים, מיתרי חיבור, ולנהל חלונות זמן. ביטויים תוכן דינמיים ב-ADF (למשל, FLT:0) מאפשר לך לבנות צינורות שמתאימים לשינויים סביבתיים ללא עריכה ידנית.זה שימושי במיוחד עבור עומסים מצטברים שבהם אתה צריך לעבור את המהפך האחרון.
וודאו את הנתונים והחומרים שלכם
לעולם אל תחסנו סודות קשיחים.חנות אותם ב- Azure Key Vault ובהתחשב בהם משירותי מקושרים באמצעות סוג חיבור Key Vault. השתמש בזהויות מנוהלות בכל פעם שניתן - זה מבטל את הצורך באישורים לחלוטין.ניהול גישה מבוססת-תפקיד (RBAC) כדי להגביל את אילו משתמשים או מנהלי שירות יכולים לערוך צינורות או להתחיל / הפסקות קישורים פרטיים לכל התנועה כדי למנוע תנועה מחוץ לאינטרנט.
אופטימיזציה של אינטגרציה Runtime Configuration
עבור זרימת נתוני הייצור, ליצור את Azure IR שלך עם אזור מסוים, סוג compute (תכלית כללית), ולפחות 8+8 (16 בסך הכל) vCores. הגדר 10 דקות TTL כדי לשמור על אשכול חם, צמצום עיכוב ההפעלה מ - 5 דקות עד ליד אפס.עבור פעילויות העתק, להתחיל עם DIU, ולאחר מכן לכוון באופן ידני על בסיס ביצועים מזווית המעקב.
עקבו אחרי Optimize Performance
באופן קבוע לבדוק את לוח המחוונים של Azure Monitor עבור צינורות.זהה פעילויות עם משך גבוה או צריכת DIU גבוהה.אופטימיזציה של פעילויות העתקה על ידי חלוקת נתוני מקור, באמצעות עיבוד עבור עותקים של מחזור, ומאפשר עותקים מקבילים. עבור זרימת נתונים, להתאים אסטרטגיות חלוקה וגודל אשכול. השתמש בדו"ח "ההנחה" בתצוגת ניטור כדי לראות איפה עלויות מרוכזות.
יישום CI /CD ו- Version control
צור קשר את מקרה ADF שלך ל- Git repository (אזור DevOps או GitHub) כדי לעקוב אחר שינויים ולשתף פעולה. השתמש במקרים נפרדים ADF עבור dev, בדיקה וייצור. בנה צינורות פריסה אוטומטיים מייצאים תבניות ARM מ- dev, הפעלת בדיקות אימות ולאחר מכן פריסה לייצור.זה מקטין את הסיכון לשגיאות ידניות ומאפשר ל-Ricbacksbacks אם נדרש כעת עבור משתמשי Azure Servert.
מסמך קווי הצנרת והתהליכים שלך
השתמש בשמות משמעותיים עבור כל חפצים (למשל, FLT:1) הוסף תיאורים ו annotations לפעילויות מורכבות. לשמור על מסמך קופס נתונים מראה היכן כל מצגת מקורו ומה שינויים זה עובר. תיעוד טוב עוזר לחברי צוות חדשים במהירות והופך את הבעיה לפתרון הרבה יותר קל.
תכונות מתקדמות ו Capabilities
מעבר ליסוד, ADF מציע מספר תכונות מתקדמות לפתרון בעיות נתונים בעולם האמיתי.
שינוי לכידת נתונים (CDC)
ADF תומך CDC כדי לחלץ רק את השורות שחלפו מאז תמצית האחרונה.You יכול להשתמש מחברים CDC הילידים (עבור מסדי נתונים כגון SQL Server, Oracle, PostgreSQL) או ליישם עמודות סימן מים באופן ידני. CDC מצמצם את כמות הנתונים המועברים מעובדים, המאפשרת שכפול נתונים של זמן-אמת עם כפל נמוך.
המונחים:
מצב debug במיפוי זרימת נתונים מאפשר לך לבחון שינויים באופן אינטראקטיבי נגד מדגם של הנתונים החיים שלך.You יכול להציג את הפלט לאחר כל צעד, לבחון ערכי עמודה, ולהחיל במהירות. מפגשים דביג משתמשים אשכול קטן שמתחיל בשניות, מה שהופך את הפיתוח הרבה יותר מהר מאשר הפעלת צינורות מלאים debug רץ.
ניהול רשת וירטואלית
רשת וירטואלית מנוהלת (VNet) מעניקה לך בידוד רשת עבור משאבי ADF שלך.You יכול ליצור נקודות קצה פרטיות לשירותי Azure (Blob Storage, SQL Database וכו '), הבטחת נתונים לעולם לא להשאיר את Microsoft backbone.TTL עבור Managed VNet מאפשר לך לשלוט כמה זמן נקודות הקצה הפרטיות נשאר פעיל, איזון אבטחה ועלות.
שגיא ד"ר אםט
מקורות נתונים לעתים קרובות לשנות צ'מה - עמודות חדשות מופיעות, סוגים של נתונים משתנים, או עמודות הוסרו.זרי נתוני מיפוי של ADF יכולים להתמודד עם סחף באופן אוטומטי.אתה יכול להגדיר שינויים כדי לזהות עמודות חדשות על זבוב, להזין אותם, לכלול אותם בפלט.זה הופך צינורות עמידים על מנת לפצות שינויים ללא התערבות ידנית.
חלון טירונות
חלון טילינג גורם לנתוני תהליכים קבועים, לא overlapping זמן חלונות.הם אידיאליים עבור תרחישים כמו הדבקה של נתונים על לוחצים או דוחות חיוב יומי.הגורם עובר באופן אוטומטי את החלון מתחיל וזמני קצה כפרמטרים, והוא תומך backfilling (reמעבד חלונות היסטוריים) אם צריך.
שילוב עם Azure Synapse Analytics
ADF משולב עמוק עם Azure Synapse Analytics.You יכול לבנות צינורות ישירות בתוך Synapse Studio, שיתוף אותם מנוע זרימת נתונים ויכולות תזמורות.זה מאפשר לך לשלב שילוב נתונים, פיזור נתונים וניתוח נתונים גדול בפלטפורמה אחת.TheFLT:0Synapse DocumentFLT:1 מכסה כיצד להתחיל.
מקרים אמיתיים לשימוש
Azure Data Factory מבססת אינטגרציה נתונים על פני תעשיות.כאן הם דפוסים משותפים.
Data Storage Modernization
חברות נודדות ממחסני נתונים על-ידי מחסני נתונים (SQL Server, Teradata) לפלטפורמות ענן כמו Azure Synapse להשתמש ב- ADF כדי לתזזז את ההגירה.הם העתקים טבלאות היסטוריות, להגדיר רעננות מצטברות, ולהפוך נתונים להתאים schemas חדשים. ADF כדי להתמודד עם נתונים אצווה ומיקרו-batch הופך את המעבר חלק.
תגית: Lake Ingestion
ארגונים בונים אגמים נתונים מודרניים (אזור אחסון נתונים של האגם Gen2) משתמשים ב- ADF כדי לעיין בנתונים של מסדי נתונים תפעוליים, יישומים SaaS, מכשירי IoT ו- API חיצוניים.Pipelines נחיתה נתונים גולמיים ב-Parkt או תבנית דלתא, ולאחר מכן ליישם תבניות של סכימה-on-on-read לצריכה במורד הזרם על ידי Spark, Power, BI, או ML משרות.
שילוב נתונים היברידי
ארגונים רבים פועלים הן על גבי מערכות ענן ומערכות ענן. IR של ADF, המארגן העצמי של IR, המאפשר נתונים לזרום ממערכות ERP מורשת לתוך צינורות ניתוח ענן.לדוגמה, חברת ייצור עשויה להעתיק נתונים בזמן אמת חיישן ממאגרי מידע על חומרים על גבי תחזיות ל- Azure עבור מודלים של תחזוקה חיזוי.
מודיעין עסקי ודיווח
ADF הוא עמוד השדרה של פתרונות BI רבים.הוא מוציא נתונים ממערכות מקור, חל על לוגיקה עסקית (התרגילים, חישובים), ומטען אותו למסד נתונים אנליטי שכוח BI או Tableau יכול לשאול.על ידי אוטומט צינורות אלה, ארגונים להבטיח שהדיווחים שלהם תמיד עדכניים.
הכנת מידע
מדעני נתונים משתמשים ב-ADF כדי להתאים את שלב הכנת הנתונים של פרויקטים של ML.Pipelines יכולים לאסוף נתונים ממקורות מרובים, לבצע הנדסה תכונה (למשל, ⁇ , דרוג, תאריך מינוף), ולספק נתונים נקיים ל- Azure Machine Learning. אוטומציה זו מקלה על מנת לשחזר ניסויים ולהפיץ מודלים לייצור.
הגירה מ- Legacy ETL Tools
העברת עומסי עבודה קיימים לענן יכולה להיראות מרתיעה, אבל ADF מספק מספר נתיבי הגירה להקל על המעבר.
הגירה SSIS
אם יש לך חבילות SSIS, אתה יכול להרים ולהעביר אותם ל- Azure-SSIS IR עם שינויים מינימליים. ליצור Azure-SSIS IR, לפרוס את הקבצים שלך.ispac, ולרוץ אותם.לאורך זמן, אתה יכול להחליף רכיבי SSIS בודדים עם פעילויות ADF או זרימת נתונים כדי לנצל את התכונות של ענן-native. גישה זו בשלב זה מפחיתה סיכונים ומזרזת אימוץ בענן.
תגית: Migration assistant
עוזר ההגירה של מיקרוסופט (זמין בתוך פורטל ADF) עוזר להעביר צינורות, מחברות, ו- Spark בריכות מ- ADF או Synapse ל- Microsoft.זה מעריך את התלויות, מציע פריטים דומים של מרק, וממיר צינורות באופן אוטומטי.כלי זה שימושי במיוחד עבור ארגונים המבקשים לאמץ ארכיטקטורת האגם המאוחדת של הבד.
הערכה ותכנון
לפני הגירה, מלאי כל עבודות ETL הקיימות, מתעד מקורות נתונים ויעדים, תלויות מפה, ומדכא ביצועים נוכחיים. השתמש בכלים כמו Azure Migrate כדי להעריך את המוכנות. ולאחר מכן לעצב ארכיטקטורה יעד באמצעות רכיבי ADF, החל עם הערך הגבוה ביותר, צינורות המורכבות הנמוכה ביותר.מבחן כל אחד מהם היגר ביסודיות לפני פירוק המערכת.
מתחילים עם Azure Data Factory
כדי להתחיל להשתמש ב-ADF, אתה צריך מנוי Azure.You יכול להירשם עבור ההרחבה:0free Azure accountFLT 1 הכולל זיכויים כדי לחקור שירותים. ולאחר מכן לעקוב אחר ה-FLT:2quickstart מדריך 303 כדי ליצור מפעל הנתונים הראשון שלך, להגדיר צינור, ולהפעיל פעילות העתק פשוטה.
התחל קטן: להתחבר לדגימה נתונים ב- Blob Storage, להעתיק אותו לשולחן Azure SQL ולאחר מכן להוסיף טרנספורמציה פשוטה. בנה ביטחון בהדרגה ולהרחיב לתרחישים מורכבים יותר.התיעוד הרשמי של Microsoft, פורומים קהילתיים ומודולים הדרכה ב- Microsoft Learn מספקים תמיכה נרחבת.
Azure Data Factory ממשיך להתפתח, מוסיף מחברים חדשים, שיפורים ביצועים ושילוב עם Microsoft CNC. בין אם אתה בונה פלטפורמה חדשה של נתונים או מודרניזציה של תהליכי ETL קיימים, ADF מציעה את האמינות, הגדלות והגמישות הדרושים כדי להצליח באינטגרציה נתונים מודרנית.