Azure Data Factory'de Büyük ölçekli Veri Borularını Yönetin

Modern işletmeler, Microsoft Azure'daki bu iş yükleri için merkezi orkestratasyon servisi haline geldi, bulut tabanlı veri hatları oluşturmak için bulut tabanlı bir yol açıyor ve veri hatlarının her türlü modüler tasarım ve ölçeklendirme tekniklerine entegre edilmesi, onları etkin bir şekilde yönetmek, Microsoft Azure'da operasyonel uygulamalar ve sürekli maliyet gözetimi gerektirir.Bu makale, büyük ölçekli veri boru hatlarının kullanımı için çok yönlü bir şekilde atlatmak için çok yönlü bir şekilde atlıyor.

Azure Data Factory'nin Temel Mimari Bileşenleri

ADF'nin bina bloklarının nasıl etkileşimlendiğini anlamak önemlidir. Servis dört temel inşa etrafında döner, her biri bağımsız olarak ölçeklenebilir:

Performans ve bağlantı kalbinde, adisyon Runtime (IR))[değiştir | kaynağı değiştir] Azure Entegrasyon Runtime, genel bulutta çalışan aktiviteler için kullanılan tam yönetilen hesaplardır, böylece kendi kendine ev sahipliği yapan entegrasyon Runtime köprüleri üçüncü bir seçenek, AzureS Entegrasyon Runtime, asansörler ve SQL Server Entegrasyon Hizmetleri paketleri.

Microsoft'un USB:0) resmi Azure Data Factory dokümanı) temel ayrıntılar sağlar, ancak bu makale, bu bileşenleri ölçekde sürdürülebilir kılan kalıpları üzerine odaklanır.

Scale için tasarım: En İyi Uygulamalar

modüler Boru Tasarımı Tasarım

Kompleks akışlar asla tek bir monolithic boru hattı içinde yaşamamalıdır. Bunun yerine, onları daha küçük, yeniden kullanılabilir birimlere ayırmalısınız. Ortak bir model, dönüşüm ve arayış ile adlandırılabilecek ayrı boru hatlarına yüklenmelidir:0) aktivite.

Parametreleme yeniden kullanılabilirlik için kritiktir. Pas kaynağı isimleri, toplu boyutlar ve onları zorlaştırmak yerine parametreler olarak hedef şemalar. Bu şekilde bir boru hattı farklı konfigürasyon dosyaları ile benzer bir ETL işlerine hizmet edebilir.

Dönüşüm için Data Flows for Transformation

Azure Data Factory, Info Flows[0]Mapping Data Flows) ve [[Dönetici:2)Wrangling Data Flows) sunucusuz, kodsuz dönüşümler için. Mapping Data Flows genellikle tercih edilir çünkü iyi bir işlem ortamında sahnelemelerine izin verir.Data Flows, and Optimizations[Döneticileri içerir.Data Flows[Döneticileri, bağlantı noktaları, pencere işlevleri veya karmaşık iş mantığına katılır.

Büyük veri akışları için performans ipuçları şunları içerir:

Hata işleme ve Yeniden deneme Politikaları

Büyük boru hatları kaçınılmaz olarak geçici başarısızlıklarla karşılaşır - kaynak sistemlerinden ağlayan veya bir veri deposunun geçici olarak kullanılamaz. ConfigureENFLT:0)retry policies) (e.g., 3 üst üste üst üste) etkinleştirilen aktiviteler için (örneğin, "projektif işlemlerine bağlı olarak) otomatik olarak yeniden giriş yapan aktiviteler için, uyarı işlemlerine bağlı olarak, uyarıları kullanan özel bir rotayı uygulayın.

Bu hataları izleyin sadece önemli. Azure Data Factory'nin inşa edilmiş-inurFLT:0)MonitorENFLT:1), boru hattının gerçek zamanlı görünümü, aktivite süresi ve hata detayları. tarihsel analiz için, LUFLT:2 ile entegre edin.). ve )Log Analytics).

Parametre ve Dinamik İçerik

Statik boru hatları ölçek altında kırılır, çünkü her veri kaynağı ayrı bir kopya gerektirir. yerine, [[Döneticileri her seviyedeki sabit hatların parametreleri, veri kümesi parametreleri ve bağlantılı servis parametreleri. Dynamic ifadeleri (e.g., [[D:2) tek bir boru hattının yüzlerce masa veya dosyayı işlemesine izin verir. Schema-aware datasets with the pipeline values|kansım parametreleri[Dönemli)

Massive Data Volumes için Stratejiler

Katılımcılık ve Paralellik

Ateşli veya petabaylarla uğraşırken, varsayılan devre dışı işlem çok yavaştır. ADF çeşitli mekanizmalarla paralelliği destekliyor:

Kaynak ve lavabo sistemlerinden tonlama konusunda dikkatli olun. Birçok SaaS API ve veritabanı talep limitleri vardır. [FONTD:0]Enstaging[DÜT:1) Uygulamalı aktivitedeki ilk arazi verileri Blob Storage'a yükleme seçeneği, sonra işlem sistemleri üzerinde baskı azaltır.

Data Movement

Kopyalama etkinliği aşağıdaki teknikler tarafından dramatik olarak geliştirilebilir:

Bütünleme Runtime Scalability

Azure Entegrasyon Runtime, büyük dosyaları tanımlayan kopya faaliyetleri için otomatik olarak en fazla DMU sayı (örneğin, 256 DMU) seçmek için en fazla düğümler ekleyip, yatay ölçeklendirme işlemine otomatik olarak katabilirsiniz.For Self- host Integration Runtime, yatay ölçekly by choose more nodess. Monitor and memory use on IR nodes to identify bottlenecks.

Transregion boru hatları için, IR'yi aynı bölgeye aynı bölgeye, kaynağı veya bataklığı en aza indirmek için yerleştirin. Microsoft'un 03:0)copy aktivite performansı rehberi) ayrıntılı karşılaştırmalar ve öneriler sunar.

Alemal Yükler ve Sumarks

Tam reloads veri büyüdükçe pratik hale gelir. ImplementETHFLT:0)Scremental yükleme[Dönetici: 1) Sumark sütunları (örneğin, [[Dönder) veya otomatik olarak satın almak için bir araç kiralama ID.

Büyük boru hatlarında Maliyet optimizasyonu

Yüksek hacimli boru hatları için maliyetleri yönetmek kasıtlı planlama gerektirir. Azure Data Factory fiyatlandırması faaliyette olduğu faktörlere dayanıyor, DIU saatler, veri akışı hesaplama saatleri ve veri hareketi miktarları.

Scheduling and Batching

Birçok veri kaynağı ve lavabolar kapalı saatler boyunca daha düşük fiyatlara sahiptir (örneğin, Azure SQL Database DTUs gece daha ucuzdur).Heaviest boru hatlarınızı akran olmayan pencere tetikleyicileri kullanarak ) birden çok küçük veri kümesi, temel maliyetle çarpılması için tek bir kanala izin verir.

Doğru Ansiklopedi seçmek

Veri akışları için, hesap kümesi, ad-hoc veya düşük frekanslı boru hatları için ayarlanabilir ve etkinleştirilir.[/FLT:2] Aşırı sunuculu dönüşümler için ) için hesaplamalar yapılır ve genel olarak ADF’nin kullandığı kodlar için geçerlidir.

İzleme ve Bütçe Uyarıları

Kullanım Koşulları:0)Azure Cost Management[[Döneticileri ve uyarıları Veri Fabrika kaynağınız için ayarlamanız için yapılandırın. Tag boru hatları iş-unit veya proje etiketleri ile iş-sayıları ile doğru şekilde yorumlayabilirsiniz.ADF izleme bıçağında hangi boru hatlarının en fazla kaynakları tükettiğini belirlemek için ADF izleme raporu.

Data Lifecycle Management

Her bir boru hattının sonunda otomatik temizlenme faaliyetleri Azure Blob Lifecycle Management politikalarının silinmesi veya arşiv eski logları ve yedekleme dosyalarını kurtarması için kullanılabilir.Bu sadece Blob'daki metada yüklenebilir ve depolama maliyetlerini azaltır.

Güvenlik ve Yönetme

Ölçek güvenlik risklerini basitleştirir: daha fazla veri hareketi, daha fazla erişim noktası ve denetim için daha fazla boru hattı.

Yönetilen Kimlik ve RBAC

Bağlantı dizeleri ve anahtarlarını [[0|Köpektif Kimlik[Dönemli Servisler için 1 ) Azure-natif hizmetler için (Storage, DB SQL, Key Vault). Bu, Azure Key Vault'da depolanan sırları ile kendini yok eder.Use Azure RBAC to Give the pipelines minimum required permissions –for example, a pipeline reading from a blob container should only the var.For on-premiss resources, use Self host- IR with steps in Azure Key Vault.

Data Encryption

Azure Data Factory otomatik olarak TLS kullanarak geçişte şifreler verilerini şifreler.For data at rest, save your storages (ADLS Gen2, SQL DW) using şifreleme (Azure-managed keys or müşteri-managed keys) For sensitive columns, consider usingDANFLT:0Hash).Mask) Data Flows'ta dönüşümler kişisel olarak tanımlanabilir bilgi (PII)

Uyum ve Denetim

EnableFLT:0)Azure Activity Log[DÜT:1) ve [[Dönetici:2)Azure Monitor) Tüm veri fabrika olayları (borline başladığında, aktivite başarısızlıkları, bağlantılı servis değişiklikleri) Uygulamalı bir kartvizit iş alanı veya arşivde uyumluluk denetimleri için bir depolama hesabına sahip olmalıdır.

CI/CD ve DevOps için Azure Data Factory

Büyük ölçekli boru hatları statik değildir - iş gereksinimleri ile evrimleşir, bu yüzden uygun bir CI /CD boru hattı gereklidir.

Kaynak Kontrolü Entegrasyon

ADF Azure Repos veya GitHub ile entegrasyonu inşa etti. ADF UI'den tüm boru hattını yönetmek için, veri setini yönetmek ve bir şubede tanımları tetikledi.Gelişen bir şubeye bir araya getirin.

Otomatik olarak ARM Şablonları ile İşitsiz

İşbirliği alanından yayınladığınız her zaman, ADF, tüm fabrika durumunu yakalayan bir ARM şablonu yaratır.Bu şablonları serbest bırakma hattında (Azure DevOps veya GitHub Actions) üretim ve üretim ortamına dağıtmaya çalışır.

Test ve Geçerlilik

CI boru hattınızda boru hatları testlerini ekleyin. Örneğin, test ortamına dağıtdıktan sonra, promosyondan önce birkaç anahtar boru hattını kullanın ve başarılı bir şekilde tamamlayın.UseENFLT:0)Azure Data Factory'nin geçerliliği faaliyeti) önceden eksik parametreler veya şemaları kontrol etmek için.Bu yakalama sorunları erken yakalar.

Gerçek Dünya Vakaları ve Başarı Hikayeleri Kullanıyor

Bu en iyi uygulamaları zemine göre, iki ortak desen düşünün:

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Azure Data Factory'deki büyük ölçekli veri boru hatlarının yönetilmesi hem bir mimari disiplin hem de operasyonel bir uygulamadır. modüler tasarım, parametreleme, artış yükleme ve sağlam hata işleme, veri hacmi büyüdükçe boru hatları inşa edersiniz.Scaling hesaplama, kopyalama performansı ve sürekli izleme maliyetleri operasyon verimli tutmak. Güvenlik, yönetim ve CI/CD bu hızın kontrol pahasına gelmesini sağlar. Azure Data Factory, bu kalıplarla birlikteyken, herhangi bir veri odaklı organizasyon için güvenilir bir temel haline gelir.

Daha fazla okuma için, [[0Azure Data Factory Girişi[Dönetici:2) Uygulama ve ayar kılavuzu [DDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜSÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜSÜSÜSÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜSÜSÜS