Azure Data Factory'de Büyük ölçekli Veri Borularını Yönetin
Modern işletmeler, Microsoft Azure'daki bu iş yükleri için merkezi orkestratasyon servisi haline geldi, bulut tabanlı veri hatları oluşturmak için bulut tabanlı bir yol açıyor ve veri hatlarının her türlü modüler tasarım ve ölçeklendirme tekniklerine entegre edilmesi, onları etkin bir şekilde yönetmek, Microsoft Azure'da operasyonel uygulamalar ve sürekli maliyet gözetimi gerektirir.Bu makale, büyük ölçekli veri boru hatlarının kullanımı için çok yönlü bir şekilde atlatmak için çok yönlü bir şekilde atlıyor.
Azure Data Factory'nin Temel Mimari Bileşenleri
ADF'nin bina bloklarının nasıl etkileşimlendiğini anlamak önemlidir. Servis dört temel inşa etrafında döner, her biri bağımsız olarak ölçeklenebilir:
- [FONT=0)Linked Services[Döneticiler)[Döneticiler)[değiştir | kaynağı değiştir] – ADF'nin veri kaynakları ve destinasyonlara nasıl bağlantı kurduğunu tanımlayan bağlantı noktaları (Azure Blob Storage, SQL Server, REST APIs, on-premises sistemleri, vb.).
- [FONT:0)Datasets[[Dönetici: 1))[Döneticiler: Notlar veri mağazası içinde, şema bilgileri ve bölümleme ipuçları dahil olmak üzere veri deposunda verilere atıfta bulunulur.
- [FONT:0)Pipelines[[Dönler: 1) – Faaliyetlerin Mantıksal grupları (Copy, Data Flow, Azure Function, vs.) bir iş akışı yürüten bir boru hattıdır.
- [FONT:0)Triggers[DÜT:1] – Boru hattının çalıştırdığı zaman tabanlı veya etkinlik temelli) programlar.
Performans ve bağlantı kalbinde, adisyon Runtime (IR))[değiştir | kaynağı değiştir] Azure Entegrasyon Runtime, genel bulutta çalışan aktiviteler için kullanılan tam yönetilen hesaplardır, böylece kendi kendine ev sahipliği yapan entegrasyon Runtime köprüleri üçüncü bir seçenek, AzureS Entegrasyon Runtime, asansörler ve SQL Server Entegrasyon Hizmetleri paketleri.
Microsoft'un USB:0) resmi Azure Data Factory dokümanı) temel ayrıntılar sağlar, ancak bu makale, bu bileşenleri ölçekde sürdürülebilir kılan kalıpları üzerine odaklanır.
Scale için tasarım: En İyi Uygulamalar
modüler Boru Tasarımı Tasarım
Kompleks akışlar asla tek bir monolithic boru hattı içinde yaşamamalıdır. Bunun yerine, onları daha küçük, yeniden kullanılabilir birimlere ayırmalısınız. Ortak bir model, dönüşüm ve arayış ile adlandırılabilecek ayrı boru hatlarına yüklenmelidir:0) aktivite.
- Takımlar paralel olarak geliştirilebilir ve test bileşenleri yapabilirler.
- Bireysel boru hatları dam ve ayar için kolay kalır.
- Yeniden kullanılabilir aktiviteler (örneğin, genel bir “gözlü masa” boru hattı) rasyonalları azaltır.
Parametreleme yeniden kullanılabilirlik için kritiktir. Pas kaynağı isimleri, toplu boyutlar ve onları zorlaştırmak yerine parametreler olarak hedef şemalar. Bu şekilde bir boru hattı farklı konfigürasyon dosyaları ile benzer bir ETL işlerine hizmet edebilir.
Dönüşüm için Data Flows for Transformation
Azure Data Factory, Info Flows[0]Mapping Data Flows) ve [[Dönetici:2)Wrangling Data Flows) sunucusuz, kodsuz dönüşümler için. Mapping Data Flows genellikle tercih edilir çünkü iyi bir işlem ortamında sahnelemelerine izin verir.Data Flows, and Optimizations[Döneticileri içerir.Data Flows[Döneticileri, bağlantı noktaları, pencere işlevleri veya karmaşık iş mantığına katılır.
Büyük veri akışları için performans ipuçları şunları içerir:
- Uygun bir hesaplama küme boyutunu seçin (örneğin, orta büyüklükteki dönüşümler için 8 temel, milyarlarca sıraya ağır katılmak için 16+ temel).
- Veri skew önlemek için optimizasyonlu bölme (key-based, dinamik aralığı veya yuvarlak-robin) kullanın.
- Veriler akış aktivite ayarlarında enable “spark iş optimizasyonu”.
Hata işleme ve Yeniden deneme Politikaları
Büyük boru hatları kaçınılmaz olarak geçici başarısızlıklarla karşılaşır - kaynak sistemlerinden ağlayan veya bir veri deposunun geçici olarak kullanılamaz. ConfigureENFLT:0)retry policies) (e.g., 3 üst üste üst üste) etkinleştirilen aktiviteler için (örneğin, "projektif işlemlerine bağlı olarak) otomatik olarak yeniden giriş yapan aktiviteler için, uyarı işlemlerine bağlı olarak, uyarıları kullanan özel bir rotayı uygulayın.
Bu hataları izleyin sadece önemli. Azure Data Factory'nin inşa edilmiş-inurFLT:0)MonitorENFLT:1), boru hattının gerçek zamanlı görünümü, aktivite süresi ve hata detayları. tarihsel analiz için, LUFLT:2 ile entegre edin.). ve )Log Analytics).
Parametre ve Dinamik İçerik
Statik boru hatları ölçek altında kırılır, çünkü her veri kaynağı ayrı bir kopya gerektirir. yerine, [[Döneticileri her seviyedeki sabit hatların parametreleri, veri kümesi parametreleri ve bağlantılı servis parametreleri. Dynamic ifadeleri (e.g., [[D:2) tek bir boru hattının yüzlerce masa veya dosyayı işlemesine izin verir. Schema-aware datasets with the pipeline values|kansım parametreleri[Dönemli)
Massive Data Volumes için Stratejiler
Katılımcılık ve Paralellik
Ateşli veya petabaylarla uğraşırken, varsayılan devre dışı işlem çok yavaştır. ADF çeşitli mekanizmalarla paralelliği destekliyor:
- [[DÜSÜ:0)Kopy Etkinliği paralel kopyalarla ) - Birden fazla Veri Hareketi Birimlerini (DMU) kullanmak için "copy behavior" ayarlayın.For file sources, specify a list of files or use wildcard filter filter filter filter filter filter filter filter filter filters to deploy. For relationshipal resources, use a query with aFLT:3)
- [FONT=0)Data Flow partitioning[[[Dönemli: 1))[[Dönemli))[değiştir | kaynağı değiştir] -Verinin doğal dağıtımını eşleştiren bölüm programları seçin. Range partitioning işlerinde iyi çalışır; anahtarların birçok değeri olduğunda bölme bakiyeleri yüklenir.
- [FONT:0)Köple aktivite[[Dönetici: 1 ) - Dış API'leri arayarak veya depolanan prosedürleri çalışırken, birden çok satır göndermek için “batch say” artırmak.
Kaynak ve lavabo sistemlerinden tonlama konusunda dikkatli olun. Birçok SaaS API ve veritabanı talep limitleri vardır. [FONTD:0]Enstaging[DÜT:1) Uygulamalı aktivitedeki ilk arazi verileri Blob Storage'a yükleme seçeneği, sonra işlem sistemleri üzerinde baskı azaltır.
Data Movement
Kopyalama etkinliği aşağıdaki teknikler tarafından dramatik olarak geliştirilebilir:
- [FONT=0]Compression[[Dönetici:0)[[Dönetici:0)[[Döncükler için kullanılabilir veya Snappy sıkıştırması).Bu, ağ bant genişliğini ve sık sık sık kompresyona rağmen kopyaları azaltır.
- [FONT:0]Staged kopya[[Dönemli: 1))[Dönemli kopyalar[Dönemli kopyalar) – Bir taşlama mağazası (Azure Blob, ADLS Gen2) iki adıma bir kopya kırın: ilk kopyayı batırmak için kaynaktan, sonra da balkona kadar.
- [FONT=0]File format[[[Dönetici, Parkt veya ORC formatları üzerinde CSV / JSON için büyük hacimler için, çünkü sütun odaklı ve prefabrik itme izin veriyor.
Bütünleme Runtime Scalability
Azure Entegrasyon Runtime, büyük dosyaları tanımlayan kopya faaliyetleri için otomatik olarak en fazla DMU sayı (örneğin, 256 DMU) seçmek için en fazla düğümler ekleyip, yatay ölçeklendirme işlemine otomatik olarak katabilirsiniz.For Self- host Integration Runtime, yatay ölçekly by choose more nodess. Monitor and memory use on IR nodes to identify bottlenecks.
Transregion boru hatları için, IR'yi aynı bölgeye aynı bölgeye, kaynağı veya bataklığı en aza indirmek için yerleştirin. Microsoft'un 03:0)copy aktivite performansı rehberi) ayrıntılı karşılaştırmalar ve öneriler sunar.
Alemal Yükler ve Sumarks
Tam reloads veri büyüdükçe pratik hale gelir. ImplementETHFLT:0)Scremental yükleme[Dönetici: 1) Sumark sütunları (örneğin, [[Dönder) veya otomatik olarak satın almak için bir araç kiralama ID.
Büyük boru hatlarında Maliyet optimizasyonu
Yüksek hacimli boru hatları için maliyetleri yönetmek kasıtlı planlama gerektirir. Azure Data Factory fiyatlandırması faaliyette olduğu faktörlere dayanıyor, DIU saatler, veri akışı hesaplama saatleri ve veri hareketi miktarları.
Scheduling and Batching
Birçok veri kaynağı ve lavabolar kapalı saatler boyunca daha düşük fiyatlara sahiptir (örneğin, Azure SQL Database DTUs gece daha ucuzdur).Heaviest boru hatlarınızı akran olmayan pencere tetikleyicileri kullanarak ) birden çok küçük veri kümesi, temel maliyetle çarpılması için tek bir kanala izin verir.
Doğru Ansiklopedi seçmek
Veri akışları için, hesap kümesi, ad-hoc veya düşük frekanslı boru hatları için ayarlanabilir ve etkinleştirilir.[/FLT:2] Aşırı sunuculu dönüşümler için ) için hesaplamalar yapılır ve genel olarak ADF’nin kullandığı kodlar için geçerlidir.
İzleme ve Bütçe Uyarıları
Kullanım Koşulları:0)Azure Cost Management[[Döneticileri ve uyarıları Veri Fabrika kaynağınız için ayarlamanız için yapılandırın. Tag boru hatları iş-unit veya proje etiketleri ile iş-sayıları ile doğru şekilde yorumlayabilirsiniz.ADF izleme bıçağında hangi boru hatlarının en fazla kaynakları tükettiğini belirlemek için ADF izleme raporu.
Data Lifecycle Management
Her bir boru hattının sonunda otomatik temizlenme faaliyetleri Azure Blob Lifecycle Management politikalarının silinmesi veya arşiv eski logları ve yedekleme dosyalarını kurtarması için kullanılabilir.Bu sadece Blob'daki metada yüklenebilir ve depolama maliyetlerini azaltır.
Güvenlik ve Yönetme
Ölçek güvenlik risklerini basitleştirir: daha fazla veri hareketi, daha fazla erişim noktası ve denetim için daha fazla boru hattı.
Yönetilen Kimlik ve RBAC
Bağlantı dizeleri ve anahtarlarını [[0|Köpektif Kimlik[Dönemli Servisler için 1 ) Azure-natif hizmetler için (Storage, DB SQL, Key Vault). Bu, Azure Key Vault'da depolanan sırları ile kendini yok eder.Use Azure RBAC to Give the pipelines minimum required permissions –for example, a pipeline reading from a blob container should only the var.For on-premiss resources, use Self host- IR with steps in Azure Key Vault.
Data Encryption
Azure Data Factory otomatik olarak TLS kullanarak geçişte şifreler verilerini şifreler.For data at rest, save your storages (ADLS Gen2, SQL DW) using şifreleme (Azure-managed keys or müşteri-managed keys) For sensitive columns, consider usingDANFLT:0Hash).Mask) Data Flows'ta dönüşümler kişisel olarak tanımlanabilir bilgi (PII)
Uyum ve Denetim
EnableFLT:0)Azure Activity Log[DÜT:1) ve [[Dönetici:2)Azure Monitor) Tüm veri fabrika olayları (borline başladığında, aktivite başarısızlıkları, bağlantılı servis değişiklikleri) Uygulamalı bir kartvizit iş alanı veya arşivde uyumluluk denetimleri için bir depolama hesabına sahip olmalıdır.
CI/CD ve DevOps için Azure Data Factory
Büyük ölçekli boru hatları statik değildir - iş gereksinimleri ile evrimleşir, bu yüzden uygun bir CI /CD boru hattı gereklidir.
Kaynak Kontrolü Entegrasyon
ADF Azure Repos veya GitHub ile entegrasyonu inşa etti. ADF UI'den tüm boru hattını yönetmek için, veri setini yönetmek ve bir şubede tanımları tetikledi.Gelişen bir şubeye bir araya getirin.
Otomatik olarak ARM Şablonları ile İşitsiz
İşbirliği alanından yayınladığınız her zaman, ADF, tüm fabrika durumunu yakalayan bir ARM şablonu yaratır.Bu şablonları serbest bırakma hattında (Azure DevOps veya GitHub Actions) üretim ve üretim ortamına dağıtmaya çalışır.
Test ve Geçerlilik
CI boru hattınızda boru hatları testlerini ekleyin. Örneğin, test ortamına dağıtdıktan sonra, promosyondan önce birkaç anahtar boru hattını kullanın ve başarılı bir şekilde tamamlayın.UseENFLT:0)Azure Data Factory'nin geçerliliği faaliyeti) önceden eksik parametreler veya şemaları kontrol etmek için.Bu yakalama sorunları erken yakalar.
Gerçek Dünya Vakaları ve Başarı Hikayeleri Kullanıyor
Bu en iyi uygulamaları zemine göre, iki ortak desen düşünün:
- [FONT:0)Large ölçekli veri gölü enjeksiyon[[Dönetici][Dönetici: A Finansal hizmetler firması, Azure Synapse'den yüzlerce günlük işlem gerçekleştiriyor. İş birimine modüler olarak dağıtım hatlarıyla, 4-node kümeyle, bölümlenmiş bir kopya faaliyetleriyle (bugün) ve sahnelenmiş bir kopya ADLS Gen2'ye kadar. Data, Azure Synapse'ye yüklemeden önce yüzlerce günlük işlem gerçekleştiriyor.
- [FONT:0) Gerçek zamanlı olarak toplu geri dönüş ile akış[Dönder: Bir e-ticaret platformu, Azure Event Hubs'ten Blob Storage'a (Parquet format) her 5 dakika boyunca etkin bir şekilde erişim için ADF'yi kullanıyor.
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
Azure Data Factory'deki büyük ölçekli veri boru hatlarının yönetilmesi hem bir mimari disiplin hem de operasyonel bir uygulamadır. modüler tasarım, parametreleme, artış yükleme ve sağlam hata işleme, veri hacmi büyüdükçe boru hatları inşa edersiniz.Scaling hesaplama, kopyalama performansı ve sürekli izleme maliyetleri operasyon verimli tutmak. Güvenlik, yönetim ve CI/CD bu hızın kontrol pahasına gelmesini sağlar. Azure Data Factory, bu kalıplarla birlikteyken, herhangi bir veri odaklı organizasyon için güvenilir bir temel haline gelir.
Daha fazla okuma için, [[0Azure Data Factory Girişi[Dönetici:2) Uygulama ve ayar kılavuzu [DDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜSÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜSÜSÜSÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜDÜSÜSÜS