Azure Data Lake Analytics nedir?

Azure Data Lake Analytics, Apache YARN üzerinde inşa edilen bulut tabanlı, dağıtılmış bir analitik hizmettir, kuruluşların altyapıyı yönetmeden büyük veri setlerini işlemesine olanak sağlar. kümes kurulumu, ölçeklendirme ve iş zamanlamasını soyutlar, veri mühendislerine ve analistlere sorgulamaya ve alıntılamaya odaklanmasını sağlar. Servis, hem de ücretli bir iş modelini destekler, hem ölçeklenebilir hem de maliyetle etkili hale getirir.

Geleneksel on-premises Hadoop kümelerinin aksine, Azure Data Lake Analytics, iş gereksinimlerine dayanan hesap kaynakları otomatik olarak iş akışları ile iş birliği yapar ve işlem tamamlandığında kaynaklar yayınlar.Bu elastiklik özellikle de mevsimsel raporlama alanları veya reklam-hoc analitik sorgular gibi organizasyonlar için değerlidir.

Alt Mimarlık

Ana bölümünde, Azure Data Lake Analytics, Azure Data Lake Storage'da depolanan verilerin bölümlerini kullanarak Apache YARN'yi kullanmaktadır.Bir kullanıcı bir işi gönderirken, kumandanlık grafiğine (DAG) görerek bir işlem işlemi gerçekleştirerek, birden fazla işlem düğümü ile dağıtılır.Bu görevler Azure Data Lake Storage (ADLS)

Azure Data Lake Analytics için birincil sorgu dili U-SQL, SQL'nin öznitelik gücü ile C#. U-SQL, geliştiricilerin hem SQL-savvuf analistleri hem de yazılım mühendisleri için uygun hale getirmelerini sağlar. Ayrıca, kullanıcı tanımlı fonksiyonlar ve özel operatörleri için hizmet Python ve .NET zamanlarını birleştirir, çeşitli veri işleme senaryoları için sunar.

Azure Data Lake Analytics'in Anahtar Özellikleri

Otomatik Scaling ve Elasticity

Azure Data Lake Analytics dinamik olarak iş yüküne göre hesap kaynakları ölçekler.Her iş bir dizi aranırsa, performans ve maliyetle azalırsa, değişken veri hacimlerini temsil eden değişken kullanım süresine göre değişir.

Maliyet-Effective Fiyat Model

Azure Data Lake Analytics ile, sadece iş infazı sırasında tüketilen hesaplama gücü için ödersiniz, örneğin, toplu iş işleme 100 TB veri maliyeti yalnızca birkaç dolara mal olabilir, geleneksel bir küme kullanım maliyetine bakılmaksızın sürekli maliyet veya boş maliyetle ödemez.Bu tüketim temelli model sporadik iş yükleri, explor analitikleri ve geliştirme ortamları için idealdir. Örneğin, bir iş işleme 100 TB veri maliyeti sadece birkaç dolara mal olabilir.

Azure Ekosistemi ile Derin entegrasyon

Azure Data Lake Analytics yerel olarak www.FLT:0)Azure Data Lake Storage) tarafından kullanılabilir ve depolama, [[Dönetici:2)Azure SQL Database), İlişkili katalog yönetimi ve [[Dönetici için [[Döneticileri için [[Döneticileri için [Döneticileri için [Döneticileri ile çalışır.[Döneticileri ile çalışır.)

Multi Languages ve Runtimes için destek

U-SQL birincil dil olsa da, kullanıcılar mevcut programlama becerileri ve kütüphaneleri de yazabiliyor.Python) ve ) Özel ekstraktörler için [FONTD[FONTD][FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=TRNT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FONT=FO

Enterprise-Grade Security

Azure Data Lake Analytics, Azure Active Directory'nin güvenlik özelliklerini miras alır, rol tabanlı erişim kontrolünü destekler (RBAC) ve özellikler tabanlı erişim kontrolü (ABAC) Azure Storage Service Şifreleme ile şifrelenir ve transitteki veriler Azure Monitor ve Log Analytics tarafından kontrol edilebilir.Ayrıca, verilere erişim ve işleme faaliyetlerine tam görünürlük sağlayarak kullanılabilir.

Azure Data Lake Analytics Nasıl Çalışır

Tipik iş akışı dört adım içerir: veri kesintisi, iş yaratılması, uygulama ve sonuç tüketim.

  1. [FOLS) Azure Data Factory, AzCopy veya Azure Event Hubs gibi araçları kullanarak Azure Data Lake Storage (ADLS) içine alınan veriler [FOD) herhangi bir formatta olabilir - yapılandırılabilir, yarı yapılandırılmış veya yapılandırılabilir - örneğin, MATLAB, JSON, Parkt, euro veya metin dosyaları gibi.
  2. [FONT:0] Bir iş[[DÜDÜDÜDÜDÜDÜDÜDÜŞÜNÜŞÜNÜŞÜNÜŞÜNÜ:0) Bir iş oluşturun[DÜDÜDÜDÜDÜDÜDÜDÜDÜDÜ, Python veya .NET. Jobs, girdi veri kaynaklarını, dönüşümleri ve çıkış destinasyonlarını tanımlayan senaryolar olarak yazılır. Örneğin, U-SQL dosyaları ADLS, filtre kayıtları, arsa sayıları ve bir SQL veritabanına giriş yapılabilir.
  3. [FONT=0]İşi [Döntgen: 1) Azure Data Lake Analytics hizmetine otomatik olarak analiz eder ve sanal düğümler kümesinde optimize edilmiş bir uygulama planı oluşturur.
  4. [FONT:0] İşi ([Dönetici: 1) büyük bir paralel modada gerçekleştirir. Her bir düğümün bir bölümü verinin bir parçası değildir ve orta sonuçlar gerekli düğümler arasında nakavt edilir. Servis monitörleri ilerleme ve yeniden yüklenemez görevleri tamamlamayı garanti eder.
  5. [FONT:0]Retrieve sonuçları [DDDDDDDDDDDDDD:0)Bir kez iş bittiğinde, Azure SQL Database'e geri depolanabilir veya Power BI panolarında görüntülenen tüm süreç, kullanıcıların birden fazla iş eş zamanlı olarak çalıştırmasına olanak sağlar.

İş optimizasyonu ve Performansı

En üst düzey performansa göre, kullanıcılar iş başına AU'ların sayısını ayarlar, veri temizlemesini sağlamak için giriş dosyaları ve U-SQL optimizasyonlarını [FONT:0)ORDER BY) ve DISTRIBUTE BY) gibi bir iş seviyesi izleme sağlar.For iterative development:Azure Portal}|DORDER BYVisual Studio|DISTRIBUTE BY)

Azure Data Lake Analytics için Vakalar Kullanın

IoT için gerçek zamanlı veri analizi

Organizasyonlar IoT sensörlerinin büyük bir telemetri veri akışlarını oluşturuyor. Azure Data Lake Analytics bu verileri Azure Event Hubs ve Stream Analytics ile bir araya geldiğinde, teknolojili bir şekilde tespit ve enerji tüketimi analizi akıllı metreden alıyor.

Makine Öğrenme için Büyük Veri İşleme

Veri bilim adamları genellikle eğitim modellerinden önce çiğ, yapılandırılmamış verileri temiz bir şekilde dönüştürmek zorunda. Azure Data Lake Analytics karmaşık ETL (extract, transform, yük) işlemleri için petabaytlar arasında veri toplama, eğitim veri setleri için hazırlanmış, örneğin, eğitim kayıtları için Skypee Machine Learning) veya [[FONTFLT:2)Databricks. Örneğin, ADLS'de depolanan tıbbi görüntüleme işlemleri metadata çıkarmak için işlenebilir ve eğitim için model olarak ihraç edilebilir.

İş Zekası ve Raporlama

Enterprise BI takımları, Power BI gibi ham veri ve raporlama araçları arasında bir köprü olarak hareket eder. Bir perakende şirketi, mevsimsel eğilimleri, envanter ve talep tespit etmek için binlerce mağazadaki satış işlemlerini analiz edebilir.

Data Dönüşüm ve Temizlik

Veri kalitesi kalıcı bir meydan okumadır. Azure Data Lake Analytics, veri temizleme rutinlerini otomatikleştirebilir - tekrarlar, standartlaştırılmış formatlar, eksik değerleri doldurun ve finansal hizmetler için, bu, yasal raporlama standartlarının denetim edilebilir, temiz veri setlerine dönüştürerek uygun olmasını sağlar.

Log Analysis and Security Watch

Güvenlik operasyonları merkezleri (SOCs) Azure Data Lake Analytics'i günlük güvenlik loglarının gigabaytlarını işlemek için kullanabilir. Jobs, birden fazla kaynaktan (Azure Security Center, Azure Sentinel, üçüncü taraf güvenlik duvarları) olayları gerçek zamanlı uyarı için Azure Sentinel'e besleyebilir.

Educators ve Öğrenciler için Faydaları

Azure Data Lake Analytics, kümeleri yönetmek için büyük veri konseptlerini öğretmek için erişilebilir bir platform sunmaktadır. Öğrenciler, eğitim abonelikleri için Azure'a kaydolabilir (bu genellikle ücretsiz krediler içerir) ve örnek veri setlerini dakikalar içinde işlemeye başlayabilir.

Educators, taklit gerçek dünya senaryoları ile atamaları tasarlayabilir: Uçuş gecikmiş verileri analiz edebilir, sosyal medya akışları veya akıllı şehirler için veri boru hatları oluşturabilir.U-SQL ve Python ile çalışarak, öğrenciler dağıtılmış hesaplama, sorgu optimizasyonu ve Azure bulut hizmetlerinde pratik beceriler kazanırlar.

En İyi Uygulamalar ve Optimizasyon Stratejileri

Paralellik için giriş verisi

Maksimum paralellik elde etmek için, birçok küçük dosyada veri depolamak (örneğin, 50-200 MB her) birkaç büyük dosyadan daha iyi bir şekilde optimize etmek için Azure Data Lake Analytics, dosya bölmesi için bir görev atamayı mümkün olduğunda en iyi şekilde çalışır.ExpoT:0ConException BY).

Appropriate Data Formats kullanın

Köşeli formatları [Üye Olmayanlar:0)Parquet[[DÜye Olmayanlar İçin Tıklayınız.Örnek:2)|Döneci formatlar (CSV) analitik iş yükleri için. Bu daha iyi ve ön itmeler, I/O'yu azaltır ve performansı arttırır. hizmet aynı zamanda KAYNAKLAR:2[DÜye Olmayanlar için)

Monitor ve Bütçe Maliyetleri

Set up Azure Cost Management alerts to track AU-hour consumption. For development environments, limit the maximum AUs per job to avoid accidental overspend. Use Azure Policy to enforce tagging and restrict job submission to authorized users only.

Yeniden inşa edilmiş-İşlevler ve Kütüphaneler

U-SQL, dizi manipülasyon için çok sayıda yerleşik işlev içerir, tarih işleme ve istatistiksel analiz.Özel C# kodu yazmadan önce, mevcut işlevleri gözden geçirmek - genellikle yeterli ve son derece optimize edilmiştir. Gelişmiş senaryolar için, [[UCAnalytics adı alan makine öğrenmesi ve geospatit işleme için ek kütüphaneler sunar.

Transient Başarısızlıklar için Yeniden Yeniden Yenidenleme Politikaları

Dış hizmetleri (örneğin, Azure SQL Database, Cosmos DB) ABD'de bulunan ve dış veri kaynağı tanımında güvenilirlik geliştirmek için yeniden deneme mantığını ekleyin.TheurFLT:0)RETRY) ve MAXRETRIES dış veri kaynağı tanımındaki seçenekler güvenilirliğini artırabilir.

Sınırlar ve Alternatifler

Azure Data Lake Analytics güçlü olsa da, her senaryoya uygun olmayabilir.It is designed forurFLT:0)batch işleme) - gerçek zamanlı akışlar değil. alt saniyeler için, iş başına 250 AUT:2AzurCone Stream Analytics) veya ) ● Etkinleştirme işlemleri)

Azure içindeki Alternatifler, SQL-on-the-data-lake sorguları için için etkileşimli Spark tabanlı analitik için [[FONT:2)Azure Synapse Serverless SQL Pool) için SQL-on-the-data-lake sorguları ve ) Özel Hadoop veya Spark kümeleri için uygun şekilde ayarlandığında, Google Cloud Dataflow[FLT: 7+T: 7|D|D|Döneticileri ve şifreleri için benzer bir sunucuyu seçin.

Azure Data Lake Analytics ile başlayın

Başlangıçta, Azure portalı aracılığıyla Azure Data Lake Analytics hesabı oluşturmak. Azure Data Lake Storage hesabı (Gen1 veya Gen2) ile birlikte Azure SQL Database (Ex-source NYC Taxi dataset veya kendi CSV dosyaları için Azure SQL Database) oluşturmak veya Azure portalını kullanmak için Data Lake Tools for Visual Studio)

[0]

İşi gönderin ve ilerlemesini izleyin.İş grafiğini portalda, görevlerin nasıl dağıtıldığını anlamak için izleyin. Daha büyük veri setleriyle Deney ve hizmetin tam potansiyelini araştırmak için daha karmaşık dönüşümler.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Azure Data Lake Analytics, sunucusuz, maliyet etkin büyük veri işlemeye altyapıyı yönetmeden ihtiyaç duyan kuruluşlar için güçlü bir seçim olmaya devam ediyor. Azure Data Lake Analytics, çoklu diller için destek ve otomatik ölçeklendirme, geniş bir kullanım için uygun hale getiriyor - IoT Analytics'ten makine öğrenimine kadar, bu tür eğitimciler ve öğrenciler için, büyük ölçekli veri setlerinden elde etmek için kum kutu ortamı sunuyor.