Table of Contents

Was ist Azure Data Factory und warum es wichtig ist

Azure Data Factory (ADF) ist ein vollständig verwalteter, Cloud-nativer Datenintegrationsdienst von Microsoft, mit dem Sie Datenpipelines maßstäblich erstellen, planen und orchestrieren können. Er verbindet sich mit mehr als 90 integrierten, wartungsfreien Konnektoren - mit lokalen Datenbanken, SaaS-Anwendungen und anderen Cloud-Plattformen -, so dass Sie Daten ohne Schreiben von Code verschieben und transformieren können. ADF unterstützt sowohl ETL- (Extrahieren, Transformieren, Laden) als auch ELT- (Extrahieren, Laden, Transformieren) Muster und ist damit ein vielseitiges Rückgrat für Analysen, maschinelles Lernen und Datenmigrationsinitiativen.

Moderne Organisationen sammeln Daten aus Dutzenden von Quellen: Transaktionsdatenbanken, CRM-Systeme, IoT-Streams, Social Media Feeds und externe APIs. Diese Daten für die Analyse oder den Betrieb zusammenzubringen, ist eine große Herausforderung. ADF löst dies, indem es eine visuelle Schnittstelle zum Entwerfen von Workflows, eine serverlose Ausführungsmaschine, die automatisch skaliert wird, und eine tiefe Integration in das Azure-Ökosystem (Synapse, Power BI, Azure Machine Learning, Data Lake Storage) bereitstellt. Es unterstützt auch Hybrid- und Multi-Cloud-Szenarien, die es ermöglichen, lokale Systeme mit Azure-Diensten zu verbinden oder sogar Daten zwischen AWS S3 und Google Cloud Storage zu verschieben.

Der Service richtet sich an Dateningenieure, ETL-Entwickler und Analytiker, die ein zuverlässiges Tool zur Automatisierung von Datenbewegungen und -transformation benötigen. Mit seiner Pay-as-you-go-Preisgestaltung vermeiden Sie die Kosten und die Komplexität der Verwaltung Ihrer eigenen Infrastruktur. In den folgenden Abschnitten werden wir die Komponenten untersuchen, die ADF zum Ticken bringen, wie man sie effektiv einsetzt und die Best Practices, die eine gut gebaute Pipeline von einer fragilen trennen.

Kernkomponenten von Azure Data Factory

Um effektive Datenintegrationslösungen zu entwickeln, müssen Sie die Bausteine verstehen, die ADF bietet. Jede Komponente hat eine spezifische Rolle und zusammen schaffen sie ein flexibles, wiederholbares Framework für Daten-Workflows.

Pipeline

Eine Pipeline ist eine logische Arbeitseinheit, die eine oder mehrere Aktivitäten enthält. Sie definiert die Abfolge der Aufgaben, die zum Einnehmen, Transformieren und Laden von Daten erforderlich sind. Pipelines können geplant, durch Ereignisse ausgelöst oder auf Anforderung ausgeführt werden. Sie sind der primäre Mechanismus zum Orchestrieren von Datenflüssen, und Sie können mehrere Pipelines mithilfe der Aktivität Execute Pipeline verketten, um komplexe, modulare Workflows zu erstellen.

Tätigkeit

Aktivitäten sind die einzelnen Schritte innerhalb einer Pipeline. Übliche Aktivitätstypen sind Copy Data (für das Verschieben von Daten zwischen Stores), Data Flow (für codefreie Transformationen), Stored Procedure (für den Betrieb von SQL-Logik), Web (für den Aufruf von REST-APIs) und Databricks (für den Betrieb von Spark-Jobs). Jede Aktivität kann Eingabe- und Ausgabedatensätze haben, die es Ihnen ermöglichen, sie sequentiell oder parallel zu verketten.

Datensatz

Datensätze werden als Referenzen bezeichnet, die auf die Daten verweisen, die Sie in Ihren Aktivitäten verwenden möchten. Sie enthalten die Daten nicht selbst; stattdessen beschreiben sie die Struktur (Schema, Format, Standort) und Konnektivität. Beispielsweise kann ein Datensatz auf eine bestimmte Parquet-Datei in Azure Data Lake Storage oder eine Tabelle in SQL Database verweisen. Mit dieser Abstraktion können Sie denselben Datensatz über viele Pipelines und Aktivitäten hinweg wiederverwenden.

Verbundener Dienst

Verknüpfte Dienste enthalten die Verbindungsdetails - Serveradressen, Authentifizierungsdaten und Sicherheitseinstellungen -, die für den Zugriff auf externe Datenspeicher erforderlich sind. Ein verknüpfter Dienst ist im Wesentlichen eine Verbindungszeichenfolge auf Steroiden. Sie können mit Azure SQL Database, lokal verfügbarem Oracle, Amazon Redshift, Salesforce und vielen anderen verknüpfen. Durch die Trennung von Datensatzdefinitionen von Verbindungsinformationen können Sie Anmeldeinformationen an einem Ort aktualisieren, ohne jede Pipeline zu berühren.

Integration Runtime

Die Integrations-Runtime (IR) stellt die Rechenumgebung bereit, in der Aktivitäten ausgeführt werden. ADF bietet drei Arten von IR an: Azure (vollständig serverlos für Cloud-zu-Cloud-Operationen), Self-Hosted (installiert in Ihrem Netzwerk, für den Zugriff auf lokale oder private Daten) und Azure-SSIS (gewidmet für die Ausführung von SQL Server Integration Services-Paketen).

Auslöser

Trigger definieren, wann eine Pipeline läuft. Sie können Schedule Trigger (z. B. täglich um 2 Uhr), Tumbling-Fenstertrigger (für feststehende, nicht überlappende Intervalle wie stündlich oder täglich) und event-based Trigger (reagierend auf Ereignisse wie eine neue Datei, die im Blob Storage ankommt) verwenden. Trigger können Laufzeitparameter an Pipelines übergeben, wodurch eine dynamische, kontextbewusste Ausführung ermöglicht wird.

Integration Runtime Types verstehen

Die Integrationslaufzeit ist der Motor, der Ihre Pipelines antreibt. Die Wahl des richtigen Typs ist eine grundlegende Entscheidung, die sich auf Konnektivität, Sicherheit und Kosten auswirkt.

Azure Integration Runtime (Azure IR)

Azure IR ist die Standardwahl für die meisten Cloud-nativen Szenarien. Es läuft in einer verwalteten, serverlosen Umgebung, die automatisch auf der Grundlage der Arbeitslast skaliert wird. Sie müssen keine VMs bereitstellen oder Software-Updates durchführen. Azure IR ist ideal zum Kopieren von Daten zwischen Cloud-Datenspeichern (z. B. Azure Blob zu Azure SQL) und zum Ausführen von Mapping-Datenflüssen. Es unterstützt die höchste Übereinstimmung unter allen IR-Typen und kann mit verschiedenen Rechentypen konfiguriert werden (allgemein, speicheroptimiert) und Kernzahlen, um Ihren Leistungsanforderungen zu entsprechen.

Für Kopieraktivitäten können Sie die Parallelität steuern, indem Sie Data Integration Units (DIUs) einstellen. Eine DIU stellt die Verarbeitungsleistung dar, die einem Kopiervorgang zugewiesen wird. Standardmäßig verwendet ADF Autoscaling, aber Sie können die Anzahl der DIUs manuell einstellen, um den Durchsatz im Vergleich zu den Kosten zu optimieren. Azure IR bietet auch Time to Live (TTL) für Datenflüsse, was einen warmen Cluster nach Beendigung eines Auftrags am Leben erhält und die Startlatenz für nachfolgende Durchläufe reduziert.

Selbst gehostete Integration Runtime

Wenn Ihre Datenquellen hinter einer Firewall leben - in Unternehmensrechenzentren, virtuellen privaten Netzwerken oder lokalen Datenbanken - benötigen Sie Self-Hosted IR. Diese Laufzeit wird als leichte Anwendung auf einem Windows-Computer (oder einer VM) in Ihrem Netzwerk installiert. Es kann in einem Hochverfügbarkeitscluster für Zuverlässigkeit bereitgestellt werden und unterstützt sowohl Datenbewegung als auch Datenflussausführung.

Self-Hosted IR fungiert als Brücke zwischen ADF und Ihren privaten Daten. Es verschlüsselt den gesamten Datenverkehr und verwendet nur die ausgehende Kommunikation, so dass Sie keine eingehenden Ports öffnen müssen. Häufige Anwendungsfälle sind das Kopieren von Daten von SQL Server vor Ort nach Azure, die Integration von Point-of-Sale-Systemen mit Cloud-Analysen und das Verschieben von Dateien zwischen internen Dateifreigaben und Azure Data Lake. Der Kompromiss besteht darin, dass Sie die Software-Updates verwalten, die Ressourcenauslastung überwachen und sicherstellen müssen der Host-Computer läuft immer.

Azure-SSIS Integration Laufzeit

Wenn Sie bereits SQL Server Integration Services (SSIS) Pakete haben, können Sie mit Azure-SSIS IR diese mit minimalen Änderungen an Azure verschieben. Diese Laufzeit ist ein vollständig verwalteter Cluster von Azure VMs, die die SSIS Engine ausführen. Sie können Ihre .ispac Dateien direkt bereitstellen und sie werden auf dem Cluster genauso ausgeführt wie auf einem lokalen Server.

Azure-SSIS IR unterstützt alle Standard-SSIS-Anschlüsse und kann über eine Self-Hosted IR in Azure SQL Managed Instance, Azure SQL Database und lokale Quellen integriert werden. Microsoft bietet bis zu 88% Kosteneinsparungen mit Azure Hybrid Benefit, wenn Sie über bestehende SQL Server-Lizenzen verfügen. Dies ist der einzige vollständig kompatible SSIS-Dienst in der Cloud, was ihn zu einem natürlichen Migrationspfad für Unternehmen mit hohen Investitionen in SSIS macht.

Mapping Data Flows: Codefreie Transformationen

Durch die Zuordnung von Datenflüssen können Sie komplexe Datentransformationen visuell gestalten, ohne eine einzelne Zeile Code zu schreiben. Sie laufen auf Apache Spark Clustern, die von ADF verwaltet werden, so dass Sie eine verteilte Verarbeitung in großem Maßstab erhalten. Datenflüsse werden auf einer interaktiven Canvas erstellt, auf der Sie Transformationsschritte hinzufügen, Ergebnisse in Echtzeit anzeigen und die Debug-Logik vor dem Bereitstellen.

Visuelle Designerfahrung

Der Datenfluss-Designer umfasst eine Canvas (wo Sie Transformationen ziehen und verbinden), ein Konfigurationsfeld (zum Festlegen von Eigenschaften wie Spaltenzuordnungen und Ausdrücken) und einen Echtzeit-Datenvorschaubereich. Sie können die Ausgabe nach jedem Schritt inspizieren, wodurch Fehler frühzeitig erkannt werden können. Die Erfahrung ähnelt der Erstellung eines Flussdiagramms: Sie beginnen mit einer Quelle, wenden eine Reihe von Transformationen an und landen das Ergebnis in einer Senke.

Transformationskategorien

ADF organisiert Transformationen in Gruppen, die Ihnen helfen, schnell das richtige Werkzeug zu finden:

  • Mehrere Inputs/Outputs: Join, Conditional Split, Exists, Union, Lookup und New Branch ermöglichen es Ihnen, Datenströme zu kombinieren oder zu teilen.
  • Schema-Modifikatoren: Abgeleitete Spalte, Select, Aggregate, Pivot, Unpivot, Window und Rank ermöglichen es Ihnen, die Struktur und den Inhalt Ihrer Daten neu zu gestalten.
  • Row-Modifikatoren: Filter, Sort, Alter Row und Assert konzentrieren sich auf die Auswahl, Bestellung oder Markierung von Zeilen.
  • Formatter: Flatten, Parse und Stringify behandeln komplexe Datentypen wie JSON, XML und Arrays.

Jede Transformation beinhaltet einen optimierten Ausdrucks-Builder, der String, Datum, Mathematik und bedingte Logik unterstützt.Sie können integrierte Funktionen verwenden oder Ihre eigenen Ausdrücke mit der ADF-Datenfluss-Ausdruckssprache schreiben.

Performance und Skalierbarkeit

Hinter den Kulissen kompilieren die Mapping-Datenflüsse Ihre visuelle Logik in optimierte Spark-Jobs. ADF übernimmt Partitionierung, Parallelität und Ressourcenzuweisung. Sie können die Leistung steuern, indem Sie den Compute-Typ (allgemein oder speicheroptimiert) und die Anzahl der Kerne für den Cluster auswählen. ADF verwendet derzeit Spark 3.3, was Leistungsverbesserungen und Zugriff auf die neuesten Spark-Funktionen bringt. Für große Datensätze können Partitionierungsstrategien (z. B. Round-Robin, Hash, Range) Transformationen dramatisch beschleunigen. Der offizielle Performance Guide bietet detaillierte Tuning-Empfehlungen.

Erstellen einer Datenpipeline in Azure Data Factory

Der Aufbau einer End-to-End-Datenpipeline umfasst sechs wichtige Schritte, die auf dem vorherigen aufbauen und Ihre Datenintegrationslogik in einen wiederholbaren, automatisierten Prozess verwandeln.

Schritt 1: Linked Services definieren

Zuerst erstellen Sie verknüpfte Dienste für jeden Datenspeicher, den Ihre Pipeline berühren wird. Zum Beispiel könnte ein verknüpfter Dienst für Azure Blob Storage die Kontoschlüsselauthentifizierung verwenden, während ein verknüpfter Dienst für einen lokalen SQL Server die SQL-Authentifizierung verwenden und auf eine selbstgehostete IR verweisen würde. Verwenden Sie verwaltete Identitäten oder Azure Key Vault, um Anmeldeinformationen sicher zu speichern, anstatt sie zu festcodieren.

Schritt 2: Erstellen von Datensätzen

Als nächstes definieren Sie Datensätze, die die spezifischen Datenstrukturen darstellen, mit denen Sie arbeiten werden. Ein Datensatz verweist auf einen verknüpften Dienst und fügt Details wie Dateipfade, Tabellennamen und Formatoptionen (CSV, Parquet, JSON) hinzu. Beispielsweise können Sie einen Datensatz für eine CSV-Datei in Blob Storage und einen anderen für eine Tabelle in Azure SQL erstellen.

Schritt 3: Entwerfen Sie die Pipeline

Verwenden Sie die Pipeline-Canvas, um Aktivitäten hinzuzufügen. Ziehen Sie eine Copy Data-Aktivität, setzen Sie ihre Quelle und sinken Sie auf die von Ihnen erstellten Datensätze und konfigurieren Sie alle Spalten-Mappings oder Staging-Einstellungen. Fügen Sie für Transformationen eine Data Flow-Aktivität hinzu, die auf einen vorgefertigten Mapping-Datenfluss verweist. Chain-Aktivitäten mit Erfolgs- / Fehlerbedingungen, Schleifen und Zweigen, um komplexe Orchestrierungen zu erstellen.

Schritt 4: Trigger konfigurieren

Wählen Sie, wie Sie Ihre Pipeline starten. Ein Zeitplan-Trigger könnte sie jeden Morgen um 6 Uhr ausführen. Ein taumelnder Fenster-Trigger könnte stündliche Chargen verarbeiten. Ein Ereignis-Trigger könnte ausgelöst werden, sobald eine neue Datei in einem bestimmten Ordner landet. Trigger können Parameter (z. B. die Fensterstartzeit) an die Pipeline übergeben, wodurch sie dynamisch werden.

Schritt 5: Testen und Debug

Vor der Veröffentlichung können Sie den Debug-Modus von ADF verwenden, um die Pipeline interaktiv auszuführen. Sie können Haltepunkte festlegen, Zwischendaten prüfen und Ausführungsprotokolle überprüfen. Debug-Läufe erfordern keine veröffentlichte Pipeline, so dass Sie schnell iterieren können. Sobald Sie zufrieden sind, veröffentlichen Sie die Pipeline für den ADF-Dienst, wo sie für die geplante oder manuelle Ausführung verfügbar ist.

Schritt 6: Überwachen und Optimieren

Nach der Bereitstellung überwachen Sie Ihre Pipeline-Läufe in der ADF-Überwachungsansicht. Sie können Status, Dauer, gelesene/geschriebene Daten und detaillierte Protokolle auf Aktivitätsebene sehen. Richten Sie Warnungen (über Azure Monitor) ein, um Ihr Team zu benachrichtigen, wenn eine Pipeline ausfällt oder einen Schwellenwert überschreitet. Verwenden Sie diese Daten, um langsame Phasen zu identifizieren, DIU- oder Clustereinstellungen anzupassen und Kosten zu optimieren. Eine regelmäßige Überwachung ist unerlässlich, um zuverlässige Datenoperationen zu gewährleisten.

Vorteile der Verwendung von Azure Data Factory

Azure Data Factory bietet eine Vielzahl von Vorteilen, die es zu einem starken Konkurrenten für jede Datenintegrations-Workload machen.

Skalierbarkeit und Performance

ADF ist auf Skalierung ausgelegt. Es kann Petabyte an Daten verarbeiten, indem es Rechenressourcen automatisch nach Bedarf bereitstellt. Es gibt keine Vorab-Kapazitätsplanung: Sie definieren Ihre Pipelines und ADF verwaltet die Cluster, Netzwerke und Retries. Dieser serverlose Ansatz stellt sicher, dass Sie genügend Ressourcen für große Datenbursts haben, ohne für Leerlaufkapazität zwischen den Läufen zu bezahlen.

Umfangreiche Integrationsmöglichkeiten

Mit über 90 integrierten Konnektoren kann ADF Daten aus praktisch jeder Quelle aufnehmen: Big Data Stores (Amazon Redshift, Google BigQuery, HDFS), Enterprise Data Warehouses (Oracle Exadata, Teradata), SaaS-Apps (Salesforce, Marketo, ServiceNow) und Dateifreigaben. Alle Konnektoren werden von Microsoft gewartet, so dass Sie keine Treiber installieren oder API-Änderungen durchführen müssen. Wenn kein integrierter Konnektor vorhanden ist, können Sie die Copy Aktivität mit benutzerdefinierten REST- oder ODBC-Aufrufen verwenden.

Automatisierung und Orchestrierung

ADF zeichnet sich durch die Automatisierung von mehrstufigen Workflows aus. Sie können Pipelines planen, basierend auf Dateieingängen auslösen oder über REST API aufrufen. Die Orchestrierungs-Engine unterstützt Parallelität, bedingte Verzweigung, Schleifen und Fehlerbehandlung. Zum Beispiel können Sie eine Pipeline entwerfen, die versucht, Daten zu kopieren, und wenn sie fehlschlägt, eine E-Mail sendet und zweimal versucht. Mit einem Limit von 80 Aktivitäten pro Pipeline können Sie sogar die komplizierteste Geschäftslogik modellieren.

Umfassende Überwachung und Alarmierung

Jeder Pipeline-Lauf generiert detaillierte Protokolle, die Sie im ADF-Portal überprüfen oder nach Azure Monitor und Log Analytics exportieren können. Sie können die Abstammung über Aktivitäten hinweg verfolgen, die Leistung der Datenbewegung messen und proaktive Warnungen auf Fehler oder verdächtige Verzögerungen einrichten. Die Integration mit Azure Monitor ermöglicht es Ihnen, benutzerdefinierte Dashboards und Aufbewahrungsrichtlinien für die Compliance zu erstellen.

Kosteneffektives Preismodell

ADF verwendet ein verbrauchsbasiertes Preismodell. Sie bezahlen für Aktivitätsläufe, Datenbewegungen (DIU-Stunden), Transformationen (vCore-Stunden für Datenflüsse) und operative Lese-/Schreibvorgänge. Es gibt keine feste monatliche Gebühr, so dass kleine Workloads sehr wenig kosten. Für vorhersehbare hochvolumige Jobs können Sie die Kosten durch richtige DIU-Einstellungen optimieren, TTL für Datenflusscluster aktivieren und Pipelines konsolidieren. Die ADF-Preisseite enthält einen Rechner, um die Kosten basierend auf Ihren Workload-Parametern zu schätzen.

Hybrid- und Multi-Cloud-Unterstützung

Mit Self-Hosted IR können Sie sich mit lokalen Datenquellen hinter Firewalls verbinden, was ADF zu einer natürlichen Lösung für hybride Architekturen macht. Es unterstützt auch die Cross-Cloud-Datenbewegung: Sie können Daten von AWS S3 in Azure Data Lake oder von Google Cloud Storage in Azure Blob kopieren, alles in einer einzigen Pipeline. Diese Multi-Cloud-Funktion ermöglicht es Unternehmen, die Sperrung zu vermeiden und den besten Speicher für jede Workload auszuwählen.

Enterprise-Grade-Sicherheit und Compliance

Sicherheit ist in jeder Schicht eingebettet. ADF unterstützt verwaltete Identitäten (die das Berechtigungsmanagement eliminieren), Azure Key Vault Integration und Service-Prinzipale für die Authentifizierung. Alle übertragenen Daten sind mit TLS 1.2 verschlüsselt. Für private Konnektivität können Sie Azure Private Link verwenden, um den Datenverkehr im Microsoft-Netzwerk zu halten. ADF erfüllt ISO 27001, SOC 2, HIPAA und andere Industriestandards, wodurch es für regulierte Branchen wie Finanzen und Gesundheitswesen geeignet ist.

Azure Data Factory Pricing erklärt

Zu verstehen, wie ADF-Gebühren Ihnen helfen, Kosten zu budgetieren und zu optimieren. Das Preismodell ist granular, mit mehreren Dimensionen, die sich je nach Nutzung akkumulieren.

Pipeline Orchestrierung und Ausführung

Sie werden pro Aktivitätslauf zuzüglich der während der Ausführung verbrauchten Integrationslaufzeit in Rechnung gestellt. Aktivitätsläufe werden pro Ausführung berechnet (z. B. das Ausführen einer Copy Data-Aktivität kostet einmal einen kleinen Betrag). Integrationslaufzeiten variieren je nach Typ: Azure IR-Gebühren für den verwendeten Compute, während Self-Hosted IR-Gebühren nur für die Orchestrierung (die zugrunde liegende Host-Maschine liegt in Ihrer Verantwortung).

Kosten der Datenbewegung

Kopieraktivitäten verbrauchen Data Integration Units (DIUs). Microsoft berechnet 0,25 USD pro DIU-Stunde (Stand: aktueller öffentlich verfügbarer Preis). Die Anzahl der erforderlichen DIUs hängt von Datenvolumen, Quelle/Senke-Leistung und davon ab, ob Daten Regionen durchqueren. Beispielsweise kann das Kopieren von 10 GB innerhalb desselben Rechenzentrums weniger DIU-Stunden benötigen als das Kopieren von 100 GB auf Kontinenten.

Datenflussausführung

Mapping-Datenflüsse werden in vCore-hours abgerechnet. Sie wählen den Compute-Typ (allgemein oder speicheroptimiert) und die Anzahl der vCores (z. B. 8, 16, 32). Die Gesamtkosten entsprechen den verbrauchten vCore-hours multipliziert mit der jeweiligen Rate. Sie können die Kosten reduzieren, indem Sie TTL auf der IR aktivieren, wodurch der Cluster nach der Ausführung für einen kurzen Zeitraum am Leben bleibt und Kaltstarts für nachfolgende Läufe vermieden werden. Verwenden Sie für die Entwicklung den Debug-Modus, der auf einem kleineren Cluster läuft und mit einer niedrigeren Rate geladen wird.

Vorhaben und Überwachung

Lese-/Schreiboperationen kosten 0,50 US-Dollar pro 50.000 modifizierten oder referenzierten Entitäten (Datensätze, verknüpfte Dienste, Pipelines). Überwachungsoperationen (Retrieving Run Records) kosten 0,25 US-Dollar pro 50.000 Datensätze. Diese Kosten sind im Vergleich zu Ausführungskosten normalerweise vernachlässigbar, können sich jedoch addieren, wenn Ihr Team Hunderte von Pipelines erstellt und tiefe Überwachungsabfragen ausführt.

Kostenoptimierungsstrategien

  • Verwenden Sie den Azure Pricing Calculator, um die Kosten vor dem Bau von Pipelines zu modellieren.
  • Konsolidieren Sie kleine, sich wiederholende Pipelines in parametrisierte, wiederverwendbare Vorlagen.
  • Stellen Sie TTL auf Azure IR für Datenflüsse ein, um warme Cluster zu erhalten (empfohlen mindestens 10 Minuten für die Produktion).
  • Richtige DIU-Zuweisung für Kopieraktivitäten: Beginnen Sie mit der automatischen Skalierung und passen Sie sie auf der Grundlage von Leistungsprotokollen an.
  • Planen Sie nicht-kritische Pipelines während der Off-Peak-Zeiten, wenn Sie sich in einer Region mit variablen Preisen befinden.
  • Überprüfen und löschen Sie regelmäßig nicht verwendete Pipelines, Datensätze und Trigger.

Azure Data Factory vs. AWS Glue: Ein Vergleich

ADF und AWS Glue sind die führenden Cloud-ETL-Dienste, unterscheiden sich jedoch in Philosophie und Stärken.

Architektur und Designphilosophie

AWS Glue neigt zu einem Code-First-Ansatz: Sie schreiben PySpark- oder Scala-Skripte, um Transformationen zu definieren. ADF hingegen betont eine visuelle Low-Code-Erfahrung, unterstützt aber auch Code über benutzerdefinierte Aktivitäten oder Notizbücher. Wenn Ihr Team Spark bequem schreibt, fühlt sich Glue vielleicht natürlicher an. Wenn Sie Drag-and-Drop mit reichen visuellen Vorschauen bevorzugen, passen die Mapping-Datenströme von ADF besser zusammen.

Preismodelle

Glue verwendet ein einfaches DPU-Stundenmodell (Data Processing Units). ADF hat mehrere Kostenkomponenten (Orchestrierung, DIU, vCore, Operationen), die es komplexer zu schätzen, aber auch flexibler für einfache Workloads machen können. Beispielsweise kann ein kleiner, seltener Kopierauftrag in ADF weniger kosten als ein Glue-Job, weil Sie nicht für einen vollständigen Spark-Cluster bezahlen.

Integration und Ökosystem

Wenn Ihr Unternehmen bereits Microsoft-Tools (SQL Server, Active Directory, Power BI, Azure Synapse) einsetzt, bietet ADF die tiefste Integration. AWS Glue passt natürlich in das AWS-Ökosystem (S3, Redshift, Athena, Glue Catalog) und die Wahl liegt oft darin, welcher Cloud-Anbieter Ihre primäre Plattform ist.

SSIS Paketunterstützung

ADF bietet native Unterstützung für SSIS-Pakete über Azure-SSIS IR, sodass Sie vorhandenen Code ohne Umschreiben migrieren können. AWS Glue bietet keine SSIS-Kompatibilität; Sie müssten Pakete mit manuellem Aufwand oder Tools von Drittanbietern in Glue-Scripts konvertieren. Für Unternehmen mit großen SSIS-Investitionen ist ADF die klare Wahl.

Skalierbarkeit und Workload Management

Glue ist vollständig serverlos und skaliert automatisch Spark-Cluster. ADF setzt auf Integration Runtimes, die Ihnen manuelle Kontrolle über die Umgebungskonfiguration (Regionen, Compute-Typ, Kernanzahl) geben. Diese Steuerung macht ADF besser geeignet für hybride Setups, die Cloud- und On-Premise-Systeme überbrücken. Beide können für Terabyte an Daten skalieren, aber der operative Overhead unterscheidet sich.

Best Practices für die Verwendung von Azure Data Factory

Die Einhaltung etablierter Best Practices stellt sicher, dass Ihre Pipelines robust, wartbar und kosteneffizient sind.

Bauen Sie modulare und wiederverwendbare Pipelines

Bauen Sie kleine, einzweckige Pipelines anstelle monolithischer Pipelines. Verwenden Sie Parameter, um sie wiederverwendbar zu machen. Erstellen Sie beispielsweise eine parametrierte Pipeline, die Daten aus einer beliebigen Tabelle kopiert, wobei der Tabellenname und die Quellverbindung als Parameter übergeben werden. Dies reduziert die Anzahl der Pipelines, die Sie pflegen müssen, und gewährleistet eine konsistente Logik.

Robuste Fehlerbehandlung implementieren

Kritische Aktivitäten in Try-Catch-Muster mit Execute Pipeline-Aktivitäten umwandeln. Retry-Richtlinien konfigurieren (z. B. zweimal mit einem Intervall von 5 Minuten wiederholen) für vorübergehende Fehler. Einen „Failure-Zweig hinzufügen, der eine Warnung per E-Mail oder Slack sendet. Detaillierte Fehlermeldungen in eine Tabelle oder Datei für die Post-Mortem-Analyse eintragen. Pipelines so gestalten, dass Teilfehler nicht zu Beschädigungen von nachgelagerten Systemen führen.

Nutzen Sie Parametrisierung und dynamischen Inhalt

Mit dynamischen Inhaltsausdrücken in ADF (z. B. ) können Sie Pipelines erstellen, die sich ohne manuelle Bearbeitung an Umgebungsänderungen anpassen. Dies ist besonders nützlich für inkrementelle Lasten, bei denen Sie den letzten ausgeführten Zeitstempel passieren müssen.

Sichern Sie Ihre Daten und Credentials

Niemals Hardcode-Geheimnisse. Speichern Sie sie in Azure Key Vault und verweisen Sie sie über verknüpfte Dienste mit dem Verbindungstyp Key Vault. Verwenden Sie verwaltete Identitäten, wann immer möglich - dies macht die Notwendigkeit von Anmeldeinformationen vollständig aus. Wenden Sie die rollenbasierte Zugriffskontrolle (RBAC) an, um zu begrenzen, welche Benutzer oder Dienstleiter Pipelines bearbeiten oder Start-/Stop-Trigger aktivieren können. Aktivieren Sie Private Link für alle Datenbewegungen, um den Datenverkehr vom öffentlichen Internet fernzuhalten.

Optimieren der Integration Runtime Configuration

Erstellen Sie für Produktionsdatenflüsse Ihren eigenen Azure IR mit einer bestimmten Region, einem Rechentyp (allgemeiner Zweck) und mindestens 8 + 8 (insgesamt 16) vCores. Legen Sie eine 10-minütige TTL fest, um einen warmen Cluster aufrechtzuerhalten, wodurch die Startverzögerung von ~ 5 Minuten auf nahe Null reduziert wird. Beginnen Sie für Kopieraktivitäten mit automatisch skalierbarer DIU und stimmen Sie dann manuell auf der Grundlage von Leistungsmetriken aus der Überwachungsansicht ab.

Überwachen und Optimieren der Leistung

Regelmäßig das Azure Monitor Dashboard auf Pipelineläufe überprüfen. Aktivitäten mit hoher Dauer oder hohem DIU-Verbrauch identifizieren. Kopieraktivitäten optimieren, indem Quelldaten partitioniert werden, indem regionale Kopien inszeniert werden und parallele Kopien aktiviert werden. Partitionsstrategien und Clustergröße für Datenflüsse anpassen. In der Überwachungsansicht den Bericht „Verbrauch verwenden, um zu sehen, wo sich die Kosten konzentrieren.

Implementieren von CI/CD und Versionskontrolle

Verbinden Sie Ihre ADF-Instanz mit einem Git-Repository (Azure DevOps oder GitHub), um Änderungen zu verfolgen und zusammenzuarbeiten. Verwenden Sie separate ADF-Instanzen für Dev, Test und Produktion. Erstellen Sie automatisierte Bereitstellungspipelines, die ARM-Vorlagen aus dem Dev exportieren, Validierungstests durchführen und dann in die Produktion implementieren. Dies reduziert das Risiko manueller Fehler und ermöglicht bei Bedarf Rollbacks. ADF unterstützt jetzt Azure DevOps Server 2022 für lokale Git-Benutzer.

Dokumentieren Sie Ihre Pipelines und Prozesse

Verwenden Sie aussagekräftige Namen für alle Artefakte (z. B. ). Fügen Sie Beschreibungen und Anmerkungen zu komplexen Aktivitäten hinzu. Führen Sie ein Datenliniendokument, das zeigt, wo jeder Datensatz seinen Ursprung hat und welche Transformationen er durchläuft. Gute Dokumentation hilft neuen Teammitgliedern schnell an Bord und erleichtert die Fehlersuche.

Erweiterte Features und Fähigkeiten

ADF bietet neben den Grundlagen mehrere fortschrittliche Funktionen, die reale Datenherausforderungen lösen.

Change Data Capture (CDC)

ADF unterstützt CDC, nur die Zeilen zu extrahieren, die sich seit dem letzten Extrakt geändert haben. Sie können native CDC-Connectoren (für Datenbanken wie SQL Server, Oracle, PostgreSQL) verwenden oder Wasserzeichenspalten manuell implementieren. CDC minimiert die Menge der übertragenen und verarbeiteten Daten und ermöglicht eine Datenreplikation in Echtzeit mit geringer Latenz.

Datenfluss-Debug-Modus

Der Debug-Modus beim Mapping von Datenflüssen ermöglicht es Ihnen, Transformationen interaktiv mit einem Beispiel Ihrer Live-Daten zu testen. Sie können die Ausgabe nach jedem Schritt in einer Vorschau anzeigen, Spaltenwerte untersuchen und schnell iterieren. Debug-Sitzungen verwenden einen kleinen Spark-Cluster, der in Sekunden beginnt, wodurch die Entwicklung viel schneller wird als die Ausführung von Full-Pipeline-Debug-Läufen.

Verwaltetes virtuelles Netzwerk

Managed Virtual Network (VNet) bietet Ihnen Netzwerkisolation für Ihre ADF-Ressourcen. Sie können private Endpunkte für Azure-Dienste erstellen (Blob Storage, SQL-Datenbank usw.), um sicherzustellen, dass Daten niemals das Microsoft-Backbone verlassen. TTL for Managed VNet ermöglicht Ihnen die Kontrolle darüber, wie lange die privaten Endpunkte aktiv bleiben, wobei Sicherheit und Kosten ausgeglichen werden.

Schema Drift Handling

Datenquellen ändern häufig Schemata – neue Spalten werden angezeigt, Datentypen werden geändert oder Spalten werden entfernt. Die Datenflüsse von ADF können die Schemadrift automatisch verarbeiten. Sie können Transformationen konfigurieren, um neue Spalten im laufenden Betrieb zu erkennen, sie zu protokollieren und sie in die Ausgabe aufzunehmen. Dadurch sind Pipelines ohne manuelle Eingriffe widerstandsfähig gegenüber vorgelagerten Änderungen.

Tumbling Window Triggers

Tumbling window triggert Prozessdaten in festen, nicht überlappenden Zeitfenstern. Sie eignen sich ideal für Szenarien wie stündliche Aggregation von Clickstream-Daten oder tägliche Abrechnungsberichte. Der Trigger übergibt automatisch die Fensterstart- und -endzeiten als Parameter und unterstützt bei Bedarf das Backfilling (Reprocessing historischer Fenster).

Integration mit Azure Synapse Analytics

ADF ist tief in Azure Synapse Analytics integriert. Sie können Pipelines direkt innerhalb von Synapse Studio erstellen und die gleichen Datenfluss-Engines und Orchestrierungsfunktionen nutzen. Dies ermöglicht es Ihnen, Datenintegration, Data Warehousing und Big Data Analytics in einer einzigen Plattform zu kombinieren. Die Synapse-Dokumentation deckt den Einstieg ab.

Real-World Use Cases

Azure Data Factory unterstützt die Datenintegration in allen Branchen. Hier sind gängige Muster.

Data Warehouse Modernisierung

Unternehmen, die von lokalen Data Warehouses (SQL Server, Teradata) zu Cloud-Plattformen wie Azure Synapse migrieren, nutzen ADF, um die Migration zu orchestrieren. Sie kopieren historische Tabellen, richten inkrementelle Aktualisierungen ein und transformieren Daten in neue Schemata. Die Fähigkeit von ADF, Batch- und Microbatch-Daten zu verarbeiten, macht den Übergang reibungslos.

Data Lake Einnahme

Unternehmen, die moderne Data Lakes (Azure Data Lake Storage Gen2) bauen, verwenden ADF, um Daten aus operativen Datenbanken, SaaS-Anwendungen, IoT-Geräten und externen APIs aufzunehmen. Pipelines landen Rohdaten im Parquet- oder Delta-Format und wenden dann Schema-on-Read-Muster für den nachgelagerten Verbrauch durch Spark-, Power BI- oder ML-Jobs an.

Hybriddatenintegration

Viele Unternehmen betreiben sowohl On-Premises- als auch Cloud-Systeme. Die Self-Hosted IR von ADF überbrückt diese Umgebungen und ermöglicht den Datenfluss von alten ERP-Systemen in Cloud-Analyse-Pipelines. Beispielsweise könnte ein Fertigungsunternehmen Echtzeit-Sensordaten aus On-Premises-Historikdatenbanken für prädiktive Wartungsmodelle in Azure kopieren.

Business Intelligence und Reporting

ADF ist das Rückgrat vieler BI-Lösungen. Es extrahiert Daten aus Quellsystemen, wendet Geschäftslogik (Aggregationen, Berechnungen) an und lädt sie in analytische Datenbanken, die Power BI oder Tableau abfragen können. Durch die Automatisierung dieser Pipelines stellen Unternehmen sicher, dass ihre Berichte immer auf dem neuesten Stand sind.

Vorbereitung von Machine Learning-Daten

Datenwissenschaftler nutzen ADF, um die Datenvorbereitungsphase von ML-Projekten zu automatisieren. Pipelines können Daten aus verschiedenen Quellen sammeln, Feature Engineering durchführen (z. B. Kodierung, Skalierung, Datumsanalyse) und saubere Datensätze für Azure Machine Learning liefern. Diese Automatisierung erleichtert die Reproduktion von Experimenten und die Bereitstellung von Modellen in die Produktion.

Migration von Legacy ETL Tools

Das Verschieben bestehender ETL-Workloads in die Cloud mag entmutigend erscheinen, aber ADF bietet mehrere Migrationspfade, um den Übergang zu erleichtern.

SSIS Migration

Wenn Sie SSIS-Pakete haben, können Sie diese mit minimalen Änderungen heben und in Azure‐SSIS IR verschieben. Erstellen Sie eine Azure‐SSIS IR, stellen Sie Ihre .ispac-Dateien bereit und führen Sie sie aus. Im Laufe der Zeit können Sie einzelne SSIS-Komponenten durch native ADF-Aktivitäten oder Datenflüsse ersetzen, um die Vorteile der Cloud‐native-Funktionen zu nutzen. Dieser schrittweise Ansatz reduziert das Risiko und beschleunigt die Cloud-Akzeptanz.

Gewebemigrationsassistent

Der Fabric Migrationsassistent von Microsoft (verfügbar im ADF-Portal) hilft beim Verschieben von Pipelines, Notebooks und Spark-Pools von ADF oder Synapse zu Microsoft Fabric. Er wertet Abhängigkeiten aus, schlägt gleichwertige Fabric-Artefakte vor und konvertiert Pipelines automatisch. Dieses Tool ist besonders nützlich für Organisationen, die die einheitliche Lakehouse-Architektur von Fabric übernehmen möchten.

Bewertung und Planung

Vor der Migration alle vorhandenen ETL-Jobs inventarisieren, Datenquellen und -ziele dokumentieren, Abhängigkeiten abbilden und die aktuelle Leistung messen. Verwenden Sie Tools wie Azure Migrate, um die Bereitschaft zu bewerten. Entwerfen Sie dann eine Zielarchitektur mit den Komponenten von ADF, beginnend mit den Pipelines mit dem höchsten Wert und der niedrigsten Komplexität. Testen Sie jede migrierte Pipeline gründlich, bevor Sie das Altsystem deaktivieren.

Erste Schritte mit Azure Data Factory

Um mit ADF zu beginnen, benötigen Sie ein Azure-Abonnement. Sie können sich für ein freies Azure-Konto anmelden, das Credits zum Erkunden von Diensten enthält. Folgen Sie dann dem Quickstart-Leitfaden, um Ihre erste Datenfabrik zu erstellen, eine Pipeline zu definieren und eine einfache Kopieraktivität auszuführen. Der Dienst ist intuitiv genug für Anfänger, aber leistungsstark genug für Workloads auf Unternehmensebene.

Beginnen Sie klein: Verbinden Sie sich mit einem Beispieldatensatz in Blob Storage, kopieren Sie ihn in eine Azure SQL-Tabelle und fügen Sie dann eine einfache Transformation hinzu. Bauen Sie nach und nach Vertrauen auf und erweitern Sie es auf komplexere Szenarien. Die offizielle Microsoft-Dokumentation, Community-Foren und Schulungsmodule zu Microsoft Learn bieten umfangreiche Unterstützung.


Azure Data Factory entwickelt sich ständig weiter und fügt neue Konnektoren hinzu, verbessert die Leistung und integriert sich in Microsoft Fabric. Ganz gleich, ob Sie eine neue Datenplattform erstellen oder bestehende ETL-Prozesse modernisieren, ADF bietet die Zuverlässigkeit, Skalierbarkeit und Flexibilität, die für eine erfolgreiche moderne Datenintegration erforderlich sind.