Table of Contents

Ce qui est Azure Data Factory et pourquoi ça compte

Azure Data Factory (ADF) est un service d'intégration de données cloud-native entièrement géré de Microsoft qui vous permet de construire, de programmer et d'orchestrer des pipelines de données à l'échelle. Il se connecte à plus de 90 connecteurs intégrés, sans maintenance, couvrant des bases de données sur site, des applications SaaS et d'autres plateformes cloud, afin de pouvoir déplacer et transformer des données sans code d'écriture. ADF prend en charge les modèles ETL (extrait, transformation, charge) et ELT (extraction, charge, transformation), ce qui en fait un pilier polyvalent pour les initiatives d'analyse, d'apprentissage automatique et de migration de données.

Les organisations modernes collectent des données à partir de dizaines de sources : bases de données transactionnelles, systèmes CRM, flux IoT, flux de médias sociaux et API externes. La mise en commun de ces données pour analyse ou utilisation opérationnelle est un défi majeur. ADF résout cela en fournissant une interface visuelle pour concevoir des flux de travail, un moteur d'exécution sans serveur qui s'échelle automatiquement et une intégration profonde avec l'écosystème d'Azure (Synapse, Power BI, Azure Machine Learning, Data Lake Storage).

Le service est conçu pour les ingénieurs de données, les développeurs ETL et les professionnels de l'analyse qui ont besoin d'un outil fiable et de qualité pour automatiser le mouvement et la transformation des données. Avec son prix de paiement au fur et à mesure, vous évitez le coût et la complexité de la gestion de votre propre infrastructure.

Composantes de base de l'usine de données Azure

Pour concevoir des solutions efficaces d'intégration des données, vous devez comprendre les éléments de base qu'ADF fournit. Chaque composant a un rôle spécifique et crée ensemble un cadre flexible et répétable pour les flux de données.

Pipeline

Un pipeline est une unité logique de travail qui contient une ou plusieurs activités. Il définit la séquence des tâches nécessaires pour ingérer, transformer et charger les données. Les pipelines peuvent être programmés, déclenchés par des événements ou exécutés à la demande. Ils sont le principal mécanisme d'orchestration des flux de données, et vous pouvez chaîner plusieurs pipelines ensemble en utilisant l'activité Exécuter Pipeline pour construire des workflows complexes et modulaires.

Activité

Les activités sont les étapes individuelles à l'intérieur d'un pipeline.Les types d'activités courants comprennent Copy Data[ (pour déplacer les données entre les magasins), [Data Flow[ (pour les transformations sans code), Processus stocké[ (pour exécuter la logique SQL), Web[ (pour appeler les API REST), et Databricks[ (pour exécuter les tâches Spark).

Ensemble de données

Les ensembles de données sont des références qui pointent vers les données que vous souhaitez utiliser dans vos activités. Ils ne détiennent pas les données eux-mêmes; au lieu de cela, ils décrivent la structure (schema, format, emplacement) et la connectivité. Par exemple, un ensemble de données peut pointer vers un fichier Parquet spécifique dans Azure Data Lake Storage ou une table dans SQL Database. Cette abstraction vous permet de réutiliser le même ensemble de données sur de nombreux pipelines et activités.

Service lié

Les services liés contiennent les détails de connexion — adresses de serveur, identifiants d'authentification et paramètres de sécurité — nécessaires pour accéder aux magasins de données externes. Un service lié est essentiellement une chaîne de connexion sur les stéroïdes. Vous pouvez lier à Azure SQL Database, sur place Oracle, Amazon Redshift, Salesforce, et bien d'autres. En séparant les définitions de ensembles de données des informations de connexion, vous pouvez mettre à jour les identifiants en un seul endroit sans toucher chaque pipeline.

Intégration Durée

L'exécution d'intégration (IR) fournit l'environnement de calcul où les activités s'exécutent. ADF propose trois types d'IR : Azure (sans serveur, pour les opérations cloud-to-cloud), Auto-Hosted (installé sur votre réseau, pour accéder à des données sur site ou privées), et Azure-SSIS (dédié à exécuter des paquets SQL Server Integration Services).

Déclencheur

Les déclencheurs définissent quand un pipeline tourne. Vous pouvez utiliser schedule triggers[ (p. ex., tous les jours à 2h), schedule triggers[ (pour les intervalles de taille fixe, sans chevauchement comme horaire ou quotidien), et schedule-event[ (réactive aux événements comme un nouveau fichier arrivant dans Blob Storage).

Comprendre les types d'intégration

Le temps d'exécution de l'intégration est le moteur qui conduit vos pipelines. Choisir le bon type est une décision fondamentale qui affecte la connectivité, la sécurité et le coût.

Durée de l'intégration Azure (Azure IR)

Azure IR est le choix par défaut pour la plupart des scénarios cloud-natifs. Il fonctionne dans un environnement géré sans serveur qui s'échelle automatiquement en fonction de la charge de travail. Vous n'avez pas besoin de fournir des VMs ou de traiter des mises à jour logicielles. Azure IR est idéal pour copier des données entre les magasins de données cloud (par exemple, Azure Blob à Azure SQL) et pour exécuter des flux de données de cartographie. Il prend en charge la plus grande concordance entre tous les types IR et peut être configuré avec différents types de calcul (usage général, optimisé de la mémoire) et les comptes de cœur pour répondre à vos besoins de performance.

Pour les activités de copie, vous pouvez contrôler le parallélisme en paramétrant Unités d'intégration de données (UID)[.Un ID représente la puissance de traitement attribuée à une opération de copie. Par défaut, ADF utilise l'auto-calcalisation, mais vous pouvez définir manuellement le nombre d'UID pour optimiser le débit par rapport au coût. Azure IR offre également Time to Live (TTL)[ pour les flux de données, qui maintient un cluster chaud vivant après la fin d'un travail, réduisant ainsi la latence de démarrage pour les opérations ultérieures.

Durée d'intégration auto-hosté

Lorsque vos sources de données vivent derrière un pare-feu – dans des centres de données d'entreprise, des réseaux privés virtuels ou des bases de données sur site – vous avez besoin d'une IR auto-hosted. Cet exercice est installé comme une application légère sur une machine Windows (ou VM) à l'intérieur de votre réseau. Il peut être déployé dans un cluster haute disponibilité pour la fiabilité et supporte à la fois le mouvement des données et l'exécution du flux de données.

Il crypte tout le trafic et utilise la communication externe uniquement, de sorte que vous n'avez pas besoin d'ouvrir les ports entrants. Les cas d'utilisation courants comprennent la copie des données depuis SQL Server on-premises vers Azure, l'intégration des systèmes de point de vente avec l'analyse du cloud, et le déplacement des fichiers entre les parts de fichiers internes et Azure Data Lake. L'échange est que vous devez gérer les mises à jour du logiciel, surveiller l'utilisation des ressources et s'assurer que la machine hôte est toujours en marche.

Azure-SSIS Integration Runtime

Si vous avez déjà des paquets SQL Server Integration Services (SSIS), Azure-SSIS IR vous permet de les soulever et de les déplacer vers Azure avec des modifications minimes. Cet exécuttime est un cluster entièrement géré de VMs Azure qui exécute le moteur SSIS. Vous pouvez déployer vos fichiers .ispac directement, et ils s'exécuteront sur le cluster comme ils le feraient sur un serveur sur site.

Azure-SSIS IR prend en charge tous les connecteurs SSIS standard et peut s'intégrer avec Azure SQL Managed Instance, Azure SQL Database et des sources sur site via un IR auto-hosted. Microsoft offre jusqu'à 88 % d'économies avec Azure Hybrid Benefit si vous avez des licences SQL Server existantes. C'est le seul service SSIS entièrement compatible dans le cloud, ce qui en fait un chemin de migration naturel pour les organisations avec des investissements lourds dans SSIS.

Cartographie des flux de données : transformations sans code

La cartographie des flux de données vous permet de concevoir visuellement des transformations complexes de données sans écrire une seule ligne de code. Elles fonctionnent sur des grappes Apache Spark gérées par ADF, de sorte que vous obtenez un traitement distribué à l'échelle. Les flux de données sont écrits sur une toile interactive où vous ajoutez des étapes de transformation, des résultats de prévisualisation en temps réel et une logique de débogue avant de déployer.

Expérience de conception visuelle

Le concepteur de flux de données comprend une toile (où vous faites glisser et connectez des transformations), un panneau de configuration (pour définir des propriétés comme les mappages de colonnes et les expressions) et un panneau d'aperçu des données en temps réel. Vous pouvez inspecter la sortie après chaque étape, ce qui facilite la détection des erreurs tôt. L'expérience est similaire à la construction d'un diagramme de flux : vous commencez par une source, appliquez une série de transformations et atterrissez le résultat dans un évier.

Catégories de transformation

ADF organise des transformations en groupes qui vous aident à trouver rapidement le bon outil :

  • Les entrées/sorties multiples :[ Rejoindre, Split conditionnel, Existe, Union, Lookup et Nouvelle Branche vous permettent de combiner ou de diviser des flux de données.
  • Modificateurs de schéma:[ Colonne dérivée, Sélectionner, Aggregate, Pivot, Unpivot, Fenêtre et Rank vous permettent de remodeler votre structure et votre contenu de données.
  • Modificateurs de la courbe:[ Filtre, tri, alter la ligne et l'Assert se concentrent sur la sélection, la commande ou le marquage des lignes.
  • Formatint, Parse et Stringify gèrent des types de données complexes comme JSON, XML et tableaux.

Chaque transformation comprend un constructeur d'expression optimisé qui prend en charge la logique de chaîne, de date, de math et de condition. Vous pouvez utiliser des fonctions intégrées ou écrire vos propres expressions en utilisant le langage d'expression de flux de données ADF.

Performance et scalabilité

Dans les coulisses, les flux de données de cartographie compilent votre logique visuelle en emplois Spark optimisés. ADF gère la partition, le parallélisme et l'allocation des ressources. Vous pouvez contrôler les performances en sélectionnant le type de calcul (usage général ou optimisé de la mémoire) et le nombre de cœurs pour le cluster. ADF utilise actuellement Spark 3.3, qui apporte des améliorations de performance et l'accès aux dernières fonctionnalités Spark. Pour les gros ensembles de données, les stratégies de partition (par exemple, round-robin, hachage, gamme) peuvent accélérer considérablement les transformations.

Création d'un pipeline de données dans Azure Data Factory

La construction d'un pipeline de données de bout en bout comporte six étapes clés. Chaque étape s'appuie sur la précédente, transformant votre logique d'intégration de données en un processus reproductible et automatisé.

Étape 1: Définir les services liés

Tout d'abord, créez des services liés pour chaque stockage de données que votre pipeline touchera. Par exemple, un service lié pour Azure Blob Storage peut utiliser l'authentification de la clé de compte, tandis qu'un service lié pour un serveur SQL sur site utiliserait l'authentification SQL et pointerait vers un IR auto-hosté. Utilisez des identités gérées ou Azure Key Vault pour stocker les identifiants en toute sécurité au lieu de les coder dur.

Étape 2: Créer des ensembles de données

Ensuite, définissez des ensembles de données qui représentent les structures de données spécifiques avec lesquelles vous travaillez. Un ensemble de données fait référence à un service lié et ajoute des détails comme les chemins de fichiers, les noms de tables et les options de format (CSV, Parquet, JSON). Par exemple, vous pouvez créer un ensemble de données pour un fichier CSV dans Blob Storage et un autre pour une table dans Azure SQL.

Étape 3 : Concevoir le pipeline

Utilisez la toile de pipeline pour ajouter des activités. Faites glisser une activité Copy Data[, définissez sa source et enfoncez les ensembles de données que vous avez créés, et configurez toute correspondance de colonnes ou les paramètres de mise en scène. Pour les transformations, ajoutez une activité Data Flow[ qui fait référence à un flux de données de cartographie pré-construit.

Étape 4: Configurer les déclencheurs

Choisissez comment lancer votre pipeline. Un déclencheur de calendrier pourrait l'exécuter tous les matins à 6h. Un déclencheur de fenêtre de chute pourrait traiter des lots horaires. Un déclencheur d'événement pourrait déclencher dès qu'un nouveau fichier atterrit dans un dossier spécifique. Les déclencheurs peuvent passer des paramètres (p. ex., l'heure de démarrage de la fenêtre) au pipeline, ce qui les rend dynamiques.

Étape 5: Essai et débogage

Avant de publier, utilisez le mode de débogage ADF. Vous pouvez définir des points d'arrêt, inspecter les données intermédiaires et examiner les journaux d'exécution. Les sorties de débogage ne nécessitent pas de pipeline publié, vous pouvez donc l' itérer rapidement. Une fois satisfait, publiez le pipeline au service ADF, où il devient disponible pour l'exécution planifiée ou manuelle.

Étape 6 : Surveiller et optimiser

Après le déploiement, surveillez les opérations de votre pipeline dans la vue de surveillance ADF. Vous pouvez voir l'état, la durée, les données lues/écrites et les journaux détaillés des niveaux d'activité. Configurez des alertes (via Azure Monitor) pour informer votre équipe lorsqu'un pipeline échoue ou dépasse un seuil. Utilisez ces données pour identifier les étapes lentes, ajuster les paramètres de DIU ou de cluster et optimiser les coûts.

Avantages de l'utilisation de Azure Data Factory

Azure Data Factory offre une large gamme d'avantages qui en font un concurrent fort pour toute charge de travail d'intégration de données.

Échelle et performance

ADF est construit pour l'échelle. Il peut gérer les petaoctets de données en fournissant automatiquement des ressources de calcul basées sur la demande. Il n'y a pas de planification de capacité initiale: vous définissez vos pipelines, et ADF gère les clusters, le réseau et les rétries. Cette approche sans serveur vous assure avoir assez de ressources pour les grandes explosions de données sans payer pour la capacité de ralenti entre les pistes.

Capacités d'intégration étendues

Avec plus de 90 connecteurs intégrés, ADF peut ingérer des données de pratiquement n'importe quelle source : les big data stores (Amazon Redshift, Google BigQuery, HDFS), les entrepôts de données d'entreprise (Oracle Exadata, Teradata), les applications SaaS (Salesforce, Marketo, ServiceNow) et les parts de fichiers. Tous les connecteurs sont entretenus par Microsoft, donc vous n'avez pas besoin d'installer des pilotes ou de gérer les modifications de l'API.

Automatisation et orchestre

Vous pouvez programmer des pipelines, les déclencher en fonction des arrivées de fichiers ou les invoquer via l'API REST. Le moteur d'orchestration prend en charge le parallélisme, les branchements conditionnels, les boucles et la gestion des erreurs. Par exemple, vous pouvez concevoir un pipeline qui tente de copier des données, et si elle échoue, envoie un courriel et des rétractations deux fois. Avec une limite de 80 activités par pipeline, vous pouvez modéliser même la logique d'affaires la plus complexe.

Surveillance et alerte globales

Chaque exécution de pipeline génère des journaux détaillés que vous pouvez consulter sur le portail ADF ou exporter vers Azure Monitor et Log Analytics. Vous pouvez suivre la lignage à travers les activités, mesurer les performances de mouvement de données, et mettre en place des alertes proactives pour les défaillances ou les retards suspects. L'intégration avec Azure Monitor vous permet de créer des tableaux de bord personnalisés et des politiques de rétention pour la conformité.

Modèle de tarification rentable

Vous payez pour les parcours d'activité, les mouvements de données (heures de DIU), les transformations (heures de base pour les flux de données) et les lectures/écritures opérationnelles. Il n'y a pas de frais mensuels fixes, donc les petites charges de travail coûtent très peu. Pour des emplois prévisibles à volume élevé, vous pouvez optimiser les coûts en mesurant correctement les paramètres de DIU, en permettant à TTL de regrouper les flux de données et en consolidant les pipelines.

Support hybride et multi-cloud

Avec Auto-Hosted IR, vous pouvez vous connecter aux sources de données sur site derrière les pare-feu, ce qui rend ADF un ajustement naturel pour les architectures hybrides. Il prend également en charge le mouvement de données cross-cloud : vous pouvez copier des données de AWS S3 à Azure Data Lake, ou de Google Cloud Storage à Azure Blob, le tout dans un seul pipeline. Cette capacité multi-cloud permet aux organisations d'éviter le verrouillage et de choisir le meilleur stockage pour chaque charge de travail.

Sécurité et conformité des entreprises

La sécurité est intégrée à chaque couche. ADF prend en charge les identités gérées (qui éliminent la gestion des titres), l'intégration de la clé de contrôle d'azure et les principaux services d'authentification. Toutes les données en transit sont cryptées avec TLS 1.2. Pour la connectivité privée, vous pouvez utiliser Azure Private Link pour maintenir le trafic au sein du réseau Microsoft.

Azure Data Factory Tarification expliquée

Comprendre comment les frais d'ADF vous aident à budgetr et à optimiser les coûts. Le modèle de tarification est granulaire, avec plusieurs dimensions qui s'accumulent en fonction de l'utilisation.

Orchestration et exécution de pipelines

Vous êtes facturé par activité et les heures d'exécution d'intégration consommées pendant l'exécution. Les activités sont facturées par exécution (par exemple, exécuter une activité Copier les données une fois que coûte un petit montant).Les heures d'exécution d'intégration varient selon le type : les frais IR d'azur pour le calcul utilisé, tandis que les frais IR auto-hosted seulement pour l'orchestration (la machine hôte sous-jacente est votre responsabilité).

Frais de déplacement des données

Les activités de copie consomment des unités d'intégration de données (UID). Microsoft facture 0,25 $ par heure de DIU (selon le dernier prix public disponible). Le nombre d'UID requis dépend du volume de données, des performances source/puits et de la question de savoir si les données traversent les régions.

Exécution du flux de données

Vous choisissez le type de calcul (usage général ou optimisé de la mémoire) et le nombre de vCores (p. ex. 8, 16, 32). Le coût total correspond au nombre d'heures de vCore consommées multiplié par le taux applicable. Vous pouvez réduire les coûts en permettant TTL sur l'IR, qui maintient le cluster en vie pendant une courte période après exécution, en évitant les démarrages à froid pour les parcours suivants. Pour le développement, utilisez le mode de débogage, qui fonctionne sur un cluster plus petit et est chargé à un taux inférieur.

Opérations et suivi

Les opérations de lecture/écriture coûtent 0,50 $ par 50 000 entités modifiées ou référencées (données, services liés, pipelines).Les opérations de surveillance (extraction des dossiers de fonctionnement) coûtent 0,25 $ par 50 000 dossiers. Ces coûts sont généralement négligeables par rapport aux coûts d'exécution, mais ils peuvent s'additionner si votre équipe construit des centaines de pipelines et effectue des requêtes de surveillance profonde.

Stratégies d'optimisation des coûts

  • Utilisez la Calculatrice de prix d'Azure pour modéliser les coûts avant de construire des pipelines.
  • Consolider de petits pipelines répétitifs en modèles paramétrés et réutilisables.
  • Définir TTL sur Azure IR pour les flux de données afin de préserver les grappes chaudes (au moins 10 minutes recommandées pour la production).
  • Allocation de DIU de taille droite pour les activités de copie : commencez par l'échelle automatique et ajustez-vous en fonction des journaux de performance.
  • Planifiez des pipelines non critiques pendant les heures creuses si vous êtes dans une région dont le prix est variable.
  • Vérifier et supprimer régulièrement les pipelines, les ensembles de données et les déclencheurs non utilisés.

Nuance Azure Data Factory vs. AWS : une comparaison

ADF et AWS Glue sont les principaux services de cloud ETL, mais ils diffèrent en philosophie et en forces.

Architecture et philosophie du design

AWS Glue s'appuie sur une première approche de code : vous écrivez des scripts PySpark ou Scala pour définir les transformations. ADF, par contre, met l'accent sur une expérience visuelle, peu codée, bien qu'il supporte également le code via des activités ou des cahiers personnalisés. Si votre équipe est à l'aise d'écrire Spark, Glue peut se sentir plus naturel.

Modèles de tarification

La colle utilise un modèle DPU simple (Unités de traitement des données). ADF a plusieurs composantes de coûts (orchestration, DIU, vCore, opérations) qui peuvent rendre plus complexe à estimer mais aussi plus flexible pour les charges de travail simples. Par exemple, un petit travail de copie rare en ADF peut coûter moins cher qu'un travail de colle parce que vous ne payez pas pour un cluster Spark complet.

Intégration et écosystème

Si votre organisation utilise déjà des outils Microsoft (SQL Server, Active Directory, Power BI, Azure Synapse), ADF offre une intégration la plus profonde. AWS Glue s'intègre naturellement dans l'écosystème AWS (S3, Redshift, Athena, Glue Catalog). Le choix revient souvent à quel fournisseur de cloud est votre plateforme principale.

Soutien du paquet SSIS

ADF fournit une prise en charge native des paquets SSIS via Azure-SSIS IR, de sorte que vous pouvez migrer le code existant sans réécrire. AWS Glue n'offre aucune compatibilité SSIS ; vous devriez convertir les paquets en scripts Glue en utilisant des outils d'effort manuel ou tiers.

Évoluabilité et gestion de la charge de travail

La colle est entièrement sans serveur et écaille automatiquement les clusters Spark. ADF s'appuie sur des Runtimes d'intégration qui vous donnent un contrôle manuel sur la configuration de l'environnement (régions, type de calcul, nombre de cœurs). Ce contrôle rend ADF mieux adapté aux configurations hybrides qui bridgeent les systèmes cloud et on-premises.

Meilleures pratiques pour utiliser Azure Data Factory

En suivant les pratiques exemplaires établies, vos pipelines sont robustes, durables et rentables.

Conception Pipelines modulaires et réutilisables

Construisez de petits pipelines à usage unique plutôt que des pipelines monolithiques. Utilisez des paramètres pour les réutiliser. Par exemple, créez un pipeline paramétré qui copie les données de n'importe quelle table, avec le nom de la table et la connexion source passés comme paramètres. Cela réduit le nombre de pipelines que vous devez maintenir et assure une logique cohérente.

Mettre en œuvre une gestion des erreurs robustes

Configurez les politiques de ré-essai (p. ex., réessayer deux fois avec un intervalle de 5 minutes) pour les défaillances transitoires. Ajoutez une branche --Failure-- qui envoie une alerte par courriel ou par Slack. Enregistrez les messages d'erreur détaillés à une table ou à un fichier pour l'analyse post mortem. Concevez des pipelines de sorte que les défaillances partielles ne corrompent pas les systèmes en aval.

Paramètre de levier et contenu dynamique

Utilisez les paramètres pour les chemins de fichiers, les chaînes de connexion et les fenêtres de temps d'exécution. Les expressions de contenu dynamique dans ADF (par exemple, ) vous permettent de construire des pipelines qui s'adaptent aux changements d'environnement sans édition manuelle. Ceci est particulièrement utile pour les charges incrémentales où vous devez passer le dernier timestamp d'exécution.

Sécurisez vos données et vos lettres de créances

Ne jamais avoir de secrets de code dur. Conservez-les dans Azure Key Vault et référez-les à partir de services liés en utilisant le type de connexion Key Vault. Utilisez des identités gérées chaque fois que possible, ce qui élimine complètement le besoin d'identifications. Appliquez le contrôle d'accès basé sur le rôle (RBAC) pour limiter les utilisateurs ou les principaux de service qui peuvent modifier des pipelines ou des déclencheurs de démarrage/arrêt.

Optimiser la configuration d'intégration de l'exécution

Pour les flux de données de production, créez votre propre Azure IR avec une région spécifique, calculez le type (usage général) et au moins 8+8 (16 total) vCores. Définissez un TTL de 10 minutes pour maintenir un cluster chaud, réduisant le délai de démarrage de ~5 minutes à près de zéro.

Surveiller et optimiser les performances

Revoir régulièrement le tableau de bord Azure Monitor pour les parcours de pipelines. Identifier les activités à haute durée ou à forte consommation de DIU. Optimiser les activités de copie en partitionnant les données sources, en utilisant la mise en scène pour les copies trans-régions et en permettant des copies parallèles. Pour les flux de données, ajuster les stratégies de partition et la taille des grappes.

Mettre en oeuvre le CI/CD et le contrôle de la version

Connectez votre instance ADF à un dépôt Git (Azure DevOps ou GitHub) pour suivre les changements et collaborer. Utilisez des instances ADF distinctes pour la dev, le test et la production. Construisez des pipelines de déploiement automatisés qui exportent des modèles ARM de dev, lancent des tests de validation, puis se déploient en production. Cela réduit le risque d'erreurs manuelles et permet des retours si nécessaire.

Documentez vos pipelines et vos procédés

Utilisez des noms significatifs pour tous les artefacts (p. ex. ]. Ajoutez des descriptions et des annotations à des activités complexes. Maintenez un document de lignage de données qui montre où chaque ensemble de données provient et quelles transformations il subit. Une bonne documentation aide les nouveaux membres de l'équipe à bord rapidement et facilite grandement le dépannage.

Caractéristiques et capacités avancées

Au-delà des bases, ADF propose plusieurs fonctionnalités avancées qui résolvent les défis de données du monde réel.

Changement de saisie des données (CDC)

ADF prend en charge CDC pour extraire uniquement les lignes qui ont changé depuis le dernier extrait. Vous pouvez utiliser des connecteurs CDC natifs (pour des bases de données comme SQL Server, Oracle, PostgreSQLTM) ou implémenter manuellement des colonnes filigranes. CDC minimise la quantité de données transférées et traitées, permettant ainsi une réplication des données en temps quasi réel avec une faible latence.

Mode de débogage du flux de données

Le mode de débogage dans la cartographie des flux de données vous permet de tester les transformations interactives contre un échantillon de vos données en direct. Vous pouvez prévisualiser la sortie après chaque étape, examiner les valeurs de colonne et itérer rapidement. Les sessions de débogage utilisent un petit cluster Spark qui commence en quelques secondes, rendant le développement beaucoup plus rapide que les opérations de débogage en pipeline.

Réseau virtuel géré

Le réseau virtuel géré (VNet) vous permet d'isoler vos ressources ADF. Vous pouvez créer des paramètres privés pour les services Azure (Blob Storage, SQL Database, etc.), vous assurant que les données ne quittent jamais l'épine dorsale de Microsoft.

Manipulation de la dérive du schéma

Les sources de données changent souvent de schéma : de nouvelles colonnes apparaissent, les types de données changent ou les colonnes sont supprimés. La cartographie des flux de données ADF=s peut gérer automatiquement la dérive du schéma. Vous pouvez configurer les transformations pour détecter de nouvelles colonnes à la volée, les enregistrer et les inclure dans la sortie.

Déclencheurs de fenêtres à trébucher

Les déclencheurs de fenêtres de saut traitent les données dans des fenêtres de temps fixes et non-overlapping. Ils sont idéaux pour des scénarios comme l'agrégation horaire des données de clicstream ou des rapports de facturation quotidiens. Le déclencheur passe automatiquement les heures de début et de fin de la fenêtre comme paramètres, et il prend en charge le remblayage (retraitement des fenêtres historiques) si nécessaire.

Intégration avec Azure Synapse Analytics

ADF est profondément intégré à Azure Synapse Analytics. Vous pouvez construire des pipelines directement à l'intérieur de Synapse Studio, partageant les mêmes capacités de flux de données et d'orchestration. Cela vous permet de combiner l'intégration de données, l'entreposage de données et l'analyse de données massives dans une seule plateforme.

Cas d'utilisations réelles dans le monde

Azure Data Factory permet l'intégration de données dans les différentes industries. Voici des modèles communs.

Modernisation de l ' entrepôt de données

Les entreprises qui migrent des entrepôts de données sur site (SQL Server, Teradata) vers des plateformes cloud comme Azure Synapse utilisent ADF pour orchestrer la migration. Elles copient des tables historiques, mettent en place des mises à jour progressives et transforment les données pour s'adapter à de nouveaux schémas.

Données Ingestion du lac

Les organisations qui construisent des lacs modernes de données (Azure Data Lake Storage Gen2) utilisent ADF pour ingérer des données provenant de bases de données opérationnelles, d'applications SaaS, de dispositifs IoT et d'API externes.

Intégration des données hybrides

De nombreuses entreprises exploitent des systèmes sur site et des systèmes cloud. ADF=S Auto-Hosted IR relie ces environnements, permettant aux données des systèmes ERP existants de circuler dans des pipelines d'analyse de cloud. Par exemple, une entreprise de fabrication peut copier des données de capteurs en temps réel à partir de bases de données d'historiens sur site à Azure pour des modèles de maintenance prédictive.

Renseignements commerciaux et rapports

ADF est l'épine dorsale de nombreuses solutions BI. Il extrait des données des systèmes sources, applique la logique opérationnelle (agrégations, calculs) et les charge dans des bases de données analytiques que Power BI ou Tableau peuvent interroger. En automatisant ces pipelines, les organisations s'assurent que leurs rapports sont toujours à jour.

Préparation des données d'apprentissage automatique

Les Data Scientists utilisent ADF pour automatiser la phase de préparation des données des projets ML. Pipelines peut collecter des données de plusieurs sources, effectuer l'ingénierie des fonctionnalités (par exemple, encodage, mise à l'échelle, analyse de date), et fournir des ensembles de données propres à Azure Machine Learning. Cette automatisation facilite la reproduction des expériences et le déploiement des modèles dans la production.

Migration à partir des outils de l'ETL hérités

Le déplacement des charges de travail existantes de l'ETL vers le cloud peut sembler redoutable, mais ADF fournit plusieurs voies de migration pour faciliter la transition.

Migration SSIS

Si vous avez des paquets SSIS, vous pouvez les déplacer vers Azure‐SSIS IR avec des modifications minimes. Créez un IR Azure-SSIS, déployez vos fichiers .ispac et les exécutez. Au fil du temps, vous pouvez remplacer les composants SSIS individuels par des activités ADF natives ou des flux de données pour profiter des fonctionnalités cloud-native.

Assistant à la migration des tissus

Microsoft , assistant de migration de tissu (disponible dans le portail ADF) aide à déplacer les pipelines, les carnets et les piscines Spark de ADF ou Synapse à Microsoft Fabric. Il évalue les dépendances, suggère des artefacts de tissu équivalents, et convertit les pipelines automatiquement. Cet outil est particulièrement utile pour les organisations qui cherchent à adopter Fabric , architecture unifiée de la maison de lac.

Évaluation et planification

Avant de migrer, entreposez tous les emplois existants de ETL, documentez les sources de données et les destinations, les dépendances de la carte et mesurez la performance actuelle. Utilisez des outils comme Azure Migrez pour évaluer la préparation.

Commencer avec Azure Data Factory

Pour commencer à utiliser ADF, vous avez besoin d'un abonnement Azure. Vous pouvez vous inscrire à un compte gratuit Azure[ qui comprend des crédits pour explorer les services. Ensuite, suivez le quickstart guide[ pour créer votre première usine de données, définir un pipeline et exécuter une simple activité de copie.

Commencez petit : connectez-vous à un ensemble de données dans Blob Storage, copiez-le à une table SQL Azure, puis ajoutez une transformation simple. Construisez la confiance progressivement et élargissez-vous à des scénarios plus complexes. La documentation officielle de Microsoft, les forums communautaires et les modules de formation sur Microsoft Learn fournissent un soutien étendu.


Azure Data Factory continue d'évoluer, ajoutant de nouveaux connecteurs, des améliorations de performance et une intégration avec Microsoft Fabric. Que vous construisiez une nouvelle plate-forme de données ou modernisiez les processus ETL existants, ADF offre la fiabilité, l'évolutivité et la flexibilité nécessaires pour réussir dans l'intégration moderne des données.