相性データ移行チャレンジの克服

重要なビジネスデータを保持する一方で、メインフレーム、オンプレミスのデータベース、または10年にわたるERPプラットフォームが、現代のクラウド環境の柔軟性、スケーラビリティ、コスト効率性を欠かせません。日常的な操作を中断することなく、このデータを移行することは、高い取り組みです。Azure Data Factory(ADF)は、これらの課題を解決する、サーバーレスなデータ統合サービスを提供し、組織が従来のソースからデータを編集し、自動化することを可能にします。

Azure Data Factoryの理解

Azure Data Factoryは、Microsoftのクラウドベースの抽出物、変換、ロード(ETL)、抽出、ロード、トランスフォーム(ELT)サービスです。 これにより、さまざまなオンプレミスとクラウドソースからデータをインジェストするデータパイプラインを構築するためのビジュアルインターフェイスとコード優先オプションが提供されます。 そのコアでは、ADFは]]の統合ランタイム(IR)を使用して、ネットワーク全体でデータソースに接続し、キーとレガシーシステム間の安全な橋を提供します。

  • []パイプライン:]]データの動きと変換を実行している活動の論理グループ化。
  • []リンクサービス:[]]] 接続文字列 ソースと宛先システムを指します。
  • [データセット:[]]]] アクティビティで使用されるデータ構造の名称表示。
  • [ トリガー:] タイムまたはイベントベースのパイプラインを実行するためのメカニズム。

ADFのサーバーレスな自然は、Microsoft がスケーリング、パッチ作成、高可用性を処理するインフラを管理する手段ではありません。これにより、限られた IT リソースを持つ組織にとって特に魅力的になります。

Explore the official Azure Data Factory documentation →

レガシーの移行のための重要な機能

幅広いコネクティビティ

ADFは、[]のSQL Server、Oracle、SAP、IBM Db2、MySQL、PostgreSQL、フラットファイル、およびメインフレームデータソースを含む100以上の組み込みコネクタをサポートしています。 セルフホスト型の統合ランタイムを使用すると、ファイアウォールの背後にあるオンプレミスシステムを確実にアクセスできます。 これは、カスタムコードまたはサードパーティのブリッジツールの必要性を排除します。

スケールでのデータの変換

マッピングデータフローは、join、集計、pivoting、およびデータ品質チェックなどの機能を備えた視覚的、非コード変換を可能にします。複雑なロジックでは、データフロースクリプトまたは[])を計算するインスタンス(Alue Databricks、HDInsight)を使用できます。変換は、データフロースクリプト()または)]をAzure DataBlog DataBlogiet、およびに記録する、および[FLT:]を、および[Analy]に変換する前に、データが、データが、およびデータが、およびデータが、データが、およびデータが、データが、データが、およびデータが、データが、またはデータが、データが、または、または、およびデータが、または、データが、または、または、または、または、または、データが、データが、データが、データが、データが、または、データが、データが、または、または、または、または、またはデータが、または、データが、データが、データ

オーケストラ・シュドリン

細粒されたスケジューリングにより、増分ダンプ、一晩フルロード、またはイベント駆動のトリガーが行えます。 []] トリガー依存]モデルは、成功、失敗、または完了に基づいてチェーンパイプラインを生成し、堅牢なワークフローを作成します。 ダッシュボードと]を監視すると、アジュールモニターがレイテンシ、エラー、および入力されたエラーに関するリアルタイムアラートをリアルタイムに統合できます。

セキュリティとコンプライアンス

ADFは、安全認証のための「]」の暗号化と、公的なインターネットを遮断するために「」と統合する「ADF」で、セキュリティ認証の管理、および」のアジュールプライベートリンク」の暗号化をサポートしています。 コンプライアンス認証(ISO、SOC、HIPAA、GDPR)は、規制業界に適しています。

View Azure Data Factory pricing and tiers →

相続的移行へのフェーズドアプローチ

フェーズ1: 発見と発見評価

従来のシステム、データベーススキーマ、データボリューム、アクセスパターン、および依存関係を調べることから始まります。 ] Azure Migrate または、互換性を評価するためのカスタムプロファイリングスクリプトを使用します。 データの品質の問題を特定し、レコードを識別し、保存された手順またはトリガーに埋め込まれたビジネスルール。 のドキュメントターゲットスキーママッピング [[FLT:]] 。

フェーズ2:パイプラインの設計と開発

ソースと宛先ごとにリンクされたサービスを作成します。 小さなデータセットを抽出するプルーフオブコンセプトパイプラインで始まり、単純な変換を適用し、接続を検証します。 [パラメータ化]を使用して、複数のテーブルやパーティションを処理する。 大規模なデータセットの場合、 ]の透かしを実装して、増分荷重を有効にします。 変更された日付列またはシステム変更フィールドを使用します。

フェーズ3:テストと検証

パイプラインをコピーオンとトランスフォーメーションに対して実行します。 行数、ハッシュチェック、およびソースとターゲット間のサンプルレコードを比較します。 ADFの]データプレビューデバッグモード[]を使用して、隔離問題。 ]]の回帰テストフレームワークを複数回検証する複数の環境(provid)を自動化する(prodedev)、テスト)を設定します。

フェーズ4: 実行とカトオーバー

計画されたダウンタイムウィンドウで最終移行をスケジュールします。ゼロダウンタイム戦略では、[ dual-write Pattern] を使用します。ADF がAzure への増分変更を同期しながら、レガシーシステムに引き続き書き込みます。最終同期後、データの完全性を検証し、アプリケーション接続文字列を切り替えます。モニター ADF パイプラインは、必要に応じて、任意の障害と再処理を実行します。

フェーズ5:最適化と監視

ポストマイグレーション、レビューパイプラインのパフォーマンス。 [] データのフローのパーソナライゼーション]、]]] [データ統合ユニット]カウント、およびステージング場所。 [] セットアップ]パイプラインの故障と遅延のアラート。 Azure ポリシー[FLT:] とセキュリティ基準を強制する] と とセキュリティ基準を強制する。

複雑な移行のための高度な検討

大容量との処理]の処理

データテラバイトでは、複数の並列コピーで[の配布コピーアクティビティを使用します。 パーティション戦略(日付、ハッシュ、または地域)はスループットを改善します。 []]]を使用して、ブロブストレージ[[]]を介して設定して、Ulse SynapseにバルクロードのためのPolyBaseまたはCOPY INTOステートメントを許可します。 モニター - [FLTの実行時間リソース] - リソース[FLT:] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT] - [FLT - [FLT] - [FLT] - [

データ変換の複雑さ

レガシーシステムは、多くの場合、非正規化テーブル、階層データ、またはカスタムファイル形式を持っています。 []]アジュール・データブリック]をPython / Scalaベースの変換、または]]を埋め込むには、ライトビジネスロジック用のAzelle Functions]を使用します。 スキーマの進化については、で読み込むことを検討してください。 デルタ・レイク - 回路図は、回路図をサポートして、回路図をサポートしているアーキテクチャを準備します。

移行中のセキュリティとガバナンス

認証情報には、[]] Azure Key Vault を使用して、機密データの露出を最小限に抑えます。 ]]] を実装します。 対象環境が PII を難読化する必要がある場合、Azure SQL で を隠します。 Azure ポリシー] を HTTPS とバージョンを強化します。 [[FLT] Audit LogF] をすべてのパイプラインで保持します。

リアルワールド成功シナリオ

  • [小売会社:]]は、Azure SQLデータベースに20年旧AS / 400在庫システムを移行しました。 ADFは、夜間にデルタの負荷を処理し、データのマッピングは、クリーンな履歴価格データの流れを処理します。 合計移行は6週間で完了し、99.9%の精度。
  • [ヘルスケアプロバイダー:]]]は、OracleデータベースからAzure SynapseにレガシーなERGデータを移動しました。 セルフホストされたIRでADFを使用して、HIPAA準拠の暗号化と監査を適用して、毎日何百万人もの患者レコードをポンプで使用しました。
  • [製造会社:]]]SAP ECC、レガシーのメインフレーム(z/OS)、SQL Serverから単一のAzure Data Lakeに統合されたデータ。 ADFは、生産システムをハッキングすることなく、多相移行をオーケストラにしました。

移行の代替とのADFの比較

Azure Data Factory は、スケーラブルでコードフリーのオーケストレーションで優れています。他のツールは特定のニーズに合致する場合があります。

  • SSIS(SQL Serverインテグレーションサービス):[Microsoft BIスタックに既に投資した組織に最適だが、インフラ管理がさらに必要である。
  • []Azure Data Studio + dbt:[ より開発者中心で、変換ロジックが複雑でバージョン管理を必要とする場合に便利です。
  • [サードパーティ製のツール(Fivetran、Stitch):[]はSaaSソースのシンプルなセットアップを提供が、高度な変換とネイティブAzure統合が欠如する可能性があります。

ADFは、使いやすさ、ネイティブAzureエコシステムの統合、およびエンタープライズレベルの制御のバランスをとっています。

See a detailed comparison of Azure Data Factory vs. other migration tools →

スムーズな移行のためのベストプラクティス

  • 小さじ:]]を、スケーリングを数百にする前に、単一のテーブルでパイプラインを生成します。
  • [パラメータとメタデータ:[] 構成テーブルによって駆動される再利用可能なパイプラインを構築します。
  • アラート付きのモニター:[ 設定 []] パイプライン健康とコストのダッシュボード]。
  • ロールバックの計画:[]]] 検証が完了するまで、レガシーシステムがアクセスできるようにします。
  • ドキュメントのすべて:]]は、データ行列、パイプライン図、エラー処理手順を維持します。

コンテンツ

Azure Data Factoryは、従来のシステムからデータを移行するというタスクを構造化し、効率的なプロセスに変える堅牢でクラウドネイティブなプラットフォームです。広範なコネクタライブラリ、スケーラブルな変換機能、および堅牢なセキュリティ統合により、組織はデータを安全に管理し、データのインフラストラクチャを近代化することができます。フェーズド・アプローチを踏襲し、ADFの高度な機能を活用することで、ビジネスは、最小限のダウンタイム、低コスト、クラウドベースの分析への明確なパスを実現できます。従来のシステムが、現代の要求の下での崩れを継続するにつれて、ADFの将来のデータブリッジを埋め込むことができます。