Table of Contents
Legacy Data 마이그레이션 도전
Azure Data Factory(ADF)는 기존의 데이터와 데이터의 통합을 통해 데이터의 통합을 가능하게 합니다. Azure Data Factory(ADF)는 데이터의 통합을 통해 데이터의 통합을 가능하게 합니다. Azure Data Factory(ADF)는 데이터의 통합을 통해 데이터의 통합을 간소화하고, 데이터의 통합을 통해 데이터의 통합을 간소화하고, 데이터의 통합을 통해 데이터의 통합을 가능하게 합니다. Azure Data Factory(ADF)는 이러한 과제를 해결하고, 조직을 조직을 통해 데이터를 분석하고, Azure Data의 데이터의 통합을 최소화할 수 있습니다.
Azure Data Factory에 대한 이해
Azure Data Factory는 Microsoft의 클라우드 기반 추출, Transform, Load (ETL) 및 Extract, Load, Transform (ELT) 서비스입니다. 이 기능은 온프레미스 및 클라우드 소스의 다양한 배열에서 데이터를 통합하는 데이터 파이프라인을 구축하는 시각적 인터페이스와 코드 첫 번째 옵션을 제공합니다. 핵심에서 ADF는 Integration Runtime (IR)을 사용하여 네트워크의 데이터 소스에 연결하여 Azure Data 시스템에 대한 보안을 제공합니다.
- Pipelines: 데이터 이동 및 변환을 수행하는 활동의 논리 그룹화.
- Linked Services: 소스 및 목적지 시스템에 대한 연결 문자열.
- Datasets: 활동에 사용되는 데이터 구조의 조회.
- Triggers: 시간 또는 파이프라인을 실행하는 이벤트 기반 메커니즘.
ADF의 서버가 없는 자연은 인프라가 관리되지 않는 것을 의미합니다. Microsoft는 스케일링, 패치 및 높은 가용성을 처리합니다. 이는 제한된 IT 리소스를 가진 조직에 특히 매력적입니다.
Explore the official Azure Data Factory documentation →Legacy Migration의 주요 기능
Broad 연결
ADF는 SQL Server, Oracle, SAP, IBM Db2, MySQL, PostgreSQL], 플랫 파일 및 메인 프레임 데이터 소스를 포함한 100개의 내장 커넥터를 지원합니다. 자체 호스팅 통합 실행 시간을 사용하여 방화벽 뒤에 온프레미스 시스템에 안전하게 액세스할 수 있습니다. 이 사용자 정의 코드 또는 타사 브리징 도구에 대한 필요성을 제거하십시오.
Scale의 데이터 변환
Mapping Data Flows는 참여, 집계, 피봇, 데이터 품질 검사와 같은 기능과 시각적, 코드 변환을 허용한다. 복잡한 논리를 위해 Data Flow Scripts] 또는 Compute Instances (Azure Databricks, HDInsight)를 사용할 수 있다. Transformations는 메모리 또는 Azure Data를 사용하여 데이터를 처리하기 전에 Azure Data를 작성하는 것이 일반적이다.
관현 및 일정
Fine-grained scheduling은 증가 덤프, 야간 완전 부하, 또는 이벤트 구동 트리거를 가능하게합니다. Trigger Dependency 모델은 성공, 실패, 또는 완료, 강력한 워크플로우를 생성하여 체인 파이프를 허용합니다. 대시보드와 Azure Monitor 통합은 대기 시간, 오류, 처리 및 처리에 실시간 경고를 제공합니다.
보안 및 준수
ADF는 나머지와 transit에서 암호화를 지원, ]유효한 식별] 안전한 인증 및 통합 ]Azure Private Link] 공공 인터넷에서 트래픽을 유지. 준수 인증 (ISO, SOC, HIPAA, GDPR) 규제 산업에 적합.
View Azure Data Factory pricing and tiers →Legacy Migration에 대한 단계별 접근
1단계: 발견 및 평가
재고 관리 시스템-database 스키마, 데이터 볼륨, 액세스 패턴 및 의존성에 의해 시작. 사용 Azure Migrate] 또는 사용자 정의 프로파일링 스크립트 호환성을 평가하기. 저장 절차 또는 트리거에 내장 된 데이터 품질 문제, 또는 팬딩 레코드 및 비즈니스 규칙을 식별. Data Lineage Document.
2단계: Pipeline 설계 및 개발
각 소스 및 목적지에 대한 연결 된 서비스를 생성. 데이터의 작은 하위 세트를 추출하는 증거 합의 파이프라인으로 시작, 간단한 변환을 적용, 연결성을 검증. 사용 parameterization] 여러 테이블 또는 파티션을 처리하기 위해. 큰 데이터 세트를 위해, 구현 ]watermarking]을 사용하여 incremental 부하를 활성화하기 위해 - 수정 된 날짜 또는 열량 필드를 사용.
3 단계 : 테스트 및 검증
복사 전용 및 변환 활동에 대한 건조 실행 파이프라인을 실행하십시오. 열 수를 비교하고, 해시 체크 및 소스와 대상 사이의 샘플 레코드를 확인합니다. ADF의 Data Preview 및 Debug Mode를 사용하여 고립 된 문제. Regression Testing Framework]를 설치하여 검증된 다중 환경 (다중한 시험)을 자동화합니다.
4 단계 : 실행 및 컷 오버
계획된 가동 중단 창 도중 최종 이동을 계획하십시오. 0 가동 중단 계획을 위해, 사용 dual write 본 : ADF syncs가 Azure에 증가한 변화를 syncs하면서 유산 체계에 쓰기를 계속하십시오. 최종 동기화 후에, 유효한 자료 무결성 및 스위치 신청 연결 끈. 감시자 ADF 파이프라인은 어떤 실패든지를 위해 실행하고 처리하는 것을 필요로 합니다.
5단계: 최적화 및 모니터링
포스트 마이그레이션, 검토 파이프라인 성능. ]데이터 흐름 파티션], DIU (데이터 통합 단위)[ 카운트, 및 시효 위치. 설정 ]Azure Monitor] 파이프라인 실패와 지연에 대한 경고. 고려 Azure Policy] namicials and security standard.
복잡한 미량에 대한 고급 고려
대용량 처리 및 Performance Tuning
데이터의 테라 바이트에 대해, 사용 ]배당 복사 활동] 여러 병렬 사본과 함께. 파티션 전략 (일시, 해시, 또는 지역) 처리량을 향상. 사용 Blob Storage]를 통해 수행을 허용하는 PolyBase 또는 COPY INTO는 Azure Synapse에 대량 부하에 대한 진술을 허용. 모니터 ]]]]]]. 자원 및 자원의 확장.]
데이터 변환 Complexity
레거시 시스템은 종종 비정상화 된 테이블, 계층 데이터 또는 사용자 정의 파일 형식이 있습니다. Azure Databricks Python/Scala 기반 변환에 대한, 또는 Azure Functions]]]를 사용하여 조명 비즈니스 논리에 대한. 스키마 진화를 위해, Delta Lake[[[FLT:]]]]]Delta Lakes-house-house-house-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko-ko
마이그레이션 중 보안 및 거버넌스
]Azure Key Vault를 사용하여 민감한 데이터의 노출 최소화. 구현 Column-Level Masking] Azure SQL 대상 환경이 PII를 방해하는 경우. 사용 Azure Policy] 에 따라 HTTPS 및 판재. ] ]:7]:]]:7]
Real-World 성공 시나리오
- Retail Company: Azure SQL Database에 20년 이상의 AS/400 재고 시스템을 마이그레이션했습니다. ADF는 밤낮으로 델타 로드를 처리하고, 데이터를 매핑하는 것은 과거 가격 데이터를 정리했습니다. 총 마이그레이션은 99.9% 정확도로 6주 동안 완료되었습니다.
- Healthcare Provider: ON-premises Oracle Database에서 Azure Synapse에 대한 레거시 EHR 데이터를 이동했습니다. ADF를 사용하여 환자의 수백만을 펌프로 각자 호스팅 IR를 사용하여 HIPAA-compliant 암호화 및 감사를 적용하십시오.
- 제조업체: SAP ECC, 레거시 메인프레임(z/OS), SQL Server에서 단일 Azure Data Lake로 통합된 데이터. ADF는 생산 시스템의 반작성 없이 다단계 마이그레이션을 관행했습니다.
마이그레이션 대안으로 ADF 비교
Azure Data Factory 확장 가능한 코드없는 관현악에 발췌한 다른 도구는 특정 요구에 맞게 할 수 있습니다.
- SSIS (SQL Server Integration Services): Microsoft BI stack에 이미 투자한 조직에 대한 베스트, 하지만 더 많은 인프라 관리가 필요합니다.
- Azure Data Studio + dbt:] 더 많은 개발자 중심, 변혁 논리가 복잡하고 버전 컨트롤을 필요로 할 때 유용합니다.
- Third-party tools (Fivetran, Stitch):] SaaS 소스에 대한 간단한 설정 제공하지만 고급 변환 및 기본 Azure 통합이 부족할 수 있습니다.
ADF는 사용, 네이티브 Azure 생태계 통합 및 엔터프라이즈급 제어를 용이하게 하는 강력한 균형을 잡습니다.
See a detailed comparison of Azure Data Factory vs. other migration tools →부드러운 마이그레이션을위한 모범 사례
- Start Small: 수백에 흩어져서 단일 테이블을 가진 파이프라인을 갖는다.
- 사용 매개변수 및 메타데이터: 구성표에 의해 구동되는 재사용 가능한 파이프라인 구축.
- ]Alerts: ]Azure Monitor 대쉬보드를 설치하여 파이프라인의 건강과 비용에 대한.
- Rollback의 플랜: 유효성 검사가 완료될 때까지 접근 가능한 유산 시스템 유지.
- Document Everything: 데이터 전송, 파이프라인 다이어그램 및 오류 처리 절차 유지.
관련 기사
Azure Data Factory는 레거시 시스템에서 구조화, 효율적인 프로세스로 데이터를 마이그레이션하는 데 엄청난 작업을 변환하는 강력한 클라우드 기반 플랫폼입니다. 광범위한 커넥터 라이브러리, 확장 가능한 변환 기능 및 꽉 보안 통합은 조직이 자신감을 가지고 데이터를 현대화 할 수 있도록합니다. ADF의 고급 기능을 활용한 단계 접근 및 레버리지로 인해 비즈니스는 최소한의 가동 시간, 낮은 비용 및 클라우드 기반 분석에 대한 명확한 경로가 달성할 수 있습니다. 레거시 시스템은 최신의 데이터 방식을 계속 활용하고, 미래 데이터 브릿지를 활용하기 위해 최신의 데이터 방식을 계속 활용할 수 있습니다.