Bemærk
Adgang til denne side kræver godkendelse. Du kan prøve at logge på eller ændre mapper.
Adgang til denne side kræver godkendelse. Du kan prøve at ændre mapper.
I denne artikel beskrives funktionen til hentning af ændringsdata (CDC) i Kopiér job, og hvordan du bruger den.
Hvad er ændring af datahentning (CDC) i kopijobbet
Cdc (Change Data Capture) i Kopiér job er en effektiv funktion i Fabric Data Factory, der muliggør effektiv og automatiseret replikering af ændrede data, herunder indsatte, opdaterede og slettede poster fra en kilde til en destination. Dette sikrer, at dine destinationsdata forbliver opdaterede uden manuel indsats, hvilket forbedrer effektiviteten i dataintegrationen, samtidig med at belastningen på dit kildesystem reduceres.
Vigtige fordele ved CDC i Kopiér job
- Nul manuel indgriben: Registrerer automatisk trinvise ændringer (indsætter, opdaterer, sletter) direkte fra kilden.
- Automatisk replikering: Holder destinationsdata synkroniseret løbende med kildeændringer.
- Optimeret ydeevne: Behandler kun ændrede data, hvilket reducerer behandlingstiden og minimerer belastningen af kilden.
- Smartere trinvis kopi: Registrerer automatisk CDC-aktiverede kildetabeller og giver dig mulighed for at vælge enten CDC-baseret eller vandmærkebaseret trinvis kopi til hver tabel.
Læsemetoder: CDC-baseret vs. vandmærkebaseret inkrementel kopi
- CDC-baseret trinvis kopi: Hvis CDC er aktiveret for kildedatabasen, henter og replikerer Kopiér job automatisk indsættelser, opdateringer og sletninger på destinationen ved anvendelse af de nøjagtige ændringer.
- Trinvis kopi baseret på vandmærke: Hvis CDC ikke er aktiveret i kildedatabasen, registrerer Kopiér job ændringer ved at sammenligne en trinvis kolonne (f.eks. tidsstempel eller id) med den seneste kørsel og derefter føjer eller fletter de ændrede data til destinationen baseret på din konfiguration.
Skrivemetoder: SCD Type 1 (Merge) vs. SCD Type 2
Når du bruger CDC i Copy-job, er det vigtigt at forstå, hvordan ændringer anvendes på din destination. Den opdateringsmetode, du vælger, kortlægges til langsomt skiftende dimension (SCD)-mønstre, som ofte bruges i datawarehousing.
SCD Type 1 (Sammenfletning)
SCD Type 1, også kendt som Merge-opdateringsmetoden , er standardadfærden for CDC i Copy-job. Med denne tilgang afspejler destinationen altid kildedataens aktuelle tilstand :
- Indsættelser: Nye rækker fra kilden tilføjes til destinationen.
- Opdateringer: Ændrede rækker i kilden overskriver de tilsvarende rækker i destinationen.
- Sletninger: Slettede rækker i kilden fjernes fra destinationen.
Denne metode gemmer kun den nyeste version af hver post. Der er ikke bevaret nogen historiske data. Det er ideelt, når destinationen skal være en nøjagtig, up-todato kopi af kilden.
SCD Type 2 (Historisk sporing)
SCD Type 2 bevarer historiske data ved at oprette nye rækker til ændringer, mens tidligere versioner af poster bevares. Når en kildepost opdages som opdateret fra sidste kørsel, udløber den eksisterende aktuelle post i destinationen ved at sætte dens Valid_To og ændre Is_Current til falsk. En ny post indsættes derefter med de opdaterede attributværdier, en ny Valid_From, og Is_Current = sand. Når en post slettes ved kilden, bliver den nuværende version soft-slettet — den fjernes ikke fysisk, men dens Valid_To dato sættes og Is_Current markeres som falsk. Denne tilgang bevarer hele livscyklussen for hver post, når der skrives til destinationen, inklusive poster der ikke længere findes i kildekoden.
CDC i kopijobbet giver indbygget understøttelse af SCD Type 2 som skrivemetode. For at aktivere SCD Type 2 skal du vælge den som skrivemetode, når du konfigurerer dit Copy-job — der kræves ingen brugerdefineret kode eller yderligere logik. Både historiksporing og soft delete-håndtering er aktiveret sammen og anvendes konsekvent på alle valgte tabeller.
SCD Type 2 i Copy job tilføjer følgende kolonner til destinationen:
-
Valid_From: Tidsstemplet, da pladeversionen blev gældende. -
Valid_To: Tidsstemplet, da pladeversionen blev erstattet eller slettet. Aktive poster bruger NULL-værdien. -
Is_Current: Et flag, der angiver, om posten er den nuværende aktive version.
For eksempel, hvis en kunde flytter fra Californien til New York, bevares begge versioner:
| Kundes nøgle | Kunde-id | Navn | Tilstand | Valid_From | Valid_To | Is_Current |
|---|---|---|---|---|---|---|
| 1001 | C-123 | Firma | nøglecenter | 2023-01-15 | 2026-02-20 | Nej |
| 1002 | C-123 | Firma | NY | 2026-02-20 | NUL | Ja |
Valg mellem SCD Type 1 og SCD Type 2
| Funktion | SCD Type 1 (Sammenfletning) | SCD Type 2 (Forhåndsvisning) |
|---|---|---|
| Understøttet i CDC-kopijob | Ja | Ja |
| Historiske data | Ikke bevaret | Bevaret med versionerede rækker |
| Destinationstilstand | Afspejler altid den nuværende kilde | Indeholder alle versioner af rekorder, der sammenligner med den sidste kørsel |
| Sletninger | Rækkerne fjernes fysisk | Blød sletning — rækker markeres som inaktive |
| Brugstilfælde | Operationel rapportering, realtidssynkronisering | Historisk analyse, revisionsspor, overholdelse |
| Implementeringsindsats | Indbygget, ingen ekstra konfiguration | Indbygget, vælg SCD Type 2 som skrivemetode |
Understøttede stik
I øjeblikket understøtter CDC in Copy-jobbet følgende kilde- og destinationsdatalagre:
| Connector | CDC-kilde | CDC-destination | Skriv - SCD Type 2 |
|---|---|---|---|
| Azure SQL DB |
|
|
|
| Azure SQL Managed Instance |
|
|
|
| Fabric data warehouse |
|
|
|
| Fabric Lakehouse-bord (Forhåndsvisning) |
|
|
|
| Google BigQuery (Forhåndsvisning) |
|
|
|
| On-premises SQL Server |
|
|
|
| Oracle (Preview) |
|
|
|
| Udgående SAP Datasphere for ADLS Gen2 |
|
|
|
| SAP Datasphere Outbound til AWS S3 |
|
|
|
| SAP Datasphere Outbound til Google CloudStorage |
|
|
|
| Snowflake (Forhåndsvisning) |
|
|
|
| SQL-database i Fabric |
|
|
|
| Synapse data warehouse |
|
|
|
Note
SCD Type 2 i Copy-jobbet er i øjeblikket i preview. Når du laver CDC-replikering fra Oracle-kilder, understøttes SCD Type 2 endnu ikke. Hvis du opretter skemaet i din destinationsdatabase, understøttes SCD2 ikke.
For SAP Datasphere Outbound, gå venligst til Change Data Capture from SAP via SAP Datasphere Outbound in Copy-jobbet for at lære flere detaljer.
Skemaændringer og ændringer i kildedatatyper
Copy job håndterer ændringer i kildeskemaet baseret på, om kolonnemapping er konfigureret.
Når kolonnemapping er konfigureret
Når en kolonnemappe konfigureres, respekterer og følger Kopi-jobbet altid det.
- Ny kolonne tilføjet ved kilden: Kopieringsjobbet ignorerer den nye kolonne, fordi den ikke er en del af kolonnemappingen. Kørsler fortsætter med at lykkes, og den nye kolonne er ikke synkroniseret med destinationen.
- Kolonne slettet ved kilden: Hvis en kildekolonne, der aldrig var en del af kolonnemappingen, slettes, er der ingen påvirkning. Runs fortsætter med at lykkes, fordi den droppede kolonne aldrig blev synkroniseret. Hvis en kildekolonne, der er defineret i kolonnemappingen, slettes eller omdøbes, fejler kørselen, fordi den kortlagte kildekolonne ikke længere kan findes.
- Ændringer af kildedatatype: Kopijob respekterer de datatyper, der er angivet i kolonnemappingen, og håndtering af runtime-typekompatibilitet gælder. Kildedatatypen skal kunne støbes til destinationsdatatypen. Hvis den opdaterede kildetype ikke kan castes til destinationstypen, fejler kørslen.
Når kolonnemapping ikke er konfigureret
Når der ikke er konfigureret nogen kolonnemapping, følger Copy job nedenfor.
- Ny kolonne tilføjet ved kilden: Kørsler fortsætter med at lykkes, og den nye kolonne er ikke synkroniseret med destinationen.
- Kolonne slettet ved kilden: Den slettede kolonne er ikke længere synkroniseret. Eksisterende data for den kolonne i destinationen fjernes ikke, og kørsler fortsætter med at lykkes uden at overføre nye data til den kolonne.
- Ændringer i kildedatatype: Håndtering af runtime-typekompatibilitet gælder. Kildedatatypen skal kunne støbes til destinationsdatatypen. Hvis den opdaterede kildetype ikke kan castes til destinationstypen, fejler kørslen.
Sådan get started
For at komme i gang med CDC in Copy-jobbet, se følgende vejledninger for trin-for-trin vejledning om specifikke kilder:
- Ændr dataindsamling fra Azure SQL DB ved hjælp af Copy job
- Ændr dataindsamling fra SAP via SAP Datasphere Outbound i Copy job
- Skift dataindsamling fra Snowflake ved hjælp af Copy-job
- Ændr dataindsamling fra Oracle-database ved hjælp af Copy-jobbet
Kendte begrænsninger
- Når både CDC-aktiverede og ikke-CDC-aktiverede kildetabeller vælges i et kopijob, behandles alle tabeller som vandmærkebaseret trinvis kopi.
- Kun nettoændringsfangst (fuld ændringsfangst kommer senere).
- Brugerdefinerede hentningsforekomster understøttes ikke. kun standardforekomsten af hentning understøttes.
- Om CDF er aktiveret eller ej på Fabric Lakehouse-tabeller, kan ikke automatisk opdages.