Hvad er Data Factory i Microsoft Fabric?

Data Factory i Microsoft Fabric hjælper dig med at løse en af virksomhedens sværeste udfordringer: at omdanne spredte data til nyttig indsigt.

Din organisations data findes mange forskellige steder: databaser, filer, cloudtjenester og ældre systemer. Denne variation gør det svært at få et komplet billede af din virksomhed. Data Factory forbinder til mere end 170 datakilder, herunder multicloud-miljøer og hybride opsætninger med on-premises gateways. Det hjælper dig med at flytte og transformere dine data i stor skala og omdanne dem til formater, der fungerer godt til analyse og beslutningstagning.

Diagram over dataintegrationsstakken i Microsoft Fabric.

Diagram over Data Factory i Microsoft Fabric, der viser et udvalg af connectorer, der er knyttet til analyse- og dataudviklingsværktøjer i Fabric via dataflytning, orkestrering og transformation. Alt dette sidder oven på Fabric OneLake, og hele stakken er vævet igennem med AI-drevet intelligens.

Uanset om du er en forretningsbruger, der bygger din første dataanalysestrategi, eller en udvikler, der skaber komplekse arbejdsstrømme, vil du finde de rette værktøjer til at:

  • Saml dine data
  • Ryd op i det
  • Gør den klar til analyse i dit Lakehouse eller data warehouse
  • Automatiser dine dataarbejdsgange

Hvad er dataintegration?

Dataintegration er processen med at samle dine strategiske data, så du kan få adgang til og analysere dem. Det er en vigtig del af enhver virksomhed, der ønsker at træffe datadrevne beslutninger.

Der er mange måder at integrere dine data på, men en af de mest almindelige strategier er ETL. ETL står for Extract, Transform, Load. Den tager oplysninger fra mange forskellige kilder, omdanner dem til et format, du kan analysere, og indlæser dem i et fælles destinationssystem til analyse eller rapportering. Når du implementerer en ETL-proces i din virksomheds dataplatform, forbedrer det datakonsistens, kvalitet og tilgængelighed.

Her er, hvad hver fase gør:

  • Udtræk: Læser data fra dine kilder og flytter dem til en central lagerplacering. Kilder kan være databaser, filer, API'er, websteder og mere.
  • Transform: Renser, beriger og transformerer dine data til et format, der er nemt at analysere. Du kan f.eks. sammenligne salgsdata fra en SQL-database med scannede, historiske salgsdokumenter. Når du har udtrukket dataene, skal du transformere dataene fra hver kilde, så de er i samme format, kontrollere for beskadigelser eller dubletter og kombinere dataene til et enkelt datasæt.
  • Indlæsning: Skriver de transformerede data til et destinationssystem, såsom et datalager eller en datalake. Destinationssystemet er det sted, hvor du kan køre forespørgsler og rapporter om dine data.

ETL eller ELT?

Når du arbejder med data, er det vigtigt, hvordan du bevæger dig og transformerer, og hver organisation har forskellige behov. For eksempel, overvej ETL (Extract, Transform, Load) og ELT (Extract, Load, Transform). Hver metode har styrker, afhængigt af dine behov for ydeevne, skalerbarhed og omkostninger.

ETL: Transformér dine data, før du indlæser dem i destinationen. Denne metode fungerer godt, når du skal rense, standardisere eller berige data, mens de bevæger sig. For eksempel kan du bruge Data Factorys Dataflow Gen2 til at anvende transformationer i stor skala, før data indlæses i et lager eller Lakehouse.

ELT: Indlæs rådata først, og transformer dem derefter, hvor de er gemt. Denne fremgangsmåde bruger styrken ved analyseprogrammer som Fabric's OneLake, Spark Notebooks eller SQL-baserede værktøjer. ELT fungerer godt til håndtering af store datasæt med moderne beregning i cloudskala.

Fabric Data Factory understøtter begge dele. Du kan:

  • Byg klassiske ETL-pipelines for øjeblikkelig datakvalitet og parathed
  • Brug ELT-arbejdsgange til at drage fordel af integreret beregning og lagring til store transformationer
  • Kombiner begge tilgange i samme løsning for fleksibilitet

Data Factory er en kraftfuld dataintegrationsløsning

Data Factory opretter forbindelse til dine data, flytter dem, transformerer dem og orkestrerer dine dataflytnings- og transformationsopgaver fra ét sted. Du bestemmer, hvilken strategi der fungerer bedst for din virksomhed, og Data Factory leverer værktøjerne til at få det gjort.

Opret forbindelse til dine data: Uanset om det er i det lokale miljø, i skyen eller på tværs af multicloudmiljøer, opretter Data Factory forbindelse til dine datakilder og destinationer. Det understøtter en bred vifte af datakilder, herunder databaser, datasøer, filsystemer, API'er og mere. Se tilgængelige connectorer for at få en komplet liste over understøttede datakilder og destinationer.

Flyt data: Data Factory indeholder flere metoder til at flytte data fra kilde til destination eller give nem adgang til eksisterende data, afhængigt af dine behov.

  • Kopieringsjob – Foretrukken løsning til forenklet dataflytning med oprindelig understøttelse af flere leveringstypografier, herunder massekopiering, trinvis kopiering og CDC-replikering (Change Data Capture). Det giver også fleksibilitet til at håndtere en bred vifte af scenarier fra mange kilder til mange destinationer – alt sammen gennem en intuitiv og brugervenlig oplevelse.
  • Kopieringsaktivitet – Flytter data fra et sted til et andet i enhver skala med omfattende tilpasning, understøttelse af en lang række kilder og destinationer og manuel kontrol af parallel kopiering for forbedret ydeevne.
  • Spejling – Opret en replika af din driftsdatabase i næsten realtid i OneLake i Microsoft Fabric for at gøre dine analyser og rapportering nemmere.

Se beslutningsguiden for databevægelse for at hjælpe dig med at vælge den rigtige metode til databevægelse til din situation.

Transform: Data Factory indeholder aktiviteter, der kan oprette forbindelse til dine brugerdefinerede transformationsscripts eller den effektive dataflowdesigner.

  • Pipelineaktiviteter – Fabric Notebook, HDInsight-aktivitet, Spark-jobdefinition, lagret procedure, SQL-scripts og meget mere. Disse aktiviteter giver dig mulighed for at køre brugerdefineret kode eller scripts for at transformere dine data.
  • Dataflow Gen2 - Transformér dine data ved hjælp af et low-code interface med over 300 transformationer. Du kan udføre joinforbindelser, sammenlægninger, datarensning, brugerdefinerede transformationer og meget mere.
  • dbt-job - dbt-job i Microsoft Fabric muliggør SQL-baserede datatransformationer direkte i Fabric. De tilbyder en simpel, kodefri opsætning til at bygge, teste og implementere dbt-modeller oven på dit Fabric-datalager.

Orkestrer: Data Factory giver dig mulighed for at oprette pipelines, der kan køre flere databevægelser, transformationer og andre aktiviteter i en enkelt arbejdsproces.

AI-drevet dataintegration

AI optræder overalt i Data Factory for at hjælpe dig med at få mere gjort med mindre indsats. Copilot for Data Factory lader dig designe, redigere og administrere pipelines og dataflows ved brug af naturligt sprog. Du kan skrive almindelige engelske prompter, og Copilot omdanner dem til fungerende ETL-trin.

Copilot opsummerer også dine eksisterende dataflowforespørgsler og pipelines, så du hurtigt kan forstå, hvad de gør. Hvis du støder på fejl, forklarer Copilot, hvad der gik galt, og foreslår måder at løse det på.

Du kan finde flere oplysninger under Copilot i Fabric i Data Factory-arbejdsbelastningen.

Hvad skal du bruge for at komme i gang?

Hvad hvis du allerede bruger Azure Data Factory?

Data Factory i Microsoft Fabric er den næste generation af Azure Data Factory, der er bygget til at håndtere dine mest komplekse udfordringer med dataintegration med en enklere tilgang.

Se sammenligningsguiden for de vigtigste forskelle mellem disse to tjenester, så du kan træffe det rigtige valg for din virksomhed.

Når du er klar til at migrere, følg migrationsguiden for dine Azure Data Factory- og Azure Synapse-pipelines.

Hvad er Fabric Data Factory Pipeline SLA?

SLA for pipelines i Fabric svarer til SLA for pipelines i Azure Data Factory: "Microsoft garanterer, at det med succes behandler anmodninger om at udføre operationer mod Data Factory-ressourcer mindst 99,9 procent af tiden. Det garanterer også, at alle aktivitetskørsler starter inden for fire minutter af deres planlagte udførelsestider mindst 99,9 procent af tiden. Læs hele Data Factory service-level agreement (SLA)."

Du kan finde flere oplysninger og komme i gang med Microsoft Fabric ved at følge disse vejledninger: