Merk
Tilgang til denne siden krever autorisasjon. Du kan prøve å logge på eller endre kataloger.
Tilgang til denne siden krever autorisasjon. Du kan prøve å endre kataloger.
Data Factory i Microsoft Fabric hjelper deg med å løse en av bedriftens tøffeste utfordringer: å gjøre spredte data om til nyttig innsikt.
Organisasjonens data finnes på mange forskjellige steder: databaser, filer, skytjenester og eldre systemer. Denne variasjonen gjør det vanskelig å få et komplett bilde av virksomheten din. Data Factory kobler til mer enn 170 datakilder, inkludert multicloud-miljøer og hybridoppsett med lokale gateways. Det hjelper deg med å flytte og transformere dataene dine i stor skala, og gjøre dem om til formater som fungerer godt for analyse og beslutningstaking.
Diagram over Data Factory i Microsoft Fabric som viser et utvalg koblinger koblet til analyse- og datautviklingsverktøy i Fabric gjennom dataflytting, orkestrering og transformasjon. Alt dette sitter på toppen av Fabric OneLake, og hele stabelen er vevd gjennom med AI-drevet intelligens.
Enten du er en forretningsbruker som bygger din første dataanalysestrategi, eller en utvikler som lager komplekse arbeidsstrømmer, vil du finne de riktige verktøyene for å:
- Samle dataene dine
- Rydd opp
- Gjør den klar for analyse i ditt Lakehouse eller datalager
- Automatiser dataarbeidsflytene dine
Hva er dataintegrering?
Dataintegrasjon er prosessen med å samle dine strategiske data slik at du kan få tilgang til og analysere dem. Det er en sentral del av enhver virksomhet som ønsker å ta datadrevne beslutninger.
Det er mange måter å integrere dataene dine på, men en av de vanligste strategiene er ETL. ETL står for Extract, Transform, Load. Den tar informasjon fra mange forskjellige kilder, transformerer den til et format du kan analysere, og laster den inn i et felles destinasjonssystem for analyse eller rapportering. Når du implementerer en ETL-prosess i bedriftens dataplattform, forbedrer det datakonsistens, kvalitet og tilgjengelighet.
Her er hva hver fase gjør:
- Trekk ut: Leser data fra kildene dine og flytter dem til et sentralt lagringssted. Kilder kan være databaser, filer, APIer, nettsteder og mer.
- Transformer: Renser, beriker og transformerer dataene dine til et format som er enkelt å analysere. Du kan for eksempel sammenligne salgsdata fra en SQL-database med skannede, historiske salgsdokumenter. Når du har trukket ut dataene, må du transformere dataene fra hver kilde slik at de er i samme format, se etter skader eller duplikater og kombinere dataene til ett enkelt datasett.
- Last inn: Skriver de transformerte dataene til et destinasjonssystem, som et datavarehus eller en datalake. Målsystemet er der du kan kjøre spørringer og rapporter om dataene dine.
ETL eller ELT?
Når du jobber med data, er det viktig hvordan du beveger deg og transformerer, og hver organisasjon har ulike behov. For eksempel, vurder ETL (Extract, Transform, Load) og ELT (Extract, Load, Transform). Hver metode har sine styrker, avhengig av dine behov for ytelse, skalerbarhet og kostnad.
ETL: Transformer dataene dine før du laster dem inn i destinasjonen. Denne metoden fungerer godt når du må rense, standardisere eller berike data mens de beveger seg. For eksempel, bruk Data Factorys Dataflow Gen2 for å anvende transformasjoner i stor skala før data lastes inn i et lager eller Lakehouse.
ELT: Last inn rådata først, og transformer dem deretter der de er lagret. Denne tilnærmingen bruker kraften til analysemotorer som Fabrics OneLake, Spark Notebooks eller SQL-baserte verktøy. ELT fungerer godt for håndtering av store datasett med moderne databehandling i skyskala.
Fabric Data Factory støtter begge. Du kan:
- Bygg klassiske ETL-datasamlebånd for umiddelbar datakvalitet og beredskap
- Bruk ELT-arbeidsflyter til å dra nytte av integrert databehandling og lagring for store transformasjoner
- Kombiner begge tilnærmingene i samme løsning for fleksibilitet
Data Factory er en kraftig dataintegrasjonsløsning
Data Factory kobler til dataene dine, flytter dem, transformerer dem og orkestrerer dataflyttings- og transformasjonsoppgavene dine fra ett sted. Du bestemmer hvilken strategi som fungerer best for din virksomhet, og Data Factory gir deg verktøyene for å få det gjort.
Koble til dataene dine: Enten det er lokalt, i skyen eller på tvers av miljøer med flere skyer, kobler Data Factory til datakildene og målene dine. Den støtter et bredt spekter av datakilder, inkludert databaser, datasjøer, filsystemer, APIer og mer. Se tilgjengelige koblinger for en fullstendig liste over støttede datakilder og mål.
Flytt data: Data Factory tilbyr flere metoder for å flytte data fra kilde til mål, eller gi enkel tilgang til eksisterende data, avhengig av dine behov.
- Kopieringsjobb – Foretrukket løsning for forenklet dataflytting med opprinnelig støtte for flere leveringsstiler, inkludert massekopiering, trinnvis kopiering og replikering av endringsdatafangst (CDC). Det gir også fleksibilitet til å håndtere et bredt spekter av scenarier fra mange kilder til mange destinasjoner – alt gjennom en intuitiv og brukervennlig opplevelse.
- Kopieringsaktivitet – Flytter data fra ett sted til et annet i en hvilken som helst skala, med omfattende tilpasning, støtte for et bredt spekter av kilder og destinasjoner, og manuell kontroll av parallell kopiering for forbedret ytelse.
- Speiling – Opprett en kopi av driftsdatabasen i OneLake i Microsoft Fabric i nær sanntid for å gjøre analyse og rapportering enklere.
Se beslutningsguiden for databevegelse for å hjelpe deg med å velge riktig metode for databevegelse for ditt scenario.
Transform: Data Factory tilbyr aktiviteter for å koble deg til egendefinerte transformasjonsskript eller den kraftige dataflytutformingen.
- Datasamlebåndaktiviteter – Strukturnotatblokk, HDInsight-aktivitet, Spark-jobbdefinisjon, lagret prosedyre, SQL-skript og mer. Med disse aktivitetene kan du kjøre egendefinert kode eller skript for å transformere dataene.
- Dataflow Gen2 – Transformér dataene dine ved hjelp av et lavkodegrensesnitt med over 300 transformasjoner. Du kan utføre sammenføyninger, aggregasjoner, datarensing, tilpassede transformasjoner og mye mer.
- dbt-jobb - dbt-jobb i Microsoft Fabric muliggjør SQL-baserte datatransformasjoner direkte i Fabric. De tilbyr et enkelt, kodefritt oppsett for å bygge, teste og distribuere dbt-modeller oppå ditt Fabric-datavarehus.
Orkestreres: Data Factory lar deg opprette datasamlebånd som kan kjøre flere dataflyttinger, transformasjoner og andre aktiviteter i én enkelt arbeidsflyt.
- Planlegg pipeliner til å kjøre på bestemte tidspunkter, eller utløs dem basert på hendelser.
- Pipeliner kan inkludere kontrollflytlogikk, for eksempel løkker og betingelser, for å håndtere komplekse arbeidsflyter og orkestrere all databehandlingen ved hjelp av et enkelt lavkodebasert brukergrensesnitt for pipelineutforming.
- Hvis du foretrekker å uttrykke orkestreringsprosessene dine i kode, integreres Fabric Data Factory med Apache Airflow for å bygge DAG-er for orkestrering ved hjelp av Python.
AI-drevet dataintegrasjon
AI finnes overalt i Data Factory for å hjelpe deg å få gjort mer med mindre innsats. Copilot for Data Factory lar deg designe, redigere og administrere pipelines og dataflyter ved å bruke naturlig språk. Du kan skrive inn vanlige engelske spørsmål, og Copilot gjør dem om til fungerende ETL-trinn.
Copilot oppsummerer også eksisterende dataflytspørringer og datasamlebånd, slik at du raskt kan forstå hva de gjør. Hvis du støter på feil, forklarer Copilot hva som gikk galt og foreslår måter å fikse det på.
Hvis du vil ha mer informasjon, kan du se Copilot i Fabric i Data Factory-arbeidsbelastningen.
Hva trenger du for å komme i gang?
- En Microsoft Fabric-leierkonto med et aktivt abonnement. Hvis du ikke har en, kan du opprette en gratis konto.
- Et Microsoft Fabric-aktivert arbeidsområde. Finn ut hvordan du oppretter et arbeidsområde.
Hva om du allerede bruker Azure Data Factory?
Data Factory i Microsoft Fabric er neste generasjon av Azure Data Factory, bygget for å håndtere de mest komplekse dataintegreringsutfordringene dine med en enklere tilnærming.
Se sammenligningsguiden for de viktigste forskjellene mellom disse to tjenestene, slik at du kan ta det riktige valget for din virksomhet.
Når du er klar til å migrere, følg migreringsguiden for dine Azure Data Factory- og Azure Synapse-pipelines.
Hva er Fabric Data Factory Pipeline SLA?
SLA for pipelines in Fabric tilsvarer SLA for pipelines i Azure Data Factory: «Microsoft garanterer at det vellykket behandler forespørsler om å utføre operasjoner mot Data Factory-ressurser minst 99,9 prosent av gangene. Den garanterer også at alle aktivitetskjøringer starter innen fire minutter av sine planlagte utførelsestider minst 99,9 prosent av gangene. Les hele Data Factory service-level agreement (SLA)."
Relatert innhold
Hvis du vil ha mer informasjon og komme i gang med Microsoft Fabric, kan du følge disse veiledningene:
- Veiledet datafabrikklab – demonstrasjon av Data Factory i Fabric
- Hva kan du koble til? - alle tilgjengelige kilder og destinasjoner for Data Factory
- End-to-end Data Factory-veiledning – Følg denne veiledningen gjennom hele ETL-prosessen, fra datainntak til transformasjon og lasting til et destinasjonssystem.