Kartlegging av dataflyttransformasjoner i dataflyt gen2 (Forhåndsvisning)

Important

Kartlegging av dataflyttransformasjoner i dataflyt gen2 er for øyeblikket i offentlig forhåndsvisning og kan endres.

Mapping data flow (MDF)-transformasjoner i dataflow gen2 gjør det mulig å utarbeide, utføre og overvåke Spark-baserte datatransformasjoner direkte i Data Factory i Microsoft Fabric.

MDF-transformasjoner bringer kapabilitetene til Azure Data Factory og Azure Synapse Analytics Mapping Data Flows inn i Microsoft Fabric gjennom en kjent lavkode-visuell authoring-opplevelse integrert med dataflow gen2.

Med MDF-transformasjoner kan du:

  • Migrer eksisterende Azure Data Factory- og Azure Synapse Analytics Mapping Data Flows-pipelines til Fabric.
  • Lag nye Spark-baserte transformasjoner direkte i Fabric.
  • Utfør MDF-transformasjoner ved bruk av Fabric-datapipelines.
  • Overvåk transformasjonsgjennomføringen ved hjelp av integrerte overvåkingsopplevelser.
  • Fortsett å bruke kjente Mapping Dataflyt-transformasjonsmønstre inne i Fabric.

Hva er mapping data flow-transformasjoner?

MDF-transformasjoner utvider dataflyt gen2 med Spark-drevne transformasjonsmuligheter for storskala dataforberedelse og transformasjonsarbeidsbelastninger.

MDF-transformasjoner gir:

  • En lavkode-opplevelse av visuell authoring
  • Spark-basert utførelse
  • Integrert orkestrering gjennom Fabric-pipelines
  • Overvåking og gjennomføringsinnsikt direkte i Fabric

Bruk MDF-transformasjoner til å:

  • Migrer eksisterende Azure Data Factory eller Azure Synapse Analytics Mapping Data Flows-pipelines til Fabric.
  • Bygg nye Spark-baserte transformasjonspipelines direkte i Fabric.

MDF-transformasjoner integreres fullt ut med dataflow gen2 og gir en kjent forfatteropplevelse lik Azure Data Factory og Azure Synapse Analytics Mapping Data Flows.

Skjermbilde av kartleggings-dataflyttransformasjonsopplevelsen innebygd i et dataflyt gen2-lerret i Microsoft Fabric.

Scenarier som støttes

MDF-transformasjoner støtter for øyeblikket følgende scenarier.

Migrer eksisterende kartleggingsdataflyter

Du kan migrere eksisterende Azure Data Factory og Azure Synapse Analytics Mapping Data Flows til Fabric ved å bruke Azure Data Factory/Synapse Analytics innebygde migreringsopplevelse.

Skjermbilde av Azure Data Factory-migreringsopplevelsen for å oppgradere Mapping Data Flows-pipelines til Fabric.

Under migrasjon:

  1. Mapping Data Flows konverteres til MDF-transformasjoner i dataflow gen2.
  2. Pipelines og transformasjonslogikk migreres sammen.
  3. MDF transformerer åpner inne i det innebygde transformasjonslerretet i dataflow gen2.
  4. Eksisterende transformasjonslogikk kan fortsette å bli forfattet, validert, utført og overvåket i Fabric.

Opprett nye mapping dataflyt-transformasjoner i Fabric

Du kan også lage nye MDF-transformasjoner direkte i dataflow gen2. Denne erfaringen gjør det mulig for deg å:

  • Bygg Spark-baserte transformasjoner ved hjelp av et visuelt grensesnitt.
  • Bruk kjente transformasjonsmuligheter for Mapping Dataflyt.
  • Utfør transformasjoner ved bruk av Fabric-datapipelines.
  • Overvåk gjennomføringen gjennom integrerte overvåkingsopplevelser.

Forutsetninger

Før du bruker MDF-transformasjoner i dataflow gen 2, sørg for at følgende forutsetninger er oppfylt:

  • En Fabric-kapasitet.
  • Bidragsyter eller høyere rettigheter til Fabric-arbeidsområdet.
  • Eksisterende Fabric-tilkoblinger for støttede datakilder.
  • (Valgfritt) Et eksisterende Azure Data Factory- eller Azure Synapse Analytics-arbeidsområde, hvis du bruker migrasjonsscenarier.

Begrensninger

Følgende funksjoner støttes for øyeblikket ikke i offentlig forhåndsvisning:

Areal Begrensning
Flowlets Støttes ikke.
Dataflyt Library Støttes ikke.
Brukerdefinerte funksjoner (UDF-er) Støttes ikke.
Dataflytkjøring MDF-transformasjoner kan kun utføres gjennom pipeline Dataflow-aktiviteten. Direkte kjøring fra dataflow gen2 støttes ikke for øyeblikket. Kun lagre-handlingen er tilgjengelig fra Save & run-menyen .
Administrert virtuelt nettverk Støtte for Managed virtuelt nettverk (Managed VNet) er ikke tilgjengelig i denne forhåndsvisningen.
Kjøretidsutførelse MDF transform execution bruker for øyeblikket den underliggende Synapse Spark runtime, lik Azure Data Factory og Azure Synapse Analytics Mapping Data Flows.
Funksjonsparitet Ikke alle Mapping Dataflyt-funksjoner er tilgjengelige i denne forhåndsvisningen.

Støttede koblinger

MDF-transformasjoner støtter de mest brukte kilde- og sinkkoblingene som er tilgjengelige i Azure Data Factory og Azure Synapse Analytics Mapping Data Flows.

Følgende kontakter støttes for øyeblikket:

Kategori Datalager MDF-transformasjoner i dataflyt gen2 (kilde/sluk) Støttede autentiseringstyper
Azure Azure Blob Storage ✓/✓ Grunnleggende, administrert identitet / arbeidsområdeidentitet, tjenesteprinsipp
Azure Cosmos DB for NoSQL ✓/✓ Basic
Azure Data Explorer ✓/✓ Administrert identitet / arbeidsplassidentitet
Azure Data Lake Storage Gen1 ✓/✓ Grunnleggende, administrert identitet / arbeidsområdeidentitet, tjenesteprinsipp
Azure Data Lake Storage Gen2 ✓/✓ Grunnleggende, administrert identitet / arbeidsområdeidentitet, tjenesteprinsipp
Azure Database for MySQL ✓/✓ Basic
Azure Database for PostgreSQL ✓/✓ Basic
Azure Databricks Delta Lake ✓/✓ Bruk delta-format Basic
Azure SQL Database ✓/✓ Grunnleggende, administrert identitet / arbeidsområdeidentitet, tjenesteprinsipp
Azure SQL Managed Instance ✓/✓ Grunnleggende, administrert identitet / arbeidsområdeidentitet, tjenesteprinsipp
Azure Synapse Analytics ✓/✓ Basic
Database Snowflake ✓/✓ Basic
Filen Amazon S3 ✓/✓ Basic
SFTP ✓/✓ Basic
Generisk REST ✓/✓ Grunnleggende, tjenesteleder

Under forfatterskapet:

  • Eksisterende Fabric-tilkoblinger kan gjenbrukes.
  • Nye forbindelser kan skapes direkte fra forfatteropplevelsen ved bruk av Get Data-opplevelsen .
  • Konfigurasjon av kilde og sluk følger kjente mønstre for Mapping Dataflyt.

Støttede transformasjoner

MDF-transformasjoner gir en kjent lavkode-visuell transformasjonsopplevelse for å bygge skalerbare Spark-baserte datatransformasjonspipelines i Fabric.

Følgende transformasjoner støttes for øyeblikket:

Navn Kategori Beskrivelse
Mengde Skjemaendring Definer aggregeringer som SUM, MIN, MAX og COUNT gruppert etter eksisterende eller beregnede kolonner.
Alter-raden Radmodifikator Angi policyer for innsetting, sletting, oppdatering og oppsert på rader.
Påstå Radmodifikator Definer assert-regler for rader i datastrømmen.
Skuespillere Skjemaendring Endre kolonnedatatyper med typekontroll.
Betinget splittelse Flere inndata/utdata Rut rader til forskjellige bekker basert på samsvarende forhold.
Avledet kolonne Skjemaendring Generer nye kolonner eller modifiser eksisterende felt ved hjelp av uttrykk.
Ekstern kall Skjemaendring Kall eksterne endepunkter inline for hver rad.
Finnes Flere inndata/utdata Sjekk om data finnes i en annen kilde eller strøm.
Filter Radmodifikator Filtrer rader basert på betingelser.
Flatten Formattere Flat ut hierarkiske strukturer som JSON-arrays til rader.
Føy sammen Flere inndata/utdata Kombiner data fra to kilder eller strømmer.
Oppslag Flere inndata/utdata Referer data fra en annen kilde eller strøm.
Ny gren Flere inndata/utdata Bruk flere transformasjonsstier på samme strøm.
Analyser Formattere Parse JSON, avgrenset tekst eller XML-formaterte strenger.
Pivoter Skjemaendring Konverter ulike radverdier til kolonner.
Rangering Skjemaendring Lag ordnede rangeringer basert på sorteringsbetingelser.
Velg Skjemaendring Omdøp, omorganiser eller fjern kolonner.
Vask - Definer destinasjonen for transformerte data.
Sortering Radmodifikator Sorter rader i den nåværende datastrømmen.
Source - Definer kilden for dataflyten.
Stringify Formattere Konverter komplekse typer til strengverdier.
Surrogatnøkkel Skjemaendring Generer økende surrogatnøkkelverdier.
Union Flere inndata/utdata Kombiner flere datastrømmer loddrett.
Avpivoter Skjemaendring Omformer kolonner til radverdier.
Vindu Skjemaendring Definer vindusbaserte aggregeringer over datastrømmer.

Lag en mapping dataflyt-transformasjon i dataflow gen2

For å skape en ny MDF-transformasjon i Fabric:

  1. Åpne Fabric-arbeidsområdet ditt.

  2. Velg Nytt element.

  3. Velg Dataflow Gen2.

  4. Oppgi et navn på dataflow-gen2-elementet og velg Opprett.

  5. I dataflow gen2-lerretet, bruk ett av følgende alternativer:

    • Velg Kjør Mapping dataflyttransformasjoner fra New action-gruppen i dataflow gen2 home-båndet.
    • Velg flisen Run Mapping data flow transforms (ADF Mapping Data Flows) fra lerretet.

    Skjermbilde som viser muligheten til å lage en mapping dataflyt-transformasjon fra dataflow gen2-båndet i Microsoft Fabric.

    Skjermbilde viser mulighet til å lage en mapping dataflyt-transformasjon fra dataflow gen2 lerretflisen i Microsoft Fabric.

En ny MDF-transformasjonshandling vises på dataflow gen2-lerretet og åpner den innebygde MDF-transformasjonsforfattingsopplevelsen.

Tips

MDF transform authoring-opplevelsen bruker et kjent visuelt grensesnitt som ligner på Azure Data Factory og Azure Synapse Analytics Mapping Data Flows.

Forfatterens kartlegging av dataflyttransformasjoner

Etter at du har laget en MDF-transformasjon, kan du begynne å lage transformasjonslogikk.

Aktiver feilsøkingsmodus

For interaktiv forfatterskap og forhåndsvisning av data:

  1. Slå på dataflyt-debug-bryteren fra den flytende verktøylinjen.
  2. Vent til feilsøkingsøkten initialiseres.
  3. Etter at det er aktivert, kan du forhåndsvise kilde- og transformasjonsdata under forfatterskapet.

Skjermbilde av mapping data flow transform canvas med Data flow debug-modus aktivert.

Bemerkning

Debug-økter kan ta flere minutter å initialisere, avhengig av hvor tilgjengelig Spark er i kjøretid.

Legg til en kilde

For å konfigurere en kilde:

  1. Velg Legg til kilde.
  2. Velg tilkoblingstype.
  3. Velg en eksisterende Fabric-tilkobling eller lag nye tilkoblinger direkte gjennom Get Data-opplevelsen om nødvendig.
  4. Bla gjennom og velg kildefilen, tabellen eller datasettet.

Skjermbilde av kildekonfigurasjonsinnstillingene i kartleggingsdataflyt-transformasjonsopplevelsen.

Etter at du har konfigurert kildetilkoblingen og datasettet, bruk fanen Data preview-fanen for å validere og forhåndsvise kildedataene under interaktiv authoring.

Skjermbilde av fanen Data forhåndsvisning som viser kildedata i mapping data flow transform authoring-opplevelsen.

Legg til transformasjoner

For å legge til transformasjoner:

  1. Velg + ikonet ved siden av en kilde eller transformasjon.
  2. Velg transformasjonstypen.
  3. Konfigurer transformasjonsinnstillinger.

Du kan fortsette å bygge transformasjonslogikk ved å bruke det visuelle transformasjonslerretet.

Skjermbilde av den visuelle transformasjonsgrafen i kartleggingsdataflyt-transformasjonsopplevelsen.

Konfigurer en sink

Etter at transformasjonslogikken er fullført:

  1. Legg til en vask-transformasjon.
  2. Konfigurer destinasjonsforbindelsen.
  3. Konfigurer skriveinnstillinger.

Skjermbilde av konfigurasjonen av sink-transformasjonen i kartleggingsdataflyt-transformasjonsopplevelsen.

Valider og lagre

Før henrettelsen:

  1. Velg Valider fra MDF-transformasjonsverktøylinjen.

    Skjermbilde av Valider-knappen i mapping-dataflyttransformasjonsverktøylinjen.

  2. Løs valideringsproblemer hvis noen rapporteres.

  3. Velg Savefra Save & run-menyen .

    Skjermbilde av lagringsalternativet i Save and run-menyen for en mapping dataflyt-transformasjon.

Bemerkning

Kun Lagre-handlingen støttes for øyeblikket for dataflyt gen2 med MDF-transformasjoner i offentlig forhåndsvisning.

Kjør mapping dataflyt-transformasjoner ved hjelp av Fabric-pipelines

Du kjører MDF-transformasjoner gjennom Fabric-datapipelines ved hjelp av en Dataflow-aktivitet.

For å utføre en MDF-transformasjon:

  1. Lag en ny Fabric-pipeline.
  2. Legg til en Dataflow-aktivitet i pipelinen.
  3. I aktivitetsinnstillingene velger du dataflow-gen2-elementet som inneholder MDF-transformasjonen.
  4. Velg MDF-transformasjonsspørringen for å kjøre.
  5. Konfigurer Spark-runtime-innstillinger etter behov.
  6. Valider og publiser pipelinen.
  7. Kjør pipelinen manuelt eller konfigurer en tidsplan eller triggere.

Skjermbilde av en Fabric-pipeline med en Dataflow-aktivitet konfigurert for kartlegging av dataflyttransformasjon.

Konfigurer Spark-kjøretidsinnstillinger

MDF-transformasjoner utføres ved hjelp av administrert Spark-kjøretid integrert med Data Factory i Microsoft Fabric. Du kan konfigurere Spark-runtime-innstillinger under pipeline-kjøring, inkludert:

  • Beregningsstørrelse
  • Slukegenskaper

Skjermbilde av Spark-runtime-konfigurasjonsinnstillingene for en Dataflow-aktivitet i en Fabric-pipeline.

Overvåk utførelser av kartlegging av dataflyttransformasjoner

Du kan overvåke MDF-transformasjonsutførelse gjennom:

  • Pipeline-utgangspanelet

    Skjermbilde av pipeline-utgangspanelet som viser kartleggingsresultater for dataflyttransformasjon.

  • Overvåkingssenteret

    Skjermbilde av Monitoring Hub som viser aktivitetskjøringer for en kartlegging av dataflyttransformasjon.

For å se overvåkingsdetaljer:

  1. Åpne detaljene for pipeline-kjøringen.
  2. Velg Dataflow-aktiviteten fra Activity Runs.
  3. Gjennomgå kjørestatus og kjøretidsdetaljer.

Skjermbilde av overvåkingssiden for mapping data flow transform som viser kjørestatus og kjøretidsdetaljer.