Trinnvise dataalternativer for Dataflow Gen2

Bemerkning

De trinnvise dataalternativene beskrevet i denne artikkelen er for øyeblikket i forhåndsvisning.

Når du aktiverer staging på en spørring, skriver Dataflow Gen2 mellomliggende resultater til en intern staging-Lakehouse slik at motoren kan bruke Fabric beregning for transformasjoner eller for å lande data i en destinasjon.

Staged Data-seksjonen i dataflow Scale-innstillingene lar deg justere to aspekter av den pipelinen:

  • Optimalisert kopi til Lakehouse (Forhåndsvisning) — Bruk en raskere vei for å skrive trinnvise data til en Fabric Lakehouse-datadestinasjon.
  • Aktiver V-Order-komprimering (Forhåndsvisning) — Bruk V-Order-komprimering på data skrevet til staging-Lakehouse.

Begge alternativene gjelder på dataflow-nivå og trer kun i bruk i Dataflow Gen2.

Hvor finner du innstillingene

  1. Åpne dataflyten din i Power Query-editoren.
  2. Velg Alternativer fra menyen.
  3. Gå til fanen Skala .
  4. De to innstillingene er listet under Staged Data.

Skjermbilde av dialogen Innstillinger med fanen Skala valgt og Staged Data-seksjonen markert.

Optimalisert kopi til Lakehouse (Forhåndsvisning)

Når dette alternativet er på, bruker Dataflow Gen2 en optimalisert databevegelsessti for spørringer som:

  • Ha staging aktivert, og
  • Skriv til en Fabric Lakehouse datadestinasjon.

I standardstien flyter data fra staging-lageret til Lakehouse med ekstra serialisering og nettverkshopp. Den optimaliserte banen reduserer disse hoppene, noe som kan forkorte oppdateringstiden betydelig for staging-tunge dataflyter som lander i en Lakehouse.

For et målt eksempel på oppdateringstids- og CU-forbrukets påvirkning av dette alternativet, se Scenario 3: Optimalisert kopi til Lakehouse i Dataflow Gen2 kostnads- og ytelsesbenchmarkene.

Når den skal brukes

Slå dette på når du iscenesetter spørringer som til slutt lander i en Fabric Lakehouse-datadestinasjon. Iscenesettelse er mest nyttig når:

  • Spørringen din inneholder transformasjoner som ikke brettes til kilden.
  • Du bør stole på Fabric staging compute (Lakehouse eller Warehouse) for å kjøre tunge operasjoner som joins, group-by eller filtre før du skriver til destinasjonen.

For mer om når staging hjelper, se Best practices for å oppnå best ytelse med Dataflow Gen2.

Standard virkemåte

Alternativet er av som standard. For de fleste dataflyter som faser data og skriver til en Fabric Lakehouse, er det fordelaktig å slå på dette alternativet.

Vurderinger

  • Alternativet gjelder kun spørringer som har staging aktivert og som skriver til en Fabric Lakehouse-datadestinasjon. For spørringer som skriver til andre destinasjoner (Fabric Warehouse, Fabric SQL-database, Azure SQL, Snowflake, KQL, Azure Data Lake Storage Gen2, fildestinasjoner), har valget ingen effekt.
  • Hvis du slår av staging for en spørring, gjelder ikke den optimaliserte kopieringsstien for den spørringen.
  • Alternativet gjelder for alle kvalifiserende spørringer i dataflyten. Det er ingen overstyring per forespørsel i dag.

Aktiver V-Order-komprimering (Forhåndsvisning)

V-Order er en skrivetidsoptimalisering for Parquet-filformatet som forbedrer leseytelsen for nedstrøms Fabric-motorer, på bekostning av ekstra CPU under skrivingen. For bakgrunn og veiledning på tvers av motorer, se Delta Lake-tabelloptimalisering og vedlikeholdog optimalisering av V-Order og Cross-workload tabeller.

Når dette alternativet er på, anvender Dataflow Gen2 V-Order-komprimering på data skrevet til staging-Lakehouse. Når den er av, skrives trinnvise data uten V-Order.

Når man skal slå V-Order av eller på for iscenesettelse

Staging Lakehouse inneholder mellomliggende data som kun brukes av Dataflow Gen2 selv: dataflowen leser stagede data på nytt under samme oppdatering for å utføre videre transformasjoner eller skrive til en destinasjon, og Dataflow-koblingen leser fra de trinnvise dataene når andre elementer spør dataflowens output. Sluttbruker-spørringsmotorer (Power BI Direct Lake, Fabric Warehouse, SQL analytics endpoint, Spark) leser ikke staging-Lakehouse direkte. Disse scenariene gjelder i stedet for din Lakehouse-datadestinasjon . For destinasjonsveiledning, se Aktiver V-orden-komprimering på en Lakehouse-destinasjon.

Siden trinnvis data vanligvis leses et lite antall ganger i samme oppdatering, er det et godt valg å slå av V-Order for staging for de fleste dataflyter. Å hoppe over V-Order reduserer CPU-en i skrivetiden og forkorter oppdateringstiden, spesielt for store staging-skrivinger. Vurder å slå V-Order for staging hvis dataflowens trinnvise output brukes mange ganger gjennom Dataflow-koblingen, og du vil prioritere leseytelse for disse nedstrømsspørringene fremfor staging-skrivekostnad.

Standard virkemåte

Alternativet er aktivert som standard. Bruk veiledningen ovenfor for å avgjøre hva som passer for din dataflyt.

Hvor ellers gjelder V-ordren

I tillegg til dataflytnivåinnstillingen som styrer staging-Lakehouse, kan V-Order også styres på selve Lakehouse-datadestinasjonen, gjennom Enable using of V-Order compression advanced option. Den innstillingen styrer om data skrevet til destinasjons-Lakehouse er V-Order-komprimert. Destinasjonen er overflaten som leses av Direct Lake, Fabric Warehouse, SQL-analyseendepunktet og Spark, så destinasjonsnivå-veiledningen er scenariobasert.

For detaljer om destinasjonsnivå-alternativet, se Aktiver V-ordre-komprimering på en Lakehouse-destinasjon.