Gefaseerde gegevensopties voor Gegevensstroom Gen2

Note

De gefaseerde gegevensopties die in dit artikel worden beschreven, zijn momenteel beschikbaar als preview-versie.

Wanneer u staging inschakelt voor een query, schrijft Dataflow Gen2 tussenresultaten naar een intern staging-Lakehouse, zodat de engine de Fabric-rekenkracht kan gebruiken voor transformaties of om gegevens naar een bestemming te schrijven.

In de sectie Gefaseerde gegevens in de instellingen voor gegevensstroomschaal kunt u twee aspecten van die pijplijn afstemmen:

  • Geoptimaliseerd kopiëren naar Lakehouse (Preview) — Gebruik een snellere manier om gefaseerde gegevens naar een Fabric Lakehouse-gegevensdoel te schrijven.
  • V-Order-compressie inschakelen (Preview) — V-Order-compressie toepassen op gegevens die naar het staging-Lakehouse worden geschreven.

Beide opties zijn van toepassing op gegevensstroomniveau en worden alleen van kracht in Dataflow Gen2.

Waar vind ik de instellingen?

  1. Open uw gegevensstroom in de Power Query-editor.
  2. Selecteer Opties in het menu.
  3. Ga naar het tabblad Schaal .
  4. De twee instellingen worden vermeld onder Gefaseerde gegevens.

Schermopname van het dialoogvenster Opties met het tabblad Schaal geselecteerd en de sectie Gefaseerde gegevens gemarkeerd.

Geoptimaliseerd kopiëren naar Lakehouse (Preview)

Wanneer deze optie is ingeschakeld, gebruikt Dataflow Gen2 een geoptimaliseerd pad voor gegevensverplaatsing voor query's die:

  • staging ingeschakeld hebben, en
  • Schrijf naar een Fabric Lakehouse gegevensbestemming.

In het standaardpad stromen gegevens van het staging-warehouse naar het lakehouse, met extra serialisatie en netwerksprongen. Het geoptimaliseerde pad vermindert deze tussenstappen, waardoor de verversingstijd aanzienlijk kan worden verkort voor gegevensstromen met veel stagingstappen die in een Lakehouse terechtkomen.

Voor een gemeten voorbeeld van de impact van de verversingstijd en het verbruik van deze optie, zie Scenario 3: Geoptimaliseerde kopie naar Lakehouse in de Dataflow Gen2 kosten- en prestatiebenchmarks.

Wanneer gebruikt u het?

Schakel dit in wanneer u query's klaarzet die uiteindelijk in een Fabric Lakehouse-gegevensbestemming terechtkomen. Fasering is het handigst wanneer:

  • Uw query bevat transformaties waarvoor query folding naar de bron niet mogelijk is.
  • U wilt Fabric-staging-rekenkracht (Lakehouse of Warehouse) gebruiken om zware bewerkingen, zoals joins, groeperingen of filters, uit te voeren voordat de gegevens naar de bestemming worden geschreven.

Zie De aanbevolen procedures voor het verkrijgen van de beste prestaties met Dataflow Gen2 voor meer informatie over wanneer fasering helpt.

Standaardgedrag

De optie is standaard uitgeschakeld. Voor de meeste gegevensstromen die gegevens fasen en schrijven naar een Fabric Lakehouse, is het handig om deze optie in te schakelen.

Overwegingen

  • De optie wordt alleen van kracht op query's waarvoor fasering is ingeschakeld en die schrijven naar een Fabric Lakehouse-gegevensbestemming. Voor query's die naar andere bestemmingen schrijven (Fabric Warehouse, Fabric SQL-database, Azure SQL, Snowflake, KQL, Azure Data Lake Storage Gen2, bestandsbestemmingen), heeft de optie geen effect.
  • Als u fasering voor een query uitschakelt, is het geoptimaliseerde kopieerpad niet van toepassing op die query.
  • De optie is van toepassing op alle in aanmerking komende query's in de gegevensstroom. Er is momenteel geen overschrijving voor afzonderlijke query’s.

V-Order-compressie inschakelen (Preview)

V-Order is een schrijfoptimalisatie voor de Parquet-bestandsindeling die de leesprestaties van onderliggende Fabric-engines verbetert, ten koste van extra CPU-capaciteit tijdens het schrijven. Zie voor achtergrondinformatie en engineoverschrijdende richtlijnen optimalisatie van Delta Lake-tabellen en V-Order en tabelonderhoud en -optimalisatie voor verschillende workloads.

Wanneer deze optie is ingeschakeld, past Dataflow Gen2 V-Order-compressie toe op gegevens die naar de staging Lakehouse zijn geschreven. Wanneer de gegevens zijn uitgeschakeld, worden gefaseerde gegevens zonder V-Order geschreven.

Wanneer u V-Order in- of uitschakelt bij gefaseerde implementatie

De staging-Lakehouse bevat intermediaire gegevens die alleen door Dataflow Gen2 zelf worden gebruikt: de dataflow leest tijdens dezelfde vernieuwing de in staging geplaatste gegevens opnieuw om verdere transformaties toe te passen of gegevens naar een bestemming weg te schrijven, en de Dataflow-connector leest uit de in staging geplaatste gegevens wanneer andere items de uitvoer van de dataflow opvragen. Query-engines voor eindgebruikers (Power BI Direct Lake, Fabric Warehouse, SQL analytics-eindpunt, Spark) lezen het staging-Lakehouse niet direct. Deze scenario's zijn in plaats daarvan van toepassing op uw Lakehouse-gegevensbestemming . Zie V-Order-compressie inschakelen op een Lakehouse-bestemming voor richtlijnen voor bestemmingen.

Omdat gefaseerde gegevens doorgaans een klein aantal keren binnen dezelfde vernieuwing worden gelezen, is het uitschakelen van V-volgorde voor fasering een goede keuze voor de meeste gegevensstromen. Het overslaan van V-Order vermindert het CPU-gebruik tijdens het schrijven en verkort de vernieuwingstijd, vooral bij grote staging-schrijfbewerkingen. Overweeg om V-Order in te schakelen voor fasering als de gefaseerde uitvoer van de gegevensstroom vaak wordt verbruikt via de gegevensstroomconnector en u de leesprestaties voor die downstreamquery's wilt verbeteren ten opzichte van de faseringskosten voor schrijfbewerkingen.

Standaardgedrag

De optie is standaard ingeschakeld. Gebruik de bovenstaande richtlijnen om te bepalen wat geschikt is voor uw gegevensstroom.

Waar anders V-Order van toepassing is

Naast de instelling op gegevensstroomniveau waarmee het staging-Lakehouse wordt bepaald, kan V-Order ook worden beheerd op de verbinding van de Lakehouse-gegevensbestemming zelf, via de geavanceerde optie Het gebruik van V-Order-compressie inschakelen. Met deze instelling bepaalt u of gegevens die naar het doel Lakehouse zijn geschreven, V-Order gecomprimeerd zijn. Het doel is het oppervlak dat wordt gelezen door Direct Lake, Fabric Warehouse, het EINDPUNT voor SQL-analyse en Spark, dus richtlijnen op doelniveau zijn gebaseerd op scenario's.

Zie V-Order-compressie inschakelen op een Lakehouse-bestemming voor meer informatie over de optie op doelniveau.