Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Note
Alternativen för mellanlagrade data som beskrivs i den här artikeln är för närvarande i förhandsversion.
När du aktiverar staging för en fråga skriver Dataflow Gen2 mellanliggande resultat till ett internt Lakehouse för mellanlagring så att motorn kan använda beräkningskapacitet i Fabric för omvandlingar eller för att skriva data till ett mål.
I avsnittet Mellanlagrade data i inställningarna för dataflödesskala kan du finjustera två aspekter av pipelinen:
- Optimerad kopiering till Lakehouse (förhandsversion) — Använd en snabbare metod för att skriva mellanlagrad data till ett Fabric Lakehouse-datamål.
- Aktivera V-Order-komprimering (förhandsversion) – Använd V-Order-komprimering för data som skrivits till mellanlagringen av Lakehouse.
Båda alternativen gäller på dataflödesnivå och träder endast i kraft i Dataflöde Gen2.
Var du hittar inställningarna
- Öppna ditt dataflöde i Power Query-redigeraren.
- Välj Alternativ på menyn.
- Gå till fliken Skala .
- De två inställningarna visas under Mellanlagrade data.
Optimerad kopia till Lakehouse (förhandsversion)
När det här alternativet är aktiverat använder Dataflow Gen2 en optimerad dataförflyttningssökväg för frågor som:
- Ha mellanlagring aktiverat, och
- Skriv till ett datamål i Fabric Lakehouse.
I standardvägen flödar data från staging-Warehouse till Lakehouse med extra serialisering och nätverkshopp. Den optimerade vägen minskar dessa hopp, vilket avsevärt kan förkorta uppdateringstiden för dataflöden med omfattande mellanlagring som hamnar i ett Lakehouse.
För ett mätt exempel på uppdateringstiden och CU-förbrukningens påverkan av detta alternativ, se scenario 3: Optimerad kopia till Lakehouse i Dataflow Gen2 kostnads- och prestandabenchmarks.
När du ska använda detta
Aktivera detta när du mellanlagrar frågor som slutligen hamnar i ett Fabric Lakehouse-datamål. Staging är mest användbart när:
- Din fråga innehåller transformationer som inte kan återföras till källan.
- Du vill använda Fabrics beräkningsresurser för mellanlagring (Lakehouse eller Warehouse) för att köra tunga åtgärder som sammanfogningar, grupperingar eller filter innan du skriver till måldestinationen.
Mer information om när mellanlagring hjälper finns i Metodtips för att få bästa prestanda med Dataflow Gen2.
Standardbeteende
Alternativet är inaktiverat som standard. För de flesta dataflöden som mellanlagrar data och skriver till en Fabric Lakehouse är det fördelaktigt att aktivera det här alternativet.
Överväganden
- Alternativet gäller endast för frågor där mellanlagring har aktiverats och som skriver data till ett Fabric Lakehouse-datamål. För frågor som skriver till andra mål (Fabric Warehouse, Fabric SQL-databas, Azure SQL, Snowflake, KQL, Azure Data Lake Storage Gen2, filmål) har alternativet ingen effekt.
- Om du inaktiverar mellanlagring för en fråga gäller inte den optimerade kopieringssökvägen för den frågan.
- Alternativet gäller för alla kvalificerande frågor i dataflödet. Det finns ingen möjlighet att åsidosätta enskilda frågor idag.
Aktivera V-orderkomprimering (förhandsversion)
V-Order är en optimering vid skrivning för Parquet-filformatet som förbättrar läsprestandan för efterföljande Fabric-motorer, på bekostnad av högre CPU-användning vid skrivning. Bakgrundsinformation och vägledning för flera motorer finns i Delta Lake-tabelloptimering och V-Order och tabellunderhåll och optimering för olika arbetsbelastningar.
När det här alternativet är aktiverat tillämpar Dataflow Gen2 V-Order-komprimering på data som skrivs till mellanlagrings-Lakehouse. När funktionen är avstängd skrivs mellanlagrad data utan V-Order.
När V-Order ska vara aktiverad eller inaktiverad för staging
Mellanlagringslakehouset innehåller mellanliggande data som endast används av Dataflow Gen2 självt: dataflödet läser in mellanlagrade data på nytt under samma uppdatering för att tillämpa ytterligare transformeringar eller skriva till ett mål, och Dataflow-anslutningen läser från de mellanlagrade dataene när andra objekt frågar efter utdata från dataflödet. Frågemotorer för slutanvändare (Power BI Direct Lake, Fabric Warehouse, SQL Analytics-slutpunkt, Spark) läser inte direkt från mellanlagringslakehouset. Dessa scenarier gäller i stället ditt datamål i Lakehouse. Vägledning för målet finns i Aktivera V-Order-komprimering för ett Lakehouse-mål.
Eftersom mellanlagrade data vanligtvis läss ett litet antal gånger inom samma uppdatering är det bra att inaktivera V-order för mellanlagring för de flesta dataflöden. Att hoppa över V-Order minskar CPU-användningen vid skrivning och förkortar uppdateringens varaktighet, särskilt för stora mellanlagrade skrivningar. Överväg att aktivera V-Order aktiverad för mellanlagring om dataflödets mellanlagrade utdata används många gånger via Dataflow-anslutningen och du vill prioritera läsprestanda för dessa efterföljande frågor framför skrivkostnaden för mellanlagring.
Standardbeteende
Alternativet är aktiverat som standard. Använd vägledningen ovan för att bestämma vad som är rätt för ditt dataflöde.
Var annars V-Order gäller
Förutom inställningen för dataflödesnivå som styr mellanlagringen av Lakehouse kan V-Order också styras på själva Lakehouse-datamålanslutningen, via alternativet Aktivera användning av avancerad V-Order-komprimering . Den inställningen styr om data som skrivs till mål-Lakehouse är V-Order-komprimerade. Målet är ytan som läss av Direct Lake, Fabric Warehouse, SQL Analytics-slutpunkten och Spark, så vägledningen på målnivå baseras på scenariot.
Mer information om målnivåalternativet finns i Aktivera V-Order-komprimering på ett Lakehouse-mål.
Relaterat innehåll
- Dataflow Gen2 kostnads- och prestandabenchmarks
- Metodtips för att få bästa prestanda med Dataflow Gen2
- Dataflow Gen2-data destinations och hanterade inställningar
- Delta Lake-tabelloptimering och V-order
- Underhåll och optimering av tabeller över olika arbetsbelastningar
- Modern utvärderare för Dataflow Gen2 med CI/CD
- Använda partitionerad beräkning i Dataflöde Gen2 (förhandsversion)