Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Microsoft Fabric Dataflow Gen2 erbjuder flera sätt att effektivt ta in, transformera och ladda data. De här metoderna hjälper dig att balansera prestanda, skalbarhet och kostnad.
Denna artikel är prestanda- och kostnadsreferensen för Dataflow Gen2. Den jämför prestandan för fyra vanliga arbetsbelastningar – bulkkopiering, omfattande datatransformering, optimerade skrivningar till lakehouse och sammanslagning av partitionerade filer – och rapporterar körtiden och de kapacitetsenheter (CU) som var och en förbrukade, uppmätta via kapacitetstelemetri. Använd den för att uppskatta vad dina egna uppdateringar kostar och för att välja den funktionalitet som passar varje arbetsbelastning.
I stor skala överträffar Dataflow Gen2 avsevärt Dataflow Gen1 både vad gäller hastighet och kostnad – och ju större arbetsbelastning, desto större är gapet. Genom att köra samma M-skript, mot samma data, på samma Fabric kapacitet, slutförde Dataflow Gen2 varje benchmark i denna artikel 1,7× till 21× snabbare än Dataflow Gen1-baslinjen. I varje scenario där båda generationernas kapacitetskonsumtion mättes gjorde Dataflow Gen2 det snabbare arbetet samtidigt som det förbrukade 82% till 95% färre kapacitetsenheter – så hastighetsökningen sker inte på bekostnad av extra kapacitet. Du får ihop båda vinsterna utan att skriva om en enda fråga.
Hur stor vinsten blir beror på din arbetsbelastning, och den viktigaste faktorn är hur länge dina frågor körs. Standard Compute fakturerar de första 10 minuterna av varje fråga med 12 CU per sekund, sedan endast 1,5 CU för varje extra sekund, så ju längre en fråga körs, desto lägre blir dess genomsnittliga kostnad per sekund. Ett kort dataflöde avslutas inom den första nivån och når aldrig det billigare priset, så skillnaden mellan de två generationerna är liten. Vinsterna ökar med datavolymen och körtiden, därför används stora datamängder med hög volym och långvariga uppdateringar i prestandatesterna i den här artikeln.
Dataflow Gen2 blir också billigare på sina egna villkor: nuvarande priser och funktioner minskar CU-förbrukningen med uppskattningsvis 14% till 84%, beroende på arbetsbelastningen, jämfört med vad samma arbetsbelastning skulle ha förbrukat före 2026.
Note
I den här artikeln mäts kostnad och kapacitet i Fabric Capacity Units (CUs). För hur Dataflow Gen2 förbrukar CU:er och hur det kopplas till fakturering, se Dataflow Gen2 prissättning. Dessa riktmärken och CU-siffror speglar den nuvarande Dataflow Gen2-prismodellen och kapaciteterna, inklusive nivådelad Standard Compute-prissättning, Fast Copy och Modern Evaluator. Eftersom Dataflow Gen2:s prestanda och kostnadseffektivitet har förbättrats över tid, kan siffror publicerade före 2026 inte spegla det nuvarande beteendet.
Följande funktioner hjälper dig att optimera dina dataflöden:
- Snabb kopiering – Accelerera bulkdatarörelse innan transformation.
- Modern Utvärderare – Snabba upp tung dataformning på icke-vikbara frågor.
- Mellanlagringsfrågor – Landa data i ett mellanliggande lager innan du tillämpar transformeringar, vilket aktiverar ELT-mönster.
- Optimerad kopiering till Lakehouse – Snabbare skrivning av stegad data till en destination i Lakehouse i ELT-arbetsbelastningar.
- Partitionerad beräkning (Förhandsgranskning) – Skalar transformationer över stora och partitionerade datamängder.
Den här artikeln tar upp vanliga användningsfall, verkliga exempel och benchmarkingresultat för att hjälpa dig välja rätt kapacitet för din arbetsbelastning.
Dataflow Gen2 debiterar för varje motor separat, enligt följande aktuella priser:
- Standard Compute (mashup-motorfrågor) – 12 CU för varje sekund upp till 10 minuter av varje fråga, sedan 1,5 CU för varje extra sekund.
- Fast Copy (datarörelse) - 1,5 CU för varje sekund kopiaktivitet, mätt över alla använda kärnor.
För den kompletta hastighetsmodellen, se Dataflow Gen2-prissättning.
Snabbreferens
Matcha din arbetsbelastning med rätt Dataflow Gen2-kapacitet. Ett referensexempel för var och en finns i det länkade scenariot.
| Capability | Använd den när... | Viktig fördel | Riktmärke |
|---|---|---|---|
| Snabbkopiering | Du behöver en direkt kopia med högt dataflöde från en källa som stöds utan transformeringar. | Snabbare inmatning till lägre beräkningskostnad. | Scenario 1: Kopiera data |
| Modernt utvärderingsverktyg | Du formar data från icke vikbara eller delvis vikbara kopplingar (filter, härledning, rensning). | Snabbare körning utan att ändra programmets logik. | Scenario 2: Tung datahantering |
| Optimerad kopia till Lakehouse | Du aktiverade mellanlagring för en fråga som skriver till en lakehouse-destination. | Maximerar genomströmningen när man skriver stadierade data till sjöhuset. | Scenario 3: Optimerad kopiering till Lakehouse |
| Partitioned Compute (Preview) | Du transformerar stora, partitionerade eller flerfilsdatauppsättningar som kan köras parallellt. Kombinera med Modern Evaluator när det stöds. | Parallelliserad körning mellan partitioner. | Scenario 4: Kombinera filer |
Note
Bakgrund om frågeutvärdering och frågedelegering finns i Grunderna för frågedelegering.
Sammanfattning av benchmark-resultat
De flesta scenarier i denna artikel använder New York City Taxi & Limousine Commission (TLC) Trip Data – TLC Trip Record Data-dataset : miljarder taxireseregister lagrade som Parquet-filer i ADLS Gen2, som täcker 2021–2025 (fram till augusti). Scenario 3 använder en Fabric-sjöhustabell med cirka 113 miljoner taxireseuppgifter i New York City från 2017 till mitten av 2018. Måldestinationen är ett Fabric lakehouse eller lager, beroende på scenariot.
I följande tabell sammanfattas prestandaresultatet för alla scenarier. Varje scenario innehåller också en Dataflow Gen1-baslinje för jämförelse.
| Scenario | Vad det gör | Funktionen är aktiverad | Gen2-exekveringstid | Hastighetsökning jämfört med Gen1-referenslinjen | Gen1 CU | Gen2 CU | Minskning av CU på Gen2 |
|---|---|---|---|---|---|---|---|
| Scenario 1: Kopiera data | Massinläs fem konsoliderade Parquet-filer från ADLS Gen2 till ett lakehouse utan transformeringar. | Snabbkopiering | 00:09:08 | 11× snabbare | 84,411 | 14,593 | 83% |
| Scenario 2: Tung datahantering | Tillämpa icke-vikbara transformeringar (filter, härledning, rensning) på en enda stor Parquet-fil som läses in i ett sjöhus. | Modern utvärderare | 00:46:29 | 1,7× snabbare | 56,855 | 10,485 | 82% |
| Scenario 3: Optimerad kopiering till Lakehouse | Transformera en taxitabell för NYC med 113 miljoner rader från ett Fabric-lakehouse och skriv resultatet till en lakehouse-tabell via en accelererad kopieringsväg. Detta benchmark använder optimerad kopia till Lakehouse och V-Order. | Optimerad kopia till Lakehouse | 00:03:34 | 15× snabbare | 50,788 | 2,391 | 95% |
| Scenario 4: Kombinera filer | Kombinera och transformera 56 partitionerade Parquet-filer parallellt och läs in i ett datamagasin. | Partitioned Compute (förhandsversion) | 00:04:48 | 21× snabbare | Ej uppmätt | Ej uppmätt | Ej uppmätt |
Följande diagram jämför samma scenarier efter kapacitetsförbrukning istället för exekveringstid.
Stegvis information, konfigurationer av datauppsättningar och designmönster för varje funktion finns i avsnitten scenario som följer.
Note
Alla scenarier i denna artikel har Modern Evaluator aktiverad och V-Order avstängd om inget uttryckligen anges annat. Gen1 CU- och Gen2 CU-kolumnerna visar sekunder för kapacitetsenhet. CU-reduktionen på Gen2-kolumnen är minskningen i CU-sekunder från Dataflow Gen1-baslinjen till den bästa Dataflow Gen2-konfigurationen, beräknad som (Gen1 CU − Gen2 CU) ÷ Gen1 CU.
Hur vi mätte dessa riktmärken
Varje scenario kör samma M-skript två gånger: en gång på Dataflow Gen1 för att etablera en baslinje, och en gång på Dataflow Gen2 med den här funktionen aktiverad.
Varje körning i den här artikeln har samma testförhållanden:
- Alla scenarier och båda generationerna kördes på samma Fabric-kapacitet, så inget resultat speglar en annan kapacitetsstorlek eller SKU.
- Ingen datagateway var inblandad. Varje anslutning gick direkt från Fabric-tjänsten till en molnbaserad datakälla.
- Varje scenario använde samma källdata och samma M-skript för både Dataflow Gen1 och Dataflow Gen2.
De rapporterade siffrorna betyder följande:
- Körtid är den totala uppdateringstiden som rapporteras för dataflödeskörningen.
- CU som förbrukas är de Capacity Unit-sekunder som körningen fakturerade till kapaciteten, läst från Microsoft Fabric Capacity Metrics-appen. Eftersom Dataflow Gen2 fakturerar varje motor separat är ett scenarios total summan av varje motor som kördes under uppdateringen, och CU-siffror avrundas till närmaste hela CU-sekund. För den kompletta hastighetsmodellen, se Dataflow Gen2-prissättning.
När du jämför de två generationerna, ha dessa arkitektoniska skillnader i åtanke:
- Dataflow Gen1 använder en fundamentalt annorlunda arkitektur än Dataflow Gen2, och det stöder inte funktioner som Fast Copy, Modern Evaluator, Optimized copy to Lakehouse eller Partitioned Compute.
- Dataflow Gen1 kan endast ladda data som CSV-filer, medan Dataflow Gen2 laddar data som Parquet-filer i dessa scenarier.
Note
Dessa siffror registrerades i vår egen testmiljö i augusti 2026 och gäller endast för dessa specifika körningar. Dina egna resultat varierar beroende på datavolym, kapacitetsstorlek och konfiguration. För att mäta dina egna arbetsbelastningar, se Beräkna uppskattade kostnader med Fabric Metrics-appen och historiken för uppdateringar av dataflödes.
Scenario 1: Kopiera data
NYC Taxi-analysteamet behöver ladda miljontals råa Parquet-reseregister från ADLS Gen2 i ett Fabric-sjöhus. Teamet behöver inga transformeringar, bara en direkt kopia för att stödja nedströmsanalys.
Challenges
- Flytta stora mängder Parquet-data snabbt in i sjöhuset.
- Minska inmatningstiden för dagliga uppdateringar.
- Minimera beräkningskostnaden för enkla extract-load (EL) arbetsflöden.
Dataset
Årsvis sammanslagna NYC Yellow Taxi Parquet-filer, fem konsoliderade partitioner (2021–aug 2025).
Solution
Teamet möjliggör Fast Copy i Dataflow Gen2. Snabbkopiering optimerar dataförflyttningsvägar och parallelliserar skrivprocesser för stödda anslutningar.
Design
Den här frågan kombinerar de fem årvisa Parquet-filerna och laddar in resultatet i lakehouse.
Överväganden kring Fast Copy
- Stöder filformaten.csv och .parquet .
- Stöder upp till 1 M rader per tabell per körning för Azure SQL Database.
- Bäst lämpad för extrahera-ladda (EL)-arbetsflöden före transformering.
Results
När du aktiverar Fast Copy tar Dataflow Gen2 in denna datamängd cirka 11× snabbare än Dataflow Gen1-baslinjen (00:09:08 vs. 01:38:59) samtidigt som beräkningsanvändningen minskas. Utan Fast Copy är Dataflow Gen2 redan cirka 2,8× snabbare än Gen1 på samma arbetsbelastning.
| Konfiguration | Körningstid (hh:mm:ss) | Jämförelse mot Gen1 | CU förbrukad |
|---|---|---|---|
| Baslinje för Dataflöde Gen1 | 01:38:59 | — | 84,411 |
| Dataflöde Gen2 utan snabb kopiering | 00:35:25 | 2,8× snabbare | Ej uppmätt |
| Dataflöde Gen2 med snabb kopiering | 00:09:08 | 11× snabbare | 14,593 |
När du aktiverar Fast Copy – den mest optimala Dataflow Gen2-konfigurationen för detta scenario – tar Scenario 1:s Fast Copy-inmatning av fem konsoliderade Parquet-filer i ett sjöhus 14 593 CU-sekunder. Följande tabell bryter ner det totala antalet per operation:
| Operation | Motor (mätare) | CU-sekunder |
|---|---|---|
| Dataförflyttning | Snabbkopiering | 8,280 |
| Kör sökfrågor | Standardberäkning | 6,313 |
| Total | 14,593 |
Dataöverföring med Fast Copy debiteras med 1,5 CU för varje sekund av kopieringsaktivitet, beräknat som den sammanlagda tiden över alla kärnor som kopieringen körs på. Dataflow Gen2 balanserar automatiskt hur många kärnor varje Fast Copy-scenario använder, så en kopia som snabbt blir klar i väggklockstid kan fortfarande sträcka sig över många kärnsekunder. All återstående frågetid faktureras på Standard Compute (12 CU per sekund upp till 10 minuter, sedan 1,5 CU för varje extra sekund). För den fullständiga prismodellen, se Dataflow Gen2 prissättning.
Viktiga lärdomar
- Att aktivera Fast Copy minskade en 99 minuter lång inläsning till ungefär nio minuter, en tiodubbel förbättring för samma datauppsättning och M-skript.
- Dataflow Gen2 använde också 83% mindre kapacitet än Dataflow Gen1 för samma arbete (14 593 mot 84 411 CU-sekunder), så hastighetsökningen kom inte på bekostnad av extra beräkning.
- Hastighetsökningen kommer från inbyggd, parallelliserad datarörelse som kringgår mashup-motorn, så den gäller bara för extrakt-laddningssteg som uppfyller Fast Copy-kraven. Alla transformationer som bryter vikningsprocessen återgår till standardmotorn och går miste om fördelarna.
- För källor som stöds behandlar du Fast Copy som standard för inmatning och reserverar tyngre transformeringsmotorer (som beskrivs i nästa scenarier) för steg som faktiskt omformar data.
Scenario 2: Avancerad dataformning
Efter inmatning applicerar teamet filtrering, nullersättning och kodmappning innan data laddas in i lakehouse. Dessa transformationer omvandlas inte fullt ut tillbaka till Parquet och är långsamma vid bearbetning i minnet.
Challenges
- Förbättra omvandlingshastigheten för halvvikbara eller icke-vikbara frågor.
- Bibehåll Power Query-redigering utan att skriva kod.
- Minska den totala uppdateringstiden och kostnaden.
Dataset
Alla Parquet-filer för 2021–augusti 2025 slogs ihop till en sammanslagen fil.
Solution
Teamet aktiverar Modern Evaluator, en högpresterande körningsmotor som är utformad för effektiv omvandling, särskilt för anslutningsappar som ADLS Gen2 och SharePoint.
Design
Den här frågan matar in data från en konsoliderad Parquet-fil, filtrerar kolumnerna trip_distance och fare_amount för att behålla värden över 0, ersätter null-värden med passenger_count 1 och skapar en ny payment_method kolumn genom att mappa betalningstyperna innan data läses in i lakehouse.
Överväganden om moderna utvärderare
- Förväntade uppdateringstider kan vara betydligt snabbare (varierar beroende på datauppsättning och transformeringar).
- Optimerad för stora volymer (miljontals rader).
- Fördelaktigt för ej vikbara frågor.
- Faster skriver till destinationer som ett sjöhus.
Results
När du aktiverar Modern Evaluator kör Dataflow Gen2 denna formningsarbetsbelastning cirka 1,7× snabbare än Dataflow Gen1:s baslinje (00:46:29 vs. 01:19:56) samtidigt som den icke-kodade Power Query-upplevelsen bevaras. Utan Modern Evaluator är samma arbetsbelastning bara cirka 1,2 × snabbare än Gen1 (01:08:37 vs. 01:19:56).
| Konfiguration | Körningstid (hh:mm:ss) | Jämförelse mot Gen1 | CU förbrukad |
|---|---|---|---|
| Baslinje för Dataflöde Gen1 | 01:19:56 | — | 56,855 |
| Dataflöde Gen2 utan modern utvärderare | 01:08:37 | 1.2× snabbare | Ej uppmätt |
| Dataflöde Gen2 med modern utvärderare | 00:46:29 | 1,7× snabbare | 10,485 |
När du aktiverar Modern Evaluator – den mest optimala Dataflow Gen2-konfigurationen för detta scenario – tar scenario 2:s Modern Evaluator 10 485 CU-sekunder som formar en enda stor Parquet-fil till ett sjöhus. Följande tabell bryter ner det totala antalet per operation:
| Operation | Motor (mätare) | CU-sekunder |
|---|---|---|
| Kör sökfrågor | Standardberäkning | 10,485 |
| Total | 10,485 |
Arbetet körs helt på Standard Compute, som faktureras på två nivåer: 12 CU för varje sekund upp till 10 minuter, och sedan 1,5 CU för varje extra sekund. Följande tabell visar hur den fakturerade varaktigheten och CU-summan delas upp mellan dessa nivåer:
| Faktureringsnivå | Fakturerad varaktighet | Rate | CU-sekunder |
|---|---|---|---|
| Första 10 minuterna | 00:10:00 (600 sekunder) | 12 CU för varje sekund | 7 200 |
| Mer än 10 minuter | 00:36:29 (2 189,8 sekunder) | 1,5 CU för varje sekund | 3,284.7 |
| Total | 00:46:29 (2 789,8 sekunder) | 10,484.7 |
Denna tabell visar den uppmätta totalen med en decimalplats så att nivåerna summerar exakt; resten av artikeln avrundar det till 10 485 CU-sekunder.
Fördelningen visar hur mycket den första nivån dominerar kostnaden: de första 10 minuterna utgör bara cirka 22 % av körningen men står för ungefär 69 % av CU-sekunderna, eftersom var och en av dessa sekunder kostar åtta gånger mer än en sekund i den andra nivån. Allt efter 10 minuter – huvuddelen av en lång shaping run – faktureras till den betydligt lägre taxan på 1,5 CU. Modern Evaluator sänker räkningen ytterligare genom att förkorta själva faktureringstiden, inte genom att ändra priset. För den fullständiga prismodellen, se Dataflow Gen2 prissättning.
Viktiga lärdomar
- Utan Modern Evaluator var Dataflow Gen2 bara cirka 1,2 × snabbare än Dataflow Gen1:s baslinje på denna formningsarbetsbelastning. Att aktivera Modern Evaluator förbättrade prestandan till cirka 1,7× snabbare än Gen1, på identiskt M-skript och dataset.
- Kapacitetsbesparingen är större än tidsbesparingen: Dataflow Gen2 blev 1,7 × snabbare samtidigt som den förbrukade 82% mindre kapacitet än Dataflow Gen1 (10 485 mot 56 855 CU-sekunder).
- Denna prestandaökning kommer från en mer effektiv exekveringsväg för icke-vikbara och semi-vikbara frågor. Power Query lägger traditionellt mest tid på dessa frågor, särskilt när du använder kopplingar som ADLS Gen2 och SharePoint. Ökar skalan med radvolym och formningskomplexitet.
- Använd Modern Evaluator som standard för formtunga flöden där frågor inte helt viks tillbaka till källan. Ju större dataset och ju fler transformationer du gör i motorn, desto större effekt bör du förvänta dig.
Scenario 3: Optimerad kopia till Lakehouse
NYC Taxi-analysteamet förvandlar ett stort bord och skriver resultatet till ett sjöhus i Fabric. Att skriva volymen till destinationen är den långsammaste delen av uppdateringen, så teamet vill snabba upp skrivningen utan att ändra transformationslogiken.
Challenges
- Skriv snabbt ett stort transformerat resultat till ett lakehouse-mål.
- Se till att skrivningen till målet inte blir flaskhalsen i uppdateringen.
- Bevara no-code Power Query-upplevelsen och den befintliga transformationslogiken.
Dataset
En Fabric lakehouse-tabell med cirka 113 miljoner taxiresor i New York från 2017 till mitten av 2018.
Solution
Teamet aktiverar Aktivera mellanlagring och Optimerad kopiering till Lakehouse för en enskild fråga som skriver till ett Lakehouse-mål. Optimerad kopia till Lakehouse flyttar det mellanlagrade resultatet till Lakehouse via en accelererad väg.
Design
Benchmarkdataflödet använder en enda fråga med Enable staging aktiverat och en lakehouse-destination som använder V-Order. Sökningen läser den cirka 113 miljoner rader stora taxitabellen i New York från ett sjöhus i Fabric, sorterar raderna efter upphämtningsdatum och tid, och lägger till två härledda kolumner – början av upphämtningsmånaden och summan av MTA:s skatt och förbättringstillägg. Eftersom staging används skriver Optimerad kopiering till Lakehouse det transformerade resultatet till Lakehouse-målet via en accelererad sökväg, vilket ger den snabba körtiden.
Optimerad text till Lakehouse-överväganden
- Det kräver Aktivera mellanlagring för frågan och ett lakehouse som mål. Mer information finns i Alternativ för mellanlagrade data för Dataflöde Gen2.
- Det påskyndar skrivningen till lakehouse utan att ändra transformeringslogiken.
- Kombinera det med V-Order på destinationen för att optimera resultatet för downstream-analys.
Results
När du aktiverar Optimerad kopia till Lakehouse slutför Dataflow Gen2 denna uppdatering cirka 15× snabbare än Dataflow Gen1-baslinjen (00:03:34 vs. 00:53:20) utan att ändra transformationslogiken. Utan den är samma stegvisa dataflöde ungefär 3,6× snabbare än Gen1.
| Konfiguration | Körningstid (hh:mm:ss) | Jämförelse mot Gen1 | CU förbrukad |
|---|---|---|---|
| Baslinje för Dataflöde Gen1 | 00:53:20 | — | 50,788 |
| Dataflow Gen2 med mellanlagring + V-Order (ingen optimerad kopiering till Lakehouse) | 00:14:45 | 3,6× snabbare | Ej uppmätt |
| Dataflow Gen2 med mellanlagring + optimerad kopiering till Lakehouse + V-Order | 00:03:34 | 15× snabbare | 2,391 |
När du aktiverar staging, optimerad kopiering till Lakehouse och V-Order – den mest optimala Dataflow Gen2-konfigurationen för detta scenario – slutförs Scenario 3:s uppdatering av NYC:s taxitabell med 113 miljoner rader till en lakehouse-tabell på 00:03:34 och tar 2 391 CU-sekunder. Följande tabell bryter ner det totala antalet per operation:
| Operation | Motor (mätare) | CU-sekunder |
|---|---|---|
| Kör sökfrågor | Standardberäkning | 2,391 |
| Total | 2,391 |
Arbetet faktureras helt på Standard Compute (12 CU per sekund upp till 10 minuter, sedan 1,5 CU för varje extra sekund). Den optimerade kopian till lakehouse går via mashup-motorn, så det finns ingen separat mätare. För den fullständiga prismodellen, se Dataflow Gen2 prissättning.
Viktiga lärdomar
- Optimerad kopiering till Lakehouse påskyndar skrivandet av det transformerade resultatet till lakehouse-destinationen, vilket minskar uppdateringen från 00:14:45 (utan den) till 00:03:34 – ungefär 4× snabbare än samma dataflöde utan den, och ungefär 15× snabbare än Dataflow Gen1-baslinjen (00:53:20).
- Detta scenario gav den största kapacitetsbesparingen jämfört med Dataflow Gen1 i denna artikel: Dataflow Gen2 förbrukade 95% mindre kapacitet än Dataflow Gen1 (2 391 mot 50 788 CU-sekunder).
- Det kräver att Aktivera staging är aktiverat för frågan och ett lakehouse-mål, och det ändrar inte transformationslogiken.
- Det här scenariot använder uttryckligen V-Order på målutdata.
- Använd Optimized copy to Lakehouse varje gång du skriver staged data till en Lakehouse-destination och skrivtiden dominerar uppdateringen.
Scenario 4: Kombinera filer
Note
Partitioned Compute är för närvarande i förhandsvisning och endast tillgänglig i Dataflow Gen2 med CI/CD. Kapaciteten förbättras fortfarande, så dess beteende, stödda transformationer och prestanda kan förändras innan allmän tillgänglighet. Behandla resultaten i detta scenario som en ögonblicksbild av förhandsvisningen.
Teamet måste nu aggregera och utöka resedata över hundratals Parquet-filer (månatliga partitioner). Transformeringar omfattar procentsatser för beräkningstips i datamängden.
Challenges
- Du måste bearbeta hundratals stora filer.
- Transformeringar kräver gruppering, aggregering och berikning mellan partitioner.
- Sekventiell körning blir en flaskhals.
Dataset
56 Parquet-filer (2021–aug. 2025).
Solution
Teamet aktiverar Partitioned Compute (Preview), som parallelliserar bearbetning mellan partitioner och slår samman resultat effektivt.
Design
Denna fråga kombinerar 56 Parquet-filer och skapar en ny anpassad kolumn för dricksprocent, "Tip Pctg", på Transform Sample-filen innan datan laddas in i lagret.
Överväganden för partitionerad beräkning
- För närvarande i förhandsvisning och endast tillgänglig i Dataflow Gen2 med CI/CD; Kapaciteten förbättras fortfarande.
- Använd den när källan inte stöder vikning.
- Ger bästa prestanda vid inläsning av data till stagingmiljö eller databasinlagring.
- Använd Sample transform-filen från Combine-filer för att säkerställa konsekvent transformationslogik.
- Stöder en delmängd av transformeringar. prestanda varierar.
Results
Partitionerad beräkning levererar cirka 21 × snabbare prestanda än Dataflow Gen1-baslinjen (00:04:48 vs. 01:40:57) på stora, partitionerade, flerfilsdatamängder.
| Konfiguration | Körningstid (hh:mm:ss) | Jämförelse mot Gen1 | CU förbrukad |
|---|---|---|---|
| Baslinje för Dataflöde Gen1 | 01:40:57 | — | Ej uppmätt |
| Dataflöde Gen2 med partitionerad beräkning | 00:04:48 | 21× snabbare | Ej uppmätt |
Partitioned Compute riktar sig mot väggklockstid snarare än kostnad. Den kör partitioner parallellt så att uppdateringen blir klar tidigare, men den parallellismen sprider arbetet över mer beräkning istället för att minska det, så kostnaden är vanligtvis liknande eller högre än samma arbetsbelastning utan funktionen. CU-förbrukningen mättes inte för detta scenario, så den här artikeln rapporterar endast körtid.
Viktiga lärdomar
- Partitionerad beräkning levererade en hastighet på 21× över Dataflow Gen1-baslinjen och avslutades på under fem minuter. Eftersom funktionen är i förhandsvisning och fortfarande förbättras, kan man förvänta sig att dessa siffror kommer att utvecklas.
- Se partitionerad beräkning som ett sätt att bli klar snabbare, inte för att spendera mindre. Parallellism förkortar väggklocktiden genom att köra partitioner samtidigt, så kostnaden är vanligtvis liknande eller högre än samma arbetsbelastning utan den.
- Vinsten kommer från att bearbeta varje partition parallellt och slå samman resultaten. Det är särskilt effektivt på flera filer eller partitionerade källor, där veckling inte är ett alternativ och sekventiell utvärdering är flaskhalsen.
- Använd Sample-transform-filmönstret från Combine-filer så att transformationslogik tillämpas konsekvent per partition. Partitioned Compute stöder för närvarande en delmängd av transformationer, så kontrollera att dina formningssteg är kompatibla innan du förlitar dig på det, och kontrollera igen när förhandsvisningen utvecklas.
- För högvolymspartitionerad inmatning till staging area eller ett lager, gör Partitionerad Beräkning till standard och kombinera den med Modern Evaluator när möjligt. Eftersom det fortfarande är i förhandsvisning, validera det mot din egen arbetsbelastning innan du använder det för produktionsuppdateringar.
Kostnad över tid (då jämfört med nu)
Dataflow Gen2 har blivit mer kostnadseffektivt att köra över tid. Samma logik, på samma data, förbrukar färre CU:er idag än tidigare, utan att du behöver göra några ändringar i dina frågor.
I denna jämförelse betyder det samma arbetsbelastning under de priser och funktioner som var allmänt tillgängliga före 2026. Nu innebär samma arbetsbelastning som körs idag med de bästa allmänt tillgängliga inställningarna (som Modern Evaluator och Fast Copy). Båda kolonnerna använder den bästa allmänt tillgängliga konfigurationen för sin period. De nuvarande siffrorna mäts med kapacitetstelemetri. De dåvarande siffrorna är uppskattningar av vad samma arbetsbelastning skulle ha förbrukat vid den tiden, eftersom de tidigare serviceförhållandena inte kan återges idag.
| Scenario | Capability | Beräknad CU före 2026 (GA som bäst) | CU nu (bästa GA-versionen) | Uppskattad minskning |
|---|---|---|---|---|
| Scenario 1: Kopiera data | Snabbkopiering | 17,055 | 14,593 | 14% |
| Scenario 2: Tung datahantering | Modern utvärderare | 66,164 | 10,485 | 84% |
| Scenario 3: Optimerad kopiering till Lakehouse | Optimerad kopia till Lakehouse | 14,173 | 2,391 | 83% |
Till exempel skulle den tunga formningsarbetsbelastningen i scenario 2 ha förbrukat uppskattningsvis 66 164 CU-sekunder före 2026, och förbrukar nu 10 485 CU-sekunder. Denna förändring är en 84% reduktion med identisk logik och inga ändringar krävs. Två förbättringar samverkar för att skapa detta. För det första blev prissättningen för Standard Compute nivåindelad: i stället för en fast avgift på 16 CU för varje sekund av hela körningen debiteras endast de första 10 minuterna med 12 CU per sekund, och varje efterföljande sekund debiteras med bara 1,5 CU, så den långa svansen av en arbetsbelastning för formning kostar nu bara en bråkdel av vad den kostade tidigare. För det andra förkortar Modern Evaluator – som vanligtvis finns tillgänglig sedan april 2026 – själva faktureringstiden, så det finns färre sekunder att fakturera på båda nivåerna. En kortare körning som faktureras enligt en betydligt billigare long-tail-prisnivå förklarar varför CU-förbrukningen sjunker så kraftigt, och därför är det så viktigt att kombinera Modern Evaluator med den nuvarande nivåbaserade prissättningen för dataflöden med omfattande formning.
Fast Copy-intaget i scenario 1 skulle ha förbrukat uppskattningsvis 17 055 CU-sekunder före 2026, och förbrukar nu 14 593 CU-sekunder. Denna förändring innebär en minskning på 14 %, vilket beror på att Standard Compute-priset sänks från fasta 16 CU per sekund till 12 CU per sekund i upp till 10 minuter; den del som avser Fast Copy-dataflytt är oförändrad. Den optimerade kopian till Lakehouse-uppdatering i scenario 3 skulle ha förbrukat uppskattningsvis 14 173 CU-sekunder före 2026, och förbrukar nu 2 391 CU-sekunder. Denna förändring är en minskning med 83%. Varje jämförelse använder samma arbetsbelastning med de bästa allmänt tillgängliga inställningarna för sin period.
Note
Denna då-mot-nu-jämförelse exkluderar Partitioned Compute, eftersom CU-förbrukning inte mättes för det scenariot och funktionen fortfarande är i förhandsvisning.
Vanliga frågor och svar
Hur faktureras Dataflow Gen2?
Dataflow Gen2 fakturerar varje motor separat i Fabric Capacity Units (CUs). Standard Compute (mashup-motorn) fakturerar 12 CU per sekund upp till 10 minuter av varje fråga, sedan 1,5 CU för varje extra sekund. Fast Copy (datarörelse) fakturerar 1,5 CU för varje sekund av kopieringsaktivitet, mätt över alla kärnor som kopian körs på. Du debiteras endast för den beräkningskapacitet som varje fråga faktiskt använder, utan någon fast avgift per uppdatering och utan kostnad för inaktiv tid. För den kompletta hastighetsmodellen, se Dataflow Gen2-prissättning.
Är Dataflow Gen2 prissättning elastisk?
Yes. Dataflow Gen2 fakturerar endast för den beräkningskapacitet som varje fråga faktiskt använder, mätt i Fabric Capacity Units (CUs). Det finns ingen fast avgift per uppdatering, ingen avgift för inaktivitet och inga direkta avgifter under författartiden för inbyggd funktionalitet. I benchmarktesterna i den här artikeln förbrukade en fullständig uppdatering 14 593 CU-sekunder för en Fast Copy-inläsning och 10 485 CU-sekunder för en tung transformationsarbetsbelastning.
Hur kan jag uppskatta min Dataflow Gen2-kostnad innan jag kör hela arbetsbelastningen?
Kör en liten, representativ uppdatering och mät vad den förbrukar, istället för att bygga hela lösningen och sedan upptäcka kostnaden. För att uppskatta kostnaden på detta sätt:
- Bygg dataflödet mot ett prov eller en enda partition av din källkod istället för hela datamängden.
- Uppdatera den en gång, och läs sedan de CU-sekunder den förbrukade i Microsoft Fabric Capacity Metrics-appen.
- Kontrollera dataflödesuppdateringshistoriken för att se vilka motorer som kördes, eftersom Standard Compute och Fast Copy faktureras separat.
- Dividera de uppmätta CU-sekunderna med raderna eller GB du bearbetade för att få en hastighet per enhet, och multiplicera sedan med hela din datavolym.
Note
Dataflow Gen2 är optimerad för storskaliga arbetsbelastningar, så dess prestanda- och effektivitetsfördelar är mest tydliga på stora, verkliga datamängder. Ett litet eller syntetiskt urval kanske inte visar de fulla vinsterna, och en kostnad per enhet som extrapoleras från ett mycket litet urval kan överskatta kostnaden för en fullständig körning. Verifiera mot en representativ datavolym när du kan.
För hela metoden, se Beräkna uppskattade kostnader med Fabric Metrics-appen och dataflödesuppdateringshistorik.
Hur lång tid tar en Gen2-uppdatering av Dataflow?
Det beror på datavolymen och på vilka transformationer du använder. I prestandatesterna i den här artikeln varierade uppdateringskörningarna för Dataflow Gen2 från 00:03:34 för en optimerad kopia av en tabell med 113 miljoner rader till ett lakehouse, upp till 00:46:29 för ett tungt formningsarbete på en stor konsoliderad Parquet-fil. En bulkkopia av fem konsoliderade Parquet-filer avslutades på 00:09:08 med Fast Copy, och en kombination av 56 partitionerade filer blev klar på 00:04:48 med Partitioned Compute (Preview). För fullständiga tider per scenario, se sammanfattningen av jämförelseresultat.
Vilken Dataflow Gen2-funktion sänker kostnaden mest?
Det beror på arbetsbelastningen, eftersom varje funktion riktar sig mot olika flaskhalsar: Fast Copy för transformationsfri insamling, Modern Evaluator för icke-vikbar dataformning, Optimized copy till Lakehouse för att påskynda skrivningar till en lakehouse-destination, och Partitioned Compute (Preview) för stora multifildataset. Jämfört med Dataflow Gen1 som baslinje gav Optimized copy to Lakehouse den största besparingen i dessa prestandatester, med 95 % färre CU-sekunder. Jämfört med motsvarande Dataflow Gen2-körningar före 2026 gav Modern Evaluator den största uppskattade minskningen, med 84% färre CU-sekunder på en tung formningsbelastning. För att matcha en kapacitet med din arbetsbelastning, se snabbreferensen.
Hur kan jag få en Dataflow att uppdatera Gen2 snabbare?
Anpassa kapaciteten efter flaskhalsen: aktivera Fast Copy för källor för extraktinläsning som stöds, slå på Modern Evaluator för transformeringar som inte kan vikas, aktivera Optimized copy to Lakehouse när du skriver mellanlagrade data till ett lakehouse-mål och använd Partitioned Compute (Preview) för stora partitionerade datauppsättningar eller datauppsättningar med flera filer. Varje funktion jämförs i denna artikel med den specifika hastighetsökning den gav jämfört med Dataflow Gen1-baslinjen.
Behöver jag ändra mina förfrågningar för att få dessa förbättringar?
No. Varje benchmark i denna artikel körde samma M-skript över båda generationerna och varje konfiguration. Fast Copy, Modern Evaluator och Optimized copy to Lakehouse är inställningar du aktiverar, och de ändrar hur motorn kör dina frågor istället för frågorna i sig. En begränsning: Fast Copy gäller bara steg som uppfyller kraven, så en transformering som bryter query folding återgår till standardmotorn och då går vinsten förlorad. För dessa förutsättningar, se Fast copy i Dataflow Gen2.
Är Dataflow Gen2 snabbare och billigare än Dataflow Gen1?
För arbetsbelastningar med hög volym som de som benchmarkas i denna artikel, ja på båda punkterna. Dataflow Gen2 kördes mellan 1,7 × och 21 × snabbare än Dataflow Gen1-baslinjen på samma data och samma M-skript, och den förbrukade 82% till 95% färre kapacitetsenheter i de scenarier där båda generationerna mättes. Till exempel blev en bulkkopia som tog 01:38:59 i Dataflow Gen1 klar på 00:09:08 i Dataflow Gen2 med Fast Copy – ungefär 11× snabbare. Skillnaden är mindre för kortvariga dataflöden, eftersom en fråga som slutförs inom de första 10 minuterna aldrig når den billigare 1,5 CU-nivån, så vinsterna ökar med datavolym och körtid. För den fullständiga jämförelsen per scenario, se sammanfattningen av jämförelseresultat.
Hur mycket kapacitet förbrukar Dataflow Gen1 jämfört med Dataflow Gen2?
I de scenarier där båda generationerna mättes förbrukade Dataflow Gen1 flera gånger mer kapacitet än Dataflow Gen2 för samma högvolymsarbete. Fast Copy-intagningen tog 84 411 CU-sekunder på Dataflow Gen1 jämfört med 14 593 CU-sekunder på Dataflow Gen2, en minskning med 83%. Den tunga dataformningsarbetsbelastningen tog 56 855 CU-sekunder på Dataflow Gen1 jämfört med 10 485 CU-sekunder på Dataflow Gen2, en minskning på 82%. Den optimerade kopieringsarbetsbelastningen till Lakehouse förbrukade 50 788 CU-sekunder på Dataflow Gen1 jämfört med 2 391 CU-sekunder på Dataflow Gen2, en minskning på 95%. Alla tre dessa uppdateringar pågår i mer än 10 minuter, så större delen av deras Dataflow Gen2-körning debiteras enligt den lägre taxan på 1,5 CU. För siffror per scenario, se sammanfattningen av benchmarkresultat.
Bör jag flytta mina Dataflow Gen1 dataflows till Dataflow Gen2?
Yes. Dataflow Gen2 är den nuvarande generationen av dataflöden i Microsoft Fabric, så planera att flytta alla Dataflow Gen1-dataflöden till den. Bland benchmarks i denna artikel avslutade Dataflow Gen2 samma M-skript 1,7× till 21× snabbare samtidigt som det förbrukade 82% till 95% färre kapacitetsenheter än Dataflow Gen1 – samma logik, som går snabbare och använder mindre av din kapacitet. De kapabiliteter som ger dessa vinster – Fast Copy, Modern Evaluator, Optimized copy to Lakehouse och Partitioned Compute – finns endast tillgängliga i Dataflow Gen2, så gapet fortsätter att växa i takt med att dessa funktioner förbättras. Räkna med de största vinsterna vid högvolyms, långvariga uppdateringar. När du migrerar, testa en representativ arbetsbelastning för att bekräfta vinsterna på din egen data och kapacitet. För att komma igång, se Dataflow Gen2-översikt.
Har Dataflow Gen2 blivit mer kostnadseffektivt över tid?
Yes. Den tunga formningsbelastningen i scenario 2 skulle ha förbrukat uppskattningsvis 66 164 CU-sekunder före 2026 och förbrukar nu 10 485 CU-sekunder med nuvarande allmänt tillgängliga kapaciteter, en uppskattad minskning på 84% med identisk logik och inga ändringar krävs. För siffror per scenario, se Kostnad över tid (då vs. nu).
Är äldre Dataflow Gen2 kostnads- och prestandasiffror fortfarande korrekta?
Inte nödvändigtvis. Siffrorna i denna artikel speglar den nuvarande Dataflow Gen2-prismodellen – 12 CU för varje sekund upp till 10 minuter av Standard Compute, sedan 1,5 CU för varje extra sekund – tillsammans med nuvarande funktioner som Fast Copy och Modern Evaluator. Eftersom Dataflow Gen2 har blivit snabbare och mer kostnadseffektivt över tid kan jämförelsesiffror eller kostnadsuppskattningar publicerade före 2026 överskatta nuvarande kostnader eller underskatta nuvarande prestanda. Verifiera dina egna arbetsbelastningar mot Microsoft Fabric Capacity Metrics-appen.