Dataflow Gen2 kostnad og ytelse: kapabilitetsbenchmarks og CU-kostnader

Microsoft Fabric Dataflow Gen2 tilbyr flere måter å importere, transformere og laste data effektivt på. Disse metodene hjelper deg å balansere ytelse, skalerbarhet og kostnad.

Denne artikkelen er referansen for ytelse og kostnader for Dataflow Gen2. Den benchmarker fire vanlige arbeidsbelastninger – bulkkopiering, tung dataforming, optimaliserte skrivinger til et lakehouse, og kombinasjon av partisjonerte filer – og rapporterer kjøretid og kapasitetsenheter (CU) som hver enkelt brukte, målt fra kapasitetstelemetri. Bruk det til å estimere hva dine egne oppdateringer koster, og for å velge den funksjonaliteten som passer til hver arbeidsmengde.

I stor skala overgår Dataflow Gen2 Dataflow Gen1 betydelig både når det gjelder hastighet og kostnad – og jo større arbeidsmengde, desto større er gapet. Ved å kjøre det samme M-skriptet, mot samme data, på samme Fabric kapasitet, fullførte Dataflow Gen2 alle benchmarkene i denne artikkelen 1,7× til 21× raskere enn Dataflow Gen1-baseline. I alle scenarier der begge generasjoners kapasitetsforbruk ble målt, gjorde Dataflow Gen2 det raskere arbeidet mens den brukte 82% til 95% færre enheter – så hastighetsøkningen går ikke på bekostning av ekstra kapasitet. Du får begge gevinstene sammen, uten å skrive om en eneste forespørsel.

Hvor mye du får avhenger av arbeidsmengden din, og den største faktoren er hvor lenge forespørslene dine pågår. Standard Compute fakturerer de første 10 minuttene av hver spørring med 12 CU for hvert sekund, deretter bare 1,5 CU for hvert ekstra sekund, så jo lenger en spørring kjører, desto lavere blir gjennomsnittskostnaden per sekund. En kort dataflyt avsluttes innenfor det første nivået og når aldri den billigere prisen, så forskjellen mellom de to generasjonene er liten. Gevinstene øker med datavolum og kjøretid, og derfor bruker benchmarkene i denne artikkelen store, store datasett med høyt volum og langvarige oppdateringer.

Dataflow Gen2 blir også stadig billigere på sine egne premisser: nåværende priser og kapasiteter reduserer CU-forbruket med anslagsvis 14% til 84%, avhengig av arbeidsmengden, sammenlignet med hva samme arbeidsmengde ville ha brukt før 2026.

Notat

Gjennom hele denne artikkelen måles kostnad og kapasitet i Fabric Capacity Units (CUs). For hvordan Dataflow Gen2 bruker kreditter og hvordan det samsvarer med fakturering, se Dataflow Gen2-prising. Disse benchmarkene og CU-tallene gjenspeiler dagens Dataflow Gen2-prismodell og kapasiteter, inkludert lagdelt Standard Compute-prising, Fast Copy og Modern Evaluator. Fordi Dataflow Gen2-ytelse og kostnadseffektivitet har forbedret seg over tid, kan tall publisert før 2026 ikke reflektere dagens atferd.

Følgende funksjoner hjelper deg å optimalisere dataflytene dine:

  • Rask kopiering – Akselerer bulk-databevegelse før transformasjon.
  • Modern Evaluator – Gjør tung dataforming raskere på ikke-foldbare spørringer.
  • Staging-spørringer – Landdata i et mellomlag før transformasjoner brukes, noe som muliggjør ELT-mønstre.
  • Optimalisert kopiering til Lakehouse – Raskere skriving av trinnvise data til en lakehouse-destinasjon i ELT-arbeidsbelastninger.
  • Partitioned Compute (Forhåndsvisning) – Skalerer transformasjoner på tvers av store og partisjonerte datasett.

Denne artikkelen dekker vanlige brukstilfeller, virkelige eksempler og benchmarking-resultater for å hjelpe deg med å velge riktig kapasitet for din arbeidsmengde.

Dataflow Gen2 fakturerer hver motor separat, med disse nåværende hastighetene:

  • Standard beregning (mashup-motorspørringer) – 12 CU for hvert sekund opptil 10 minutter av hver spørring, deretter 1,5 CU for hvert ekstra sekund.
  • Fast Copy (databevegelse) - 1,5 CU for hvert sekund med kopiaktivitet, målt på tvers av alle brukte kjerner.

For den komplette ratemodellen, se Dataflow Gen2-prising.

Hurtigreferanse

Match arbeidsmengden din med riktig Dataflow Gen2-kapasitet. For et referanseeksempel på hver, se det tilknyttede scenariet.

Kapabilitet Bruk det når... Viktige fordeler Referanse
Rask kopi Du trenger en direkte, høygjennomstrømningskopi fra en støttet kilde uten transformasjoner. Raskere inntak med lavere datakraft. Scenario 1: Kopier data
Modern Evaluator Du former data fra ikke-foldbare eller delvis foldbare kontakter (filtre, utledninger, rensing). Raskere utførelse uten å endre logikk. Scenario 2: Tung dataforming
Optimalisert kopi til Lakehouse Du aktiverte staging på en spørring som skriver til en innsjødestinasjon. Maksimerer gjennomstrømningen når man skriver trinnvise data til innsjøhuset. Scenario 3: Optimalisert kopi til Lakehouse
Partitioned Compute (Preview) Du transformerer store, partisjonerte eller flerfil-datasett som kan kjøres parallelt. Kombiner med Modern Evaluator når det støttes. Parallellisert utførelse på tvers av partisjoner. Scenario 4: Kombiner filer

Notat

For bakgrunn om query evaluation og query folding, se Query folding basics.

Sammendrag av referanseresultater

De fleste scenarioene i denne artikkelen bruker New York City Taxi & Limousine Commission (TLC) Trip Data – TLC Trip Record Data-datasettet: milliarder av taxiturregistre lagret som Parquet-filer i ADLS Gen2, som dekker 2021–2025 (frem til august). Scenario 3 bruker en Fabric lakehouse-tabell med omtrent 113 millioner taxiturer i New York fra 2017 til midten av 2018. Destinasjonen er et Fabric innsjøhus eller lager, avhengig av situasjonen.

Følgende tabell oppsummerer benchmarkresultatene på tvers av alle scenarier. Hvert scenario inkluderer også en Dataflow Gen1-baseline for sammenligning.

Scenario Hva det gjør Kapasitet aktivert Gen2-utførelsestid Hastighetsøkning vs. Gen1 baseline Gen1 CU Gen2 CU CU-reduksjon på Gen2
Scenario 1: Kopier data Last inn fem konsoliderte Parquet-filer fra ADLS Gen2 i en hytte ved innsjøen uten transformasjoner. Rask kopi 00:09:08 11× raskere 84,411 14,593 83%
Scenario 2: Tung dataforming Bruk ikke-foldbare transformasjoner (filtre, utledninger, rensing) på en enkelt stor Parquet-fil lastet inn i et innsjøhus. Modern Evaluator 00:46:29 1,7× raskere 56,855 10,485 82%
Scenario 3: Optimalisert kopi til Lakehouse Forvandle et taxibord med 113 millioner rader i New York fra et Fabric lakehouse og skriv resultatet til et lakehouse-bord på en akselerert kopieringsbane. Denne benchmarken bruker Optimized copy til Lakehouse og V-Order. Optimalisert kopi til Lakehouse 00:03:34 15× raskere 50,788 2,391 95%
Scenario 4: Kombiner filer Kombiner og transformer 56 partisjonerte Parquet-filer parallelt og last inn i et lager. Partitioned Compute (Preview) 00:04:48 21× raskere Ikke målt Ikke målt Ikke målt

Sammenligningsdiagram som viser kjøretid og relativ hastighetsøkning for de fire benchmark-scenarioene i sammendragstabellen.

Følgende diagram sammenligner de samme scenariene etter kapasitetsforbruk i stedet for kjøringstid.

Sammenligningsdiagram som viser CU-sekundene brukt av Dataflow Gen1-baseline versus den beste Dataflow Gen2-konfigurasjonen for hvert benchmark-scenario.

For trinnvise detaljer, datasettkonfigurasjoner og designmønstre for hver kapasitet, se scenarioseksjonene som følger.

Notat

Alle scenarioer i denne artikkelen har Modern Evaluator aktivert og V-Order deaktivert med mindre annet er eksplisitt oppgitt. Gen1 CU og Gen2 CU-kolonnene rapporterer Capacity Unit-sekunder. CU-reduksjonen på Gen2-kolonnen er fallet i CU-sekunder fra Dataflow Gen1-baseline til den beste Dataflow Gen2-konfigurasjonen, beregnet som (Gen1 CU − Gen2 CU) ÷ Gen1 CU.

Hvordan vi målte disse referansepunktene

Hvert scenario kjører det samme M-skriptet to ganger: én gang på Dataflow Gen1 for å etablere en baseline, og én gang på Dataflow Gen2 med testfunksjonen aktivert.

Hver gjennomgang i denne artikkelen deler de samme testbetingelsene:

  • Alle scenarier og begge generasjoner kjørte på samme Fabric-kapasitet, så ingen resultater reflekterer ulik kapasitetsstørrelse eller SKU.
  • Ingen datagateway var involvert. Hver tilkobling gikk direkte fra Fabric-tjenesten til en skybasert datakilde.
  • Hvert scenario brukte samme kildedata og samme M-skript for både sine Dataflow Gen1- og Dataflow Gen2-kjøringer.

De rapporterte tallene betyr følgende:

  • Kjøretid er den totale oppdateringstiden som rapporteres for dataflow-kjøringen.
  • CU som brukes er Capacity Unit-sekundene som kjøringen fakturerte til kapasiteten, lest fra Microsoft Fabric Capacity Metrics-appen. Fordi Dataflow Gen2 fakturerer hver motor separat, er totalen i et scenario summen av alle motorene som kjørte under oppdateringen, og CU-tallene rundes til nærmeste hele CU-sekund. For den komplette ratemodellen, se Dataflow Gen2-prising.

Når du sammenligner de to generasjonene, husk disse arkitektoniske forskjellene:

  • Dataflow Gen1 bruker en fundamentalt annerledes arkitektur enn Dataflow Gen2, og den støtter ikke funksjoner som Fast Copy, Modern Evaluator, Optimized copy to Lakehouse eller Partitioned Compute.
  • Dataflow Gen1 kan kun laste data som CSV-filer, mens Dataflow Gen2 laster data som Parquet-filer i slike situasjoner.

Notat

Disse tallene ble registrert i vårt eget testmiljø i august 2026 og gjelder kun for disse spesifikke løpene. Dine egne resultater varierer med datavolum, kapasitetsstørrelse og konfigurasjon. For å måle dine egne arbeidsbelastninger, se Compute estimerte kostnader ved bruk av Fabric Metrics-appen og historikken for oppdatering av dataflyten.

Scenario 1: Kopier data

NYC Taxi-analyseteamet må laste inn millioner av rå Parquet-turopptegnelser fra ADLS Gen2 i et Fabric-hytte ved innsjøen. Teamet trenger ingen transformasjoner, bare en direkte kopi for å støtte nedstrøms analyse.

Utfordringer

  • Flytt store mengder Parquet-data raskt inn i innsjøhuset.
  • Reduser inntakstiden for daglige oppfriskninger.
  • Minimer beregningskostnader for enkle extract-load (EL) arbeidsbelastninger.

Dataset

År for år ble NYC Yellow Taxi Parquet-filer slått sammen, fem konsoliderte partisjoner (2021–august 2025).

Løsning

Teamet muliggjør Fast Copy i Dataflow Gen2. Fast Copy optimaliserer databevegelsesstier og paralleliserer skrivinger for støttede koblinger.

Design

Skjermbilde av dataflytdesign for Fast Copy som viser spørringsinnstillinger.

Denne forespørselen kombinerer de fem årvise Parquet-filene og laster resultatet inn i innsjøhuset.

Vurderinger ved Fast Copy

  • Støtter filformater.csv og .parquet .
  • Støtter opptil 1 millioner rader per tabell per gjennomspilling for Azure SQL Database.
  • Best egnet for extract-load (EL) arbeidsflyter før transformasjoner.

Resultater

Diagram som sammenligner Dataflow Gen1-baseline med den beste Dataflow Gen2-konfigurasjonen for scenario 1, og viser kjøretid og CU-forbruk som prosentandel av Gen1-baseline.

Når du aktiverer Fast Copy, tar Dataflow Gen2 inn dette datasettet omtrent 11× raskere enn Dataflow Gen1-baselinjen (00:09:08 vs. 01:38:59) samtidig som datakraften reduseres. Uten Fast Copy er Dataflow Gen2 allerede omtrent 2,8× raskere enn Gen1 på samme arbeidsbelastning.

Konfigurasjon Utførelsestid (hh:mm:ss) Sammenligning med Gen1 CU konsumert
Dataflow Gen1 baseline 01:38:59 84,411
Dataflow Gen2 uten Fast Copy 00:35:25 2,8 × raskere Ikke målt
Dataflow Gen2 med rask kopiering 00:09:08 11× raskere 14,593

Når du aktiverer Fast Copy – den mest optimale Dataflow Gen2-konfigurasjonen for dette scenariet – tar Scenario 1s Fast Copy-inntasting av fem konsoliderte Parquet-filer inn i et lakehouse 14 593 CU-sekunder. Tabellen nedenfor gir denne totalen etter operasjon:

Operation Motor (måler) CU sekunder
Dataflytting Rask kopi 8,280
Kjør spørringer Standard databehandling 6,313
Total 14,593

Fast Copy-dataflyt faktureres med en rate på 1,5 CU for hvert sekund med kopiaktivitet, målt som total tid over alle kjernene kopien kjører på. Dataflow Gen2 balanserer automatisk hvor mange kjerner hvert Fast Copy-scenario bruker, så en kopi som blir ferdig raskt i veggklokketid kan fortsatt strekke seg over mange kjernesekunder. All gjenværende spørringstid faktureres på Standard Compute (12 CU for hvert sekund opptil 10 minutter, deretter 1,5 CU for hvert ekstra sekund). For den fullstendige ratemodellen, se Dataflow Gen2-prising.

Viktige punkter

  • Aktivering av Fast Copy kollapset en 99-minutters innsamling til omtrent ni minutter, en forbedring på størrelsesorden sammenlignet med samme datasett og M-skript.
  • Dataflow Gen2 brukte også 83% mindre kapasitet enn Dataflow Gen1 for samme arbeid (14 593 mot 84 411 CU-sekunder), så hastighetsøkningen gikk ikke på bekostning av ekstra datakraft.
  • Hastighetsøkningen kommer fra native, parallellisert databevegelse som omgår mashup-motoren, så den gjelder kun for ut- og lastetrinn som oppfyller Fast Copy-kravene. Enhver transformasjon som bryter folding, faller tilbake til standardmotoren og mister gevinstene.
  • For støttede kilder, behandle Fast Copy som standard for inntak og reserver tyngre transformasjonsmotorer (dekket i neste scenario) for steg som faktisk omformer dataene.

Scenario 2: Tung dataforming

Etter inntak anvender teamet filtrering, null-erstatning og kodekartlegging før data lastes inn i lakehouse. Disse transformasjonene folder ikke helt tilbake til Parquet og er trege i hukommelsen.

Utfordringer

  • Forbedre transformasjonshastigheten for semifoldbare eller ikke-foldbare spørringer.
  • Oppretthold no-code Power Query-forfatting.
  • Reduser total oppdateringstid og kostnad.

Dataset

Alle Parquet-filer for 2021–august 2025 ble slått sammen til én samlet fil.

Løsning

Teamet muliggjør Modern Evaluator, en høyytelses kjøringsmotor designet for effektiv transformasjon, spesielt for koblinger som ADLS Gen2 og SharePoint.

Design

Skjermbilde av dataflytdesign for Modern Evaluator som viser spørringsinnstillinger.

Denne spørringen henter inn data fra en konsolidert Parquet-fil, filtrerer trip_distance og fare_amount kolonnene for å holde verdier over 0, erstatter nullpunkter med passenger_count 1, og oppretter en ny payment_method kolonne ved å mappe betalingstypene før dataene lastes inn i lakehouse.

Moderne vurderinger for evaluatorer

  • Forventede oppdateringstider kan være betydelig raskere (varierer etter datasett og transformasjoner).
  • Optimalisert for store volumer (millioner av rader).
  • Gunstig for ikke-foldbare spørringer.
  • Raskere skriver til destinasjoner som et hus ved innsjøen.

Resultater

Diagram som sammenligner Dataflow Gen1-baseline med den beste Dataflow Gen2-konfigurasjonen for scenario 2, og viser kjøretid og CU-forbruk som prosentandel av Gen1-baseline.

Når du aktiverer Modern Evaluator, kjører Dataflow Gen2 denne forming-arbeidsbelastningen omtrent 1,7 × raskere enn Dataflow Gen1-baselinjen (00:46:29 vs. 01:19:56) samtidig som den ikke-kode-Power Query-opplevelsen bevares. Uten Modern Evaluator er samme arbeidsmengde bare omtrent 1,2× raskere enn Gen1 (01:08:37 vs. 01:19:56).

Konfigurasjon Utførelsestid (hh:mm:ss) Sammenligning med Gen1 CU konsumert
Dataflow Gen1 baseline 01:19:56 56,855
Dataflow Gen2 uten Modern Evaluator 01:08:37 1,2× raskere Ikke målt
Dataflow Gen2 med Modern Evaluator 00:46:29 1,7× raskere 10,485

Når du aktiverer Modern Evaluator – den mest optimale Dataflow Gen2-konfigurasjonen for dette scenariet – bruker scenario 2s Modern Evaluator som former en enkelt stor Parquet-fil til et lakehouse 10 485 CU-sekunder. Tabellen nedenfor gir denne totalen etter operasjon:

Operation Motor (måler) CU sekunder
Kjør spørringer Standard databehandling 10,485
Total 10,485

Arbeidet kjører helt på Standard Compute, som faktureres på to nivåer: 12 CU for hvert sekund opptil 10 minutter, deretter 1,5 CU for hvert ekstra sekund. Tabellen nedenfor viser hvordan den fakturerte varigheten og totalen av CU-en ble fordelt på disse nivåene:

Faktureringsnivå Fakturert varighet Rente CU sekunder
De første 10 minuttene 00:10:00 (600 sekunder) 12 cus for hvert sekund 7,200
Utover 10 minutter 00:36:29 (2 189,8 sekunder) 1,5 CU for hvert sekund 3,284.7
Total 00:46:29 (2 789,8 sekunder) 10,484.7

Denne tabellen viser den målte totalen til én desimal, så nivåene summerer seg nøyaktig; resten av artikkelen runder det av til 10 485 CU-sekunder.

Fordelingen viser hvor mye første nivå dominerer plakaten: de første 10 minuttene utgjør bare omtrent 22% av løpet, men utgjør omtrent 69% av CU-sekundene, fordi hvert av disse sekundene koster åtte ganger mer enn et sekund i andre nivå. Alt som passerer 10-minuttersmerket – hoveddelen av en lang forming-periode – faktureres med en mye lavere rate på 1,5 CU. Modern Evaluator senker regningen ytterligere ved å forkorte faktureringsperioden, ikke ved å endre prisen. For den fullstendige ratemodellen, se Dataflow Gen2-prising.

Viktige punkter

  • Uten Modern Evaluator var Dataflow Gen2 bare omtrent 1,2 × raskere enn Dataflow Gen1-baseline på denne formingsarbeidsbelastningen. Aktivering av Modern Evaluator forbedret ytelsen til omtrent 1,7 × raskere enn Gen1, på identisk M-skript og datasett.
  • Kapasitetsbesparelsen er større enn tidsbesparelsen: Dataflow Gen2 fullførte 1,7 × raskere mens den brukte 82% mindre kapasitet enn Dataflow Gen1 (10 485 mot 56 855 CU-sekunder).
  • Denne ytelsesøkningen kommer fra en mer effektiv kjøringsvei for ikke-foldbare og semi-foldbare spørringer. Power Query bruker tradisjonelt mest tid på disse spørringene, spesielt når du bruker koblinger som ADLS Gen2 og SharePoint. Gevinster skalerer med radvolum og formingskompleksitet.
  • Bruk Modern Evaluator som standard for flyter med mye forming, der spørringer ikke folder helt tilbake til kilden. Jo større datasett og jo flere transformasjoner du bruker i engine, desto større effekt bør du forvente.

Scenario 3: Optimalisert kopi til Lakehouse

NYC Taxi-analyseteamet forvandler et stort bord og skriver resultatet til et Fabric innsjøhus. Å skrive det volumet til destinasjonen er den tregeste delen av oppdateringen, så teamet ønsker å øke hastigheten på skrivingen uten å endre transformasjonslogikken.

Utfordringer

  • Skriv et stort omgjort resultat til et sted for et innsjøhus raskt.
  • Hold destinasjonsskrivingen fra å bli flaskehalsen ved oppdatering.
  • Bevar no-code Power Query-opplevelsen og den eksisterende transformasjonslogikken.

Dataset

En Fabric lakehouse-tabell med omtrent 113 millioner taxiturer i New York fra 2017 til midten av 2018.

Løsning

Teamet aktiverer Aktiver staging og aktiverer Optimalisert kopi til Lakehouse på en enkelt spørring som skriver til en Lakehouse-destinasjon. Optimalisert kopi til Lakehouse flytter det trinnvise resultatet til Lakehouse på en akselerert vei.

Design

Benchmark-dataflyten bruker en enkelt spørring med Enable staging aktivert og en lakehouse-destinasjon som bruker V-Order. Spørringen leser det omtrent 113 millioner rader store NYC-taxibordet fra et Fabric lakehouse, sorterer radene etter hentedato og tidspunkt, og legger til to avledede kolonner – starten på hentemåneden og summen av MTA-skatten og forbedringstillegget. Fordi stagingen er på, skriver Optimized Copy til Lakehouse det transformerte resultatet til lakehouse-destinasjonen på en akselerert vei, noe som driver den raske kjøretiden.

Optimaliserte kopier til Lakehouse-vurderinger

  • Det krever aktivering av staging på spørringen og en lakehouse-destinasjon. For mer informasjon, se Staged data-alternativer for Dataflow Gen2.
  • Den akselererer skrivingen til innsjøhuset uten å endre transformasjonslogikken.
  • Kombiner det med V-Order på destinasjonen for å optimalisere resultatet for downstream-analyse.

Resultater

Diagram som sammenligner Dataflow Gen1-baseline med den beste Dataflow Gen2-konfigurasjonen for scenario 3, og viser kjøretid og CU-forbruk som prosentandel av Gen1-baseline.

Når du aktiverer Optimalisert kopi til Lakehouse, fullfører Dataflow Gen2 denne oppdateringen omtrent 15× raskere enn Dataflow Gen1-baselinjen (00:03:34 vs. 00:53:20) uten å endre transformasjonslogikken. Uten den er samme trinnvise dataflyt omtrent 3,6 × raskere enn Gen1.

Konfigurasjon Utførelsestid (hh:mm:ss) Sammenligning med Gen1 CU konsumert
Dataflow Gen1 baseline 00:53:20 50,788
Dataflow Gen2 med staging + V-Order (ingen optimalisert kopi til Lakehouse) 00:14:45 3,6 × raskere Ikke målt
Dataflow Gen2 med staging + optimalisert kopi til Lakehouse + V-Order 00:03:34 15× raskere 2,391

Når du aktiverer staging, optimalisert kopi til Lakehouse, og V-Order – den mest optimale Dataflow Gen2-konfigurasjonen for dette scenariet – oppdaterer Scenario 3 den 113 millioner rader store NYC-taxitabellen til en lakehouse-tabell på 00:03:34 og bruker 2 391 CU-sekunder. Tabellen nedenfor gir denne totalen etter operasjon:

Operation Motor (måler) CU sekunder
Kjør spørringer Standard databehandling 2,391
Total 2,391

Arbeidet faktureres helt på Standard Compute (12 CU for hvert sekund opptil 10 minutter, deretter 1,5 CU for hvert ekstra sekund). Den optimaliserte kopien til lakehouse går gjennom mashup-motoren, så det finnes ingen egen måler. For den fullstendige ratemodellen, se Dataflow Gen2-prising.

Viktige punkter

  • Optimalisert kopi til Lakehouse akselererer skrivingen av det transformerte resultatet til lakehouse-destinasjonen, og reduserer oppdateringen fra 00:14:45 (uten den) til 00:03:34 – omtrent 4× raskere enn samme dataflyt uten, og omtrent 15× raskere enn Dataflow Gen1-baseline (00:53:20).
  • Dette scenariet ga den største kapasitetsbesparelsen sammenlignet med Dataflow Gen1 i denne artikkelen: Dataflow Gen2 brukte 95% mindre kapasitet enn Dataflow Gen1 (2 391 mot 50 788 CU-sekunder).
  • Det krever Enable staging på spørringen og en lakehouse-destinasjon, og det endrer ikke transformasjonslogikken din.
  • Dette scenariet bruker eksplisitt V-Order på destinasjonsutgangen.
  • Bruk optimalisert kopi til Lakehouse hver gang du skriver trinnvise data til en Lakehouse-destinasjon, og skrivetiden dominerer oppdateringen.

Scenario 4: Kombiner filer

Notat

Partitioned Compute er for øyeblikket i forhåndsvisning og kun tilgjengelig i Dataflow Gen2 med CI/CD. Kapasiteten får fortsatt forbedringer, så oppførselen, støttede transformasjoner og ytelse kan endres før generell tilgjengelighet. Behandle resultatene i dette scenariet som et øyeblikksbilde av forhåndsvisningen.

Teamet må nå aggregere og berike reisedata på tvers av hundrevis av Parquet-filer (månedlige partisjoner). Transformasjoner inkluderer beregning av tipsprosenter på tvers av datasettet.

Utfordringer

  • Du må behandle hundrevis av store filer.
  • Transformasjoner krever gruppering, aggregering og berikelse på tvers av partisjoner.
  • Sekvensiell utførelse blir en flaskehals.

Dataset

Femtiseks Parquet-filer (2021–aug 2025).

Løsning

Teamet aktiverer Partitioned Compute (Preview), som paralleliserer prosessering på tvers av partisjoner og slår sammen resultater effektivt.

Design

Skjermbilde av dataflytdesign for Partitioned Compute som viser spørringsinnstillinger.

Denne spørringen kombinerer 56 Parquet-filer og oppretter en ny egendefinert kolonne for tipsprosent "Tip Pctg" på Transform Sample-filen før dataene lastes inn i lageret.

Vurderinger ved partisjonert beregning

  • For øyeblikket i forhåndsvisning og kun tilgjengelig i Dataflow Gen2 med CI/CD; Kapasiteten får fortsatt forbedringer.
  • Bruk den når kilden ikke støtter folding.
  • Gir best ytelse når data lastes inn til staging eller lageret.
  • Bruk Sample transform-filen fra Combine-filer for å sikre konsistent transformasjonslogikk.
  • Støtter en delmengde av transformasjoner; Ytelsen varierer.

Resultater

Diagram som sammenligner Dataflow Gen1-baseline med den beste Dataflow Gen2-konfigurasjonen for scenario 4, og viser kjøretid som en prosentandel av Gen1-baseline.

Partitioned Compute leverer omtrent 21× raskere ytelse enn Dataflow Gen1-baselinen (00:04:48 vs. 01:40:57) på store, partisjonerte, flerfil-datasett.

Konfigurasjon Utførelsestid (hh:mm:ss) Sammenligning med Gen1 CU konsumert
Dataflow Gen1 baseline 01:40:57 Ikke målt
Dataflow Gen2 med partisjonert beregning 00:04:48 21× raskere Ikke målt

Partitioned Compute retter seg mot veggklokketid i stedet for kostnad. Den kjører partisjoner parallelt slik at oppdateringen blir ferdig raskere, men denne parallellismen fordeler arbeidet over mer beregning i stedet for å redusere det, så kostnaden er vanligvis lik eller høyere enn samme arbeidsmengde uten funksjonen. CU-forbruket ble ikke målt for dette scenariet, så denne artikkelen rapporterer kun kjøretid.

Viktige punkter

  • Partitioned Compute leverte en hastighetsøkning på 21 × sammenlignet med Dataflow Gen1-baseline og ble ferdigstilt på under fem minutter. Siden funksjonaliteten er i forhåndsvisning og fortsatt får forbedringer, kan du forvente at disse tallene vil utvikle seg.
  • Se på Partitioned Compute som en måte å bli ferdig på tidligere, ikke for å bruke mindre. Parallellisme forkorter veggklokketiden ved å kjøre partisjoner samtidig, så kostnaden er vanligvis lik eller høyere enn samme arbeidsmengde uten den.
  • Gevinsten kommer fra å behandle hver partisjon parallelt og slå sammen resultatene, så det er mest effektivt på flerfil- eller partisjonerte kilder hvor folding ikke er tilgjengelig og sekvensiell evaluering er flaskehalsen.
  • Bruk Sample-transformasjonsfilmønsteret fra Combine-filer slik at transformasjonslogikken anvendes konsekvent per partisjon. Partitioned Compute støtter for øyeblikket et delsett av transformasjoner, så sjekk at formingsstegene dine er kompatible før du stoler på det, og sjekk på nytt etter hvert som forhåndsvisningen utvikler seg.
  • For høyvolum, partisjonert inntasting til staging eller lager, gjør Partitioned Compute til standard og kombiner det med Modern Evaluator når det er mulig. Siden det fortsatt er i forhåndsvisning, valider det mot din egen arbeidsmengde før du tar det i bruk for produksjonsoppdateringer.

Kostnad over tid (da vs. nå)

Dataflow Gen2 har blitt mer kostnadseffektiv å kjøre over tid. Den samme logikken, på samme data, bruker færre kredittpoeng i dag enn tidligere, uten behov for endringer i spørringene dine.

I denne sammenligningen betyr det samme arbeidsmengde under prisene og mulighetene som generelt var tilgjengelige før 2026. betyr det samme arbeidsmengden kjørt i dag med de beste generelt tilgjengelige innstillingene (som Modern Evaluator og Fast Copy). Begge kolonnene bruker den beste generelt tilgjengelige konfigurasjonen for sin periode. De nåværende tallene måles fra kapasitetstelemetri. De daværende tallene er estimater av hva den samme arbeidsmengden ville ha brukt på det tidspunktet, fordi de tidligere tjenesteforholdene ikke kan gjenskapes i dag.

Scenario Kapabilitet Anslått CU før 2026 (beste GA) CU nå (beste GA) Estimert reduksjon
Scenario 1: Kopier data Rask kopi 17,055 14,593 14%
Scenario 2: Tung dataforming Modern Evaluator 66,164 10,485 84%
Scenario 3: Optimalisert kopi til Lakehouse Optimalisert kopi til Lakehouse 14,173 2,391 83%

Sammenligningsdiagram som viser estimerte CU-sekunder før 2026 versus de målte CU-sekundene nå for hvert scenario i da-mot-nå-tabellen.

For eksempel ville den tunge formingsbelastningen i scenario 2 ha brukt anslagsvis 66 164 CU-sekunder før 2026, og bruker nå 10 485 CU-sekunder. Denne endringen er en reduksjon på 84% med identisk logikk og ingen nødvendige endringer. To forbedringer kombineres for å skape det. Først ble Standard Compute-prisene lagdelt: i stedet for en fast 16 CU for hvert sekund av hele perioden, fakturerer bare de første 10 minuttene med 12 CU for hvert sekund og hvert sekund etter fakturaer med bare 1,5 CU, så den lange halen av en formingsarbeidsmengde nå koster en brøkdel av det den gjorde. For det andre forkorter Modern Evaluator – som generelt har vært tilgjengelig siden april 2026 – selve faktureringstiden, slik at det er færre sekunder å fakturere på begge nivåer. En kortere løpetid fakturert mot en langt billigere langhale-rate er grunnen til at CU-forbruket faller så kraftig, og det er grunnen til at det å kombinere Modern Evaluator med dagens lagdelte prising er så viktig for dataflyter med mye forming.

Fast Copy-inntaket i scenario 1 ville ha brukt anslagsvis 17 055 CU-sekunder før 2026, og bruker nå 14 593 CU-sekunder. Denne endringen er en reduksjon på 14%, drevet av at Standard Compute rate faller fra en flat 16 CU per sekund til 12 CU per sekund opptil 10 minutter; Fast Copy-delen for databevegelse er uendret. Den optimaliserte kopien til Lakehouse-oppdatering i scenario 3 ville ha brukt anslagsvis 14 173 CU-sekunder før 2026, og bruker nå 2 391 CU-sekunder. Denne endringen er en reduksjon på 83%. Hver sammenligning bruker samme arbeidsmengde med de beste generelt tilgjengelige innstillingene for sin periode.

Notat

Denne da-mot-nå-sammenligningen utelater Partitioned Compute, fordi CU-forbruket ikke ble målt for det scenariet og funksjonaliteten fortsatt er i forhåndsvisning.

Vanlige spørsmål

Hvordan faktureres Dataflow Gen2?

Dataflow Gen2 fakturerer hver motor separat i Fabric Capacity Units (CUs). Standard Compute (mashup-motoren) fakturerer 12 CU for hvert sekund opptil 10 minutter av hver spørring, deretter 1,5 CU for hvert ekstra sekund. Fast Copy (dataflyt) fakturerer 1,5 CU for hvert sekund med kopiaktivitet, målt på tvers av alle kjernene kopien kjører på. Du blir kun fakturert for beregningen hver spørring faktisk bruker, uten fast gebyr per oppdatering og uten kostnad for inaktiv tid. For den komplette ratemodellen, se Dataflow Gen2-prising.

Er Dataflow Gen2-prising elastisk?

Ja. Dataflow Gen2 fakturerer kun for den beregningen hver spørring faktisk bruker, målt i Fabric Capacity Units (CUs). Det er ingen fast avgift per oppdatering, ingen kostnad for inaktiv tid, og ingen direkte kostnader under opprettelsestid for native funksjonalitet. I benchmarkene i denne artikkelen tok en full oppdatering 14 593 CU-sekunder for en Fast Copy-inntak og 10 485 CU-sekunder for en tung formingsbelastning.

Hvordan kan jeg estimere kostnaden for Dataflow Gen2 før jeg kjører hele arbeidsmengden?

Kjør en liten, representativ oppdatering og mål hva den forbruker, i stedet for å bygge hele løsningen og oppdage kostnaden etterpå. For å estimere kostnaden på denne måten:

  • Bygg dataflyten mot et utvalg eller en enkelt partisjon av kilden din i stedet for hele datasettet.
  • Oppdater den én gang, og les deretter CU-sekundene den brukte i Microsoft Fabric Capacity Metrics-appen.
  • Sjekk oppdateringshistorikken for dataflyten for å se hvilke motorer som kjørte, fordi Standard Compute og Fast Copy faktureres separat.
  • Del de målte CU-sekundene på radene eller GB du behandlet for å få en hastighet per enhet, og multipliser deretter med hele datavolumet ditt.

Notat

Dataflow Gen2 er optimalisert for arbeidsbelastninger i stor skala, så ytelses- og effektivitetsfordelene er mest tydelige på store, virkelige datasett. En liten eller syntetisk prøve viser kanskje ikke full gevinst, og en enhetsrate ekstrapolert fra et lite utvalg kan overvurdere kostnaden for en full runde. Valider mot et representativt datavolum når du kan.

For hele metoden, se Compute estimerte kostnader ved bruk av Fabric Metrics-appen og historikk for oppdatering av dataflow.

Hvor lang tid tar en oppdatering av Dataflow Gen2?

Det avhenger av datamengden og transformasjonene du anvender. I benchmarkene i denne artikkelen varierte Dataflow Gen2-oppdateringer fra 00:03:34 for en optimalisert kopi av en tabell med 113 millioner rader inn i et lakehouse, opp til 00:46:29 for en tung formingsbelastning over en stor konsolidert Parquet-fil. En bulkkopi av fem konsoliderte Parquet-filer ble ferdigstilt på 00:09:08 med Fast Copy, og en kombinasjon av 56 partisjonerte filer ble fullført på 00:04:48 med Partitioned Compute (Preview). For fullstendige tider per scenario, se sammendraget av referanseresultatene.

Hvilken Dataflow Gen2-funksjon senker kostnadene mest?

Det avhenger av arbeidsmengden, fordi hver kapasitet retter seg mot en forskjellig flaskehals: Fast Copy for transformasjonsfri inntakelse, Modern Evaluator for ikke-foldbar dataforming, Optimized copy til Lakehouse for å akselerere skriving til en lakehouse-destinasjon, og Partitioned Compute (Preview) for store datasett med flere filer. Målt mot Dataflow Gen1-baseline, ga Optimized copy to Lakehouse den største besparelsen i disse benchmarkene, med 95% færre CU-sekunder. Sammenlignet med tilsvarende Dataflow Gen2-kjøringer før 2026, ga Modern Evaluator den største estimerte reduksjonen, med 84% færre CU-sekunder på en tung formingsbelastning. For å matche en kapasitet med arbeidsmengden din, se hurtigreferansen.

Hvordan kan jeg gjøre en Dataflow Gen2-oppdatering raskere?

Match funksjonaliteten til flaskehalsen: aktiver Fast Copy for støttede extract-load-kilder, slå på Modern Evaluator for ikke-foldbare transformasjoner, aktiver Optimized copy til Lakehouse når du skriver staged data til en lakehouse-destinasjon, og bruk Partitioned Compute (Preview) for store partisjonerte eller flerfildatasett. Hver kapasitet blir i denne artikkelen benchmarket med den spesifikke hastighetsøkningen den ga sammenlignet med Dataflow Gen1-baseline.

Må jeg endre spørringene mine for å få disse forbedringene?

Nei. Hver benchmark i denne artikkelen kjørte det samme M-skriptet på tvers av begge generasjoner og i alle konfigurasjoner. Fast Copy, Modern Evaluator og Optimized copy to Lakehouse er innstillinger du slår på, og de endrer hvordan motoren kjører spørringene dine i stedet for selve spørringene. En forbehold: Fast Copy gjelder kun for steg som oppfyller forutsetningene, så en transformasjon som bryter query folding faller tilbake til standardmotoren og mister gevinsten. For disse forutsetningene, se Fast copy i Dataflow Gen2.

Er Dataflow Gen2 raskere og billigere enn Dataflow Gen1?

For arbeidsmengder med høyt volum som de som er beskrevet i denne artikkelen, ja på begge punkter. Dataflow Gen2 kjørte mellom 1,7 × og 21 × raskere enn Dataflow Gen1-baselinjen på samme data og samme M-skript, og den brukte 82% til 95% færre kapasitetsenheter i scenarioene der begge generasjonene ble målt. For eksempel ble en bulkkopi som tok 01:38:59 i Dataflow Gen1 ferdig på 00:09:08 i Dataflow Gen2 med Fast Copy – omtrent 11× raskere. Forskjellen er mindre for kortvarige dataflyter, fordi en spørring som fullføres innen de første 10 minuttene aldri når det billigere 1,5 CU-nivået, så gevinstene øker med datavolum og kjøretid. For full sammenligning per scenario, se sammendraget av referanseresultatene.

Hvor mye kapasitet bruker Dataflow Gen1 sammenlignet med Dataflow Gen2?

I scenarioene der begge generasjonene ble målt, brukte Dataflow Gen1 flere ganger mer kapasitet enn Dataflow Gen2 for samme store arbeidsmengder. Fast Copy-inntaket brukte 84 411 CU-sekunder på Dataflow Gen1 mot 14 593 CU-sekunder på Dataflow Gen2, en reduksjon på 83%. Den tunge dataformingsarbeidsmengden brukte 56 855 CU-sekunder på Dataflow Gen1 mot 10 485 CU-sekunder på Dataflow Gen2, en reduksjon på 82%. Den optimaliserte kopien til Lakehouse-arbeidsbelastningen brukte 50 788 CU-sekunder på Dataflow Gen1 mot 2 391 CU-sekunder på Dataflow Gen2, en reduksjon på 95%. Alle disse tre oppdateringene varer godt over 10 minutter, så mesteparten av deres Dataflow Gen2-varighet fakturerer med lavere 1,5 CU-hastighet. For tallene per scenario, se sammendraget av referanseresultatene.

Bør jeg flytte Dataflow Gen1 dataflows til Dataflow Gen2?

Ja. Dataflow Gen2 er den nåværende generasjonen av dataflows i Microsoft Fabric, så planlegg å flytte Dataflow Gen1 dataflows dit. På tvers av benchmarkene i denne artikkelen fullførte Dataflow Gen2 det samme M-skriptet 1,7× til 21× raskere samtidig som det brukte 82% til 95% færre kapasitetsenheter enn Dataflow Gen1 – samme logikk, som kjører raskere og bruker mindre av kapasiteten din. Kapasitetene som gir disse gevinstene – Fast Copy, Modern Evaluator, Optimized copy to Lakehouse og Partitioned Compute – er kun tilgjengelige i Dataflow Gen2, så gapet øker etter hvert som disse kapabilitetene forbedres. Forvent størst gevinst ved høyvolum, langvarige oppdateringer. Når du migrerer, test en representativ arbeidsbelastning for å bekrefte gevinstene på dine egne data og kapasitet. For å komme i gang, se Dataflow Gen2-oversikt.

Har Dataflow Gen2 blitt mer kostnadseffektiv over tid?

Ja. Den tunge formingsbelastningen i scenario 2 ville ha brukt anslagsvis 66 164 CU-sekunder før 2026, og bruker nå 10 485 CU-sekunder med nåværende generelt tilgjengelige kapasiteter, en reduksjon på anslått 84% med identisk logikk og uten nødvendige endringer. For tallene per scenario, se Kostnad over tid (da vs. nå).

Er eldre Dataflow Gen2 kostnads- og ytelsestall fortsatt nøyaktige?

Ikke nødvendigvis. Tallene i denne artikkelen gjenspeiler dagens Dataflow Gen2-prismodell – 12 CU for hvert sekund opptil 10 minutter med Standard Compute, deretter 1,5 CU for hvert ekstra sekund – sammen med nåværende funksjoner som Fast Copy og Modern Evaluator. Fordi Dataflow Gen2 har blitt raskere og mer kostnadseffektivt over tid, kan referansetall eller kostnadsestimater publisert før 2026 overvurdere nåværende kostnader eller undervurdere nåværende ytelse. Valider dine egne arbeidsbelastninger mot Microsoft Fabric Capacity Metrics-appen.