Muistiinpano
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää kirjautua sisään tai vaihtaa hakemistoa.
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää vaihtaa hakemistoa.
Microsoft Fabric Dataflow Gen2 tarjoaa useita tapoja vastaanottaa, muuntaa ja ladata dataa tehokkaasti. Nämä menetelmät auttavat tasapainottamaan suorituskyvyn, skaalautuvuuden ja kustannukset.
Tämä artikkeli on suorituskyky- ja kustannusviite Dataflow Gen2:lle. Se mittaa neljää yleistä työkuormaa – massakopiointi, raskas datan muotoilu, optimoitu kirjoitus järventaloon ja osioitujen tiedostojen yhdistäminen – ja raportoi suoritusajan sekä kapasiteettiyksiköt (CU), jotka kukin kulutti, mitattuna kapasiteettitelemetriasta. Käytä sitä arvioidaksesi, mitä omat päivityksesi maksavat, ja valita jokaiseen työkuormaan sopiva ominaisuus.
Laajassa mittakaavassa Dataflow Gen2 päihittää selvästi Dataflow Gen1:n sekä nopeudessa että kustannuksissa – ja mitä suurempi työkuorma, sitä suurempi ero on. Ajamalla samaa M-skriptiä, samoja tietoja vastaan, samalla Fabric-kapasiteetilla, Dataflow Gen2 suoritti kaikki tämän artikkelin benchmarkit 1.7×–21× nopeammin kuin Dataflow Gen1:n perusarvo. Jokaisessa skenaariossa, jossa molempien sukupolvien kapasiteetin kulutusta mitattiin, Dataflow Gen2 teki nopeamman työn kuluttaen 82%–95% vähemmän kapasiteettiyksikköä – joten nopeutuminen ei tule lisäkapasiteetin kustannuksella. Saat molemmat hyödyt yhdessä, ilman että yhtäkään kyselyä tarvitsee kirjoittaa uudelleen.
Kuinka paljon saat lisää, riippuu työmäärästäsi, ja suurin tekijä on se, kuinka kauan kyselysi kestää. Standard Compute laskuttaa jokaisen kyselyn ensimmäiset 10 minuuttia 12 CU per sekunti, sitten vain 1,5 CU jokaista lisäsekuntia kohden, joten mitä pidempään kysely kestää, sitä pienemmäksi sen keskimääräinen kustannus sekunnissa on. Lyhyt datavirta päättyy ensimmäisen tason sisälle eikä koskaan saavuta halvempaa hintaa, joten ero näiden kahden sukupolven välillä on pieni. Kasvu kasvaa datan määrän ja suoritusajan myötä, minkä vuoksi tämän artikkelin benchmarkit käyttävät suuria, suurivolyymeja aineistoja ja pitkäaikaisia päivityksiä.
Dataflow Gen2 myös halpenee omilla ehdoillaan: nykyiset hinnoittelut ja ominaisuudet vähentävät CU:n kulutusta arviolta 14% 84%:iin työkuormasta riippuen verrattuna siihen, mitä sama työkuorma olisi kuluttanut ennen vuotta 2026.
Huomautus
Tässä artikkelissa kustannukset ja kapasiteetti mitataan Fabric Capacity Units (CU) -yksiköissä. Tietoa siitä, miten Dataflow Gen2 kuluttaa CU:ita ja miten se liittyy laskutukseen, katso Dataflow Gen2 -hinnoittelu. Nämä vertailuarvot ja CU-luvut heijastavat nykyistä Dataflow Gen2 -hinnoittelumallia ja ominaisuuksia, mukaan lukien porrastettu Standard Compute -hinnoittelu, Fast Copy ja Modern Evaluator. Koska Dataflow Gen2:n suorituskyky ja kustannustehokkuus ovat parantuneet ajan myötä, ennen vuotta 2026 julkaistut luvut eivät välttämättä heijasta nykyistä käyttäytymistä.
Seuraavat ominaisuudet auttavat optimoimaan datavirtojasi:
- Nopea kopio – Nopeuta massadatan siirtoa ennen muuntamista.
- Modern Evaluator – Nopeuta raskasta datan muotoilua ei-taittuvilla kyselyillä.
- Staging-kyselyt – Aseta data välikerrokseen ennen muunnosten tekemistä, jolloin ELT-mallit voidaan toteuttaa.
- Optimoitu kopio Lakehouseen – Nopeuta vaiheittaisen datan kirjoittamista lakehouse-kohteeseen ELT-työkuormissa.
- Osioitu laskenta (esikatselu) – Skaalaa muunnokset suurten ja osioitujen aineistojen välillä.
Tässä artikkelissa käsitellään yleisiä käyttötapauksia, todellisia esimerkkejä ja vertailutuloksia, jotka auttavat sinua valitsemaan oikean kyvykkyyden työkuormallesi.
Dataflow Gen2 laskuttaa jokaisen moottorin erikseen näillä nykyisillä hinnoilla:
- Standard Compute (mashup-moottorikyselyt) – 12 CU per sekunti ja enintään 10 minuuttia kutakin kyselyä, sitten 1,5 CU jokaista lisäsekuntia kohden.
- Nopea kopiointi (datan siirto) – 1,5 CU jokaista sekuntia kohden, mitattuna kaikilla käytetyillä ytimillä mitattuna.
Täydellisen hintamallin löydät katso Dataflow Gen2 -hinnoittelu.
Pikaopas
Sovita työkuormasi oikeaan Dataflow Gen2 -ominaisuuteen. Vertailuesimerkki kustakin löytyy linkitetystä skenaariosta.
| Ominaisuus | Käytä sitä kun... | Keskeinen hyöty | Vertailuarvo |
|---|---|---|---|
| Nopea kopio | Tarvitset suoran, korkean läpimenon kopion tuetusta lähteestä ilman muunnoksia. | Nopeampi vastaanotto alhaisemmalla laskentakustannuksella. | Skenaario 1: Kopioi data |
| Nykyaikainen arvioija | Muokkaat dataa ei-taittuvista tai osittain taittuvista liittimistä (suodattimet, johdannaiset, puhdistus). | Nopeampi toteutus ilman logiikan muuttamista. | Skenaario 2: Raskas datan muokkaus |
| Optimoitu kopio Lakehouselle | Otit käyttöön vaiheittauksen kyselyssä, joka kirjoittaa järvimajan kohteeseen. | Maksimoi läpimenon, kun kirjoitetaan vaiheistettua dataa järvenrakennukseen. | Skenaario 3: Optimoitu kopio Lakehouseen |
| Partitioned Compute (Preview) | Muunnat suuria, osioituja tai monitiedostoisia aineistoja, jotka voivat toimia rinnakkain. Yhdistä Modern Evaluatoriin, kun se on tuettu. | Rinnakkaissuoritus osioiden välillä. | Skenaario 4: Yhdistä tiedostot |
Huomautus
Taustaa kyselyiden arvioinnista ja taittelusta löytyy kohdasta Kyselyn taittoperusteet.
Vertailutulosten yhteenveto
Useimmat tämän artikkelin skenaariot käyttävät New York City Taxi & Limousine Commission (TLC) Trip Data – TLC Trip Record Data -aineistoa: miljardeja taksimatkatietueita tallennettuna Parquet-tiedostoina ADLS Gen2:een, kattaen vuodet 2021–2025 (elokuuhun asti). Skenaario 3 käyttää Fabric-järvimajan taulukkoa, jossa on noin 113 miljoonaa NYC:n taksimatkarekisteriä vuosilta 2017 puoliväliin 2018. Määränpää on Fabric-järvitalo tai varasto, tilanteesta riippuen.
Seuraava taulukko tiivistää vertailutulokset kaikissa skenaarioissa. Jokaisessa skenaariossa on myös Dataflow Gen1 -vertailukohta.
| Skenaario | Toiminnot | Ominaisuus päällä | Gen2:n suoritusaika | Nopeus verrattuna Gen1:n lähtötasoon | Gen1 CU | Gen2 CU | CU-vähennys Gen2:ssa |
|---|---|---|---|---|---|---|---|
| Skenaario 1: Kopioi data | Lataa viisi yhdistettyä Parquet-tiedostoa ADLS Gen2:sta irtotavaraan ilman muunnoksia. | Nopea kopio | 00:09:08 | 11× nopeammin | 84,411 | 14,593 | 83% |
| Skenaario 2: Raskas datan muokkaus | Sovella ei-taittuvia muunnoksia (suodattimia, johdannaisia, puhdistusta) yhteen suureen Parquet-tiedostoon, joka on ladattu järventaloon. | Nykyaikainen arvioija | 00:46:29 | 1,7× nopeammin | 56,855 | 10,485 | 82% |
| Skenaario 3: Optimoitu kopio Lakehouseen | Muunna 113 miljoonan rivin NYC:n taksipöytä Fabric-järvenmökistä ja kirjoita tulos järvitalotaulukoksi kiihdytetyllä kopiointipolulla. Tämä testi käyttää optimoitua kopiota Lakehouseen ja V-Orderiin. | Optimoitu kopio Lakehouselle | 00:03:34 | 15× nopeammin | 50,788 | 2,391 | 95% |
| Skenaario 4: Yhdistä tiedostot | Yhdistä ja muunna 56 ositettua Parquet-tiedostoa rinnakkain ja lataa ne varastoon. | Partitioned Compute (Preview) | 00:04:48 | 21× nopeammin | Ei mitattu | Ei mitattu | Ei mitattu |
Seuraava kaavio vertaa samoja skenaarioita kapasiteetin kulutuksen perusteella suoritusajan sijaan.
Vaiheittaiset yksityiskohdat, tietoaineiston konfiguraatiot ja suunnittelumallit kullekin kyvykkyydelle löytyvät seuraavista skenaarioosioista.
Huomautus
Kaikissa tämän artikkelin skenaarioissa Modern Evaluator on käytössä ja V-Order pois päältä, ellei toisin mainita. Gen1 CU ja Gen2 CU -sarakkeet raportoivat kapasiteettiyksikön sekunnit. Gen2-sarakkeen CU-vähennys tarkoittaa CU-sekuntien laskua Dataflow Gen1 -perusrajasta parhaaseen Dataflow Gen2 -konfiguraatioon, joka lasketaan muodossa (Gen1 CU − Gen2 CU) ÷ Gen1 CU.
Miten mittasimme nämä vertailuarvot
Jokainen skenaario suorittaa saman M-skriptin kahdesti: kerran Dataflow Gen1:ssä perustason luomiseksi ja kerran Dataflow Gen2:ssa, jossa testattava ominaisuus on käytössä.
Jokainen tämän artikkelin suoritus jakaa samat testiolosuhteet:
- Kaikki skenaariot ja molemmat sukupolvet toimivat samalla Fabric-kapasiteetilla, joten mikään tulos ei heijasta eri kapasiteettikokoa tai SKU:ta.
- Dataporttia ei ollut mukana. Jokainen yhteys siirtyi suoraan Fabric-palvelusta pilvitietolähteeseen.
- Jokainen skenaario käytti samaa lähdedataa ja samaa M-skriptiä sekä Dataflow Gen1- että Dataflow Gen2 -ajoissa.
Raportoidut luvut tarkoittavat seuraavaa:
- Suoritusaika on datavirran kokonaisvirkistyskesto, joka raportoitiin.
- Kulutettu CU on kapasiteettiyksikön sekunteja, jotka ajo laskutetaan kapasiteettiin, lukemalla Microsoft Fabric Capacity Metrics -sovelluksesta. Koska Dataflow Gen2 laskuttaa jokaisen moottorin erikseen, skenaarion kokonaissumma on kaikkien päivitysajan aikana käynnissä olleiden moottoreiden summa, ja CU-luvut pyöristetään lähimpään koko CU-sekuntiin. Täydellisen hintamallin löydät katso Dataflow Gen2 -hinnoittelu.
Kun vertaat kahta sukupolvea, pidä mielessä nämä arkkitehtoniset erot:
- Dataflow Gen1 käyttää perustavanlaatuisesti erilaista arkkitehtuuria kuin Dataflow Gen2, eikä se tue ominaisuuksia kuten Fast Copy, Modern Evaluator, Optimized copy to Lakehouse tai Partitioned Compute.
- Dataflow Gen1 voi ladata dataa vain CSV-tiedostoina, kun taas Dataflow Gen2 lataa dataa Parquet-tiedostoina näissä tilanteissa.
Huomautus
Nämä luvut kirjattiin omassa testiympäristössämme elokuussa 2026, ja ne koskevat vain näitä erityisiä ajoja. Omat tuloksesi vaihtelevat datamäärän, kapasiteetin koon ja konfiguroinnin mukaan. Oman työkuorman mittaamiseksi katso Laske arvioidut kustannukset Fabric Metrics -sovelluksella ja datavirran päivityshistoriassa.
Skenaario 1: Kopioi data
NYC Taxi -analytiikkatiimin täytyy ladata miljoonia raakaa Parquet-matkatietueita ADLS Gen2:sta Fabric-järvenmajaan. Tiimi ei tarvitse muunnoksia, vain suoran kopion tukemaan alavirran analytiikkaa.
Haasteet
- Siirrä suuria määriä Parquet-dataa nopeasti järvenmajaan.
- Vähennä nauttimisaikaa päivittäisten virkistysten vuoksi.
- Minimoi laskentakustannukset yksinkertaisissa poimintakuorman (EL) työkuormissa.
Dataset
Vuosittain yhdistetyt NYC Yellow Taxi Parquet -tiedostot, viisi yhdistettyä osiota (2021–elokuu 2025).
Ratkaisu
Tiimi mahdollistaa nopean kopioinnin Dataflow Gen2:ssa. Fast Copy optimoi datan liikkumisreitit ja rinnakkaistaa kirjoitukset tuetuille liittimille.
Suunnittelu
Tämä kysely yhdistää viiden vuoden Parquet-tiedostot ja lataa tuloksen järventaloon.
Nopean kopion näkökulmat
- Tukee .csv - ja .parquet-tiedostomuotoja .
- Tukee jopa 1M riviä per taulukko per kierros Azure SQL Database.
- Parhaiten soveltuvat extract-load (EL) -työnkulkuihin ennen muunnoksia.
Tulokset
Kun otat Fast Copy -toiminnon käyttöön, Dataflow Gen2 vastaanottaa tämän aineiston noin 11× nopeammin kuin Dataflow Gen1:n perusarvo (00:09:08 vs. 01:38:59) samalla kun laskentateho vähenee. Ilman Fast Copya Dataflow Gen2 on jo noin 2,8× nopeampi kuin Gen1 samalla työkuormalla.
| Määritykset | Suoritusaika (hh:mm:ss) | Vertailu Gen1:een | Kulutettu CU |
|---|---|---|---|
| Dataflow Gen1 -perusarvo | 01:38:59 | — | 84,411 |
| Dataflow Gen2 ilman nopeaa kopiointia | 00:35:25 | 2,8× nopeammin | Ei mitattu |
| Dataflow Gen2 nopealla kopiolla | 00:09:08 | 11× nopeammin | 14,593 |
Kun otat Fast Copy -toiminnon käyttöön – optimaalisin Dataflow Gen2 -konfiguraatio tässä tilanteessa – Scenario 1:n Fast Copy -kopiointi viidestä yhdistetystä Parquet-tiedostosta lakehouseen kuluttaa 14 593 CU-sekuntia. Seuraava taulukko jakaa tämän summan operaatioittain:
| Toiminta | Moottori (mittari) | CU sekuntia |
|---|---|---|
| Tietojen siirto | Nopea kopio | 8,280 |
| Kyselyjen suorittaminen | Vakio käsittely | 6,313 |
| Yhteensä | 14,593 |
Nopea kopiointidatan liike laskutetaan nopeudella 1,5 CU per sekunti kopiointiaktiivisuutta, mitattuna kaikkien ytimien kokonaisajana, joilla kopio toimii. Dataflow Gen2 tasapainottaa automaattisesti, kuinka monta ydintä kukin Fast Copy -skenaario käyttää, joten kopio, joka valmistuu nopeasti seinäkellon aikana, voi silti kattaa useita ydinsekunteja. Jäljellä oleva kyselyaika laskutetaan Standard Compute -menetelmällä (12 CU jokaista sekuntia 10 minuuttiin asti, sitten 1,5 CU jokaista lisäsekuntia kohden). Täyden hintamallin löydät katso Dataflow Gen2 -hinnoittelu.
Tärkeimmät seikat
- Nopean kopion käyttöönotto tiivisti 99 minuutin käsittelyn noin yhdeksään minuuttiin, mikä oli huomattava parannus samaan aineistoon ja M-skriptiin.
- Dataflow Gen2 käytti myös 83% vähemmän kapasiteettia kuin Dataflow Gen1 samassa työssä (14 593 verrattuna 84 411 CU-sekuntia), joten nopeutuminen ei aiheuttanut lisälaskentaa.
- Nopeus tulee natiivista, rinnakkaisesta datan liikkeestä, joka ohittaa mashup-moottorin, joten se koskee vain nouto-latausvaiheita, jotka täyttävät Fast Copy -vaatimukset. Mikä tahansa muunnos, joka rikkoo foldauksen, palaa standardimoottoriin ja menettää vahvistukset.
- Tuettujen lähteiden osalta käsittele Fast Copya oletuksena vastaanottoon ja varaa raskaammat muunnosmoottorit (jotka käsitellään seuraavissa skenaarioissa) vaiheille, jotka oikeasti muokkaavat dataa.
Skenaario 2: Raskas datan muokkaus
Vastaanoton jälkeen tiimi käyttää suodatusta, nollakorvausta ja koodikartoitusta ennen datan lataamista järvenrakennukseen. Nämä muodonmuutokset eivät täysin palaudu Parquetiin ja ovat hitaita muistissa.
Haasteet
- Paranna muunnosnopeutta puolitaittuville tai ei-taittuville kyselyille.
- Ylläpidä kooditon Power Query -luominen.
- Vähennä kokonaisvirkistysaikaa ja kustannuksia.
Dataset
Kaikki Parquet-tiedostot vuosilta 2021–elokuu 2025 yhdistettiin yhdeksi yhdistetyksi tiedostoksi.
Ratkaisu
Tiimi mahdollistaa Modern Evaluatorin -suoritusmoottorin, joka on suunniteltu tehokkaaseen muunnokseen erityisesti liittimille kuten ADLS Gen2 ja SharePoint.
Suunnittelu
Tämä kysely vastaanottaa dataa yhdistetystä Parquet-tiedostosta, suodattaa ja-sarakkeet trip_distancefare_amount pitääkseen arvot yli 0, korvaa nollat passenger_count 1:llä ja luo uuden payment_method sarakkeen kartoittamalla maksutyypit ennen datan lataamista järventaloon.
Nykyaikaiset arvioijan näkökohdat
- Odotetut virkistysajat voivat olla merkittävästi nopeampia (vaihtelee aineiston ja muunnosten mukaan).
- Optimoitu suurille tilavuuksille (miljoonia rivejä).
- Hyödyllinen ei-taittuville kyselyille.
- Nopeampi kirjoittaa kohteisiin kuin järvimajaan.
Tulokset
Kun otat Modern Evaluatorin käyttöön, Dataflow Gen2 suorittaa tämän muokkauskuorman noin 1,7× nopeammin kuin Dataflow Gen1:n perusarvo (00:46:29 vs. 01:19:56) säilyttäen samalla no-code-Power Query -kokemuksen. Ilman Modern Evaluatoria sama työmäärä on vain noin 1,2× nopeampi kuin Gen1:ssä (01:08:37 vs. 01:19:56).
| Määritykset | Suoritusaika (hh:mm:ss) | Vertailu Gen1:een | Kulutettu CU |
|---|---|---|---|
| Dataflow Gen1 -perusarvo | 01:19:56 | — | 56,855 |
| Dataflow Gen2 ilman Modern Evaluatoria | 01:08:37 | 1,2× nopeammin | Ei mitattu |
| Dataflow Gen2 Modern Evaluatorilla | 00:46:29 | 1,7× nopeammin | 10,485 |
Kun otat käyttöön Modern Evaluatorin – optimaalisimman Dataflow Gen2 -konfiguroinnin tässä tilanteessa – Scenario 2:n Modern Evaluator -muoto yhdestä suuresta Parquet-tiedostosta järvenrakennukseksi vie 10 485 CU-sekuntia. Seuraava taulukko jakaa tämän summan operaatioittain:
| Toiminta | Moottori (mittari) | CU sekuntia |
|---|---|---|
| Kyselyjen suorittaminen | Vakio käsittely | 10,485 |
| Yhteensä | 10,485 |
Työ toimii kokonaan Standard Compute -menetelmällä, joka on laskutettu kahdelle tasolle: 12 CU per sekunti 10 minuuttiin asti, sitten 1,5 CU jokaista lisäsekuntia kohden. Seuraava taulukko näyttää, miten laskutettu kesto ja CU:n kokonaissumma jakautuvat näiden tasojen kesken:
| Laskutustaso | Laskutettu kesto | Korko | CU sekuntia |
|---|---|---|---|
| Ensimmäiset 10 minuuttia | 00:10:00 (600 sekuntia) | 12 CU per sekunti | 7,200 |
| Yli 10 minuuttia | 00:36:29 (2 189,8 sekuntia) | 1,5 CU per sekunti | 3,284.7 |
| Yhteensä | 00:46:29 (2 789,8 sekuntia) | 10,484.7 |
Tämä taulukko näyttää mitatun summan yhteen desimaaliin, joten tasot summautuvat täsmälleen; loput artikkelista pyöristää sen 10 485 CU sekuntiin.
Jako osoittaa, kuinka paljon ensimmäinen taso hallitsee kokonaisuutta: ensimmäiset 10 minuuttia ovat vain noin 22% juoksusta, mutta ne muodostavat noin 69% CU:n sekunnista, koska jokainen näistä sekunneista maksaa kahdeksan kertaa enemmän kuin sekunti toisella tasolla. Kaikki yli 10 minuutin ajan – suurimman osan pitkästä muotoilujaksosta – veloitetaan paljon alhaisemmalla 1,5 CU:n nopeudella. Modern Evaluator laskee laskua edelleen lyhentämällä laskutusaikaa itsessään, ei muuttamalla korkoa. Täyden hintamallin löydät katso Dataflow Gen2 -hinnoittelu.
Tärkeimmät seikat
- Ilman Modern Evaluatoria Dataflow Gen2 oli vain noin 1,2× nopeampi kuin Dataflow Gen1:n perustaso tässä muokkaustyökuormassa. Modern Evaluatorin käyttöönotto paransi suorituskykyä noin 1,7× nopeammin kuin Gen1 identtisellä M-skriptillä ja datajoukolla.
- Kapasiteetin säästö on suurempi kuin ajansäästö: Dataflow Gen2 päätyi 1,7× nopeammin ja kulutti kapasiteettia 82% vähemmän kuin Dataflow Gen1 (10 485 verrattuna 56 855 CU sekuntiin).
- Tämä suorituskyvyn parannus johtuu tehokkaammasta suorituspolusta ei-taittuville ja puolitaittuville kyselyille. Power Query käyttää perinteisesti eniten aikaa näihin kyselyihin, erityisesti kun käytät liittimiä kuten ADLS Gen2 ja SharePoint. Vahvistukset skaalautuvat rivin tilavuuden ja muotoilun monimutkaisuuden mukaan.
- Käytä Modern Evaluatoria oletuksena muotoilupainotteisissa virroissa, joissa kyselyt eivät täysin palaa lähteeseen. Mitä suurempi aineisto on ja mitä enemmän muunnoksia käytät moottorissa, sitä enemmän vaikutusta kannattaa odottaa.
Skenaario 3: Optimoitu kopio Lakehouseen
NYC Taxin analytiikkatiimi muuntaa suuren pöydän ja kirjoittaa tuloksen Fabric-järvenmajaksi. Tämän volyymin kirjoittaminen kohteeseen on päivityksen hitain osa, joten tiimi haluaa nopeuttaa kirjoitusta muuttamatta muunnoslogiikkaa.
Haasteet
- Kirjoita suuri muunnettu tulos nopeasti järvenmökkäkohteeseen.
- Pidä kohdekirjoitus välttämästä päivityspullonkaulaa.
- Säilytä no-code Power Query -kokemus ja olemassa oleva muunnoslogiikka.
Dataset
Fabric Lakehouse -pöytä, jossa on noin 113 miljoonaa NYC:n taksimatkarekisteriä vuosilta 2017 puoliväliin 2018.
Ratkaisu
Tiimi ottaa käyttöön Enable staging -toiminnon ja ottaa käyttöön optimoidun kopion Lakehouseen yhdellä kyselyllä, joka kirjoittaa lakehouse-kohteeseen. Optimoitu kopio Lakehouseen siirtää vaiheistetun tuloksen lakehouseen kiihdytetyllä reitillä.
Suunnittelu
Vertailudatavirta käyttää yhtä kyselyä, jossa Enable staging on päällä, ja järventalokohdetta , joka käyttää V-Orderia. Kysely lukee noin 113 miljoonan rivin NYC:n taksitaulukon Fabric-järvenrakennuksesta, lajittelee rivit noutopäivän ja -ajan mukaan ja lisää kaksi johdettua saraketta – noutokuukauden alun sekä MTA:n veron ja parannuslisämaksun summan. Koska staging on päällä, optimoitu kopio Lakehouseen kirjoittaa muunnetut tulokset lakehouse-kohteeseen kiihdytetyllä polulla, mikä ohjaa nopeaa suoritusaikaa.
Optimoitu kopio Lakehouse-näkökulmiin
- Se vaatii Enable stagingin kyselyssä ja järvenmökkäkohteen. Lisätietoja löytyy kohdasta Staged data options for Dataflow Gen2.
- Se nopeuttaa kirjoittamista järvenrakennukseen muuttamatta muunnoslogiikkaa.
- Yhdistä se kohteen V-Orderiin optimoidaksesi tuloksen alavirran analytiikkaa varten.
Tulokset
Kun otat käyttöön optimoidun kopioimisen Lakehouseen, Dataflow Gen2 suorittaa tämän päivityksen noin 15× nopeammin kuin Dataflow Gen1:n perusarvo (00:03:34 vs. 00:53:20) muuttamatta muunnoslogiikkaa. Ilman sitä sama vaiheittainen datavirta on noin 3,6× nopeampi kuin Gen1:ssä.
| Määritykset | Suoritusaika (hh:mm:ss) | Vertailu Gen1:een | Kulutettu CU |
|---|---|---|---|
| Dataflow Gen1 -perusarvo | 00:53:20 | — | 50,788 |
| Dataflow Gen2 vaiheistuksella + V-järjestys (ei optimoitua kopiota Lakehouseen) | 00:14:45 | 3,6× nopeammin | Ei mitattu |
| Dataflow Gen2 vaiheituksella + Optimoitu kopio Lakehouseen + V-järjestys | 00:03:34 | 15× nopeammin | 2,391 |
Kun otat käyttöön vaiheen, optimoitu kopio Lakehouseen ja V-Order – optimaalisin Dataflow Gen2 -konfiguraatio tähän skenaarioon – Scenario 3:n 113 miljoonan rivin NYC-taksipöydän päivitys lakehouse-taulukoksi valmistuu ajassa 00:03:34 ja kuluttaa 2 391 CU sekuntia. Seuraava taulukko jakaa tämän summan operaatioittain:
| Toiminta | Moottori (mittari) | CU sekuntia |
|---|---|---|
| Kyselyjen suorittaminen | Vakio käsittely | 2,391 |
| Yhteensä | 2,391 |
Teos laskutetaan kokonaan Standard Compute -menetelmällä (12 CU per sekunti 10 minuuttiin asti, sitten 1,5 CU jokaista lisäsekuntia kohden). Optimoitu kopio järvenrakennukseen kulkee mashup-moottorin kautta, joten erillistä mittaria ei ole. Täyden hintamallin löydät katso Dataflow Gen2 -hinnoittelu.
Tärkeimmät seikat
- Optimoitu kopiointi Lakehouseen nopeuttaa muunnetun tuloksen kirjoittamista lakehouse-kohteeseen, jolloin päivitys lyhentää 00:14:45:stä (ilman sitä) 00:03:34:ään – noin 4× nopeampi kuin sama datavirta ilman sitä ja noin 15× nopeammin kuin Dataflow Gen1:n perusarvo (00:53:20).
- Tämä skenaario toi suurimman kapasiteetin säästön verrattuna Dataflow Gen1:een tässä artikkelissa: Dataflow Gen2 kulutti 95% vähemmän kapasiteettia kuin Dataflow Gen1 (2 391 verrattuna 50 788 CU sekuntiin).
- Se vaatii Enable staging -toiminnon kyselyssä ja lakehouse-kohteen, eikä se muuta muunnoslogiikkaa.
- Tässä skenaariossa kohdetulos käyttää nimenomaisesti V-järjestystä .
- Käytä optimoitua kopiointia Lakehouseen aina, kun kirjoitat vaiheitettua dataa lakehouse-kohteeseen, ja kirjoitusaika hallitsee päivitystä.
Skenaario 4: Yhdistä tiedostot
Huomautus
Partitioned Compute on tällä hetkellä esikatseluvaiheessa ja saatavilla vain Dataflow Gen2:ssa CI/CD:llä. Ominaisuus saa edelleen parannuksia, joten sen käyttäytyminen, tuetut muutokset ja suorituskyky voivat muuttua ennen yleistä saatavuutta. Käsittele tämän skenaarion tuloksia kuin esikatselun hetken hetkessä.
Tiimin on nyt koottava ja rikastettava matkatietoja sadoista Parquet-tiedostoista (kuukausittaisista osioista). Muunnokset sisältävät tip-prosenttien laskemisen koko aineistossa.
Haasteet
- Sinun täytyy käsitellä satoja suuria tiedostoja.
- Muunnokset vaativat ryhmittelyä, aggregointia ja rikastamista osion yli.
- Peräkkäinen toteutus muuttuu pullonkaulaksi.
Dataset
Viisikymmentäkuusi Parquet-tiedostoa (2021–elokuu 2025).
Ratkaisu
Tiimi mahdollistaa osioidun laskennan (Preview), joka rinnakkaistaa käsittelyn osioiden välillä ja yhdistää tulokset tehokkaasti.
Suunnittelu
Tämä kysely yhdistää 56 Parquet-tiedostoa ja luo uuden räätälöidyn sarakkeen tipin prosenttiosuudelle "Tip Pctg" Transform Sample -tiedostoon ennen datan lataamista varastoon.
Jaetut laskennan näkökohdat
- Tällä hetkellä esikatseluvaiheessa ja saatavilla vain Dataflow Gen2:ssa CI/CD:llä; Ominaisuus saa edelleen parannuksia.
- Käytä sitä, kun lähde ei tue taittamista.
- Tarjoaa parhaan suorituskyvyn, kun dataa ladataan stagingiin tai varastoon.
- Käytä Combin-tiedostojenSample transform -tiedostoa varmistaaksesi johdonmukaisen muunnoslogiikan.
- Tukee muunnoksien osajoukkoa; Suorituskyky vaihtelee.
Tulokset
Partitioned Compute tarjoaa noin 21× nopeamman suorituskyvyn kuin Dataflow Gen1:n perustaso (00:04:48 vs. 01:40:57) suurilla, osioiduilla, monitiedostoisilla aineistoilla.
| Määritykset | Suoritusaika (hh:mm:ss) | Vertailu Gen1:een | Kulutettu CU |
|---|---|---|---|
| Dataflow Gen1 -perusarvo | 01:40:57 | — | Ei mitattu |
| Dataflow Gen2 osioidulla laskentatoimella | 00:04:48 | 21× nopeammin | Ei mitattu |
Jaettu laskenta keskittyy seinäkellon aikaan kustannusten sijaan. Se ajaa osioita rinnakkain, jotta päivitys valmistuu nopeammin, mutta rinnakkaisuus jakaa työn laajemmalle laskentatasolle sen sijaan, että sitä vähentäisi, joten kustannukset ovat tyypillisesti samankaltaiset tai korkeammat kuin sama työkuorma ilman ominaisuutta. CU:n kulutusta ei mitattu tässä tilanteessa, joten tämä artikkeli raportoi vain suoritusajan.
Tärkeimmät seikat
- Partitioned Compute saavutti 21 × nopeutuksen Dataflow Gen1 -lähtötasoon nähden ja suoritti alle viidessä minuutissa. Koska ominaisuus on jo esikatselussa ja saa edelleen parannuksia, odotettavissa on, että nämä luvut kehittyvät.
- Käsittele jaettua laskentaa tapana saada aikaisemmin valmiiksi, ei vähemmän. Rinnakkaisuus lyhentää seinäkelloaikaa ajamalla osioita samanaikaisesti, joten kustannukset ovat tyypillisesti samankaltaiset tai korkeammat kuin saman työkuorman ilman sitä.
- Hyöty saadaan jokaisen osion rinnakkaisesta käsittelystä ja tulosten yhdistämisestä, joten se on tehokkaimmillaan monitiedostoisissa tai osioiduissa lähteissä, joissa taittaminen ei ole mahdollista ja peräkkäinen arviointi on pullonkaula.
- Käytä Combin-tiedostojen Sample transform -tiedostomallia , jotta muunnoslogiikkaa sovelletaan johdonmukaisesti per osio. Partitioned Compute tukee tällä hetkellä osaa muunnoksista, joten varmista, että muotoiluvaiheesi ovat yhteensopivia ennen kuin luottaa siihen, ja tarkista uudelleen esikatselun kehittyessä.
- Suuren volyymin, ositetun vastaanoton yhteydessä stagingiin tai varastoon tee Partitioned Compute oletusarvoksi ja yhdistä se Modern Evaluatoriin aina kun mahdollista. Koska se on vielä esikatselussa, validoi se omaan työkuormaasi vastaan ennen kuin otat sen käyttöön tuotantopäivityksissä.
Kustannukset ajan myötä (silloin vs. nyt)
Dataflow Gen2:sta on tullut kustannustehokkaampi ajaa ajan myötä. Sama logiikka, samoilla datalla, kuluttaa nykyään vähemmän CU:ita kuin ennen, eikä kyselyihisi tarvitse muuttaa mitään.
Tässä vertailussa tarkoitetaan samaa työkuormaa verrattuna hinnoitteluun ja ominaisuuksiin, jotka ovat yleisesti saatavilla ennen vuotta 2026. Nyt sama työkuorma suoritetaan tänään parhailla yleisesti saatavilla olevilla asetuksilla (kuten Modern Evaluator ja Fast Copy). Molemmat sarakkeet käyttävät aikakautensa parasta yleisesti saatavilla olevaa kokoonpanoa. Nykyiset luvut mitataan kapasiteettitelemetrialla. Tuolloin lasketut luvut ovat arvioita siitä, mitä sama työmäärä olisi kuluttanut tuolloin, koska aiempia palveluolosuhteita ei voida toistaa nykyään.
| Skenaario | Ominaisuus | Arvioitu CU ennen vuotta 2026 (paras GA) | CU nyt (paras GA) | Arvioitu vähennys |
|---|---|---|---|---|
| Skenaario 1: Kopioi data | Nopea kopio | 17,055 | 14,593 | 14% |
| Skenaario 2: Raskas datan muokkaus | Nykyaikainen arvioija | 66,164 | 10,485 | 84% |
| Skenaario 3: Optimoitu kopio Lakehouseen | Optimoitu kopio Lakehouselle | 14,173 | 2,391 | 83% |
Esimerkiksi raskaan muotoilun työmäärä skenaariossa 2 olisi kuluttanut arviolta 66 164 CU sekuntia ennen vuotta 2026, ja nyt se kuluttaa 10 485 CU-sekuntia. Tämä muutos on 84% reduktio, jossa logiikka on identtinen eikä muutoksia tarvita. Kaksi parannusta yhdistyy, jotta se syntyy. Ensinnäkin Standard Compute -hinnoittelu muuttui porrastetuksi: sen sijaan, että olisi ollut tasainen 16 CU per sekunti koko suorituksesta, vain ensimmäiset 10 minuuttia veloitetaan 12 CU per sekunti per sekunti ja joka sekunti jälkeen laskut vain 1,5 CU, joten muotoilutyön pitkä häntä maksaa nyt murto-osan siitä, mitä se teki. Toiseksi, Modern Evaluator – yleisesti saatavilla huhtikuusta 2026 lähtien – lyhentää laskutusaikaa itsessään, joten laskutusaikaa on vähemmän kummallakin tasolla. Lyhyempi jakso suhteessa paljon halvempaan pitkän hännän korkoon on syy siihen, miksi CU:n kulutus laskee niin jyrkästi, ja siksi Modern Evaluatorin yhdistäminen nykyiseen porrastettuun hinnoitteluun on niin tärkeää muotoilupainotteisissa tietovirroissa.
Nopean kopion vastaanotto skenaariossa 1 kuluttaisi arviolta 17 055 CU sekuntia ennen vuotta 2026, ja nyt se kuluttaa 14 593 CU sekuntia. Tämä muutos on 14% vähennys, joka johtuu Standard Compute -nopeudesta, joka laskee tasaisesta 16 CU:sta sekunnissa 12 CU:hun sekunnissa aina 10 minuuttiin; Fast Copy -datan siirtoosuus on ennallaan. Optimoitu kopio Lakehouse-päivitykseen skenaariossa 3 kuluttaisi arviolta 14 173 CU sekuntia ennen vuotta 2026, ja nyt kuluttaa 2 391 CU sekuntia. Tämä muutos on 83% vähennys. Jokainen vertailu käyttää samaa työkuormaa aikakauden parhailla yleisesti saatavilla olevilla asetuksilla.
Huomautus
Tämä silloin verrattuna nykyhetkeen vertailu ei sisällä ositetun laskentaa, koska CU:n kulutusta ei mitattu kyseisessä tilanteessa ja ominaisuus on edelleen esikatselussa.
Usein kysytyt kysymykset
Miten Dataflow Gen2 laskutetaan?
Dataflow Gen2 laskuttaa jokaisen moottorin erikseen Fabric Capacity Units (CU) -yksiköissä. Standard Compute (mashup-moottori) laskuttaa 12 CU jokaista sekuntia kohden jopa 10 minuuttia jokaisesta kyselystä, ja sitten 1,5 CU jokaista lisäsekuntia kohden. Nopea kopiointi (datan siirto) laskuttaa 1,5 CU jokaista sekuntia kohden, mitattuna kaikissa ytimissä, joilla kopio toimii. Sinua laskutetaan vain siitä laskentamäärästä, jonka kukin kysely oikeasti käyttää, ilman kiinteää päivitysmaksua eikä maksua tyhjäkäyntiajasta. Täydellisen hintamallin löydät katso Dataflow Gen2 -hinnoittelu.
Onko Dataflow Gen2:n hinnoittelu joustavaa?
Kyllä. Dataflow Gen2 laskuttaa vain sitä laskentaa, jota kukin kysely oikeasti käyttää, mitattuna Fabric Capacity Units (CU) -yksiköissä. Ei ole kiinteää päivitysmaksua, ei maksua tyhjäkäyntiajasta eikä suoria maksuja alkuperäisestä toiminnallisuudesta. Tämän artikkelin benchmarkeissa täysi päivitys kulutti 14 593 CU-sekuntia nopean kopioinnin vastaanotolle ja 10 485 CU-sekuntia raskaalle muotoilutyökuormalle.
Miten voin arvioida Dataflow Gen2 -kustannukseni ennen kuin teen koko työkuorman?
Suorita pieni, edustava päivitys ja mittaa, mitä se kuluttaa, sen sijaan että rakentaisit täydellisen ratkaisun ja selvittäisit kustannukset jälkikäteen. Kustannusten arvioimiseksi näin:
- Rakenna datavirta näytteen tai yhden osion pohjalta lähteestä koko aineiston sijaan.
- Päivitä se kerran ja lue sitten CU-sekunnit, jotka se kulutti Microsoft Fabric Capacity Metrics -sovelluksessa.
- Tarkista datavirran virkistyshistoria nähdäksesi, mitkä moottorit olivat käynnissä, koska Standard Compute ja Fast Copy laskutetaan erikseen.
- Jaa mitatut CU-sekunnit käsittelemilläsi riveillä tai GB:llä saadaksesi yksikkökohtaisen nopeuden, ja kerro sitten koko datavolyymillasi.
Huomautus
Dataflow Gen2 on optimoitu suurimittakaavaisille työkuormille, joten sen suorituskyky- ja tehokkuushyödyt näkyvät parhaiten suurissa, todellisissa tietoaineistoissa. Pieni tai synteettinen otos ei välttämättä näytä kaikkia hyötyjä, ja pienestä otoksesta ekstrapoloitu yksikkökohtainen nopeus voi liioitella täyden erän kustannuksia. Validoi edustuksellista datamäärää vastaan aina kun mahdollista.
Koko menetelmän löydät katso: Laske arvioidut kustannukset Fabric Metrics -sovelluksella ja datavirran päivityshistoria.
Kuinka kauan Dataflow Gen2:n päivitys kestää?
Se riippuu datavolyymista ja käytetyistä muunnoksista. Tämän artikkelin benchmarkeissa Dataflow Gen2:n päivitykset vaihtelivat 00:03:34:stä optimoidulle 113 miljoonan rivin taulukolle järvimajaan, aina 00:46:29:ään raskaalle muotoilutyökuormalle suuren yhdistetyn Parquet-tiedoston yli. Viiden yhdistetyn Parquet-tiedoston massakopio valmistui ajassa 00:09:08 Fast Copy -toiminnolla, ja 56 ositetun tiedoston yhdistelmä valmistui ajassa 00:04:48 Partitioned Compute (Preview) -toiminnolla. Täydelliset skenaariokohtaiset ajat löydät vertailutulosten yhteenvedosta.
Mikä Dataflow Gen2 -ominaisuus laskee kustannuksia eniten?
Se riippuu työkuormasta, koska jokainen ominaisuus kohdistuu eri pullonkaulaan: Fast Copy muunnosvapaaseen vastaanottoon, Modern Evaluator ei-taittuvaan datan muotoiluun, Optimoitu kopio Lakehouseen kirjoitusten nopeuttamiseen lakehouse-kohteeseen ja Partitioned Compute (Preview) suurille monitiedostoisille aineistoille. Dataflow Gen1 -perusarvoon mitattuna optimoitu kopio Lakehouseen tuotti suurimman säästön näissä vertailuarvoissa, 95% vähemmän CU-sekuntia. Verrattuna vastaaviin Dataflow Gen2 -ajoihin ennen vuotta 2026, Modern Evaluator tuotti suurimman arvioidun vähennyksen, 84% vähemmän CU-sekuntia raskaalla muotoilutyökuormalla. Jos haluat sovittaa kyvykkyyden työkuormaasi, katso pikaviitteessä.
Miten voin nopeuttaa Dataflow Gen2:n päivitystä?
Sovita ominaisuus pullonkaulaan: ota käyttöön Fast Copy tuetuille purku-latauslähteille, ota käyttöön Modern Evaluator ei-taittuville muunnoksille, ota käyttöön optimoitu kopio Lakehouseen, kun kirjoitetaan vaiheitettua dataa lakehouse-kohteeseen, ja käytä Partitioned Compute (Preview) -toimintoa suurille osioiduille tai monitiedostoisille aineistoille. Jokainen ominaisuus on tässä artikkelissa verrattavissa sen tarjoaman nopeutuksen perusteella Dataflow Gen1 -perustasolla.
Täytyykö minun muuttaa kyselyitäni saadakseni nämä parannukset?
Ei. Jokainen tämän artikkelin benchmark ajoi samaa M-skriptiä molemmilla sukupolvilla ja kaikissa kokoonpanoissa. Fast Copy, Modern Evaluator ja Optimized copy to Lakehouse ovat asetuksia, jotka kytket päälle, ja ne muuttavat sitä, miten moottori ajaa kyselyt itse kyselyiden sijaan. Yksi varoitus: Fast Copy koskee vain vaiheita, jotka täyttävät sen vaatimukset, joten muunnos, joka rikkoo kyselyn taittoa, palaa standardimoottoriin ja menettää vahvistuksen. Näistä edellytyksistä katso Nopea kopio Dataflow Gen2:ssa.
Onko Dataflow Gen2 nopeampi ja edullisempi kuin Dataflow Gen1?
Suurten työmäärien kohdalla, kuten tässä artikkelissa arvioiduissa, kyllä molemmissa tapauksissa. Dataflow Gen2 toimi välillä 1,7× ja 21× nopeammin kuin Dataflow Gen1:n perusarvo samalla datalla ja samalla M-skriptillä, ja se kulutti 82%–95 kapasiteettiyksikköä% vähemmän niissä tilanteissa, joissa molempia sukupolvia mitattiin. Esimerkiksi massakopio, joka kesti 01:38:59 Dataflow Gen1:ssä, päättyi 00:09:08 Dataflow Gen2:ssa Fast Copylla – noin 11× nopeammin. Ero on pienempi lyhytaikaisissa datavirroissa, koska kysely, joka valmistuu ensimmäisen 10 minuutin aikana, ei koskaan saavuta halvemman 1,5 CU -tason tasoa, joten hyödyt kasvavat datamäärän ja suoritusajan myötä. Täydellisen vertailun skenaariokohtaisesti löydät vertailutulosten yhteenvedosta.
Kuinka paljon kapasiteettia Dataflow Gen1 kuluttaa verrattuna Dataflow Gen2:een?
Niissä skenaarioissa, joissa molempia sukupolvia mitattiin, Dataflow Gen1 kulutti useita kertoja enemmän kapasiteettia kuin Dataflow Gen2 samaan suurvolyymiin työhön. Nopea kopio kulutti 84 411 CU sekuntia Dataflow Gen1:ssä verrattuna 14 593 CU sekuntiin Dataflow Gen2:ssa, mikä tarkoittaa 83% vähennystä. Raskas datan muokkaustyökuorma vei 56 855 CU sekuntia Dataflow Gen1:ssä kun taas Dataflow Gen2:ssa 10 485 CU sekuntia, mikä tarkoittaa 82% vähennystä. Optimoitu kopio Lakehouseen kulutti 50 788 CU sekuntia Dataflow Gen1:ssä verrattuna 2 391 CU-sekuntiin Dataflow Gen2:ssa, mikä tarkoittaa 95% vähennystä. Kaikki nämä kolme päivitystä kestävät reilusti yli 10 minuuttia, joten suurin osa heidän Dataflow Gen2 -kestostaan veloitetaan alemmalla 1,5 CU-nopeudella. Skenaariokohtaiset luvut löytyvät vertailutulosten yhteenvedosta.
Pitäisikö minun siirtää Dataflow Gen1 -datavirtani Dataflow Gen2:een?
Kyllä. Dataflow Gen2 on Microsoft Fabric -datavirtojen nykyinen sukupolvi, joten suunnittele siirtäväsi kaikki Dataflow Gen1 -datavirrat siihen. Tämän artikkelin benchmarkeissa Dataflow Gen2 suoritti saman M-skriptin 1.7×–21× nopeammin ja kulutti 82%–95% vähemmän kapasiteettiyksikköä kuin Dataflow Gen1 – sama logiikka, mutta se toimii nopeammin ja käyttää vähemmän kapasiteettia. Ominaisuudet, jotka tuottavat nämä hyödyt – Fast Copy, Modern Evaluator, Optimized copy to Lakehouse ja Partitioned Compute – ovat saatavilla vain Dataflow Gen2:ssa, joten ero kasvaa jatkuvasti näiden ominaisuuksien kehittyessä. Odotettavissa on suuria voittoja suurilla volyymilla, pitkäaikaisilla päivityksillä. Siirron aikana testaa edustavaa työkuormaa varmistaaksesi oman datasi ja kapasiteettisi hyödyt. Aloita katsomalla Dataflow Gen2 -yleiskatsaus.
Onko Dataflow Gen2 ajan myötä tullut kustannustehokkaammaksi?
Kyllä. Raskaan muotoilun työmäärä skenaariossa 2 olisi kuluttanut arviolta 66 164 CU-sekuntia ennen vuotta 2026, ja nyt se kuluttaa 10 485 CU-sekuntia nykyisillä yleisesti käytettävissä olevilla kyvyillä, mikä tarkoittaa arviolta 84% vähennystä identtisellä logiikalla ilman muutoksia. Skenaariokohtaisia lukuja varten katso Kustannukset ajan myötä (silloin vs. nyt).
Ovatko vanhemmat Dataflow Gen2:n kustannus- ja suorituskykyluvut edelleen tarkkoja?
Ei välttämättä. Tämän artikkelin luvut heijastavat nykyistä Dataflow Gen2 -hinnoittelumallia – 12 CU per sekunti jopa 10 minuuttia Standard Computea kohden, sitten 1,5 CU jokaista lisäsekuntia kohden – sekä nykyiset ominaisuudet kuten Fast Copy ja Modern Evaluator. Koska Dataflow Gen2 on ajan myötä muuttunut nopeammaksi ja kustannustehokkaammaksi, ennen vuotta 2026 julkaistut vertailuluvut tai kustannusarviot saattavat yliarvioida nykyisiä kustannuksia tai aliarvioida nykyistä suorituskykyä. Validoi omat työkuormasi Microsoft Fabric Capacity Metrics -sovelluksella.