Muistiinpano
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää kirjautua sisään tai vaihtaa hakemistoa.
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää vaihtaa hakemistoa.
Muistio
Tässä artikkelissa kuvatut vaiheitetut datavaihtoehdot ovat tällä hetkellä esikatseluvaiheessa.
Kun otat stagingin käyttöön kyselyssä, Dataflow Gen2 kirjoittaa välitulokset sisäiseen staging-Lakehouseen, jotta moottori voi käyttää Fabric laskentaa muunnoksiin tai datan sijoittamiseen kohteeseen.
Staged Data -osio datavirran skaalausasetuksissa antaa sinun säätää kahta putkiston osa-aluetta:
- optimoitu kopio Lakehouseen (Preview) — Käytä nopeampaa polkua kirjoittaaksesi vaiheitetut tiedot Fabric Lakehouse-datakohteeseen.
- Ota V-järjestyksen pakkaus käyttöön (Preview) — Sovella V-järjestyksen pakkausta staging-Lakehouseen kirjoitettuun dataan.
Molemmat vaihtoehdot pätevät dataflow-tasolla ja ovat voimassa vain Dataflow Gen2:ssa.
Mistä löytää asetukset
- Avaa datavirtasi Power Query -editorissa.
- Valitse valikosta Asetukset .
- Mene Scale-välilehdelle.
- Nämä kaksi asetusta on listattu Staged Data -osiossa.
Optimoitu kopio Lakehouseen (Esikatselu)
Kun tämä asetus on päällä, Dataflow Gen2 käyttää optimoitua tiedonsiirtopolkua kyselyille, jotka:
- Onko staging käytössä, ja
- Kirjoita Fabric Lakehouse datakohteeseen.
Oletuspolulla data kulkee staging-varastosta Lakehouseen lisäsarjallistamisen ja verkkohyppyjen kera. Optimoitu reitti vähentää näitä hyppyjä, mikä voi merkittävästi lyhentää virkistysaikaa vaihekuormitteisissa datavirroissa, jotka päätyvät Lakehouseen.
Mitattu esimerkki tämän vaihtoehdon virkistysajan ja CU-kulutuksen vaikutuksesta löytyy Skenaariosta 3: Optimoitu kopio Lakehouseen Dataflow Gen2:n kustannus- ja suorituskykymittareissa.
Milloin sitä kannattaa käyttää
Kytke tämä päälle, kun käynnistät kyselyt, jotka lopulta päätyvät Fabric Lakehouse -datakohteeseen. Lavastus on hyödyllisintä kun:
- Kyselysi sisältää muunnoksia, jotka eivät taitu lähteeseen.
- Haluat luottaa Fabric staging -laskentaan (Lakehouse tai Warehouse) suorittaaksesi raskaita toimintoja, kuten liitoksia, ryhmittämistä tai suodattimia ennen kuin kirjoitat kohteeseen.
Lisätietoja siitä, milloin staging auttaa, löydät Parhaat käytännöt parhaan suorituskyvyn saavuttamiseksi Dataflow Gen2:lla.
Oletustoiminta
Vaihtoehto on oletuksena pois päältä. Useimmissa datavirroissa, jotka vaiheittavat dataa ja kirjoittavat Fabric Lakehouseen, tämän asetuksen käyttöönotto on hyödyllistä.
Huomioitavia seikkoja
- Vaihtoehto on voimassa vain kyselyissä, joissa staging on käytössä ja jotka kirjoitetaan Fabric Lakehouse -datakohteeseen. Kyselyissä, jotka kirjoittavat muihin kohteisiin (Fabric Warehouse, Fabric SQL database, Azure SQL, Snowflake, KQL, Azure Data Lake Storage Gen2, file destinations), vaihtoehdolla ei ole vaikutusta.
- Jos poistat vaiheistuksen pois päältä kyselylle, optimoitu kopiopolku ei koske kyseistä kyselyä.
- Vaihtoehto koskee kaikkia datavirran kelpoisia kyselyjä. Tänään ei ole per-query overredea.
Ota käyttöön V-järjestyksen pakkaus (Esikatselu)
V-Order on kirjoitusaikainen optimointi Parquet-tiedostomuodolle, joka parantaa lukusuorituskykyä alavirran Fabric-moottoreissa, mutta kirjoittamisen aikana kuluu lisäprosessoria. Taustaa ja moottorien välisiä ohjeita varten katso Delta Lake -taulukon optimointi sekä V-järjestyksen ja ristiinkuorman taulukon ylläpito ja optimointi.
Kun tämä vaihtoehto on päällä, Dataflow Gen2 soveltaa V-järjestyksen pakkausta staging-Lakehouseen kirjoitettuun dataan. Kun se on pois päältä, vaiheistettu data kirjoitetaan ilman V-Orderia.
Milloin V-järjestys kytketään päälle tai pois päältä lavastusta varten
Lakehouse-vaiheen sisällä välidataa, jota käyttää vain Dataflow Gen2 itse: dataflow lukee vaiheitetun datan uudelleen saman päivityksen aikana lisämuunnoksia tai kirjoittaakseen kohteeseen, ja Dataflow-liitin lukee vaiheistetusta datasta, kun muut kohteet kysyvät datavirran tulosta. Loppukäyttäjän kyselymoottorit (Power BI Direct Lake, Fabric Warehouse, SQL Analytics Endpoint, Spark) eivät lue staging Lakehousea suoraan. Nämä skenaariot koskevat Lakehouse-datakohdettasi . Kohteen ohjeita varten katso Ota käyttöön V-järjestyksen pakkaus Lakehouse-kohteessa.
Koska vaiheistettua dataa luetaan tyypillisesti vain muutaman kerran saman päivityksen aikana, V-Orderin pois päältä siirtäminen vaiheistuksen vuoksi on hyvä valinta useimmille datavirroille. V-Orderin ohittaminen lyhentää kirjoitusaikaista prosessoria ja lyhentää virkistysaikaa, erityisesti suurissa staging-kirjoituksissa. Harkitse V-Orderin käynnistämistä stagingissa, jos datavirran vaiheistettu tulos kuluu monta kertaa Dataflow-liittimen kautta ja haluat suosia lukusuorituskykyä näissä alavirran kyselyissä staging-kirjoituskustannusten sijaan.
Oletustoiminta
Vaihtoehto on oletuksena päällä. Käytä yllä olevaa ohjeistusta päättääksesi, mikä on oikea tietovirtasi kannalta.
Missä muualla V-Order soveltuu
Dataflow-tason asetuksen lisäksi, joka ohjaa Lakehousen vaiheitusta, V-Orderia voidaan ohjata myös Lakehouse-datan kohdeyhteyden kautta, Enable using of V-Order compressing advanced -vaihtoehdon kautta. Tämä asetus määrittää, pakataanko kohde-Lakehouseen kirjoitettu data V-Order-pakattua. Kohde on Direct Laken, Fabric Warehousen, SQL-analytiikan päätepisteen ja Sparkin lukema pinta, joten kohdetason ohjeistus perustuu skenaarioihin.
Lisätietoja kohdetason vaihtoehdosta löytyy kohdasta Enable V-Order compress on a Lakehouse destination.
Liittyvä sisältö
- Dataflow Gen2:n kustannus- ja suorituskykymittarit
- Parhaat käytännöt parhaan suorituskyvyn saamiseksi Dataflow Gen2:n avulla
- Dataflow Gen2 -datakohteet ja hallitut asetukset
- Delta Lake -taulukon optimointi ja V-Order
- Työkuormataulukon ylläpito ja optimointi
- Modern Evaluator for Dataflow Gen2 with CI/CD
- Käytä osioitua laskentaa Dataflow Gen2:ssa (Preview)