Parhaat käytännöt parhaan suorituskyvyn saamiseksi Dataflow Gen2:n avulla

Tässä artikkelissa annetaan parhaita käytäntöjä Dataflow Gen2:n suorituskyvyn optimoinnille Fabric Data Factoryssa. Näiden ohjeiden avulla voit parantaa tietojen integrointiprosessiesi tehokkuutta ja nopeutta.

Opit lisää

Tässä artikkelissa tutustut seuraaviin:

  • Suorituskyvyn optimoinnin avainalueet: tietovuon suorituskykyyn vaikuttavien kolmen tärkeän komponentin (tietolähde, tietovuomoduuli ja tietokohde) ymmärtäminen
  • Ydinoptimointitekniikat: Nopean kopion, kyselyn delegoinnin taittelun ja valmistelun hyödyntäminen tehokkuuden maksimoimiseksi
  • Tosielämän skenaariot: Yleiset suorituskykyhaasteet ja niiden erityisratkaisut
  • Parhaat käytännöt: Toiminnalliset ohjeet erilaisiin tietojen integrointimalleihin ja käyttötapauksiin

Mitkä ovat tärkeimmät alueet, joihin pitää keskittyä suorituskyvyn optimoinnissa?

Tietovuon päästä päähän -kokemuksessa on useita keskeisiä alueita, joihin sinun tulee keskittyä suorituskyvyn optimoinnissa. Näitä alueita ovat tietojen siirto, tietovuomoduuli ja tietojen muunnokset. Jokainen näistä osista ja niiden väliset polut ovat ratkaisevassa roolissa tietovuon yleisen suorituskyvyn kannalta, ja niiden optimointi voi johtaa merkittäviin parannuksiin suoritusajassa ja resurssien käytössä.

Tietovuon Gen2-taustan yleiskatsauskaavio.

Tietojen siirto

Tietojen siirto on tietovuon suorituskyvyn tärkeä osa. Siihen liittyy tietojen siirtäminen eri osien, kuten tietolähteiden, valmistelualueiden ja lopullisten kohteiden, välillä. Tehokas tietojen siirto voi vähentää huomattavasti suoritusaikaa ja resurssien kulutusta. Tietovuo Gen2:ssa tietojen siirto on optimoitu nopean kopion kaltaisten tekniikoiden avulla, mikä mahdollistaa suuren siirtomäärän tiedonsiirron ilman lähdejärjestelmään delegoitavien muunnosten kuormituksia. Lue lisää nopeasta kopioinnista.

Tietomuunnos

Tietojen muuntaminen on prosessi, jossa tietoja muunnetaan rakenteesta toiseen. Se sisältää usein toimintoja, kuten suodatuksen, koostamisen ja liittämisen. Tietovuo Gen2:ssa muunnokset on suunniteltu tehokkaiksi ja käyttämään kyselyn delegointi lähteeseen -ominaisuuksia aina, kun se on mahdollista. Kyselyn delegointi lähteeseen mahdollistaa muunnosten siirtämisen lähdejärjestelmään, mikä vähentää tietovuossa Gen2 siirrettävien ja käsiteltävien tietojen määrää. Tämä vähennys on erityisen tärkeää suurille tietojoukoille, sillä se minimoi tietovuomoduulin kuormituksen ja nopeuttaa suoritusaikaa. Lisätietoja kyselyn delegoinnista lähteeseen on kohdassa Kyselyn delegointi lähteeseen. Noudata myös muita kyselyjen optimoinnin parhaita käytäntöjä, kuten suodatusta aikaisessa vaiheessa ja usein, tietojen esikatselun rajoittamista parametrisoinnin avulla ja tarpeettomien muunnosten välttämistä tietovuossa. Lisätietoja kyselyn optimoinnista on kohdassa Kyselyn optimointi.

Valmistelutietojen ja varaston käsittely

Valmistelutiedot ovat tekniikka, jonka avulla parannetaan suorituskykyä tallentamalla välituloksia tilapäisesti valmistelualueelle. Tietovuon Gen2 mukana toimitetaan lavastus Lakehouse ja valmisteluvarasto, joiden avulla voidaan tehdä muunnoksia tehokkaammin. Valmistelutietojen avulla voit käyttää näiden valmistelualueiden käsittelyresursseja monimutkaisten tietovoiden erittelemiseksi hallittaviin vaiheisiin, mikä lyhentää yleistä käsittelyaikaa. Tämä erittely on erityisen hyödyllinen suurissa tietoaineistoissa tai monimutkaisissa muunnoksissa, joiden suorittaminen yhdessä vaiheessa muuten veisi kauan. Voit pitää valmistelusijainteja tilapäisenä tallennusalueena, jonka avulla voit taittaa muunnoksia. Tämä lähestymistapa on erityisen hyödyllinen käsiteltäessä tietolähteitä, jotka eivät tue kyselyn delegointia lähteeseen tai kun muunnokset ovat liian monimutkaisia lähettääkseen ne lähdejärjestelmään. Jos haluat ottaa valmistelun käyttöön tehokkaasti, voit pitää silmällä tietovuon editorin taittamisilmaisimia varmistaaksesi, että muunnokset lähetetään lähteeseen. Jos huomaat, että muunnosta ei ole taitettu, harkitse kyselyn jakamista kahdeksi kyselyksi ja muunnoksen soveltamista toisessa kyselyssä. Ota valmistelu käyttöön ensimmäisessä kyselyssä, jotta voit suorittaa muunnoksen valmistelu-Lakehousessa tai Warehouse-tietojenkäsittelyssä. Tämän lähestymistavan avulla voit hyödyntää valmistelualueilla käytettävissä olevia käsittelyresursseja ja varmistaa samalla, että tietovuo pysyy tehokkaana ja reagoivana.

Näyttökuva, jossa näytetään, miten valmistelu otetaan käyttöön Dataflow Gen2:ssa.

Kun sinulla on tietoja, jotka on jo vaiheistettu Lakehousessa tai varastossa, ja käytät enemmän muunnoksia, jotka taittavat seuraavat kyselyt kokonaan, tietovuo kirjoittaa tulosteen valmisteluvarastoon. Tämä voi olla nopeampaa kuin kirjoittaminen valmisteluiseen Lakehouseen, koska DW voi kirjoittaa tietojoukon rinnakkain ja se käy läpi vähemmän verkkohyppyjä vastaavien sarjoitusvaiheiden kanssa.

Skenaariot ja huomioitavat optimoinnit

Kun käsittelet Dataflow Gen2 -tietovuota, on tärkeää ymmärtää eri skenaarioita, joita saatat kohdata, ja miten voit optimoida suorituskyvyn kussakin tapauksessa. Seuraavista seikoista saat käytännön ohjeita siitä, miten parhaita käytäntöjä sovelletaan reaalimaailman tilanteisiin. Räätälöimällä lähestymistapaasi tietojen ja muunnosten erityisominaisuuksien perusteella voit saavuttaa optimaalisen suorituskyvyn tietojen integroinnin työnkuluissa. Seuraavassa on joitakin yleisiä skenaarioita, joita saatat kohdata käyttäessäsi Dataflow Gen2:ta, sekä suositeltuja toimintoja suorituskyvyn optimoimiseksi. Huomaa, että suorituskyvyn optimointi on jatkuva prosessi, joka liittyy hyvin paljon skenaarioosi. Sinun on ehkä muovettava lähestymistapaasi omien tietoihisi ja muunnoksiesi erityisominaisuuksiin perustuen.

Huomioitavaa 1: Tietojen siirron parantaminen nopealla kopiolla

Tässä skenaariossa huomaat, että tietojen siirto tietolähteen ja valmistelualueen välillä tai lopulliseen kohteeseen kestää odotettua kauemmin. Tähän voi liityä useita tekijöitä, kuten verkon viive, suuret tietojoukkojen koot tai tehottomia tiedonsiirtomenetelmiä.

Harkitse tässä tapauksessa tietojen siirtopolun arviointia ja sen optimointia suorituskyvyn parantamiseksi. Yksi tapa on käyttää nopeaa kopiota suuren siirtonopeuden tiedonsiirtoon, mikä voi vähentää huomattavasti suoritusaikaa. Nopea kopiointi on suunniteltu käsittelemään suuria tietomääriä tehokkaasti minimoimalla perinteisiin tiedonsiirtomenetelmiin liittyvät yleiskuormitukset. Ole kuitenkin varovainen: jos lisäät muunnoksia samassa kyselyssä kuin nopea kopiointi -toiminto, se voi poistaa nopean kopion käytöstä, jos muunnokset eivät taita lähdejärjestelmään. Tässä tapauksessa harkitse kyselyn erottamista kahteen vaiheeseen: yksi Nopean kopioinnin toimintoa varten ja toinen muunnoksia varten käyttämällä valmistelu-Lakehouse- tai Warehouse-käsittelyä. Tämän lähestymistavan avulla voit hyödyntää nopeaa kopiointia tietojen suuren siirtonopeuden saamiseksi samalla, kun suoritat tarvittavat muunnokset erillisessä vaiheessa. Lue lisää nopeasta kopioinnista.

Näyttökuva Asetukset-valintaikkunasta, joka näyttää nopean kopioinnin käyttöönottosijainnin tietovuon Gen2:ssa.

Voit ottaa nopean kopion käyttöön tietovuon asetuksissa. Tämä asetus on oletusarvoisesti käytössä, mutta voit myös edellyttää, että pikakopiota käytetään tietyssä tietovuon kyselyssä. Voit tehdä tämän valitsemalla Vaadi nopea kopiointi -vaihtoehdon kyselyn asetuksista. Tämä toiminto varmistaa, että valitussa kyselyssä käytetään pikakopiointia ja että se ohittaa pikakopioinnin vähimmäiskoon raja-arvon. Tämä asetus on erityisen hyödyllinen, kun haluat varmistaa, että nopeaa kopiota käytetään tietyissä kyselyissä tietojen koosta tai muista ehdoista riippumatta. Jos tarvitset nopean kopion, varmista, että tietolähde on yhteensopiva pikakopion kanssa ja että kyselyn muunnokset voidaan siirtää lähdejärjestelmään. Jos tarvitset nopean kopioinnin kyselylle, joka ei ole yhteensopiva pikakopioinnin kanssa, tietovuo epäonnistuu. Jos et edellytä pikakopiointia, tietovuo suoritetaan edelleen, mutta se voi palata oletusarvoiseen tietojen siirtomenetelmään, joka ei ehkä ole yhtä tehokas kuin pikakopiointi. Tämän joustavuuden avulla voit optimoida tietovuosi tietojen integrointiprosessien erityisvaatimusten perusteella.

Näyttökuva, jossa näkyy Edellytä nopeaa kopiota -vaihtoehdon sijainti tietovuossa Gen2.

Huomioitavaa 2: monimutkaisten muunnosten suoritusajan parantaminen valmistelua käyttämällä

Tässä skenaariossa sinulla on tietovuo, jossa on useita monimutkaisia muunnoksia, kuten liitokset, koosteet ja suodatus. Suoritusaika on odotettua pidempi, ja haluat optimoida näiden muunnosten suorituskyvyn.

Harkitse tässä tapauksessa tietovuon purkamista pienempiin, helpommin hallittaviin vaiheisiin. Sen sijaan, että suoritat kaikki muunnokset yhdessä kyselyssä, voit lavastaa tiedot valmisteluympäristössä tai varastossa ja ottaa sitten muunnokset käyttöön myöhemmissä kyselyissä. Tämän lähestymistavan avulla voit käyttää valmistelualueen käsittelyresursseja monimutkaisille muunnoksille lyhentäen yleistä suoritusaikaa. Varmista myös, että muunnokset on suunniteltu lähteeseen lähteeseen aina kun mahdollista, sillä tämä voi parantaa suorituskykyä merkittävästi vähentämällä tietovuossa Gen2 siirrettyjen ja käsiteltyjen tietojen määrää. Jos huomaat, että joitakin muunnoksia ei ole taitettu, harkitse niiden jakamista erillisiin kyselyihin ja niiden käyttämistä tietojen valmistelun jälkeen.

Seuraavassa kuvassa näet, miten tietovuoeditorin taittoilmaisimet voivat auttaa tunnistamaan, mitkä muunnokset lähetetään lähdejärjestelmään.

Näyttökuva, jossa korostetaan Käytössä olevat vaiheet -ruudun taittamisilmaisimia.

Voit ottaa valmistelun tehokkaasti käyttöön jakamalla tietovuon kahdeksi kyselyksi. Voit tehdä tämän napsauttamalla hiiren kakkospainikkeella ensimmäistä vaihetta, joka ei taivu lähdejärjestelmään, ja valitsemalla Pura edellinen -vaihtoehdon. Tämä toiminto luo uuden kyselyn, joka vaiheistaa tiedot valmisteluvaiheessa Lakehouse- tai Warehouse-käsittelytilassa, jolloin voit suorittaa muunnoksen erillisessä vaiheessa. Tämän lähestymistavan avulla voit hyödyntää valmistelualueilla käytettävissä olevia käsittelyresursseja ja varmistaa samalla, että tietovuo pysyy tehokkaana ja reagoivana.

Näyttökuva vaiheen pikavalikosta, jossa on korostettu Poimi edellinen -vaihtoehto.

Anna sitten uudelle kyselylle nimi ja valitse "OK".

Näyttökuva Poimi vaiheet -valintaikkunasta, johon on lisätty uusi nimi.

Nyt kun uusi kysely on luotu, voit tarkistaa, onko valmistelu käytössä ensimmäisessä kyselyssä. Jos valmistelu ei ole käytössä, voit ottaa sen käyttöön valitsemalla Ota valmistelu käyttöön -vaihtoehdon kyselyasetuksista. Tämän toiminnon avulla voit suorittaa muunnoksia valmisteluympäristössä Lakehouse tai Warehouse käsittely, mikä optimoi tietovuon suorituskyvyn. Toisen kyselyn valmistelu on valinnaista, mutta se voi parantaa suorituskykyä entisestään, jos voit tehdä lisämuunnoksia valmistelualueella ennen lopullisen tuloksen kirjoittamista kohdesijainniin.

Näyttökuva kyselyn pikavalikosta, jossa on korostettu Ota valmistelu käyttöön- ja Nopea kopiointi -asetukset.

Jos nyt tarkastelet taittoilmaisimia tietovuoeditorissa, ensimmäisen kyselyn muunnokset lähetetään lähdejärjestelmään. Toinen kysely ei ehkä vastaa samoja lähteeseen delegoinnin ilmaisimia, koska valmistelualue ja muunnokset ovat selvillä vain suoritusajan aikana ja muunnokset, jotka voidaan lähettää valmistelualueelle.

Näyttökuva Käytössä olevat vaiheet -ruudusta, jossa on korostettu taittoilmaisimet ja joiden kaikki on määritetty vihreiksi.

Lisätietoja tietovuon muunnosten optimoinnista ja sen varmistamisesta, että ne siirretään lähdejärjestelmään, on kohdassa Kyselyn delegointi lähteeseen.

Huomio 3: Optimoi datan siirtyminen vaiheesta Lakehouseen Lakehouse-kohteessa

Tässä tilanteessa käytä Lakehouse-kohdetta datavirtaan ja ota käyttöön staging muunnosten suorittamiseksi ennen lopullisen tuloksen kirjoittamista. Varmista, että vaiheittainen datan siirtäminen Lakehouseen ei lisää tarpeetonta ylimääräistä kuormitusta kokonaisvirkistysaikaan.

Lakehouse on täysin tuettu ja suorituskykyinen kohde tälle mallille. Datan siirto staging-varastosta Lakehouse-kohteeseen on optimoitu, joten sinun ei enää tarvitse vaihtaa määränpäätä varastoon saadaksesi hyvän suorituskyvyn. Suositeltu lähestymistapa on ELT-malli: käytä Fast Copya datan nopeaan laskemiseen, suorita muunnokset vaiheitetulla datalla Fabric-vaiheen laskennalla ja kirjoita lopullinen tulos Lakehouseen. Suurissa aineistoissa Fast Copy on edelleen suositeltu tapa siirtää dataa tehokkaasti.

Saadaksesi tästä kaavasta parhaan hyödyn tänään, jaa Fast Copy ja transformaatiotyö kahteen kyselyyn: yhteen kyselyyn, joka suorittaa Fast Copy -datan siirron, ja toiseen, joka soveltaa muunnokset vaiheitetussa datassa ennen kuin kirjoittaa Lakehouse-kohteeseen. Yhdistämällä Fast Copy -operaation ei-taittumattomiin muunnoksiin samassa kyselyssä Fast Copy poistuu, joten niiden pitäminen erillisissä kyselyissä on tärkein asia, johon kannattaa kiinnittää huomiota. Jos muodonmuutoksesi taittuvat kokonaan lähteeseen, voit myös kirjoittaa suoraan Lakehouseen staging pois päältä.

Kun vaiheistat dataa ja kirjoitat Lakehouse-kohteeseen, ota käyttöön Scal-välilehdellä Optimoitu kopioi Lakehouseen (Preview) -vaihtoehto reitittääksesi vaiheitetun datan Lakehouseen nopeampaa kopiointipolkua pitkin, mikä vähentää vaiheen ja Lakehousen hypyn ylikuormitusta. Lisätietoja löytyy kohdasta Staged data options for Dataflow Gen2.

Huomioitavaa 4: Suurten tietojen esikatselu suunnittelun aikana

Tässä skenaariossa käsittelet tietovuota, jossa on suuria tietojoukkoja, ja suunnitteluaika on hidas tietojen esikatselujen koon vuoksi. Tämä prosessi voi vaikeuttaa tietovuon luomista ja testaamista tehokkaasti.

Harkitse tässä tapauksessa joko rakennenäkymän tai parametrisoinnin käyttämistä tietojen esikatselun koon rajoittamiseksi. Käyttämällä parametreihin, kuten päivämääräalueeseen tai tiettyihin tunnuksiin, perustuvia suodattimia voit vähentää suunnitteluaikaympäristössä näytettävien tietojen määrää. Tämän lähestymistavan avulla voit pitää suunnitteluympäristön reagoivan ja tehokkaana, jolloin voit keskittyä tietovuon tuottamiseen ja testaamiseen ilman suurten tietojen esikatselujen estämistä. Lisäksi voit muokata parametreja suorituksen aikana ja noutaa tarvittaessa koko tietojoukon.

Jos käsittelet esimerkiksi suurta tapahtumatietojoukkoa, voit luoda parametrin, joka suodattaa tiedot tietyn päivämääräalueen perusteella. Näin näet suunnittelun aikana vain niiden tietojen alijoukon, jotka liittyvät nykyiseen työseesi. Kun olet valmis suorittamaan tietovuon, voit säätää parametria sisältämään koko tietojoukon ja varmistaa, että tietojen integrointiprosessit pysyvät tehokkaina ja reagoivana. Seuraavassa esimerkissä näytetään, miten voit määrittää parametrin Dataflow Gen2:ssa:

  1. Valitse Hallitse parametreja -vaihtoehto tietovuoeditorissa.

  2. Valitse Lisää parametri -painike lisätäksesi uuden parametrin.

    Näyttökuva tietovuoeditorista, jossa on korostettu Parametrien hallinta -valinta ja Uusi parametri -asetus.

  3. Täytä parametrin tiedot, kuten nimi, tyyppi ja arvo. Voit esimerkiksi luoda parametrin nimeltä DesignDateFilter,DateTime jonka oletusarvo rajoittaa tietojen esikatselun tiettyyn päivämääräalueeseen.

    Näyttökuva Parametrien hallinta -valintaikkunasta, jossa on korostettu Nimi-, Tyyppi- ja Nykyinen arvo -asetukset.

  4. Käytä parametria tietovuokyselyissäsi käyttämällä sitä suodatusehdoissa. Voit esimerkiksi suodattaa tiedot DesignDateFilter-parametrin perusteella, jos haluat rajoittaa tietojen esikatselun tiettyyn päivämääräalueeseen. Tässä tapauksessa suodatamme tiedot sisältämään vain tietueet, joissa "Date"-sarake on suurempi kuin DesignDateFilter-parametri .

    Näyttökuva Päivämäärä-sarakkeen suodatinvalikosta, jossa uusi suodatin on käytössä sarakkeessa.

  5. Nyt voit käyttää DesignDateFilter-parametria tietovuokyselyissäsi tietojen esikatselun rajoittamiseen suunnittelun aikana. Kun olet valmis suorittamaan tietovuon, voit säätää parametriarvoa sisältämään koko tietojoukon. Näin varmistat, että tietojen integrointiprosessit pysyvät tehokkaina ja reagoivana.

    Näyttökuva Suodata rivit -valintaikkunasta, jossa DesignDateFilter on suodattimena käytettävä parametri.

Toinen vaihtoehto on käyttää skeemanäkymää, jonka avulla voit nähdä tietojesi rakenteen lataamatta koko tietojoukkoa. Tämä näkymä tarjoaa korkean tason yleiskatsauksen tietojoukon tietotyypeistä ja sarakkeista, joten voit suunnitella ja testata tietovuota ilman, että suuret tietojen esikatselut vaikuttavat sinuun. Jos haluat siirtyä rakennenäkymään, valitse Rakennenäkymä-vaihtoehto tietovuon editorissa. Näyttökuva tietovuoeditorista, jossa on korostettu Skeemanäkymä-vaihtoehtoa.

Huomioitava seikka 5: Tietovuon gen2 suorituksenaikaiset ominaisuudet verrattuna Dataflow Gen1 -tietovuohon

Tässä skenaariossa huomaat, että tietovuon Gen2 suorituskyky on hitaampi kuin tietovuon Gen1, erityisesti suoritusajan ja resurssien käytön osalta. Tämä suorituskykyero voi johtua useista tekijöistä, kuten eroista tietovuon Gen2:ssa käytetyissä optimointitekniikoissa ja tulostemuodoissa.

Tietovuo Gen2 lähettää tietoja Delta Parquet -muodossa, kun käytät valmistelu- tai Lakehouse-kohteita, mikä poikkeaa Dataflow Gen1:n CSV-tulostuksesta. Vaikka Delta Parquet saattaa pidentää ETL-suoritusaikaa CSV-tiedostoon verrattuna, se mahdollistaa tehokkaat jatkokäsittelytoiminnot, kuten Direct Lake, Lakehouses ja Warehouses, joten nämä palvelut voivat käyttää tietoja tehokkaasti ilman lisäkäsittelyä tai kustannuksia. Tämä tallennusmenetelmän ero tarkoittaa sitä, että vaikka ensimmäinen suoritusaika voi olla pidempi, loppuvaiheen prosessien yleistä suorituskykyä ja tehokkuutta voidaan parantaa merkittävästi ja se voi johtaa tietojen integroinnin työnkulkujen parempaan pitkän aikavälin suorituskykyyn. Lue lisätietoja Delta Parquet -muodosta.

Huomioitavaa 6: Suurten tapahtumamuotoisten tietojoukkojen päivitysajan optimointi lisäävää päivitystä käyttämällä

Tässä skenaariossa käsittelet suurta tapahtumatietojoukkoa, jota päivitetään usein, ja haluat optimoida tietovuon päivitysajan. Tämä optimointi voi olla haastavaa, koska tietoja on paljon ja tarve käsitellä vain uusia tai muuttuvia tietueita.

Harkitse tässä tapauksessa lisäävän päivityksen tai mallin käyttämistä tietojen lisäämiseen. Lisäävän päivityksen avulla voit käsitellä vain uusia tai muutettuja tietoja viimeisimmän päivityksen jälkeen, mikä vähentää käsiteltyjen tietojen määrää ja nopeuttaa yleistä suoritusaikaa. Tämä lähestymistapa on erityisen hyödyllinen tilanteissa, joissa tietoja päivitetään usein, kuten tapahtumajärjestelmissä. Ottamalla lisäävän päivityksen käyttöön voit optimoida tietovuon suorituskyvyn ja varmistaa, että tietojen integrointiprosessit pysyvät tehokkaina ja reagoivana. Lue lisää lisäävästä päivityksestä tai lisää lisäävän tietojen keräämisen mallista.

Huomioitavaa 7: Käytän yhdyskäytävää yhteyden muodostamiseksi paikalliseen tietolähteeseen ja haluan optimoida tietovuon suorituskyvyn

Tässä skenaariossa käytät yhdyskäytävää yhteyden muodostamiseksi paikalliseen tietolähteeseen ja haluat optimoida tietovuon suorituskyvyn. Yhdyskäytävät voivat lisätä viivettä ja yleiskustannuksia, mikä voi vaikuttaa tietovuon yleiseen suorituskykyyn.

Tässä tapauksessa harkitse tietovuon jakamista kahteen erilliseen tietovuohon: yksi tietojen siirtämiseksi paikallisesta tietolähteestä tietokohteeseen (kuten Lakehouse tai Warehouse) ja toinen muuntamista ja lopullista tulosta varten. Tämän lähestymistavan avulla voit optimoida tietojen siirtovaihetta hyödyntämällä nopeaa kopiota suuren siirtonopeuden tiedonsiirrossa säilyttäen samalla muunnosvaiheen keskittyen tietojen tehokkaaseen käsittelyyn ja yleisen suoritusajan lyhentämiseen. Erottamalla tietojen siirron ja muunnosvaiheet voit vähentää yhdyskäytävän viiveen ja kapasiteettirajoitusten vaikutusta. Syynä tähän on se, että yhdyskäytävä suorittaa koko tietovuon, ja jos tietovuo on monimutkainen tai siinä on useita muunnoksia, se voi hidastaa suorituskykyä, kun yhdyskäytävä käsittelee kaikki yhdyskäytävää isännöivän tietokoneen muunnokset. Jakamalla tietovuon voit varmistaa, että yhdyskäytävä on vastuussa vain tietojen siirtovaiheesta, mikä voi parantaa suorituskykyä merkittävästi ja lyhentää suoritusaikaa.

Huomioitavaa 8: käytän tietovuon liittimiä tietovuon tietojen kuluttamiseen ja haluan optimoida tietojen integrointiprosesseja

Tässä skenaariossa käytät tietovuon liittimiä tietovuon tietojen kuluttamiseen ja haluat optimoida tietojen integrointiprosessit. Tietovuon liittimet voivat tarjota kätevän tavan käyttää ja käyttää tietoja.

Harkitse tässä tapauksessa tietokohteiden käyttämistä tietovuon liittimien sijaan tietovuon tietojen kuluttamiseen. Tietokohteet, kuten Lakehouset ja Varastot, on suunniteltu tallentamaan ja tarjoamaan tietoja tehokkaasti, jotta voit käyttää niiden ominaisuuksia jatkokäyttöön. Suurin tietokohteiden käyttämisen etu on se, että ne tarjoavat usein yleisempiä tapoja muodostaa yhteys tietoihin, kuten SQL-päätepisteeseen tai Käyttää Direct Lake -ominaisuuksia, mikä voi parantaa suorituskykyä merkittävästi ja vähentää resurssien kulutusta.

Huomio 9: Ota Modern Evaluator käyttöön kyselyjen suorituskyvyn parantamiseksi

Tässä tilanteessa haluat parantaa datavirran kokonaissuorituskykyä, erityisesti monimutkaisissa muunnoksissa tai liittimien kanssa, jotka eivät tue kyselyjen taittoa.

Tässä tapauksessa harkitse Modern Query Evaluation Enginen (Modern Evaluator) käyttöönottoa Dataflow Gen2:ssa CI/CD:llä. Modern Evaluator on uusi kyselyjen suoritusmoottori, joka toimii .NET Core 8:lla ja voi merkittävästi parantaa datavirran suorituskyvyä. Suositellaan, että tämä ominaisuus otetaan aina käyttöön tuetuissa tilanteissa, sillä se tarjoaa useita keskeisiä etuja:

  • Nopeampi tietovuon suorittaminen: Moderni moduuli voi lyhentää kyselyn arviointiaikaa huomattavasti. Monet tietovuot toimivat huomattavasti nopeammin, jolloin voit päivittää tietoja useammin tai täyttää tiukat päivitysikkunat.
  • Tehokkaampi käsittely: Moottori on optimoitu tehokkuutta varten käyttämällä parannettuja algoritmeja ja nykyaikaista ajoaikaa. Tämä tarkoittaa, että se pystyy käsittelemään monimutkaisia muunnoksia pienemmillä yleiskustannuksilla, mikä auttaa ylläpitämään suorituskykyä tietomäärän kasvaessa.
  • Skaalautuvuus ja luotettavuus: Nopeuttamalla suoritusta ja vähentämällä pullonkauloja Modern Evaluator auttaa tietovirtoja skaalautumaan suurempiin määriin ja vakaulaan. Voit odottaa tasaisempia päivityskestoja ja vähemmän aikakatkaisuongelmia suurissa datavirroissa.

Modern Evaluator on erityisen hyödyllinen, kun:

  • Työskentelet ei-taittuvien tai osittain taittuvien liittimien kanssa
  • Sovellat suodattimia, sarakkeiden johdannaisia tai datan puhdistusoperaatioita
  • Käsittelet suuria datamääriä tai monimutkaisia muunnoksia
  • Datavirtasi pyörivät useita kertoja päivässä, ja sinun täytyy säästää aikaa

Modernin arvioijan mahdollistamiseksi:

  1. Avaa datavirtasi Power Query -editorissa.
  2. Valitse valikosta Asetukset .
  3. Siirry Scale-välilehdelle.
  4. Ota käyttöön Modern query evaluation engine -vaihtoehto.
  5. Tallenna ja aja datavirtasi.

Kuvakaappaus vaihtoehtojen valintaikkunasta, joka näyttää modernin kyselyarvioijan asetuksen.

Modern Evaluator tukee kasvavaa liitinluetteloa. Täydellisen listan tuetuista liittimistä ja nykyisen ominaisuuksien tilan löydät kohdasta Modern Evaluator for Dataflow Gen2 with CI/CD. Jos datavirtasi käyttää liittimiä, joita ei ole tuettu listalla, nämä kyselyt jatkuvat vakiomoottorilla.

Lisätietoja Modern Evaluatorista löytyy kohdasta Modern Evaluator for Dataflow Gen2 with CI/CD.

Conclusion

Noudattamalla näitä parhaita käytäntöjä ja tarkastelemalla tietoihisi ja muunnoksiisi liittyviä erityisiä ominaisuuksia voit optimoida Dataflow Gen2:n suorituskyvyn Fabric Data Factoryssa. Nämä ohjeet tarjoavat toiminnallisia merkityksellisiä tietoja, joilla voit parantaa tietojen integrointiprosessiesi tehokkuutta ja nopeutta, olipa kyseessä sitten suuret tietojoukot, monimutkaiset muunnokset tai tietyt tietojen integrointitavat. Muista, että suorituskyvyn optimointi on jatkuva prosessi. Sinun on ehkä muutettava lähestymistapaasi tietojen integroinnin työnkulkujen kehittyvien tarpeiden mukaan. Valvomalla ja optimoimalla tietovoita jatkuvasti voit varmistaa, että ne pysyvät tehokkaina ja reagoivat liiketoimintavaatimuksiin.