Datavuon Gen2:n valmistelukohteiden tiedot

Suorituskyvyn ja luotettavuuden parantamiseksi Tietovuo Gen2 käyttää valmistelukohteita keskitason tietojen tallentamiseen tietojen muunnoksen aikana. Tässä artikkelissa kuvataan, mitä vaiheen kohteet ovat, millaisia ELT-kuvioita ne avaavat vaiheen aikana kerran, viittaa moniin malleihin ja miten hallita niiden sisältämää dataa.

Mitä ovat lavastuskohteet?

Valmistelukohteet ovat tietojen välitallennuspaikkoja, joita Dataflow Gen2 käyttää tietojen tallentamiseen tietojen muuntamisen aikana. Näillä nimikkeillä on "DataflowsStagingLakehouse"- ja "DataflowsStagingWarehouse"-nimiä. Valmistelukohteita käytetään välitietojen tallentamiseen tietojen muuntamisen aikana suorituskyvyn parantamiseksi. Nämä kohteet luodaan automaattisesti, kun luot ensimmäisen tietovuon, ja Dataflow Gen2 hallitsee niitä. Nämä kohteet piilotetaan käyttäjältä työtilassa, mutta ne voivat näkyä muissa kokemuksissa, kuten Nouda tiedot tai Lakehouse-resurssienhallinnassa. Suosittelemme vahvasti, ettet pääse suoraan käyttöön tai muokkaa vaiheituskohteiden tietoja, sillä se voi johtaa odottamattomaan käyttäytymiseen. Myöskään tietojen tallentamista valmistelukohteisiin ei tueta, ja se voi johtaa tietojen menetykseen.

ELT-mallit: vaihe kerran, viittaa moniin

Välivaraston lisäksi staging avaa joukon ELT-kuvioita, jotka on rakennettu yhdelle perustalle: vaihe yksi, viittaa moniin. Lähdekysely merkitään vaiheitetuksi, jotta sen tulos materialisoidaan sisäiseen vaihetallennustilaan. Alavirran kyselyt viittaavat sitten vaiheitettuun kyselyyn sen sijaan, että lukisivat lähdettä uudelleen. Fast Copy on valinnainen kiihdytin, joka nopeuttaa vaiheitetun kyselyn täyttymistä, mutta se ei määritä kaavaa.

Kaavalla on merkitystä, koska kun data on vaiheistettu, alavirran kyselyt voivat:

  • Ajaa indeksoitua, kyselykelpoista kopiota vastaan ilman, että lähde palaa takaisin.
  • Taita suodattimet, liitokset ja aggregaatiot takaisin SQL-staging-päätepisteelle sen sijaan, että suoritettaisiin mashup-moottorissa.
  • Haarautuu useisiin rinnakkaisiin muunnoksiin tai kohteisiin yhdestä materialisoidusta tuloksesta.

Yleiset käyttötapaukset

Seuraavat kuviot on tyypillisesti kerrostettu vaiheitetun lähdekyselyn päälle.

Käyttötapaus Description
Muotoiltu data analytiikkamalleiksi Viitatut kyselyt muovaavat vaiheitetun datan fakta- ja ulottuvuustaulukoiksi, yhteenvedoksiksi, kokouksiksi tai KPI:iksi deduplikaation, ryhmittelyn ja avainten generoinnin kautta.
Taitettava laskennallinen työntö Viitatut kyselyt, jotka on kirjoitettu vaiheitetulle datalle, taittavat liitoksensa, suodattimensa ja ryhmäkohtaiset operaationsa staging SQL -päätepisteeseen, siirtäen laskennan varastomoottoriin mashup-moottorin sijaan. Tämä on usein suurin yksittäinen suoritusvoitto, jonka lavastus mahdollistaa.
Tietojen laatu- ja auditointiosasto Viitatut kyselyt validoivat tai tarkastavat vaiheitettua dataa (nollatarkistukset, rajoitteiden validointi, rivimäärät) lukematta lähdettä uudelleen.
Levittäytyminen useisiin kohteisiin Useat viitatut kyselyt lataavat kukin eri kohteen samasta vaiheitetusta lähteestä (esimerkiksi yksi Lakehouse ja yksi Warehouse).
Vaihe ja yhdistäminen Jokainen lähde vaiheistetaan omaan kyselyynsä, minkä jälkeen alavirran viitattu kysely yhdistää tai yhdistää vaiheitetut tulokset, taittaen liitoksen takaisin staging-SQL-päätepisteeseen.

Kun lavastus ei ole oikea valinta

Staging lisää tallennuskustannuksia ja ylimääräisen kirjoituksen ennen kuin alavirran kyselyt käynnistyvät. Harkitse sen ohittamista, kun:

  • Muunnoksesi taittuu jo päästä päähän lähdejärjestelmään, eikä mashup-moottorissa ole laskentaa.
  • Datavirralla on yksi lähtö, eikä alavirran haarautumista, validointia tai fan-outia ole.
  • Lähdeviive on pullonkaula, eikä lähdettä voi rinnastaa vaiheen avulla.

Lisätietoja siitä, milloin vaiheitus kannattaa ottaa käyttöön tai poistaa käytöstä, löydät kohdasta Parhaat käytännöt parhaan suorituskyvyn saavuttamiseksi Dataflow Gen2:lla.

Vaiheittaisten nimikkeiden tiedot

Valmistelukohteita ei ole suunniteltu käyttäjien suoraa käyttöä varten. Dataflow Gen2 hallitsee valmistelukohteiden tietoja ja varmistaa, että tiedot ovat yhdenmukaisessa tilassa. Valmistelukohteiden tietojen käyttämistä suoraan ei tueta, koska ei voida taata, että tiedot ovat yhdenmukaisessa tilassa. Jos tarvitset pääsyn dataan staging-elementeissä, voit käyttää dataflow-liitintä Power BI:ssä, Excelissä tai muissa datavirroissa.

Tärkeää

Sisäinen API, joka palvelee vaiheiteltua dataa alavirran käyttäjille (kuten semanttiset mallit tai muut datavirrat Dataflows-liittimen avulla), voi kokea ajoittaisia aikakatkaisuja. Nämä aikakatkaisut voivat aiheuttaa päivitysvirheitä kulutuskohteissa, usein virheenä "Avain ei täsmännyt yhtään riviä taulukossa." Tämä virhe ei viittaa dataongelmaan. Se tarkoittaa, että taustajärjestelmä ei ehtinyt palauttaa vaiheittaisia tuloksia ajoissa.

Suositeltu kiertotie: Määritä datan kohde (Lakehouse tai Warehouse) datavirtallesi ja päivitä alavirran kohteet lukemaan suoraan kyseisestä kohteesta Lakehouse- tai Warehouse-liittimellä. Tämä ohittaa sisäisen staging-API:n ja parantaa päivityksen luotettavuutta.

Lisätietoja löytyy Data Factoryn rajoituksista.

Tietojen poistaminen valmistelukohteista voidaan pakottaa jollakin seuraavista toimista:

  • Poista valmistelu käytöstä tietovuossa ja päivitä (30 päivän kuluttua poistamme tietojen keräämisen käytöstä).
  • Poista tietovuo (poistaa tiedot suoraan).
  • Poista työtila (poistaa suoraan StagingLakehousen ja StagingWarehousen).

Vaiheen kustannusvaikutukset

Lakehousen ja Varaston stagointi tallentavat välidataa osana datavirran käsittelyä. Näiden staging-esineiden kuluttama varastointi laskutetaan osana OneLake-varastoasi. Tämä tarkoittaa, että staging-kohteisiin tallennettu data lasketaan kokonaisvaltaiseen OneLake-tallennuskulutukseesi ja siihen liittyviin kustannuksiin.

Säilytyskustannusten tehokas hallinta:

  • Seuraa staging-tallennustilan käyttöä: Ole tietoinen, että staging-data kertyy jokaisen datavirran päivityksen myötä, kunnes roskat kerätään tai poistetaan nimenomaisesti.
  • Poista staging käytöstä, kun sitä ei tarvita: Jos muunnokset taittuvat lähdejärjestelmään, stagingia ei välttämättä tarvita. Vaiheen poistaminen käytöstä vähentää tallennustilan kulutusta.
  • Siivoa käyttämättömät tietovirrat: Poistamalla tarpeettomat tietovirrat poistetaan välittömästi niihin liittyvän vaiheistuksen datan.
  • Ota huomioon päivitystiheys: Säännölliset päivitykset, joissa vaiheistus on päällä, voivat johtaa suurempaan tallennustilan kulutukseen. Tasapainottele suorituskykyedut tallennuskustannusten kanssa.

Lisätietoja OneLake-tallennustilan hinnoittelusta löytyy Microsoft Fabricin hinnoittelusta.