Muistiinpano
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää kirjautua sisään tai vaihtaa hakemistoa.
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää vaihtaa hakemistoa.
Koskee:✅ Fabric-data-insinöörit ja datatiede
Fabric Data Engineeringin resurssiprofiilit auttavat sinua saamaan optimoidut Spark-laskentakonfiguraatiot ilman manuaalista säätöä. Kuvailet työkuormaasi valitsemalla ensisijaisen käyttötapauksen, datamäärän ja muutaman muun korkean tason syötteen. Fabric luo sitten suositellun konfiguraation — mukaan lukien solmukoot, automaattiskaalausasetukset ja ajonaikainen versio — todistettujen parhaiden käytäntöjen ja sisäisten suorituskykytietojen pohjalta.
Miksi käyttää resurssiprofiileja
Resurssiprofiilit tarjoavat:
- Optimoitu alusta alkaen: Ensimmäinen Spark-istuntosi toimii laskentateholla, joka on viritetty työkuormaasi varten — iteratiivista vertailua ei tarvita.
- Johdonmukaisuus: Kaikki Spark-työt työtilassa jakavat saman suorituskykyyn säädetyn konfiguraation.
- Parempi hinta-suorituskyky: Oikean kokoiset resurssit vähentävät hukkaa ja parantavat läpimenoa.
- Alhaisempi operatiivinen ylikuormitus: Vähemmän virityssyklejä ja vähemmän tukieskalaatioita.
Edellytykset
Resurssiprofiilien konfigurointiin sinulla täytyy olla työtilan ylläpitäjän rooli.
Määritä resurssiprofiili
Resurssiprofiilin konfigurointi työtilallesi:
Mene työtilaasi ja valitse Työtilan asetukset.
Laajenna Data Engineering/Science vasemmasta ruudusta ja valitse sitten Spark settings.
Saadaksesi suositellun laskentakonfiguraation resurssien käytön optimoimiseksi, valitse Optimoi käyttötapauksellesi kohdasta Aloita.
Optimoi käyttötapauksellesi -sivulla anna seuraavat syötteet:
- Ensisijainen käyttötapaus: Valitse joko Medallion-kerros tai Tehtäväpohjainen, ja valitse sitten tietty vaihtoehto pudotusvalikosta. Medallion-kerrosvaihtoehdot ovat pronssi, hopea tai kulta. Tehtäväpohjaiset vaihtoehdot ovat joko luku- tai kirjoitusoptimoituja. Ohjeita käyttötapauksen valintaan löytyy kohdasta Ensisijainen käyttötapaviite.
- Tyypillinen datavolyymi: Valitse tilavuus pudotusvalikosta: enintään 1 GB, 10 GB, 100 GB, 1 TB tai yli 1 TB.
- Maksimikapasiteettiyksiköt (CU): Käytä liukusäädintä asettaaksesi Spark-poolin maksimi-CU-raja.
Valitse Hanki suositus.
Fabric luo optimoidun konfiguraation syötteidesi perusteella.
Tarkista suositus. Suositus sisältää arvot kahdelle kategorialle:
- Kipinäpooli: Poolin tyyppi, solmuperhe, solmujen koko, automaattinen skaalaus ja dynaamisen toimeenpanijan allokaatio.
- Ympäristö: Ajonaikainen versio, Spark-ajurin ytimet ja muisti, Spark-suoritusohjelman ytimet, muisti ja instanssit.
Jos haluat säätää syötteitäsi, valitse taaksepäin oleva nuoli palataksesi edelliselle sivulle, päivitä valinnat ja valitse sitten Haku suositus uudelleen.
Syötä Spark-poolin nimi ja ympäristö konfiguraatiota varten, valitse sitten Apply tallentaaksesi sen työtilaan.
Kun olet soveltanut resurssiprofiilia, Fabric luo mukautetun Spark-poolin suositelluilla asetuksilla.
Muistio
Jos työtilassasi ei vielä ole mukautettua poolia, uusi pooli asetetaan automaattisesti oletuspooliksi työtilalle. Jos työtilassasi on jo oletuspooli, sinun täytyy vaihtaa manuaalisesti uuteen pooliin Spark-työtilan asetuksista. Aktiiviset istunnot eivät vaikuta ennen kuin ne käynnistetään uudelleen.
Ensisijainen käyttötapaviite
Käytä seuraavia ohjeita valitaksesi oikean ensisijaisen käyttötapauksen syötteen, kun määrität resurssiprofiilin:
Medallionkikerros
Valitse Medallion-kerros , jos dataputkistosi noudattaa medallion-arkkitehtuurin mallia, jossa data kulkee pronssin (raaka), hopean (puhdistettu) ja kultaisen (kuratoitu) vaiheiden läpi. Jokainen vaihtoehto säätää laskentaa kyseisen vaiheen luku- ja kirjoitusominaisuuksien mukaan.
| Käyttötapaus | Milloin kannattaa käyttää |
|---|---|
| Pronssi | Raakadatan vastaanotto, korkea kirjoitusnopeus, monipuoliset formaatit |
| Hopea | Puhdistus ja rikastutus, tasapainotettu luku/kirjoitus kohtalaisilla liitoksilla |
| Kulta | Aggregointi ja raportointi, lukemiseen optimoitu analytiikkaan ja Power BI:hen |
Tehtäväpohjainen
Valitse tehtäväpohjainen , jos työmääräsi ei noudata medallion-mallia tai jos sitä hallitsee yksittäinen käyttökuvio. Esimerkiksi käytä tätä vaihtoehtoa itsenäisille ETL-töille, interaktiivisille analyysivihkoille tai suoratoistoputkille.
| Käyttötapaus | Milloin kannattaa käyttää |
|---|---|
| Luku optimoitu | Lukutilaisuudet ja kyselyt, interaktiiviset muistikirjat |
| Kirjoitusoptimoitu | Suuren volyymin vastaanotto, ETL-putket, suoratoisto |
Automaattinen resurssiprofiilien päivitys
Resurssiprofiilit tukevat automaattista päivitystä, joka pitää Spark-laskentakokoonpanosi linjassa Fabric:n uusimpien optimointien kanssa. Kun automaattinen päivitys on käytössä, Fabric soveltaa työkuormakohtaisia Spark-ominaisuuksia resurssiprofiilityypin perusteella ilman manuaalista säätöä.
Automaattiset asetukset
Fabric tarjoaa kolme automaattista päivitysprofiilia, joista kukin on viritetty tietylle työkuormamallille:
Lukupainotteinen Spark-työkuormille
Aseta :spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate
{
"spark.databricks.delta.optimizeWrite.enabled": "true",
"spark.databricks.delta.optimizeWrite.partitioned.enabled": "true",
"spark.databricks.delta.optimizeWrite.binSize": "128"
}
Käytä tätä profiilia, kun työkuormasi on hallitseva Spark-lukulistoilla ja kohtuulliset kirjoitusoptimointitarpeet.
Lukupainotteinen Power BI-työkuormille
Aseta :spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate
{
"spark.sql.parquet.vorder.default": "true",
"spark.databricks.delta.optimizeWrite.enabled": "true",
"spark.databricks.delta.optimizeWrite.binSize": "1g"
}
Käytä tätä profiilia, kun datasi kulutetaan pääasiassa Power BI:n toimesta. V-järjestys on käytössä optimaalisen Direct Lake -suorituskyvyn takaamiseksi, ja suurempi bin-koko tuottaa vähemmän ja suurempia tiedostoja, jotka soveltuvat analyyttisiin lukuihin.
Kirjoituspainotteiset työkuormat
Aseta :spark.fabric.resourceProfile.writeHeavyAutoUpdate
{
"spark.sql.parquet.vorder.default": "false",
"spark.databricks.delta.optimizeWrite.binSize": "128",
"spark.databricks.delta.optimizeWrite.partitioned.enabled": "true"
}
Käytä tätä profiilia, kun työkuormasi on kirjoitusintensiivinen (esimerkiksi suuri määrä syöttöä tai ETL). V-järjestys on poistettu käytöstä kirjoituskuormituksen vähentämiseksi, ja optimoitu kirjoitus osiointien avulla on käytössä tehokkaan tiedostoasettelun takaamiseksi.
Miten automaattinen päivitys toimii
Kun käytössä on automaattinen päivitys sisältävä resurssiprofiili:
- Fabric valitsee sopivan automaattisen päivityksen konfiguraation ensisijaisen käyttötapauksen ja työkuormatyypin perusteella.
- Spark-ominaisuudet sovelletaan automaattisesti uusiin sessioihin työtilassa.
- Aktiiviset sessiot eivät vaikuta ennen kuin ne alkavat uudelleen.
Muistio
Automaattiset asetukset optimoivat Delta Laken kirjoituskäyttäytymisen ja tiedostoasettelun alkuperäisten profiilisyötteiden rajoissa. Ne eivät muuta poolin kokoa, solmujen konfiguraatiota tai automaattisen skaalauksen asetuksia.
Määritysviittaus
| Setting | Sovelletut ominaisuudet | Milloin kannattaa käyttää |
|---|---|---|
spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate |
Optimointi kirjoituskäytössä, osioitu kirjoitus, 128 MB bin koko | Lukupainotteinen Spark-analytiikka |
spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate |
V-järjestys käytössä, kirjoitusoptimointi, 1 GB bin-koko | Lukupainotteinen Power BI/DirectLake |
spark.fabric.resourceProfile.writeHeavyAutoUpdate |
V-järjestys pois päältä, optimoitu kirjoitus, 128 MB binin koko, osioitu | Kirjoituspainotteinen syöttö ja ETL |