Määritä resurssiprofiilit Microsoft Fabricissa

Koskee:✅ Fabric-data-insinöörit ja datatiede

Fabric Data Engineeringin resurssiprofiilit auttavat sinua saamaan optimoidut Spark-laskentakonfiguraatiot ilman manuaalista säätöä. Kuvailet työkuormaasi valitsemalla ensisijaisen käyttötapauksen, datamäärän ja muutaman muun korkean tason syötteen. Fabric luo sitten suositellun konfiguraation — mukaan lukien solmukoot, automaattiskaalausasetukset ja ajonaikainen versio — todistettujen parhaiden käytäntöjen ja sisäisten suorituskykytietojen pohjalta.

Miksi käyttää resurssiprofiileja

Resurssiprofiilit tarjoavat:

  • Optimoitu alusta alkaen: Ensimmäinen Spark-istuntosi toimii laskentateholla, joka on viritetty työkuormaasi varten — iteratiivista vertailua ei tarvita.
  • Johdonmukaisuus: Kaikki Spark-työt työtilassa jakavat saman suorituskykyyn säädetyn konfiguraation.
  • Parempi hinta-suorituskyky: Oikean kokoiset resurssit vähentävät hukkaa ja parantavat läpimenoa.
  • Alhaisempi operatiivinen ylikuormitus: Vähemmän virityssyklejä ja vähemmän tukieskalaatioita.

Edellytykset

Resurssiprofiilien konfigurointiin sinulla täytyy olla työtilan ylläpitäjän rooli.

Määritä resurssiprofiili

Resurssiprofiilin konfigurointi työtilallesi:

  1. Mene työtilaasi ja valitse Työtilan asetukset.

  2. Laajenna Data Engineering/Science vasemmasta ruudusta ja valitse sitten Spark settings.

  3. Saadaksesi suositellun laskentakonfiguraation resurssien käytön optimoimiseksi, valitse Optimoi käyttötapauksellesi kohdasta Aloita.

    Kuvakaappaus, jossa näkyy aloituspainike Optimoi käyttötapauksellesi Spark-asetuksissa.

  4. Optimoi käyttötapauksellesi -sivulla anna seuraavat syötteet:

    • Ensisijainen käyttötapaus: Valitse joko Medallion-kerros tai Tehtäväpohjainen, ja valitse sitten tietty vaihtoehto pudotusvalikosta. Medallion-kerrosvaihtoehdot ovat pronssi, hopea tai kulta. Tehtäväpohjaiset vaihtoehdot ovat joko luku- tai kirjoitusoptimoituja. Ohjeita käyttötapauksen valintaan löytyy kohdasta Ensisijainen käyttötapaviite.
    • Tyypillinen datavolyymi: Valitse tilavuus pudotusvalikosta: enintään 1 GB, 10 GB, 100 GB, 1 TB tai yli 1 TB.
    • Maksimikapasiteettiyksiköt (CU): Käytä liukusäädintä asettaaksesi Spark-poolin maksimi-CU-raja.
  5. Valitse Hanki suositus.

    Kuvakaappaus, jossa näkyy painike suositusten saamiseksi.

    Fabric luo optimoidun konfiguraation syötteidesi perusteella.

  6. Tarkista suositus. Suositus sisältää arvot kahdelle kategorialle:

    • Kipinäpooli: Poolin tyyppi, solmuperhe, solmujen koko, automaattinen skaalaus ja dynaamisen toimeenpanijan allokaatio.
    • Ympäristö: Ajonaikainen versio, Spark-ajurin ytimet ja muisti, Spark-suoritusohjelman ytimet, muisti ja instanssit.

    Kuvakaappaus, jossa on suositeltu asetus valitulle käyttötapaukselle, mukaan lukien resurssiprofiili, solmuasetukset ja ajonaikainen versio.

    Jos haluat säätää syötteitäsi, valitse taaksepäin oleva nuoli palataksesi edelliselle sivulle, päivitä valinnat ja valitse sitten Haku suositus uudelleen.

  7. Syötä Spark-poolin nimi ja ympäristö konfiguraatiota varten, valitse sitten Apply tallentaaksesi sen työtilaan.

    Kuvakaappaus, jossa näkyy painike suositusten soveltamiseen.

Kun olet soveltanut resurssiprofiilia, Fabric luo mukautetun Spark-poolin suositelluilla asetuksilla.

Muistio

Jos työtilassasi ei vielä ole mukautettua poolia, uusi pooli asetetaan automaattisesti oletuspooliksi työtilalle. Jos työtilassasi on jo oletuspooli, sinun täytyy vaihtaa manuaalisesti uuteen pooliin Spark-työtilan asetuksista. Aktiiviset istunnot eivät vaikuta ennen kuin ne käynnistetään uudelleen.

Ensisijainen käyttötapaviite

Käytä seuraavia ohjeita valitaksesi oikean ensisijaisen käyttötapauksen syötteen, kun määrität resurssiprofiilin:

Medallionkikerros

Valitse Medallion-kerros , jos dataputkistosi noudattaa medallion-arkkitehtuurin mallia, jossa data kulkee pronssin (raaka), hopean (puhdistettu) ja kultaisen (kuratoitu) vaiheiden läpi. Jokainen vaihtoehto säätää laskentaa kyseisen vaiheen luku- ja kirjoitusominaisuuksien mukaan.

Käyttötapaus Milloin kannattaa käyttää
Pronssi Raakadatan vastaanotto, korkea kirjoitusnopeus, monipuoliset formaatit
Hopea Puhdistus ja rikastutus, tasapainotettu luku/kirjoitus kohtalaisilla liitoksilla
Kulta Aggregointi ja raportointi, lukemiseen optimoitu analytiikkaan ja Power BI:hen

Tehtäväpohjainen

Valitse tehtäväpohjainen , jos työmääräsi ei noudata medallion-mallia tai jos sitä hallitsee yksittäinen käyttökuvio. Esimerkiksi käytä tätä vaihtoehtoa itsenäisille ETL-töille, interaktiivisille analyysivihkoille tai suoratoistoputkille.

Käyttötapaus Milloin kannattaa käyttää
Luku optimoitu Lukutilaisuudet ja kyselyt, interaktiiviset muistikirjat
Kirjoitusoptimoitu Suuren volyymin vastaanotto, ETL-putket, suoratoisto

Automaattinen resurssiprofiilien päivitys

Resurssiprofiilit tukevat automaattista päivitystä, joka pitää Spark-laskentakokoonpanosi linjassa Fabric:n uusimpien optimointien kanssa. Kun automaattinen päivitys on käytössä, Fabric soveltaa työkuormakohtaisia Spark-ominaisuuksia resurssiprofiilityypin perusteella ilman manuaalista säätöä.

Automaattiset asetukset

Fabric tarjoaa kolme automaattista päivitysprofiilia, joista kukin on viritetty tietylle työkuormamallille:

Lukupainotteinen Spark-työkuormille

Aseta :spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate

{
    "spark.databricks.delta.optimizeWrite.enabled": "true",
    "spark.databricks.delta.optimizeWrite.partitioned.enabled": "true",
    "spark.databricks.delta.optimizeWrite.binSize": "128"
}

Käytä tätä profiilia, kun työkuormasi on hallitseva Spark-lukulistoilla ja kohtuulliset kirjoitusoptimointitarpeet.

Lukupainotteinen Power BI-työkuormille

Aseta :spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate

{
    "spark.sql.parquet.vorder.default": "true",
    "spark.databricks.delta.optimizeWrite.enabled": "true",
    "spark.databricks.delta.optimizeWrite.binSize": "1g"
}

Käytä tätä profiilia, kun datasi kulutetaan pääasiassa Power BI:n toimesta. V-järjestys on käytössä optimaalisen Direct Lake -suorituskyvyn takaamiseksi, ja suurempi bin-koko tuottaa vähemmän ja suurempia tiedostoja, jotka soveltuvat analyyttisiin lukuihin.

Kirjoituspainotteiset työkuormat

Aseta :spark.fabric.resourceProfile.writeHeavyAutoUpdate

{
    "spark.sql.parquet.vorder.default": "false",
    "spark.databricks.delta.optimizeWrite.binSize": "128",
    "spark.databricks.delta.optimizeWrite.partitioned.enabled": "true"
}

Käytä tätä profiilia, kun työkuormasi on kirjoitusintensiivinen (esimerkiksi suuri määrä syöttöä tai ETL). V-järjestys on poistettu käytöstä kirjoituskuormituksen vähentämiseksi, ja optimoitu kirjoitus osiointien avulla on käytössä tehokkaan tiedostoasettelun takaamiseksi.

Miten automaattinen päivitys toimii

Kun käytössä on automaattinen päivitys sisältävä resurssiprofiili:

  1. Fabric valitsee sopivan automaattisen päivityksen konfiguraation ensisijaisen käyttötapauksen ja työkuormatyypin perusteella.
  2. Spark-ominaisuudet sovelletaan automaattisesti uusiin sessioihin työtilassa.
  3. Aktiiviset sessiot eivät vaikuta ennen kuin ne alkavat uudelleen.

Muistio

Automaattiset asetukset optimoivat Delta Laken kirjoituskäyttäytymisen ja tiedostoasettelun alkuperäisten profiilisyötteiden rajoissa. Ne eivät muuta poolin kokoa, solmujen konfiguraatiota tai automaattisen skaalauksen asetuksia.

Määritysviittaus

Setting Sovelletut ominaisuudet Milloin kannattaa käyttää
spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate Optimointi kirjoituskäytössä, osioitu kirjoitus, 128 MB bin koko Lukupainotteinen Spark-analytiikka
spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate V-järjestys käytössä, kirjoitusoptimointi, 1 GB bin-koko Lukupainotteinen Power BI/DirectLake
spark.fabric.resourceProfile.writeHeavyAutoUpdate V-järjestys pois päältä, optimoitu kirjoitus, 128 MB binin koko, osioitu Kirjoituspainotteinen syöttö ja ETL