Muistiinpano
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää kirjautua sisään tai vaihtaa hakemistoa.
Tämän sivun käyttö edellyttää valtuutusta. Voit yrittää vaihtaa hakemistoa.
Delta Lake MERGE -komento mahdollistaa käyttäjien päivittää Delta-taulukon edistyneillä ehdoilla. Se voi päivittää tietoja lähdetaulukosta, näkymästä tai DataFrame-kehyksestä kohdetaulukkoon komennon avulla MERGE . Nykyistä algoritmia ei kuitenkaan ole täysin optimoitu muokkaamattomien rivien käsittelyyn. Vähäisen sekoittamisen yhdistämisoptimoinnin vuoksi muokkaamattomat rivit jätetään pois kalliista sekoitustoiminnosta, jota tarvitaan täsmäytettyjen rivien päivittämiseen.
Muistio
Matalan sekoittamisen yhdistäminen on käytettävissä oletusarvoisesti käytettävissä kaikissa Fabric Spark-suorituspalveluissa, mikä parantaa merkittävästi MERGE toimintojen suorituskykyä.
Miksi sekoitusta on käytettävä vähän?
Tällä hetkellä MERGE toimintoa tehdään kahdella liittämällä suoritusta. Ensimmäinen liittyminen käyttää koko kohdetaulukkoa ja lähdetietoja löytääkseen luettelon kohdetaulukon kosket arvoista tiedostoista, mukaan lukien vastaavat rivit. Sen jälkeen se suorittaa toisen liitoslukemisen vain kosketettuihin tiedostoihin ja lähdetietoihin todellisen taulukkopäivityksen tekemiseksi. Vaikka ensimmäinen liitos on vähentää toisen liitoksen tietojen määrää, koskettomissa tiedostoissa voi silti olla valtava määrä muokkaamattomia rivejä. Ensimmäinen liitoskysely on kevyempi, koska se lukee vain sarakkeet annetussa vastaavassa ehdossa. Toisen taulukkopäivityksen on ladattava kaikki sarakkeet, mikä aiheuttaa kalliin sekoitusprosessin.
Vähäisen sekoittamisen yhdistämisoptimoinnin ansiosta Delta pitää vastaavan rivin tuloksen ensimmäisestä liitoksesta tilapäisesti ja käyttää sitä toisessa liitokseen. Tuloksen perusteella se jättää muokkaamattomat rivit pois raskaasta sekoitusprosessista. Vastaaville riveille ja muokkaamattomille riveille olisi kaksi erillistä kirjoitustyötä, joten tulostiedostoja voi olla kaksi kertaa enemmän kuin edellisessä suhteessa. Odotettu suorituskyky on kuitenkin suurempi kuin mahdollisten pienten tiedostojen ongelma.
Vähäisen sekoituksen yhdistämisen edut
- Koskemattomien tiedostojen muokkaamattomat rivit käsitellään erikseen. Varsinaisia MERGE-toimintoja ei käytetä. Se voi säästää MERGE-kokonaissuoritusaikaa ja käsittelyresursseja. Voitto olisi suurempi, kun useita rivejä kopioidaan ja vain muutama rivi päivitetään.
- Rivijärjestykset säilytetään muokkaamattomille riveille. Siksi muokkaamattomien rivien tulostiedostot voivat olla edelleen tehokkaita tietojen ohittamisessa, jos tiedosto lajiteltiin tai Z-ORDERED.
- Tässä olisi pieni yleiskuormitys jopa pahimmassa tapauksessa, kun MERGE-ehto vastaa kaikkia koskettamien tiedostojen rivejä.
Pienen sekoituksen yhdistämisen ottaminen käyttöön ja poistaminen käytöstä
Matalan sekoituksen yhdistäminen on oletusarvoisesti käytössä Spark-istunnon määrityksenä: