Merk
Tilgang til denne siden krever autorisasjon. Du kan prøve å logge på eller endre kataloger.
Tilgang til denne siden krever autorisasjon. Du kan prøve å endre kataloger.
Delta-bordvedlikehold hjelper deg å holde bordene raske og lagringseffektive etter hvert som de vokser. Over tid kan Delta-tabeller akkumulere mange små filer, slettede data kan fortsette å bruke lagringsplass, og utdaterte statistikker kan redusere spørringseffektiviteten. Regelmessig vedlikehold hjelper deg å forbedre leseytelsen, gjenvinne lagring og holde tabellmetadata i tråd med hvordan arbeidslastene dine får tilgang til data. Bruk denne artikkelen som en rask guide til de viktigste vedlikeholdsoperasjonene som er tilgjengelige for Delta-tabeller.
Hvorfor vedlikehold er viktig
Etter hvert som Delta-tabeller vokser, endrer skriveaktivitet den fysiske utformingen av tabellen. Gjentatte inntastingsjobber kan lage mange små filer, oppdaterings- og sletteoperasjoner kan etterlate urefererte filer eller mykslettede rader, og eldre statistikker kan gjøre det vanskeligere for Spark å hoppe over unødvendige data. Hvis du vedlikeholder tabeller regelmessig, reduserer du overhead for skanninger, hjelper Fabric å optimalisere forespørsler mer effektivt, og unngår å betale for lagring som aktive bordversjoner ikke lenger trenger.
Bruk OPTIMIZE for bin-komprimering
Bruk OPTIMIZE når Delta-tabellen din har samlet mange små filer og du vil konsolidere dem til færre, større filer. Denne operasjonen forbedrer leseytelsen ved å redusere filhåndteringskostnader og gjøre skanningene mer effektive.
OPTIMIZE støtter også andre argumenter og egenskaper som VORDER. For full syntaks, alternativer og eksempler, se tabellkompaktering og V-orden.
Bruk VACUUM til opprydding i lagring
Bruk VACUUM når du vil fjerne urefererte datafiler som er eldre enn det konfigurerte lagringsvinduet. I Fabric hjelper denne operasjonen deg med å gjenerobre OneLake-lagring etter oppdateringer, slettinger, sammenslåinger, overskrivingsoperasjoner og komprimering.
VACUUM fokuserer på opprydding av lagring i stedet for spørringstuning, så det supplerer vanligvis andre vedlikeholdsoppgaver i stedet for å erstatte dem. For veiledning om oppbevaring og detaljer om gjennomføring, se VACUUM.
Bruk REORG for målrettet omorganisering
Bruk REORG når du trenger å omskrive tabellens tilstand for et spesifikt vedlikeholdsmål i stedet for generell filkomprimering. I Delta Lake REORG TABLE ... APPLY (PURGE) fjernes rader som slettevektorer er merket som slettet, fysisk. For de støttede alternativene og når du skal bruke dem, se Reorganize Delta-tabeller med REORG.
Bemerkning
REORG er vanligvis ikke nødvendig fordi OPTIMIZE den automatisk renser filer der mer enn 5% poster refereres til av slettingsvektorer.
Hold statistikken oppdatert
Fabric Spark Runtime støtter to typer statistikk på Delta-tabeller: filstatistikk og tabellstatistikk.
- Filstatistikk—Delta Lake registrerer min-, maks- og nulltallsverdier per fil for indekserte kolonner hver gang en datafil skrives. Spark-motoren bruker disse statistikkene til å hoppe over filer som ikke kan inneholde rader som matcher et spørringspredikat, noe som reduserer mengden data som skannes. Som standard samles statistikk inn for de første 32 kolonnene. For detaljer om hvordan filhopp fungerer og hvordan man kan tilpasse hvilke kolonner statistikk samles inn for, se Filhopp.
- Tabellstatistikk—Kolonnenivåstatistikk aggregert på tvers av alle filer i tabellen vedlikeholdes automatisk slik at Spark har bedre metadata for spørringsplanlegging. Disse statistikkene forbedrer ytelsen gjennom bedre optimaliseringsbeslutninger for filtre, joins og aggregeringer. For å lære hvordan automatiserte statistikker fungerer og hvordan du konfigurerer, se Automatiserte statistikker for Delta-tabeller.
Bruk autokomprimering for kontinuerlig filhåndtering
Delta Lake støtter også automatisk komprimering etter skriving, slik at tabellene kan forbli sunnere uten å kreve en separat manuell jobb hver gang. Du kan kontrollere denne oppførselen gjennom tabellegenskaper eller arbeidsområdeinnstillinger, avhengig av hvordan du håndterer Spark-arbeidsbelastningene dine. Se Auto kompaktering for detaljer om hvordan du aktiverer.
Kjør vedlikehold fra innsjøhusets brukergrensesnitt
Hvis du foretrekker en UI-basert arbeidsflyt, kan du kjøre vedlikeholdshandlinger direkte fra Lakehouse-utforskeren, se vedlikehold av Lakehouse-tabellen.
Følg en praktisk vedlikeholdsrytme
Kjør OPTIMIZE etter store batch-inntak eller når små filer begynner å hope seg opp og bremse lesingen. Kjør VACUUM på en regelmessig rytme, som ukentlig eller etter store komprimeringssykluser, for å hente tilbake lagring fra filer tabellen ikke lenger refererer til.
REORG TABLE ... APPLY (PURGE) er ikke nødvendig som rutinemessig vedlikehold fordi OPTIMIZE den automatisk fjerner filer der mer enn 5% poster refereres til av slettingsvektorer. Reserver PURGE for scenarier som krever eksplisitt kontroll, som for eksempel overholdelse eller GDPR-forpliktelser. Overvåk tabellens tilstand med DESCRIBE DETAIL og DESCRIBE HISTORY slik at du kan spore antall filer, størrelse og vedlikeholdshistorikk før og etter hver operasjon.
-- View current table state
DESCRIBE DETAIL table_name;
-- View history of transactions
DESCRIBE HISTORY table_name;