architektura pamięci

Usługa Lakebase oddziela magazyn od zasobów obliczeniowych. Dane bazy danych są przechowywane w warstwie magazynu rozproszonego zarządzanej przez usługę Databricks niezależnie od wystąpień obliczeniowych, które uruchamiają zapytania. Pamięć masowa zachowuje trwałość i wysoką dostępność niezależnie od tego, czy zasoby obliczeniowe są uruchomione, wstrzymane czy skalowane.

Aby uzyskać przegląd współpracy warstw obliczeniowej i pamięci masowej, w tym sejfów i serwerów stron, zobacz architekturę Lakebase.

Architektura pamięci masowej pokazująca warstwę obliczeniową połączoną z rozproszoną pamięcią masową z nadmiarowością strefową, której dane są zapisywane w magazynie obiektów w chmurze zarządzanym przez Databricks.

Note

Na platformie Azure usługa Lakebase trwale zapisuje dane w usłudze Azure Blob Storage jako warstwie magazynu obiektów w chmurze. W zależności od regionu stosowane jest magazynowanie lokalnie nadmiarowe (LRS) lub magazynowanie strefowo nadmiarowe (ZRS). LRS replikuje dane w wielu kopiach w obrębie jednego centrum danych, zapewniając wysoką trwałość danych w regionie. ZRS replikuje dane w wielu strefach dostępności. Databricks zarządza warstwą nadmiarowości pamięci masowej. Nie można go konfigurować przez klienta.

Warstwa przechowywania

Usługa Lakebase używa architektury magazynu rozproszonego. Żadna maszyna nie przechowuje stanu autorytatywnego bazy danych. Lakebase również przechowuje dane do chmurowego magazynowania obiektów zarządzanego przez Databricks, będącego podstawą trwałości całej warstwy pamięci. Przechowywanie obiektów w chmurze jest zaprojektowane z myślą o bardzo wysokiej trwałości i nie opiera się na asynchronicznej replikacji, więc opóźnienie replikacji nie wpływa na trwałość. Azure Databricks zarządza konfiguracją redundancji pamięci masowej.

Na platformie Azure usługa Lakebase trwale zapisuje dane w usłudze Azure Blob Storage jako warstwie magazynu obiektów w chmurze.

Nadmiarowość magazynu jest niezależna od wysokiej dostępności zasobów obliczeniowych

Azure Databricks zarządza redundancją i dostępnością pamięci Lakebase niezależnie od ustawień wysokiej dostępności (HA). Włączenie lub wyłączenie wysokiej dostępności (HA) nie wpływa na nadmiarowość pamięci masowej.

Wysoka dostępność to funkcja warstwy obliczeniowej. Z wyprzedzeniem udostępnia pomocniczą instancję obliczeniową w oddzielnej strefie dostępności na potrzeby automatycznego przełączenia awaryjnego. Nadmiarowość magazynu i wysoka dostępność zasobów obliczeniowych to niezależne warstwy.

Charakterystyczny Redundancja magazynowa Wysoka dostępność zasobów obliczeniowych (HA)
Mandatory Yes No
Możliwe do skonfigurowania przez klienta No Yes
Co chroni Trwałość i dostępność danych Możliwość wykonywania zapytań

Porównanie obok siebie pokazujące, że nadmiarowość pamięci masowej pozostaje bez zmian niezależnie od tego, czy HA warstwy obliczeniowej jest wyłączone, czy włączone.

Jak separacja magazynu umożliwia korzystanie z innych funkcji

Rozdzielenie magazynu z zasobów obliczeniowych umożliwia korzystanie z kilku funkcji usługi Lakebase:

  • Brak utraty danych (RPO = 0): Ponieważ Lakebase trwale rejestruje każdą zadeklarowaną transakcję na warstwie pamięci masowej przed jej potwierdzeniem, nie tracisz żadnych zobowiązanych danych, gdy obliczenia zawodzą, restartują, skalują się do zera lub przechodzą do awaryjnego overu.
  • Błyskawiczne gałęzie: Lakebase tworzy gałęzie z wykorzystaniem mechanizmu copy-on-write we współdzielonej pamięci masowej. Proces nie duplikuje żadnych danych.
  • Repliki do odczytu: Wiele instancji obliczeniowych odczytuje dane z tej samej współdzielonej warstwy pamięci masowej. Takie podejście nie wymaga replikacji danych.
  • Skalowanie do zera: Obliczenia są wstrzymywane, ale pamięć masowa pozostaje zachowana. Dane są natychmiast dostępne po wznowieniu obliczeń.
  • Szybkie przejście w tryb failover: Ponieważ magazyn jest oddzielony od zasobów obliczeniowych, tryb failover nie obejmuje przenoszenia danych. Lakebase awansuje pomocniczą instancję obliczeniową, która łączy się z istniejącą pamięcią masową.
  • Wysoka dostępność: Skonfiguruj nadmiarowość na poziomie zasobów obliczeniowych, aby umożliwić automatyczne przełączanie awaryjne między strefami dostępności. Zobacz Wysoka dostępność.
  • Zarządzaj wysoką dostępnością: Włącz i skonfiguruj ustawienie HA dla zasobów obliczeniowych w swoim punkcie końcowym. Zobacz Zarządzanie wysoką dostępnością.
  • Gałęzie bazy danych: Dowiedz się, jak gałęzie wykorzystują mechanizm copy-on-write do tworzenia natychmiastowych, odizolowanych środowisk. Zobacz Gałęzie.
  • Repliki do odczytu: Dodaj wystąpienia obliczeniowe tylko do odczytu, które odczytują z tej samej warstwy magazynu bez replikacji danych. Zobacz Repliki do odczytu.