Bezserwerowe i klasyczne środowiska obliczeniowe dla potoków danych

Każdy potok usługi Lakeflow Pipelines wykonuje aktualizacje na bezserwerowych albo klasycznych zasobach obliczeniowych. Typ obliczeń to ustawienie konfigurowane oddzielnie dla każdego potoku, które wybierasz w ustawieniach potoku. To nie jest automatyczne: potok działa na bezserwerowych zasobach obliczeniowych tylko wtedy, gdy włączysz ustawienie Serverless, a w przeciwnym razie działa na klasycznych zasobach obliczeniowych. Ta strona porównuje obie opcje, abyś mógł wybrać odpowiednią dla każdego pipeline'u.

Databricks zaleca bezserwerowe zasoby obliczeniowe dla niemal wszystkich potoków danych. W trybie bezserwerowym platforma Azure Databricks zarządza infrastrukturą za użytkownika. Nie ma klastrów, dla których można by je powiększać, konfigurować, zabezpieczać czy przyznawać uprawnienia, a do tego otrzymujesz funkcje, których klasyczne obliczenia nie są w stanie zaoferować, takie jak odświeżanie inkrementalne i pionowe automatyczne skalowanie. W przypadku klasycznej mocy obliczeniowej odpowiadasz za skonfigurowanie i utrzymanie tej infrastruktury. Serverless obsługuje niemal wszystko, co obsługują klasyczne usługi obliczeniowe. Wyjątki to starszy metastore Hive oraz niektóre konfiguracje sieciowe. W przypadku większości potoków przetwarzania wybór klasycznych zasobów obliczeniowych wiąże się z koniecznością ręcznego wykonywania zadań, które w przeciwnym razie obsłużyłby model serverless.

Important

Odświeżanie inkrementalne zmaterializowanych widoków jest dostępne tylko w potokach bezserwerowych. Zmaterializowane widoki działające na klasycznym obliczeniu są zawsze w pełni przeliczane. Jeśli odświeżanie przyrostowe jest wymagane dla danego obciążenia, użyj obliczeń bezserwerowych. Zobacz Odświeżanie przyrostowe, aby uzyskać zmaterializowane widoki.

Porównaj opcje obliczeniowe

Poniższa tabela porównuje bezserwerowe i klasyczne modele obliczeniowe pod względem możliwości, które najczęściej wpływają na wybór:

Capability Serverless Classic
Zarządzanie infrastrukturą Azure Databricks zarządza całą infrastrukturą. Nie ma konfiguracji klastra. Musisz skonfigurować klastry, w tym automatyczne skalowanie, typy instancji i polityki klastrów.
Odświeżanie przyrostowe dla widoków zmaterializowanych Supported. Widoki materializowane są odświeżane przyrostowo zawsze, gdy jest to opłacalne, aby obniżyć koszty przetwarzania. Zobacz Odświeżanie przyrostowe, aby uzyskać zmaterializowane widoki. Niewspierane. Zmaterializowane widoki są zawsze w pełni przetwarzane.
Autoscaling Ulepszone automatyczne skalowanie, które skaluje się poziomo (więcej wykonawców) i pionowo (większe wykonawcy). Zobacz Optymalizowanie wykorzystania klastra pipeline’u Lakeflow za pomocą automatycznego skalowania. Ulepszone automatyczne skalowanie, które skaluje się poziomo. Wybierasz typy instancji.
Rurociągi strumieniowe Włączone domyślnie. Mikropaczki są przetwarzane równolegle, aby zwiększyć przepustowość i zmniejszyć opóźnienia. Zobacz Jak skonfigurować potok bezserwerowy. Niedostępne.
Uprawnienie do tworzenia zasobów obliczeniowych Niewymagane. Wszyscy użytkownicy przestrzeni roboczych mogą domyślnie uruchamiać potoki bezserwerowe. Required. Użytkownicy potrzebują nieograniczonego dostępu do tworzenia klastrów lub dostępu do polityki obliczeniowej.
Zasady obliczeniowe i typy instancji Zarządzane przez Azure Databricks. Nie ustawiasz typów instancji ani polityki obliczeniowej. Ręcznie stosujesz politykę obliczeniową i wybierasz typy instancji pracowników i sterowników.
Katalog Unity Zawsze używa Unity Catalog. Można użyć Unity Catalog lub starszego magazynu metadanych Hive.
Przypisywanie kosztów Zastosuj niestandardowe tagi z zasadami użytkowania serverless. Stosuj niestandardowe tagi do pipeline. Musisz ręcznie połączyć dane tagów z danymi rozliczeniowymi.
Klastry aktualizacji i konserwacji Zarządzane przez Azure Databricks. Konfigurujesz klastry aktualizacji i konserwacji osobno.
Obliczenia na pojedynczym węźle Nie są potrzebne. Usługa Azure Databricks automatycznie dobiera zasoby obliczeniowe do obciążenia. Konfigurujesz obliczenia pojedynczych węzłów dla małych lub nierozproszonych obciążeń.

Kiedy używać przetwarzania bezserwerowego

Użyj obliczeń serwerless dla każdego pipeline'a, który nie spełnia jednego z klasycznych ograniczeń dostępnych tylko w poniższym zakresie. W szczególności serwerless jest właściwym wyborem, gdy:

  • Chcesz, aby Azure Databricks zarządzał infrastrukturą za Ciebie, w tym pionowym autoskalowaniem i wyborem instancji, zamiast samodzielnie konfigurować i utrzymywać klastry.
  • Chcesz używać odświeżania przyrostowego w przypadku zmaterializowanych widoków, aby zmniejszyć koszty odświeżania.
  • Chcesz, aby użytkownicy obszaru roboczego mogli uruchamiać potoki bez uprawnień do tworzenia klastrów.

Potoki bezserwerowe wymagają obszaru roboczego z włączonym Unity Catalog oraz regionu z obsługą bezserwerowości. Aby uzyskać wymagania i konfigurację, zobacz Konfiguruj pipeline bez serwera.

Kiedy używać klasycznego obliczenia

Serverless obsługuje niemal każde obciążenie pipeline, więc używaj klasycznego compute tylko wtedy, gdy serverless w ogóle nie może uruchomić pipeline:

  • Twoje tabele korzystają z przestarzałego metastore Hive zamiast Unity Catalog. Aby przenieść tabele metastore Hive do Unity Catalog i włączyć tryb bezserwerowy, zobacz Uaktualnianie tabel i widoków Hive do Unity Catalog.
  • Twój pipeline wymaga prywatnej sieci, której serwerless nie obsługuje.
  • Twój pipeline działa w regionie, gdzie serwerless nie jest dostępny.

W przypadku klasycznych zasobów obliczeniowych to Ty konfigurujesz i utrzymujesz zasady obliczeniowe, typy instancji, jednowęzłowe zasoby obliczeniowe oraz oddzielne klastry aktualizacji i konserwacji — pracę tę w rozwiązaniu bezserwerowym wykonuje się za Ciebie.

Informacje o opcjach instalacji i konfiguracji znajdziesz w artykule Konfigurowanie klasycznych zasobów obliczeniowych dla potoków.

Ustaw typ obliczeniowy

Typ obliczeń wybierasz w ustawieniach obliczeń pipeline, włączając lub wyłączając ustawienie Serverless . Nowe potoki domyślnie korzystają z serverless. Możesz także przekonwertować istniejący potok skonfigurowany przy użyciu Unity Catalog na tryb bezserwerowy.

Dodatkowe zasoby