Usługi analityczne w usługach Azure i AWS

W tym artykule porównaliśmy usługi analityczne w usługach Amazon Web Services (AWS) i Azure. Obejmuje pozyskiwanie i orkiestrację danych, jeziora danych, przetwarzanie wsadowe, hurtownie danych, przetwarzanie strumieniowe, zarządzanie danymi, udostępnianie oraz business intelligence.

Aby uzyskać informacje o operacyjnych magazynach danych relacyjnych i nierelacyjnych, zobacz Usługi bazy danych na platformie Azure i AWS. Informacje o usługach uczenia maszynowego i usługach AI dla aplikacji można znaleźć w artykule Usługi AI i uczenia maszynowego na platformach Azure i AWS.

Podejścia platformowe

Platforma AWS udostępnia poszczególne usługi analityczne, które można tworzyć w rozwiązaniu. Microsoft Fabric zapewnia zintegrowane obciążenia robocze Data Factory, inżynierii danych, Data Warehouse, Real-Time Intelligence, nauki o danych i Power BI na platformie OneLake. Azure również udostępnia autonomiczne usługi, w tym Azure Data Factory, Azure Databricks, Azure Event Hubs, Azure Stream Analytics i Azure Data Explorer.

Zintegrowana platforma nie jest automatycznie właściwym wyborem dla każdego obciążenia. Porównaj obsługę źródeł i formatów, wymagane mechanizmy i interfejsy API, izolację sieci, dostępność regionalną, granice nadzoru, kontrolę operacyjną, istniejące umiejętności i ceny. Pojemność usługi Fabric jest współdzielona między obciążeniami Fabric, podczas gdy samodzielne usługi Azure mają własne modele pojemnościowe i rozliczeniowe.

Integracja i aranżacja danych

Usługi integracji danych umożliwiają pozyskiwanie, kopiowanie, przekształcanie i organizowanie danych w systemach operacyjnych i magazynach analitycznych.

Usługa AWS usługa Azure Wskazówki dotyczące wyboru
AWS Glue Usługa Data Factory w Microsoft Fabric lub Azure Data Factory Wszystkie trzy zapewniają integrację danych zarządzanych. Porównaj łączniki, silniki transformacji, sieci prywatne, lokalizację środowiska uruchomieniowego, funkcje orkiestracji oraz integrację z docelową platformą analityczną.
Przepływy pracy zarządzane przez usługę Amazon dla systemu Apache Airflow Zadania systemu Apache Airflow w Microsoft Fabric Oba uruchamiają przepływy pracy Apache Airflow. Zweryfikuj obsługiwane wersje systemu Airflow, instalację pakietów, sieć, tożsamość, skalowanie i wymagania dotyczące migracji.
AWS Database Migration Service Azure Database Migration Service lub Fabric Asystent migracji dla Data Warehouse Te narzędzia mają różne zakresy. Użyj usługi Azure Database Migration Service w przypadku obsługiwanych par źródło-docelowa baza danych. Użyj Fabric Asystent migracji, aby przenieść obsługiwane schematy i dane SQL do Fabric Data Warehouse.
Przepływ aplikacji Amazon Łączniki usługi Data Factory lub Azure Logic Apps Użyj usługi Data Factory do pozyskiwania i przekształcania danych na potrzeby analiz. Użyj usługi Logic Apps na potrzeby integracji aplikacji i procesów biznesowych. Sprawdź operacje łącznika, uwierzytelnianie oraz wymagania dotyczące wolumenu danych.

Magazyny data lake i lakehouse

Amazon S3 często stanowi warstwę pamięci masowej dla jezior danych AWS. W Azure Azure Data Lake Storage zapewnia magazyn obiektów z hierarchiczną przestrzenią nazw. OneLake jest logicznym jeziorem danych wbudowanym w platformę Microsoft Fabric.

Usługa AWS usługa Azure Wskazówki dotyczące wyboru
Amazon S3 Azure Data Lake Storage Oba zapewniają trwały magazyn obiektów na potrzeby danych analitycznych. Porównanie zachowania przestrzeni nazw, zabezpieczeń, zarządzania cyklem życia, replikacji, integracji ekosystemu i kosztów transferu danych.
Amazon S3 Microsoft OneLake OneLake jest częścią platformy Fabric i zapewnia współdzielony magazyn danych dla obciążeń roboczych platformy Fabric. OneLake nie jest uniwersalnym zamiennikiem dla wszystkich obciążeń S3. Użyj rozwiązania Fabric, jeśli jest ono platformą analityczną, a jego pojemność, region, zabezpieczenia i model obciążenia spełniają Twoje wymagania.
Tworzenie jeziora AWS Zabezpieczenia usługi OneLake i Microsoft Purview w usłudze Fabric Usługa AWS Lake Formation zarządza dostępem do magazynów danych opartych na usłudze S3. Fabric oddziela uprawnienia magazynowania, uprawnienia elementów i funkcje nadzoru. Przełóż wymagania dotyczące autoryzacji i zarządzania, zamiast zakładać, że istnieje odpowiednik w postaci jednej usługi.
Dane zewnętrzne usługi Amazon S3 Skróty OneLake Skróty odwołują się do obsługiwanych danych w usługach S3, Azure Data Lake Storage, Google Cloud Storage i innych lokalizacjach bez kopiowania. Zamiast tego używaj przenoszenia danych, gdy potrzebujesz złożonych przekształceń, niestandardowego planowania lub miejsca docelowego poza usługą OneLake.

Inżynieria danych wsadowa

Usługa AWS usługa Azure Wskazówki dotyczące wyboru
Amazon EMR Azure Databricks Obie obsługują zarządzane obciążenia platformy Apache Spark i inne obciążenia inżynierii danych. Porównaj zgodność środowisk uruchomieniowych, zarządzanie klastrem, automatyczne skalowanie, nadzór, notesniki, zadania i integracje z ekosystemem.
Amazon EMR i interaktywne sesje AWS Glue Fabric Inżynieria danych Inżynieria danych w usłudze Fabric oferuje zarządzaną usługę Spark, notesniki, środowiska i zadania zintegrowane z usługą OneLake. Nie jest to bezpośredni zamiennik każdej struktury EMR ani konfiguracji klastra. Zweryfikuj wymagania dotyczące środowiska uruchomieniowego, biblioteki, sieci i wydajności.
AWS Glue Studio Fabric Data Factory lub Azure Data Factory Te usługi zapewniają wizualne i oparte na kodzie środowiska przekształcania danych. Wybierz na podstawie silnika transformacji, orkiestracji, obsługi źródeł i miejsc docelowych oraz modelu operacyjnego.

Magazyny danych i analiza SQL

Usługa AWS usługa Azure Wskazówki dotyczące wyboru
Amazon Redshift Fabric Data Warehouse Oba zapewniają rozproszone magazyny danych SQL. Porównaj zgodność z SQL, izolację obciążeń, skalowanie, ładowanie danych, udostępnianie danych, współbieżność, nadzór i cennik. Fabric Data Warehouse działa w oparciu o usługę OneLake i wykorzystuje pojemność usługi Fabric.
Amazon Redshift Azure Databricks SQL Rozważ Azure Databricks SQL, gdy obciążenie korzysta z architektury lakehouse, a usługa Databricks jest podstawową platformą danych. Nie jest to zamiennik silnika relacyjnego dla każdego zastosowania w Redshift.
Amazon Redshift Spectrum Fabric lakehouse, OneLake shortcuts i Direct Lake Usługa Redshift Spectrum wysyła zapytania o dane w usłudze S3. Fabric zapewnia oddzielne możliwości magazynu, obliczeń i semantyki modelu. Direct Lake wymaga obsługiwanych tabel Delta oraz pojemności usługi Fabric. Sprawdź formaty źródłowe i limity pojemności.
Amazon Aten punkt końcowy analizy SQL usługi Fabric lakehouse lub Azure Databricks SQL Athena to bezserwerowa usługa SQL dla danych przechowywanych w usłudze S3. Opcje platformy Azure różnią się pod względem magazynu, metadanych, mocy obliczeniowej i rozliczeń. Wybierz na podstawie lokalizacji danych, zgodności z SQL, opóźnień, współbieżności i nadzoru.

Analiza w czasie rzeczywistym

Oddziel przyjmowanie zdarzeń od przetwarzania strumieniowego i analitycznego magazynu danych podczas porównywania usług. Punkt końcowy zgodny z platformą Kafka nie zapewnia każdej funkcji brokera platformy Apache Kafka.

Usługa AWS usługa Azure Wskazówki dotyczące wyboru
Strumienie danych Amazon Kinesis Azure Event Hubs Oba przyjmują i przechowują strumienie zdarzeń o wysokiej przepustowości dla niezależnych odbiorców. Porównanie partycjonowania, przechowywania, odtwarzania, przepływności, protokołów i skalowania.
Amazon Managed Service for Apache Flink Azure Stream Analytics lub strumienie zdarzeń Fabric Te usługi przetwarzają strumienie, ale używają różnych języków i modeli wykonywania. Usługa Stream Analytics używa języka zapytań opartego na języku SQL. Strumienie zdarzeń w usłudze Fabric umożliwiają pozyskiwanie danych, transformacje bez użycia kodu oraz kierowanie w ramach usługi Fabric.
Przesyłanie strumieniowe zarządzane przez usługę Amazon dla platformy Apache Kafka Usługa Event Hubs dla platformy Apache Kafka Usługa Amazon MSK uruchamia platformę Apache Kafka typu open source. Usługa Event Hubs udostępnia punkt końcowy zgodny z platformą Kafka i nie jest klastrem platformy Apache Kafka. Zweryfikuj funkcje protokołu, transakcje, kompresję, obsługę strumieni platformy Kafka, przechowywanie, limity przydziału i wymagania dotyczące warstw.
Usługa Amazon OpenSearch Azure Data Explorer lub Fabric Eventhouse Użyj Azure Data Explorer lub Eventhouse do analizy dzienników, telemetrii i szeregów czasowych za pomocą języka zapytań Kusto. Usługa OpenSearch udostępnia również funkcje wyszukiwania pełnotekstowego, więc te usługi nie są kompletnymi zamiennikami obciążeń wyszukiwania.
Amazon Timestream Azure Data Explorer lub Fabric Eventhouse Te usługi obsługują analizę szeregów czasowych. Porównaj protokoły pozyskiwania danych, język zapytań, retencję danych, warstwowanie danych, sposób obsługi aktualizacji oraz wymagania integracyjne.

Analiza biznesowa i udostępnianie danych

Usługa AWS usługa Azure Wskazówki dotyczące wyboru
Amazon QuickSight Power BI Obie zapewniają modelowanie semantyczne, raporty, pulpity nawigacyjne, udostępnianie i osadzoną analizę. Porównaj wymagania dotyczące licencjonowania, pojemności, tożsamości, nadzoru, tworzenia i osadzania.
Grafana zarządzana przez Amazon Azure Managed Grafana Obie oferują zarządzaną usługę Grafana. Porównanie integracji ze źródłem danych, uwierzytelniania, sieci prywatnej, wysokiej dostępności, wtyczek i warstw cenowych.
Wymiana danych platformy AWS Microsoft Marketplace i zewnętrzne udostępnianie danych w usłudze Fabric Usługa AWS Data Exchange łączy platformę handlową danych z dostarczaniem. Microsoft Marketplace i udostępnianie danych w usłudze Fabric dotyczą różnych części tego przepływu pracy. Zewnętrzne udostępnianie danych w usłudze Fabric umożliwia kontrolowany dostęp między dzierżawcami do obsługiwanych elementów platformy Fabric, ale nie jest platformą wymiany danych.

Zarządzanie danymi

Microsoft Purview i połączenie usług AWS zapewniają funkcje odkrywania danych, klasyfikacji, śledzenia pochodzenia danych, zarządzania dostępem i zgodności. AWS często łączy Glue Data Catalog, Lake Formation, Amazon Macie, AWS Identity and Access Management oraz AWS Config. Microsoft Purview zapewnia ujednolicony katalog i funkcje nadzoru dla obsługiwanych źródeł w środowiskach Azure, Fabric, lokalnych, wielochmurowych i SaaS.

Zakres nadzoru zależy od źródła i funkcji. Sprawdź obsługę skanowania, gromadzenie informacji o pochodzeniu danych, wymuszanie zasad, etykiety poufności, dostęp do sieci oraz dostępność w regionach dla każdego źródła danych w architekturze.

Zagadnienia dotyczące migracji

Nie migruj platformy analitycznej, traktując jej jak listy zamienników usług jeden do jednego. Spis źródeł danych, formatów, typów tabel, potoków, zależności aranżacji, kodu przekształcenia, dialektów zapytań, modeli semantycznych, raportów, zasad zabezpieczeń, rezydencji danych, celów poziomu usług i procesów operacyjnych. Przed wybraniem usług docelowych użyj reprezentatywnych testów wydajności i kosztów.