Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Usługa Microsoft Fabric oferuje kilka sposobów uwzględnienia danych na platformie. Ten przewodnik zawiera jasne zalecenie dotyczące najbardziej typowych scenariuszy, a następnie zawiera szczegółowe porównania funkcji , gdy trzeba dokładniej poznać szczegóły.
Szybkie zalecenie: Której opcji przenoszenia danych należy użyć?
Skorzystaj z architektury medalionu jako przewodnika:
Złote dane (raportowanie i analiza przetworzonych danych) — użyj funkcji dublowania. Jeśli masz już przetwarzanie ETL w innym miejscu i głównie musisz przenieść wyselekcjonowane dane do Fabric w celu raportowania, Mirroring jest najprostszym i najbardziej opłacalnym wyborem. Jest ona bezpłatna, wymaga minimalnej konfiguracji i stale replikuje dane do usługi OneLake.
Dane z brązu (nieprzetworzone pozyskiwanie) — rozpocznij od zadania kopiowania. Podczas pozyskiwania surowych danych szybko będziesz potrzebować przekształceń, mapowania schematu, kontroli harmonogramu i ładowania przyrostowego. Zadanie kopiowania zapewnia te możliwości natywnie bez złożoności potoków przetwarzania.
Dane przesyłane strumieniowo w czasie rzeczywistym — użyj Eventstreams. W przypadku przetwarzania i pozyskiwania danych o niskim opóźnieniu sterowanego zdarzeniami, Eventstreams udostępnia potoki w czasie rzeczywistym bez potrzeby pisania kodu do przekształceń i routingu do wielu miejsc docelowych.
Złożona orkiestracja — potoki zapewniają potrzebną elastyczność orkiestracji, a działania kopiowania w potokach oferują parametryzację obiektów danych i pozyskiwanie danych napędzane metadanymi. W przeciwnym razie aktywność zadania kopiowania i aktywność kopiowania są równe w ramach potoku.
Aby zapoznać się z pełnym podziałem równoległym możliwości i obsługiwanymi funkcjami, zobacz szczegółowe porównanie funkcji.
Najważniejsze pojęcia
Dublowanie zapewnia prosty i bezpłatny sposób dublowania danych operacyjnych w usłudze Fabric na potrzeby analizy. Jest ona zoptymalizowana pod kątem łatwego użycia z minimalną konfiguracją i zapisuje w jednym miejscu docelowym tylko do odczytu w usłudze OneLake.
Działania kopiowania w Pipelines są tworzone dla użytkowników, którzy potrzebują orkiestrowanych przepływów pracy pozyskiwania danych opartych na potokach. Możesz dostosować ją w szerokim zakresie i dodać logikę przekształcania, ale musisz samodzielnie zdefiniować składniki potoku i zarządzać nimi, w tym śledzić stan ostatniego uruchomienia na potrzeby kopiowania przyrostowego.
Zadanie kopiowania ułatwia pozyskiwanie danych dzięki natywnej obsłudze wielu stylów dostarczania, w tym kopiowania zbiorczego, kopiowania przyrostowego i replikacji przechwytywania zmian danych (CDC), a jednocześnie nie trzeba kompilować potoków, jednocześnie zapewniając dostęp do wielu zaawansowanych opcji. Obsługuje wiele źródeł i miejsc docelowych i działa dobrze, gdy potrzebujesz większej kontroli niż mirroringu, ale mniej złożoności niż zarządzanie potokami za pomocą aktywności kopiowania.
Strumienie zdarzeń: przeznaczone do pozyskiwania, przekształcania i przetwarzania danych przesyłanych strumieniowo w czasie rzeczywistym. Obsługuje potoki o małych opóźnieniach, zarządzanie schematami i routing do miejsc docelowych, takich jak Eventhouse, Lakehouse, Activator i niestandardowe punkty końcowe obsługujących AMQP, Kafka i HTTP.
Szczegółowe porównanie funkcji
W poniższych tabelach porównaliśmy pełne możliwości każdej opcji przenoszenia danych. Użyj tej sekcji, jeśli musisz ocenić określone funkcje dla danego scenariusza.
| Dublowanie | Zadanie kopiowania | Działanie kopiowania (pipeline) | Strumienie zdarzeń | |
|---|---|---|---|---|
| Źródeł | Bazy danych i integracja innych firm z usługą Open Mirroring | Wszystkie obsługiwane źródła danych i formaty | Wszystkie obsługiwane źródła danych i formaty | 25+ źródeł i wszystkich formatów |
| Kierunki | Format tabelaryczny w usłudze Fabric OneLake (tylko do odczytu) | Wszystkie obsługiwane miejsca docelowe i formaty | Wszystkie obsługiwane miejsca docelowe i formaty | 4 lub więcej miejsc docelowych |
| Elastyczność | Prosta konfiguracja ze stałym zachowaniem | Łatwe w użyciu + opcje zaawansowane | Zaawansowane i w pełni dostosowywalne opcje | Proste i dostosowywalne opcje |
| Zdolność | Dublowanie | Zadanie kopiowania | Działanie kopiowania (pipeline) | Strumienie zdarzeń |
|---|---|---|---|---|
| Planowanie niestandardowe | Tak | Tak | Ciągły | |
| Zarządzanie tabelami i kolumnami | Tak | Tak | Tak (schemat, zarządzanie zdarzeniami i polami) | |
| Zachowanie kopiowania: Dołączanie, Upsert, Zastępowanie | Tak | Tak | Append | |
| Zaawansowana możliwość obserwacji i inspekcja | Tak | Tak | ||
| Tryby kopiowania | ||||
| Ciągła replikacja oparta na usłudze CDC | Tak | Tak | Tak | |
| Kopiowanie zbiorcze lub wsadowe | Tak | Tak | Tak (początkowa replikacja migawki CDC) | |
| Rodzima obsługa kopii przyrostowej (opartej na znacznikach czasowych) | Tak | |||
| Kopiowanie przy użyciu zapytania zdefiniowanego przez użytkownika | Tak | Tak | ||
| Przypadki użycia | ||||
| Ciągła replikacja na potrzeby analizy i raportowania | Tak | Tak | Tak | |
| Sterowane metadanymi ELT/ETL do magazynowania danych | Tak | Tak | ||
| Konsolidacja danych | Tak | Tak | Tak | |
| Migracja danych / Kopia zapasowa danych / Udostępnianie danych | Tak | Tak | Tak | |
| Wolne od kosztów | Tak | |||
| Przewidywalna wydajność | Tak | Tak | Tak |
Scenariusze
Przejrzyj te scenariusze, aby ułatwić wybór strategii przenoszenia danych najlepiej dopasowanej do Twoich potrzeb.
Scenariusz 1
James jest menedżerem finansowym w firmie ubezpieczeniowej. Jego zespół używa usługi Azure SQL Database do śledzenia danych zasad, oświadczeń i informacji o klientach w wielu jednostkach biznesowych. Kierownictwo wykonawcze chce tworzyć pulpity nawigacyjne w czasie rzeczywistym do monitorowania wydajności biznesowej. Jednak James nie może pozwolić, aby zapytania analityczne spowalniały systemy operacyjne, które przetwarzają tysiące codziennych transakcji.
James ma już wprowadzone procesy ETL, a jego zespół potrzebuje przetworzonych danych na poziomie złotym dostępnych w usłudze Fabric do raportowania dla kadry kierowniczej. Nie chce zarządzać harmonogramowaniem, konfigurować obciążeń przyrostowych ani martwić się wyborem tabeli — potrzebuje, aby wszystko było automatycznie odzwierciedlane. Ponieważ jest to przeznaczone tylko do raportowania, posiadanie danych w formacie tylko do odczytu w usłudze OneLake działa doskonale. Rozwiązanie musi być również opłacalne, ponieważ wychodzi z budżetu departamentu.
James wybiera mirroring. Mirroring zapewnia ciągłą replikację opartą na CDC, automatycznie obsługując wszystkie tabele bez konieczności konfiguracji. Prosta konfiguracja oznacza, że nie potrzebuje wiedzy technicznej, a bezpłatny koszt pasuje do jego budżetu. Format tabelaryczny tylko do odczytu w usłudze OneLake zapewnia swojemu zespołowi dostęp do analizy, którego potrzebują, bez wpływu na wydajność operacyjną.
Scenariusz 2
Lisa jest analitykiem biznesowym w firmie logistycznej. Musi pozyskiwać nieprzetworzone dane wysyłki z wielu baz danych Snowflake do tabel Fabric Lakehouse na potrzeby analizy łańcucha dostaw. Dane obejmują zarówno historyczne rekordy początkowego obciążenia, jak i nowe przesyłki dostarczane przez cały dzień. Lisa chce uruchomić ten proces zgodnie z niestandardowym harmonogramem — co 4 godziny w godzinach pracy.
Ponieważ Lisa wprowadza nieprzetworzone dane warstwy brązowej, wie, że szybko potrzebuje przekształceń, mapowania schematów i kontroli planowania. Musi wybrać określone tabele z każdego wystąpienia usługi Snowflake, zmapować kolumny na standardowe nazwy i zastosować mechanizm upsert do obsługi aktualizacji istniejących rekordów wysyłki. Chce również, aby zaawansowane monitorowanie śledziło jakość i wydajność przetwarzania danych.
Lisa wybiera pozycję Kopiuj zadanie. Zadanie kopiowania zapewnia niestandardowe planowanie, którego potrzebuje, obsługuje wszystkie jej źródła danych, w tym Snowflake, i oferuje możliwości zarządzania tabelami i kolumnami dla jej konfiguracji wieloregionalnej. Natywna obsługa kopiowania przyrostowego z wykrywaniem opartym na znakach wodnych i zachowaniem typu upsert umożliwia jej obsługę tych wymagań bez konieczności budowania potoków.
Scenariusz 3
David jest starszym inżynierem danych w firmie telekomunikacyjnej. Tworzy złożony przepływ pracy pozyskiwania danych, który musi wyodrębnić dane użycia klientów z Oracle przy użyciu niestandardowych zapytań SQL, stosować przekształcenia biznesowe i ładować te dane do wielu miejsc docelowych, w tym do magazynu danych Fabric oraz systemów zewnętrznych. Przepływ pracy musi również koordynować się z innymi działaniami potoku, takimi jak walidacja danych i etapy powiadomień.
David musi mieć pełną kontrolę nad procesem kopiowania, w tym możliwość używania zapytań zdefiniowanych przez użytkownika do łączenia tabel i filtrowania danych w źródle. Potrzebuje zaawansowanych i w pełni dostosowywalnych opcji konfiguracji, przewidywalnej wydajności dla dużych wolumenów danych oraz możliwości zintegrowania procesu kopiowania z szerszymi orkiestracjami przepływów pracy w potokach, wraz z zarządzaniem zależnościami i obsługą błędów.
David przegląda dostępne opcje i wybiera opcję Działania kopiowania w potokach. Takie podejście zapewnia zaawansowaną i w pełni dostosowywalną konfigurację, którą potrzebuje, obsługuje zapytania zdefiniowane przez użytkownika do złożonego wyodrębniania danych i zapewnia aranżację opartą na potoku wymaganą dla jego przepływu pracy. Zaawansowane funkcje monitorowania i audytu pomagają mu śledzić złożony proces, podczas gdy framework przepływu danych pozwala mu koordynować czynności kopiowania z innymi etapami przetwarzania danych.
Scenariusz 4
Ash jest menedżerem produktu w firmie telekomunikacyjnej. Jej zespół musi monitorować metryki obsługi klienta, takie jak woluminy połączeń, czasy oczekiwania i wydajność agenta, w czasie rzeczywistym, aby zapewnić zgodność umowy SLA i zwiększyć zadowolenie klientów. Dane pochodzą z wielu systemów operacyjnych, takich jak platformy CRM, dzienniki centrum połączeń i bazy danych przypisań agentów, i docierają z dużą częstotliwością przez cały dzień.
Ash używa Fabric Eventstreams do pozyskiwania i przekształcania tych danych w ruchu. Konfiguruje łączniki przesyłania strumieniowego w celu ściągania danych z różnych źródeł, stosowania przekształceń przy użyciu środowiska bez kodu i kierowania przetworzonych zdarzeń do usługi Eventhouse na potrzeby analizy w czasie rzeczywistym. Integruje aktywację danych w celu wyzwalania alertów i zautomatyzowanych przepływów pracy w przypadku naruszenia progów umowy SLA, dzięki czemu może wysyłać powiadomienia do przełożonych lub dynamicznie dostosowywać poziomy zatrudnienia.
Wynikiem jest pulpit nawigacyjny w czasie rzeczywistym, który jest aktualizowany w ciągu kilku sekund, co daje zespołowi Ash wgląd w metryki wydajności na żywo i umożliwia szybkie podejmowanie decyzji opartych na danych. Ta architektura przesyłania strumieniowego eliminuje opóźnienia potoków wsadowych i umożliwia firmie natychmiastowe reagowanie na potrzeby klientów.
Wprowadzenie
Teraz, gdy już wiesz, której strategii przenoszenia danych użyć, możesz rozpocząć pracę z następującymi zasobami: