Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Podczas konfigurowania reguł ujednolicania danych w profilu klienta należy wziąć pod uwagę następujące najlepsze rozwiązania:
Równowaga między czasem potrzebnym na ujednolicenie a pełnym dopasowaniem. Próba przechwycenia każdego możliwego dopasowania prowadzi do tego, że wiele zasad i unifikacja zajmuje dużo czasu.
Dodawaj reguły stopniowo i śledź wyniki. Usuń reguły, które nie poprawiają wyniku dopasowania.
Zdeduplikuj każdą tabelę, tak aby każdy klient był reprezentowany w jednym wierszu.
Normalizacja umożliwia standaryzację różnic w sposobie wprowadzania danych, takich jak ulica vs. ul vs. St. vs. street.
Użyj dopasowania rozmytego strategicznie, aby poprawić literówki i błędy takie jak bob@contoso.com i bob@contoso.cm. Dopasowania rozmyte trwają dłużej niż dopasowania dokładne. Zawsze sprawdzaj, czy dodatkowy czas spędzony na dopasowywaniu rozmytym jest wart zyskania większego współczynnika dopasowania.
Zawęź zakres dopasowań za pomocą dokładnego dopasowania. Upewnij się, że każda reguła z warunkami rozmytymi ma co najmniej jeden warunek dokładnego dopasowania.
Nie dopasowuj kolumn, które zawierają często powtarzane dane. Upewnij się, że kolumny z dopasowaniem rozmytym nie mają często powtarzanych wartości, takich jak domyślna wartość formularza "Imię".
Wydajność unifikacji
Uruchomienie każdej reguły wymaga czasu. Wzorce, takie jak porównywanie każdej tabeli z każdą inną tabelą lub próba uchwycenia każdego możliwego dopasowania rekordów, mogą prowadzić do wydłużenia czasu przetwarzania podczas ujednolicania. Podejście to również zwraca również niewiele (jeśli w ogóle) dopasowań w ramach planu, który porównuje każdą tabelę z tabelą podstawową.
Najlepszym rozwiązaniem jest rozpoczęcie od podstawowego zestawu reguł, o których wiesz, że są potrzebne, takich jak porównanie każdej tabeli z tabelą podstawową. Tabela podstawowa powinna być tabelą z najbardziej kompletnymi i dokładnymi danymi. Uporządkuj tę tabelę u góry w kroku ujednolicania Reguły uzgadniania.
Stopniowo dodawaj kilka reguł i zobacz, jak długo trwa wprowadzanie zmian i czy Twoje wyniki ulegną poprawie. Przejdź do Ustawienia>System>Stan i wybierz Dopasuj, aby zobaczyć, jak długo trwała deduplikacja i dopasowywanie dla każdego przebiegu ujednolicania.
Wyświetl statystyki reguł na stronach Reguły deduplikacji i Reguły dopasowywania, aby sprawdzić, czy liczba unikatowych rekordów uległa zmianie. Jeśli nowa reguła pasuje do niektórych rekordów, a liczba unikatowych rekordów nie zmienia się, poprzednia reguła identyfikuje te dopasowania.
Dane klienta
W kroku Dane klientów:
Wyklucz kolumny, które nie są potrzebne do dopasowywania reguł lub których nie chcesz uwzględniać w profilu klienta końcowego.
Przejrzyj opisy kolumn wybrane przez inteligentne mapowanie.
Nie wszystkie kolumny muszą być mapowane. Mapuj wspólne kolumny, takie jak pola e-mail i adres, aby ułatwić dalsze procesy. Możesz jednak pozostawić niezmapowane kolumny z unikalnym identyfikatorem lub przeznaczone do celów specyficznych dla Twojej firmy.
Deduplikacja
Użyj reguł deduplikacji, aby usunąć zduplikowane rekordy klientów w tabeli, tak aby pojedynczy wiersz w każdej tabeli reprezentował każdego klienta. Dobra reguła jednoznacznie identyfikuje klienta.
W tym prostym przykładzie rekordy 1, 2 i 3 mają ten sam adres e-mail lub numer telefonu i reprezentują tę samą osobę.
| identyfikator | Nazwa/nazwisko | Telefon | |
|---|---|---|---|
| 1 | Osoba 1 | (425) 555-1111 | AAA@A.com |
| 2 | Osoba 1 | (425) 555-1111 | BBB@B.com |
| 3 | Osoba 1 | (425) 555-2222 | BBB@B.com |
| 4 | Osoba 2 | (206) 555-9999 | Person2@contoso.com |
Nie dopasowuj wyłącznie na podstawie imienia, ponieważ ta reguła dopasowuje różne osoby o tym samym imieniu.
Utwórz regułę 1 przy użyciu nazwy i telefonu, która pasuje do rekordów 1 i 2.
Utwórz regułę 2 przy użyciu nazwy i e-maila, która pasuje do rekordów 2 i 3.
Połączenie reguły 1 i reguły 2 powoduje utworzenie jednej grupy dopasowania, ponieważ rekord 2 jest im udostępniania.
To Ty decydujesz o liczbie reguł i warunków, które jednoznacznie identyfikują Twoich klientów. Dokładne zasady zależą od danych dostępnych do dopasowania, jakości danych i tego, jak wyczerpujący ma być proces deduplikacji.
Normalizacja
Użyj normalizacji, aby ustandaryzować dane w celu lepszego dopasowania. Normalizacja dobrze działa na dużych zbiorach danych.
System wykorzystuje znormalizowane dane wyłącznie do celów porównawczych, aby skuteczniej dopasować dane klientów. Nie spowoduje to zmiany danych w końcowym ujednoliconym profilu klienta.
Dokładne dopasowanie
Użyj precyzji, aby określić, jak blisko siebie powinny znajdować się dwa ciągi, aby można je było uznać za zgodne. Domyślne ustawienie dokładności wymaga dokładnego dopasowania. Każda inna wartość umożliwia dopasowanie rozmyte dla tego warunku.
Ustaw precyzję na niską (30% dopasowanie), średnią (60% dopasowanie) lub wysoką (80% dopasowanie). Możesz też dostosować i ustawić precyzję co 1%.
Warunki dokładnego dopasowania
Najpierw wykonuje się dokładne warunki dopasowania, aby uzyskać mniejszy zbiór wartości dla dopasowania rozmytego. Aby warunki dokładnego dopasowania były skuteczne, powinny charakteryzować się rozsądnym stopniem niepowtarzalności. Jeśli na przykład wszyscy klienci mieszkają w tym samym kraju/regionie, dokładne dopasowanie kraju/regionu nie pomoże zawęzić zakresu.
Kolumny takie jak imię i nazwisko, adres e-mail, telefon lub adres mają dobrą niepowtarzalność i świetnie nadają się do wykorzystania jako dokładne dopasowanie.
Upewnij się, że kolumna używana dla warunku dokładnego dopasowania nie ma żadnych często powtarzanych wartości, takich jak wartość domyślna "Imię" przechwycona przez formularz. Customer Insights może profilować kolumny danych, aby uzyskać wgląd w najczęściej powtarzające się wartości. Profilowanie danych można włączyć w połączeniach Azure Data Lake (przy użyciu formatu Common Data Model lub Delta) i Synapse. Profil danych uruchamia się podczas kolejnego odświeżania źródła danych. Więcej informacji można znaleźć w artykule Profilowanie danych.
Dopasowanie rozmyte
Użyj dopasowania rozmytego, aby dopasowywać łańcuchy znaków, które są do siebie zbliżone, ale nie identyczne z powodu literówek lub innych niewielkich różnic. Używaj dopasowania rozmytego strategicznie, ponieważ jest ono wolniejsze niż dopasowania dokładne. Upewnij się, że w każdej regule zawierającej warunki rozmyte znajduje się co najmniej jeden warunek dokładnego dopasowania.
Dopasowanie rozmyte nie jest przeznaczone do przechwytywania odmian imion, takich jak Suzzie i Suzanne. Warianty te są lepiej wychwytywane za pomocą wzorca normalizacji Typ: Nazwa lub niestandardowego dopasowania aliasów, w którym klienci mogą wprowadzić listę odmian nazw, które chcą uwzględnić jako dopasowania.
Do reguły można dodać warunki, na przykład warunki dopasowania dla pól FirstName i Phone. Warunki w danej regule są warunkami "AND". Każdy warunek musi być spełniony, aby wiersze były zgodne. Osobnymi regułami są warunki "OR". Jeśli reguła 1 nie pasuje do wierszy, wiersze są porównywane z regułą 2.
Notatka
Tylko kolumny typu danych „ciąg znaków” mogą korzystać z dopasowania rozmytego. W przypadku kolumn z innymi typami danych, takimi jak liczba całkowita, podwójna precyzja lub data/godzina, pole dokładności jest tylko do odczytu i ustawione na dokładne dopasowanie.
Rozmyte obliczenia dopasowujące
Dopasowania rozmyte są określane przez obliczenie wyniku odległości edycji między dwoma ciągami. Jeśli wynik spełnia lub przekracza próg precyzji, ciągi są uznawane za zgodne.
Odległość edycji to liczba edycji wymaganych do przekształcenia jednego ciągu w inny poprzez dodanie, usunięcie lub zmianę znaku.
Na przykład znaki "robert2020@hotmail.com" i "robrt2020@hotmail.cm" mają dystans edycji równy dwa, gdy usuniesz znaki e i o . Aby obliczyć wynik odległości edycyjnej, użyj następującego wzoru: (długość ciągu bazowego – odległość edycyjna) / długość ciągu bazowego.
| Ciąg bazowy | Ciąg do porównania | Ocena |
|---|---|---|
| robert2020@hotmail.com | robrt2020@hotmail.cm | (20 - 2)/20 = 0,9 |