Identyfikacja podobnych wierszy danych za pomocą transformacji grupowania rozmytego

Dotyczy:SQL Server Środowisko SSIS Integration Runtime w usłudze Azure Data Factory

Aby dodać i skonfigurować transformację Fuzzy Grouping, pakiet musi już zawierać co najmniej jedno zadanie Przepływ danych oraz źródło.

Aby zaimplementować transformację rozmytego grupowania w przepływie danych

  1. W narzędziu SQL Server Data Tools (SSDT) otwórz projekt Integration Services zawierający odpowiedni pakiet.

  2. W Eksploratorze rozwiązań kliknij dwukrotnie pakiet, aby go otworzyć.

  3. Kliknij zakładkę Przepływ danych, a następnie z Toolboxa przeciągnij transformację Fuzzy Grouping na powierzchnię projektową.

  4. Połącz transformację Fuzzy Grouping z przepływem danych, przeciągając łącznik ze źródła danych lub z poprzedniej transformacji do transformacji Fuzzy Grouping.

  5. Kliknij dwukrotnie transformację grupowania rozmytego.

  6. W oknie dialogowym Fuzzy Grouping Transformation Editor, na zakładce Menedżer połączeń, wybierz OLE DB connection manager, który łączy się z bazą danych SQL Server.

    Note

    Transformacja wymaga połączenia z bazą danych SQL Server w celu tworzenia tymczasowych tabel i indeksów.

  7. Kliknij zakładkę Kolumny i na liście Dostępne kolumny wejściowe zaznacz pole wyboru kolumn wejściowych, aby zidentyfikować podobne wiersze w zbiorze danych.

  8. Zaznacz pole wyboru w kolumnie Pass Through , aby wskazać kolumny wejściowe, które należy przejść do wyjścia transformacji. Kolumny przekazywane nie są uwzględniane podczas identyfikowania duplikatów wierszy.

    Note

    Kolumny wejściowe używane do grupowania są automatycznie zaznaczane jako kolumny przekazywane i nie można usunąć ich zaznaczenia, gdy są używane do grupowania.

  9. Opcjonalnie zaktualizuj nazwy kolumn wyjściowych w kolumnie Output Alias .

  10. Opcjonalnie zaktualizuj nazwy wyczyszczonych kolumn w kolumnie Group OutputAlias .

    Note

    Domyślne nazwy kolumn to nazwy kolumn wejściowych z przyrostkiem "_clean".

  11. Opcjonalnie zaktualizuj typ dopasowania używany w kolumnie Typ dopasowania.

    Note

    Przynajmniej jedna kolumna musi stosować dopasowanie rozmyte.

  12. Określ kolumny minimalnego poziomu podobieństwa w kolumnie Minimalne podobieństwo . Wartość musi należeć do przedziału od 0 do 1. Im bliżej wartości jest 1, tym bardziej muszą być podobne wartości w kolumnach wejściowych, aby utworzyć grupę. Minimalne podobieństwo 1 oznacza dokładne dopasowanie.

  13. Opcjonalnie zaktualizuj nazwy kolumn podobieństwa w kolumnie Alias Wyjścia Podobieństwa .

  14. Aby określić sposób obsługi liczb w wartościach danych, zaktualizuj wartości w kolumnie Cyfry .

  15. Aby określić, jak transformacja porównuje dane ciągu w kolumnie, zmodyfikuj domyślny wybór opcji porównania w kolumnie Flagi porównawcze .

  16. Kliknij zakładkę Zaawansowane, aby zmodyfikować nazwy kolumn, które transformacja dodaje do wyjścia dla unikalnego identyfikatora wiersza (_key_in), identyfikatora wiersza duplikatu (_key_out) oraz wartości podobieństwa (_score).

  17. Opcjonalnie można dostosować próg podobieństwa, przesuwając suwak.

  18. Opcjonalnie wyczyść pola wyboru separatora tokenów, aby zignorować ograniczniki w danych.

  19. Kliknij przycisk OK.

  20. Aby zapisać zaktualizowany pakiet, kliknij Zapisz zaznaczone elementy w menu Plik.