Remover duplicados de cada tabela para unificação de dados

A eliminação de duplicados localiza e remove registos duplicados de um cliente de uma tabela de origem para que cada cliente seja representado por uma única linha em cada tabela. Cada tabela é desduplicada separadamente, utilizando regras para identificar os registos relativos a um determinado cliente.

Cada regra de desduplicação é aplicada a cada linha. Se a sua primeira regra corresponder às linhas 1 e 2 e a regra 2 corresponder às linhas 2 e 3, as linhas 1, 2 e 3 serão correspondidas. Quando as linhas correspondentes são encontradas, uma linha vencedora é selecionada para representar esse cliente com base nas Preferências de intercalação (Mais preenchido, Mais recente ou Menos recente). Use a opção Avançado para criar uma linha vencedora selecionando campos das várias linhas correspondentes, como o e-mail mais recente, mas o endereço mais preenchido.

Customer Insights - Dados executa automaticamente as seguintes ações:

  • Elimine a duplicação de registos com o mesmo valor de chave primária, selecionando a primeira linha do conjunto de dados como vencedora.
  • Elimine a duplicação de registos utilizando as Regras de Correspondência definidas para a tabela ao fazer a correspondência de linhas entre tabelas.

Definir regras de eliminação de duplicados

Uma boa regra identifica um cliente exclusivo. Considere os seus dados. Pode ser suficiente identificar clientes com base num campo como o e-mail. No entanto, se pretender diferenciar os clientes que partilham um e-mail, pode optar por ter uma regra com duas condições, que correspondam em E-mail + Nome Próprio. Para obter mais informações, consulte Melhores práticas de eliminação de duplicados.

  1. Na página Regras de duplicação, selecione uma tabela e selecione Adicionar regra para definir as regras de duplicação.

    Sugestão

    Se tiver melhorado tabelas ao nível origem de dados para ajudar a melhorar os resultados de unificação, selecione Utilizar tabelas melhoradas no topo da página. Para obter mais informações, consulte Enriquecimento para fontes de dados.

    Captura de ecrã da página Regras de desduplicação com a tabela destacada e a opção Adicionar regra visível

  2. No painel Adicionar regra, introduza as seguintes informações:

    • Selecionar campo: selecione na lista de campos disponíveis da tabela o campo que pretende verificar quanto à existência de duplicados. Escolha os campos que sejam provavelmente únicos para cada cliente. Por exemplo, um endereço de e-mail ou a combinação de nome, cidade e número de telefone.

      • Normalizar: selecione as opções de normalização para a coluna. A normalização só afeta o passo correspondente e não altera os dados.

        Normalização Exemplos
        Números Converte muitos símbolos Unicode que representam números em números simples.
        Exemplos: ❽ e Ⅷ são ambos normalizados para o número 8.
        Nota: Os símbolos têm de ser codificados no Formato Unicode Point.
        Símbolos Remove os símbolos e carateres especiais.
        Exemplos: !?"#$%&'( )+,.-/:;<=>@^~{}`[ ]
        Texto para minúsculas Converte caracteres maiúsculos em minúsculos. 
        Exemplo: "ISTO É uM EXemplO" é convertido em "isto é um exemplo"
        Tipo — Telefone Converte números de telefone de vários formatos para dígitos e tem em conta as variações na forma como os códigos de país e as extensões são apresentados. Símbolos e espaços em branco são ignorados. Os dígitos '0' iniciais nos indicativos do país são ignorados, fazendo corresponder +1 e +01. As extensões significadas por um prefixo com letras são ignoradas (X 123). O indicativo do país normalizado é significativo, pelo que um número de telefone com indicativo do país não corresponderá a um número de telefone sem indicativo do país.
        Exemplo: +01 425.555.1212 corresponde a 1 (425) 555-1212
        +01 425.555.1212 não coincide com (425) 555-1212
        Tipo — Nome Converte mais de 500 variações comuns de nomes e títulos. 
        Exemplos: "debby" -> "deborah" "prof" e "professor" -> "Prof."
        Tipo — Endereço Converte partes comuns de endereços
        Exemplos: "rua" -> "R" and "noroeste" -> "no"
        Tipo — Organização Remove aproximadamente 50 “palavras supérfluas” de nomes de empresas, como “co”, “corp”, “corporation” e “ltd.”
        Unicode para ASCII Converte carateres Unicode para o respetivo equivalente de tipo de letra ASCII
        Exemplo: Os carateres 'à,' 'á,' 'â,' 'À,' 'Á,' 'Â,' 'Ã,' 'Ä,' 'Ⓐ,' e 'A' são todos convertidos em 'a'.
        Espaço em branco Remove todos os espaços em branco
        Mapeamento de aliases Permite carregar uma lista personalizada de pares de cadeias que podem ser usadas para indicar cadeias que devem ser sempre consideradas como uma correspondência exata. 
        Use o mapeamento de alias quando tiver exemplos de dados específicos que acha que deveriam corresponder e não correspondem usando um dos outros padrões de normalização. 
        Exemplo: Scott e Scooter ou MSFT e Microsoft.
        Desvio personalizado Permite carregar uma lista personalizada de cadeias que podem ser usadas para indicar cadeias que nunca devem ser correspondidas.
        O desvio personalizado é útil quando tem dados com valores comuns que devem ser ignorados, como um número de telefone fictício ou um e-mail fictício. 
        Exemplo: Nunca faça corresponder o número de telefone 555-1212, ou test@contoso.com
    • Precisão: defina o nível de precisão. A precisão é usada para correspondência exata e correspondência difusa, e determina o quão próximas duas cadeias precisam de estar para serem consideradas uma correspondência.

      • Básico: escolha entre Baixo (30%), Médio (60%), Alto (80%) e Exato (100%). Selecione Exato para incluir apenas os registos com correspondência a 100 %.
      • Personalizado: Defina uma percentagem com a qual os registos têm de coincidir. O sistema só faz correspondência entre os registos que ultrapassam este limiar.
    • Nome: nome da regra.

      Captura de ecrã do painel Adicionar regra para remover duplicados.

  3. Opcionalmente, selecione Adicionar>Adicionar condição para adicionar mais condições à regra. As condições estão ligadas a um operador E lógico e, portanto, só são executadas se todas as condições forem satisfeitas.

  4. Opcionalmente, Adicionar>Adicionar exceção para adicionar exceções à regra. As exceções são utilizadas para resolver casos raros de falsos positivos e falsos negativos.

  5. Selecione Concluído para criar a regra.

  6. Opcionalmente, adicione mais regras.

Selecionar preferências de união

Quando as regras são executadas e são identificados registos duplicados para um cliente, é selecionado um "registo vencedor" com base na política de fusão. A linha vencedora representa o cliente no passo seguinte de unificação que faz a correspondência entre registos de tabelas. Os dados nas linhas não vencedoras ("alternativas") são utilizados no passo de unificação das regras de correspondência para fazer corresponder os registos de outras tabelas à linha vencedora. Esta abordagem melhora os resultados correspondentes, permitindo que informações como números de telefone anteriores ajudem a identificar registos correspondentes. A linha vencedora pode ser configurada para ser a mais preenchida, a mais recente ou a menos recente dos registos duplicados encontrados.

  1. Selecione uma tabela e, em seguida, Editar preferências de união. O painel Unir preferências aparece.

  2. Escolha uma de três opções para determinar que registo manter se forem encontrados duplicados:

    • Mais preenchido: identifica o registo com as colunas mais preenchidas como registo vencedor. É a opção de união por predefinição.
    • Mais recente: Identifica o registo vencedor com base na data mais recente. Requer uma data ou um campo numérico para definir o caráter recente.
    • Menos recente: Identifica o registo vencedor com base no menos recente. Requer uma data ou um campo numérico para definir a atualidade.

    No caso de empate, o registo vencedor é aquele com o MAX(PK), ou seja, o maior valor da chave primária.

  3. Opcionalmente, para definir as preferências de união em colunas individuais de uma tabela, selecione Avançadas na parte inferior do painel. Por exemplo, pode optar por manter o e-mail mais recente e o endereço mais completo de diferentes registos. Expanda a tabela para ver todas as suas colunas e defina que opção utilizar para colunas individuais. Se escolher uma opção baseada em recência, tem também de especificar um campo de data/hora que defina a recência.

    Preferências de união avançadas que mostram e-mails recentes e endereços completos

  4. Selecione Concluído para aplicar preferências de união

Depois de definir as regras de eliminação de duplicados e as preferências de união selecione Seguinte.