Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
A eliminação de duplicação localiza e remove registros duplicados de um cliente de uma tabela de origem para que cada cliente seja representado por uma única linha em cada tabela. Cada tabela é desduplicada separadamente usando regras para identificar os registros de um cliente específico.
Cada regra de deduplicação é aplicada a todas as linhas. Se a primeira regra corresponder às linhas 1 e 2, e a segunda regra corresponder às linhas 2 e 3, então as linhas 1, 2 e 3 serão consideradas correspondentes. Quando linhas correspondentes são encontradas, uma linha vencedora é selecionada para representar esse cliente com base nas Preferências de mesclagem (Mais preenchido, Mais recente ou Menos recente). Use a opção Avançado para criar uma linha vencedora selecionando campos das várias linhas correspondentes, como o email mais recente, e o endereço mais completo.
Customer Insights - Data executa automaticamente as seguintes ações:
- Remova a duplicação de registros com o mesmo valor de chave primária, selecionando a primeira linha do conjunto de dados como vencedora.
- Remova a duplicação de registros usando as Regras de Correspondência definidas para a tabela ao comparar linhas entre tabelas.
Definir regras de deduplicação
Uma boa regra identifica um cliente exclusivo. Leve em consideração os dados. Talvez basta identificar clientes com base em um campo, como email. No entanto, se quiser diferenciar clientes que compartilhem um email, você poderá optar por ter uma regra com duas condições, correspondendo a Email + Nome. Para mais informações, consulte Práticas recomendadas de desduplicação.
Na página Regras de desduplicação, selecione uma tabela e selecione Adicionar regra para definir as regras de desduplicação.
Dica
Se você tiver enriquecido tabelas no nível da fonte de dados para ajudar a melhorar os resultados da unificação, selecione Usar tabelas enriquecidas na parte superior da página. Para obter mais informações, consulte Enriquecimento de fontes de dados.
No painel Adicionar regra, insira as seguintes informações:
Selecionar campo: escolha na lista de campos disponíveis da tabela na qual você deseja verificar se há duplicidades. Escolha campos que provavelmente são exclusivos para cada cliente. Por exemplo, um endereço de email ou a combinação de nome, cidade e número de telefone.
Normalizar: selecione as opções de normalização para a coluna. A normalização só afeta a etapa de correspondência, e não os dados.
Normalização Exemplos Numerais Converte muitos símbolos Unicode que representam números em números simples.
Exemplos: ❽ e Ⅷ são ambos normalizados para o número 8.
Observação: os símbolos devem ser codificados no formato Unicode Point.Símbolos Remove símbolos e caracteres especiais.
Exemplos: !?"#$%&'( )+,.-/:;<=>@^~{}`[ ]Texto em letras minúsculas Converte caracteres maiúsculos em minúsculos.
Exemplo: "ESTE É uM EXemplO" é convertido em "este é um exemplo"Tipo – Telefone Converte telefones em formatos variados em dígitos e leva em conta variações na maneira como extensões e códigos de país são apresentados. Símbolos e espaços em branco são ignorados. Os dígitos "0" à esquerda em códigos de país são ignorados, correspondendo a +1 e +01. As extensões indicadas por um prefixo com letras são ignoradas (X 123). O código de país normalizado é significativo, logo, um telefone com um código de país não corresponderá a um telefone sem um código de país.
Exemplo: +01 425.555.1212 corresponde a 1 (425) 555-1212
+01 425.555.1212 não corresponderá a (425) 555-1212Tipo – Nome Converte mais de 500 variações comuns de nomes e títulos.
Exemplos: "debby" -> "deborah" "prof" e "professor" -> "Prof."Tipo – Endereço Converte partes comuns de endereços
Exemplos: "street" -> "st" e "northwest" -> "nw"Tipo – Organização Remove cerca de 50 palavras irrelevantes de nomes de empresas, como "co", "corp", "corporation" e "ltd." Unicode para ASCII Converte caracteres Unicode para seu equivalente em letra ASCII
Exemplo: os caracteres 'à,' 'á,' 'â,' 'À,' 'Á,' 'Â,' 'Ã,' 'Ä,' 'Ⓐ' e 'A' são todos convertidos em 'a'.Espaço em branco Remove todos os espaços em branco Mapeamento de alias Permite carregar uma lista personalizada de pares de cadeias de caracteres que podem ser usados para indicar cadeias de caracteres que devem sempre ser consideradas uma correspondência exata.
Use o mapeamento de aliases quando você tiver exemplos específicos de dados que acredita que deveriam corresponder, mas que não correspondem usando um dos outros padrões de normalização.
Exemplo: Scott e Scooter, ou MSFT e Microsoft.Desvio personalizado Permite carregar uma lista personalizada de cadeias de caracteres que podem ser usadas para indicar cadeias de caracteres que jamais devem ter uma correspondência.
O desvio personalizado é útil quando você tem dados com valores comuns que devem ser ignorados, como um número de telefone fictício ou um email fictício.
Exemplo: Nunca corresponda ao número de telefone 555-1212, ou test@contoso.com
Precisão: defina o nível de precisão. A precisão é usada para correspondência exata e difusa e determina o quão próximas duas cadeias de caracteres precisam estar para serem consideradas uma correspondência.
- Básico: escolha entre Baixo (30%), Médio (60%), Alto (80%) e Exato (100%). Selecione Exato para corresponder apenas a registros com 100% de correspondência.
- Personalizado: Defina uma porcentagem de correspondência que os registros precisam atingir. O sistema só compara registros que excedam esse limite.
Nome: nome da regra.
Opcionalmente, selecione Adicionar>Adicionar condição para adicionar mais condições à regra. As condições são conectadas a um operador lógico AND e, portanto, somente serão executadas se todas as condições forem atendidas.
Opcionalmente, selecione Adicionar>Adicionar exceção para adicionar exceções à regra. As exceções são usadas para lidar com casos raros de falsos positivos e falsos negativos.
Selecione Concluído para criar a regra.
Opcionalmente, adicione mais regras.
Selecione preferências de mesclagem
Quando as regras são executadas e registros duplicados são identificados para um cliente, uma "linha vencedora" é selecionada com base na política de mesclagem. A linha vencedora representa o cliente na próxima etapa de unificação, que faz a correspondência de registros entre tabelas. Os dados nas linhas não vencedoras ("alternativas") são usados na etapa de unificação de regras correspondentes para comparar registros de outras tabelas com a linha vencedora. Essa abordagem melhora os resultados de correspondência, permitindo que informações como números de telefone anteriores ajudem a identificar registros correspondentes. A linha vencedora pode ser configurada para ser a mais preenchida, a mais recente ou a menos recente dos registros duplicados encontrados.
Selecione uma tabela e, em seguida, Editar preferências de mesclagem. O painel Preferências de mesclagem é exibido.
Escolha uma das três opções para determinar qual registro manter se uma duplicidade for encontrada:
- Mais preenchido: identifica o registro com as colunas mais preenchidas como o registro vencedor. É a opção de mesclagem padrão.
- Mais recente: identifica o registro vencedor com base na maior recência. Requer uma data ou um campo numérico para definir a recência.
- Menos recente: identifica o registro vencedor com base na menor recência. Requer uma data ou um campo numérico para definir a recência.
Se houver um empate, o registro vencedor será o que tiver o MAX(PK) ou o maior valor da chave primária.
Como opção, para definir preferências de mesclagem em colunas individuais de uma tabela, selecione Avançado na parte inferior do painel. Por exemplo, você pode manter o email mais recente E o endereço mais completo de diferentes registros. Expanda a tabela para ver todas as colunas e defina qual opção usar para colunas individuais. Se você escolher uma opção baseada em recência, também precisará especificar um campo de data/hora que determine a recência.
Selecione Concluído para aplicar suas preferências de mesclagem.
Depois de definir as regras de eliminação de duplicação e as preferências de mesclagem, selecione Avançar.