Verificações e ingestão no Mapa de Dados

Este artigo fornece uma visão geral dos recursos de verificação e ingestão no Mapa de Dados do Microsoft Purview. Esses recursos conectam sua conta do Microsoft Purview às suas fontes para preencher o Mapa de Dados e o Catálogo Unificado para que você possa começar a explorar e gerenciar seus dados por meio do Microsoft Purview.

  • A verificação captura metadados de fontes de dados e os traz para o Microsoft Purview.
  • A ingestão processa metadados e os armazena no Catálogo Unificado de ambos:
    • Varreduras de fonte de dados - os metadados digitalizados são adicionados ao Mapa de Dados.
    • Conexões de linhagem - os recursos de transformação adicionam metadados sobre suas fontes, saídas e atividades ao Mapa de Dados.

Verificação

Depois de registrar as fontes de dados em sua conta do Microsoft Purview, verifique as fontes de dados. O processo de digitalização se conecta à fonte de dados e captura metadados técnicos, como nomes, tamanho do arquivo, colunas e muito mais. Ele também extrai esquemas para fontes de dados estruturadas, aplica classificações em esquemas e aplica rótulos de confidencialidade se o Mapa de Dados estiver conectado ao portal do Microsoft Purview. Você pode disparar o processo de verificação para ser executado imediatamente ou agendá-lo para ser executado periodicamente para manter sua conta do Microsoft Purview atualizada.

Para cada verificação, você pode personalizar o processo para digitalizar apenas as informações necessárias, em vez de toda a fonte.

Escolha um método de autenticação para suas verificações

O Microsoft Purview é seguro por padrão. Ele não armazena senhas ou segredos diretamente, portanto, você precisa escolher um método de autenticação para suas fontes. Você pode autenticar sua conta do Microsoft Purview de várias maneiras, mas nem todos os métodos têm suporte para cada fonte de dados.

  • Identidade Gerenciada
  • Entidade de Serviço
  • Autenticação do SQL
  • Autenticação do Windows
  • ARN da função
  • Autenticação delegada
  • Chave do consumidor
  • Chave de Conta ou Autenticação Básica

Sempre que possível, use uma identidade gerenciada, pois ela elimina a necessidade de armazenar e gerenciar credenciais para fontes de dados individuais. Esse método pode reduzir bastante o tempo que você e sua equipe gastam configurando e solucionando problemas de autenticação para verificações. Quando você habilita uma identidade gerenciada para sua conta do Microsoft Purview, uma identidade é criada no Microsoft Entra ID (Entra ID) e é vinculada ao ciclo de vida da sua conta.

Definir o escopo da verificação

Ao digitalizar uma fonte, você pode digitalizar toda a fonte de dados ou escolher apenas entidades específicas (pastas ou tabelas) para digitalizar. As opções disponíveis dependem da fonte que você está verificando. Você pode definir essas opções para verificações únicas e agendadas.

Por exemplo, ao criar e executar uma verificação de um Banco de Dados SQL do Azure, você pode escolher quais tabelas verificar ou selecionar todo o banco de dados.

Para cada entidade (pasta ou tabela), existem três estados de seleção: totalmente selecionada, parcialmente selecionada e não selecionada. No exemplo a seguir, se você selecionar o Departamento 1 na hierarquia de pastas, o Departamento 1 será considerado como totalmente selecionado. As entidades pai do Departamento 1, que são Empresa e exemplo, são consideradas parcialmente selecionadas, pois as outras entidades sob o mesmo pai (por exemplo, Departamento 2) não são selecionadas. Ícones diferentes são usados na interface do usuário para entidades com diferentes estados de seleção.

Captura de tela que mostra o escopo da sua página de verificação.

Depois de executar a verificação, é provável que novos ativos sejam adicionados ao sistema de origem. Por padrão, os ativos futuros em um determinado pai são selecionados automaticamente se o pai for total ou parcialmente selecionado quando você executar a verificação novamente. No exemplo anterior, depois de selecionar Departamento 1 e executar a verificação, todos os novos ativos na pasta Departamento 1 ou em Empresa e exemplo serão incluídos quando você executar a verificação novamente.

Um botão de alternância, como visto na imagem abaixo, permite que os usuários controlem a inclusão automática de novos ativos em pai parcialmente selecionado. Por padrão, a alternância está desativada e o comportamento de inclusão automática para um pai parcialmente selecionado é desabilitado. Com a alternância desativada, todos os novos ativos em pais parcialmente selecionados, como Empresa e exemplo , não serão incluídos quando você executar a verificação novamente; apenas novos ativos no Departamento 1 são incluídos na verificação futura.

Captura de tela que mostra o escopo da sua página de verificação com o botão de alternância desativado.

Se a alternância estiver ativada, os novos ativos em um pai serão selecionados automaticamente se o pai for total ou parcialmente selecionado quando você executar a verificação novamente. O comportamento de inclusão é o mesmo de antes da introdução da alternância.

Captura de tela que mostra o escopo da sua página de verificação com o botão de alternância ativado.

Observação

  • A disponibilidade do botão de alternância depende do tipo de fonte de dados. Atualmente, ele está disponível em visualização pública para fontes, incluindo o Armazenamento de Blobs do Azure, o Azure Data Lake Storage Gen 1, o Azure Data Lake Storage Gen 2, os Arquivos do Azure e o pool de SQL dedicado do Azure (anteriormente SQL DW).
  • Para todas as verificações criadas ou agendadas antes da introdução da alternância, o estado de alternância é definido como Ativado e não pode ser alterado. Para qualquer verificação criada ou agendada após a introdução da alternância, o estado de alternância não pode ser alterado após a verificação ser salva. Você precisa criar uma nova verificação para alterar o estado de alternância.
  • Quando a alternância está desativada, para fontes de tipo de armazenamento como o Azure Data Lake Storage Gen 2, pode levar até quatro horas para que a experiência de navegação por tipo de origem se torne totalmente disponível após a conclusão do trabalho de verificação.

Limitações conhecidas

Quando a alternância estiver desativada:

  • As entidades de arquivo em um pai parcialmente selecionado não são verificadas.
  • Se todas as entidades existentes sob um pai forem explicitamente selecionadas, o pai será considerado totalmente selecionado e todos os novos ativos sob o pai serão incluídos quando você executar a verificação novamente.

Personalizar o nível de verificação

Na terminologia do Mapa de Dados, existem três níveis diferentes de varredura com base no escopo e nas funcionalidades dos metadados:

  • Varredura L1: extrai informações básicas e metadados, como nome de arquivo, tamanho e nome totalmente qualificado
  • L2 scan: extrai o esquema para tipos de arquivos estruturados e tabelas de banco de dados
  • Verificação L3: Extrai o esquema quando aplicável e sujeita o arquivo amostrado ao sistema e às regras de classificação personalizadas

Ao configurar uma nova verificação ou editar uma verificação existente, você pode personalizar o nível de verificação para verificar as fontes de dados que suportam a configuração do nível de verificação.

Captura de tela que mostra a lista suspensa para selecionar os níveis de verificação.

Por padrão, a "Detecção automática" será selecionada, o que significa que o Microsoft Purview aplica o nível de verificação mais alto disponível para essa fonte de dados. Tome o Banco de Dados SQL do Azure como exemplo, a "Detecção automática" será resolvida como "Nível 3" quando a verificação for executada, pois a fonte de dados já deu suporte à classificação no Microsoft Purview. O nível de verificação nos detalhes de execução de verificação mostra o nível real aplicado.

Captura de tela que mostra o nível de verificação real aplicado.

Para todas as execuções de verificação no histórico de verificação concluídas antes de personalizar o nível de verificação como um novo recurso, o nível de verificação será definido e exibido como Detecção automática.

Captura de tela que mostra o nível de verificação como detecção automática.

  • Quando um nível de digitalização mais alto fica disponível para uma fonte de dados, as verificações salvas ou agendadas que têm o nível de verificação definido como Detecção automática aplicam automaticamente o novo nível de verificação. Por exemplo, se a classificação como um novo recurso estiver habilitada para uma determinada fonte de dados, todas as verificações existentes nessa fonte de dados aplicarão automaticamente a classificação.

  • A configuração do nível de varredura é exibida na interface de monitoramento de varredura para cada execução de varredura.

  • Se você selecionar Nível 1, a verificação retornará apenas metadados técnicos básicos, como nome do ativo, tamanho do ativo, carimbo de data/hora modificado e muito mais, com base na disponibilidade de metadados existentes de uma fonte de dados específica. Para o Banco de Dados SQL, o processo cria entidades de ativo como tabelas no Mapa de Dados, mas não extrai o esquema da tabela. (Observação: os usuários ainda podem ver o esquema da tabela por meio da visualização ao vivo se tiverem as permissões necessárias no sistema de origem).

  • Se você selecionar Nível 2, a verificação retornará esquemas de tabela e metadados técnicos básicos, mas não executará amostragem e classificação de dados. Para o Banco de Dados SQL do Azure, as entidades de ativo de tabela capturam o esquema da tabela sem informações de classificação.

  • Se você selecionar o Nível 3, a verificação realizará a amostragem e a classificação dos dados. Esta é uma configuração padrão para a verificação do Banco de Dados SQL do Azure antes do nível de verificação como um novo recurso é introduzido.

  • Se você definir uma verificação agendada para um nível de verificação mais baixo e modificá-la posteriormente para um nível de verificação mais alto, a próxima execução de verificação executará automaticamente uma verificação completa e atualizará todos os ativos de dados existentes da fonte de dados com metadados introduzidos por uma configuração de nível de verificação mais alta. Por exemplo, quando você altera um conjunto de verificações agendadas com Nível 2 em um Banco de Dados SQL do Azure para Nível 3, a próxima verificação executada é uma verificação completa e atualiza todos os ativos de tabela e exibição do Banco SQL do Azure existentes com informações de classificação. Todas as varreduras posteriores são retomadas como varreduras incrementais definidas com o Nível 3.

  • Se você definir uma verificação agendada para um nível de verificação mais alto e modificá-la posteriormente para um nível de verificação mais baixo, a próxima execução de verificação continuará a executar uma verificação incremental e todos os novos ativos de dados da fonte de dados terão apenas metadados introduzidos por uma configuração de nível de verificação mais baixa. Por exemplo, quando você altera um conjunto de verificação agendado com Nível 3 em um Banco de Dados SQL do Azure para Nível 2, a próxima verificação executada é uma verificação incremental e todos os novos ativos de tabela e exibição do Banco de Dados SQL do Azure adicionados no Mapa de Dados não têm informações de classificação. Todos os ativos de dados existentes ainda mantêm as informações de classificação geradas a partir do conjunto de varredura anterior com o Nível 3.

Observação

  • A personalização do nível de verificação está disponível no momento para as seguintes fontes de dados: Banco de Dados SQL do Azure, Instância Gerenciada de SQL do Azure Azure Cosmos DB para NoSQL, Banco de Dados do Azure para PostgreSQL, Banco de Dados do Azure do Azure para MySQL, Azure Data Lake Storage Gen2, Armazenamento de Blobs do Azure, Arquivos do Azure, Azure Synapse Analytics, Azure Pool de SQL dedicado (antigo SQL DW), Azure Data Explorer, Dataverse Azure Vários (Azure assinatura), Azure Vários (Azure Grupo de Recursos), Snowflake Azure Catálogo do Databricks Unity
  • Atualmente, o recurso está disponível apenas no runtime de integração do Azure e no runtime de integração da Rede Virtual Gerenciada v2.

Verificar conjunto de regras

Um conjunto de regras de verificação determina os tipos de informações que uma verificação procura quando está sendo executada em uma de suas fontes. As regras disponíveis dependem do tipo de fonte que você está verificando, mas incluem itens como os tipos de arquivo que você deve verificar e os tipos de classificações necessários.

Muitos tipos de fonte de dados já têm conjuntos de regras de verificação do sistema, mas você também pode criar seus próprios conjuntos de regras de verificação para adaptar suas verificações à sua organização.

Agende sua verificação

O Microsoft Purview oferece a opção de verificar diariamente, semanalmente ou mensalmente em um horário específico que você escolher. Saiba mais sobre as opções de agendamento com suporte. Verificações diárias ou semanais podem ser apropriadas para fontes de dados com estruturas que estão ativamente em desenvolvimento ou mudam com frequência. A varredura mensal é mais apropriada para fontes de dados que mudam com pouca frequência. Trabalhe com o administrador da origem que você deseja examinar para identificar um momento em que as demandas de computação na origem são baixas.

Como as verificações detectam ativos excluídos

Um catálogo do Microsoft Purview só tem conhecimento do estado de um repositório de dados quando executa uma verificação. Para que o catálogo saiba se um arquivo, tabela ou contêiner foi excluído, ele compara a última saída de verificação com a saída de verificação atual. Por exemplo, suponha que a última vez que você verificou uma conta do Azure Data Lake Storage Gen2, ela incluiu uma pasta chamada folder1. Quando a mesma conta for verificada novamente, a pasta1 estará ausente. Portanto, o catálogo pressupõe que a pasta foi excluída.

Dica

Devido à forma como os arquivos excluídos são detectados, pode ser necessário várias verificações bem-sucedidas para detectar e resolver os ativos excluídos. Se o Catálogo unificado não estiver registrando exclusões para uma verificação com escopo, tente várias verificações completas para resolver o problema.

Detectando arquivos excluídos

A lógica para detectar arquivos ausentes funciona para várias verificações feitas pelo mesmo usuário e por usuários diferentes. Por exemplo, suponha que um usuário execute uma verificação única em um armazenamento de dados do Data Lake Storage Gen2 nas pastas A, B e C. Posteriormente, um usuário diferente na mesma conta executa uma verificação única diferente nas pastas C, D e E do mesmo armazenamento de dados. Como a pasta C foi verificada duas vezes, o catálogo verifica se há possíveis exclusões. No entanto, as pastas A, B, D e E foram verificadas apenas uma vez e o catálogo não as marca para ativos excluídos.

Para manter os arquivos excluídos fora do catálogo, é importante executar verificações regulares. O intervalo de verificação é importante, pois o catálogo não pode detectar ativos excluídos até que outra verificação seja executada. Portanto, se você executar verificações uma vez por mês em um repositório específico, o catálogo não poderá detectar nenhum ativo de dados excluído nesse armazenamento até que você execute a próxima verificação um mês depois.

Quando você enumera grandes armazenamentos de dados como o Data Lake Storage Gen2, há várias maneiras (incluindo erros de enumeração e eventos descartados) de perder informações. Uma verificação específica pode não detectar que um arquivo foi criado ou excluído. Portanto, a menos que o catálogo tenha certeza de que um arquivo foi excluído, ele não o exclui do catálogo. Essa estratégia significa que pode haver erros quando um arquivo que não existe no armazenamento de dados verificado ainda existe no catálogo. Em alguns casos, um repositório de dados pode precisar ser verificado duas ou três vezes antes de capturar determinados ativos excluídos.

Observação

  • Os ativos marcados para exclusão são excluídos após uma verificação bem-sucedida. Os ativos excluídos podem continuar visíveis em seu catálogo por algum tempo antes de serem processados e removidos.
  • A detecção de exclusão tem suporte apenas para essas fontes no Microsoft Purview: workspaces do Azure Synapse Analytics, Azure SQL Server habilitados para Arc, Armazenamento de Blobs do Azure, Arquivos do Azure, Azure Cosmos DB Azure Data Explorer, Banco de Dados do Azure para MySQL, Banco de Dados do Azure para PostgreSQL, Azure Pool de SQL Dedicado, Azure Machine Learning, Banco de Dados SQL do Azure e Instância Gerenciada do SQL do Azure. Para essas fontes, quando um ativo é excluído da fonte de dados, as verificações subsequentes removerão automaticamente os metadados e a linhagem correspondentes no Microsoft Purview.

Ingestão

A ingestão é o processo que preenche o Mapa de Dados com metadados coletados por meio de seus vários processos.

Observação

A contagem combinada de todos os objetos filhos (entidades referidas) e contatos (proprietário, especialista) não deve exceder 20.000 entidades.

Ingestão de varreduras

O processo de digitalização identifica metadados técnicos ou classificações e os envia para ingestão. A ingestão analisa a entrada da verificação, aplica padrões de conjunto de recursos, preenche as informações de linhagem disponíveis e, em seguida, carrega automaticamente o Mapa de Dados. Você pode descobrir ou organizar ativos e esquemas somente após a conclusão da ingestão. Se a verificação for concluída, mas você não vir seus ativos no Mapa de dados ou no catálogo, será necessário aguardar a conclusão do processo de assimilação.

Ingestão de conexões de linhagem

Você pode conectar recursos como o Azure Data Factory e o Azure Synapse ao Microsoft Purview para trazer informações de fonte de dados e linhagem para o Mapa de Dados. Por exemplo, quando um pipeline de cópia é executado em um Azure Data Factory conectado ao Microsoft Purview, o serviço ingere metadados sobre as fontes de entrada, a atividade e as fontes de saída. As informações são adicionadas ao Mapa de Dados.

Se você adicionar uma fonte de dados ao Mapa de Dados por meio de uma verificação, as informações de linhagem sobre a atividade serão adicionadas à fonte existente. Se você ainda não adicionou a fonte de dados ao Mapa de Dados, o processo de ingestão de linhagem a adicionará à coleção raiz com suas informações de linhagem.

Para obter mais informações sobre as conexões de linhagem disponíveis, consulte o guia do usuário de linhagem.

Próximas etapas

Para obter mais informações ou instruções específicas para verificar fontes, siga os links abaixo.