Linhagem de dados no Catálogo de Dados clássico

Este artigo fornece uma visão geral da linhagem de dados no Catálogo de Dados do Microsoft Purview clássico. Ele também detalha como os sistemas de dados podem se integrar ao catálogo para capturar a linhagem de dados. O Microsoft Purview pode capturar a linhagem de dados em diferentes partes do acervo de dados da sua organização e em diferentes níveis de preparação, incluindo:

  • Dados brutos preparados de várias plataformas
  • Dados transformados e preparados
  • Dados usados por plataformas de visualização

Para linhagem de dados no Catálogo unificado, veja como exibir detalhes do ativo de dados e informações de linhagem.

Casos de uso

A linhagem de dados é amplamente compreendida como o ciclo de vida que abrange a origem dos dados e para onde eles se movem ao longo do tempo através do acervo de dados. Ele é usado para diferentes tipos de cenários retrospectivos, como solução de problemas, rastreamento da causa raiz em pipelines de dados e depuração. A linhagem também é usada para análise de qualidade de dados, conformidade e cenários hipotéticos, geralmente chamados de análise de impacto. A linhagem é representada visualmente para mostrar os dados que se movem da origem para o destino, incluindo como os dados foram transformados. Dada a complexidade da maioria dos ambientes de dados corporativos, essas exibições podem ser difíceis de entender sem fazer alguma consolidação ou mascaramento de pontos de dados periféricos.

Experiência de linhagem no Catálogo de Dados clássico

O catálogo se conecta a outros sistemas de processamento, armazenamento e análise de dados para extrair informações de linhagem. As informações são combinadas para representar uma experiência de linhagem genérica e específica do cenário no catálogo.

linhagem de ponta a ponta mostrando dados copiados do armazenamento de blobs até o Power BI dashboard

Seu patrimônio de dados pode incluir sistemas que fazem extração, transformação de dados (sistemas ETL/ELT), análise e sistemas de visualização. Cada um dos sistemas captura metadados estáticos e operacionais avançados que descrevem o estado e a qualidade dos dados dentro do limite do sistema. O objetivo da linhagem em um catálogo de dados é extrair o movimento, a transformação e os metadados operacionais de cada sistema de dados com a menor granularidade possível.

O exemplo a seguir é um caso de uso típico de dados que se movem por vários sistemas, em que um catálogo se conectaria a cada um dos sistemas para linhagem.

  • O Data Factory copia dados da zona local/bruta para uma zona de destino na nuvem.
  • Sistemas de processamento de dados como Synapse e Databricks processariam e transformariam dados da zona de destino para a zona selecionada usando notebooks.
  • Processamento adicional de dados em modelos analíticos para desempenho e agregação de consulta ideais.
  • Os sistemas de visualização de dados consumirão os conjuntos de dados e processarão seu metamodelo para criar um painel de BI, experimentos de ML e assim por diante.

Granularidade de linhagem

A seção a seguir aborda os detalhes sobre a granularidade da qual as informações de linhagem são coletadas pelo Microsoft Purview. Essa granularidade pode variar com base nos sistemas de dados com suporte no Microsoft Purview.

Linhagem no nível de entidade: Origens > Processar > Destinos

  • A linhagem é representada como um grafo, normalmente contém entidades de origem e destino em sistemas de armazenamento de dados que são conectadas por um processo invocado por um sistema de computação.
  • Os sistemas de dados se conectam ao catálogo para gerar e relatar um objeto exclusivo que faz referência ao objeto físico do sistema de dados subjacente, por exemplo: procedimento armazenado SQL, notebooks e assim por diante.
  • A linhagem de alta fidelidade com outros metadados, como propriedade, é capturada para mostrar a linhagem em um formato legível por humanos para entidades de origem & destino. Por exemplo: linhagem em um nível de tabela do Hive em vez de partições ou nível de arquivo.

Linhagem de nível de coluna ou atributo

Identifique os atributos de uma entidade de origem que é usada para criar ou derivar atributos na entidade de destino. O nome do atributo de origem pode ser retido ou renomeado em um destino. Sistemas como o ADF (Azure Data Factory) podem fazer uma cópia única do ambiente local para a nuvem. Por exemplo: Table1/ColumnA -> Table2/ColumnA.

Status de execução do processo

Para dar suporte à análise de causa raiz e cenários de qualidade de dados, capturamos o status de execução dos trabalhos em sistemas de processamento de dados. Esse requisito não tem nada a ver com a substituição dos recursos de monitoramento de outros sistemas de processamento de dados, nem o objetivo é substituí-los.

Resumo

A linhagem é um recurso crítico para dar suporte a cenários de qualidade, confiança e auditoria. O objetivo de um catálogo de dados é criar uma estrutura robusta em que todos os sistemas de dados em seu ambiente possam se conectar naturalmente e relatar a linhagem. Depois que os metadados estiverem disponíveis, o catálogo poderá reunir os metadados fornecidos pelos sistemas de dados para potencializar os casos de uso de governança de dados.

Próximas etapas