Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Este artigo explica as etapas necessárias para conectar uma conta do Azure Data Factory a uma conta do Microsoft Purview para acompanhar a linhagem de dados e ingerir fontes de dados. O artigo também explica detalhes do escopo de cobertura de atividades e padrões de linhagem com suporte.
Quando você conecta um Azure Data Factory ao Microsoft Purview, sempre que uma atividade do Azure Data Factory com suporte é executada, ela ingere automaticamente metadados sobre os dados de origem da atividade, os dados de saída e a atividade no Mapa de Dados do Microsoft Purview.
Se uma fonte de dados já estiver verificada e existir no Mapa de Dados, o processo de ingestão adicionará as informações de linhagem do Azure Data Factory a essa fonte existente. Se a origem ou saída não existir no Mapa de Dados e tiver suporte da linhagem do Azure Data Factory, o Microsoft Purview adicionará automaticamente seus metadados do Azure Data Factory no Mapa de Dados na coleção raiz.
Essa conexão é uma excelente maneira de monitorar seu patrimônio de dados à medida que os usuários movem e transformam informações usando o Azure Data Factory.
Exibir conexões existentes do Data Factory
Várias fábricas de dados do Azure podem se conectar a um único Purview para enviar informações de linhagem por push. O limite atual permite que você conecte até 10 contas do Azure Data Factory por vez a partir do centro de gerenciamento do Microsoft Purview. Para mostrar a lista de contas do Azure Data Factory conectadas à sua conta do Microsoft Purview, siga estas etapas:
Selecione Gerenciamento no painel de navegação esquerdo.
Em Conexões de linhagem, selecione Data Factory.
A lista de conexões do Data Factory é exibida.
Observe os vários valores para o Status da conexão:
- Conectado: o Data Factory está conectado à conta do Microsoft Purview.
- Desconectado: o Data Factory tem acesso ao catálogo, mas está conectado a outro catálogo. Como resultado, a linhagem de dados não será relatada ao catálogo automaticamente.
- Desconhecido: o usuário atual não tem acesso ao Data Factory, portanto, o status da conexão é desconhecido.
Observação
Para exibir as conexões do Data Factory, você precisa ter a função a seguir. Não há suporte para a herança de função do grupo de gerenciamento. Função dos administradores da coleção na coleção raiz.
Criar nova conexão do Azure Data Factory
Observação
Para adicionar ou remover as conexões do Azure Data Factory, você precisa ter a função a seguir. Não há suporte para a herança de função do grupo de gerenciamento. Função dos administradores da coleção na coleção raiz.
Além disso, você precisa ser o "Proprietário" ou "Colaborador" do Azure Data Factory.
O Azure Data Factory precisa ter a identidade gerenciada atribuída pelo sistema habilitada.
Siga as etapas abaixo para conectar um Azure Data Factory existente à sua conta do Microsoft Purview. Você também pode conectar o Data Factory à conta do Microsoft Purview pelo ADF.
Selecione Gerenciamento no painel de navegação esquerdo.
Em Conexões de linhagem, selecione Data Factory.
Na página Conexão do Data Factory , selecione Novo.
Selecione sua conta do Azure Data Factory na lista e selecione OK. Você também pode filtrar por nome de assinatura para limitar sua lista.
Algumas instâncias do Azure Data Factory poderão ser desabilitadas se o Azure Data Factory já estiver conectado à conta atual do Purview ou se o Azure Data Factory não tiver uma identidade gerenciada. Uma mensagem de aviso será exibida se qualquer um dos Data Factorys do Azure selecionados já estiver conectado a outra conta do Microsoft Purview. Quando você seleciona OK, a conexão do Azure Data Factory com a outra conta do Microsoft Purview é desconectada. Nenhuma outra confirmação é necessária.
Observação
Você pode adicionar até 10 contas do Azure Data Factory de uma vez. Para adicionar mais de 10 contas do Azure Data Factory, adicione-as em vários lotes.
Como funciona a autenticação
O Azure Data Factory usa sua identidade gerenciada para autenticar operações de push de linhagem do Microsoft Purview. Quando você conecta seu Azure Data Factory ao Purview na interface do usuário, ele adiciona a atribuição de função automaticamente.
Conceda à identidade gerenciada do Azure Data Factory a função Curador de Dados na coleção raiz do Microsoft Purview. Para saber mais, confira Controle de acesso no Microsoft Purview e Adicionar funções e restringir o acesso por meio de coleções.
Remover conexões do Data Factory
Importante
Mesmo que a conexão com o Data Factory seja removida, qualquer ingestão em andamento não será cancelada. A ingestão de linhagem do Azure Data Factory é uma operação assíncrona.
Para remover uma conexão do Azure Data Factory, conclua as seguintes etapas:
Na página Conexão do Data Factory, selecione o botão Remover ao lado de uma ou mais conexões do Azure Data Factory.
Selecione Confirmar no pop-up para excluir as conexões selecionadas do Azure Data Factory.
Monitorar os links do Azure Data Factory
No portal do Microsoft Purview, você pode monitorar os links do Data Factory.
Atividades do Azure Data Factory com suporte
O Microsoft Purview captura a linhagem de runtime das seguintes atividades do Azure Data Factory:
Importante
O Microsoft Purview descartará a linhagem se a origem ou o destino usar um sistema de armazenamento de dados sem suporte.
A integração entre o Azure Data Factory e o Microsoft Purview dá suporte apenas a um subconjunto dos sistemas de dados compatíveis com o Azure Data Factory. Para obter mais informações, consulte as seções a seguir.
atividade Copy support
| Armazenamento de dados | Com suporte |
|---|---|
| Azure Storage Blob | Sim |
| Azure Cognitive Search | Sim |
| Azure Cosmos DB para NoSQL * | Sim |
| Azure Cosmos DB para MongoDB * | Sim |
| Azure Data Explorer * | Sim |
| Azure Data Lake Storage Gen1 | Sim |
| Azure Data Lake Storage Gen2 | Sim |
| Banco de Dados do Azure para MariaDB * | Sim |
| Banco de Dados do Azure para MySQL * | Sim |
| Banco de Dados de Dados do Azure para PostgreSQL * | Sim |
| Arquivos do Azure | Sim |
| Banco de Dados SQL do Azure * | Sim |
| Instância Gerenciada de SQL do Azure * | Sim |
| Azure Synapse Analytics * | Sim |
| Pool de SQL dedicado do Azure (antigo SQL DW) * | Sim |
| Armazenamento de Tabelas do Azure | Sim |
| Amazon S3 | Sim |
| Hive * | Sim |
| Oracle * | Sim |
| Tabela SAP (ao conectar-se ao SAP ECC ou SAP S/4HANA) | Sim |
| SQL Server * | Sim |
| Teradata * | Sim |
* No momento, o Microsoft Purview não dá suporte a consulta ou procedimento armazenado para linhagem ou verificação. A linhagem é limitada apenas a fontes de tabela e exibição.
Se você usar o Integration Runtime auto-hospedado, observe a versão mínima com suporte de linhagem para:
- Qualquer caso de uso: versão 5.9.7885.3 ou posterior
- Copiando dados do Oracle: versão 5.10 ou posterior
- Copiando dados para o Azure Synapse Analytics por meio do comando COPY ou do PolyBase: versão 5.10 ou posterior
Limitações na linhagem da atividade de cópia
No momento, se você usar os seguintes recursos de atividade de cópia, a linhagem ainda não terá suporte:
- Copie dados para o Azure Data Lake Storage Gen1 usando o formato binário.
- Configuração de compactação para arquivos binários, texto delimitado, Excel, JSON e XML.
- Opções de partição de origem para o Banco de Dados SQL do Azure, a Instância Gerenciada do SQL do Azure, o Azure Synapse Analytics, o SQL Server e a Tabela SAP.
- Copie dados para o coletor baseado em arquivo com a configuração de máx. linhas por arquivo.
- Atualmente, a linhagem no nível da coluna não é suportada pela atividade de cópia quando origem/coletor é conjunto de recursos.
Além da linhagem, o esquema do ativo de dados (mostrado na guia Ativo -> Esquema) é relatado para os seguintes conectores:
- Arquivos CSV e Parquet no blob do Azure, Arquivos do Azure, ADLS Gen1, ADLS Gen2 e Amazon S3
- Azure Data Explorer, Banco de Dados SQL do Azure, Instância Gerenciada de SQL do Azure, Análise de Azure Synapse, SQL Server, Teradata
Suporte ao Fluxo de Dados
| Armazenamento de dados | Com suporte |
|---|---|
| Azure Storage Blob | Sim |
| Azure Cosmos DB para NoSQL * | Sim |
| Azure Data Lake Storage Gen1 | Sim |
| Azure Data Lake Storage Gen2 | Sim |
| Banco de Dados do Azure para MySQL * | Sim |
| Banco de Dados de Dados do Azure para PostgreSQL * | Sim |
| Banco de Dados SQL do Azure * | Sim |
| Instância Gerenciada de SQL do Azure * | Sim |
| Azure Synapse Analytics * | Sim |
| Pool de SQL dedicado do Azure (antigo SQL DW) * | Sim |
* No momento, o Microsoft Purview não dá suporte a consulta ou procedimento armazenado para linhagem ou verificação. A linhagem é limitada apenas a fontes de tabela e exibição.
Limitações na linhagem de fluxo de dados
- A linhagem do fluxo de dados pode gerar um conjunto de recursos no nível da pasta sem visibilidade dos arquivos envolvidos.
- Atualmente, não há suporte para a linhagem no nível de coluna quando origem/coletor é conjunto de recursos.
- Para a linhagem da atividade de fluxo de dados, o Microsoft Purview dá suporte apenas à exibição da origem e do coletor envolvidos. A linhagem detalhada para a transformação do fluxo de dados ainda não tem suporte.
- A linhagem não é suportada quando os flowlets fazem parte do fluxo de dados.
- Atualmente, o Purview não dá suporte a relatórios de linhagem para tabelas do Synapse (LakeHouse DB/Workspace DB)
Executar o suporte do Pacote SSIS
Consulte os armazenamentos de dados com suporte.
Acessar conta segura do Microsoft Purview
Se um firewall proteger sua conta do Microsoft Purview, saiba como permitir que o Azure Data Factory acesse uma conta segura do Microsoft Purview por meio de pontos de extremidade privados do Microsoft Purview.
Traga a linhagem do Azure Data Factory para o Microsoft Purview
Para obter instruções detalhadas, confira o Tutorial: Enviar dados de linhagem do Data Factory para o Microsoft Purview.
Padrões de linhagem com suporte
O Microsoft Purview dá suporte a vários padrões de linhagem. Os dados de linhagem gerados dependem do tipo de origem e coletor usados nas atividades do Azure Data Factory. Embora o Azure Data Factory dê suporte a mais de 80 fontes e coletores, o Microsoft Purview dá suporte a apenas um subconjunto. Para obter as fontes e coletores com suporte, consulte Atividades do Azure Data Factory com suporte.
Para configurar o Azure Data Factory para enviar informações de linhagem, confira Introdução à linhagem.
Você pode encontrar informações na exibição de linhagem usando os seguintes métodos:
- Na guia Linhagem , passe o mouse sobre as formas para visualizar informações adicionais sobre o ativo na dica de ferramenta.
- Selecione o nó ou a borda para ver o tipo de ativo ao qual ele pertence ou para alternar ativos.
- A guia Linhagem exibe colunas de um conjunto de dados no lado esquerdo. Para obter mais informações sobre a linhagem no nível da coluna, consulte Linhagem da coluna do conjunto de dados.
Linhagem de dados para operações 1:1
O padrão mais comum para capturar a linhagem de dados move dados de um único conjunto de dados de entrada para um único conjunto de dados de saída, com um processo intermediário.
Um exemplo desse padrão inclui os seguintes componentes:
- 1 origem/entrada: Cliente (Tabela SQL)
- 1 coletor/saída: Customer1.csv (Azure Blob)
- 1 processo: CopyCustomerInfo1#Customer1.csv (Data Factory atividade Copy)
Movimentação de dados com linhagem 1:1 e suporte a curinga
Outro cenário comum para capturar a linhagem é usar um curinga para copiar arquivos de um único conjunto de dados de entrada para um único conjunto de dados de saída. O curinga permite que a atividade de cópia corresponda a vários arquivos para cópia usando uma parte comum do nome do arquivo. O Microsoft Purview captura a linhagem no nível do arquivo para cada arquivo individual copiado pela atividade de cópia correspondente.
Um exemplo desse padrão inclui os seguintes componentes:
- Origem/entrada: CustomerCall*.csv (caminho ADLS Gen2)
- Coletor/saída: CustomerCall*.csv (arquivo de blob de Azure)
- 1 processo: CopyGen2ToBlob#CustomerCall.csv (Data Factory atividade Copy)
Movimentação de dados com linhagem n:1
Você pode usar as atividades de Fluxo de Dados para executar operações de dados como mesclar, ingressar e assim por diante. Você pode usar mais de um conjunto de dados de origem para produzir um conjunto de dados de destino. Neste exemplo, o Microsoft Purview captura a linhagem no nível do arquivo para arquivos de entrada individuais em uma tabela SQL que faz parte de uma atividade de Fluxo de Dados.
Um exemplo desse padrão inclui os seguintes componentes:
- 2 fontes/entradas: Customer.csv, Sales.parquet (caminho ADLS Gen2)
- 1 coletor/saída: Dados da empresa (tabela SQL do Azure)
- 1 processo: DataFlowBlobsToSQL (atividade de Fluxo de Dados do Data Factory)
Linhagem para conjuntos de recursos
Um conjunto de recursos é um objeto lógico no catálogo que representa muitos arquivos de partição no armazenamento subjacente. Para obter mais informações, consulte Noções básicas sobre conjuntos de recursos. Quando o Microsoft Purview captura a linhagem do Azure Data Factory, ele aplica as regras para normalizar os arquivos de partição individuais e criar um único objeto lógico.
No exemplo a seguir, um conjunto de recursos do Azure Data Lake Gen2 é produzido a partir de um Blob do Azure:
- 1 origem/entrada: Employee_management.csv (Azure Blob)
- 1 coletor/saída: Employee_management.csv (Azure Data Lake Gen 2)
- 1 processo: CopyBlobToAdlsGen2_RS (Azure Data Factory atividade Copy)
Próximas etapas
Tutorial: Enviar dados de linhagem do Data Factory por push para o Microsoft Purview