Padrões comuns para pipelines de ingestão gerenciada

O Lakeflow Connect fornece padrões e técnicas para otimizar os pipelines de ingestão gerenciada. Use esses padrões para controlar quais dados são ingeridos, gerenciar atualizações de pipeline e configurar comportamentos avançados.

Nem todos os conectores dão suporte aos padrões comuns nesta seção.

Tópico Description
Seleção de coluna Selecione ou exclua colunas específicas durante a ingestão para reduzir o volume de dados e melhorar o desempenho.
Modo contínuo Execute um pipeline integrado de CDC como um stream sempre ativo para ingestão de baixa latência.
Propriedades da tabela Delta Defina propriedades da tabela Delta Lake, como expansão de tipo, nas tabelas de destino por meio da especificação do pipeline.
Atualização completa Realize um recarregamento completo dos seus dados a partir do sistema de origem.
Clustering líquido Habilite o clustering líquido nas tabelas de destino para otimizar o layout de dados e melhorar o desempenho da consulta.
Acompanhamento de histórico Acompanhe as alterações históricas em seus dados usando SCD (Dimensão de Alteração Lenta) tipo 2.
Monitorar custos Use tabelas do sistema para acompanhar os custos do pipeline e monitorar padrões de uso.
Pipelines de vários destinos Ingerir dados de uma única fonte para vários catálogos ou tabelas de destino.
Manutenção de pipeline Gerenciar atualizações de pipeline, pausas e solução de problemas de fluxos de trabalho.
Marcação de pipeline Aplique tags de pipeline para organização de recursos, rastreamento de propriedade e atribuição de custo.
Filtragem de linhas Filtrar linhas durante a ingestão usando condições semelhantes a SQL.
Fechamento inteligente Entenda como uma atualização de pipeline do CDC integrada disparada é interrompida automaticamente depois que ela alcança a origem, reduzindo o custo e limitando o runtime de atualização.
Configurar a identidade Executar como Configure quais permissões de identidade serão usadas quando o pipeline for executado.
Linhagem de dados de origem Rastreie a linhagem das tabelas de origem dos dados ingeridos para que as tabelas de origem apareçam nas exibições de linhagem de ponta a ponta do Unity Catalog.
Nomear tabelas de destino Nomeie tabelas de destino. Por padrão, uma tabela de destino recebe o nome da tabela de origem correspondente. No entanto, nomear uma tabela de destino é útil quando você ingerir o mesmo objeto de origem duas vezes no mesmo esquema. Conectores gerenciados não dão suporte a nomes de tabela duplicados no mesmo esquema de destino. Nomear uma tabela de destino também pode alinhar tabelas às convenções de nomenclatura da sua organização.
Validação de certificado do servidor TLS Configure a validação de certificado TLS para pipelines do conector de banco de dados para verificar a identidade do servidor de banco de dados de origem e evitar ataques de PITM (person-in-the-middle).