Padrões comuns para pipelines de ingestão geridos de forma automatizada

O Lakeflow Connect fornece padrões e técnicas para otimizar os seus pipelines de ingestão geridos. Use estes padrões para controlar quais os dados ingeridos, gerir atualizações do pipeline e configurar comportamentos avançados.

Nem todos os conectores suportam os padrões comuns desta secção.

Tópico Description
Seleção de coluna Selecione ou exclua colunas específicas durante a ingestão para reduzir o volume de dados e melhorar o desempenho.
Modo contínuo Execute um pipeline CDC integrado como um fluxo continuamente ativo para uma ingestão de baixa latência.
Propriedades da tabela delta Defina propriedades da tabela Delta Lake, como a expansão de tipos, nas tabelas de destino na especificação do pipeline.
Atualização completa Forçar um recarregamento completo dos dados a partir do sistema de origem.
Agrupamento de líquidos Permitir a clusterização líquida em tabelas de destino para otimizar o layout dos dados e melhorar o desempenho das consultas.
Acompanhamento histórico Acompanhe as alterações históricas nos seus dados usando a Dimensão Que Muda Lentamente (SCD) tipo 2.
Monitorizar custos Utilize tabelas de sistema para acompanhar os custos dos pipelines e monitorizar padrões de utilização.
Pipelines multi-destino Importar dados de uma única fonte para várias tabelas ou catálogos de destino.
Manutenção de tubulações Gerir atualizações do pipeline, pausas e fluxos de trabalho de resolução de problemas.
Marcação de pipeline Aplique etiquetas de pipeline para organização de recursos, acompanhamento de propriedade e atribuição de custos.
Filtragem por linhas Filtrar as linhas durante a ingestão usando condições semelhantes ao SQL.
Fecho inteligente Compreenda como uma atualização de pipeline de CDC integrada acionada pára automaticamente depois de se sincronizar com a origem, reduzindo os custos e delimitando a duração da execução da atualização.
Configurar a identidade de Executar como Configure quais as permissões da identidade a serem usadas quando o pipeline é executado.
Linhagem dos dados de origem Monitorize a linhagem das tabelas de origem dos dados ingeridos, para que as tabelas de origem apareçam nas vistas de linhagem de ponta a ponta do Unity Catalog.
Nomear tabelas de destino Nomeie tabelas de destino. Por defeito, uma tabela de destino recebe o nome da tabela de origem correspondente. No entanto, nomear uma tabela de destino é útil quando ingeres o mesmo objeto de origem duas vezes no mesmo esquema. Os conectores geridos não suportam nomes duplicados de tabelas no mesmo esquema de destino. Nomear uma tabela de destino também pode alinhar as tabelas às convenções de nomenclatura da sua organização.
Validação de certificados de servidor TLS Configure a validação de certificados TLS para pipelines de conectores de banco de dados a fim de verificar a identidade do servidor de origem da banco de dados e prevenir ataques de intermediário.