Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O Lakeflow Connect fornece padrões e técnicas para otimizar os pipelines de ingestão gerenciada. Use esses padrões para controlar quais dados são ingeridos, gerenciar atualizações de pipeline e configurar comportamentos avançados.
Nem todos os conectores dão suporte aos padrões comuns nesta seção.
| Tópico | Description |
|---|---|
| Seleção de coluna | Selecione ou exclua colunas específicas durante a ingestão para reduzir o volume de dados e melhorar o desempenho. |
| Modo contínuo | Execute um pipeline integrado de CDC como um stream sempre ativo para ingestão de baixa latência. |
| Propriedades da tabela Delta | Defina propriedades da tabela Delta Lake, como expansão de tipo, nas tabelas de destino por meio da especificação do pipeline. |
| Atualização completa | Realize um recarregamento completo dos seus dados a partir do sistema de origem. |
| Clustering líquido | Habilite o clustering líquido nas tabelas de destino para otimizar o layout de dados e melhorar o desempenho da consulta. |
| Acompanhamento de histórico | Acompanhe as alterações históricas em seus dados usando SCD (Dimensão de Alteração Lenta) tipo 2. |
| Monitorar custos | Use tabelas do sistema para acompanhar os custos do pipeline e monitorar padrões de uso. |
| Pipelines de vários destinos | Ingerir dados de uma única fonte para vários catálogos ou tabelas de destino. |
| Manutenção de pipeline | Gerenciar atualizações de pipeline, pausas e solução de problemas de fluxos de trabalho. |
| Marcação de pipeline | Aplique tags de pipeline para organização de recursos, rastreamento de propriedade e atribuição de custo. |
| Filtragem de linhas | Filtrar linhas durante a ingestão usando condições semelhantes a SQL. |
| Fechamento inteligente | Entenda como uma atualização de pipeline do CDC integrada disparada é interrompida automaticamente depois que ela alcança a origem, reduzindo o custo e limitando o runtime de atualização. |
| Configurar a identidade Executar como | Configure quais permissões de identidade serão usadas quando o pipeline for executado. |
| Linhagem de dados de origem | Rastreie a linhagem das tabelas de origem dos dados ingeridos para que as tabelas de origem apareçam nas exibições de linhagem de ponta a ponta do Unity Catalog. |
| Nomear tabelas de destino | Nomeie tabelas de destino. Por padrão, uma tabela de destino recebe o nome da tabela de origem correspondente. No entanto, nomear uma tabela de destino é útil quando você ingerir o mesmo objeto de origem duas vezes no mesmo esquema. Conectores gerenciados não dão suporte a nomes de tabela duplicados no mesmo esquema de destino. Nomear uma tabela de destino também pode alinhar tabelas às convenções de nomenclatura da sua organização. |
| Validação de certificado do servidor TLS | Configure a validação de certificado TLS para pipelines do conector de banco de dados para verificar a identidade do servidor de banco de dados de origem e evitar ataques de PITM (person-in-the-middle). |