O que é o Lakeflow Connect?

O Lakeflow Connect oferece conectores simples e eficientes para ingerir dados de arquivos locais, aplicativos empresariais populares, bancos de dados, armazenamento em nuvem, barramentos de mensagens e muito mais. Esta página descreve algumas das maneiras pelas quais o Lakeflow Connect pode melhorar o desempenho do ETL. Ele também abrange casos de uso comuns e a variedade de ferramentas de ingestão com suporte, desde conectores totalmente gerenciados até estruturas totalmente personalizáveis.

Conectores por tipo

O Lakeflow Connect organiza conectores de acordo com o tipo de fonte de onde você ingere. Cada tipo possui um conjunto de conectores e uma visão geral de como eles funcionam:

Tipo de conector Descrição
Conectores de banco de dados Faça a ingestão de bancos de dados relacionais, como MySQL, PostgreSQL, Oracle e SQL Server, usando captura de dados de alterações.
Conectores SaaS Importe dados de aplicativos SaaS empresariais, como Salesforce, HubSpot, Jira e Workday.
Conectores de arquivo Ingerir arquivos estruturados e não estruturados de armazenamento de objetos em nuvem e serviços corporativos de arquivos, como Google Drive e SharePoint.
Conectores de streaming Ingira continuamente a partir de barramentos de mensagens e fontes de eventos em streaming, como Apache Kafka e RabbitMQ.
Conectores baseados em consulta Faça a ingestão de dados de bancos de dados consultando diretamente a fonte, sem captura de dados de alterações.
Gravação direta (Zerobus Ingest API) Escreva registros diretamente em tabelas de streaming a partir do seu aplicativo usando a API Zerobus Ingest.

Modelos de serviço flexíveis

O Lakeflow Connect oferece uma ampla gama de conectores para aplicativos empresariais, armazenamento em nuvem, bancos de dados, barramentos de mensagens e muito mais. Ele também oferece a flexibilidade para escolher entre os seguintes:

Opção Descrição
Um serviço totalmente gerenciado Conectores prontos para uso imediato que democratizam o acesso a dados com UIs simples e APIs poderosas. Isso permite que você crie rapidamente pipelines de ingestão robustos, minimizando os custos de manutenção de longo prazo.
Um pipeline personalizado Se você precisar de mais personalização, pode usar pipelines Lakeflow ou Structured Streaming. Por fim, essa versatilidade permite que o Lakeflow Connect atenda às necessidades específicas da sua organização.

Unificação com as principais ferramentas do Databricks

O Lakeflow Connect usa os principais recursos do Databricks para fornecer gerenciamento de dados abrangente. Por exemplo, ele oferece governança ao usar o Catálogo do Unity, orquestração ao usar o Lakeflow Jobs e monitoramento holístico nos seus pipelines. Isso ajuda sua organização a gerenciar a segurança de dados, a qualidade e o custo, unificando os processos de ingestão com outras ferramentas de engenharia de dados. O Lakeflow Connect é criado em uma Plataforma de Inteligência de Dados aberta, com total flexibilidade para incorporar suas ferramentas de terceiros preferenciais. Isso garante uma solução personalizada que se alinhe à sua infraestrutura existente e às estratégias de dados futuras.

Ingestão rápida e escalonável

O Lakeflow Connect usa leituras e gravações incrementais para habilitar a ingestão eficiente. Quando combinado com transformações incrementais downstream, isso pode melhorar significativamente o desempenho de ETL.

Casos de uso comuns

Os clientes ingerem dados para resolver os problemas mais desafiadores de suas organizações. Os casos de uso de exemplo incluem o seguinte:

Caso de uso Descrição
Cliente 360 Medição do desempenho da campanha e da pontuação de clientes em potencial
Gerenciamento de portfólio Maximizando o ROI com modelos históricos e de previsão
Análise do consumidor Personalizando as experiências de compra dos clientes
Recursos humanos centralizados Suporte à força de trabalho da sua organização
Gêmeos digitais Aumentando a eficiência de fabricação
Chatbots RAG Criar chatbots para ajudar os usuários a entender políticas, produtos e muito mais

Camadas da pilha ETL

Alguns conectores operam em um nível da pilha ETL. Por exemplo, o Databricks oferece conectores totalmente gerenciados para aplicativos empresariais, como Salesforce e bancos de dados como o SQL Server. Outros conectores operam em uma camada diferente da pilha ETL. Por exemplo, você pode usar conectores padrão nos pipelines do Lakeflow para ter mais opções de personalização. Da mesma forma, você pode escolher seu nível de personalização para transmitir dados do Apache Kafka, Amazon Kinesis, Google Pub/Sub e Apache Pulsar.

O Databricks recomenda começar com a camada mais gerenciada. Se ele não atender aos seus requisitos (por exemplo, se não der suporte à fonte de dados), desça para a próxima camada.

A tabela a seguir descreve as camadas de produtos de ingestão:

Camada Descrição
Pipelines do Lakeflow Os pipelines do Lakeflow oferecem um framework declarativo para a criação de pipelines de dados. Defina suas transformações e os pipelines do Lakeflow gerenciam orquestração, monitoramento, qualidade de dados, erros e muito mais. Eles se baseiam no Streaming Estruturado para streaming e dão suporte à maioria dos recursos de Streaming Estruturado. Para qualquer recurso de Streaming Estruturado ainda não disponível nos pipelines do Lakeflow, você pode usar as APIs de Streaming Estruturado diretamente.
Conectores totalmente gerenciados Os conectores totalmente gerenciados baseiam-se nos pipelines do Lakeflow, oferecendo ainda mais automação para as fontes de dados mais populares. Eles estendem a funcionalidade dos pipelines do Lakeflow para também incluir autenticação específica da fonte, CDC, tratamento de casos extremos, manutenção de longo prazo da API, novas tentativas automáticas, evolução automática do esquema, entre outros. Portanto, eles oferecem ainda mais automação para quaisquer fontes de dados com suporte.

Conectores gerenciados

Você pode usar conectores totalmente gerenciados para ingerir de aplicativos empresariais e bancos de dados. Consulte os conceitos de conectores do Lakeflow Connect para ver uma lista completa de conectores compatíveis.

As interfaces com suporte incluem:

  • Interface do usuário do Databricks
  • Pacotes de Automação Declarativa
  • Databricks APIs
  • Databricks SDKs
  • CLI do Databricks

Conectores da comunidade

Os conectores da comunidade estendem o Lakeflow Connect a fontes sem suporte para conectores gerenciados. Eles são open-source, construídos e mantidos pela comunidade, e não são apoiados por SLAs do Databricks. Use um conector que a comunidade já tenha registrado para ingerir dados de uma fonte compatível. Consulte os Conectores da Comunidade no Lakeflow Connect.

Conectores personalizados

Conectores personalizados permitem que você construa seu próprio conector para uma fonte que não tem conector gerenciado. Você constrói, testa, implanta e executa um conector personalizado no seu próprio espaço de trabalho do Azure Databricks, sem registrá-lo na comunidade. Veja Construir um conector personalizado para o Lakeflow Connect.

Conectores padrão

Além dos conectores gerenciados, o Databricks oferece conectores personalizáveis para barramentos de mensagens e armazenamento de objetos de nuvem. Veja Escolha um conector padrão.

Criar ou modificar uma tabela a partir do upload de arquivo (Interface para Adicionar Dados)

Você pode ingerir arquivos que residem em sua rede local, arquivos carregados em um volume ou arquivos baixados de um local da Internet. Veja Criar ou modificar uma tabela usando o upload de arquivo.

Parceiros de ingestão

Muitas ferramentas de terceiros dão suporte à ingestão em lote ou streaming no Databricks. O Databricks valida várias integrações de terceiros, embora as etapas para configurar o acesso aos sistemas de origem e ingerir dados variem de acordo com a ferramenta. Consulte os parceiros de ingestão para obter uma lista de ferramentas validadas. Alguns parceiros de tecnologia também são apresentados no Databricks Partner Connect, que tem uma interface do usuário que simplifica a conexão de ferramentas de terceiros aos dados do Lakehouse.

Ingestão DIY

O Databricks fornece uma plataforma de computação geral. Como resultado, você pode criar seus próprios conectores de ingestão usando qualquer linguagem de programação compatível com o Databricks, como Python ou Java. Você também pode importar e usar bibliotecas populares de conectores de software livre, como ferramenta de carregamento de dados, Airbyte e Debezium.

Alternativas de ingestão

O Databricks recomenda a ingestão para a maioria dos casos de uso porque ele é dimensionado para acomodar grandes volumes de dados, consultas de baixa latência e limites de API de terceiros. A ingestão copia dados de seus sistemas de origem para o Azure Databricks, o que resulta em dados duplicados que podem ficar obsoletos ao longo do tempo. Se você não quiser copiar dados, poderá usar as seguintes ferramentas:

Ferramenta Descrição
Federação do Lakehouse Permite que você consulte fontes de dados externas sem mover seus dados.
OpenSharing Permite compartilhar dados com segurança entre plataformas, nuvens e regiões.