Arquiteturas de referência da Databricks (transferir)

As arquiteturas de referência Databricks fornecem orientação arquitetónica abrangendo fontes de dados, ingestão, transformação, consulta e processamento, serviço, análise e armazenamento.

Cada arquitetura de referência tem um PDF para download em formato 11 x 17 (A3).

Enquanto o Databricks é uma plataforma aberta que se integra com um vasto ecossistema de ferramentas parceiras, as arquiteturas de referência focam-se apenas nos serviços Azure e na plataforma Databricks. Os serviços do fornecedor de serviços de computação em nuvem apresentados são selecionados para ilustrar os conceitos e não são exaustivos.

Arquitetura de referência para a plataforma Azure Databricks.

Download: Arquitetura de referência para a plataforma Azure Databricks

A arquitetura de referência do Azure mostra os seguintes serviços específicos do Azure para ingestão, armazenamento, serviço e análise:

  • Azure Synapse e SQL Server como sistemas de origem para Lakehouse Federation
  • Hub IoT do Azure e Centros de Eventos do Azure para ingestão de streaming
  • Azure Data Factory para ingestão em lote
  • Azure Data Lake Storage Gen 2 (ADLS) como o armazenamento de objetos para dados e ativos de IA
  • SQL do Azure DB e Azure Cosmos DB como bancos de dados operacionais
  • Azure Purview como o catálogo empresarial para o qual a UC exporta informações de esquema e linhagem
  • Power BI como a ferramenta de BI
  • O Azure OpenAI pode ser usado pelo Serviço de Modelo como um LLM externo.

Organização das arquiteturas de referência

A arquitetura de referência é estruturada nas raias Origem, Ingestão, Transformação, Consulta/Processo, Serviço, Análise e Armazenamento:

  • Source

    Existem três formas de integrar dados externos na Plataforma de Inteligência de Dados:

    • ETL: A plataforma permite a integração com sistemas que fornecem dados semiestruturados e não estruturados (como sensores, dispositivos IoT, mídia, arquivos e logs), bem como dados estruturados de bancos de dados relacionais ou aplicativos de negócios.
    • Lakehouse Federation: Fontes SQL, como bases de dados relacionais, podem ser integradas em Databricks e Unity Catalog sem ETL. Nesse caso, os dados do sistema de origem são governados pelo Unity Catalog, e as consultas são enviadas para o sistema de origem.
    • Federação de catálogos: Os catálogos do Hive Metastore também podem ser integrados ao Unity Catalog por meio da federação de catálogos, permitindo que o Unity Catalog controle as tabelas armazenadas no Hive Metastore.
  • Ingest

    Carregar dados para o Databricks em lote ou em fluxo:

    • Databricks Lakeflow Connect oferece conectores integrados para ingestão de aplicativos corporativos e bancos de dados. O pipeline de ingestão resultante é governado pelo Unity Catalog e é alimentado por computação sem servidor e Pipelines.
    • Os arquivos entregues ao armazenamento em nuvem podem ser carregados diretamente usando o Databricks Auto Loader.
    • Para a ingestão em lote de dados de aplicações empresariais para o Delta Lake, a plataforma Databricks depende de ferramentas de ingestão de parceiros com adaptadores específicos para estes sistemas de referência.
    • Os eventos de streaming podem ser ingeridos diretamente de sistemas de streaming de eventos, como o Kafka, usando o Databricks Structured Streaming. As fontes de streaming podem ser sensores, IoT ou alterar processos de captura de dados .
  • Storage

  • Transformar e Consultar/processar

    • A plataforma Databricks utiliza os seus motores Apache, Spark e Photon para todas as transformações e consultas.

    • Pipelines é uma estrutura declarativa para simplificar e otimizar pipelines de processamento de dados confiáveis, sustentáveis e testáveis.

    • Alimentada pelo Apache Spark e Photon, a Databricks Data Intelligence Platform suporta ambos os tipos de cargas de trabalho: consultas SQL via armazéns SQL e cargas de trabalho SQL, Python e Scala via clusters de espaço de trabalho.

    • Para ciência de dados (modelação de ML e IA), a plataforma de IA e aprendizagem automática da Databricks fornece ambientes de execução de ML especializados para AutoML e para o desenvolvimento de tarefas de ML. Todos os fluxos de trabalho de ciência de dados e MLOps são melhor suportados pelo MLflow.

  • Serving

    • Para casos de uso de armazenamento de dados (DWH) e BI, a plataforma Databricks fornece Databricks SQL, o armazém de dados baseado em armazéns SQL e armazéns SQL sem servidor.

    • Para aprendizagem automática, o Model Serving é uma capacidade escalável, em tempo real e de nível empresarial, de serviço de modelos alojada no plano de controlo Databricks. O Unity AI Gateway é a solução da Databricks para governar e monitorizar o acesso a modelos de IA suportados e aos seus modelos associados que servem endpoints.

    • Bases de dados operacionais:

      • Lakebase é um banco de dados de processamento de transações on-line (OLTP) baseado no Postgres e totalmente integrado com a Databricks Data Intelligence Platform. Permite criar bases de dados OLTP em Databricks e integrar cargas de trabalho OLTP com Databricks.
      • Sistemas externos, como bancos de dados operacionais, podem ser usados para armazenar e entregar produtos de dados finais para aplicativos de usuários.
  • Collaboration:

    • Os parceiros comerciais obtêm acesso seguro aos dados de que precisam através do OpenSharing.

    • Baseado no OpenSharing, o Databricks Marketplace é um fórum aberto para a troca de produtos de dados.

    • As Salas Limpas são ambientes seguros e que protegem a privacidade, onde vários usuários podem trabalhar juntos em dados corporativos confidenciais sem acesso direto aos dados uns dos outros.

  • Analysis

    • As aplicações finais de negócio estão nesta raia. Exemplos incluem clientes personalizados, como aplicações de IA ligadas ao Model Serving para inferência em tempo real ou aplicações que acedem a dados enviados do Databricks para uma base de dados operacional.

    • Para casos de uso de BI, os analistas normalmente usam ferramentas de BI para acessar o data warehouse. Os desenvolvedores de SQL também podem usar o Editor SQL Databricks (não mostrado no diagrama) para consultas e painéis.

    • A plataforma de inteligência de dados também oferece painéis para criar visualizações de dados e compartilhar insights.

  • Integrate

    • Serviços externos de IA como OpenAI, LangGraph ou HuggingFace podem ser usados diretamente a partir da Plataforma de Inteligência Databricks.

    • Os orquestradores externos podem usar a abrangente API REST ou conectores dedicados para ferramentas de orquestração externas, como o Apache Airflow .

    • O Unity Catalog é usado para todos os dados e governança de IA na Databricks Intelligence Platform e pode integrar outros bancos de dados em sua governança por meio da Lakehouse Federation.

      Além disso, o Unity Catalog pode ser integrado em outros catálogos corporativos, por exemplo, Purview. Entre em contato com o fornecedor do catálogo corporativo para obter detalhes.

Recursos comuns para todas as cargas de trabalho

Além disso, a plataforma Databricks vem com capacidades de gestão que suportam todas as cargas de trabalho:

  • Governança de dados e IA

    O sistema central de governança de dados e IA na plataforma de inteligência de dados Databricks é o Unity Catalog. O Unity Catalog fornece um único local para gerir políticas de acesso a dados que se aplicam a todos os espaços de trabalho e suporta todos os ativos criados ou usados em Databricks, como tabelas, volumes, funcionalidades (feature store) e modelos (registo de modelos). O Unity Catalog também pode ser usado para capturar linhagens de dados de tempo de execução em consultas executadas no Databricks.

    O Databricks Data Quality Monitoring permite que você monitore a qualidade dos dados de todas as tabelas em sua conta. Ele deteta anomalias em todas as suas tabelas e fornece um perfil de dados completo para cada tabela.

    Para observabilidade, as tabelas do sistema são um armazenamento analítico hospedado pelo Databricks dos dados operacionais da sua conta. As tabelas do sistema podem ser usadas para observabilidade histórica em toda a sua conta.

  • Mecanismo de inteligência de dados

    A Plataforma de Inteligência de Dados Databricks permite que toda a sua organização utilize dados e IA, combinando IA com os benefícios de unificação do Databricks para compreender a semântica única dos seus dados. Consulte Recursos auxiliares de IA do Databricks.

    O Genie Code está disponível em cadernos Databricks, editor SQL, editor de ficheiros e noutros locais como assistente de IA consciente do contexto para os utilizadores.

  • Automação e orquestração

    O Lakeflow Jobs orquestra o processamento de dados, o aprendizado de máquina e os pipelines de análise na plataforma de inteligência de dados Databricks. Lakeflow pipelines permitem-lhe criar pipelines ETL fiáveis e de fácil manutenção com sintaxe declarativa. A plataforma suporta também CI/CD e MLOps

Casos de uso de alto nível para a Plataforma de Inteligência de Dados no Azure

Ingestão integrada de aplicativos e bancos de dados SaaS com o Lakeflow Connect

Ingestão com LFC no Azure Databricks.

Download: Arquitetura de referência do Lakeflow Connect para Azure Databricks.

O Databricks Lakeflow Connect oferece conectores integrados para ingestão de aplicativos corporativos e bancos de dados. O pipeline de ingestão resultante é regido pelo Unity Catalog e é suportado por computação sem servidor e pipelines Lakeflow.

O Lakeflow Connect aproveita leituras e gravações incrementais eficientes para tornar a ingestão de dados mais rápida, escalável e econômica, enquanto seus dados permanecem atualizados para consumo downstream.

Ingestão em lote e ETL

Arquitetura de referência para ETL em lote no Azure Databricks.

Download: Arquitetura de referência de ETL em lote para o Azure Databricks

As ferramentas de ingestão usam adaptadores específicos da fonte para ler dados da fonte e, em seguida, armazená-los no armazenamento em nuvem, de onde o Auto Loader os pode ler, ou invocar diretamente o Databricks (por exemplo, com ferramentas de ingestão de parceiros integradas na plataforma Databricks). Para carregar os dados, o ETL do Databricks e o mecanismo de processamento executam as consultas por meio de Pipelines. Orquestre trabalhos de tarefa única ou múltipla usando o Lakeflow Jobs e controle-os usando o Unity Catalog (controle de acesso, auditoria, linhagem e assim por diante). Para fornecer acesso a tabelas douradas específicas para sistemas operacionais de baixa latência, exporte as tabelas para um banco de dados operacional, como um RDBMS ou armazenamento de chave-valor no final do pipeline de ETL.

Streaming e captura de dados das alterações (CDC)

Arquitetura de streaming estruturada do Spark no Azure Databricks.

Download: Arquitetura de streaming estruturada do Spark para o Azure Databricks

O mecanismo ETL do Databricks usa o Spark Structured Streaming para ler filas de eventos como Apache Kafka ou Hub de Eventos do Azure. As etapas subsequentes seguem a abordagem do caso de uso em lote acima.

A captura de dados de alteração em tempo real (CDC) normalmente armazena os eventos extraídos em uma fila de eventos. A partir daí, o caso de uso segue o modelo de streaming.

Se o CDC for feito em batch, com os registos extraídos armazenados primeiro no armazenamento na cloud, o Databricks Auto Loader pode lê-los, e o caso de uso segue o Batch ETL.

Machine learning e IA (tradicional)

Arquitetura de referência de aprendizado de máquina e IA para o Azure Databricks.

Download: Aprendizado de máquina e arquitetura de referência de IA para o Azure Databricks

Para aprendizagem automática, a Plataforma de Inteligência de Dados Databricks oferece bibliotecas de machine learning e deep learning de última geração. Ele fornece funcionalidades como Feature Store e Model Registry (ambos integrados no Unity Catalog), funcionalidades de low-code com AutoML e integração do MLflow no ciclo de vida da ciência de dados.

O Unity Catalog controla todos os ativos relacionados à ciência de dados (tabelas, recursos e modelos), e os cientistas de dados podem usar o Lakeflow Jobs para orquestrar seus trabalhos.

Para implantar modelos de forma escalável e de nível empresarial, use os recursos MLOps para publicar os modelos no serviço de modelos.

Aplicações para agentes

Arquitetura de referência de aplicações de IA para Azure Databricks.

Download: AI application reference architecture for Azure Databricks

Para implantar modelos de forma escalável e de nível empresarial, use os recursos MLOps para publicar os modelos no serviço de modelos.

Análise de BI e SQL

Arquitetura de referência de análise de BI e SQL para o Azure Databricks.

Download: arquitetura de referência de análise de BI e SQL para Azure Databricks

Para casos de uso de BI, os analistas de negócios podem usar painéis, o editor Databricks SQL ou ferramentas de BI , como Tableau ou Power BI. Em todos os casos, o mecanismo é Databricks SQL (serverless ou non-serverless), e o Unity Catalog fornece descoberta de dados, exploração e controle de acesso.

Aplicativos de negócios

Aplicações Empresariais para o Databricks no Azure Databricks.

Download: Aplicações empresariais para Databricks no Azure Databricks

O Databricks Apps permite que os desenvolvedores criem e implantem dados seguros e aplicativos de IA diretamente na plataforma Databricks, o que elimina a necessidade de infraestrutura separada. Os aplicativos são hospedados na plataforma sem servidor Databricks e se integram aos principais serviços da plataforma. Utilize o Lakebase se a aplicação precisar de dados OLTP que foram sincronizados a partir do Databricks.

Federação Lakehouse

Arquitetura de referência de federação Lakehouse para Azure Databricks.

Download: Arquitetura de referência de federação Lakehouse para Azure Databricks

A Lakehouse Federation permite que bancos de dados SQL externos (como MySQL, Postgres, SQL Server ou Azure Synapse) sejam integrados ao Databricks.

Todas as cargas de trabalho (IA, DWH e BI) podem beneficiar-se disso sem a necessidade de enviar os dados para armazenamento de objetos através de ETL primeiro. O catálogo de origem externa é integrado ao catálogo Unity, e o controlo de acesso detalhado pode ser aplicado através da plataforma Databricks.

Federação de catálogos

Arquitetura de referência de federação de catálogo para o Azure Databricks.

Download: Arquitetura de referência de federação de catálogo para o Azure Databricks

A federação de catálogos permite que Metastores Hive externos (como MySQL, Postgres, SQL Server ou Azure Synapse) sejam integrados ao Databricks.

Todas as cargas de trabalho (IA, DWH e BI) podem beneficiar-se disso sem a necessidade de enviar os dados para armazenamento de objetos através de ETL primeiro. O catálogo de origem externa é adicionado ao Unity Catalog onde o controle de acesso refinado é aplicado por meio da plataforma Databricks.

Partilhe dados com ferramentas de terceiros

Arquitetura de referência de compartilhamento de dados corporativos para o Azure Databricks.

Download: Partilhar dados com ferramentas de terceiros através da arquitetura de referência para o Azure Databricks

A partilha de dados de nível empresarial com terceiros é fornecida pelo OpenSharing. Ele permite o acesso direto aos dados no repositório de objetos protegido pelo Unity Catalog. Esse recurso também é usado no Databricks Marketplace, um fórum aberto para troca de produtos de dados.

Consumir dados compartilhados do Databricks

Consuma dados compartilhados do Databricks para Azure Databricks.

Download: Consumir dados compartilhados da arquitetura de referência do Databricks para o Azure Databricks

O protocolo OpenSharing Databricks-to-Databricks permite que os utilizadores partilhem dados de forma segura com qualquer utilizador Databricks, independentemente da conta ou da cloud host, desde que esse utilizador tenha acesso a um espaço de trabalho ativado para o Unity Catalog.