Conector para ingestão do Microsoft SQL Server

Esta página ajuda-o a compreender o fluxo de trabalho de ingestão do SQL Server, incluindo os fatores que determinam a sua abordagem de configuração e os passos envolvidos para diferentes personas de utilizador.

CDC padrão vs. CDC integrado

O SQL Server suporta duas arquiteturas de ingestão. A tabela seguinte compara-os:

Feature CDC padrão (baseado em gateway) CDC Integrado (Beta)
Número de oleodutos Dois (porta de entrada para ingestão e fluxo de ingestão) One (canalização unificada)
Configuração Crie um gateway, depois crie um pipeline de ingestão que faça referência ao ID do gateway Crie um único pipeline que faça referência a uma ligação ao Unity Catalog
Modo Gateway A porta de entrada funciona continuamente O pipeline integra a extração em cada atualização
Referência de conexão ingestion_gateway_id connection_name (uma conexão ao Unity Catalog)
Tipo de conector Implícito Explícito: connector_type: CDC
Volume de encenação O gateway gere o volume de preparação internamente Configuras o volume de staging através de data_staging_options. O pipeline cria automaticamente um se não for especificado.

A mesma configuração da base de dados de origem aplica-se a ambas as arquiteturas. Consulte Configurar o Microsoft SQL Server para ingestão no Azure Databricks. Para mais informações, consulte Criar um pipeline CDC integrado para SQL Server.

Disponibilidade de funcionalidades

Feature Availability
Criação de pipelines com base na interface de utilizador Ícone de verificação verde Apoiado
Criação de pipeline baseada em API Ícone de verificação verde Apoiado
Pacotes de Automação Declarativa Ícone de verificação verde Apoiado
Ingestão incremental Ícone de verificação verde Apoiado
Governança do Catálogo Unity Ícone de verificação verde Apoiado
Orquestração usando Lakeflow Jobs Ícone de verificação verde Apoiado
SCD tipo 2 Ícone de verificação verde Apoiado
Seleção e desseleção de colunas baseadas em API Ícone de verificação verde Apoiado
Filtragem de linhas baseada em API Ícone vermelho X Não suportado
Evolução automatizada do esquema: colunas novas e excluídas Ícone de verificação verde Apoiado
Evolução automatizada do esquema: alterações no tipo de dados Ícone vermelho X Não suportado
Evolução automatizada do esquema: renomeações de colunas Ícone vermelho X Não suportado
Requer uma atualização completa.
Evolução automatizada do esquema: Novas tabelas Ícone de verificação verde Apoiado
Se ingerires todo o esquema. Veja as limitações no número de tabelas por pipeline.
Número máximo de tabelas por pipeline 250

Métodos de autenticação

Método de autenticação Availability
OAuth U2M Ícone vermelho X Não suportado
OAuth M2M Ícone vermelho X Não suportado
OAuth (token de atualização manual) Ícone vermelho X Não suportado
Autenticação básica (nome de utilizador/palavra-passe) Ícone de verificação verde Apoiado
Autenticação básica (chave API) Ícone vermelho X Não suportado
Autenticação básica (chave JSON da conta de serviço) Ícone vermelho X Não suportado

O que deve saber antes de começar

Tópico Por que é importante
Persona de utilizador do Azure Databricks O fluxo de trabalho depende da sua persona de utilizador Azure Databricks:
  • Utilizador único: Um utilizador administrador configura a base de dados de origem e cria uma ligação ao Unity Catalog, um gateway de ingestão e um pipeline de ingestão.
  • Multiutilizador: Um utilizador administrador configura a base de dados de origem e cria uma ligação para utilizadores não administradores criarem pares gateway-pipeline.
Variação da base de dados A configuração da base de dados de origem depende do ambiente de implementação do SQL Server.
Método de monitorização de alterações A configuração da base de dados de origem depende de como escolhe acompanhar as alterações na fonte.
Método de autenticação Os passos para criar uma ligação dependem do método de autenticação que escolher.
Interface Os passos para criar uma ligação, um gateway e um pipeline dependem da interface.
Frequência de ingestão O cronograma do pipeline depende da sua latência e dos seus requisitos de custo.
Padrões comuns Dependendo das suas necessidades de ingestão, o pipeline pode usar configurações como rastreio de histórico, seleção de colunas e filtragem de linhas. As configurações suportadas variam consoante o conector. Veja Disponibilidade de funcionalidades.

Iniciar a ingestão a partir do SQL Server

A tabela seguinte apresenta uma visão geral do fluxo de trabalho de ingestão do SQL Server de ponta a ponta, com base no tipo de utilizador:

User Steps
Administrador
Não administrador Use qualquer interface suportada para criar um gateway e um pipeline. Ver Ingerir dados do SQL Server.