Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Esta página ajuda-o a compreender o fluxo de trabalho de ingestão do SQL Server, incluindo os fatores que determinam a sua abordagem de configuração e os passos envolvidos para diferentes personas de utilizador.
CDC padrão vs. CDC integrado
O SQL Server suporta duas arquiteturas de ingestão. A tabela seguinte compara-os:
| Feature | CDC padrão (baseado em gateway) | CDC Integrado (Beta) |
|---|---|---|
| Número de oleodutos | Dois (porta de entrada para ingestão e fluxo de ingestão) | One (canalização unificada) |
| Configuração | Crie um gateway, depois crie um pipeline de ingestão que faça referência ao ID do gateway | Crie um único pipeline que faça referência a uma ligação ao Unity Catalog |
| Modo Gateway | A porta de entrada funciona continuamente | O pipeline integra a extração em cada atualização |
| Referência de conexão | ingestion_gateway_id |
connection_name (uma conexão ao Unity Catalog) |
| Tipo de conector | Implícito | Explícito: connector_type: CDC |
| Volume de encenação | O gateway gere o volume de preparação internamente | Configuras o volume de staging através de data_staging_options. O pipeline cria automaticamente um se não for especificado. |
A mesma configuração da base de dados de origem aplica-se a ambas as arquiteturas. Consulte Configurar o Microsoft SQL Server para ingestão no Azure Databricks. Para mais informações, consulte Criar um pipeline CDC integrado para SQL Server.
Disponibilidade de funcionalidades
| Feature | Availability |
|---|---|
| Criação de pipelines com base na interface de utilizador |
|
| Criação de pipeline baseada em API |
|
| Pacotes de Automação Declarativa |
|
| Ingestão incremental |
|
| Governança do Catálogo Unity |
|
| Orquestração usando Lakeflow Jobs |
|
| SCD tipo 2 |
|
| Seleção e desseleção de colunas baseadas em API |
|
| Filtragem de linhas baseada em API |
|
| Evolução automatizada do esquema: colunas novas e excluídas |
|
| Evolução automatizada do esquema: alterações no tipo de dados |
|
| Evolução automatizada do esquema: renomeações de colunas |
Requer uma atualização completa. |
| Evolução automatizada do esquema: Novas tabelas |
Se ingerires todo o esquema. Veja as limitações no número de tabelas por pipeline. |
| Número máximo de tabelas por pipeline | 250 |
Métodos de autenticação
| Método de autenticação | Availability |
|---|---|
| OAuth U2M |
|
| OAuth M2M |
|
| OAuth (token de atualização manual) |
|
| Autenticação básica (nome de utilizador/palavra-passe) |
|
| Autenticação básica (chave API) |
|
| Autenticação básica (chave JSON da conta de serviço) |
|
O que deve saber antes de começar
| Tópico | Por que é importante |
|---|---|
| Persona de utilizador do Azure Databricks | O fluxo de trabalho depende da sua persona de utilizador Azure Databricks:
|
| Variação da base de dados | A configuração da base de dados de origem depende do ambiente de implementação do SQL Server. |
| Método de monitorização de alterações | A configuração da base de dados de origem depende de como escolhe acompanhar as alterações na fonte. |
| Método de autenticação | Os passos para criar uma ligação dependem do método de autenticação que escolher. |
| Interface | Os passos para criar uma ligação, um gateway e um pipeline dependem da interface. |
| Frequência de ingestão | O cronograma do pipeline depende da sua latência e dos seus requisitos de custo. |
| Padrões comuns | Dependendo das suas necessidades de ingestão, o pipeline pode usar configurações como rastreio de histórico, seleção de colunas e filtragem de linhas. As configurações suportadas variam consoante o conector. Veja Disponibilidade de funcionalidades. |
Iniciar a ingestão a partir do SQL Server
A tabela seguinte apresenta uma visão geral do fluxo de trabalho de ingestão do SQL Server de ponta a ponta, com base no tipo de utilizador:
| User | Steps |
|---|---|
| Administrador |
|
| Não administrador | Use qualquer interface suportada para criar um gateway e um pipeline. Ver Ingerir dados do SQL Server. |