Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Você pode criar uma cópia lógica de dados de banco de dados KQL em uma casa de eventos ativando a disponibilidade do OneLake. Ao ativar a disponibilidade OneLake, você pode consultar os dados em seu banco de dados KQL no formato Delta Lake por meio de outros mecanismos Fabric, como o modo Direct Lake em Power BI, Warehouse, Lakehouse, Notebooks e muito mais. Delta Lake é o formato unificado de tabelas para data lake que possibilita o acesso integrado aos dados em todos os mecanismos de computação no Fabric.
Neste artigo, você aprenderá a ativar a disponibilidade de dados do banco de dados KQL no OneLake.
Quando a disponibilidade do OneLake e a sincronização de esquema estiverem habilitadas, você também poderá usar Analisar dados com>endpoint SQL no nível do banco de dados para consultar a representação do Delta Lake em tempo quase real por meio de mecanismos baseados em SQL.
Quando a disponibilidade do OneLake e a sincronização de esquema estiverem habilitadas, você também poderá usar Analisar dados com>endpoint SQL no nível do banco de dados para consultar a representação do Delta Lake em tempo quase real por meio de mecanismos baseados em SQL.
Como a disponibilidade do OneLake funciona para bancos de dados KQL
Você pode ativar a disponibilidade do OneLake no banco de dados ou na tabela. Quando habilitados no nível do banco de dados, todas as novas tabelas e seus dados são disponibilizados no OneLake. Ao ativar o recurso, você também pode optar por aplicar essa opção a tabelas existentes, selecionando a opção Aplicar a tabelas existentes, para incluir o preenchimento histórico dos dados. Ao ativar no nível da tabela, apenas essa tabela e seus dados ficam disponíveis no OneLake. A política de retenção de dados do banco de dados KQL também é aplicada aos dados no OneLake. Os dados removidos do banco de dados KQL no fim do período de retenção também são removidos do OneLake. Se você desativar a disponibilidade do OneLake, os dados serão excluídos temporariamente do OneLake.
A sincronização de esquema do backend mantém a representação do Delta Lake alinhada com o banco de dados KQL, permitindo consultas em tempo quase real por meio do ponto de extremidade SQL e de notebooks. Para obter a latência esperada e o comportamento de envio em lote, consulte o comportamento adaptável.
Embora a disponibilidade do OneLake esteja ativada, você não pode realizar as seguintes tarefas:
- Renomeie as tabelas.
- Altere um tipo de coluna. Há suporte para adicionar ou excluir uma coluna.
- Aplique segurança em nível de linha a tabelas.
- Excluir, truncar ou limpar dados.
Se você precisar realizar qualquer uma dessas tarefas, use as seguintes etapas:
- Desative a disponibilidade do OneLake.
- Execute a tarefa.
- Ative a disponibilidade do OneLake.
Importante
A desativação da disponibilidade do OneLake exclui seus dados do OneLake. Quando você reativa a disponibilidade, todos os dados ficam disponíveis no OneLake, incluindo o backfill de dados históricos.
Observação
Para obter informações sobre o tempo necessário para que os dados apareçam no OneLake, consulte o comportamento adaptável. Não há nenhum custo de armazenamento extra para ativar a disponibilidade do OneLake. Para obter mais informações, confira consumo de recursos.
Pré-requisitos
- Um workspace com uma capacidade habilitada para o Fabric.
- Um banco de dados KQL com dados e permissões de edição.
Ativar a disponibilidade do OneLake para um banco de dados ou tabela KQL
Você pode ativar a disponibilidade do OneLake para um banco de dados KQL ou uma tabela.
Selecione um banco de dados ou uma tabela.
Na seção OneLake do painel de detalhes, defina Disponibilidade como Habilitada.
Na janela Habilitar disponibilidade do OneLake , selecione Habilitar.
Os detalhes do banco de dados ou da tabela são atualizados automaticamente.
Ao ativar a disponibilidade do OneLake em seu banco de dados ou tabela KQL, você pode acessar todos os dados no caminho do OneLake especificado no formato Delta Lake. Você também pode criar um atalho do OneLake a partir de um lakehouse ou de um warehouse, ou consultar os dados diretamente por meio do modo Direct Lake do Power BI. Com a disponibilidade do OneLake ativada em seu banco de dados ou tabela KQL, agora você pode acessar todos os dados no caminho especificado do OneLake no formato Delta Lake. Você também pode criar um atalho do OneLake a partir de um Lakehouse, Data Warehouse ou consultar os dados diretamente pelo modo Power BI Direct Lake.
Usar com Analisar dados com opções
Quando a disponibilidade do OneLake está habilitada, os itens de banco de dados Eventhouse e KQL expõem Analisar dados com opções no nível do banco de dados:
- Endpoint SQL: Disponível quando a disponibilidade do OneLake e a sincronização do esquema estão habilitadas.
- Notebook: abre a análise baseada em bloco de anotações para o banco de dados selecionado.
Se você desativar a disponibilidade do OneLake, a opção de ponto de extremidade do SQL será removida deste menu até que você a habilite novamente.
Comportamento adaptativo para processamento em lote de arquivos Parquet
Uma casa de eventos agrupa de forma inteligente fluxos de dados de entrada em um ou mais arquivos Parquet estruturados para análise. Agrupar fluxos de dados em lotes é importante ao lidar com dados que chegam aos poucos, pois gravar muitos arquivos Parquet pequenos no data lake pode ser ineficiente. Essa ineficiência resulta em custos mais altos e baixo desempenho de consulta.
O mecanismo adaptável do eventhouse poderá atrasar as operações de gravação no OneLake se não houver dados suficientes para criar arquivos Parquet ideais. Esse comportamento garante que os arquivos Parquet tenham tamanho ideal e sigam as práticas recomendadas do Delta Lake. Ele equilibra a necessidade de disponibilidade imediata dos dados com considerações de custo e desempenho.
Latência de gravação padrão e configurável para disponibilidade do OneLake:
| Configuração | Valor padrão | Intervalo permitido |
|---|---|---|
Atraso na operação de gravação (TargetLatencyInMinutes) |
Até 3 horas ou até que arquivos de tamanho suficiente (normalmente de 200 a 256 MB) sejam criados | 5 minutos a 3 horas |
Por exemplo, use o seguinte comando Kusto para definir o atraso de gravação como 5 minutos para uma única tabela:
.alter-merge table <TableName> policy mirroring dataformat=parquet with (IsEnabled=true, TargetLatencyInMinutes=5);
Cuidado
Ajustar o atraso a um período mais curto pode resultar em uma tabela delta abaixo do ideal com um grande número de arquivos pequenos, o que pode levar a um desempenho de consulta ineficiente. A tabela resultante no OneLake é somente leitura e não pode ser otimizada após a criação.
Você pode monitorar há quanto tempo novos dados foram adicionados no lago verificando sua latência de dados usando o .show table mirroring operations comando.
Os resultados são medidos a partir da última adição de dados. Quando a Latência retorna 00:00:00, todos os dados no banco de dados KQL estão disponíveis no OneLake.
Visualizar arquivos do Delta Lake no OneLake
Quando você ativa a disponibilidade do OneLake em uma tabela, o processo cria uma pasta de log delta junto com os arquivos JSON e Parquet correspondentes. Você pode visualizar os arquivos disponíveis no OneLake e suas propriedades sem sair do Real-Time Intelligence.
Para realizar a exibição dos arquivos, passe o mouse sobre uma tabela no painel Explorer e, em seguida, selecione o menu Mais [...]>Exibir arquivos.
Para realizar a exibição das propriedades da pasta de logs delta ou dos arquivos individuais, passe o mouse sobre a pasta ou sobre o arquivo e, em seguida, selecione o menu Mais [...]>Propriedades.
Para visualizar os arquivos na pasta de logs delta:
- Selecione a pasta _delta_log.
- Selecione um arquivo para exibir os metadados e o esquema da tabela. O editor que se abre está em formato somente leitura.
Acessar a política de espelhamento do OneLake
Por padrão, quando você ativa a disponibilidade do OneLake para um banco de dados ou tabela KQL, o sistema habilita uma política de espelhamento. Você pode usar a política de espelhamento para monitorar a latência de dados ou alterá-la para tabelas delta de partição.
Observação
Se você desativar a disponibilidade do OneLake, a propriedade IsEnabled da política de espelhamento será definida como false (IsEnabled=false).
Tabelas delta de partição no OneLake
Você pode particionar suas tabelas de delta para melhorar a velocidade de consulta. Para obter informações sobre quando particionar arquivos do OneLake, consulte Quando particionar tabelas. Cada partição é representada como uma coluna separada usando o PartitionName listado na lista Partitions. Essa representação significa que sua cópia do OneLake tem mais colunas do que sua tabela de origem.
Para particionar suas tabelas delta, use o .alter-merge table policy mirroring comando.
Consultar tabelas Delta de um bloco de anotações Fabric
Você pode usar o Bloco de Anotações do Fabric para ler os dados do OneLake usando o snippet de código a seguir.
Dica
Você pode iniciar um notebook novo ou existente do Fabric diretamente em Analisar dados com>Notebook em um Eventhouse ou banco de dados KQL. O notebook se conecta automaticamente ao contexto do banco de dados selecionado. Use o exemplo de código a seguir quando quiser acesso manual baseado em caminho.
No snippet de código, substitua
<workspaceGuid>,<workspaceGuid>e<tableName>por seus próprios valores.
delta_table_path = 'abfss://<workspaceGuid>@onelake.dfs.fabric.microsoft.com/<eventhouseGuid>/Tables/<tableName>'
df = spark.read.format("delta").load(delta_table_path)
df.show()
Observação
Para um banco de dados do Azure Data Explorer, use este código:
delta_table_path = 'abfss://<workspaceName>@onelake.dfs.fabric.microsoft.com/<itemName>.KustoDatabase/Tables/<tableName>'