Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O Lakeflow Designer inclui operadores internos para tarefas comuns de preparação e transformação de dados. Abra o menu do operador no painel lateral à esquerda para procurar operadores por categoria ou use Pesquisar um operador... na parte superior do painel. A pesquisa do operador sugere operadores com base em sua intenção. Por exemplo, digitar average by month retorna o operador Aggregate . Para configurar um operador depois de adicioná-lo à tela, clique duas vezes nele ou passe o mouse sobre ele e clique no (Operador Editar) para abrir o painel de configuração.
Cada operador exibe uma descrição gerada por IA do que ele faz. A descrição também atua como um editor para o operador: editar a descrição reconfigura o operador para corresponder à sua descrição.
Para saber como criar seus próprios operadores definidos pelo usuário, consulte operadores definidos pelo usuário no Lakeflow Designer.
Origem e saída
Fonte
Importa dados para o Designer de uma tabela do Catálogo do Unity ou de outra fonte com suporte. Para selecionar uma origem, pesquise uma tabela ou arquivo por nome ou navegue por catálogo e esquema. Você também pode criar uma nova tabela a partir deste painel.
Depois de selecionar uma tabela, o painel mostra o nome, o proprietário e a hora da última atualização da tabela. Clique em Selecionar uma nova fonte de dados para alterar a origem. Alterar a origem invalida o cache de saída para todos os operadores downstream.
Você também pode usar uma exibição de métrica do Catálogo do Unity como fonte. Ao selecionar uma exibição de métrica, selecione as dimensões e medidas a serem incluídas e o Designer gera a consulta agregada para você.
Para obter toda a gama de opções de ingestão de dados, incluindo o direcionamento de um volume ou pasta inteiro do Catálogo do Unity, consulte Ingestão de dados no Lakeflow Designer.
Inserir Dados
Cria uma tabela digitando valores em um editor de estilo de planilha. Use esse operador para adicionar pequenas quantidades de dados de referência, como valores de pesquisa ou dados de teste, sem criar uma tabela de origem separada.
| Campo | Descrição |
|---|---|
| Dados da tabela | Insira seus dados como uma tabela. A primeira linha define os cabeçalhos de coluna e as linhas restantes são os dados. O designer infere o tipo de dados de cada coluna de seus valores. |
Saída
Exporta dados do Designer. O operador De saída pode gravar resultados em uma tabela do Catálogo do Unity, publicá-los como uma exibição materializada ou gravá-los em um arquivo em um volume do Catálogo do Unity. Selecione o destino com o tipo De saída.
| Tipo de saída | Descrição |
|---|---|
| Table | Grava os resultados em uma tabela gerenciada do Catálogo do Unity. Defina um nome de tabela e um local de saída (catálogo e esquema) e, em seguida, selecione um modo de gravação. |
| Visão materializada | Publica os resultados como uma exibição materializada no Catálogo do Unity que é atualizada quando a preparação de dados visuais é executada. |
| File | Grava os resultados em um arquivo em um volume do Catálogo do Unity. Selecione um tipo de arquivo de CSV, Excel ou JSON e defina o volume de destino e o nome do arquivo. |
Para uma saída de Tabela ou Arquivo , selecione como cada execução grava no destino com o modo de gravação:
| Modo de gravação | Descrição |
|---|---|
| Sobrescrever | Substitui o conteúdo existente pelos resultados da execução atual. Este é o padrão. |
| Acrescentar | Adiciona os resultados da execução atual às linhas existentes. |
| Merge | Upserts linhas na tabela de destino, correspondendo nas chaves de mesclagem que você especificar. Disponível para saídas de tabela. |
Clique em Executar para executar a preparação de dados visuais e gravar os resultados. Para uma saída de tabela, se a tabela não existir, o operador a criará. Execuções agendadas gravam no destino usando o mesmo modo de gravação.
Função de IA
Executa uma operação interna de IA em seus dados. No painel de configuração, abra Selecionar uma função e selecione uma das funções na tabela a seguir. Cada função expõe opções no painel para entradas (por exemplo, colunas, prompts, rótulos ou idiomas) e saídas.
| Função | Descrição |
|---|---|
ai_analyze_sentiment |
Executa a análise de sentimento no texto de entrada. |
ai_classify |
Classifica texto ou documentos analisados usando rótulos fornecidos. |
ai_extract |
Extrai dados estruturados de texto ou documentos analisados usando campos definidos. |
ai_fix_grammar |
Corrige erros gramaticais no texto. |
ai_forecast |
Prevê dados de série temporal até um horizonte que você especificar.
ai_forecast é uma função com valor de tabela que processa toda a tabela de entrada. |
ai_gen |
Responde a um prompt fornecido pelo usuário em relação à entrada. |
ai_mask |
Mascara as entidades especificadas no texto (por exemplo, para desentupimento). |
ai_parse_document |
Extrai texto, tabelas e layout de documentos não estruturados. |
ai_prep_search |
Transforma a saída de documento analisada em partes prontas para pesquisa para pipelines rag (pesquisa de vetor e geração aumentada de recuperação). |
ai_query |
Responde a um prompt usando qualquer modelo de base com suporte, para flexibilidade de modelo e tarefa de uso geral. |
ai_similarity |
Compara duas cadeias de caracteres e retorna uma pontuação de similaridade semântica. |
ai_summarize |
Gera um resumo do texto. |
ai_translate |
Converte o texto em um idioma de destino especificado. |
Para detalhes sobre cada função, veja Transformar dados não estruturados usando Funções de IA.
Transformations
Os operadores a seguir executam transformações em seus dados.
Aggregate
Resume as linhas agrupando dados e calculando valores agregados.
| Campo | Descrição |
|---|---|
| Agrupar por | Selecione uma coluna, selecione uma função de agregação e forneça um nome para a coluna de saída. Clique em + Adicionar agregação para adicionar mais. Funções suportadas: AVG, COUNT, COUNT DISTINCT, MAX, MEANMEDIAN, , MIN, , PERCENTILE, STDDEV. SUMVARIANCE |
| Agrupar por | Selecione as colunas pelas quais agrupar. Clique em + Adicionar agrupamento para adicionar mais. As colunas usadas em Grupo são incluídas automaticamente na saída. |
Combinar
Mescla dados de várias tabelas com esquemas correspondentes em uma única saída.
| Campo | Descrição |
|---|---|
| Definir operação | Selecione União, Intersecção ou Exceto. |
| Estratégia de mesclagem | Selecione Distinct para excluir linhas duplicadas da saída ou Tudo para manter todas as linhas, incluindo duplicatas. |
Único
Remove linhas duplicadas dos dados de entrada. Por padrão, o operador desduplica em todas as colunas. Você pode, em vez disso, escolher um subconjunto de colunas como chave e ordenar as linhas para controlar qual duplicado é mantido.
| Campo | Descrição |
|---|---|
| Único por | Selecione Todas as colunas para remover linhas idênticas em todas as colunas, ou Colunas selecionadas para remover linhas que sejam duplicadas apenas nas colunas que você escolheu como chave. |
| Ordem por | Opcional: selecione uma ou mais colunas e uma direção de ordenação para controlar qual linha é mantida para cada conjunto de duplicados. Se você não definir uma ordem, o operador mantém a primeira fileira que encontrar. |
Filter
Divide linhas com base em se elas atendem a uma ou mais condições, usando um construtor de condições gráficas.
| Campo | Descrição |
|---|---|
| Condition | Para cada condição, selecione uma coluna, um tipo de condição e um valor para corresponder condicionalmente. Tipos de condição com suporte:
Para condições em colunas de data, o seletor de data dá suporte à navegação ao longo de anos e meses. Quando uma condição corresponde aos valores de uma coluna (por exemplo, É um dos), a lista de valores mostra uma amostra dos valores distintos da coluna com base na entrada. Selecione Carregar mais para obter valores adicionais sob demanda. |
O operador Filter tem duas saídas para que você possa ramificar dados com base em se ele atende às condições:
| Saída | Descrição |
|---|---|
| Included | Linhas que atendem às condições de filtro. |
| Excluído | Linhas que não atendem às condições de filtro, incluindo linhas em que a condição é avaliada como nula. |
Join
Vincula duas tabelas em uma chave combinando dois conjuntos de dados de entrada com base em valores de coluna correspondentes.
| Campo | Descrição |
|---|---|
| Tabelas de entrada | Selecione as duas tabelas de entrada a serem unidas. |
| Condição de junção | Especifique pelo menos uma condição de junção selecionando colunas correspondentes das duas tabelas. Clique + Adicionar expressão de junção para adicionar mais condições. Opcional: clique na seta entre as tabelas esquerda e direita para adicionar uma condição de junção personalizada e edite a descrição gerada por IA ou escreva SQL. |
| Caso de correspondência | Quando desativadas (o padrão), as teclas de junção de cadeia de caracteres correspondem sem diferenciação de maiúsculas e minúsculas (e ignoram o espaço em branco à esquerda e à direita). Ative a correspondência de maiúsculas e minúsculas para corresponder exatamente às teclas de cadeia de caracteres. Essa opção se aplica às chaves de junção, não às condições de junção personalizadas. |
| Tipo de junção | Selecione o tipo de junção. Por padrão, o operador Join divide seus resultados em três saídas (consulte a seção a seguir). Selecione Junção completa, junção interna, junção à esquerda ou junção à direita para produzir uma única saída unida. |
| Colunas de saída | Opcional: selecione quais colunas incluir. Por padrão, todas as colunas de ambas as tabelas são incluídas. Nomes de coluna duplicados recebem um prefixo de nome de tabela. |
| Colunas de expressão personalizadas | Opcional: adicione colunas de expressão personalizada com base no resultado associado. |
Por padrão, o operador Join tem três saídas para que você possa ramificar um fluxo de trabalho com base nos resultados da junção:
| Saída | Descrição |
|---|---|
| Sem correspondência à esquerda | Linhas da entrada esquerda que não têm correspondência na entrada direita. |
| Coincidente | Linhas que correspondem entre ambas as entradas. |
| Direita incompatível | Linhas da entrada direita que não têm correspondência na entrada esquerda. |
Quando você seleciona um tipo de Junção específico (completo, interno, esquerdo ou direito), o operador produz uma única saída unida em vez das três saídas divididas.
Limit
Restringe a contagem de linhas passando apenas até o número máximo de linhas especificadas.
| Campo | Descrição |
|---|---|
| Máximo de linhas | Especifique o número máximo de linhas a serem passadas. |
Dinâmico
Remodela dados tabulares em duas direções. Use as guias na parte superior do painel de configuração para selecionar o modo.
Linhas → Colunas (pivô)
Transforma valores distintos em uma coluna em novos cabeçalhos de coluna, preenchidos com valores agregados de outra coluna.
| Campo | Descrição |
|---|---|
| Coluna dinâmica | Selecione a coluna cujos valores distintos se tornam os novos cabeçalhos. |
| Agregação de valor | Selecione a coluna cujos valores preenchem as células dinâmicas e selecione uma função de agregação (por exemplo, , SUM, AVG, COUNTou MINMAX). Configure como os valores ausentes são tratados (por exemplo, nulo ou zero), se disponíveis no painel. |
Colunas → Linhas (unpivot)
Dobra uma ou mais colunas em linhas.
| Campo | Descrição |
|---|---|
| Transformar colunas em linhas | Selecione as colunas a serem despivotas. |
| Colunas de chave e valor | Defina nomes para a chave de saída e as colunas de valor. |
Incluir colunas
Para qualquer um dos modos, selecione quais colunas permanecem na saída ao lado dos valores dinâmicos ou não dinâmicos e solte as colunas que você não precisa antes da transformação. O designer infere colunas fixas (agrupamento) das colunas que você não atribui a funções dinâmicas, de valor ou não dinâmicas.
Classificar
Ordena linhas em uma ou mais colunas.
| Campo | Descrição |
|---|---|
| Ordem de classificação | Selecione ASC (crescente) ou DESC (decrescente ) para cada coluna. Clique + Adicionar expressão de classificação para classificar por colunas adicionais. A classificação segue a ordem léxica padrão. |
SQL
Grava código SQL personalizado para qualquer transformação não coberta pelos outros operadores.
| Campo | Descrição |
|---|---|
| Editor de SQL | Digite uma instrução SQL SELECT . Para fazer referência à saída de um operador de entrada, use o nome desse operador como o nome da tabela em sua consulta. Por exemplo:SELECT COUNT(*)FROM aggregate_2WHERE 1 = 1Clique no |
| Parameters | Para fazer referência a um parâmetro de preparação de dados visuais, use a sintaxe de marcador de parâmetro nomeada, como :environment. O designer mostra um exemplo acima do editor quando você abre o operador para edição. Consulte Parâmetros. |
Selecionar
Seleciona, renomeia e reordena colunas dos dados de entrada.
| Campo | Descrição |
|---|---|
| Incluir ou excluir colunas | Selecione Iniciar com todas as colunas ou Iniciar sem colunas e, em seguida, use as caixas de seleção para incluir ou excluir colunas individuais. Arraste colunas para reordená-las. |
| Renomear uma coluna | Digite um novo nome no campo Renomear ao lado de qualquer coluna. |
| Selecione as colunas dinamicamente | Em vez de escolher colunas individualmente, selecione as colunas por uma regra para que a saída se adapte conforme o esquema de entrada muda. Escolha se deseja manter colunas correspondentes ou remover colunas correspondentes, então combinar colunas por:
|
Prepare
Limpa e deriva colunas encadeando uma ou mais ações nos dados de entrada. Clique + Adicionar ação e selecione uma ação. Adicione quantas ações forem necessárias. Eles se aplicam em ordem.
| Ação | Descrição |
|---|---|
| Fórmula | Crie uma nova coluna ou substitua uma coluna existente usando uma linguagem natural ou uma expressão SQL. |
| Tipo de alteração | Converter uma coluna em outro tipo de dados. |
| Substituir valor | Localizar e substituir valores em uma coluna. |
| Preencher nulos | Substitua valores nulos por uma constante. |
| Caso de texto | Altere a maiúscula para baixo, superior ou título. |
| Cortar | Remova o espaço em branco de uma ou ambas as extremidades. |
| Substituição de Regex | Substitua o texto correspondente a um padrão regex. |
| Extrair | Extraia uma subcadeia de caracteres correspondente a um grupo regex. |
| Data de análise | Analise uma cadeia de caracteres em uma data ou carimbo de data/hora. |
Para remover uma ação, passe o mouse sobre sua linha e clique no .
Colunas personalizadas
A ação Fórmula abre o editor de expressões, em que você pode criar uma nova coluna ou substituir uma coluna existente usando linguagem natural ou código SQL. O editor tem duas caixas de entrada e é bidirecional:
- Descrição: digite uma descrição de linguagem natural do que você deseja que a coluna faça. O Designer usa o Genie para gerar a expressão de código correspondente abaixo.
- Expressão: se você preferir escrever ou editar código diretamente, clique no botão editar expressão. Editar a expressão gera automaticamente uma descrição de linguagem natural.
No editor de expressões, digite @ para abrir um menu com as colunas de entrada do operador e as funções SQL embutidas. Digite depois @ para filtrar a lista, depois selecione uma entrada para inseri-la: uma coluna insere seu nome, e uma função insere sua chamada com o cursor colocado entre parênteses. O mesmo @ menu está disponível nos editores de expressões de outros operadores, como condições personalizadas de Filtro e Join.
Python
Executa Python personalizados (PySpark) nos dados de entrada.
| Campo | Descrição |
|---|---|
result |
Atribua um único DataFrame, resultque se torna a saída do operador. |
inputs["data"] |
Uma lista de DataFrames de entrada, em ordem upstream. O painel de detalhes do operador mostra o nome de cada entrada, em ordem. Por exemplo, Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales). |
| Parameters | Chame dbutils.widgets.get(), como dbutils.widgets.get("environment"), para fazer referência a um parâmetro de preparação de dados visuais. O designer mostra um exemplo acima do editor quando você abre o operador para edição. Consulte Parâmetros. |
Um padrão mínimo é usar a primeira entrada quando presente ou um DataFrame vazio, caso contrário:
# inputs["data"] is a list of input DataFrames
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
A partir daí, você pode encadear operações dataframe (por exemplo, , , ou junções) select antes do término da atribuição ou substituir filter por um novo DataFrame criado a partir de withColumn. resultresultinputs["data"]
Durante uma prévia, a saída do operador flui para o painel de saída conforme é produzida, incluindo qualquer coisa que você renderize display() e texto que imprima, para que você possa ver os resultados antes do fim da execução.
Modo de pré-visualização em Python
Enquanto você constrói uma preparação visual de dados, o Designer visualiza continuamente a saída de cada operador em uma amostra dos seus dados. Essas prévias rodam seu código em Python da mesma forma que uma execução completa. Isso é um problema quando seu código tem efeitos colaterais, como chamar uma API externa, enviar uma notificação ou escrever para um sistema fora do Unity Catalog. Normalmente, você não quer que esses efeitos colaterais apareçam em toda prévia.
Para deixar seu código diferenciar os dois, leia config["is_preview"], um Designer booleano define para você:
-
TrueDurante uma prévia, então você pode pular efeitos colaterais. -
Falsedurante uma execução completa, como quando você clica em Executar ou em uma execução programada.
Por exemplo, efeitos colaterais do guarda para que eles rodem apenas fora das prévias:
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
# Side effects run only on a full run or scheduled job, not during previews.
if not config["is_preview"]:
write_results_to_external_system(result)
Organização
Note
Adiciona uma anotação na tela para que você possa documentar o fluxo de trabalho em si: sua finalidade, suposições, ressalvas ou contexto de entrega para qualquer pessoa que abra a preparação de dados visuais mais tarde.
| Campo | Descrição |
|---|---|
| Conteúdo | Edite o conteúdo da anotação embutido na tela com um editor de rich-text. Você pode adicionar títulos, estilo de texto, links, imagens e tabelas em que texto sem formatação não é suficiente. As anotações não afetam a forma como os dados fluem por meio de operadores. |
Group
Agrupa visualmente operadores na tela sem alterar como os dados fluem entre eles, o que é útil quando uma preparação de dados visuais aumenta ou você deseja refletir estágios lógicos.
| Campo | Descrição |
|---|---|
| Adicionar ao grupo | Arraste um ou mais operadores para um grupo para adicioná-los a ele. |
| Criar com base na seleção | Selecione um ou vários operadores, abra o menu de atalho (clique com o botão direito do mouse) e selecione Criar novo grupo para encapsular a seleção em um novo grupo. |
| Name | Dê ao grupo um nome descritivo. |
| Minimizar/expandir | Clique em minimizar ou expandir para mostrar ou ocultar o conteúdo do grupo na tela. |
| Ativar / desativar | Clique com o botão direito no cabeçalho do grupo e selecione Desativar para excluir todos os operadores do grupo das execuções, ou Habilitar para incluí-los novamente. Operadores desativados não produzem linhas de saída, então operadores posteriores recebem um resultado vazio até que você os habilite. Você também pode ativar ou desativar um operador individual. Veja Habilitar ou desativar operadores. |
Visualization
Cria uma visualização dos dados de entrada e os renderiza diretamente na tela. Conecte um operador de Visualização a qualquer operador que produza dados tabulares para mapear os resultados sem sair do Designer.
Para configurar a visualização, abra o operador e selecione um tipo de Visualização e mapeie suas colunas para o gráfico.
| Campo | Descrição |
|---|---|
| Visualization | O tipo de gráfico a ser renderizado, como Barra, Área ou Contador. |