Operadores incorporados no Lakeflow Designer

O Lakeflow Designer inclui operadores incorporados para tarefas comuns de preparação e transformação de dados. Abra o menu do operador no painel lateral à esquerda para navegar pelos operadores por categoria, ou use Procurar um operador... no topo do painel. A pesquisa de operadores sugere operadores com base na sua intenção. Por exemplo, ao tipar average by month devolve o operador Aggregate . Para configurar um operador depois de o adicionar à tela, clique duas vezes nele, ou passe o rato sobre ele e clique no ícone Lápis. (Editar operador), para abrir o painel de configuração.

O menu de operadores do LFD mostra a caixa de pesquisa de operadores e os operadores agrupados por categoria.

Cada operador apresenta uma descrição gerada por IA do que faz. A descrição também funciona como um editor para o operador: editar a descrição reconfigura o operador para corresponder à sua descrição.

Para aprender a criar os seus próprios operadores definidos pelo utilizador, consulte Operadores definidos pelo utilizador no Lakeflow Designer.

Fonte e saída

Source

Importa dados para o Designer a partir de uma tabela Unity Catalog ou outra fonte suportada. Para selecionar uma fonte, procure uma tabela ou ficheiro por nome, ou navegue por catálogo e esquema. Também pode criar uma nova tabela a partir deste painel.

Depois de selecionares uma tabela, o painel mostra o nome da tabela, o proprietário e a última hora de atualização. Clique em Selecionar uma nova fonte de dados para alterar a fonte. Alterar a fonte invalida a cache de saída para todos os operadores a jusante.

Também pode usar uma vista métrica do Unity Catalog como fonte. Quando seleciona uma vista métrica, selecione as dimensões e medidas a incluir, e o Designer gera a consulta agregada para si.

Para a gama completa de opções de ingestão de dados, incluindo direcionar um volume ou pasta completo do Unity Catalog, veja Ingest data into Lakeflow Designer.

Introdução de dados

Cria uma tabela digitando valores num editor ao estilo folha de cálculo. Use este operador para adicionar pequenas quantidades de dados de referência, como valores de consulta ou dados de teste, sem criar uma tabela de origem separada.

Campo Description
Dados da tabela Introduza os seus dados como uma tabela. A primeira linha define os cabeçalhos das colunas, e as restantes linhas são os dados. O designer infere o tipo de dado de cada coluna a partir dos seus valores.

Output

Exporta dados do Designer. O operador de Saída pode escrever resultados numa tabela do Catálogo Unity, publicá-los como uma vista materializada ou gravá-los num ficheiro num volume do Catálogo Unity. Selecione o destino com o tipo de Saída.

Tipo de saída Description
Table Escreve os resultados numa tabela gerida do Unity Catalog. Defina um nome de Tabela e uma localização de Saída (catálogo e esquema), depois selecione um modo de Escrita.
Visão materializada Publica os resultados como uma vista materializada no Unity Catalog que atualiza quando a preparação visual dos dados é executada.
File Grava os resultados num ficheiro num volume do Unity Catalog. Selecione um tipo de ficheiro CSV, Excel ou JSON, depois defina o volume alvo e o nome do ficheiro.

Para uma saída de Tabela ou Ficheiro , selecione como cada execução escreve no destino com o modo Write:

Modo de escrita Description
Sobrescrever Substitui o conteúdo existente pelos resultados da corrida atual. Este é o padrão.
Anexar Soma os resultados da execução atual às linhas existentes.
Merge Upserts avança para a tabela alvo ao corresponder nas chaves de fusão que especificas. Disponível para saídas de tabela.

Clica em Executar para executar a preparação dos dados visuais e escrever os resultados. Para uma saída de tabela, se a tabela não existir, o operador cria-a. Execuções agendadas escrevem no destino usando o mesmo modo de escrita.

Função de IA

Executa uma operação de IA integrada nos seus dados. No painel de configuração, abra Selecionar uma função e selecionar uma das funções na tabela seguinte. Cada função expõe opções no painel para entradas (por exemplo, colunas, prompts, rótulos ou línguas) e saídas.

Function Description
ai_analyze_sentiment Realiza análise de sentimento no texto de entrada.
ai_classify Classifica texto ou documentos analisados usando as etiquetas que fornecer.
ai_extract Extrai dados estruturados de texto ou documentos analisados usando campos que definiste.
ai_fix_grammar Corrige erros gramaticais no texto.
ai_forecast Prevê dados de séries temporais até um horizonte que especificar. ai_forecast é uma função de valores de tabela que processa toda a tabela de entrada.
ai_gen Responde a um prompt fornecido pelo utilizador contra a entrada.
ai_mask As máscaras especificavam entidades no texto (por exemplo, para desidentificação).
ai_parse_document Extrai texto, tabelas e layout de documentos não estruturados.
ai_prep_search Transforma a saída de documentos analisados em blocos prontos para pesquisa para pipelines de geração aumentada de pesquisa vetorial e recuperação (RAG).
ai_query Responde a um prompt usando qualquer modelo de fundação suportado, para flexibilidade de tarefas e modelos de uso geral.
ai_similarity Compara duas cadeias e devolve uma pontuação de similaridade semântica.
ai_summarize Gera um resumo do texto.
ai_translate Traduz o texto para a língua-alvo que especificar.

Para detalhes sobre cada função, veja Transformar dados não estruturados usando Funções de IA.

Transformations

Os seguintes operadores realizam transformações nos seus dados.

Aggregate

Resume as linhas agrupando dados e calculando valores agregados.

Campo Description
Agrupar por Selecione uma coluna, selecione uma função de agregação e forneça um nome para a coluna de saída. Clique + Adicionar agregação para adicionar mais. Funções suportadas: AVG, COUNT, MAXCOUNT DISTINCT, MEAN, MEDIAN, MIN, , PERCENTILE, , STDDEV, SUM, , . VARIANCE
Agrupar por Selecione as colunas para agrupar. Clique + Adicionar agrupamento para adicionar mais. As colunas usadas em Agrupar por são automaticamente incluídas na saída.

Combine

Funde dados de múltiplas tabelas com esquemas correspondentes numa única saída.

Campo Description
Definir operação Selecione união, interseção ou exceção.
Estratégia de fusão Selecione Distinto para excluir linhas duplicadas da saída, ou Todos para manter todas as linhas, incluindo as duplicadas.

Unique

Remove linhas duplicadas dos dados de entrada. Por defeito, o operador desduplica em todas as colunas. Pode, em vez disso, escolher um subconjunto de colunas como chave e ordenar as linhas para controlar qual duplicado é mantido.

Campo Description
Único por Selecione Todas as colunas para remover linhas idênticas em todas as colunas, ou Colunas Selecionadas para remover linhas que sejam duplicadas apenas nas colunas que escolher como chave.
Encomendar por Opcional: selecione uma ou mais colunas e uma direção de ordenação para controlar qual linha é mantida para cada conjunto de duplicados. Se não definir uma ordem, o operador mantém a primeira fila que encontra.

Filter

Divide as linhas consoante se cumprem uma ou mais condições, usando um construtor gráfico de condições.

Campo Description
Condition Para cada condição, selecione uma coluna, um tipo de condição e um valor a corresponder condicionalmente. Tipos de condições suportadas:
  • É igual a / Não é igual a
  • É um dos / Não é um dos
  • Contém / Não contém
  • Começa com / Não começa com
  • Termina com / Não termina com
  • Maior que / Menor que
  • É nulo / Não é nulo

Para as condições nas colunas de datas, o seletor de data suporta a navegação entre anos e meses.
Quando uma condição corresponde aos valores de uma coluna (por exemplo, É um dos), a lista de valores mostra uma amostra dos valores distintos da coluna com base na entrada. Selecione Carregar mais para obter valores adicionais a pedido.

O operador Filter tem duas saídas, por isso pode ramificar dados com base em satisfazer as condições:

Output Description
Included Linhas que cumpram as condições do filtro.
Excluídos Linhas que não cumprem as condições do filtro, incluindo linhas onde a condição é avaliada como nula.

Join

Liga duas tabelas numa chave combinando dois conjuntos de dados de entrada com base na correspondência dos valores das colunas.

Campo Description
Tabelas de entrada Selecione as duas tabelas de entrada para se juntar.
Condição de junção Especifique pelo menos uma condição de junção selecionando colunas correspondentes das duas tabelas. Clique + Adicionar expressão de junção para adicionar mais condições. Opcional: clique na seta entre as tabelas esquerda e direita para adicionar uma condição de junção personalizada, depois edite a descrição gerada pela IA ou escreva SQL.
Caso de correspondência Quando desligado (o padrão), as teclas de join de string coincidem de forma insensível a maiúsculas minúsculas (e ignoram o espaço branco inicial e final). Liga a caixa Match para corresponder exatamente às teclas das cordas. Esta opção aplica-se às chaves de junção, não a condições de junção personalizadas.
Tipo de junção Selecione o tipo de junção. Por defeito, o operador Join divide os seus resultados em três saídas (ver a secção seguinte). Selecione junção completa, junção interna, junção à esquerda ou junção à direita para produzir uma única saída unida em vez disso.
Colunas de saída Opcional: selecione quais as colunas a incluir. Por defeito, todas as colunas de ambas as tabelas estão incluídas. Nomes de colunas duplicados recebem um prefixo de nome de tabela.
Colunas de expressão personalizadas Opcional: adicionar colunas de expressão personalizadas com base no resultado junto.

Por defeito, o operador de junção tem três saídas, por isso pode ramificar um fluxo de trabalho com base nos resultados da junção:

Output Description
Deixado sem igual Linhas da entrada esquerda que não têm correspondência na entrada direita.
Combinado Linhas que coincidem em ambas as entradas.
Direita sem igual Linhas da entrada direita que não têm correspondência na entrada esquerda.

Quando se seleciona um tipo específico de Join (full, inner, left ou right), o operador produz uma única saída unida em vez das três saídas divididas.

Limite

Restringe a contagem de linhas passando apenas até ao número máximo de linhas que especificas.

Campo Description
Máximo de linhas Especifique o número máximo de linhas a atravessar.

Pivot

Remodela os dados tabulares em duas direções. Usa os separadores no topo do painel de configuração para selecionar o modo.

Linhas → Colunas (pivot)

Transforma valores distintos numa coluna em novos cabeçalhos de colunas, preenchidos com valores agregados de outra coluna.

Campo Description
Coluna de pivô Selecione a coluna cujos valores distintos se tornam os novos cabeçalhos.
Valor & agregação Selecione a coluna cujos valores preenchem as células pivotadas e selecione uma função de agregação (por exemplo, SUM, AVG, COUNTMIN, , ou MAX). Configure como os valores em falta são tratados (por exemplo, nulo ou zero), se disponíveis no painel.

Colunas → Linhas (despivô)

Dobra uma ou mais colunas em linhas.

Campo Description
Reorganizar colunas Seleciona as colunas para despivotar.
Colunas de chave e valor Defina nomes para as colunas de chave de saída e de valor.

Incluir colunas

Para qualquer um dos modos, seleciona quais as colunas que ficam na saída juntamente com os valores pivotados ou não pivotados, e elimina as colunas que não precisas antes da transformação. O designer infere colunas fixas (agrupando) a partir das colunas que não atribuis a papéis de pivot, valor ou despivot.

Ordenar

Ordena linhas numa ou mais colunas.

Campo Description
Sequência de ordenação Selecione ASC (ascendente) ou DESC (descendente) para cada coluna. Clique + Adicionar expressão de ordenação para ordenar por colunas adicionais. A ordenação segue a ordem lexical padrão.

SQL

Escreve código SQL personalizado para qualquer transformação não coberta pelos outros operadores.

Campo Description
Editor de SQL Escreve uma instrução SQL SELECT . Para referenciar a saída de um operador de entrada, use o nome desse operador como nome da tabela na sua consulta. Por exemplo:
SELECT COUNT(*)
FROM aggregate_2
WHERE 1 = 1
Clique no ícone de Código. para abrir todo o painel de código SQL e ver como a sua declaração se encaixa no fluxo de trabalho completo.
Parameters Para referenciar um parâmetro visual de preparação de dados, use a sintaxe de marcadores de parâmetros nomeados, como :environment. O designer mostra um exemplo acima do editor quando abres o operador para edição. Consulte Parâmetros.

Selecione

Seleciona, renomeia e reordena as colunas a partir dos dados de entrada.

Campo Description
Incluir ou excluir colunas Selecione Começar com todas as colunas ou Começar sem colunas, depois use as caixas de seleção para incluir ou excluir colunas individuais. Arraste colunas para as reordenar.
Renomear uma coluna Escreva um novo nome no campo Renomear ao lado de qualquer coluna.
Selecionar colunas dinamicamente Em vez de escolher as colunas individualmente, selecione as colunas por uma regra para que a saída se adapte à medida que o esquema de entrada muda. Escolha se quer manter colunas correspondentes ou remover colunas correspondentes, depois associar colunas por:
  • Tipo de dados da coluna: Selecione um ou mais tipos, como Booleano, Inteiro, Flutuante/Duplo, Decimal, String, Data, Timestamp ou Binário.
  • Nome da coluna: Corresponde a nomes que comecem, terminam com, contêm ou correspondem a uma expressão regular. Ativa o sensível a maiúsculas minúsculas para corresponder exatamente ao caso.
  • Fórmula: Escreva uma expressão booleana que seja avaliada para cada coluna em relação aos seus metadados, usando campos como Name, Type, e IsNumeric. Por exemplo, IsNumeric AND Name LIKE '%_id' corresponde a colunas numéricas cujo nome termina em _id.

Prepare

Limpa e deriva colunas encadeando uma ou mais ações sobre os dados de entrada. Clica + Adicionar ação e seleciona uma ação. Adiciona quantas ações precisares. Candidatam-se por ordem.

Ação Description
Fórmula Crie uma nova coluna ou sobrescrita uma coluna existente usando linguagem natural ou uma expressão SQL.
Alterar tipo Converter uma coluna para outro tipo de dado.
Valor de substituição Encontre e substitua valores numa coluna.
Nulos de preenchimento Substitua valores nulos por uma constante.
Caso de texto Muda a maiúscula para inferior, superior ou título.
Cortar Remova espaços em branco de uma ou ambas as extremidades.
Substituição Regex Substitui o texto que corresponde a um padrão regex.
Extrato Extrai uma substring que corresponda a um grupo regex.
Data de análise Analise uma sequência numa data ou carimbo temporal.

Para remover uma ação, passe o rato sobre a sua linha e clique no ícone Traço..

Colunas personalizadas

A ação Fórmula abre o editor de expressões, onde pode criar uma nova coluna ou sobrescrever uma coluna existente usando código em linguagem natural ou SQL. O editor tem duas caixas de entrada e é bidirecional:

  • Descrição: Escreve uma descrição em linguagem natural do que queres que a coluna faça. O designer usa o Genie para gerar a expressão de código correspondente abaixo.
  • Expressão: Se preferir escrever ou editar código diretamente, clique no botão de editar expressão. Editar a expressão gera automaticamente uma descrição em linguagem natural.

No editor de expressões, escreva @ para abrir um menu com as colunas de entrada do operador e as funções SQL integradas. Escreva depois @ para filtrar a lista, depois selecione uma entrada para a inserir: uma coluna insere o seu nome, e uma função insere a sua chamada com o cursor colocado entre parênteses. O mesmo @ menu está disponível nos editores de expressões de outros operadores, como condições personalizadas de Filter e Join.

Python

Executa Python personalizado (PySpark) nos dados de entrada.

Campo Description
result Atribui-se um único DataFrame a result, que se torna a saída do operador.
inputs["data"] Uma lista de DataFrames de entrada, por ordem a montante. O painel de detalhes do operador mostra o nome de cada entrada, por ordem. Por exemplo, Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales).
Parameters Chame dbutils.widgets.get(), como dbutils.widgets.get("environment"), para referenciar um parâmetro visual de preparação de dados. O designer mostra um exemplo acima do editor quando abres o operador para edição. Consulte Parâmetros.

Um padrão mínimo é usar a primeira entrada quando presente, ou um DataFrame vazio caso contrário:

# inputs["data"] is a list of input DataFrames

result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")

A partir daí, pode encadear operações DataFrame (por exemplo, select, filter, withColumn, ou joins) antes result da atribuição terminar, ou substituir result por um novo DataFrame construído a partir de inputs["data"].

Durante uma pré-visualização, a saída do operador flui para o painel de saída à medida que é produzida, incluindo tudo o que utiliza display() e o texto que imprime, para que possa ver os resultados antes do fim da execução.

Modo de pré-visualização em Python

À medida que constróis uma preparação visual de dados, o Designer pré-visualiza continuamente a saída de cada operador numa amostra dos teus dados. Estas pré-visualizações executam o teu código Python da mesma forma que uma execução completa. Isso é um problema quando o teu código tem efeitos secundários, como ligar a uma API externa, enviar uma notificação ou escrever para um sistema fora do Unity Catalog. Normalmente não queres que esses efeitos secundários apareçam em todas as pré-visualizações.

Para deixar o seu código distinguir os dois, leia config["is_preview"], um Designer booleano define para si:

  • True Durante uma corrida de pré-visualização, por isso podes saltar efeitos secundários.
  • False durante uma execução completa, como quando clicas em Executar ou numa execução agendada.

Por exemplo, efeitos secundários de guarda para que só funcionem fora das pré-visualizações:

result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")

# Side effects run only on a full run or scheduled job, not during previews.
if not config["is_preview"]:
    write_results_to_external_system(result)

Organização

Note

Adiciona uma nota na tela para que possas documentar o fluxo de trabalho em si: o seu propósito, pressupostos, ressalvas ou contexto de transferência para quem abrir a preparação de dados visuais mais tarde.

Campo Description
Conteúdo Nota de edição conteúdo em linha na tela com um editor de texto enriquecido. Pode adicionar títulos, estilo de texto, links, imagens e tabelas onde o texto simples não é suficiente. As notas não afetam a forma como os dados passam pelos operadores.

Group

Agrupa visualmente os operadores na tela sem alterar a forma como os dados fluem entre eles, o que é útil quando uma preparação visual de dados cresce ou se quer refletir etapas lógicas.

Campo Description
Adicionar ao grupo Arraste um ou mais operadores para um grupo para os adicionar.
Criar a partir da seleção Selecione um ou vários operadores, abra o menu de atalho (clique com o botão direito) e selecione Criar novo grupo para envolver a seleção num novo grupo.
Name Dê ao grupo um nome descritivo.
Minimizar / expandir Clique em minimizar ou expandir para mostrar ou esconder o conteúdo do grupo na tela.
Ativar / desativar Clique com o botão direito no cabeçalho do grupo e selecione Desativar para excluir todos os operadores do grupo das execuções, ou Ativar para os incluir novamente. Operadores desativados não produzem linhas de saída, por isso os operadores a jusante recebem um resultado vazio até que os ative ativado. Também pode ativar ou desativar um operador individual. Veja Ativar ou desativar operadores.

Visualization

Cria uma visualização a partir dos dados de entrada e renderiza-os diretamente na tela. Ligue um operador de visualização a qualquer operador que produza dados tabulares para graficar os resultados sem sair do Designer.

Para configurar a visualização, abra o operador e selecione um tipo de Visualização , depois mapeie as suas colunas para o gráfico.

Campo Description
Visualization O tipo de gráfico a renderizar, como Barra, Área ou Contador.

Recursos adicionais