Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O Lakeflow Designer inclui operadores incorporados para tarefas comuns de preparação e transformação de dados. Abra o menu do operador no painel lateral à esquerda para navegar pelos operadores por categoria, ou use Procurar um operador... no topo do painel. A pesquisa de operadores sugere operadores com base na sua intenção. Por exemplo, ao tipar average by month devolve o operador Aggregate . Para configurar um operador depois de o adicionar à tela, clique duas vezes nele, ou passe o rato sobre ele e clique (Editar operador), para abrir o painel de configuração.
Cada operador apresenta uma descrição gerada por IA do que faz. A descrição também funciona como um editor para o operador: editar a descrição reconfigura o operador para corresponder à sua descrição.
Para aprender a criar os seus próprios operadores definidos pelo utilizador, consulte Operadores definidos pelo utilizador no Lakeflow Designer.
Fonte e saída
Source
Importa dados para o Designer a partir de uma tabela Unity Catalog ou outra fonte suportada. Para selecionar uma fonte, procure uma tabela ou ficheiro por nome, ou navegue por catálogo e esquema. Também pode criar uma nova tabela a partir deste painel.
Depois de selecionares uma tabela, o painel mostra o nome da tabela, o proprietário e a última hora de atualização. Clique em Selecionar uma nova fonte de dados para alterar a fonte. Alterar a fonte invalida a cache de saída para todos os operadores a jusante.
Também pode usar uma vista métrica do Unity Catalog como fonte. Quando seleciona uma vista métrica, selecione as dimensões e medidas a incluir, e o Designer gera a consulta agregada para si.
Para a gama completa de opções de ingestão de dados, incluindo direcionar um volume ou pasta completo do Unity Catalog, veja Ingest data into Lakeflow Designer.
Introdução de dados
Cria uma tabela digitando valores num editor ao estilo folha de cálculo. Use este operador para adicionar pequenas quantidades de dados de referência, como valores de consulta ou dados de teste, sem criar uma tabela de origem separada.
| Campo | Description |
|---|---|
| Dados da tabela | Introduza os seus dados como uma tabela. A primeira linha define os cabeçalhos das colunas, e as restantes linhas são os dados. O designer infere o tipo de dado de cada coluna a partir dos seus valores. |
Output
Exporta dados do Designer. O operador de Saída pode escrever resultados numa tabela do Catálogo Unity, publicá-los como uma vista materializada ou gravá-los num ficheiro num volume do Catálogo Unity. Selecione o destino com o tipo de Saída.
| Tipo de saída | Description |
|---|---|
| Table | Escreve os resultados numa tabela gerida do Unity Catalog. Defina um nome de Tabela e uma localização de Saída (catálogo e esquema), depois selecione um modo de Escrita. |
| Visão materializada | Publica os resultados como uma vista materializada no Unity Catalog que atualiza quando a preparação visual dos dados é executada. |
| File | Grava os resultados num ficheiro num volume do Unity Catalog. Selecione um tipo de ficheiro CSV, Excel ou JSON, depois defina o volume alvo e o nome do ficheiro. |
Para uma saída de Tabela ou Ficheiro , selecione como cada execução escreve no destino com o modo Write:
| Modo de escrita | Description |
|---|---|
| Sobrescrever | Substitui o conteúdo existente pelos resultados da corrida atual. Este é o padrão. |
| Anexar | Soma os resultados da execução atual às linhas existentes. |
| Merge | Upserts avança para a tabela alvo ao corresponder nas chaves de fusão que especificas. Disponível para saídas de tabela. |
Clica em Executar para executar a preparação dos dados visuais e escrever os resultados. Para uma saída de tabela, se a tabela não existir, o operador cria-a. Execuções agendadas escrevem no destino usando o mesmo modo de escrita.
Função de IA
Executa uma operação de IA integrada nos seus dados. No painel de configuração, abra Selecionar uma função e selecionar uma das funções na tabela seguinte. Cada função expõe opções no painel para entradas (por exemplo, colunas, prompts, rótulos ou línguas) e saídas.
| Function | Description |
|---|---|
ai_analyze_sentiment |
Realiza análise de sentimento no texto de entrada. |
ai_classify |
Classifica texto ou documentos analisados usando as etiquetas que fornecer. |
ai_extract |
Extrai dados estruturados de texto ou documentos analisados usando campos que definiste. |
ai_fix_grammar |
Corrige erros gramaticais no texto. |
ai_forecast |
Prevê dados de séries temporais até um horizonte que especificar.
ai_forecast é uma função de valores de tabela que processa toda a tabela de entrada. |
ai_gen |
Responde a um prompt fornecido pelo utilizador contra a entrada. |
ai_mask |
As máscaras especificavam entidades no texto (por exemplo, para desidentificação). |
ai_parse_document |
Extrai texto, tabelas e layout de documentos não estruturados. |
ai_prep_search |
Transforma a saída de documentos analisados em blocos prontos para pesquisa para pipelines de geração aumentada de pesquisa vetorial e recuperação (RAG). |
ai_query |
Responde a um prompt usando qualquer modelo de fundação suportado, para flexibilidade de tarefas e modelos de uso geral. |
ai_similarity |
Compara duas cadeias e devolve uma pontuação de similaridade semântica. |
ai_summarize |
Gera um resumo do texto. |
ai_translate |
Traduz o texto para a língua-alvo que especificar. |
Para detalhes sobre cada função, veja Transformar dados não estruturados usando Funções de IA.
Transformations
Os seguintes operadores realizam transformações nos seus dados.
Aggregate
Resume as linhas agrupando dados e calculando valores agregados.
| Campo | Description |
|---|---|
| Agrupar por | Selecione uma coluna, selecione uma função de agregação e forneça um nome para a coluna de saída. Clique + Adicionar agregação para adicionar mais. Funções suportadas: AVG, COUNT, MAXCOUNT DISTINCT, MEAN, MEDIAN, MIN, , PERCENTILE, , STDDEV, SUM, , . VARIANCE |
| Agrupar por | Selecione as colunas para agrupar. Clique + Adicionar agrupamento para adicionar mais. As colunas usadas em Agrupar por são automaticamente incluídas na saída. |
Combine
Funde dados de múltiplas tabelas com esquemas correspondentes numa única saída.
| Campo | Description |
|---|---|
| Definir operação | Selecione união, interseção ou exceção. |
| Estratégia de fusão | Selecione Distinto para excluir linhas duplicadas da saída, ou Todos para manter todas as linhas, incluindo as duplicadas. |
Unique
Remove linhas duplicadas dos dados de entrada. Por defeito, o operador desduplica em todas as colunas. Pode, em vez disso, escolher um subconjunto de colunas como chave e ordenar as linhas para controlar qual duplicado é mantido.
| Campo | Description |
|---|---|
| Único por | Selecione Todas as colunas para remover linhas idênticas em todas as colunas, ou Colunas Selecionadas para remover linhas que sejam duplicadas apenas nas colunas que escolher como chave. |
| Encomendar por | Opcional: selecione uma ou mais colunas e uma direção de ordenação para controlar qual linha é mantida para cada conjunto de duplicados. Se não definir uma ordem, o operador mantém a primeira fila que encontra. |
Filter
Divide as linhas consoante se cumprem uma ou mais condições, usando um construtor gráfico de condições.
| Campo | Description |
|---|---|
| Condition | Para cada condição, selecione uma coluna, um tipo de condição e um valor a corresponder condicionalmente. Tipos de condições suportadas:
Para as condições nas colunas de datas, o seletor de data suporta a navegação entre anos e meses. Quando uma condição corresponde aos valores de uma coluna (por exemplo, É um dos), a lista de valores mostra uma amostra dos valores distintos da coluna com base na entrada. Selecione Carregar mais para obter valores adicionais a pedido. |
O operador Filter tem duas saídas, por isso pode ramificar dados com base em satisfazer as condições:
| Output | Description |
|---|---|
| Included | Linhas que cumpram as condições do filtro. |
| Excluídos | Linhas que não cumprem as condições do filtro, incluindo linhas onde a condição é avaliada como nula. |
Join
Liga duas tabelas numa chave combinando dois conjuntos de dados de entrada com base na correspondência dos valores das colunas.
| Campo | Description |
|---|---|
| Tabelas de entrada | Selecione as duas tabelas de entrada para se juntar. |
| Condição de junção | Especifique pelo menos uma condição de junção selecionando colunas correspondentes das duas tabelas. Clique + Adicionar expressão de junção para adicionar mais condições. Opcional: clique na seta entre as tabelas esquerda e direita para adicionar uma condição de junção personalizada, depois edite a descrição gerada pela IA ou escreva SQL. |
| Caso de correspondência | Quando desligado (o padrão), as teclas de join de string coincidem de forma insensível a maiúsculas minúsculas (e ignoram o espaço branco inicial e final). Liga a caixa Match para corresponder exatamente às teclas das cordas. Esta opção aplica-se às chaves de junção, não a condições de junção personalizadas. |
| Tipo de junção | Selecione o tipo de junção. Por defeito, o operador Join divide os seus resultados em três saídas (ver a secção seguinte). Selecione junção completa, junção interna, junção à esquerda ou junção à direita para produzir uma única saída unida em vez disso. |
| Colunas de saída | Opcional: selecione quais as colunas a incluir. Por defeito, todas as colunas de ambas as tabelas estão incluídas. Nomes de colunas duplicados recebem um prefixo de nome de tabela. |
| Colunas de expressão personalizadas | Opcional: adicionar colunas de expressão personalizadas com base no resultado junto. |
Por defeito, o operador de junção tem três saídas, por isso pode ramificar um fluxo de trabalho com base nos resultados da junção:
| Output | Description |
|---|---|
| Deixado sem igual | Linhas da entrada esquerda que não têm correspondência na entrada direita. |
| Combinado | Linhas que coincidem em ambas as entradas. |
| Direita sem igual | Linhas da entrada direita que não têm correspondência na entrada esquerda. |
Quando se seleciona um tipo específico de Join (full, inner, left ou right), o operador produz uma única saída unida em vez das três saídas divididas.
Limite
Restringe a contagem de linhas passando apenas até ao número máximo de linhas que especificas.
| Campo | Description |
|---|---|
| Máximo de linhas | Especifique o número máximo de linhas a atravessar. |
Pivot
Remodela os dados tabulares em duas direções. Usa os separadores no topo do painel de configuração para selecionar o modo.
Linhas → Colunas (pivot)
Transforma valores distintos numa coluna em novos cabeçalhos de colunas, preenchidos com valores agregados de outra coluna.
| Campo | Description |
|---|---|
| Coluna de pivô | Selecione a coluna cujos valores distintos se tornam os novos cabeçalhos. |
| Valor & agregação | Selecione a coluna cujos valores preenchem as células pivotadas e selecione uma função de agregação (por exemplo, SUM, AVG, COUNTMIN, , ou MAX). Configure como os valores em falta são tratados (por exemplo, nulo ou zero), se disponíveis no painel. |
Colunas → Linhas (despivô)
Dobra uma ou mais colunas em linhas.
| Campo | Description |
|---|---|
| Reorganizar colunas | Seleciona as colunas para despivotar. |
| Colunas de chave e valor | Defina nomes para as colunas de chave de saída e de valor. |
Incluir colunas
Para qualquer um dos modos, seleciona quais as colunas que ficam na saída juntamente com os valores pivotados ou não pivotados, e elimina as colunas que não precisas antes da transformação. O designer infere colunas fixas (agrupando) a partir das colunas que não atribuis a papéis de pivot, valor ou despivot.
Ordenar
Ordena linhas numa ou mais colunas.
| Campo | Description |
|---|---|
| Sequência de ordenação | Selecione ASC (ascendente) ou DESC (descendente) para cada coluna. Clique + Adicionar expressão de ordenação para ordenar por colunas adicionais. A ordenação segue a ordem lexical padrão. |
SQL
Escreve código SQL personalizado para qualquer transformação não coberta pelos outros operadores.
| Campo | Description |
|---|---|
| Editor de SQL | Escreve uma instrução SQL SELECT . Para referenciar a saída de um operador de entrada, use o nome desse operador como nome da tabela na sua consulta. Por exemplo:SELECT COUNT(*)FROM aggregate_2WHERE 1 = 1Clique no |
| Parameters | Para referenciar um parâmetro visual de preparação de dados, use a sintaxe de marcadores de parâmetros nomeados, como :environment. O designer mostra um exemplo acima do editor quando abres o operador para edição. Consulte Parâmetros. |
Selecione
Seleciona, renomeia e reordena as colunas a partir dos dados de entrada.
| Campo | Description |
|---|---|
| Incluir ou excluir colunas | Selecione Começar com todas as colunas ou Começar sem colunas, depois use as caixas de seleção para incluir ou excluir colunas individuais. Arraste colunas para as reordenar. |
| Renomear uma coluna | Escreva um novo nome no campo Renomear ao lado de qualquer coluna. |
| Selecionar colunas dinamicamente | Em vez de escolher as colunas individualmente, selecione as colunas por uma regra para que a saída se adapte à medida que o esquema de entrada muda. Escolha se quer manter colunas correspondentes ou remover colunas correspondentes, depois associar colunas por:
|
Prepare
Limpa e deriva colunas encadeando uma ou mais ações sobre os dados de entrada. Clica + Adicionar ação e seleciona uma ação. Adiciona quantas ações precisares. Candidatam-se por ordem.
| Ação | Description |
|---|---|
| Fórmula | Crie uma nova coluna ou sobrescrita uma coluna existente usando linguagem natural ou uma expressão SQL. |
| Alterar tipo | Converter uma coluna para outro tipo de dado. |
| Valor de substituição | Encontre e substitua valores numa coluna. |
| Nulos de preenchimento | Substitua valores nulos por uma constante. |
| Caso de texto | Muda a maiúscula para inferior, superior ou título. |
| Cortar | Remova espaços em branco de uma ou ambas as extremidades. |
| Substituição Regex | Substitui o texto que corresponde a um padrão regex. |
| Extrato | Extrai uma substring que corresponda a um grupo regex. |
| Data de análise | Analise uma sequência numa data ou carimbo temporal. |
Para remover uma ação, passe o rato sobre a sua linha e clique .
Colunas personalizadas
A ação Fórmula abre o editor de expressões, onde pode criar uma nova coluna ou sobrescrever uma coluna existente usando código em linguagem natural ou SQL. O editor tem duas caixas de entrada e é bidirecional:
- Descrição: Escreve uma descrição em linguagem natural do que queres que a coluna faça. O designer usa o Genie para gerar a expressão de código correspondente abaixo.
- Expressão: Se preferir escrever ou editar código diretamente, clique no botão de editar expressão. Editar a expressão gera automaticamente uma descrição em linguagem natural.
No editor de expressões, escreva @ para abrir um menu com as colunas de entrada do operador e as funções SQL integradas. Escreva depois @ para filtrar a lista, depois selecione uma entrada para a inserir: uma coluna insere o seu nome, e uma função insere a sua chamada com o cursor colocado entre parênteses. O mesmo @ menu está disponível nos editores de expressões de outros operadores, como condições personalizadas de Filter e Join.
Python
Executa Python personalizado (PySpark) nos dados de entrada.
| Campo | Description |
|---|---|
result |
Atribui-se um único DataFrame a result, que se torna a saída do operador. |
inputs["data"] |
Uma lista de DataFrames de entrada, por ordem a montante. O painel de detalhes do operador mostra o nome de cada entrada, por ordem. Por exemplo, Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales). |
| Parameters | Chame dbutils.widgets.get(), como dbutils.widgets.get("environment"), para referenciar um parâmetro visual de preparação de dados. O designer mostra um exemplo acima do editor quando abres o operador para edição. Consulte Parâmetros. |
Um padrão mínimo é usar a primeira entrada quando presente, ou um DataFrame vazio caso contrário:
# inputs["data"] is a list of input DataFrames
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
A partir daí, pode encadear operações DataFrame (por exemplo, select, filter, withColumn, ou joins) antes result da atribuição terminar, ou substituir result por um novo DataFrame construído a partir de inputs["data"].
Durante uma pré-visualização, a saída do operador flui para o painel de saída à medida que é produzida, incluindo tudo o que utiliza display() e o texto que imprime, para que possa ver os resultados antes do fim da execução.
Modo de pré-visualização em Python
À medida que constróis uma preparação visual de dados, o Designer pré-visualiza continuamente a saída de cada operador numa amostra dos teus dados. Estas pré-visualizações executam o teu código Python da mesma forma que uma execução completa. Isso é um problema quando o teu código tem efeitos secundários, como ligar a uma API externa, enviar uma notificação ou escrever para um sistema fora do Unity Catalog. Normalmente não queres que esses efeitos secundários apareçam em todas as pré-visualizações.
Para deixar o seu código distinguir os dois, leia config["is_preview"], um Designer booleano define para si:
-
TrueDurante uma corrida de pré-visualização, por isso podes saltar efeitos secundários. -
Falsedurante uma execução completa, como quando clicas em Executar ou numa execução agendada.
Por exemplo, efeitos secundários de guarda para que só funcionem fora das pré-visualizações:
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
# Side effects run only on a full run or scheduled job, not during previews.
if not config["is_preview"]:
write_results_to_external_system(result)
Organização
Note
Adiciona uma nota na tela para que possas documentar o fluxo de trabalho em si: o seu propósito, pressupostos, ressalvas ou contexto de transferência para quem abrir a preparação de dados visuais mais tarde.
| Campo | Description |
|---|---|
| Conteúdo | Nota de edição conteúdo em linha na tela com um editor de texto enriquecido. Pode adicionar títulos, estilo de texto, links, imagens e tabelas onde o texto simples não é suficiente. As notas não afetam a forma como os dados passam pelos operadores. |
Group
Agrupa visualmente os operadores na tela sem alterar a forma como os dados fluem entre eles, o que é útil quando uma preparação visual de dados cresce ou se quer refletir etapas lógicas.
| Campo | Description |
|---|---|
| Adicionar ao grupo | Arraste um ou mais operadores para um grupo para os adicionar. |
| Criar a partir da seleção | Selecione um ou vários operadores, abra o menu de atalho (clique com o botão direito) e selecione Criar novo grupo para envolver a seleção num novo grupo. |
| Name | Dê ao grupo um nome descritivo. |
| Minimizar / expandir | Clique em minimizar ou expandir para mostrar ou esconder o conteúdo do grupo na tela. |
| Ativar / desativar | Clique com o botão direito no cabeçalho do grupo e selecione Desativar para excluir todos os operadores do grupo das execuções, ou Ativar para os incluir novamente. Operadores desativados não produzem linhas de saída, por isso os operadores a jusante recebem um resultado vazio até que os ative ativado. Também pode ativar ou desativar um operador individual. Veja Ativar ou desativar operadores. |
Visualization
Cria uma visualização a partir dos dados de entrada e renderiza-os diretamente na tela. Ligue um operador de visualização a qualquer operador que produza dados tabulares para graficar os resultados sem sair do Designer.
Para configurar a visualização, abra o operador e selecione um tipo de Visualização , depois mapeie as suas colunas para o gráfico.
| Campo | Description |
|---|---|
| Visualization | O tipo de gráfico a renderizar, como Barra, Área ou Contador. |