Operatori predefiniti in Lakeflow Designer

Lakeflow Designer include operatori predefiniti per attività comuni di preparazione e trasformazione dei dati. Aprire il menu dell'operatore nel riquadro laterale a sinistra per esplorare gli operatori per categoria oppure usare Cerca un operatore nella parte superiore del riquadro. La ricerca degli operatori suggerisce gli operatori in base alla finalità. Ad esempio, la digitazione average by month restituisce l'operatore Aggregate . Per configurare un operatore dopo averlo aggiunto all'area di disegno, fare doppio clic su di esso oppure passare il puntatore del mouse su di esso e fare clic sull'icona a forma di matita (operatore Modifica) per aprire il riquadro di configurazione.

Menu dell'operatore LFD che mostra la casella di ricerca dell'operatore e gli operatori raggruppati per categoria.

Ogni operatore visualizza una descrizione generata dall'intelligenza artificiale delle operazioni che esegue. La descrizione funge anche da editor per l'operatore: la modifica della descrizione riconfigura l'operatore in modo che corrisponda alla descrizione.

Per informazioni su come creare operatori personalizzati definiti dall'utente, vedere Operatori definiti dall'utente in Lakeflow Designer.

Origine e output

Source

Importa i dati in Progettazione da una tabella del catalogo Unity o da un'altra origine supportata. Per selezionare un'origine, cercare una tabella o un file in base al nome oppure sfogliare in base al catalogo e allo schema. È anche possibile creare una nuova tabella da questo riquadro.

Dopo aver selezionato una tabella, nel riquadro vengono visualizzati il nome, il proprietario e l'ora dell'ultimo aggiornamento della tabella. Fare clic su Selezionare una nuova origine dati per modificare l'origine. La modifica dell'origine invalida la cache di output per tutti gli operatori downstream.

È anche possibile usare una visualizzazione metrica del catalogo Unity come origine. Quando si seleziona una visualizzazione metrica, selezionare le dimensioni e le misure da includere e Progettazione genera automaticamente la query aggregata.

Per l'intera gamma di opzioni di inserimento dati, inclusa la destinazione di un intero volume o cartella di Unity Catalog, vedere Inserire dati in Lakeflow Designer.

Immettere dati

Crea una tabella digitando i valori in un editor in stile foglio di calcolo. Usare questo operatore per aggiungere piccole quantità di dati di riferimento, ad esempio valori di ricerca o dati di test, senza creare una tabella di origine separata.

Campo Descrizione
Dati tabella Immettere i dati come tabella. La prima riga definisce le intestazioni di colonna e le righe rimanenti sono i dati. Progettazione deduce il tipo di dati di ogni colonna dai relativi valori.

Output

Esporta i dati dalla finestra di progettazione. L'operatore Output può scrivere i risultati in una tabella del catalogo Unity, pubblicarli come vista materializzata o scriverli in un file in un volume del catalogo Unity. Selezionare la destinazione con Tipo di output.

Tipo di output Descrizione
Tabella Scrive i risultati in una tabella del catalogo Unity gestita. Impostare un nome tabella e un percorso di output (catalogo e schema), quindi selezionare una modalità di scrittura.
Vista materializzata Pubblica i risultati come vista materializzata in Unity Catalog che viene aggiornato quando viene eseguita la preparazione dei dati visivi.
File Scrive i risultati in un file in un volume di Catalogo Unity. Selezionare un tipo di file CSV, Excel o JSON, quindi impostare il volume di destinazione e il nome del file.

Per un output di tabella o file , selezionare la modalità di scrittura di ogni esecuzione nella destinazione con la modalità scrittura:

Modalità scrittura Descrizione
Sovrascrivi Sostituisce il contenuto esistente con i risultati dell'esecuzione corrente. Si tratta dell'impostazione predefinita.
Append Aggiunge i risultati dell'esecuzione corrente alle righe esistenti.
Merge Upserts rows into the target table by matching on the merge keys you specify.Upserts rows into the target table by matching on the merge keys you specify. Disponibile per gli output della tabella.

Fare clic su Esegui per eseguire la preparazione dei dati visivi e scrivere i risultati. Per un output di tabella, se la tabella non esiste, l'operatore lo crea. Le esecuzioni pianificate scrivono nella destinazione usando la stessa modalità di scrittura.

Funzione di intelligenza artificiale

Esegue un'operazione di intelligenza artificiale predefinita sui dati. Nel riquadro di configurazione aprire Selezionare una funzione e selezionare una delle funzioni nella tabella seguente. Ogni funzione espone le opzioni nel riquadro per gli input( ad esempio colonne, richieste, etichette o lingue) e output.

Function Descrizione
ai_analyze_sentiment Esegue l'analisi del sentiment sul testo di input.
ai_classify Classifica il testo o i documenti analizzati usando le etichette fornite.
ai_extract Estrae dati strutturati da documenti di testo o analizzati usando i campi definiti.
ai_fix_grammar Corregge gli errori grammaticali nel testo.
ai_forecast Prevedere i dati delle serie temporali fino a un orizzonte specificato. ai_forecast è una funzione con valori di tabella che elabora l'intera tabella di input.
ai_gen Risponde a una richiesta fornita dall'utente sull'input.
ai_mask Maschera le entità specificate nel testo, ad esempio per la de-identificazione.
ai_parse_document Estrae testo, tabelle e layout da documenti non strutturati.
ai_prep_search Trasforma l'output del documento analizzato in blocchi pronti per la ricerca per vettori e le pipeline di generazione aumentata (RAG).
ai_query Risponde a un prompt usando qualsiasi modello di base supportato, per la flessibilità delle attività e dei modelli per utilizzo generico.
ai_similarity Confronta due stringhe e restituisce un punteggio di somiglianza semantica.
ai_summarize Genera un riepilogo del testo.
ai_translate Converte il testo in una lingua di destinazione specificata.

Per informazioni dettagliate su ogni funzione, vedere Arricchire i dati usando funzioni di intelligenza artificiale.

Transformations

Gli operatori seguenti eseguono trasformazioni sui dati.

Aggregazione

Riepiloga le righe raggruppando i dati e calcolando i valori aggregati.

Campo Descrizione
Aggregazione per Selezionare una colonna, selezionare una funzione di aggregazione e specificare un nome per la colonna di output. Fare clic su + Aggiungi aggregazione per aggiungere altro. Funzioni supportate: AVG, COUNT, MAXMEAN, MEDIAN, MIN, PERCENTILE, STDDEV, SUM. VARIANCE
Raggruppa per Selezionare le colonne per cui raggruppare. Fare clic su + Aggiungi raggruppamento per aggiungere altro. Le colonne usate in Group by vengono incluse automaticamente nell'output.

Combinare

Unisce i dati da più tabelle con schemi corrispondenti in un singolo output.

Campo Descrizione
Imposta operazione Selezionare Unione, Intersect o Except.
Strategia di unione Selezionare Distinct per escludere righe duplicate dall'output oppure Tutte per mantenere tutte le righe incluse quelle duplicate.

Filter

Suddivide le righe in base al fatto che soddisfino una o più condizioni, usando un generatore di condizioni grafiche.

Campo Descrizione
Condition Per ogni condizione, selezionare una colonna, un tipo di condizione e un valore per la corrispondenza condizionale. Tipi di condizione supportati:
  • Uguale a / Non è uguale a
  • È uno di / non è uno di
  • Contiene/Non contiene
  • Inizia con / Non inizia con
  • Termina con / non termina con
  • Maggiore di / Minore di
  • Null/Is not null

Per le condizioni sulle colonne di data, la selezione data supporta lo spostamento tra anni e mesi.

L'operatore Filter ha due output in modo da poter diramare i dati in base al fatto che soddisfi le condizioni:

Output Descrizione
Included Righe che soddisfano le condizioni di filtro.
Escluso Righe che non soddisfano le condizioni di filtro, incluse le righe in cui la condizione restituisce Null.

Unisciti.

Collega due tabelle in una chiave combinando due set di dati di input in base ai valori di colonna corrispondenti.

Campo Descrizione
Tabelle di input Selezionare le due tabelle di input da unire.
Condizione di join Specificare almeno una condizione di join selezionando le colonne corrispondenti nelle due tabelle. Fare clic su + Aggiungi espressione di join per aggiungere altre condizioni. Facoltativo: fare clic sulla freccia tra le tabelle sinistra e destra per aggiungere una condizione di join personalizzata, quindi modificare la descrizione generata dall'intelligenza artificiale o scrivere SQL.
Distingui maiuscole/minuscole Se disattivata (impostazione predefinita), le chiavi di join di stringa corrispondono senza distinzione tra maiuscole e minuscole (e ignorano spazi vuoti iniziali e finali). Attivare Maiuscole /minuscole per trovare la corrispondenza esatta delle chiavi stringa. Questa opzione si applica alle chiavi di join, non alle condizioni di join personalizzate.
Tipo di join Selezionare il tipo di join. Per impostazione predefinita, l'operatore Join suddivide i risultati in tre output (vedere la sezione seguente). Selezionare Join completo, Inner join, Left join o Right join per produrre invece un singolo output unito.
Colonne di output Facoltativo: selezionare le colonne da includere. Per impostazione predefinita, vengono incluse tutte le colonne di entrambe le tabelle. I nomi di colonna duplicati ricevono un prefisso del nome di tabella.
Colonne di espressioni personalizzate Facoltativo: aggiungere colonne di espressioni personalizzate in base al risultato unito.

Per impostazione predefinita, l'operatore Join ha tre output in modo da poter creare un ramo di un flusso di lavoro in base ai risultati del join:

Output Descrizione
Senza corrispondenza Righe dall'input sinistro che non hanno corrispondenze nell'input destro.
Abbinato Righe che corrispondono a entrambi gli input.
Diritto non corrispondente Righe dall'input destro che non hanno corrispondenze nell'input sinistro.

Quando si seleziona un tipo di join specifico (completo, interno, sinistro o destro), l'operatore produce un singolo output unito anziché i tre output divisi.

Limit

Limita il numero di righe passando solo fino al numero massimo di righe specificato.

Campo Descrizione
Numero massimo di righe Specificare il numero massimo di righe da passare.

Pivot

Rimodellare i dati tabulari in due direzioni. Usare le schede nella parte superiore del riquadro di configurazione per selezionare la modalità.

Righe → colonne (pivot)

Trasforma valori distinti in una colonna in nuove intestazioni di colonna, riempite con valori aggregati di un'altra colonna.

Campo Descrizione
Colonna pivot Selezionare la colonna i cui valori distinti diventano le nuove intestazioni.
Valore e aggregazione Selezionare la colonna i cui valori riempiono le celle con pivot e selezionare una funzione di aggregazione , ad esempio , SUMAVGCOUNT, MIN, o .MAX Configurare la modalità di gestione dei valori mancanti ,ad esempio Null o zero, se disponibile nel riquadro.

Colonne → righe (unpivot)

Riduce una o più colonne in righe.

Campo Descrizione
Trasformare le colonne tramite UnPivot Selezionare le colonne da annullare.
Colonne chiave e valore Impostare i nomi per le colonne chiave e valore di output.

Includi colonne

Per entrambe le modalità, selezionare le colonne che rimangono nell'output insieme ai valori pivot o senza pivot e rilasciare le colonne non necessarie prima della trasformazione. Progettazione deduce colonne fisse (raggruppamento) dalle colonne che non si assegnano a ruoli pivot, valore o unpivot.

Sort

Ordina righe su una o più colonne.

Campo Descrizione
Ordine di ordinamento Selezionare ASC (crescente) o DESC (decrescente) per ogni colonna. Fare clic su + Aggiungi espressione di ordinamento per ordinare in base a colonne aggiuntive. L'ordinamento segue l'ordinamento lessicale standard.

SQL

Scrive codice SQL personalizzato per qualsiasi trasformazione non coperta dagli altri operatori.

Campo Descrizione
Editor di SQL Digitare un'istruzione SQL SELECT . Per fare riferimento all'output di un operatore di input, usare il nome dell'operatore come nome della tabella nella query. Per esempio:
SELECT COUNT(*)
FROM aggregate_2
WHERE 1 = 1
Fare clic sull'icona Codice. Per aprire il riquadro del codice SQL completo e verificare il modo in cui l'istruzione rientra nel flusso di lavoro completo.
Parameters Per fare riferimento a un parametro di preparazione dei dati visivi, usare la sintassi dell'indicatore di parametro denominato, ad esempio :environment. Progettazione mostra un esempio sopra l'editor quando si apre l'operatore per la modifica. Vedere Parametri.

Seleziona

Seleziona, rinomina e riordina le colonne dai dati di input.

Campo Descrizione
Includere o escludere colonne Selezionare Inizia con tutte le colonne o Inizia senza colonne, quindi usare le caselle di controllo per includere o escludere singole colonne. Trascinare le colonne per riordinarle.
Rinominare una colonna Digitare un nuovo nome nel campo Rinomina accanto a qualsiasi colonna.

Prepare

Pulisce e deriva le colonne concatenando una o più azioni sui dati di input. Fare clic su + Aggiungi azione e selezionare un'azione. Aggiungere tutte le azioni necessarie. Si applicano in ordine.

Action Descrizione
Formula Creare una nuova colonna o sovrascrivere una colonna esistente usando il linguaggio naturale o un'espressione SQL.
Modificare il tipo Convertire una colonna in un altro tipo di dati.
Sostituisci valore Trovare e sostituire i valori in una colonna.
Riempimento di valori Null Sostituire i valori Null con una costante.
Maiuscole/minuscole Modificare la distinzione tra maiuscole e minuscole, superiore o titolo.
Tagliare Rimuovere gli spazi vuoti da una o entrambe le estremità.
Sostituzione regex Sostituire il testo corrispondente a un criterio regex.
estrarre Estrarre una sottostringa corrispondente a un gruppo regex.
Analizza data Analizzare una stringa in una data o un timestamp.

Per rimuovere un'azione, passare il puntatore del mouse sulla riga e fare clic sull'icona Trattino.

Colonne personalizzate

L'azione Formula apre l'editor di espressioni, in cui è possibile creare una nuova colonna o sovrascrivere una colonna esistente usando il linguaggio naturale o il codice SQL. L'editor ha due caselle di input ed è bidirezionale:

  • Descrizione: digitare una descrizione del linguaggio naturale di ciò che si vuole fare la colonna. Progettazione usa Genie per generare l'espressione di codice corrispondente seguente.
  • Espressione: se si preferisce scrivere o modificare direttamente il codice, fare clic sul pulsante Modifica espressione. La modifica dell'espressione genera automaticamente una descrizione del linguaggio naturale.

Python

Esegue Python personalizzate (PySpark) sui dati di input.

Campo Descrizione
result Assegnare un singolo dataframe a result, che diventa l'output dell'operatore.
inputs["data"] Elenco di dataframe di input, in ordine upstream. Il riquadro dei dettagli dell'operatore mostra il nome di ogni input, in ordine. Ad esempio: Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales).
Parameters Chiamare dbutils.widgets.get(), ad esempio dbutils.widgets.get("environment"), per fare riferimento a un parametro di preparazione dei dati visivi. Progettazione mostra un esempio sopra l'editor quando si apre l'operatore per la modifica. Vedere Parametri.

Un modello minimo consiste nell'usare il primo input quando presente o un dataframe vuoto in caso contrario:

# inputs["data"] is a list of input DataFrames

result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")

Da qui è possibile concatenare le operazioni del dataframe (ad esempio, , , o join) select prima che l'assegnazione termini o sostituire filter con un nuovo dataframe compilato da withColumn. resultresultinputs["data"]

Organizzazione

Note

Aggiunge una nota nell'area di disegno in modo da poter documentare il flusso di lavoro stesso: scopo, presupposti, avvertenze o contesto di handoff per chiunque apra la preparazione dei dati visivi in un secondo momento.

Campo Descrizione
Contenuto Modificare il contenuto della nota inline nell'area di disegno con un editor rtf. È possibile aggiungere intestazioni, stili di testo, collegamenti, immagini e tabelle in cui il testo normale non è sufficiente. Le note non influiscono sul flusso dei dati attraverso gli operatori.

Group

Raggruppa visivamente gli operatori nell'area di disegno senza modificare il modo in cui i dati vengono trasmessi tra di essi, che è utile quando una preparazione dei dati visivi aumenta di dimensioni elevate o si desidera riflettere le fasi logiche.

Campo Descrizione
Aggiungi al gruppo Trascinare uno o più operatori in un gruppo per aggiungerli.
Crea dalla selezione Selezionare uno o più operatori, aprire il menu di scelta rapida (clic con il pulsante destro del mouse) e selezionare Crea nuovo gruppo per eseguire il wrapping della selezione in un nuovo gruppo.
Name Assegnare al gruppo un nome descrittivo.
Riduci a icona/espandi Fare clic su riduci a icona o espandere per visualizzare o nascondere il contenuto del gruppo nell'area di disegno.

Visualization

Crea una visualizzazione dai dati di input ed esegue il rendering direttamente nell'area di disegno. Connettere un operatore Visualization a qualsiasi operatore che produce dati tabulari per tracciare i risultati senza uscire da Progettazione.

Per configurare la visualizzazione, aprire l'operatore e selezionare un tipo di visualizzazione , quindi eseguire il mapping delle colonne al grafico.

Campo Descrizione
Visualization Tipo di grafico di cui eseguire il rendering, ad esempio Barra, Area o Contatore.

Risorse aggiuntive