Inbyggda operatorer i Lakeflow Designer

Lakeflow Designer innehåller inbyggda operatorer för vanliga dataförberedelse- och transformeringsuppgifter. Öppna operatormenyn i sidofönstret till vänster för att bläddra bland operatorer efter kategori, eller använd Sök efter en operator... överst i fönstret. Operatorsökning föreslår operatorer baserat på din avsikt. Om du till exempel skriver returneras average by monthoperatorn Aggregering . Om du vill konfigurera en operator när du har lagt till den på arbetsytan dubbelklickar du på den eller hovra över den och klickar på pennikonen. (Redigera operator) för att öppna konfigurationsfönstret.

LFD-operatormenyn som visar operatorns sökruta och operatorer grupperade efter kategori.

Varje operator visar en AI-genererad beskrivning av vad den gör. Beskrivningen fungerar också som redigerare för operatorn: om du redigerar beskrivningen konfigureras operatorn om så att den matchar din beskrivning.

Information om hur du skapar egna användardefinierade operatorer finns i Användardefinierade operatorer i Lakeflow Designer.

Källa och utdata

Source

Importerar data till Designer från en Unity Catalog-tabell eller annan källa som stöds. Om du vill välja en källa söker du efter en tabell eller fil efter namn eller bläddrar efter katalog och schema. Du kan också skapa en ny tabell från det här fönstret.

När du har valt en tabell visas tabellens namn, ägare och senaste uppdateringstid i fönstret. Klicka på Välj en ny datakälla för att ändra källan. Om du ändrar källan ogiltigförklaras utdatacachen för alla underordnade operatorer.

Du kan också använda en måttvy för Unity Catalog som källa. När du väljer en måttvy väljer du de dimensioner och mått som ska inkluderas, och Designer genererar den aggregerade frågan åt dig.

Det fullständiga datainmatningsalternativet, inklusive att rikta in en hel Unity Catalog-volym eller mapp, finns i Mata in data i Lakeflow Designer.

Ange data

Skapar en tabell genom att skriva värden i ett redigeringsprogram i kalkylbladsformat. Använd den här operatorn för att lägga till små mängder referensdata, till exempel uppslagsvärden eller testdata, utan att skapa en separat källtabell.

Fält Description
Tabelldata Ange dina data som en tabell. Den första raden definierar kolumnrubrikerna och de återstående raderna är data. Designern härleder varje kolumns datatyp från dess värden.

Resultat

Exporterar data från Designer. Utdataoperatorn kan skriva resultat till en Unity Catalog-tabell, publicera dem som en materialiserad vy eller skriva dem till en fil i en Unity Catalog-volym. Välj mål med utdatatyp.

Utdatatyp Description
Table Skriver resultatet till en hanterad Unity Catalog-tabell. Ange ett tabellnamn och en utdataplats (katalog och schema) och välj sedan ett skrivläge.
Materialiserad vy Publicerar resultatet som en materialiserad vy i Unity Catalog som uppdateras när den visuella dataförberedelserna körs.
File Skriver resultatet till en fil i en Unity Catalog-volym. Välj en filtyp för CSV, Excel eller JSON och ange sedan målvolymen och filnamnet.

För tabell - eller filutdata väljer du hur varje körning skriver till målet med skrivläge:

Skrivläge Description
Skriv över Ersätter det befintliga innehållet med resultatet av den aktuella körningen. Det här är standardinställningen.
Lägg till Lägger till resultatet av den aktuella körningen till de befintliga raderna.
Merge Upserts rader i måltabellen genom att matcha på de sammanslagningsnycklar som du anger. Tillgänglig för tabellutdata.

Klicka på Kör för att köra den visuella dataförberedelserna och skriva resultatet. Om tabellen inte finns för tabellutdata skapar operatorn den. Schemalagda körningar skriver till målet med samma skrivläge.

AI-funktion

Kör en inbyggd AI-åtgärd på dina data. Öppna Välj en funktion i konfigurationsfönstret och välj en av funktionerna i följande tabell. Varje funktion visar alternativ i fönstret för indata (till exempel kolumner, prompter, etiketter eller språk) och utdata.

Function Description
ai_analyze_sentiment Utför attitydanalys på indatatext.
ai_classify Klassificerar text eller tolkade dokument med hjälp av etiketter som du anger.
ai_extract Extraherar strukturerade data från text eller tolkade dokument med hjälp av fält som du definierar.
ai_fix_grammar Korrigerar grammatiska fel i text.
ai_forecast Prognoser för tidsseriedata upp till en horisont som du anger. ai_forecast är en tabellvärdesfunktion som bearbetar hela indatatabellen.
ai_gen Besvarar en uppmaning från användaren mot indata.
ai_mask Maskerar angivna entiteter i text (till exempel för avidentifiering).
ai_parse_document Extraherar text, tabeller och layout från ostrukturerade dokument.
ai_prep_search Transformerar tolkade dokumentutdata till sökklara segment för rag-pipelines (vector search and retrieval augmented generation).
ai_query Besvarar en fråga med valfri grundmodell som stöds för generell uppgifts- och modellflexitet.
ai_similarity Jämför två strängar och returnerar en semantisk likhetspoäng.
ai_summarize Genererar en sammanfattning av text.
ai_translate Översätter text till ett målspråk som du anger.

För detaljer om varje funktion, se Transformera ostrukturerad data med AI-funktioner.

Transformations

Följande operatorer utför transformeringar av dina data.

Aggregate

Sammanfattar rader genom att gruppera mängdvärden för data och databehandling.

Fält Description
Aggregera efter Välj en kolumn, välj en aggregeringsfunktion och ange ett namn för utdatakolumnen. Klicka på + Lägg till sammansättning för att lägga till mer. Stödda funktioner: , , , , , MEANMEDIAN, MIN, PERCENTILESTDDEVSUM. VARIANCEMAXCOUNT DISTINCTCOUNTAVG
Gruppera efter Välj de kolumner som ska grupperas efter. Klicka på + Lägg till gruppering för att lägga till mer. Kolumner som används i Gruppera efter inkluderas automatiskt i utdata.

Kombinera

Sammanfogar data från flera tabeller med matchande scheman i en enda utdata.

Fält Description
Ställ in operation Välj Union, Intersect eller Except.
Sammanslagningsstrategi Välj Distinkt om du vill undanta dubbletter av rader från utdata eller Alla för att behålla alla rader inklusive dubbletter.

Unique

Tar bort dubbletter av rader från indatan. Som standard deduplicerar operatorn över alla kolumner. Du kan istället välja en delmängd av kolumner som nyckel och ordna raderna för att styra vilken dubblettett som behålls.

Fält Description
Unik av Välj Alla kolumner för att ta bort rader som är identiska i varje kolumn , eller Valda kolumner för att ta bort rader som är dubbletter endast i de kolumner du väljer som nyckel.
Sortera efter Valfritt: välj en eller flera kolumner och en sorteringsriktning för att styra vilken rad som sparas för varje uppsättning dubbletter. Om du inte ställer in en order behåller operatören den första raden den stöter på.

Filter

Delar rader baserat på om de uppfyller ett eller flera villkor med hjälp av en grafisk villkorsbyggare.

Fält Description
Tillstånd För varje villkor väljer du en kolumn, en villkorstyp och ett värde som ska matchas villkorligt. Villkorstyper som stöds:
  • Är lika med/är inte lika med
  • Är en av/är inte en av
  • Innehåller/innehåller inte
  • Börjar med/börjar inte med
  • Slutar med/slutar inte med
  • Större än/mindre än
  • Är null/är inte null

För villkor för datumkolumner stöder datumväljaren navigering över år och månader.
När ett villkor matchar en kolumns värden (till exempel Är ett av), visar värdelistan ett urval av kolumnens olika värden baserat på indatan. Välj Ladda mer för att hämta ytterligare värden på begäran.

Filteroperatorn har två utdata så att du kan förgrena data baserat på om den uppfyller villkoren:

Resultat Description
Included Rader som uppfyller filtervillkoren.
Utesluten Rader som inte uppfyller filtervillkoren, inklusive rader där villkoret utvärderas till null.

Ansluta

Länkar två tabeller på en nyckel genom att kombinera två indatauppsättningar baserat på matchande kolumnvärden.

Fält Description
Indatatabeller Välj de två indatatabeller som ska kopplas.
Kopplingsvillkor Ange minst ett kopplingsvillkor genom att välja matchande kolumner från de två tabellerna. Klicka på + Lägg till kopplingsuttryck för att lägga till fler villkor. Valfritt: klicka på pilen mellan tabellerna till vänster och höger för att lägga till ett anpassat kopplingsvillkor och redigera sedan den AI-genererade beskrivningen eller skriva SQL.
Matchningsfall När du är av (standard) matchar strängkopplingsnycklar skiftlägesokänsligt (och ignorerar inledande och avslutande blanksteg). Aktivera Matchningsfall för att matcha strängnycklar exakt. Det här alternativet gäller för kopplingsnycklarna, inte för anpassade kopplingsvillkor.
Kopplingstyp Välj kopplingstyp. Som standard delar kopplingsoperatorn sina resultat över tre utdata (se följande avsnitt). Välj Fullständig koppling, Inre koppling, Vänster koppling eller Höger koppling för att skapa en enda ansluten utdata i stället.
Utdatakolumner Valfritt: välj vilka kolumner som ska inkluderas. Som standard inkluderas alla kolumner från båda tabellerna. Duplicerade kolumnnamn får ett prefix för tabellnamn.
Anpassade uttryckskolumner Valfritt: Lägg till anpassade uttryckskolumner baserat på det anslutna resultatet.

Som standard har kopplingsoperatorn tre utdata så att du kan förgrena ett arbetsflöde baserat på kopplingsresultat:

Resultat Description
Vänster omatchad Rader från de vänstra indata som inte har någon matchning i höger indata.
Matchad Rader som matchar mellan båda indata.
Höger omatchad Rader från höger indata som inte har någon matchning i den vänstra inmatningen.

När du väljer en specifik kopplingstyp (fullständig, inre, vänster eller höger) genererar operatorn en enda ansluten utdata i stället för de tre delade utdata.

Limit

Begränsar antalet rader genom att endast skicka igenom upp till det maximala antalet rader som du anger.

Fält Description
Maximalt antal rader Ange det maximala antalet rader som ska skickas.

Pivot

Omformar tabelldata i två riktningar. Använd flikarna överst i konfigurationsfönstret för att välja läget.

Rader → kolumner (pivot)

Omvandlar distinkta värden i en kolumn till nya kolumnrubriker, fyllda med aggregerade värden från en annan kolumn.

Fält Description
Pivåtkolumn Välj den kolumn vars distinkta värden blir de nya rubrikerna.
Värde & aggregering Välj den kolumn vars värden fyller de pivoterade cellerna och välj en aggregeringsfunktion (till exempel , SUM, AVGCOUNT, MINeller MAX). Konfigurera hur saknade värden hanteras (till exempel null eller noll) om det är tillgängligt i fönstret.

Kolumner → rader (unpivot)

Viker en eller flera kolumner i rader.

Fält Description
Omvandla kolumner Välj de kolumner som ska avpivotas.
Nyckel- och värdekolumner Ange namn för utdatanyckeln och värdekolumnerna.

Inkludera kolumner

I båda lägena väljer du vilka kolumner som ska ligga kvar i utdata tillsammans med de pivoterade eller opivoterade värdena och släpper kolumner som du inte behöver före omvandlingen. Designern härleder fasta (gruppering) kolumner från de kolumner som du inte tilldelar till pivoterings-, värde- eller opivotroller.

Sortera

Beställer rader på en eller flera kolumner.

Fält Description
Sorteringsordning Välj ASC (stigande) eller DESC (fallande) för varje kolumn. Klicka på + Lägg till sorteringsuttryck för att sortera efter ytterligare kolumner. Sortering följer standardlexisk ordning.

SQL

Skriver anpassad SQL-kod för alla transformeringar som inte omfattas av de andra operatorerna.

Fält Description
SQL-redigerare Skriv en SQL-instruktion SELECT . Om du vill referera till utdata för en indataoperator använder du operatorns namn som tabellnamn i frågan. Som exempel:
SELECT COUNT(*)
FROM aggregate_2
WHERE 1 = 1
Klicka på kodikonen. för att öppna det fullständiga SQL-kodfönstret och se hur din instruktion passar in i det fullständiga arbetsflödet.
Parameters Om du vill referera till en visuell dataförberedelseparameter använder du namngiven parametermarkörsyntax, till exempel :environment. Designern visar ett exempel ovanför redigeraren när du öppnar operatorn för redigering. Se Parametrar.

Välj

Väljer, byter namn på och ändrar ordning på kolumner från indata.

Fält Description
Inkludera eller exkludera kolumner Välj Börja med alla kolumner eller Starta utan kolumner och använd sedan kryssrutorna för att inkludera eller exkludera enskilda kolumner. Dra kolumner för att ordna om dem.
Byt namn på en kolumn Skriv ett nytt namn i fältet Byt namn bredvid valfri kolumn.
Välj kolumner dynamiskt Istället för att välja kolumner individuellt, välj kolumner enligt en regel så att utdata anpassar sig när indataschemat ändras. Välj om du vill behålla matchande kolumner eller Ta bort matchande kolumner, och matcha sedan kolumnerna genom att:
  • Kolumndatatyp: Välj en eller flera typer, såsom boolesk, heltal, flytta/dubbel, decimal, sträng, datum, tidsstämpel eller binär.
  • Kolumnnamn: Matchar namn som börjar med, slutar med, innehåller eller matchar ett reguljärt uttryck. Slå på kassialkänslig för att matcha fallet exakt.
  • Formel: Skriv ett boolesk uttryck som utvärderas för varje kolumn mot dess metadata, med fält som Name, Type, och IsNumeric. Till exempel IsNumeric AND Name LIKE '%_id' matchar numeriska kolumner vars namn slutar på _id.

Prepare

Rensar och härleder kolumner genom att länka en eller flera åtgärder på indata. Klicka på + Lägg till åtgärd och välj en åtgärd. Lägg till så många åtgärder som du behöver. De gäller i ordning.

Åtgärd Description
Formel Skapa en ny kolumn eller skriv över en befintlig kolumn med naturligt språk eller ett SQL-uttryck.
Ändra typ Konvertera en kolumn till en annan datatyp.
Ersätt värde Hitta och ersätt värden i en kolumn.
Fyll null Ersätt null-värden med en konstant.
Textfall Ändra skiftläge till lägre, övre eller rubrik.
Trimma Ta bort blanksteg från en eller båda ändar.
Regex-ersättning Ersätt text som matchar ett regex-mönster.
Extrahera Extrahera en delsträng som matchar en regex-grupp.
Parsningsdatum Parsa en sträng till ett datum eller en tidsstämpel.

Om du vill ta bort en åtgärd hovra över raden och klicka på Streckikonen..

Anpassade kolumner

Formelåtgärden öppnar uttrycksredigeraren, där du kan skapa en ny kolumn eller skriva över en befintlig kolumn med antingen naturligt språk eller SQL-kod. Redigeraren har två indatarutor och är dubbelriktad:

  • Beskrivning: Ange en beskrivning av det naturliga språket för det du vill att kolumnen ska göra. Designer använder Genie för att generera motsvarande koduttryck nedan.
  • Uttryck: Om du föredrar att skriva eller redigera kod direkt klickar du på knappen Redigera uttryck. När du redigerar uttrycket genereras automatiskt en beskrivning av naturligt språk.

I uttrycksredigeraren, skriv @ för att öppna en meny med operatörens inmatningskolumner och de inbyggda SQL-funktionerna. Skriv after @ för att filtrera listan, välj sedan en post att infoga: en kolumn infogar dess namn, och en funktion infogar sitt anrop med markören placerad inom parentesen. Samma @ meny finns tillgänglig i uttrycksredigerarna hos andra operatörer, såsom anpassade Filter- och Join-villkor.

Python

Kör anpassade Python (PySpark) på indata.

Fält Description
result Tilldela en enda DataFrame till result, som blir operatorns utdata.
inputs["data"] En lista över indatadataramar i uppströmsordning. Informationsfönstret för operatorn visar namnet på varje indata i ordning. Till exempel Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales).
Parameters Anropa dbutils.widgets.get(), till exempel dbutils.widgets.get("environment"), för att referera till en visuell dataförberedelseparameter. Designern visar ett exempel ovanför redigeraren när du öppnar operatorn för redigering. Se Parametrar.

Ett minimalt mönster är att använda de första indata när de finns, eller en tom DataFrame på annat sätt:

# inputs["data"] is a list of input DataFrames

result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")

Därifrån kan du länka DataFrame-åtgärder (till exempel , , eller kopplingar) select innan tilldelningen avslutas eller ersätta filter med en ny DataFrame som skapats från withColumn. resultresultinputs["data"]

Under en förhandsvisning strömmar operatörens utdata in i utdatapanelen när den produceras, inklusive allt du renderar med display() och text du skriver ut, så att du kan se resultat innan körningen är klar.

Python förhandsgranskningsläge

När du bygger en visuell dataförberedelse förhandsgranskar Designer kontinuerligt varje operatörs utdata på ett urval av din data. Dessa förhandsvisningar kör din Python-kod på samma sätt som en fullständig körning. Det är ett problem när din kod har bieffekter, som att anropa ett externt API, skicka en notis eller skriva till ett system utanför Unity Catalog. Du vill vanligtvis inte att de bieffekterna ska aktiveras vid varje förhandsvisning.

För att låta din kod skilja de två åt, läs config["is_preview"], en boolesk designer sätter för dig:

  • True Under en förhandsvisning, så du kan hoppa över bieffekter.
  • False under en hel genomspelning, som när du klickar på Spring eller på en schemalagd runda.

Till exempel skyddar biverkningar så att de bara körs utanför förhandsvisningar:

result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")

# Side effects run only on a full run or scheduled job, not during previews.
if not config["is_preview"]:
    write_results_to_external_system(result)

Organisation

Note

Lägger till en anteckning på arbetsytan så att du kan dokumentera själva arbetsflödet: dess syfte, antaganden, varningar eller överlämningskontext för alla som öppnar förberedelsen av visuella data senare.

Fält Description
Innehåll Redigera anteckningsinnehåll infogat på arbetsytan med en rtF-redigerare. Du kan lägga till rubriker, textformatering, länkar, bilder och tabeller där oformaterad text inte räcker. Anteckningar påverkar inte hur data flödar via operatorer.

Group

Grupperar operatorer visuellt på arbetsytan utan att ändra hur data flödar mellan dem, vilket är användbart när en visuell dataförberedelse blir stor eller om du vill återspegla logiska faser.

Fält Description
Lägg till i grupp Dra en eller flera operatorer till en grupp för att lägga till dem i den.
Skapa från markering Välj en eller flera operatorer, öppna snabbmenyn (högerklicka) och välj Skapa ny grupp för att omsluta markeringen i en ny grupp.
Name Ge gruppen ett beskrivande namn.
Minimera/expandera Klicka på minimera eller expandera för att visa eller dölja gruppens innehåll på arbetsytan.
Aktivera/inaktivera Högerklicka på gruppens rubrik och välj Inaktivera för att utesluta alla operatörer i gruppen från körningar, eller Aktivera för att inkludera dem igen. Inaktiverade operatorer producerar inga utgångsrader, så nedströmsoperatörer får ett tomt resultat tills du aktiverar dem. Du kan också aktivera eller inaktivera en enskild operatör. Se Aktivera eller inaktivera operatörer.

Visualization

Skapar en visualisering från indata och renderar den direkt på arbetsytan. Anslut en visualiseringsoperator till alla operatorer som skapar tabelldata för att kartlägga resultaten utan att lämna Designer.

Om du vill konfigurera visualiseringen öppnar du operatorn och väljer en visualiseringstyp och mappar sedan kolumnerna till diagrammet.

Fält Description
Visualization Diagramtypen som ska återges, till exempel stapel, område eller räknare.

Ytterligare resurser