Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Lakeflow Designer innehåller inbyggda operatorer för vanliga dataförberedelse- och transformeringsuppgifter. Öppna operatormenyn i sidofönstret till vänster för att bläddra bland operatorer efter kategori, eller använd Sök efter en operator... överst i fönstret. Operatorsökning föreslår operatorer baserat på din avsikt. Om du till exempel skriver returneras average by monthoperatorn Aggregering . Om du vill konfigurera en operator när du har lagt till den på arbetsytan dubbelklickar du på den eller hovra över den och klickar på (Redigera operator) för att öppna konfigurationsfönstret.
Varje operator visar en AI-genererad beskrivning av vad den gör. Beskrivningen fungerar också som redigerare för operatorn: om du redigerar beskrivningen konfigureras operatorn om så att den matchar din beskrivning.
Information om hur du skapar egna användardefinierade operatorer finns i Användardefinierade operatorer i Lakeflow Designer.
Källa och utdata
Source
Importerar data till Designer från en Unity Catalog-tabell eller annan källa som stöds. Om du vill välja en källa söker du efter en tabell eller fil efter namn eller bläddrar efter katalog och schema. Du kan också skapa en ny tabell från det här fönstret.
När du har valt en tabell visas tabellens namn, ägare och senaste uppdateringstid i fönstret. Klicka på Välj en ny datakälla för att ändra källan. Om du ändrar källan ogiltigförklaras utdatacachen för alla underordnade operatorer.
Du kan också använda en måttvy för Unity Catalog som källa. När du väljer en måttvy väljer du de dimensioner och mått som ska inkluderas, och Designer genererar den aggregerade frågan åt dig.
Det fullständiga datainmatningsalternativet, inklusive att rikta in en hel Unity Catalog-volym eller mapp, finns i Mata in data i Lakeflow Designer.
Ange data
Skapar en tabell genom att skriva värden i ett redigeringsprogram i kalkylbladsformat. Använd den här operatorn för att lägga till små mängder referensdata, till exempel uppslagsvärden eller testdata, utan att skapa en separat källtabell.
| Fält | Description |
|---|---|
| Tabelldata | Ange dina data som en tabell. Den första raden definierar kolumnrubrikerna och de återstående raderna är data. Designern härleder varje kolumns datatyp från dess värden. |
Resultat
Exporterar data från Designer. Utdataoperatorn kan skriva resultat till en Unity Catalog-tabell, publicera dem som en materialiserad vy eller skriva dem till en fil i en Unity Catalog-volym. Välj mål med utdatatyp.
| Utdatatyp | Description |
|---|---|
| Table | Skriver resultatet till en hanterad Unity Catalog-tabell. Ange ett tabellnamn och en utdataplats (katalog och schema) och välj sedan ett skrivläge. |
| Materialiserad vy | Publicerar resultatet som en materialiserad vy i Unity Catalog som uppdateras när den visuella dataförberedelserna körs. |
| File | Skriver resultatet till en fil i en Unity Catalog-volym. Välj en filtyp för CSV, Excel eller JSON och ange sedan målvolymen och filnamnet. |
För tabell - eller filutdata väljer du hur varje körning skriver till målet med skrivläge:
| Skrivläge | Description |
|---|---|
| Skriv över | Ersätter det befintliga innehållet med resultatet av den aktuella körningen. Det här är standardinställningen. |
| Lägg till | Lägger till resultatet av den aktuella körningen till de befintliga raderna. |
| Merge | Upserts rader i måltabellen genom att matcha på de sammanslagningsnycklar som du anger. Tillgänglig för tabellutdata. |
Klicka på Kör för att köra den visuella dataförberedelserna och skriva resultatet. Om tabellen inte finns för tabellutdata skapar operatorn den. Schemalagda körningar skriver till målet med samma skrivläge.
AI-funktion
Kör en inbyggd AI-åtgärd på dina data. Öppna Välj en funktion i konfigurationsfönstret och välj en av funktionerna i följande tabell. Varje funktion visar alternativ i fönstret för indata (till exempel kolumner, prompter, etiketter eller språk) och utdata.
| Function | Description |
|---|---|
ai_analyze_sentiment |
Utför attitydanalys på indatatext. |
ai_classify |
Klassificerar text eller tolkade dokument med hjälp av etiketter som du anger. |
ai_extract |
Extraherar strukturerade data från text eller tolkade dokument med hjälp av fält som du definierar. |
ai_fix_grammar |
Korrigerar grammatiska fel i text. |
ai_forecast |
Prognoser för tidsseriedata upp till en horisont som du anger.
ai_forecast är en tabellvärdesfunktion som bearbetar hela indatatabellen. |
ai_gen |
Besvarar en uppmaning från användaren mot indata. |
ai_mask |
Maskerar angivna entiteter i text (till exempel för avidentifiering). |
ai_parse_document |
Extraherar text, tabeller och layout från ostrukturerade dokument. |
ai_prep_search |
Transformerar tolkade dokumentutdata till sökklara segment för rag-pipelines (vector search and retrieval augmented generation). |
ai_query |
Besvarar en fråga med valfri grundmodell som stöds för generell uppgifts- och modellflexitet. |
ai_similarity |
Jämför två strängar och returnerar en semantisk likhetspoäng. |
ai_summarize |
Genererar en sammanfattning av text. |
ai_translate |
Översätter text till ett målspråk som du anger. |
För detaljer om varje funktion, se Transformera ostrukturerad data med AI-funktioner.
Transformations
Följande operatorer utför transformeringar av dina data.
Aggregate
Sammanfattar rader genom att gruppera mängdvärden för data och databehandling.
| Fält | Description |
|---|---|
| Aggregera efter | Välj en kolumn, välj en aggregeringsfunktion och ange ett namn för utdatakolumnen. Klicka på + Lägg till sammansättning för att lägga till mer. Stödda funktioner: , , , , , MEANMEDIAN, MIN, PERCENTILESTDDEVSUM. VARIANCEMAXCOUNT DISTINCTCOUNTAVG |
| Gruppera efter | Välj de kolumner som ska grupperas efter. Klicka på + Lägg till gruppering för att lägga till mer. Kolumner som används i Gruppera efter inkluderas automatiskt i utdata. |
Kombinera
Sammanfogar data från flera tabeller med matchande scheman i en enda utdata.
| Fält | Description |
|---|---|
| Ställ in operation | Välj Union, Intersect eller Except. |
| Sammanslagningsstrategi | Välj Distinkt om du vill undanta dubbletter av rader från utdata eller Alla för att behålla alla rader inklusive dubbletter. |
Unique
Tar bort dubbletter av rader från indatan. Som standard deduplicerar operatorn över alla kolumner. Du kan istället välja en delmängd av kolumner som nyckel och ordna raderna för att styra vilken dubblettett som behålls.
| Fält | Description |
|---|---|
| Unik av | Välj Alla kolumner för att ta bort rader som är identiska i varje kolumn , eller Valda kolumner för att ta bort rader som är dubbletter endast i de kolumner du väljer som nyckel. |
| Sortera efter | Valfritt: välj en eller flera kolumner och en sorteringsriktning för att styra vilken rad som sparas för varje uppsättning dubbletter. Om du inte ställer in en order behåller operatören den första raden den stöter på. |
Filter
Delar rader baserat på om de uppfyller ett eller flera villkor med hjälp av en grafisk villkorsbyggare.
| Fält | Description |
|---|---|
| Tillstånd | För varje villkor väljer du en kolumn, en villkorstyp och ett värde som ska matchas villkorligt. Villkorstyper som stöds:
För villkor för datumkolumner stöder datumväljaren navigering över år och månader. När ett villkor matchar en kolumns värden (till exempel Är ett av), visar värdelistan ett urval av kolumnens olika värden baserat på indatan. Välj Ladda mer för att hämta ytterligare värden på begäran. |
Filteroperatorn har två utdata så att du kan förgrena data baserat på om den uppfyller villkoren:
| Resultat | Description |
|---|---|
| Included | Rader som uppfyller filtervillkoren. |
| Utesluten | Rader som inte uppfyller filtervillkoren, inklusive rader där villkoret utvärderas till null. |
Ansluta
Länkar två tabeller på en nyckel genom att kombinera två indatauppsättningar baserat på matchande kolumnvärden.
| Fält | Description |
|---|---|
| Indatatabeller | Välj de två indatatabeller som ska kopplas. |
| Kopplingsvillkor | Ange minst ett kopplingsvillkor genom att välja matchande kolumner från de två tabellerna. Klicka på + Lägg till kopplingsuttryck för att lägga till fler villkor. Valfritt: klicka på pilen mellan tabellerna till vänster och höger för att lägga till ett anpassat kopplingsvillkor och redigera sedan den AI-genererade beskrivningen eller skriva SQL. |
| Matchningsfall | När du är av (standard) matchar strängkopplingsnycklar skiftlägesokänsligt (och ignorerar inledande och avslutande blanksteg). Aktivera Matchningsfall för att matcha strängnycklar exakt. Det här alternativet gäller för kopplingsnycklarna, inte för anpassade kopplingsvillkor. |
| Kopplingstyp | Välj kopplingstyp. Som standard delar kopplingsoperatorn sina resultat över tre utdata (se följande avsnitt). Välj Fullständig koppling, Inre koppling, Vänster koppling eller Höger koppling för att skapa en enda ansluten utdata i stället. |
| Utdatakolumner | Valfritt: välj vilka kolumner som ska inkluderas. Som standard inkluderas alla kolumner från båda tabellerna. Duplicerade kolumnnamn får ett prefix för tabellnamn. |
| Anpassade uttryckskolumner | Valfritt: Lägg till anpassade uttryckskolumner baserat på det anslutna resultatet. |
Som standard har kopplingsoperatorn tre utdata så att du kan förgrena ett arbetsflöde baserat på kopplingsresultat:
| Resultat | Description |
|---|---|
| Vänster omatchad | Rader från de vänstra indata som inte har någon matchning i höger indata. |
| Matchad | Rader som matchar mellan båda indata. |
| Höger omatchad | Rader från höger indata som inte har någon matchning i den vänstra inmatningen. |
När du väljer en specifik kopplingstyp (fullständig, inre, vänster eller höger) genererar operatorn en enda ansluten utdata i stället för de tre delade utdata.
Limit
Begränsar antalet rader genom att endast skicka igenom upp till det maximala antalet rader som du anger.
| Fält | Description |
|---|---|
| Maximalt antal rader | Ange det maximala antalet rader som ska skickas. |
Pivot
Omformar tabelldata i två riktningar. Använd flikarna överst i konfigurationsfönstret för att välja läget.
Rader → kolumner (pivot)
Omvandlar distinkta värden i en kolumn till nya kolumnrubriker, fyllda med aggregerade värden från en annan kolumn.
| Fält | Description |
|---|---|
| Pivåtkolumn | Välj den kolumn vars distinkta värden blir de nya rubrikerna. |
| Värde & aggregering | Välj den kolumn vars värden fyller de pivoterade cellerna och välj en aggregeringsfunktion (till exempel , SUM, AVGCOUNT, MINeller MAX). Konfigurera hur saknade värden hanteras (till exempel null eller noll) om det är tillgängligt i fönstret. |
Kolumner → rader (unpivot)
Viker en eller flera kolumner i rader.
| Fält | Description |
|---|---|
| Omvandla kolumner | Välj de kolumner som ska avpivotas. |
| Nyckel- och värdekolumner | Ange namn för utdatanyckeln och värdekolumnerna. |
Inkludera kolumner
I båda lägena väljer du vilka kolumner som ska ligga kvar i utdata tillsammans med de pivoterade eller opivoterade värdena och släpper kolumner som du inte behöver före omvandlingen. Designern härleder fasta (gruppering) kolumner från de kolumner som du inte tilldelar till pivoterings-, värde- eller opivotroller.
Sortera
Beställer rader på en eller flera kolumner.
| Fält | Description |
|---|---|
| Sorteringsordning | Välj ASC (stigande) eller DESC (fallande) för varje kolumn. Klicka på + Lägg till sorteringsuttryck för att sortera efter ytterligare kolumner. Sortering följer standardlexisk ordning. |
SQL
Skriver anpassad SQL-kod för alla transformeringar som inte omfattas av de andra operatorerna.
| Fält | Description |
|---|---|
| SQL-redigerare | Skriv en SQL-instruktion SELECT . Om du vill referera till utdata för en indataoperator använder du operatorns namn som tabellnamn i frågan. Som exempel:SELECT COUNT(*)FROM aggregate_2WHERE 1 = 1Klicka på |
| Parameters | Om du vill referera till en visuell dataförberedelseparameter använder du namngiven parametermarkörsyntax, till exempel :environment. Designern visar ett exempel ovanför redigeraren när du öppnar operatorn för redigering. Se Parametrar. |
Välj
Väljer, byter namn på och ändrar ordning på kolumner från indata.
| Fält | Description |
|---|---|
| Inkludera eller exkludera kolumner | Välj Börja med alla kolumner eller Starta utan kolumner och använd sedan kryssrutorna för att inkludera eller exkludera enskilda kolumner. Dra kolumner för att ordna om dem. |
| Byt namn på en kolumn | Skriv ett nytt namn i fältet Byt namn bredvid valfri kolumn. |
| Välj kolumner dynamiskt | Istället för att välja kolumner individuellt, välj kolumner enligt en regel så att utdata anpassar sig när indataschemat ändras. Välj om du vill behålla matchande kolumner eller Ta bort matchande kolumner, och matcha sedan kolumnerna genom att:
|
Prepare
Rensar och härleder kolumner genom att länka en eller flera åtgärder på indata. Klicka på + Lägg till åtgärd och välj en åtgärd. Lägg till så många åtgärder som du behöver. De gäller i ordning.
| Åtgärd | Description |
|---|---|
| Formel | Skapa en ny kolumn eller skriv över en befintlig kolumn med naturligt språk eller ett SQL-uttryck. |
| Ändra typ | Konvertera en kolumn till en annan datatyp. |
| Ersätt värde | Hitta och ersätt värden i en kolumn. |
| Fyll null | Ersätt null-värden med en konstant. |
| Textfall | Ändra skiftläge till lägre, övre eller rubrik. |
| Trimma | Ta bort blanksteg från en eller båda ändar. |
| Regex-ersättning | Ersätt text som matchar ett regex-mönster. |
| Extrahera | Extrahera en delsträng som matchar en regex-grupp. |
| Parsningsdatum | Parsa en sträng till ett datum eller en tidsstämpel. |
Om du vill ta bort en åtgärd hovra över raden och klicka på .
Anpassade kolumner
Formelåtgärden öppnar uttrycksredigeraren, där du kan skapa en ny kolumn eller skriva över en befintlig kolumn med antingen naturligt språk eller SQL-kod. Redigeraren har två indatarutor och är dubbelriktad:
- Beskrivning: Ange en beskrivning av det naturliga språket för det du vill att kolumnen ska göra. Designer använder Genie för att generera motsvarande koduttryck nedan.
- Uttryck: Om du föredrar att skriva eller redigera kod direkt klickar du på knappen Redigera uttryck. När du redigerar uttrycket genereras automatiskt en beskrivning av naturligt språk.
I uttrycksredigeraren, skriv @ för att öppna en meny med operatörens inmatningskolumner och de inbyggda SQL-funktionerna. Skriv after @ för att filtrera listan, välj sedan en post att infoga: en kolumn infogar dess namn, och en funktion infogar sitt anrop med markören placerad inom parentesen. Samma @ meny finns tillgänglig i uttrycksredigerarna hos andra operatörer, såsom anpassade Filter- och Join-villkor.
Python
Kör anpassade Python (PySpark) på indata.
| Fält | Description |
|---|---|
result |
Tilldela en enda DataFrame till result, som blir operatorns utdata. |
inputs["data"] |
En lista över indatadataramar i uppströmsordning. Informationsfönstret för operatorn visar namnet på varje indata i ordning. Till exempel Available inputs: inputs["data"][0] (customers), inputs["data"][1] (sales). |
| Parameters | Anropa dbutils.widgets.get(), till exempel dbutils.widgets.get("environment"), för att referera till en visuell dataförberedelseparameter. Designern visar ett exempel ovanför redigeraren när du öppnar operatorn för redigering. Se Parametrar. |
Ett minimalt mönster är att använda de första indata när de finns, eller en tom DataFrame på annat sätt:
# inputs["data"] is a list of input DataFrames
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
Därifrån kan du länka DataFrame-åtgärder (till exempel , , eller kopplingar) select innan tilldelningen avslutas eller ersätta filter med en ny DataFrame som skapats från withColumn. resultresultinputs["data"]
Under en förhandsvisning strömmar operatörens utdata in i utdatapanelen när den produceras, inklusive allt du renderar med display() och text du skriver ut, så att du kan se resultat innan körningen är klar.
Python förhandsgranskningsläge
När du bygger en visuell dataförberedelse förhandsgranskar Designer kontinuerligt varje operatörs utdata på ett urval av din data. Dessa förhandsvisningar kör din Python-kod på samma sätt som en fullständig körning. Det är ett problem när din kod har bieffekter, som att anropa ett externt API, skicka en notis eller skriva till ett system utanför Unity Catalog. Du vill vanligtvis inte att de bieffekterna ska aktiveras vid varje förhandsvisning.
För att låta din kod skilja de två åt, läs config["is_preview"], en boolesk designer sätter för dig:
-
TrueUnder en förhandsvisning, så du kan hoppa över bieffekter. -
Falseunder en hel genomspelning, som när du klickar på Spring eller på en schemalagd runda.
Till exempel skyddar biverkningar så att de bara körs utanför förhandsvisningar:
result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")
# Side effects run only on a full run or scheduled job, not during previews.
if not config["is_preview"]:
write_results_to_external_system(result)
Organisation
Note
Lägger till en anteckning på arbetsytan så att du kan dokumentera själva arbetsflödet: dess syfte, antaganden, varningar eller överlämningskontext för alla som öppnar förberedelsen av visuella data senare.
| Fält | Description |
|---|---|
| Innehåll | Redigera anteckningsinnehåll infogat på arbetsytan med en rtF-redigerare. Du kan lägga till rubriker, textformatering, länkar, bilder och tabeller där oformaterad text inte räcker. Anteckningar påverkar inte hur data flödar via operatorer. |
Group
Grupperar operatorer visuellt på arbetsytan utan att ändra hur data flödar mellan dem, vilket är användbart när en visuell dataförberedelse blir stor eller om du vill återspegla logiska faser.
| Fält | Description |
|---|---|
| Lägg till i grupp | Dra en eller flera operatorer till en grupp för att lägga till dem i den. |
| Skapa från markering | Välj en eller flera operatorer, öppna snabbmenyn (högerklicka) och välj Skapa ny grupp för att omsluta markeringen i en ny grupp. |
| Name | Ge gruppen ett beskrivande namn. |
| Minimera/expandera | Klicka på minimera eller expandera för att visa eller dölja gruppens innehåll på arbetsytan. |
| Aktivera/inaktivera | Högerklicka på gruppens rubrik och välj Inaktivera för att utesluta alla operatörer i gruppen från körningar, eller Aktivera för att inkludera dem igen. Inaktiverade operatorer producerar inga utgångsrader, så nedströmsoperatörer får ett tomt resultat tills du aktiverar dem. Du kan också aktivera eller inaktivera en enskild operatör. Se Aktivera eller inaktivera operatörer. |
Visualization
Skapar en visualisering från indata och renderar den direkt på arbetsytan. Anslut en visualiseringsoperator till alla operatorer som skapar tabelldata för att kartlägga resultaten utan att lämna Designer.
Om du vill konfigurera visualiseringen öppnar du operatorn och väljer en visualiseringstyp och mappar sedan kolumnerna till diagrammet.
| Fält | Description |
|---|---|
| Visualization | Diagramtypen som ska återges, till exempel stapel, område eller räknare. |