Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Varje visuell dataförberedelsefil som du skapar i Lakeflow Designer backas upp av produktionsklar kod och lagras som en notebook-fil med namnet <name>.designer.ipynb. Du kan flytta den till produktion med samma verktyg som du använder för andra Azure Databricks kod: lagra den i Git, köra den som ett jobb och distribuera den med deklarativa Automation-paket.
Den här sidan beskriver hur du tar en visuell dataförberedelsefil från prototyp till produktion.
Lagra och versionshantera i Git
Arbetsytan lagrar visuella dataförberedelsefiler internt. Om du vill versionshantera en visuell dataförberedelsefil placerar du den i en Git-mapp och spårar den som alla andra notebook-filer:
- Skapa en Git-mapp på din arbetsyta.
- Flytta den visuella dataförberedelsefilen till git-mappen.
- Spåra, checka in och versionshantera filen på samma sätt som andra notebook-filer i Git. I Git visas filen som
<file_name>.designer.ipynb.
Mer information om Git-mappar finns i Azure Databricks Git-mappar. Information om hur du exporterar eller importerar en visuell dataförberedelsefil finns i Exportera och importera en visuell dataförberedelsefil.
Schemalägg som ett jobb
Du kan automatisera en visuell dataförberedelsefil genom att schemalägga den som ett jobb.
- Schemalägg direkt: Klicka på knappen Schema på den översta menyn för att skapa ett schemalagt jobb för din visuella dataförberedelsefil.
- Lägg till i ett jobb: Skapa ett Azure Databricks jobb och lägg till din visuella dataförberedelsefil som en uppgift. På så sätt kan du kombinera den visuella dataförberedelsefilen med andra uppgifter i en större pipeline. I listrutan Aktivitetstyp väljer du Förberedelse av visuella data och sedan filen.
Schemalagda körningar visar varje operator som en enskild nod i aktivitetsdiagrammet Jobb, så att du kan kontrollera resultatet per operator på samma sätt som du gör på arbetsytan.
Om du vill visa och hantera befintliga scheman klickar du på Schema igen för att öppna listan. Klicka på Lägg till schema för att skapa ett annat eller öppna schemats Menyn För att redigera, Köra nu, Pausa, Klona, Visa i jobb eller Ta bort den.
Visa operatorns utdata i en körning
Som standard genererar en schemalagd körning endast utdata för terminaloperatorer (operatorer utan nedströmsanslutning), till exempel en utdataoperator. Om du vill se resultatet för varje operator i körningen expanderar du Avancerade inställningar i schemadialogrutan och väljer Visa operatorutdata.
Stäng av det här alternativet för stora arbetsytor för att undvika att överskrida gränsen för körningens utdatas storlek.
Välj den serverlösa miljön
När du arbetar med en visuell dataförberedelsefil kan du välja den serverlösa miljö som används för både interaktiva körningar och schemalagda jobb. Konfigurera den i sidopanelen Miljö i det högra sidofältet, på samma sätt som för en notebook. Under Basmiljö väljer du en miljöversion. Se Konfigurera den serverlösa miljön.
Parametrisera mellan miljöer
Parametrar är namngivna värden som definieras för filen för visuell dataförberedelse som helhet och som du kan referera till i SQL- och Python-operatorer. Mer information om hur du definierar och refererar till parametrar finns i Parametrar.
Med parametrar kan du köra samma visuella dataförberedelsefil mot olika miljöer, till exempel en testkatalog under utveckling och en produktionskatalog i produktion.
-
När du schemalägger ett jobb i användargränssnittet: Åsidosätt parametervärdena för varje schema. Skapa till exempel ett schema som körs med parametern
environmentinställd påtestoch ett annat som körs med den inställd påproduction. -
När du distribuerar med ett paket: Ange parametervärdena via jobbets
parameters, och använd paketmål för att ange olika värden per miljö. Med paketutvecklings- och produktionsmål kan du distribuera samma jobb för att separera miljöer med miljöspecifika inställningar. Se Distributionslägen för deklarativa Automation-paket och konfiguration av deklarativa Automation-paket.
Vid körning läser en visuell dataförberedelsefil sina parametrar på samma sätt oavsett om den körs interaktivt eller som ett jobb, så samma fil fungerar i alla dina miljöer utan ändringar.
Läsa från olika tabeller per miljö
Om du vill läsa från en annan källtabell i varje miljö använder du en SQL-operator med parametrar i stället för en fast källoperator. Definiera catalogparametrarna , schemaoch table och referera sedan till dem med IDENTIFIER() -satsen för att skapa tabellnamnet dynamiskt:
SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)
Åsidosätt parametrarna catalog, schema eller table för varje schema eller paketmål så att samma visuella dataförberedelsefil använder testdata under utveckling och produktionsdata i produktion. Mer information om satsen finns i IDENTIFIER()IDENTIFIER satsen.
Distribuera med deklarativa automatiseringspaket
Med deklarativa Automation-paket kan du definiera och distribuera Azure Databricks resurser, till exempel jobb som källfiler, så att du kan tillämpa metodtips för programvaruutveckling som källkodskontroll, kodgranskning, testning och CI/CD för dina visuella dataförberedelsefiler. Se även Vad är deklarativa automatiseringspaket?.
Om du vill distribuera en fil för visuell dataförberedelse med ett paket definierar du en notebook-uppgift och anger filsökvägen till .designer.ipynb i notebook_task.notebook_path. I ett paket använder en visuell dataförberedelsefil nyckeln notebook_task, även om Jobs-gränssnittet visar den som aktivitetstypen Visuell dataförberedelse.
I följande exempel definieras ett jobb som kör en visuell dataförberedelsefil bredvid paketkonfigurationsfilen:
resources:
jobs:
daily_prep_job:
name: daily_prep_job
tasks:
- task_key: run_visual_data_prep
notebook_task:
notebook_path: ./my_transformation.designer.ipynb
Distribuera och kör paketet med Azure Databricks CLI:
databricks bundle deploy
databricks bundle run daily_prep_job
För hela uppsättningen uppgiftsnycklar för notebook-uppgifter, se Notebook-uppgift. En fullständig genomgång av hur du definierar ett jobb i ett paket finns i Utveckla ett jobb med deklarativa Automation-paket.
Automatisera med CI/CD
Om du vill verifiera och distribuera paket för visuell dataförberedelse automatiskt integrerar du dem i en CI/CD-pipeline. Ett exempel som använder GitHub Actions finns i GitHub Actions.