Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Den här handledningen guidar dig genom att sätta upp Databricks IDE-tillägget och sedan köra Python på ett Azure Databricks-kluster och som ett Azure Databricks-jobb i din fjärrarbetsplats. Se Databricks IDE-tillägg.
Krav
Den här självstudien kräver att:
- Du har installerat Databricks IDE-tillägg. Se Installera Databricks IDE-tillägg.
- Du har ett fjärranslutet Azure Databricks kluster att använda. Anteckna klustrets namn. Om du vill visa dina tillgängliga kluster klickar du på Compute i sidofältet på Azure Databricks arbetsytan. Se Beräkning.
Steg 1: Skapa ett nytt Databricks-projekt
I det här steget skapar du ett nytt Databricks-projekt och konfigurerar anslutningen till din fjärranslutna Azure Databricks arbetsyta.
- Starta Visual Studio Code och klicka sedan på File > Öppna mapp och öppna en tom mapp på den lokala utvecklingsdatorn.
- Klicka på ikonen för Databricks-logotypen i sidopanelen. Då öppnas Databricks-tillägget.
- I vyn Konfiguration klickar du på Skapa konfiguration.
- Kommandopaletten för att konfigurera databricks-arbetsytan öppnas. För Databricks Host anger eller väljer du url:en per arbetsyta, till exempel
https://adb-1234567890123456.7.azuredatabricks.net. - Välj en autentiseringsprofil för projektet. Se Sätt upp auktorisation för Databricks IDE-tillägget.
Steg 2: Lägg till klusterinformation i Databricks-tillägget och starta klustret
När konfigurationsvyn redan är öppen klickar du på Välj ett kluster eller klickar på kugghjulsikonen (Konfigurera kluster).
I kommandopaletten väljer du namnet på klustret som du skapade tidigare.
Klicka på uppspelningsikonen (Starta kluster) om den inte redan har startats.
Steg 3: Skapa och kör Python kod
Skapa en lokal Python kodfil: Klicka på mappen (Explorer) i sidofältet.
På huvudmenyn klickar du på File > Ny fil och väljer en Python fil. Ge filen namnet demo.py och spara den i projektets rot.
Lägg till följande kod i filen och spara den sedan. Den här koden skapar och visar innehållet i en grundläggande PySpark DataFrame:
from pyspark.sql import SparkSession from pyspark.sql.types import * spark = SparkSession.builder.getOrCreate() schema = StructType([ StructField('CustomerID', IntegerType(), False), StructField('FirstName', StringType(), False), StructField('LastName', StringType(), False) ]) data = [ [ 1000, 'Mathijs', 'Oosterhout-Rijntjes' ], [ 1001, 'Joost', 'van Brunswijk' ], [ 1002, 'Stan', 'Bokenkamp' ] ] customers = spark.createDataFrame(data, schema) customers.show()# +----------+---------+-------------------+ # |CustomerID|FirstName| LastName| # +----------+---------+-------------------+ # | 1000| Mathijs|Oosterhout-Rijntjes| # | 1001| Joost| van Brunswijk| # | 1002| Stan| Bokenkamp| # +----------+---------+-------------------+Klicka på ikonen Kör på Databricks bredvid listan med redigeringsflikar och klicka sedan på Ladda upp och kör fil. Utdata visas i vyn "Debug Console".
Du kan också högerklicka på filen i Utforskaren och sedan klicka på
demo.py>.
Steg 4: Kör koden som ett jobb
Om du vill köra demo.py som ett jobb klickar du på ikonen Kör på Databricks bredvid listan över redigeringsflikar och klickar sedan på Kör fil som arbetsflöde. Utdata visas på en separat redigeringsflik bredvid demo.py filredigeraren.
Du kan också högerklicka på demo.py filen i utforskarpanelenoch sedan välja Kör på Databricks>Kör fil som arbetsflöde.
Nästa steg
Nu när du framgångsrikt har använt Databricks IDE-tillägg för att ladda upp en lokal Python-fil och köra den på distans, kan du också:
- Utforska deklarativa Automation-paketresurser och variabler med hjälp av tilläggsgränssnittet. Se Bundle- och utforskarfunktioner.
- Kör eller felsöka Python kod med Databricks Connect. Se Debug-kod med Databricks Connect för Databricks IDE-tillägget.
- Kör en fil eller en notebook som ett Azure Databricks-jobb. Se Kör en fil på ett kluster eller en fil eller notebook som ett jobb i Azure Databricks med Databricks IDE-tillägget.
- Kör tester med
pytest. Se Kör Python-tester med Databricks IDE-tillägg.