Merk
Tilgang til denne siden krever autorisasjon. Du kan prøve å logge på eller endre kataloger.
Tilgang til denne siden krever autorisasjon. Du kan prøve å endre kataloger.
Denne quickstarten forklarer hvordan man lager en Spark-jobbdefinisjon som inneholder Python-kode med Spark Structured Streaming for å lande data i et lakehouse og deretter levere det gjennom et SQL-analyseendepunkt. Etter å ha fullført denne quickstarten, vil du ha en Spark-jobbdefinisjon som kjører kontinuerlig, og SQL-analyseendepunktet kan se de innkommende dataene.
Opprette et Python-skript
Bruk følgende Python-skript til å opprette en streaming Delta-tabell i et lakehouse ved hjelp av Apache Spark. Skriptet leser en strøm av genererte data (én rad per sekund) og skriver det i tilføyingsmodus til en Delta-tabell med navnet streamingtable. Den lagrer dataene og kontrollpunktinformasjonen i det angitte lakehouse.
Bruk følgende Python-kode som bruker Spark-strukturert strømming til å hente data i et lakehouse-bord.
from pyspark.sql import SparkSession if __name__ == "__main__": # Start Spark session spark = SparkSession.builder \ .appName("RateStreamToDelta") \ .getOrCreate() # Table name used for logging tableName = "streamingtable" # Define Delta Lake storage path deltaTablePath = f"Tables/{tableName}" # Create a streaming DataFrame using the rate source df = spark.readStream \ .format("rate") \ .option("rowsPerSecond", 1) \ .load() # Write the streaming data to Delta query = df.writeStream \ .format("delta") \ .outputMode("append") \ .option("path", deltaTablePath) \ .option("checkpointLocation", f"{deltaTablePath}/_checkpoint") \ .start() # Keep the stream running query.awaitTermination()Lagre skriptet som Python-fil (.py) på den lokale datamaskinen.
Opprett et innsjøhus
Bruk følgende fremgangsmåte for å opprette et lakehouse:
Logg inn på Fabric-portalen.
Gå til ønsket arbeidsområde, eller opprett et nytt om nødvendig.
Hvis du vil opprette et innsjøhus, velger du Nytt element fra arbeidsområdet, og deretter velger du Innsjøhus i panelet som åpnes.
Skriv inn navnet på innsjøhuset ditt, og velg Opprett.
Opprett en Spark-jobbdefinisjon
Bruk følgende steg for å lage en Spark-jobbdefinisjon:
Fra samme arbeidsområde der du opprettet et innsjøhus, velger du Nytt element.
I panelet som åpnes, under Hent data, velger du Spark-jobbdefinisjon.
Skriv inn navnet på din Spark-jobbdefinisjon og velg Opprette.
Velg Last opp, og velg Python-filen du opprettet i forrige trinn.
Under Lakehouse-referanse velger du innsjøhuset du opprettet.
Sett Retry-policy for Spark-jobbdefinisjon
Bruk følgende fremgangsmåte for å angi policyen for ny forsøk for Spark-jobbdefinisjonen:
Fra toppmenyen velger du Innstilling ikon.
Åpne kategorien Optimalisering og sett utløseren for policy på nytttil På.
Definer maksimalt antall forsøk på nytt, eller kontroller Tillat ubegrensede forsøk.
Angi tid mellom hvert forsøk på nytt, og velg Bruk.
Note
Det er en levetidsgrense på 90 dager for konfigurasjonen av policyen for nye forsøk. Når policyen for nye forsøk er aktivert, startes jobben på nytt i henhold til policyen innen 90 dager. Etter denne perioden opphører policyen for nye forsøk automatisk å fungere, og jobben avsluttes. Brukere må deretter starte jobben på nytt manuelt, noe som igjen aktiverer policyen for nytt forsøk.
Kjør og overvåk Spark-jobbdefinisjonen
Vise data ved hjelp av et SQL Analytics-endepunkt
Når skriptet kjøres, opprettes en tabell kalt streamingtable med tidsstempel og verdikolonner i lakehouse. Du kan vise dataene ved hjelp av endepunktet for SQL-analyse:
Fra arbeidsplassen, åpne hytta ved innsjøen.
Bytt til endepunkt for SQL-analyse fra øverste høyre hjørne.
Utvid Skjemaer dbo-tabeller >>fra venstre navigasjonsrute for å forhåndsvise dataene.