Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Der Einstiegspunkt zum Programmieren von Spark mit der Dataset- und DataFrame-API. Eine SparkSession kann verwendet werden, um DataFrames zu erstellen, DataFrames als Tabellen zu registrieren, SQL über Tabellen auszuführen, Tabellen zwischenzuspeichern und Parkettdateien zu lesen.
Syntax
from pyspark.sql import SparkSession
spark = SparkSession.builder.getOrCreate()
Eigenschaften
| Eigentum | Beschreibung |
|---|---|
builder |
Schnittstelle zum Erstellen der Sitzungskonfiguration. |
catalog |
Schnittstelle, über die der Benutzer zugrunde liegende Datenbanken, Tabellen, Funktionen usw. erstellen, ablegen, ändern oder abfragen kann. |
client |
Gibt Zugriff auf den Spark Connect Client. Nur Spark Connect. |
conf |
Laufzeitkonfigurationsschnittstelle für Spark. |
dataSource |
Gibt eine DataSourceRegistration für die Datenquellenregistrierung zurück. |
profile |
Gibt ein Profil für die Leistungs-/Speicherprofilerstellung zurück. |
read |
Gibt einen DataFrameReader zurück, der zum Lesen von Daten als DataFrame verwendet werden kann. |
readStream |
Gibt einen DataStreamReader zurück, der zum Lesen von Datenströmen als Streaming dataFrame verwendet werden kann. |
sparkContext |
Gibt den zugrunde liegenden SparkContext zurück. Nur im klassischen Modus. |
streams |
Gibt einen StreamingQueryManager zurück, der die Verwaltung aller aktiven Streamingabfragen zulässt. |
tvf |
Gibt eine TableValuedFunction zum Aufrufen von Tabellenwertfunktionen (TVFs) zurück. |
udf |
Gibt eine UDFRegistration für die UDF-Registrierung zurück. |
udtf |
Gibt eine UDTFRegistration für UDTF-Registrierung zurück. |
version |
Die Version von Spark, auf der diese Anwendung ausgeführt wird. |
Methodik
| Methode | Beschreibung |
|---|---|
createDataFrame(data, schema, samplingRatio, verifySchema) |
Erstellt einen DataFrame aus einer RDD, einer Liste, einem Pandas DataFrame, einem numpy ndarray oder einer Pyarrow Table. |
sql(sqlQuery, args, **kwargs) |
Gibt einen DataFrame zurück, der das Ergebnis der angegebenen Abfrage darstellt. |
table(tableName) |
Gibt die angegebene Tabelle als DataFrame zurück. |
range(start, end, step, numPartitions) |
Erstellt einen DataFrame mit einer einzelnen LongType-Spalte namens id, die Elemente in einem Bereich enthält. |
newSession() |
Gibt eine neue SparkSession mit separaten SQLConf, registrierten temporären Ansichten und UDFs zurück, aber freigegebenen SparkContext- und Tabellencache. Nur im klassischen Modus. |
getActiveSession() |
Gibt die aktive SparkSession für den aktuellen Thread zurück. |
active() |
Gibt die aktive oder standardmäßige SparkSession für den aktuellen Thread zurück. |
stop() |
Beendet den zugrunde liegenden SparkContext. |
addArtifacts(*path, pyfile, archive, file) |
Fügt der Clientsitzung Artefakte hinzu. |
interruptAll() |
Unterbricht alle Vorgänge dieser Sitzung, die derzeit auf dem Server ausgeführt wird. |
interruptTag(tag) |
Unterbricht alle Vorgänge dieser Sitzung mit dem angegebenen Tag. |
interruptOperation(op_id) |
Unterbricht einen Vorgang dieser Sitzung mit der angegebenen operationId. |
addTag(tag) |
Fügt ein Tag hinzu, das allen Vorgängen zugewiesen werden soll, die in dieser Sitzung von diesem Thread gestartet wurden. |
removeTag(tag) |
Entfernt ein Tag, das zuvor für Vorgänge hinzugefügt wurde, die von diesem Thread gestartet wurden. |
getTags() |
Ruft die Tags ab, die derzeit für alle Vorgänge festgelegt sind, die von diesem Thread gestartet werden. |
clearTags() |
Löscht die Vorgangstags des aktuellen Threads. |