Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Startpunkten för att programmera Spark med datauppsättningen och DataFrame-API:et. En SparkSession kan användas för att skapa DataFrames, registrera DataFrames som tabeller, köra SQL över tabeller, cachetabeller och läsa parquet-filer.
Syntax
from pyspark.sql import SparkSession
spark = SparkSession.builder.getOrCreate()
Egenskaper
| Fastighet | Beskrivning |
|---|---|
builder |
Gränssnitt för att bygga sessionskonfigurationen. |
catalog |
Gränssnitt genom vilket användaren kan skapa, släppa, ändra eller fråga underliggande databaser, tabeller, funktioner osv. |
client |
Ger tillgång till Spark Connect-klienten. Endast Spark Connect. |
conf |
Körningskonfigurationsgränssnitt för Spark. |
dataSource |
Returnerar en DataSourceRegistration för datakällregistrering. |
profile |
Returnerar en profil för prestanda-/minnesprofilering. |
read |
Returnerar en DataFrameReader som kan användas för att läsa data som en DataFrame. |
readStream |
Returnerar en DataStreamReader som kan användas för att läsa dataströmmar som en strömmande DataFrame. |
sparkContext |
Returnerar den underliggande SparkContext. Endast klassiskt läge. |
streams |
Returnerar en StreamingQueryManager som tillåter hantering av alla aktiva strömningsfrågor. |
tvf |
Returnerar en TableValuedFunction för att anropa tabellvärdesfunktioner (TVF:er). |
udf |
Returnerar en UDFRegistration för UDF-registrering. |
udtf |
Returnerar en UDTFRegistration för UDTF-registrering. |
version |
Den version av Spark som programmet körs på. |
Methods
| Metod | Beskrivning |
|---|---|
createDataFrame(data, schema, samplingRatio, verifySchema) |
Skapar en DataFrame från en RDD, en lista, en Pandas DataFrame, en numpy ndarray eller en pyarrow-tabell. |
sql(sqlQuery, args, **kwargs) |
Returnerar en DataFrame som representerar resultatet av den angivna frågan. |
table(tableName) |
Returnerar den angivna tabellen som en DataFrame. |
range(start, end, step, numPartitions) |
Skapar en DataFrame med en enda LongType-kolumn med namnet id, som innehåller element i ett intervall. |
newSession() |
Returnerar en ny SparkSession med separata SQLConf, registrerade temporära vyer och UDF:er, men delad SparkContext och tabellcache. Endast klassiskt läge. |
getActiveSession() |
Returnerar aktiv SparkSession för den aktuella tråden. |
active() |
Returnerar aktiv eller standard-SparkSession för den aktuella tråden. |
stop() |
Stoppar den underliggande SparkContext. |
addArtifacts(*path, pyfile, archive, file) |
Lägger till artefakter i klientsessionen. |
interruptAll() |
Avbryter alla åtgärder i den här sessionen som för närvarande körs på servern. |
interruptTag(tag) |
Avbryter alla åtgärder i den här sessionen med den angivna taggen. |
interruptOperation(op_id) |
Avbryter en åtgärd i den här sessionen med angivet operationId. |
addTag(tag) |
Lägger till en tagg som ska tilldelas till alla åtgärder som startas av den här tråden i den här sessionen. |
removeTag(tag) |
Tar bort en tagg som tidigare lagts till för åtgärder som startats av den här tråden. |
getTags() |
Hämtar de taggar som för närvarande är inställda på att tilldelas till alla åtgärder som startas av den här tråden. |
clearTags() |
Rensar den aktuella trådens åtgärdstaggar. |