SparkSession

O ponto de entrada para programar o Spark com o Dataset e a API DataFrame. Uma SparkSession pode ser usada para criar DataFrames, registar DataFrames como tabelas, executar SQL sobre tabelas, armazenar tabelas em cache e ler ficheiros de parquet.

Sintaxe

from pyspark.sql import SparkSession

spark = SparkSession.builder.getOrCreate()

Propriedades

Propriedade Descrição
builder Interface para construir a configuração da sessão.
catalog Interface através da qual o utilizador pode criar, descartar, alterar ou consultar bases de dados, tabelas, funções, etc. subjacentes.
client Dá acesso ao cliente Spark Connect. Só Spark Connect.
conf Interface de configuração em tempo de execução para o Spark.
dataSource Devolve um DataSourceRegistration para registo da fonte de dados.
profile Devolve um Perfil para perfilagem de desempenho/memória.
read Devolve um DataFrameReader que pode ser usado para ler dados como DataFrame.
readStream Devolve um DataStreamReader que pode ser usado para ler fluxos de dados como um DataFrame em streaming.
sparkContext Devolve o SparkContext subjacente. Modo clássico apenas.
streams Devolve um StreamingQueryManager que permite gerir todas as consultas de streaming ativas.
tvf Devolve uma TableValuedFunction para chamar funções de tabela (TVFs).
udf Devolve uma UDFRegistration para registo UDF.
udtf Devolve uma UDTFRegistration para registo UDTF.
version A versão do Spark em que esta aplicação está a correr.

Methods

Método Descrição
createDataFrame(data, schema, samplingRatio, verifySchema) Cria um DataFrame a partir de um RDD, uma lista, um DataFrame pandas, um numpy ndarray ou uma Tabela pyarrow.
sql(sqlQuery, args, **kwargs) Devolve um DataFrame que representa o resultado da consulta dada.
table(tableName) Devolve a tabela especificada como DataFrame.
range(start, end, step, numPartitions) Cria um DataFrame com uma única coluna LongType chamada id, contendo elementos num intervalo.
newSession() Devolve um novo SparkSession com SQLConf separado, vistas temporárias registadas e UDFs, mas partilhado do SparkContext e cache de tabelas. Modo clássico apenas.
getActiveSession() Devolve o SparkSession ativo para o tópico atual.
active() Devolve o SparkSession ativo ou predefinido para o tópico atual.
stop() Para o SparkContext subjacente.
addArtifacts(*path, pyfile, archive, file) Adiciona artefactos à sessão do cliente.
interruptAll() Interrompe todas as operações desta sessão atualmente a decorrer no servidor.
interruptTag(tag) Interrompe todas as operações desta sessão com a etiqueta dada.
interruptOperation(op_id) Interrompe uma operação desta sessão com o operationId.
addTag(tag) Adiciona uma etiqueta a ser atribuída a todas as operações iniciadas por este tópico nesta sessão.
removeTag(tag) Remove uma etiqueta anteriormente adicionada para operações iniciadas por este tópico.
getTags() Obtém as etiquetas atualmente definidas para serem atribuídas a todas as operações iniciadas por este tópico.
clearTags() Limpa as tags de operação do tópico atual.