Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O ponto de entrada para programar o Spark com o Dataset e a API DataFrame. Uma SparkSession pode ser usada para criar DataFrames, registar DataFrames como tabelas, executar SQL sobre tabelas, armazenar tabelas em cache e ler ficheiros de parquet.
Sintaxe
from pyspark.sql import SparkSession
spark = SparkSession.builder.getOrCreate()
Propriedades
| Propriedade | Descrição |
|---|---|
builder |
Interface para construir a configuração da sessão. |
catalog |
Interface através da qual o utilizador pode criar, descartar, alterar ou consultar bases de dados, tabelas, funções, etc. subjacentes. |
client |
Dá acesso ao cliente Spark Connect. Só Spark Connect. |
conf |
Interface de configuração em tempo de execução para o Spark. |
dataSource |
Devolve um DataSourceRegistration para registo da fonte de dados. |
profile |
Devolve um Perfil para perfilagem de desempenho/memória. |
read |
Devolve um DataFrameReader que pode ser usado para ler dados como DataFrame. |
readStream |
Devolve um DataStreamReader que pode ser usado para ler fluxos de dados como um DataFrame em streaming. |
sparkContext |
Devolve o SparkContext subjacente. Modo clássico apenas. |
streams |
Devolve um StreamingQueryManager que permite gerir todas as consultas de streaming ativas. |
tvf |
Devolve uma TableValuedFunction para chamar funções de tabela (TVFs). |
udf |
Devolve uma UDFRegistration para registo UDF. |
udtf |
Devolve uma UDTFRegistration para registo UDTF. |
version |
A versão do Spark em que esta aplicação está a correr. |
Methods
| Método | Descrição |
|---|---|
createDataFrame(data, schema, samplingRatio, verifySchema) |
Cria um DataFrame a partir de um RDD, uma lista, um DataFrame pandas, um numpy ndarray ou uma Tabela pyarrow. |
sql(sqlQuery, args, **kwargs) |
Devolve um DataFrame que representa o resultado da consulta dada. |
table(tableName) |
Devolve a tabela especificada como DataFrame. |
range(start, end, step, numPartitions) |
Cria um DataFrame com uma única coluna LongType chamada id, contendo elementos num intervalo. |
newSession() |
Devolve um novo SparkSession com SQLConf separado, vistas temporárias registadas e UDFs, mas partilhado do SparkContext e cache de tabelas. Modo clássico apenas. |
getActiveSession() |
Devolve o SparkSession ativo para o tópico atual. |
active() |
Devolve o SparkSession ativo ou predefinido para o tópico atual. |
stop() |
Para o SparkContext subjacente. |
addArtifacts(*path, pyfile, archive, file) |
Adiciona artefactos à sessão do cliente. |
interruptAll() |
Interrompe todas as operações desta sessão atualmente a decorrer no servidor. |
interruptTag(tag) |
Interrompe todas as operações desta sessão com a etiqueta dada. |
interruptOperation(op_id) |
Interrompe uma operação desta sessão com o operationId. |
addTag(tag) |
Adiciona uma etiqueta a ser atribuída a todas as operações iniciadas por este tópico nesta sessão. |
removeTag(tag) |
Remove uma etiqueta anteriormente adicionada para operações iniciadas por este tópico. |
getTags() |
Obtém as etiquetas atualmente definidas para serem atribuídas a todas as operações iniciadas por este tópico. |
clearTags() |
Limpa as tags de operação do tópico atual. |