Ler e escrever ficheiros ORC

Apache ORC é um formato de ficheiro colunar otimizado para cargas analíticas de grande escala. Utiliza índices e estatísticas incorporados para evitar dados irrelevantes durante as leituras. O Azure Databricks suporta ORC tanto para leitura como para escrita com o Apache Spark, incluindo especificação de esquema, particionamento e compressão de escrita.

Pré-requisitos

O Azure Databricks não requer configuração adicional para utilizar ficheiros ORC. No entanto, para transmitir ficheiros ORC, precisas do Auto Loader.

Opções

Utilize os métodos .option() e .options() de DataFrameReader e DataFrameWriter para configurar as fontes de dados ORC. Para uma lista completa de opções suportadas, veja DataFrameReader opções ORC e DataFrameWriter opções ORC.

Usage

Os exemplos seguintes utilizam o conjunto de dados de exemplo Wanderbricks para demonstrar a leitura e escrita de ficheiros ORC usando a API Spark DataFrame e SQL.

Ler e escrever ficheiros ORC

Python

# Write wanderbricks reviews to ORC format
df = spark.read.table("samples.wanderbricks.reviews")
df.write.format("orc").save("/Volumes/<catalog>/<schema>/<volume>/reviews_orc")

# Read an ORC file into a DataFrame
df = spark.read.format("orc").load("/Volumes/<catalog>/<schema>/<volume>/reviews_orc")
display(df)

# Write with overwrite mode
df.write.format("orc").mode("overwrite").save("/Volumes/<catalog>/<schema>/<volume>/reviews_orc")

Scala

// Write wanderbricks reviews to ORC format
val reviews = spark.read.table("samples.wanderbricks.reviews")
reviews.write.format("orc").save("/Volumes/<catalog>/<schema>/<volume>/reviews_orc")

// Read an ORC file into a DataFrame
val df = spark.read.format("orc").load("/Volumes/<catalog>/<schema>/<volume>/reviews_orc")
df.show()

// Write with overwrite mode
df.write.format("orc").mode("overwrite").save("/Volumes/<catalog>/<schema>/<volume>/reviews_orc")

SQL

-- Write wanderbricks reviews to ORC format
CREATE TABLE reviews_orc
USING ORC
AS SELECT * FROM samples.wanderbricks.reviews;

SELECT * FROM reviews_orc;

Leia ficheiros ORC usando SQL

Uso read_files para consultar ficheiros ORC diretamente a partir de armazenamento na cloud usando SQL sem criar uma tabela.

SELECT * FROM read_files(
  '/Volumes/<catalog>/<schema>/<volume>/reviews_orc',
  format => 'orc'
)

Especifique um esquema

Especifique um esquema ao ler ficheiros ORC para evitar a sobrecarga da inferência de esquemas. Por exemplo, defina um esquema com os campos review_id, rating e comment e leia reviews_orc para um DataFrame.

Python

from pyspark.sql.types import StructType, StructField, StringType, IntegerType

schema = StructType([
    StructField("review_id", StringType(), True),
    StructField("rating", IntegerType(), True),
    StructField("comment", StringType(), True)
])

df = spark.read.format("orc").schema(schema).load("/Volumes/<catalog>/<schema>/<volume>/reviews_orc")
df.printSchema()
df.show()

Scala

import org.apache.spark.sql.types.{StructType, StructField, StringType, IntegerType}

val schema = StructType(Array(
  StructField("review_id", StringType, nullable = true),
  StructField("rating", IntegerType, nullable = true),
  StructField("comment", StringType, nullable = true)
))

val df = spark.read.format("orc").schema(schema).load("/Volumes/<catalog>/<schema>/<volume>/reviews_orc")
df.printSchema()
df.show()

SQL

-- Create a table with an explicit schema from ORC files
CREATE TABLE reviews_orc (
  review_id STRING,
  rating INT,
  comment STRING
)
USING ORC
OPTIONS (path "/Volumes/<catalog>/<schema>/<volume>/reviews_orc");

SELECT * FROM reviews_orc;

Escrever ficheiros ORC particionados

Escrever ficheiros ORC particionados para otimizar o desempenho das consultas em grandes conjuntos de dados. Por exemplo, leia samples.wanderbricks.bookings e escreva em bookings_orc_partitioned particionado por year e month derivado da check_in coluna.

Python

from pyspark.sql.functions import year, month

df = spark.read.table("samples.wanderbricks.bookings")
df_with_parts = df.withColumn("year", year("check_in")).withColumn("month", month("check_in"))
df_with_parts.write.format("orc").partitionBy("year", "month").save("/Volumes/<catalog>/<schema>/<volume>/bookings_orc_partitioned")

Scala

import org.apache.spark.sql.functions.{year, month}

val bookings = spark.read.table("samples.wanderbricks.bookings")
val bookingsWithParts = bookings.withColumn("year", year(col("check_in"))).withColumn("month", month(col("check_in")))
bookingsWithParts.write.format("orc").partitionBy("year", "month").save("/Volumes/<catalog>/<schema>/<volume>/bookings_orc_partitioned")

SQL

-- Write partitioned ORC files by year and month
CREATE TABLE bookings_orc_partitioned
USING ORC
PARTITIONED BY (year, month)
AS SELECT *, year(check_in) AS year, month(check_in) AS month
FROM samples.wanderbricks.bookings;

Recursos adicionais

  • O que é o Delta Lake no Azure Databricks?: Se estiver a migrar de um ambiente Hive ou Hadoop usando ORC, o Delta Lake é o formato nativo do Databricks recomendado. Adiciona transações ACID, imposição de esquemas, viagem no tempo e desempenho de leitura otimizado sobre uma camada de armazenamento baseada em Parquet.
  • Leia e escreva ficheiros Parquet: Se a sua carga de trabalho requer a mais ampla compatibilidade do ecossistema fora dos Databricks, o Parquet é o formato colunar mais suportado entre motores de consulta e ferramentas de armazenamento na cloud.