Opções de formato de arquivo

O Azure Databricks tem associações de palavra-chave internas para todos os formatos de dados com suporte nativo do Apache Spark. O Azure Databricks usa o Delta Lake como o protocolo padrão para ler e gravar dados e tabelas, enquanto o Apache Spark usa Parquet. As seções a seguir descrevem as opções e configurações disponíveis ao consultar cada formato de dados no Azure Databricks.

A maioria dos formatos dá suporte à compactação de gravação por meio da opção compression . Para os valores suportados para cada formato, veja DataFrameWriter opções. Azure Databricks também pode ler diretamente arquivos pré-compactados em muitos formatos e você pode descompactar arquivos compactados em Azure Databricks, se necessário.

Para obter mais informações sobre fontes de dados do Apache Spark, confira Funções genéricas para carregar/salvar e Opções de fontes de arquivo genéricas.

Formatos de tabelas abertas

Formatos de tabela que suportam transações ACID, evolução de esquemas e interoperabilidade entre motores.

Format Description
Lago Delta O formato padrão para ler e escrever dados e tabelas no Azure Databricks.
Icebergue Leia e grave tabelas Iceberg e tenha interoperabilidade com mecanismos Iceberg externos.
OpenSharing Leia tabelas e dados compartilhados usando o protocolo de compartilhamento aberto.

Formatos de colunas

Formatos binários colunares otimizados para desempenho analítico de leitura e compressão.

Format Description
Parquete O formato colunar que o Apache Spark usa por padrão, com compressão e codificação eficientes.
ORC Um formato colunar com compressão embutida e suporte para índices leves.

Formatos baseados em texto

Formatos legíveis por humanos para intercâmbio, configuração e registros com esquemas flexíveis ou em evolução.

Format Description
JSON Leia e escreva arquivos JSON, incluindo opções para registros multilinha e inferência de esquema.
CSV Leia e escreva arquivos de texto delimitados, com opções para cabeçalhos, delimitadores e registros malformados.
XML Leia e escreva arquivos XML especificando a tag de linha e o esquema.
Texto Leia e escreva arquivos de texto simples uma linha ou um arquivo de cada vez.

Formatos binários e especializados

Formatos de serialização binária e fontes de dados específicas do Azure Databricks.

Format Description
Avro Leia e escreva arquivos do Avro e trabalhe com payloads codificados no Avro em streaming.
Experimento do MLflow Carregue os dados de execução do experimento do MLflow usando a palavra-chave personalizada mlflow-experiment.

Dados não estruturados

Formatos e tipos para armazenar e processar documentos, imagens, áudio e outros arquivos não estruturados.

Format Description
Trabalho com dados não estruturados Armazene, governe e processe dados não estruturados, como documentos, imagens e áudio.
Binário Leia arquivos como registros binários brutos, incluindo imagens e outros dados não estruturados.
Image Carregue dados de imagem para cargas de trabalho de aprendizado de máquina. O Databricks recomenda carregar imagens como dados binary.
FILE Armazene uma referência governada a um arquivo não estruturado em vez de usar BINARY ou STRING.
Ingeste arquivos como o tipo FILE Importe arquivos não estruturados para tabelas como referências FILE usando SQL, funções com valor de tabela e o Auto Loader.
Processe arquivos com UDFs Leia bytes de arquivos, extraia metadados de imagens e vídeos e gere arquivos derivados com UDFs.
Guia rápido das funções FILE Comece com o FILE tipo e suas funções no Databricks SQL e Databricks Runtime.

Dados semiestruturados

Padrões e funções para trabalhar com dados aninhados e semiestruturados no lakehouse.

Format Description
Modelagem de dados semiestruturados Escolha entre Variant, JSON strings, structs e mapas para armazenar dados semi-estruturados.
Variante Armazene dados semiestruturados usando o VARIANT tipo para leituras e gravações otimizadas.
Transformar tipos de dados complexos Trabalhe com structs, arrays e mapas no Apache Spark.
Funções de ordem superior Transforme arrays e mapas usando funções de ordem superior embutidas.