Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O Azure Databricks tem associações de palavra-chave internas para todos os formatos de dados com suporte nativo do Apache Spark. O Azure Databricks usa o Delta Lake como o protocolo padrão para ler e gravar dados e tabelas, enquanto o Apache Spark usa Parquet. As seções a seguir descrevem as opções e configurações disponíveis ao consultar cada formato de dados no Azure Databricks.
A maioria dos formatos dá suporte à compactação de gravação por meio da opção compression . Para os valores suportados para cada formato, veja DataFrameWriter opções. Azure Databricks também pode ler diretamente arquivos pré-compactados em muitos formatos e você pode descompactar arquivos compactados em Azure Databricks, se necessário.
Para obter mais informações sobre fontes de dados do Apache Spark, confira Funções genéricas para carregar/salvar e Opções de fontes de arquivo genéricas.
Formatos de tabelas abertas
Formatos de tabela que suportam transações ACID, evolução de esquemas e interoperabilidade entre motores.
| Format | Description |
|---|---|
| Lago Delta | O formato padrão para ler e escrever dados e tabelas no Azure Databricks. |
| Icebergue | Leia e grave tabelas Iceberg e tenha interoperabilidade com mecanismos Iceberg externos. |
| OpenSharing | Leia tabelas e dados compartilhados usando o protocolo de compartilhamento aberto. |
Formatos de colunas
Formatos binários colunares otimizados para desempenho analítico de leitura e compressão.
| Format | Description |
|---|---|
| Parquete | O formato colunar que o Apache Spark usa por padrão, com compressão e codificação eficientes. |
| ORC | Um formato colunar com compressão embutida e suporte para índices leves. |
Formatos baseados em texto
Formatos legíveis por humanos para intercâmbio, configuração e registros com esquemas flexíveis ou em evolução.
| Format | Description |
|---|---|
| JSON | Leia e escreva arquivos JSON, incluindo opções para registros multilinha e inferência de esquema. |
| CSV | Leia e escreva arquivos de texto delimitados, com opções para cabeçalhos, delimitadores e registros malformados. |
| XML | Leia e escreva arquivos XML especificando a tag de linha e o esquema. |
| Texto | Leia e escreva arquivos de texto simples uma linha ou um arquivo de cada vez. |
Formatos binários e especializados
Formatos de serialização binária e fontes de dados específicas do Azure Databricks.
| Format | Description |
|---|---|
| Avro | Leia e escreva arquivos do Avro e trabalhe com payloads codificados no Avro em streaming. |
| Experimento do MLflow | Carregue os dados de execução do experimento do MLflow usando a palavra-chave personalizada mlflow-experiment. |
Dados não estruturados
Formatos e tipos para armazenar e processar documentos, imagens, áudio e outros arquivos não estruturados.
| Format | Description |
|---|---|
| Trabalho com dados não estruturados | Armazene, governe e processe dados não estruturados, como documentos, imagens e áudio. |
| Binário | Leia arquivos como registros binários brutos, incluindo imagens e outros dados não estruturados. |
| Image | Carregue dados de imagem para cargas de trabalho de aprendizado de máquina. O Databricks recomenda carregar imagens como dados binary. |
| FILE | Armazene uma referência governada a um arquivo não estruturado em vez de usar BINARY ou STRING. |
| Ingeste arquivos como o tipo FILE | Importe arquivos não estruturados para tabelas como referências FILE usando SQL, funções com valor de tabela e o Auto Loader. |
| Processe arquivos com UDFs | Leia bytes de arquivos, extraia metadados de imagens e vídeos e gere arquivos derivados com UDFs. |
| Guia rápido das funções FILE | Comece com o FILE tipo e suas funções no Databricks SQL e Databricks Runtime. |
Dados semiestruturados
Padrões e funções para trabalhar com dados aninhados e semiestruturados no lakehouse.
| Format | Description |
|---|---|
| Modelagem de dados semiestruturados | Escolha entre Variant, JSON strings, structs e mapas para armazenar dados semi-estruturados. |
| Variante | Armazene dados semiestruturados usando o VARIANT tipo para leituras e gravações otimizadas. |
| Transformar tipos de dados complexos | Trabalhe com structs, arrays e mapas no Apache Spark. |
| Funções de ordem superior | Transforme arrays e mapas usando funções de ordem superior embutidas. |