Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O Azure Databricks tem ligações de palavras-chave incorporadas para todos os formatos de dados suportados nativamente pelo Apache Spark. O Azure Databricks usa o Delta Lake como o protocolo padrão para ler e gravar dados e tabelas, enquanto o Apache Spark usa o Parquet. As secções seguintes descrevem as opções e configurações disponíveis quando consulta cada formato de dados no Azure Databricks.
A maioria dos formatos suporta compressão de escrita através desta compression opção. Para os valores suportados para cada formato, consulte DataFrameWriter opções. O Azure Databricks também pode ler diretamente ficheiros pré-comprimidos em muitos formatos, e pode descompactar ficheiros comprimidos no Azure Databricks, se necessário.
Para obter mais informações sobre origens de dados do Apache Spark, veja Funções Genéricas de Carregar/Guardar e Opções Genéricas de Origem de Ficheiro.
Formatos de tabela aberta
Formatos de tabela que suportam transações ACID, evolução de esquemas e interoperabilidade entre motores.
| Format | Description |
|---|---|
| Lago Delta | O formato padrão para ler e escrever dados e tabelas no Azure Databricks. |
| Iceberg | Ler e escrever tabelas Iceberg e interoperar com motores Iceberg externos. |
| OpenSharing | Leia tabelas e dados partilhados usando o protocolo de partilha aberta. |
Formatos colunares
Formatos binários de coluna otimizados para desempenho analítico de leitura e compressão.
| Format | Description |
|---|---|
| Parquet | O formato colunar que o Apache Spark utiliza por defeito, com compressão e codificação eficientes. |
| ORC | Um formato colunar com compressão incorporada e suporte para índices leves. |
Formatos baseados em texto
Formatos legíveis por humanos para intercâmbio, configuração e registos com esquemas flexíveis ou em evolução.
| Format | Description |
|---|---|
| JSON | Leia e escreva ficheiros JSON, incluindo opções para registos multilinha e inferência de esquemas. |
| CSV | Leia e escreva ficheiros de texto delimitados, com opções para cabeçalhos, delimitadores e registos malformados. |
| XML | Leia e escreva ficheiros XML especificando a etiqueta de linha e o esquema. |
| Texto | Leia e escreva ficheiros de texto simples uma linha ou um ficheiro de cada vez. |
Formatos binários e especializados
Formatos de serialização binária e fontes de dados específicas do Azure Databricks.
| Format | Description |
|---|---|
| Avro | Leia e escreva ficheiros Avro e trabalhe com payloads codificados em Avro em streaming. |
| Experiência MLflow | Carregue os dados de execução da experiência do MLflow utilizando a palavra-chave personalizada mlflow-experiment. |
Dados não estruturados
Formatos e tipos para armazenar e processar documentos, imagens, áudio e outros ficheiros não estruturados.
| Format | Description |
|---|---|
| Trabalhar com dados não estruturados | Armazenar, governar e processar dados não estruturados, como documentos, imagens e áudio. |
| Binário | Leia ficheiros como registos binários brutos, incluindo imagens e outros dados não estruturados. |
| Image | Carregar dados de imagem para cargas de trabalho de aprendizagem automática. A Databricks recomenda carregar imagens como dados binary. |
| ARQUIVO | Armazene uma referência governada a um ficheiro não estruturado em vez de usar BINARY ou STRING. |
| Importar ficheiros como o tipo FILE | Importe ficheiros não estruturados para tabelas como referências FILE utilizando SQL, funções com valor de tabela e Auto Loader. |
| Ficheiros de processo com UDFs | Ler bytes de ficheiro, extrair metadados de imagens e vídeos e gerar ficheiros derivados com UDFs. |
| Guia de iniciação rápida das funções FILE | Comece com o FILE tipo e as suas funções em Databricks SQL e Databricks Runtime. |
Dados semiestruturados
Padrões e funções para trabalhar com dados aninhados e semi-estruturados na casa do lago.
| Format | Description |
|---|---|
| Modelos de dados semi-estruturados | Escolha entre Variant, strings JSON, structs e mapas para armazenar dados semi-estruturados. |
| Variante | Armazene dados semi-estruturados usando o VARIANT tipo para leituras e escritas otimizadas. |
| Transformar tipos de dados complexos | Trabalhar com structs, arrays e mapas no Apache Spark. |
| Funções de ordem superior | Transformar matrizes e mapas usando funções de ordem superior integradas. |