Datenformatoptionen

Azure Databricks verfügt über integrierte Schlüsselwortbindungen für alle Datenformate, die nativ von Apache Spark unterstützt werden. Azure Databricks verwendet Delta Lake als Standardprotokoll zum Lesen und Schreiben von Daten und Tabellen, während Apache Spark Parquet verwendet. Die folgenden Abschnitte beschreiben die verfügbaren Optionen und Konfigurationen, wenn Sie jedes Datenformat auf Azure Databricks abfragen.

Die meisten Formate unterstützen die Schreibkomprimierung über die compression Option. Für die unterstützten Werte für jedes Format siehe DataFrameWriter Optionen. Azure Databricks können auch direkt komprimierte Dateien in vielen Formaten lesen, und Sie können komprimierte Dateien bei Bedarf auf Azure Databricks entzippen.

Weitere Informationen zu Apache Spark-Datenquellen finden Sie unter Generische Funktionen zum Laden/Speichern und Generische Optionen für Dateiquellen.

offene Tabellenformate

Tabellenformate, die ACID-Transaktionen, Schema-Entwicklung und Interoperabilität zwischen Engines unterstützen.

Format Description
Delta-See Das Standardformat zum Lesen und Schreiben von Daten und Tabellen auf Azure Databricks.
Eisberg Lesen und schreiben Sie Eisberg-Tabellen und arbeiten Sie mit externen Eisberg-Engines zusammen.
OpenSharing Lesen Sie gemeinsam genutzte Tabellen und Daten mit dem Open-Sharing-Protokoll.

Spaltenformate

Binär-Spaltenformate, optimiert für analytische Leseleistung und Kompression.

Format Description
Parquet Das Spaltenformat, das Apache Spark standardmäßig verwendet, mit effizienter Kompression und Codierung.
ORK Ein Spaltenformat mit integrierter Kompression und Unterstützung für leichte Indizes.

Textbasierte Formate

Menschenlesbare Formate für Datenaustausch, Konfiguration und Aufzeichnungen mit flexiblen oder sich ändernden Schemata.

Format Description
JSON Lesen und schreiben Sie JSON-Dateien, einschließlich Optionen für Mehrzeilendatensätze und Schema-Inferenz.
CSV Lesen und Schreiben von durch Trennzeichen begrenzten Textdateien mit Optionen für Kopfzeilen, Trennzeichen und fehlerhafte Datensätze.
XML Lesen und schreiben Sie XML-Dateien, indem Sie das Zeilen-Tag und das Schema angeben.
Text Textdateien im Nurtextformat Zeile für Zeile oder Datei für Datei lesen und schreiben.

Binär- und spezialisierte Formate

Binäre Serialisierungsformate und Azure Databricks-spezifische Datenquellen.

Format Description
Avro Lesen und schreiben Sie Avro-Dateien und arbeiten Sie mit Avro-codierten Payloads im Streaming.
MLflow-Experiment MLflow-Experiment laden und Daten mit dem benutzerdefinierten mlflow-experiment Schlüsselwort ausführen.

Unstrukturierte Daten

Formate und Typen zur Speicherung und Verarbeitung von Dokumenten, Bildern, Audiodateien und anderen unstrukturierten Dateien.

Format Description
Arbeit mit unstrukturierten Daten Speichern, verwalten und verarbeiten unstrukturierte Daten wie Dokumente, Bilder und Audio.
Binär Lesen Sie Dateien als rohe Binärdatensätze, einschließlich Bilder und anderer unstrukturierter Daten.
Bild Lade Bilddaten für Machine-Learning-Workloads. Databricks empfiehlt, Bilder als binary Daten zu laden.
DATEI Speichern Sie eine verwaltete Referenz für eine unstrukturierte Datei, anstatt BINARY oder STRING zu verwenden.
Dateien als FILE-Typ eintragen Unstrukturierte Dateien mit SQL, tabellenwertigen Funktionen und Auto Loader als FILE-Referenzen in Tabellen einlesen.
Dateien mit UDFs bearbeiten Lesen Sie Dateibytes, extrahieren Sie Bild- und Videometadaten und generieren Sie abgeleitete Dateien mit UDFs.
Schnellstart für FILE-Funktionen Beginnen Sie mit dem FILE Typ und seinen Funktionen in Databricks SQL und Databricks Runtime.

Teilweise strukturierte Daten

Muster und Funktionen zur Arbeit mit verschachtelten und semistrukturierten Daten im Seehaus.

Format Description
Modelliere semistrukturierte Daten Wähle zwischen Varianten, JSON-Strings, Structs und Maps zur Speicherung halbstrukturierter Daten.
Variant Speichern Sie semistrukturierte Daten mit dem Typ VARIANT für optimierte Lese- und Schreibvorgänge.
Transformieren komplexer Datentypen Arbeiten Sie mit Strukturen, Arrays und Karten in Apache Spark.
Funktionen höherer Ordnung Transformieren Sie Arrays und Maps mit eingebauten höherwertigen Funktionen.