Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Azure Databricks verfügt über integrierte Schlüsselwortbindungen für alle Datenformate, die nativ von Apache Spark unterstützt werden. Azure Databricks verwendet Delta Lake als Standardprotokoll zum Lesen und Schreiben von Daten und Tabellen, während Apache Spark Parquet verwendet. Die folgenden Abschnitte beschreiben die verfügbaren Optionen und Konfigurationen, wenn Sie jedes Datenformat auf Azure Databricks abfragen.
Die meisten Formate unterstützen die Schreibkomprimierung über die compression Option. Für die unterstützten Werte für jedes Format siehe DataFrameWriter Optionen. Azure Databricks können auch direkt komprimierte Dateien in vielen Formaten lesen, und Sie können komprimierte Dateien bei Bedarf auf Azure Databricks entzippen.
Weitere Informationen zu Apache Spark-Datenquellen finden Sie unter Generische Funktionen zum Laden/Speichern und Generische Optionen für Dateiquellen.
offene Tabellenformate
Tabellenformate, die ACID-Transaktionen, Schema-Entwicklung und Interoperabilität zwischen Engines unterstützen.
| Format | Description |
|---|---|
| Delta-See | Das Standardformat zum Lesen und Schreiben von Daten und Tabellen auf Azure Databricks. |
| Eisberg | Lesen und schreiben Sie Eisberg-Tabellen und arbeiten Sie mit externen Eisberg-Engines zusammen. |
| OpenSharing | Lesen Sie gemeinsam genutzte Tabellen und Daten mit dem Open-Sharing-Protokoll. |
Spaltenformate
Binär-Spaltenformate, optimiert für analytische Leseleistung und Kompression.
| Format | Description |
|---|---|
| Parquet | Das Spaltenformat, das Apache Spark standardmäßig verwendet, mit effizienter Kompression und Codierung. |
| ORK | Ein Spaltenformat mit integrierter Kompression und Unterstützung für leichte Indizes. |
Textbasierte Formate
Menschenlesbare Formate für Datenaustausch, Konfiguration und Aufzeichnungen mit flexiblen oder sich ändernden Schemata.
| Format | Description |
|---|---|
| JSON | Lesen und schreiben Sie JSON-Dateien, einschließlich Optionen für Mehrzeilendatensätze und Schema-Inferenz. |
| CSV | Lesen und Schreiben von durch Trennzeichen begrenzten Textdateien mit Optionen für Kopfzeilen, Trennzeichen und fehlerhafte Datensätze. |
| XML | Lesen und schreiben Sie XML-Dateien, indem Sie das Zeilen-Tag und das Schema angeben. |
| Text | Textdateien im Nurtextformat Zeile für Zeile oder Datei für Datei lesen und schreiben. |
Binär- und spezialisierte Formate
Binäre Serialisierungsformate und Azure Databricks-spezifische Datenquellen.
| Format | Description |
|---|---|
| Avro | Lesen und schreiben Sie Avro-Dateien und arbeiten Sie mit Avro-codierten Payloads im Streaming. |
| MLflow-Experiment | MLflow-Experiment laden und Daten mit dem benutzerdefinierten mlflow-experiment Schlüsselwort ausführen. |
Unstrukturierte Daten
Formate und Typen zur Speicherung und Verarbeitung von Dokumenten, Bildern, Audiodateien und anderen unstrukturierten Dateien.
| Format | Description |
|---|---|
| Arbeit mit unstrukturierten Daten | Speichern, verwalten und verarbeiten unstrukturierte Daten wie Dokumente, Bilder und Audio. |
| Binär | Lesen Sie Dateien als rohe Binärdatensätze, einschließlich Bilder und anderer unstrukturierter Daten. |
| Bild | Lade Bilddaten für Machine-Learning-Workloads. Databricks empfiehlt, Bilder als binary Daten zu laden. |
| DATEI | Speichern Sie eine verwaltete Referenz für eine unstrukturierte Datei, anstatt BINARY oder STRING zu verwenden. |
| Dateien als FILE-Typ eintragen | Unstrukturierte Dateien mit SQL, tabellenwertigen Funktionen und Auto Loader als FILE-Referenzen in Tabellen einlesen. |
| Dateien mit UDFs bearbeiten | Lesen Sie Dateibytes, extrahieren Sie Bild- und Videometadaten und generieren Sie abgeleitete Dateien mit UDFs. |
| Schnellstart für FILE-Funktionen | Beginnen Sie mit dem FILE Typ und seinen Funktionen in Databricks SQL und Databricks Runtime. |
Teilweise strukturierte Daten
Muster und Funktionen zur Arbeit mit verschachtelten und semistrukturierten Daten im Seehaus.
| Format | Description |
|---|---|
| Modelliere semistrukturierte Daten | Wähle zwischen Varianten, JSON-Strings, Structs und Maps zur Speicherung halbstrukturierter Daten. |
| Variant | Speichern Sie semistrukturierte Daten mit dem Typ VARIANT für optimierte Lese- und Schreibvorgänge. |
| Transformieren komplexer Datentypen | Arbeiten Sie mit Strukturen, Arrays und Karten in Apache Spark. |
| Funktionen höherer Ordnung | Transformieren Sie Arrays und Maps mit eingebauten höherwertigen Funktionen. |