將輸出表分割,createcreateOrReplacereplace使用所給定的欄位或轉換來建立。 指定時,資料表資料會以這些值儲存,以達到高效率的讀取。
例如,當資料表按天分區時,它可能會儲存在如下目錄配置中:
table/day=2019-06-01/table/day=2019-06-02/
分割是優化物理資料配置最廣泛使用的技術之一。 它提供一個粗粒度索引,用於在查詢中對分割欄位有謂詞時跳過不必要的資料讀取。 為了讓分割效果良好,每欄中不同值的數量通常應該少於數萬個。
col 且 cols 僅支援以下轉換函數:
pyspark.sql.functions.yearspyspark.sql.functions.monthspyspark.sql.functions.dayspyspark.sql.functions.hourspyspark.sql.functions.bucket
語法
partitionedBy(col, *cols)
參數
| 參數 | 類型 | 說明 |
|---|---|---|
col |
柱或力量 | 第一個分割欄位或轉換。 |
*cols |
欄位或力量,選用 | 額外的分割欄位或轉換。 |
退貨
DataFrameWriterV2