當您在查詢上啟用 staging 時,Dataflow Gen2 會將中繼結果寫入內部暫存 Lakehouse,讓引擎能使用 Fabric 計算資源進行轉換,或將資料載入目的地。
在資料流尺度設定中的 分階段資料 區塊,讓你可以調整該管線的兩個面向:
- 最佳化複寫到 Lakehouse — 使用更快速的路徑,將暫存資料寫入 Fabric Lakehouse 資料目的地。
- 啟用 V-Order 壓縮 — 對寫入 Staging Lakehouse 的資料施加 V-Order 壓縮。
這兩個選項都適用於資料流層級,且僅在 Dataflow Gen2 生效。
在哪裡找到設定
- 在 Power Query 編輯器中開啟你的資料流。
- 從選單中選擇 選項 。
- 前往 比例 分頁。
- 這兩個設定都在 Staged Data 下列出。
優化版副本至 Lakehouse
當此選項開啟時,Dataflow Gen2 會對以下查詢使用優化的資料移動路徑:
- 啟用預備狀態,並且
- 寫入至 Fabric Lakehouse 資料目的端。
在預設路徑中,資料會從暫存倉庫流向 Lakehouse,並經過額外的序列化和網路跳轉。 優化路徑減少了這些跳躍,能大幅縮短 Lakehouse 中分階段重資料流的刷新時間。
關於此選項刷新時間與 CU 消耗影響的量度範例,請參閱 Dataflow Gen2 成本與效能基準中的 情境三:優化複製至 Lakehouse 。
何時使用它
當你在執行最終落入 Fabric Lakehouse 資料目的地的查詢時,開啟此功能。 分階段在以下情況下最為有用:
- 你的查詢包含了不會折疊到原始碼的轉換。
- 你要依賴 Fabric 的暫存運算(Lakehouse 或 Warehouse)來執行繁重操作,例如加入、群組或過濾,然後再寫入目的地。
關於分階段何時有效,請參閱 Dataflow Gen2 最佳效能最佳實務。
預設行為
預設是關閉這個選項。 對於大多數分階段資料並寫入 Fabric Lakehouse 的資料流來說,開啟這個選項是有幫助的。
Considerations
- 此選項僅適用於啟用暫存且寫入 Fabric Lakehouse 資料目的地的查詢。 對於寫入其他目的地(Fabric Warehouse、Fabric SQL 資料庫、Azure SQL、Snowflake、KQL、Azure Data Lake Storage Gen2、檔案目的地)的查詢,這個選項不會生效。
- 如果你關閉查詢的預備,優化的複製路徑就不會套用在該查詢上。
- 此選項適用於資料流中所有合格查詢。 目前不支援針對個別查詢進行覆寫。
啟用 V-Order 壓縮
V-Order 是一種針對 Parquet 檔案格式的寫入時間優化,能提升下游 Fabric 引擎的讀取效能,但代價是寫入過程中會增加 CPU。 關於背景及跨引擎指引,請參閱 Delta Lake 表格優化及 V-Order 與 跨工作負載表格維護與優化。
當此選項開啟時,Dataflow Gen2 會對寫入 暫存 Lakehouse 的資料進行 V-Order 壓縮。 停用時,暫存資料會在不使用 V-Order 的情況下寫入。
何時開啟或關閉V-Order以進行分階段
暫存 Lakehouse 會存放僅供 Dataflow Gen2 本身使用的中繼資料:資料流會在同一次重新整理期間重新讀取暫存資料,以套用進一步的轉換或寫入目標;而當其他項目查詢資料流的輸出時,Dataflow 連接器也會從暫存資料中讀取資料。 終端使用者的查詢引擎(Power BI Direct Lake、Fabric Warehouse、SQL Analytics Endpoint、Spark)不會直接讀取 Lakehouse 的暫存。 這些情境反而適用於你的 Lakehouse 資料目的地。 如需目的地相關指引,請參閱 在 Lakehouse 目的地上啟用 V-Order 壓縮。
由於暫存資料通常在同一次重新整理期間內讀取次數不多,針對暫存關閉 V-Order 是大多數資料流的不錯選擇。 跳過 V-Order 可減少 CPU 寫入時間並縮短刷新時間,尤其適用於大型暫存寫入。 如果資料流的暫存輸出會透過 Dataflow 連接器被多次取用,且你想優先考量這些下游查詢的讀取效能,而非暫存寫入成本,請考慮為暫存將 V-Order 設為開啟。
預設行為
這個選項 預設是開啟的。 請參考上述指引,決定什麼最適合你的資料流。
V-Order 也適用於哪些地方
除了控制 Lakehouse 暫存的資料流層級設定外,V-Order 也可以透過啟用 V-Order 壓縮 進階選項,直接控制 Lakehouse 資料目的地連線本身。 該設定控制寫入目的地 Lakehouse 的資料是否被 V-Order 壓縮。 目的地是 Direct Lake、Fabric Warehouse、SQL 分析端點和 Spark 所讀取的表面資料,因此目的地層級的指引是基於情境的。
關於目的地層級選項的詳細資訊,請參見 「在 Lakehouse 目的地啟用 V-Order 壓縮」。