Dataflow Gen2 的暫存資料選項

當您在查詢上啟用 staging 時,Dataflow Gen2 會將中繼結果寫入內部暫存 Lakehouse,讓引擎能使用 Fabric 計算資源進行轉換,或將資料載入目的地。

在資料流尺度設定中的 分階段資料 區塊,讓你可以調整該管線的兩個面向:

  • 最佳化複寫到 Lakehouse — 使用更快速的路徑,將暫存資料寫入 Fabric Lakehouse 資料目的地。
  • 啟用 V-Order 壓縮 — 對寫入 Staging Lakehouse 的資料施加 V-Order 壓縮。

這兩個選項都適用於資料流層級,且僅在 Dataflow Gen2 生效。

在哪裡找到設定

  1. 在 Power Query 編輯器中開啟你的資料流。
  2. 從選單中選擇 選項 。
  3. 前往 比例 分頁。
  4. 這兩個設定都在 Staged Data 下列出。

選項對話框截圖,選取縮放標籤並標示階段資料區塊。

優化版副本至 Lakehouse

當此選項開啟時,Dataflow Gen2 會對以下查詢使用優化的資料移動路徑:

  • 啟用預備狀態,並且
  • 寫入至 Fabric Lakehouse 資料目的端。

在預設路徑中,資料會從暫存倉庫流向 Lakehouse,並經過額外的序列化和網路跳轉。 優化路徑減少了這些跳躍,能大幅縮短 Lakehouse 中分階段重資料流的刷新時間。

關於此選項刷新時間與 CU 消耗影響的量度範例,請參閱 Dataflow Gen2 成本與效能基準中的 情境三:優化複製至 Lakehouse 。

何時使用它

當你在執行最終落入 Fabric Lakehouse 資料目的地的查詢時,開啟此功能。 分階段在以下情況下最為有用:

  • 你的查詢包含了不會折疊到原始碼的轉換。
  • 你要依賴 Fabric 的暫存運算(Lakehouse 或 Warehouse)來執行繁重操作,例如加入、群組或過濾,然後再寫入目的地。

關於分階段何時有效,請參閱 Dataflow Gen2 最佳效能最佳實務。

預設行為

預設是關閉這個選項。 對於大多數分階段資料並寫入 Fabric Lakehouse 的資料流來說,開啟這個選項是有幫助的。

Considerations

  • 此選項僅適用於啟用暫存且寫入 Fabric Lakehouse 資料目的地的查詢。 對於寫入其他目的地(Fabric Warehouse、Fabric SQL 資料庫、Azure SQL、Snowflake、KQL、Azure Data Lake Storage Gen2、檔案目的地)的查詢,這個選項不會生效。
  • 如果你關閉查詢的預備,優化的複製路徑就不會套用在該查詢上。
  • 此選項適用於資料流中所有合格查詢。 目前不支援針對個別查詢進行覆寫。

啟用 V-Order 壓縮

V-Order 是一種針對 Parquet 檔案格式的寫入時間優化,能提升下游 Fabric 引擎的讀取效能,但代價是寫入過程中會增加 CPU。 關於背景及跨引擎指引,請參閱 Delta Lake 表格優化及 V-Order 與 跨工作負載表格維護與優化。

當此選項開啟時,Dataflow Gen2 會對寫入 暫存 Lakehouse 的資料進行 V-Order 壓縮。 停用時,暫存資料會在不使用 V-Order 的情況下寫入。

何時開啟或關閉V-Order以進行分階段

暫存 Lakehouse 會存放僅供 Dataflow Gen2 本身使用的中繼資料:資料流會在同一次重新整理期間重新讀取暫存資料,以套用進一步的轉換或寫入目標;而當其他項目查詢資料流的輸出時,Dataflow 連接器也會從暫存資料中讀取資料。 終端使用者的查詢引擎(Power BI Direct Lake、Fabric Warehouse、SQL Analytics Endpoint、Spark)不會直接讀取 Lakehouse 的暫存。 這些情境反而適用於你的 Lakehouse 資料目的地。 如需目的地相關指引,請參閱 在 Lakehouse 目的地上啟用 V-Order 壓縮。

由於暫存資料通常在同一次重新整理期間內讀取次數不多,針對暫存關閉 V-Order 是大多數資料流的不錯選擇。 跳過 V-Order 可減少 CPU 寫入時間並縮短刷新時間,尤其適用於大型暫存寫入。 如果資料流的暫存輸出會透過 Dataflow 連接器被多次取用,且你想優先考量這些下游查詢的讀取效能,而非暫存寫入成本,請考慮為暫存將 V-Order 設為開啟。

預設行為

這個選項 預設是開啟的。 請參考上述指引,決定什麼最適合你的資料流。

V-Order 也適用於哪些地方

除了控制 Lakehouse 暫存的資料流層級設定外,V-Order 也可以透過啟用 V-Order 壓縮 進階選項,直接控制 Lakehouse 資料目的地連線本身。 該設定控制寫入目的地 Lakehouse 的資料是否被 V-Order 壓縮。 目的地是 Direct Lake、Fabric Warehouse、SQL 分析端點和 Spark 所讀取的表面資料,因此目的地層級的指引是基於情境的。

關於目的地層級選項的詳細資訊,請參見 「在 Lakehouse 目的地啟用 V-Order 壓縮」。