Fabric 環境中的 Spark 計算組態設定

Microsoft Fabric 資料工程師和資料科學體驗可在完全受控的 Spark 計算平台上運作。 預設情況下,工作空間中的所有 Spark 工作共享相同的池和資源設定,但不同的工作負載通常有不同的需求。 輕量級資料轉換不需要像大型機器學習工作那樣的驅動記憶體。

Fabric 環境讓你能依工作負載調整 Spark 運算設定,讓每個筆記本或 Spark 工作定義都能以正確的執行時版本、池和驅動程式/執行器大小執行,而不必改變整個工作區的預設值。

配置工作區層級的運算設定

工作區管理員控制環境項目是否能覆蓋工作區預設的計算設定。 關閉物品層級自訂,確保工作區的資源使用一致。 啟用此功能讓會員與貢獻者能靈活調整個別工作負載的運算。

  1. 在瀏覽器中,前往 Fabric 入口網站的 Fabric 工作區。

  2. 選取工作區設定。

  3. 選擇 資料工程/科學,然後選擇 Spark 設定。

  4. 選擇 「泳池 」標籤。

  5. 將「自訂項目計算設定」切換開啟。

    截圖顯示工作區設定中項目層級的計算自訂選項。

    當此切換開啟時,成員與貢獻者可在 Fabric 環境中更改會話層級的計算設定。 關閉時,環境項目中的 計算 區段會被停用,所有 Spark 工作都會使用工作區的預設池。

  6. 選取 [儲存]。

在環境中配置運算

在工作區管理員啟用項目層級自訂後,你可以在環境項目中設定計算設定。 這包括選擇 Spark 執行時、選擇池,以及調整驅動程式和執行器資源。

選擇 Spark 執行環境

  1. 打開你的環境項目。

  2. 在 「Home」 索引標籤中,選擇 執行時期 的下拉選單,並從中選擇執行版本。

    螢幕擷取畫面顯示如何選取環境的執行階段版本。

每個 Spark 執行時 都有自己的預設設定和預裝套件。

這很重要

  • 執行時的變更只有在你儲存並發佈環境後才會生效。
  • 如果現有函式庫或計算設定與所選執行環境不相容,發佈就會失敗。 移除或更新不相容的設定,然後再發佈。
  • 關於逐步發佈的說明,請參見 「儲存並發佈變更」。

選擇池並調整運算屬性

  1. 打開環境,然後進入 計算 區塊。

  2. 在 環境池中,選擇起始池或由你工作區管理員建立的自訂池。

    螢幕擷取畫面,顯示在環境 [計算] 區段中選取集區的位置。

  3. 請使用 計算 頁面的下拉選單來設定所選池的會話層級 Spark 屬性。 可用值取決於池的節點大小。

    這張截圖顯示了環境 Compute 區塊中計算屬性下拉選單。

    屬性包括:

    • 火花驅動核心 – 分配給火花驅動核心的數量。
    • 火花驅動器記憶體 – 分配給火花驅動器的記憶體量。
    • Spark 執行器核心- 每個執行器分配的核心數量。
    • Spark 執行器記憶體 – 分配給每個執行器的記憶體量。

關於可用池大小與資源限制的詳細資訊,請參見 Fabric 中的 Spark 運算。

備註

Spark 屬性是透過 spark.conf.set 控制應用層級參數設定,與此處描述的環境運算設定無關。