Microsoft Fabric 資料工程師和資料科學體驗可在完全受控的 Spark 計算平台上運作。 預設情況下,工作空間中的所有 Spark 工作共享相同的池和資源設定,但不同的工作負載通常有不同的需求。 輕量級資料轉換不需要像大型機器學習工作那樣的驅動記憶體。
Fabric 環境讓你能依工作負載調整 Spark 運算設定,讓每個筆記本或 Spark 工作定義都能以正確的執行時版本、池和驅動程式/執行器大小執行,而不必改變整個工作區的預設值。
配置工作區層級的運算設定
工作區管理員控制環境項目是否能覆蓋工作區預設的計算設定。 關閉物品層級自訂,確保工作區的資源使用一致。 啟用此功能讓會員與貢獻者能靈活調整個別工作負載的運算。
在瀏覽器中,前往 Fabric 入口網站的 Fabric 工作區。
選取工作區設定。
選擇 資料工程/科學,然後選擇 Spark 設定。
選擇 「泳池 」標籤。
將「自訂項目計算設定」切換開啟。
當此切換開啟時,成員與貢獻者可在 Fabric 環境中更改會話層級的計算設定。 關閉時,環境項目中的 計算 區段會被停用,所有 Spark 工作都會使用工作區的預設池。
選取 [儲存]。
在環境中配置運算
在工作區管理員啟用項目層級自訂後,你可以在環境項目中設定計算設定。 這包括選擇 Spark 執行時、選擇池,以及調整驅動程式和執行器資源。
選擇 Spark 執行環境
每個 Spark 執行時 都有自己的預設設定和預裝套件。
這很重要
- 執行時的變更只有在你儲存並發佈環境後才會生效。
- 如果現有函式庫或計算設定與所選執行環境不相容,發佈就會失敗。 移除或更新不相容的設定,然後再發佈。
- 關於逐步發佈的說明,請參見 「儲存並發佈變更」。
選擇池並調整運算屬性
打開環境,然後進入 計算 區塊。
在 環境池中,選擇起始池或由你工作區管理員建立的自訂池。
請使用 計算 頁面的下拉選單來設定所選池的會話層級 Spark 屬性。 可用值取決於池的節點大小。
屬性包括:
- 火花驅動核心 – 分配給火花驅動核心的數量。
- 火花驅動器記憶體 – 分配給火花驅動器的記憶體量。
- Spark 執行器核心- 每個執行器分配的核心數量。
- Spark 執行器記憶體 – 分配給每個執行器的記憶體量。
關於可用池大小與資源限制的詳細資訊,請參見 Fabric 中的 Spark 運算。
備註
Spark 屬性是透過 spark.conf.set 控制應用層級參數設定,與此處描述的環境運算設定無關。