機器學習實驗與模型的 Git 整合與部署流程(預覽)

Microsoft Fabric 中的機器學習實驗與模型可與 Git 整合及部署流程。 這些功能追蹤並推廣實驗與模型的元資料,而實驗執行與模型版本則保留在工作空間儲存中,不會進行版本化或推廣。

關於更廣泛發布流程的概述,請參閱 Microsoft Fabric 中的生命週期管理是什麼?

這很重要

這項功能目前處於預覽階段。

機器學習實驗和模型 Git 整合

機器學習 (ML) 實驗和模型包含中繼資料和資料。 機器學習實驗包含 runs,而機器學習模型包含 model versions。 從開發工作流程的角度來看, 筆記本 可能會參考機器學習實驗或模型。

資料不會儲存在 Git 裡;只有工件元資料會被追蹤。 預設情況下,透過 Git 同步與更新流程管理機器學習實驗和模型,但experiment runsmodel versions不會在 Git 中追蹤或設定版本。 他們的資料仍存放在工作區的儲存空間中。 當 Fabric 以可攜式邏輯 ID 表示支援的相依性參考時,這些參考可能會跨工作區繫結。 綁定行為取決於物品類型和參考格式。

生命週期流程

  1. Git 整合會序列化實驗與模型的元資料,使其能夠同步與版本管理。
  2. Git 同步是在連接的儲存庫與工作區之間套用元資料變更。
  3. 部署管線促進開發、測試與生產工作區間支援的工件元資料。
  4. 實驗執行和模型版本會留在工作空間儲存中,且不包含在任何同步路徑中。

Git 表示法

一個連接 Git 的工作空間用於機器學習實驗與模型,會序列化並追蹤以下資訊:

  • 顯示名稱。
  • 版本。 欄位 version 用來識別原始碼控制系統檔案格式的版本。 它不是機器學習模型的版本。
  • 邏輯識別。 這個logicalId值是自動產生的跨工作空間識別碼,Fabric 用來將項目與其來源控制表示關聯起來。 欲了解更多資訊,請參閱 Fabric 中的邏輯識別碼。
  • 相依性。 受支援的相依性參考可能會跨透過 Git 連線的工作區進行繫結。 繫結取決於項目類型和參考格式。 保留工作區特定 ID 的參考可能需要手動更新或參數化。

這很重要

目前只有機器學習實驗和模型成品檔案的中繼資料會在 Git 中受到追蹤。 實驗執行和模型版本(執行輸出和模型資料)不會儲存在 Git 中,也不會在 Git 中進行版本控制;其資料仍保留在工作區儲存體中。

Git 整合功能

下列功能可供使用:

  • 將 ML 實驗與模型成品檔的中繼資料序列化為由 Git 追蹤的 JSON 格式表示。
  • 支援連結到同一個 Git 分支的多個工作區,使追蹤的元資料能夠跨工作區同步。 每個工作區一次只能連接一個分支。
  • 允許直接套用更新或透過提取要求控制更新,以管理上游和下游工作區/分支之間的變更。
  • 在 Git 中追蹤實驗和模型的重新命名,以保留跨工作區的身分識別。
  • 不會對 experiment runs 或 採取 model versions任何動作;其資料會保留在工作區儲存體中,且不會被 Git 儲存或覆寫。

部署管線中的機器學習實驗和模型

Microsoft Fabric 部署管線支援機器學習(ML)實驗與模型。 它們幫助你區分開發、測試和生產環境。 如需指引,請參閱 生命週期管理的最佳實務。

這很重要

部署管線目前僅部署支援的機器學習實驗與模型元資料。 實驗執行和模型版本都不是部署管線的承載資料。 中繼資料部署不會同步或覆寫其資料。

機器學習實驗與模型部署管線整合能力:

  • 支援跨開發、測試和生產工作區部署 ML 實驗和模型。
  • 部署僅同步支援的工件元資料。 experiment runs 和 model versions 不會在工作區之間同步。
  • 當實驗和模型包含在部署管線中時,對其進行的重新命名會同步到各個工作區。
  • 在管線部署期間,筆記本、實驗和模型之間受支援的相依性參考可能會在不同工作區之間繫結。 繫結取決於項目類型和參考格式。