Overview

Important

這項功能目前處於 公開預覽版。

AI Runtime 是 Databricks 針對 深度學習 工作負載的計算產品,並為 Databricks Serverless 提供 GPU 支援。 你可以使用 AI Runtime 訓練並微調自訂模型,使用你喜愛的框架,獲得最先進的效率、效能與品質。 關於 無伺服器運算 如何融入 Databricks 架構的概述,請參見 無伺服器工作區架構。

主要功能

AI 執行時結合了受管理的 GPU 基礎設施與為深度學習打造的執行環境:

  • 全託管 GPU 基礎設施:無伺服器、靈活存取 GPU,無需叢集配置、驅動程式選擇或自動擴展政策。
  • 專為深度學習設計的執行環境:選擇最小標準環境以最大化依賴彈性,或是預載流行機器學習框架的完整 AI 環境。
  • 原生整合於筆記本、工作、Unity Catalog 與 MLflow,實現無縫開發、資料存取與實驗追蹤。

硬體選項

所有 AI 執行時加速器都配置單一節點。 該節點上的 GPU 數量取決於加速器類型:

加速器 每個節點的 GPU 數 GPU 記憶體 最適合用於 分散式訓練
1xA10 1 24 GB 中小型機器學習與深度學習任務,如經典機器學習模型或微調較小語言模型 不支援(單一 GPU)
1xH100 1 80 GB 需要比 1 張 A10 所提供的 GPU 記憶體更多、但不需要多 GPU 分散訓練的工作負載,例如微調中型語言模型 不支援(單一 GPU)
8xH100 8 每張 GPU 80 GB 大型 AI 工作負載,包括訓練或微調大型模型,或執行進階深度學習任務 支援搭配 @distributed 使用 gpus=8 修飾器

提示

只有 8 台 H100 支援多 GPU 分散式訓練。 單GPU工作負載則根據你的機型需要的GPU記憶體,選擇 1xA10 或 1xH100 。

Databricks 建議在涉及深度學習、大規模經典工作負載或 GPU 的任何客製化模型訓練使用情境中使用 AI Runtime。

例如:

  • LLM 微調(LoRA、QLoRA、完整微調)
  • 電腦視覺(物體偵測、影像分類)
  • 基於深度學習的推薦系統
  • 增強式學習
  • 以深度學習為基礎的時間序列預測

需求

開始前,請確認您的工作空間符合以下要求:

  • 以下 Azure 支援區域之一的工作空間:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3
  • AI 執行時預覽必須透過工作區管理員設定啟用。 請參閱 管理 Databricks 預覽功能。

Limitations

規劃 AI 執行時工作負載時,請考慮以下限制:

  • AI Runtime 僅支援 A10 和 H100 加速器。
  • AI 執行環境不支援 FedRAMP High 或 DoD IL5 標準的 合規安全設定檔 。
  • AI 執行時排程工作不支援使用 環境 面板新增相依性。 建議在你的筆記本中使用 %pip install 透過程式安裝相依套件。
  • 對於 AI 執行時的排程工作,不支援與筆記本相關且不相容的套件版本自動恢復行為。
  • AI 執行時連線嘗試在互動筆記本 15 分鐘後終止,筆記本工作或 CLI 工作則在 24 小時後終止。 連接的筆記本會話與筆記本工作最多可持續兩天,CLI 工作則可持續長達 14 天。 對於長期執行的模型訓練工作,應實作檢查點,並在達到最大執行時間時重新啟動工作。
  • AI 執行環境提供按需存取 GPU 資源。 雖然這讓 GPU 取得更輕鬆且靈活,但有時區域容量有限或無法使用。
  • AI Runtime 在某些情況下會利用跨區域 GPU,特別是在需求高峰時。 使用時可能會產生出口成本,且跨區域網路連線在特定時間段可能受到限制。

連接 AI 執行環境

你可以透過筆記本、使用 SSH 隧道的 IDE 終端機、排程工作、Jobs API 以及宣告式自動化套件,互動式連接 AI 執行環境。 有關逐步說明,請參閱「 從筆記本連接 AI 執行環境」。

建立環境

AI 執行環境提供兩個受管型 Python 環境:一個是最小標準環境,另一個是功能完整的 Databricks AI 環境,預載了熱門機器學習框架如 PyTorch 和 Transformers。 關於選擇環境、快取行為、匯入自訂模組及已知限制的細節,請參見 「設定您的環境」。

提示

選擇 標準 環境以完全控制你的相依性堆疊,或選擇 Databricks AI 環境,跳過安裝像 PyTorch 和 Transformers 這類常見框架。

載入 AI 執行時的資料

了解 AI 執行時的資料存取運作方式,對於流暢的體驗至關重要。 詳情請參見 AI 執行時載入資料。

分散式訓練

AI Runtime 支援在連接的單一節點上,透過多個 GPU 進行分散式訓練。 使用 @distributed Python API 中的 serverless_gpu 裝飾器,你可以僅需極少設定,即可透過 PyTorch DDP、FSDP 或 DeepSpeed 啟動多 GPU 工作負載。 如需詳細資訊,請參閱 筆記本中的分散式訓練。

提示

先在單一 GPU 上驗證你的工作負載,再使用 @distributed 裝飾器擴展至 8xH100。

Ray 在 AI 執行環境上

AI 執行時支援 Ray 用於分散式 GPU 工作負載,包括 Ray Core、Ray Data、Ray Train 及 Ray Tune。 你可以在無伺服器 GPU 運算上執行單節點或多節點 Ray 工作,無需叢集設置。 詳情與範例請參見 Ray on AI Runtime。

實驗追蹤與可觀測性

關於 MLflow 整合、日誌檢視及 GPU 監控,請參見 實驗追蹤與可觀察性。 關於模型檢查點,請參見 「提升 AI Runtime 的訓練效能與韌性」。

生產化訓練工作負載

使用宣告式自動化套件部署 AI Runtime 工作負載,以執行您自己的訓練程式碼、建立結合 GPU 與 CPU 任務的多任務作業、排定管線,並將流程從開發推進至正式環境。 請參見 將訓練工作負載投入生產環境。

Genie Code 用於深度學習

Genie Code 能協助開發並排除 AI 執行環境下的深度學習工作負載。 它能產生分散式訓練程式碼、解決環境與相依性問題,並調查 GPU 與分散式工作負載故障。 請參見 「使用 Genie Code 搭配 AI 執行時間」。

Guides

關於從經典工作負載遷移、範例筆記本及故障排除,請參閱 AI 執行環境使用者指南。 若要將現有的 Slurm 訓練工作負載移至 AI 執行時,請參見「從 Slurm 遷移」。