AI 執行時的使用者指南

Important

這項功能目前處於 公開預覽版。

透過計費使用系統表追蹤 GPU 使用率與成本,尋找範例筆記本,並排除常見錯誤。

從斯勒姆遷移

如果你是從 Slurm 叢集而非傳統 Databricks 轉過來,請參考 「從 Slurm 遷移」 ,了解如何 sbatch將 、 、 分割 srun/torchrun區和共享檔案系統映射到 Databricks 的 CLI。

追蹤使用與成本

你可以透過查詢可計費使用系統表()system.billing.usage來監控你的 AI 執行時 GPU 支出。 以下查詢會回傳無伺服器 GPU 工作負載的總使用率:

SELECT
  SUM(usage_quantity)
FROM
  system.billing.usage
WHERE
  product_features.serverless_gpu IS NOT NULL

欲了解更多可計費使用表架構,請參閱可計費使用系統資料表參考。

AI Runtime 對模型訓練 SKU 按 GPU 小時收費,價格如下:

  • H100 隨選:每 GPU 小時 7.00 美元(美國東岸)
  • A10 隨需求:每小時 4.90 美元/GPU(美國東部)

筆記本範例

以下範例筆記本類別可供你起步:

分類 Description
大型語言模型 (LLM) 微調大型語言模型,包括參數效率方法(LoRA、QLoRA)
電腦視覺 物件偵測、影像分類及其他 CV 任務
深度學習推薦系統 利用現代深度學習方法如雙塔模型建構推薦系統
經典機器學習 傳統機器學習任務包括 XGBoost 模型訓練與時間序列預測
多GPU分散式訓練 利用 Serverless GPU API 跨多 GPU 擴展訓練

完整清單請參見 AI 執行時範例筆記本。

Troubleshooting

Genie Code 能協助解決環境與相依性問題,並調查連接 AI 執行環境的筆記型電腦中 GPU 及分散式工作負載故障。 請參見 「使用 Genie Code 搭配 AI 執行時間」。

若要在計算端互動除錯,請使用網頁終端機執行 shell 指令、檢查 GPU 使用情況 nvidia-smi,並管理檔案。 當連接到無伺服器 GPU 環境 5 或更高版本時,該網頁終端可用。 請參閱在 Azure Databricks 網路終端機中執行 Shell 命令。

ValueError:numpy.dtype 大小已更改,可能表示二進位不相容。 預期從 C 標頭檔獲得 96,實際從 PyObject 獲得 88。

錯誤通常發生在編譯相依套件時所使用的 NumPy 版本與執行環境中目前安裝的 NumPy 版本不符。 這種不相容性通常是由於 NumPy 的 C API 的變化而發生的,從 NumPy 1.x 到 2.x 尤其明顯。 此錯誤表示筆記本中安裝的Python套件可能已變更NumPy版本。

推薦解決方案:

在運行時檢查 NumPy 版本並確保它與您的套件相容。 請參閱環境 4 與 環境 3 的 Serverless GPU Compute 發布說明,了解預先安裝的 Python 函式庫資訊。 如果您對不同版本的 NumPy 有相依性,請將該相依性新增至您的計算環境。

PyTorch 在安裝 torch 時找不到 libcudnn

當您安裝不同版本的 torch時,您可能會看到錯誤: ImportError: libcudnn.so.9: cannot open shared object file: No such file or directory。 這是因為 torch 只會在本機路徑中搜尋 cuDNN 函式庫。

推薦解決方案:

請在安裝--force-reinstall時重新安裝相依項目,並加入torch:

%pip install torch --force-reinstall