Important
這項功能目前處於 公開預覽版。
透過計費使用系統表追蹤 GPU 使用率與成本,尋找範例筆記本,並排除常見錯誤。
從斯勒姆遷移
如果你是從 Slurm 叢集而非傳統 Databricks 轉過來,請參考 「從 Slurm 遷移」 ,了解如何 sbatch將 、 、 分割 srun/torchrun區和共享檔案系統映射到 Databricks 的 CLI。
追蹤使用與成本
你可以透過查詢可計費使用系統表()system.billing.usage來監控你的 AI 執行時 GPU 支出。 以下查詢會回傳無伺服器 GPU 工作負載的總使用率:
SELECT
SUM(usage_quantity)
FROM
system.billing.usage
WHERE
product_features.serverless_gpu IS NOT NULL
欲了解更多可計費使用表架構,請參閱可計費使用系統資料表參考。
AI Runtime 對模型訓練 SKU 按 GPU 小時收費,價格如下:
- H100 隨選:每 GPU 小時 7.00 美元(美國東岸)
- A10 隨需求:每小時 4.90 美元/GPU(美國東部)
筆記本範例
以下範例筆記本類別可供你起步:
| 分類 | Description |
|---|---|
| 大型語言模型 (LLM) | 微調大型語言模型,包括參數效率方法(LoRA、QLoRA) |
| 電腦視覺 | 物件偵測、影像分類及其他 CV 任務 |
| 深度學習推薦系統 | 利用現代深度學習方法如雙塔模型建構推薦系統 |
| 經典機器學習 | 傳統機器學習任務包括 XGBoost 模型訓練與時間序列預測 |
| 多GPU分散式訓練 | 利用 Serverless GPU API 跨多 GPU 擴展訓練 |
完整清單請參見 AI 執行時範例筆記本。
Troubleshooting
Genie Code 能協助解決環境與相依性問題,並調查連接 AI 執行環境的筆記型電腦中 GPU 及分散式工作負載故障。 請參見 「使用 Genie Code 搭配 AI 執行時間」。
若要在計算端互動除錯,請使用網頁終端機執行 shell 指令、檢查 GPU 使用情況 nvidia-smi,並管理檔案。 當連接到無伺服器 GPU 環境 5 或更高版本時,該網頁終端可用。 請參閱在 Azure Databricks 網路終端機中執行 Shell 命令。
ValueError:numpy.dtype 大小已更改,可能表示二進位不相容。 預期從 C 標頭檔獲得 96,實際從 PyObject 獲得 88。
錯誤通常發生在編譯相依套件時所使用的 NumPy 版本與執行環境中目前安裝的 NumPy 版本不符。 這種不相容性通常是由於 NumPy 的 C API 的變化而發生的,從 NumPy 1.x 到 2.x 尤其明顯。 此錯誤表示筆記本中安裝的Python套件可能已變更NumPy版本。
推薦解決方案:
在運行時檢查 NumPy 版本並確保它與您的套件相容。 請參閱環境 4 與 環境 3 的 Serverless GPU Compute 發布說明,了解預先安裝的 Python 函式庫資訊。 如果您對不同版本的 NumPy 有相依性,請將該相依性新增至您的計算環境。
PyTorch 在安裝 torch 時找不到 libcudnn
當您安裝不同版本的 torch時,您可能會看到錯誤: ImportError: libcudnn.so.9: cannot open shared object file: No such file or directory。 這是因為 torch 只會在本機路徑中搜尋 cuDNN 函式庫。
推薦解決方案:
請在安裝--force-reinstall時重新安裝相依項目,並加入torch:
%pip install torch --force-reinstall