這很重要
這項功能目前處於 公開預覽版。
AI Runtime 是 Databricks 提供的無伺服器 GPU 運算產品,專為 深度學習 工作負載設計。 你可以使用 AI Runtime 訓練並微調自訂模型,使用你喜愛的框架,獲得最先進的效率、效能與品質。
開始
利用我們的快速入門指南,幾分鐘內完成你的第一個工作負載。
| 開始 | 描述 |
|---|---|
| 🚀 Databricks CLI 快速入門 | 是從 Slurm 或 Kubernetes 叢集來的嗎? 直接在終端機中使用 AI 執行環境進行訓練,幾分鐘內即可完成。 |
| 📓 筆記本快速入門 | 幾秒鐘內將筆電連接到 GPU,並互動式開發。 |
| ⚡ Ray | 來自射線星團? 在 AI Runtime 上執行 Ray,並支援儀表板。 |
| 🧭 概述 | 兩分鐘內了解 AI 執行環境的關鍵資訊:可用的 GPU、運作方式以及限制。 |
功能
AI Runtime 是一個全端 GPU 平台,具備多種連接 GPU 的方式、內建可觀察性與除錯工具,以及預先建置的環境。
連接無伺服器 GPU:無論你工作地點,都能接觸到無伺服器 GPU。
| Feature | 描述 |
|---|---|
| Notebooks | 將筆記型電腦連接到無伺服器 GPU 運算,互動式開發,無需叢集設置。 |
| 透過 SSH 使用 IDE | 從你的 IDE 或終端機透過 SSH 隧道直接連接 GPU 節點。 |
| Databricks CLI | 從筆電提交並管理分散式 GPU 訓練工作,使用 YAML 工作設定。 |
| Ray | 在無伺服器 GPU 運算上執行 Ray Core、Ray Data、Ray Train 和 Ray Tune。 |
管理相依項:控制工作負載執行時所使用的 Python 和系統程式庫。
| Feature | 描述 |
|---|---|
| 預建環境 | 從最簡的標準環境或預先載入機器學習框架的 Databricks AI 環境開始。 |
將資料載入 GPU:有效率地將訓練資料傳送給 GPU。
| Feature | 描述 |
|---|---|
| 高效資料載入器 | 從 Unity Catalog 磁碟區串流處理資料,使用專為高 GPU 使用率打造的容錯載入器。 |
除錯與可觀察性:追蹤實驗、檢查輸出並診斷故障。
| Feature | 描述 |
|---|---|
| 用於深度學習的 MLflow | 用 MLflow 追蹤實驗、指標和運行。 |
| 日誌檢視器 | 在程式碼執行時查看訓練輸出並監控 GPU 資源使用。 |
| 使用代理程式除錯 | 使用 Genie Code 來產生訓練程式碼、解決環境問題及除錯 GPU 故障。 |
排程與即時服務:從互動式開發轉向排程工作與端點。
| Feature | 描述 |
|---|---|
| 生產化你的工作 | 部署使用宣告式自動化套件的訓練程式碼、排程執行,並建立多工 GPU 與 CPU 工作流程。 |
| 服務你的模特兒 | 使用 Model Serving,透過可擴充的端點部署您訓練完成的模型。 |
Examples
複製端對端範例,並在幾分鐘內透過 CLI 或在筆記本中於 AI Runtime 上執行。
| Example | 描述 |
|---|---|
| 經典機器學習 | GPU 加速的 XGBoost、零樣本表格預測及時間序列預測。 |
| 推薦系統 | 訓練深度學習推薦模型,例如雙塔架構。 |
| 電腦視覺 | GPU 上的物件偵測與影像分類工作負載。 |
| 訓練後的開源模型(LLM) | 使用 LoRA、完整微調,以及 TRL、Unsloth 和 Axolotl 等程式庫,對開源大型語言模型進行微調與後續訓練。 |
| 批次推論 | 在多個 GPU 上執行大規模批次推論,使用 Ray Data 和 vLLM。 |
| 多GPU分散式訓練 | 利用 DDP、FSDP 和 DeepSpeed 將訓練擴展到多個 GPU 和節點。 |
Guides
以任務為重點的教學,教你如何將工作負載遷移到 AI 執行環境,並最大化你的 GPU 效能。
| Guide | 描述 |
|---|---|
| 從斯勒姆遷移 | 將你的 Slurm 批次腳本、分散式啟動器和共享儲存映射到 Databricks 的 CLI。 |
| 遷移經典 GPU 工作負載 | 將現有的深度學習工作負載從經典 Databricks 叢集轉移到 AI 執行環境。 |
| 績效與韌性 | 提升訓練產出,並讓長期執行的工作更具韌性,抵抗失敗。 |
瞭解更多資訊
尋找有用內容:最新產品更新以及 AI 執行環境的運作方式。
| Resource | 描述 |
|---|---|
| 產品更新 | 請參閱最新的 AI Runtime 產品更新與公告。 |
| AI 執行環境的運作原理 | 閱讀 Databricks 如何讓 GPU 在 AI 執行時中保持可靠性。 |