AI 運行環境

這很重要

這項功能目前處於 公開預覽版。

AI Runtime 是 Databricks 提供的無伺服器 GPU 運算產品,專為 深度學習 工作負載設計。 你可以使用 AI Runtime 訓練並微調自訂模型,使用你喜愛的框架,獲得最先進的效率、效能與品質。

開始

利用我們的快速入門指南,幾分鐘內完成你的第一個工作負載。

開始 描述
🚀 Databricks CLI 快速入門 是從 Slurm 或 Kubernetes 叢集來的嗎? 直接在終端機中使用 AI 執行環境進行訓練,幾分鐘內即可完成。
📓 筆記本快速入門 幾秒鐘內將筆電連接到 GPU,並互動式開發。
⚡ Ray 來自射線星團? 在 AI Runtime 上執行 Ray,並支援儀表板。
🧭 概述 兩分鐘內了解 AI 執行環境的關鍵資訊:可用的 GPU、運作方式以及限制。

功能

AI Runtime 是一個全端 GPU 平台,具備多種連接 GPU 的方式、內建可觀察性與除錯工具,以及預先建置的環境。

連接無伺服器 GPU:無論你工作地點,都能接觸到無伺服器 GPU。

Feature 描述
Notebooks 將筆記型電腦連接到無伺服器 GPU 運算,互動式開發,無需叢集設置。
透過 SSH 使用 IDE 從你的 IDE 或終端機透過 SSH 隧道直接連接 GPU 節點。
Databricks CLI 從筆電提交並管理分散式 GPU 訓練工作,使用 YAML 工作設定。
Ray 在無伺服器 GPU 運算上執行 Ray Core、Ray Data、Ray Train 和 Ray Tune。

管理相依項:控制工作負載執行時所使用的 Python 和系統程式庫。

Feature 描述
預建環境 從最簡的標準環境或預先載入機器學習框架的 Databricks AI 環境開始。

將資料載入 GPU:有效率地將訓練資料傳送給 GPU。

Feature 描述
高效資料載入器 從 Unity Catalog 磁碟區串流處理資料,使用專為高 GPU 使用率打造的容錯載入器。

除錯與可觀察性:追蹤實驗、檢查輸出並診斷故障。

Feature 描述
用於深度學習的 MLflow 用 MLflow 追蹤實驗、指標和運行。
日誌檢視器 在程式碼執行時查看訓練輸出並監控 GPU 資源使用。
使用代理程式除錯 使用 Genie Code 來產生訓練程式碼、解決環境問題及除錯 GPU 故障。

排程與即時服務:從互動式開發轉向排程工作與端點。

Feature 描述
生產化你的工作 部署使用宣告式自動化套件的訓練程式碼、排程執行,並建立多工 GPU 與 CPU 工作流程。
服務你的模特兒 使用 Model Serving,透過可擴充的端點部署您訓練完成的模型。

Examples

複製端對端範例,並在幾分鐘內透過 CLI 或在筆記本中於 AI Runtime 上執行。

Example 描述
經典機器學習 GPU 加速的 XGBoost、零樣本表格預測及時間序列預測。
推薦系統 訓練深度學習推薦模型,例如雙塔架構。
電腦視覺 GPU 上的物件偵測與影像分類工作負載。
訓練後的開源模型(LLM) 使用 LoRA、完整微調,以及 TRL、Unsloth 和 Axolotl 等程式庫,對開源大型語言模型進行微調與後續訓練。
批次推論 在多個 GPU 上執行大規模批次推論,使用 Ray Data 和 vLLM。
多GPU分散式訓練 利用 DDP、FSDP 和 DeepSpeed 將訓練擴展到多個 GPU 和節點。

Guides

以任務為重點的教學,教你如何將工作負載遷移到 AI 執行環境,並最大化你的 GPU 效能。

Guide 描述
從斯勒姆遷移 將你的 Slurm 批次腳本、分散式啟動器和共享儲存映射到 Databricks 的 CLI。
遷移經典 GPU 工作負載 將現有的深度學習工作負載從經典 Databricks 叢集轉移到 AI 執行環境。
績效與韌性 提升訓練產出,並讓長期執行的工作更具韌性,抵抗失敗。

瞭解更多資訊

尋找有用內容:最新產品更新以及 AI 執行環境的運作方式。

Resource 描述
產品更新 請參閱最新的 AI Runtime 產品更新與公告。
AI 執行環境的運作原理 閱讀 Databricks 如何讓 GPU 在 AI 執行時中保持可靠性。