什麼是 Azure Machine Learning 計算執行個體?

Azure Machine Learning 計算執行個體是提供資料科學家使用的完全受控雲端式工作站。 每個運算實例只有一個擁有者,但你可以在多個運算實例間共享檔案。

計算執行個體可讓您輕鬆地開始使用 Azure Machine Learning 開發,以及為 IT 系統管理員提供管理和企業就緒功能。

請在雲端中使用計算執行個體,做為已完整設定且完全受控的開發環境進行機器學習。 你也可以將運算實例作為訓練和推理的計算目標,用於開發和測試。

若要讓計算執行個體 Jupyter 功能能夠運作,請確定您未停用 Web 通訊端通訊。 確保您的網路允許與 *.instances.azureml.net 和 *.instances.azureml.ms 進行 Websocket 連線。

重要

本文中標示為 (預覽) 的項目目前處於公開預覽狀態。 此預覽版本會在沒有服務等級協定的情況下提供,不建議用於實際執行工作負載。 可能不支援特定功能,或可能已經限制功能。 如需詳細資訊,請參閱 Microsoft Azure 預覽版增補使用條款。

為何要使用計算執行個體?

計算執行個體是完全受控的雲端式工作站,並已針對機器學習開發環境進行最佳化。 它提供了下列優點:

重點優勢 描述
生產力 您可以在 Azure Machine Learning 工作室中,使用整合式筆記本和下列工具來建置及部署模型:
- Jupyter
- JupyterLab
- VS Code (預覽)
計算執行個體已與 Azure Machine Learning 工作區和工作室完全整合。 您可以與工作區中的其他資料科學家共用筆記本和資料。
受控且安全 降低您的安全性足跡,並提高對企業安全性要求的合規性。 計算執行個體提供健全的管理原則和安全的網路設定,例如:

- 使用 Resource Manager 範本或 Azure Machine Learning SDK 自動佈建
- Azure 角色型存取控制 (Azure RBAC)
- 虛擬網路支援
- 停用 SSH 存取的 Azure 原則
- 強制在虛擬網路中建立的 Azure 原則
- 根據排程的自動關機/自動啟動
- 已啟用 TLS 1.2
為 ML 預先配置 使用預先設定且最新的 ML 套件、深度學習架構、GPU 驅動程式,節省設定工作的時間。
可完全自訂 廣泛支援各種 Azure VM 類型 (包括 GPU) 和持續性的低層級自訂,例如安裝套件和驅動程式可讓您輕鬆地建置進階案例。 您也可以使用安裝指令碼來自動自訂

工具和環境

Azure Machine Learning 計算執行個體可讓您在工作區中以完全整合的筆記本體驗來撰寫、定型和部署模型。

您可以從 Azure Machine Learning 工作區、Jupyter、JupyterLab 或 Visual Studio Code 執行筆記本。 你可以設定 VS Code Desktop 來存取你的運算實例。 也能直接透過瀏覽器使用 VS Code 網頁版,且不需要任何必要安裝或相依性。

試試 VS Code for the Web,利用它提供的簡單整合與豐富的開發環境。 VS Code 網頁版提供許多您喜愛的 VS Code Desktop 功能,包括在瀏覽和編輯時進行搜尋和醒目提示語法。 如需使用 VS Code Desktop 和適用於 Web 的 VS Code 的詳細資訊,請參閱啟動與 Azure Machine Learning 整合的 Visual Studio Code (預覽) 和在遠端連線到計算執行個體的 VS Code 中工作 (預覽)。

您可以安裝套件,並將核心新增至計算執行個體。

下列工具和環境已安裝在計算執行個體上:

一般工具與環境 詳細資料
驅動程式 CUDA
cuDNN
NVIDIA
Blob FUSE
Intel MPI Library
Azure CLI
Azure Machine Learning 範例
Docker
Nginx
NCCL 2.0
Protobuf
R 工具與環境 詳細資料
R 核心

您在建立執行個體時,可以新增 RStudio 或 Posit Workbench (先前稱為 RStudio Workbench)。

PYTHON 工具與環境 詳細資料
蟒蛇 Python
Jupyter 和擴充功能
Jupyterlab 和擴充功能
Azure Machine Learning SDK
適用於來自 PyPI 的 Python
包含 azure-ai-ml 和許多常見的 Azure 額外套件。 若要查看完整清單,
請在計算執行個體上開啟終端機視窗並執行
conda list -n azureml_py310_sdkv2 ^azure
其他 PyPI 套件 jupytext
tensorboard
nbconvert
notebook
Pillow
Conda 套件 cython
numpy
ipykernel
scikit-learn
matplotlib
tqdm
joblib
nodejs
深度學習套件 PyTorch
TensorFlow
Keras
Horovod
MLFlow
pandas-ml
scrapbook
ONNX 套件 keras2onnx
onnx
onnxconverter-common
skl2onnx
onnxmltools
Azure Machine Learning Python 範例

計算執行個體的基底 OS 為 Ubuntu。

存取檔案

你工作空間在 Azure 檔案分享中的預設儲存帳號會儲存筆記本和 Python 腳本。 你可以在你的「使用者檔案」目錄中找到這些檔案。 此儲存體可讓您輕鬆地在計算執行個體之間共用筆記本。 當您停止或刪除計算執行個體時,儲存體帳戶也會讓您的筆記本安全地保留下來。

您工作區的 Azure 檔案共用會以磁碟機形式掛載到計算執行個體上。 此磁碟機是 Jupyter、Jupyter Labs、RStudio 和 Posit Workbench 的預設工作目錄。 這種設定意味著你在 Jupyter、JupyterLab、VS Code for Web、RStudio 或 Posit 中建立的筆記本和其他檔案會自動儲存在檔案分享中,並且也能在其他運算實例中使用。

同一工作區中的所有運算實例都能存取檔案分享中的檔案。 計算實例上這些檔案的任何變更都會可靠地保存回檔案共用。

您也可以將最新的 Azure Machine Learning 範例複製到工作區檔案共用中「使用者檔案」目錄下的資料夾。

在網路磁碟機上寫入小型檔案的速度,可能會比寫入至計算執行個體本機磁碟本身來得更慢。 如果您要撰寫許多小型檔案,請嘗試直接在計算執行個體上使用目錄,例如 /tmp 目錄。 請注意,計算實例上的檔案無法從其他計算實例存取。

請勿在筆記本檔案共用區上儲存訓練資料。 如需各種儲存資料選項的相關資訊,請參閱存取作業中的資料。

您可以在計算執行個體上使用 /tmp 目錄來儲存暫存資料。 不過,請勿在計算執行個體的 OS 磁碟上寫入大型資料檔案。 運算實例的作業系統磁碟容量為 120 GB。 你也可以將暫存訓練資料存放在掛載於 /mnt的臨時磁碟上。 暫存磁碟大小是根據所選的虛擬機器大小計算,若選擇較大容量的虛擬機,則可儲存更多資料。 你安裝的任何軟體套件都會儲存在計算實例的作業系統磁碟上。 請注意,目前作業系統磁碟不支援客戶管理的金鑰加密。 運算實例的作業系統磁碟以 Microsoft 管理的金鑰加密。

建立​​

要建立基本的運算實例,請參見 「建立你需要的資源以開始」。

如需其他選項,請參閱建立新的計算執行個體。

若您是系統管理員,可在工作區中為其他人建立計算執行個體。 你必須為這樣的運算實例停用單點登入(SSO)。

您也可以使用安裝指令碼,以自動化方式自訂和設定計算執行個體。

建立計算執行個體的其他方式:

適用於建立計算執行個體的每個區域、每個 VM 系列的專用核心配額,以及區域總配額,已統一並與 Azure Machine Learning 訓練計算叢集配額共用。 停止運算執行處理不會釋放配額,以確保您可以重新啟動運算執行處理。 請勿藉由執行 sudo 關機的方式,透過 OS 終端停止計算執行個體。

運算執行個體配有 P10 作業系統磁碟。 暫存磁碟類型取決於所選擇的 VM 大小。 目前你無法更改作業系統的磁碟類型。

運算目標

計算執行個體可作為訓練計算目標,如同 Azure Machine Learning 的訓練計算叢集。 但計算執行個體僅擁有單一節點,而計算叢集卻可以有更多節點。

重要

若要將 Compute 實例作為提交訓練工作(TrainingJobs)的計算目標,必須啟用該 Compute 實例的根權限。 這必須在建立 Compute 實例時完成。 如果沒有啟用根權限,你將無法將 Compute 實例作為訓練工作時的計算目標。

一個運算執行個體:

  • 具有作業佇列。
  • 在虛擬網路環境中安全地執行作業,而無須企業開啟 SSH 連接埠。 作業會在容器化環境中執行,並在 Docker 容器中封裝模型的相依性。
  • 您可平行執行多個小型作業。 每個 vCPU 可平行執行一個作業,其餘作業則會排入佇列。
  • 支援單一節點多 GPU 分散式訓練作業

您可以使用計算執行個體,作為測試/偵錯情境的本機推論部署目標。

提示

計算執行個體具有 120GB 的 OS 磁碟。 若您用盡磁碟空間並進入無法使用的狀態,請移除檔案/資料夾然後執行 sudo reboot,以透過計算執行個體終端,在 OS 磁碟 (掛接於 /) 上清除至少 5 GB 的磁碟空間。 重新啟動後將會釋放暫存磁碟;您不需要手動清除暫存磁碟上的空間。 如要存取終端,請移至計算清單頁面或計算執行個體詳細資訊頁面,然後按一下 [終端] 連結。 在終端機上執行 df -h 以檢查可用磁碟空間。 執行 sudo reboot 之前,請先清除至少 5 GB 的空間。 在清出 5 GB 的磁碟空間之前,請勿在 Studio 中停止或重新啟動運算執行個體。 如果 CI 磁碟已滿,自動關機 (包括已排程的啟動或停止,以及閒置關機) 將無法運作。