AI 就緒

本文概述了在 Azure 中建立 AI 工作負載的組織流程。 本文提供針對大規模採用 AI 工作負載進行重要設計和程式決策的建議。 其著重於特定於 AI 的資源組織和連線指引。

顯示 AI 採用的 6 個階段的圖表:策略、計劃、準備、治理、安全、管理。

AI 治理

AI 治理需要適當的資源組織和原則管理,以確保安全、符合規範且符合成本效益的作業。 您必須建立明確的治理界限,以保護敏感數據並有效地控制 AI 資源存取。 方法如下:

  1. 為因特網面向和內部 AI 工作負載建立個別的管理群組。 管理團隊分離確立了外部(「線上」)與僅內部(「企業」)AI工作負載之間的關鍵資料治理界線。 此區隔可防止外部使用者存取敏感性內部商務數據,同時維護適當的訪問控制。 此方法符合Azure著陸區管理群組架構原則,並支援跨工作負載類型的政策繼承。

  2. 將 AI 特定原則套用至每個管理群組。 從平台著陸區加速器開始建立基線政策,並根據需要新增 Azure 原則 定義,適用於 Foundry、Foundry Tools、Azure AI 搜尋服務 及 Azure 虛擬機器。 原則強制執行可確保整個平台的統一 AI 治理,並減少手動合規性監督。

  3. 在工作負載特定的訂用帳戶內部署 AI 資源。 AI 資源必須繼承其工作負載管理群組的治理原則,而不是平臺訂用帳戶。 此區隔可防止平臺小組控制建立的開發瓶頸,並讓工作負載小組以適當的自主權運作。 在 Azure 登陸區環境中,將 AI 工作負載部署到工作負載登陸區訂閱。

AI 網路

AI 網路包含適用於 AI 工作負載的網路基礎結構設計、安全性措施和有效率的數據傳輸模式。 您必須實作適當的安全性控制和連線選項,以防止網路中斷並維持一致的效能。 方法如下:

  1. 為面對網路的 AI 工作負載啟用 Azure DDoS 防護。Azure DDoS 保護 保護您的 AI 服務免於分散式阻斷服務攻擊所造成的潛在中斷與停機。 虛擬網路層級的 DDoS 防護可防禦針對網路工作負載的流量洪流,並在攻擊期間維持服務可用性。

  2. 使用 Azure Bastion 保障對 AI 工作負載的營運存取。 使用跳板盒和 Azure Bastion 來保護對 AI 工作負載的操作存取,並防止管理介面直接暴露於網路。 此方法會為系統管理工作建立安全的閘道,同時維護 AI 資源的網路隔離。

  3. 為內部部署數據源選擇適當的連線能力。 將大量數據從內部部署來源傳輸到雲端環境的組織需要高頻寬連線,以支援 AI 工作負載效能需求。

    • Use Azure ExpressRoute 用於高容量資料傳輸。Azure ExpressRoute 提供專用連接,適用於大量資料、即時處理或需要穩定效能的工作負載。 ExpressRoute 包含 FastPath 功能,可藉由略過特定流量的 ExpressRoute 閘道來改善數據路徑效能。

    • Use Azure VPN 閘道 用於中等資料傳輸。Azure VPN 閘道 適用於中等資料量、不頻繁的資料傳輸,或需要公共網路存取時。 VPN 閘道 在較小資料集方面,與 ExpressRoute 相比,提供更簡易的設定和更高的成本效益。 針對 AI 工作負載使用適當的 拓撲和設計 ,包括跨單位連線的站對站 VPN,以及用於安全裝置存取的點對站 VPN。

AI 可靠性

AI 可靠性需要策略性區域放置和備援規劃,以確保一致的效能和高可用性。 組織必須解決模型裝載、數據位置及災害復原的問題,才能維護可靠的 AI 服務。 您需要規劃您的區域部署策略,以避免服務中斷並優化效能。 方法如下:

  1. AI 端點與多重區域。 生產環境中的 AI 工作負載通常至少會使用兩個區域,因為可用性和關鍵程度要求足以合理化所增加的成本與複雜性。 多區域部署可讓您在區域失敗期間更快速地故障轉移和復原。 區域部署時,實施 Azure API 管理 以在 AI 端點間平衡 API 請求。

  2. 在部署之前,請先確認目標區域中的 AI 服務可用性。 不同的區域提供不同層級的 AI 服務可用性和功能支援。 請依地區查詢Azure服務可用性,以確認您所需的 AI 服務是否可用。

  3. 評估區域配額限制和容量需求。 Foundry Tools 有區域訂閱限制,影響大規模模型部署與推論工作負載。 當您預期容量需求超過標準配額時,請主動聯繫 Azure 支援,以避免擴展過程中服務中斷。

  4. 優化資料配置以適應檢索增強生成工作負載。 數據儲存位置嚴重影響RAG案例中的應用程式效能。 將數據與相同區域中的 AI 模型共置可減少延遲,並改善數據擷取效率,不過跨區域組態仍適用於特定商務需求。

  5. 將重要的 AI 資產復寫至次要區域,以取得商務持續性。 商務持續性需要將微調的模型、RAG 數據集、定型模型和定型數據復寫至次要區域。 資產復寫可在中斷期間更快速地復原,並維護不同失敗案例的服務可用性。

Azure 著陸區的 AI

Azure著陸區是建議的起點,用來準備你的Azure環境。 它為平臺和應用程式資源提供預先定義的設定。 平台設置完成後,你可以將 AI 工作負載部署到專門的工作負載著陸區。

如果你的組織使用平台著陸區加速器,請像部署其他工作負載一樣,將 AI 工作負載部署到一般的工作負載著陸區。 請參考 Azure 著陸區的 AI。 下圖 2 說明 AI 工作負載如何在 Azure 著陸區內整合。

圖示顯示Azure著陸區內的 AI 工作負載。 圖 2。Azure降落區的人工智慧工作量。

下圖顯示了一個基線的概念性資源階層。 它利用管理群組來區分內部 AI 工作負載與面向網路的 AI 工作負載。 內部工作負載會使用政策來拒絕客戶的線上存取。 此區隔可保護內部數據不受外部用戶公開。 AI 開發應該使用 Jumpbox 來管理 AI 資源和數據。

此圖顯示內部和因特網面向 AI 工作負載的資源組織。 圖 3.AI 工作負載的基準資源階層。

下一步

下一個步驟是建置 AI 工作負載並將其部署至您的 AI 環境。 使用下列連結來尋找符合您需求的架構指引。 從平臺即服務 (PaaS) 架構開始。 PaaS 是 Microsoft 推薦採用 AI 的方法。