使用擷取增強生成強化 AI 回應

Microsoft Copilot Studio 中的擷取增強生成 (RAG) 技術,結合了語言模型的推理能力與值得信賴的組織專屬知識。 這項技術可讓 Agent 根據企業內容產生準確、具情境相關性且有根據的回應,而不是單純仰賴模型記憶。

在本文中,您將學習如何:

  • 了解 RAG 如何提升 AI 的可靠性與根據性。
  • 說明 Copilot Studio 如何擷取並整合知識。
  • 識別支援的知識來源及其限制。
  • 了解治理、合規性及 AI 安全性考量。
  • 在企業環境中設計 Agent 時,套用 RAG 概念。

RAG 簡介

RAG 是一種設計模式,藉由結合兩項功能來提升 AI 的準確性:

  • 資訊擷取:搜尋企業資料來源。
  • 文字生成:使用語言模型整合擷取到的資訊。

這種做法可減少錯誤資訊、提升信任度,並產生根植於實際組織內容的回應。

Copilot Studio 中的 RAG 架構

Copilot Studio 的 RAG 管線建置於 Azure AI 服務之上,並與 Microsoft 的信任、合規性和安全性界限緊密整合。

核心元件:

  • Copilot Studio 執行階段:管理交談管線
  • 查詢最佳化引擎:重寫並解讀查詢
  • 搜尋提供者:Bing、SharePoint、Graph、Dataverse、Azure AI 搜尋服務
  • 摘要引擎:建立有根據且附有引文的回應
  • 審核層:驗證訊息和摘要
  • 狀態儲存區:短期記憶 (少於 30 天;不會用於訓練)
  • 遙測與意見反應儲存區:提供深入解析和監督機制

Copilot Studio RAG 工作流程圖,顯示訊息審核、查詢最佳化、擷取、摘要和驗證等步驟。

RAG 在 Copilot Studio 中的運作方式

Copilot Studio 中的 RAG 遵循四個步驟的流程:

  1. 查詢重寫
  2. 內容擷取
  3. 摘要與回應生成
  4. 安全性與治理驗證

1. 查詢重寫

Copilot Studio 會在搜尋前最佳化使用者的問題:

  • 釐清語意
  • 新增情境訊號 (最近 10 輪)
  • 改善關鍵字比對
  • 產生適合搜尋的查詢

這個程序可提升擷取品質,並減少不相關的結果。

2. 內容擷取

重寫查詢後,系統會依您設定的所有知識來源執行查詢。 Copilot Studio 會從每個來源取得前三筆結果,在相關性與效能之間取得平衡。 各知識來源的行為,會依驗證、索引、檔案格式和儲存體限制等因素而異。

下表彙總所有支援的知識來源及其功能、限制和驗證需求:

知識來源 描述 驗證 主要功能、限制與限定條件
公開資料 (網站) Bing 已建立索引的網站 無​​
  • 網站必須由 Bing 編製索引。
  • Bing 無法限制在特定地區。
  • 確認網站擁有權可獲得更好的結果。
  • 公開網站:子頁面深度上限為兩層 (/en/help/),不支援直接頁面。
  • Bing 自訂搜尋:一個設定識別碼,但可以使用公式設定;Azure 費用由 Microsoft 負擔;最多 400 個 URL;提供自訂排名選項;子頁面深度上限為兩層 (/en/help/);支援直接頁面。
SharePoint / OneDrive 內部企業內容 (僅限內部) Microsoft Entra ID 委派驗證
  • 需要使用者透過 Microsoft Entra ID 完成驗證,才能進行委派呼叫。
  • 系統會擷取相符的檔案 (上限 15 MB),以取得可摘要的詳細片段。
  • 安全性修剪:傳回的結果僅包含使用者具有讀取權限的內容。
  • 進階「增強型搜尋結果」功能對訊息使用租用戶 Microsoft Graph 資料錨定,提升結果品質並增加最大檔案大小 (200 MB)。
已上傳的檔案 上傳至 Dataverse 儲存體的檔案 無​​
  • 檔案 (上限 512 MB) 會儲存在 Dataverse 檔案儲存體中,每個 Agent 最多可有 500 個檔案。
  • 檔案會在 Dataverse 搜尋中建立索引,並可運用 PDF 中的影像/表格辨識功能。
  • 依預設,引文不會包含檔案連結,但可以透過自訂功能新增此連結。
Dataverse 資料表 結構化商務記錄 (僅限內部) Microsoft Entra ID 委派驗證
  • Dataverse 資料表 (上限 15 個) 可設定同義字和詞彙表,以改善搜尋效果。
  • 自然語言查詢會轉換為針對結構化資料的分析查詢。
Graph 連接器 已建立索引至 Microsoft Graph 的企業應用程式 (僅限內部) Microsoft Entra ID 委派驗證
  • 需要使用者使用 Microsoft Entra ID 完成驗證,才能進行委派呼叫。
  • 連線至已在 Microsoft Graph 索引中建立索引的其他企業知識來源,例如 ServiceNow KB、Confluence、自訂企業網站資料等。
  • 進階「增強型搜尋結果」功能使用租用戶 Microsoft Graph 資料錨定。
即時連接器 來自 Salesforce、Zendesk、SQL 等系統的即時資料 (僅限內部) 使用者必須登入
  • Copilot 連接器會從 Salesforce、ServiceNow、Zendesk、Azure SQL 擷取結構化資料。
  • 已登入的使用者必須建立與目標系統的連線。
Azure AI 搜尋服務 以向量為基礎的語意搜尋 已設定的端點
  • 傳回連結之向量化 Azure AI 搜尋服務 索引的結果。
  • 連線並非委派連線:不會進行安全性修剪,也不需要使用者驗證。
自訂資料 透過 API、流程或自訂邏輯提供的資料 無​​
  • 需要事先執行步驟以查詢來源 (例如使用雲端流程、連接器或 HTTP 要求)。
  • 結果會做為輸入傳遞給生成式回應,用於摘要出查詢的答案。
  • 輸入資料必須為表格格式,且包含三個屬性:Content (通常是相關內容的片段)、ContentLocation (選用,通常是 URL),以及 Title (選用)。

3. 摘要與回應生成

  • AI 會整合擷取到的內容
  • 套用自訂指示,控制語氣、格式、安全性或簡潔度
  • 產生基礎資料的引文
  • 運用使用者內容 (例如語言、部門或地區) 個人化回應

4. 安全性與治理驗證

每個回應都會經過自動化驗證層:

  • 審核有害、惡意、不符合規範或受版權保護的解答
  • 根據性驗證及移除錯誤資訊

不會使用客戶資料訓練語言模型。

使用 RAG 時的重要考量

RAG 最適合用於事實性問答,而非深度文件分析。

RAG 最適合用於:

  • 回答知識庫中的問題
  • 摘要政策、常見問題集和程序性內容
  • 從檔案或內部系統擷取特定事實

RAG 不適合用於:

  • 完整文件比較
  • 政策合規性評估
  • 針對冗長非結構化文件進行複雜推理

生成式 AI 安全性與合規性考量

Microsoft Copilot Studio 中的生成式 AI 功能,旨在提供強大的交談與推理能力,同時維持嚴謹的安全性、隱私權和合規性控管。

基礎模型與裝載

  • Copilot Studio 仰賴 OpenAI 訓練的基礎模型。
  • Copilot Studio 會使用最新的 OpenAI 模型之一,產生生成式回應。
  • 模型完全在內部的 Azure AI Foundry 服務上執行,並符合 Microsoft 服務信任界限的規範。
  • 所有模型使用方式皆遵循 Microsoft 負責任 AI 原則與政策。

自訂指示

建立者可以提供自訂指示,藉此塑造模型行為、影響語氣或新增格式規則。 這些指示有助於根據組織需求調整生成式回應,同時仍遵循安全性篩選及合規性控管。

資料儲存與處理

  • 在本機模型裝載無法使用時,Copilot Studio 中的資料儲存與處理可能會跨地區界限移動資料。
  • 如果不允許這種資料移動,管理員可以使用環境設定停用特定功能,例如 Azure 語言模型或 Bing Search 。
  • Copilot Studio 不會收集或使用任何客戶資料來訓練語言模型。

營運資料處理

  • 系統在運作期間,會將交談暫時儲存在安全且由 Microsoft 營運的儲存區中。
  • 已授權的 Microsoft 人員存取權,會透過具有即時 (JIT) 控管的安全存取工作站 (SAW) 加以限制。
  • 組織可以進一步透過 Customer Lockbox 控管存取權,要求 Microsoft 支援工程師必須先取得明確核准,才能檢視資料。

疑難排解遙測

  • 生成式 AI 功能會產生額外的疑難排解資料,但僅限於建立者在「測試」窗格中發起的動作,具體來說是建立者對回應按讚或按不喜歡的時候。
  • 除了這個明確的意見反應迴圈之外,不會記錄任何額外的客戶資料。

濫用監控與安全性

由於已有多層安全防護機制保護生成式 AI 功能,Copilot Studio 的生成式 AI 會停用 Azure AI 濫用監控,以避免進一步記錄客戶資料。