用真實世界的問題測試 Genie Agent,檢視產生的 SQL 與視覺化,當 Genie 出錯時編輯回應,並監控 agent 使用情況與用戶回饋,確保資料與問題持續演變時保持代理的準確性。 利用基準來評估大規模的回應準確度。
Note
精靈特工過去被稱為精靈空間。
測試你的精靈代理人
大部分的用戶互動都會在聊天視窗中進行。 判斷你的代理人是否如你所願運作的最佳方法,是用你預期業務用戶會問的現實問題來測試。
在客服設定中設定的範例問題會出現在聊天視窗中。 Genie 也能根據代理人的情境產生範例問題,幫助使用者開始探索資料。 使用者可以按下範例問題,或在畫面底部的文字欄位中輸入自己的問題。
回應會出現在文字欄位上方。 使用者輸入問題之後,它會儲存至聊天記錄。
若要開始新的交談:
- 按兩下 [新增聊天 ] 以開始新的聊天。 按兩下
以開啟先前的對話。
- 在 [ 詢問您的問題... 文字輸入] 字段中輸入您的問題。
審查回應
回應通常會以自然語言回答的形式傳遞至問題,以及顯示相關結果集的數據表。 當 Genie 偵測到視覺效果可以改善回應清晰度時,也會傳回視覺效果。 精確的響應結構會根據問題而有所不同。 如果已產生 SQL 查詢來回答問題,回應中就會包含該查詢。
Note
與其他大型語言模型(LLM)一樣,Genie 可以表現出不具決定性的行為。 這表示在提交相同的提示多次時,您偶爾可能會收到不同的輸出。 提供 Genie 可從中學習的範例 SQL 查詢,有助於讓 Genie 更一致。 請參閱 新增範例 SQL 查詢和函式。
回應意見反應
每個回應都會提示使用者回答這是正確的嗎? 使用者可以以下其中一種方式回應:
- 是的: 確認回應顯示正確。
-
修正此問題: 將回應標示為不正確。 用戶可以從常見問題中選取,或輸入自己的說明。 然後,他們可以:
- 按兩下 [提交],然後再試一次 ,使用提供的意見反應重新產生回應。
- 按兩下 [提交 ] 以傳送意見反應,而不重新產生回應。
- 要求檢閱: 將回應標記為需要手動檢閱。 使用者可以新增一個可選擇的評論,以提供額外的上下文。
身為編輯,您可以在 Genie 介面中檢視意見反應和被標記的回應。 你的精靈代理人的行為不會因為用戶反饋而改變。 您應該使用意見反應來識別改進機會或直接回應用戶問題。 Databricks 建議鼓勵使用者對使用此機制的代理提供回饋。
企業用戶可以在他們的 監控 頁面查看已標記審查問題的更新。 擁有至少 CAN MANAGE 權限的 Genie 代理用戶,可以查看該特定交換,對請求發表評論,並確認或更正回應。 他們可以在監控頁面上存取回饋並檢視要求。 然後,你可以利用這些回饋來調整回應,並反覆改進你的代理程式。 請參見「監控代理人」。
其他回應動作
針對包含所產生 SQL 的回應,其他選項可讓您與傳回的數據互動。
複製 CSV: 代理使用者可下載約 1GB 的結果資料作為 CSV 格式。 最終檔案下載大小可能略高於或小於 1GB,因為 1GB 限制會套用至比最終檔案下載還舊的步驟。 若要下載結果,請按兩下回應中的下載圖示。
顯示程式代碼: 按兩下 [顯示程式代碼 ] 以檢視產生的查詢。 這對於針對不可靠的回應進行疑難解答很有用。 請參閱 編輯和儲存查詢。
烤肉串菜單:存取下列動作:
- 複製 CSV:將回應 CSV 複製到剪貼簿。
- 新增為指示: 如需可能適用於教學 Genie 如何回答類似問題的互動,請按兩下 [新增為指示]。 這會開啟 UI 來儲存範例 SQL 查詢,並填入問題併產生 SQL。 您可以將範例保持原樣,或編輯並儲存以進行修改。 請參閱 新增範例 SQL 查詢和函式。
- 新增為基準:將問題新增為基準問題。 請參閱 基準測試。
- 重新整理資料:執行先前產生的查詢來重新整理資料。
- 重新生成回應: 再次提交問題並讓 Genie 重新生成回應。
編輯和儲存查詢
Genie 的 SQL 查詢可以檢閱精確度,並視需要加以編輯。 Genie Agent 作者通常知道網域和資料,能辨識 Genie 何時產生錯誤答案。 通常,您可以使用少量手動微調所產生 SQL 查詢來修正錯誤。 按兩下 [顯示產生的程式代碼 ] 來檢查查詢,並檢視產生的 SQL 是否有任何回應。
如果你在 Genie 代理上有 CAN EDIT 或更高權限,可以編輯產生的 SQL 語句來修正。 進行更正之後,請執行查詢。 然後,您可以將它儲存為指示,以教導 Genie 如何在未來回答。 若要儲存已編輯的查詢,請按兩下 [新增] 作為指示。
使用 Genie Code 偵錯回應
當 Genie 回傳錯誤答案時,請使用 Genie Code 來診斷問題並改善代理人的上下文:
- 從回應中開啟精靈代碼。
- 描述問題和你想要的行為。
- 檢視 Genie Code 提出的上下文變更,並接受你想保留的。
Tip
請告訴 Genie Code 幫你做這件事:
The Genie Agent is using calendar quarters instead of our fiscal calendar. Update its context to use our fiscal quarters: Q1 is February through April, Q2 is May through July, Q3 is August through October, and Q4 is November through January.
你也可以用 Genie Code 來儲存對話中的語意上下文。 當使用者引入新詞彙或糾正 Genie 的行為後,請 Genie Code 捕捉它所學到的內容。 檢視每項建議,並接受你想加入代理程式的脈絡資訊。
監控代理人
Genie 代理可被視為資料團隊與業務使用者之間的長期協作工具。 它是隨著時間累積知識,而非作為一次性部署。 隨著使用者提出新的問題,你可以優化代理程式,以提升涵蓋範圍與準確性。
使用 「監控 」分頁來檢視個別問題與回應、查看用戶回饋,並識別被標記為審查的回應。
監控分頁會顯示該代理程式中所有已提出的問題及其答案。 您可以依時間、評等、用戶或狀態來篩選問題。 透過監控代理,擁有 CAN MANAGE 權限的使用者能主動了解商業用戶提出的查詢,以及 Genie 代理的回應方式。
找出 Genie 難以回答的問題,可以幫助你更新 Genie Agent 的具體指示,以改善其回應。 按兩下問題以開啟問題和回應文字,並檢視完整的聊天對話。
回顧使用與趨勢
使用監控標籤的每週摘要區塊,檢視每週訊息量、活躍用戶及讚/踩回饋。 要辨識主要使用趨勢與常見問題,請點擊 「分析代理使用情況」。 這啟動了 Genie Code,回顧過去六個月的用戶訊息、回饋與問題,並報告常見問題、反覆出現的問題及建議的情境改進。 回覆中會附上連結至你代理人相關對話的引用。 點擊引用即可直接在 Genie Code 討論串中開啟對話。
檢查對話的品質
Genie Chat Sharing 讓經紀經理能檢視商業用戶與 Genie 經紀人的完整對話。 當對話被設定為 「可由客服經理審查」時,擁有「可管理」權限的使用者可從監控標籤開啟對話,檢視完整對話內容。 這讓您能評估 Genie 的回應品質、回應用戶回饋,並找出增加指示或範例查詢能提升準確度的部分。 對於設定為 私人的對話,客服經理可以在監控標籤看到使用者提示,但無法查看完整的對話或結果。 欲了解更多資訊,請參閱 「分享對話」。
Note
在開啟 對話分享 功能之前建立的對話仍 保持為私人。 啟用後建立的對話預設為 「可由客服經理審查」。
刪除對話
擁有 Genie 代理 CAN MANAGE 權限的使用者,可以永久刪除監控頁面中代理內的任何對話。 這會移除所有使用者的對話內容及其訊息。
- 打開 Genie Agent,點選 「監控 」標籤。
- 點擊對話即可開啟對話抽屜。
- 點擊 刪除對話。
- 在確認對話框中,點擊 刪除 即可永久刪除對話,或按下 取消 鍵關閉對話但不刪除對話。
Benchmarks
基準檢驗可讓您建立一組測試問題,您可以執行以評估 Genie 的整體回應精確度。 一套設計良好的基準測試,涵蓋最常被問到的用戶問題,有助於評估 Genie 代理在優化過程中的準確性。 每個精靈代理人最多可包含500個基準問題。
基準問題會作為新的對話進行。 它們不具備與線上 Genie 對話相同的上下文。 每個問題會以新查詢的形式處理,使用代理中定義的指令,包括任何範例的 SQL 與 SQL 函式。
基準測試題支援兩種模式:
- 聊天模式:預設模式。 Genie 透過比較其 SQL 產生的結果與提供的 SQL 答案來評估準確性。
- 代理人模式:以與精靈代理人模式相同的多步驟推理方式執行基準問題。 LLM 裁判會對回應進行評分。 你可以提供選填的評分註記,作為評分參考。
你是在跑基準測試時選擇模式,而不是在新增問題時選擇。 使用 Benchmarks 分頁右上角的模式切換,為某次執行選擇 聊天 或 代理 模式。 所選模式適用於該系列中的所有題目。
新增基準問題
基準問題應該反映使用者所提問常見問題的不同語法方式。 您可以使用它們來檢查 Genie 對問題片語或不同問題格式變化的回應。
建立基準問題時,您可以選擇性地包括其結果集為正確答案的 SQL 查詢。 在基準執行期間,會藉由比較 SQL 查詢的結果集與 Genie 所產生的結果集以評估正確性。 您也可以使用 Unity 目錄 SQL 函式作為基準測試的黃金標準答案。
若要新增基準檢驗問題:
在 Genie Agent 的頂端附近,點選 「基準測試」。
按一下 新增基準。
在問題欄位中,輸入要測試的基準問題。
(選用)提供回答問題的 SQL 查詢。 你可以在 SQL 答案 框中輸入自己的查詢,包括 Unity Catalog 的 SQL 函式。 或者,按一下 [產生 SQL] ,讓 Genie 為您撰寫 SQL 查詢。 使用準確回答您輸入的問題的 SQL 陳述式。
Note
此步驟建議用於聊天模式的運行。 只有包括此範例 SQL 陳述式的問題才會自動評估正確性。 不包括 SQL 答案 的任何問題都需要手動檢閱才能評分。 如果您使用 [產生 SQL ] 按鈕,請檢閱陳述式,以確保它正確回答問題。
(可選)在 評估筆記 欄位輸入正確答案或預期內容的指引。 在代理模式運行時,Genie 會將評估筆記交給 LLM 評審。 該備註可以參考代理模式產生的文字報告中預期的內容。
(選擇性)單擊 執行 以執行查詢並檢視結果。
當您完成編輯時,請按一下新增基準。
若要在儲存後更新問題,請按一下
鉛筆圖示以開啟更新問題對話方塊。
使用基準以測試替代問題語法
在評估精靈代理人的準確度時,設計測試以反映真實情境非常重要。 使用者可能會以不同方式詢問相同的問題。 Databricks 建議在相同問題中加入的多個種語法,並在基準測試中使用相同的範例 SQL,以完整評估正確性。 大多數 Genie 代理應包含同一問題的兩到四種不同表述。
執行基準測試問題
擁有至少 CAN 編輯權限的 Genie 代理使用者,可以隨時執行基準測試。 您可以執行所有基準問題,或選取要測試的問題子集。
對於每個問題,Genie 會解釋輸入、產生 SQL 並傳回結果。 然後,將產生的 SQL 和結果與基準測試問題中定義的 SQL 答案 進行比較。
若要執行所有基準問題:
- 在 Genie Agent 的頂端附近,點選 「基準測試」。
- 按一下執行基準以開始測試回合。
若要執行基準測試問題的子集:
- 在 Genie Agent 的頂端附近,點選 「基準測試」。
- 請勾選您要測試的問題旁邊的核取方塊。
- 按一下 [執行選取項目] 以開始對所選問題進行測試執行。
您也可以從先前的基準測試結果中選取問題子集,並重新執行這些特定問題以測試改進。
當您離開頁面時,基準測試會繼續執行。 執行完成後,您可以在 評估 標籤上檢查結果。
一次運行結束後,你可以使用 Genie Code 檢視整個流程的結果,並建議上下文改進。 詳見「使用 Genie Code 分析基準測試」。
聊天模式評分
以下標準決定 Genie 對聊天模式回應的評價:
| 狀況 | Rating |
|---|---|
| Genie 生成完全匹配提供的 SQL 答案的 SQL | 很好 |
| Genie 會產生與 SQL Answer 產生的結果集完全相符的結果集 | 很好 |
| Genie 會產生一個結果集,其資料與 SQL 答案 相同,但排序方式不同 | 很好 |
| Genie 產生一個結果集,其數值四捨五入為與 SQL 答案相同的 4 位有效數字 | 很好 |
| Genie 產生會返回空結果集或錯誤的 SQL | 壞 |
| Genie 會產生一個結果集,與由 SQL Answer 所產生的結果集相比,其中包含額外的資料行。 | 壞 |
| Genie 會產生一個與 SQL 答案 所產生不同的單一儲存格結果。 | 壞 |
Note
聊天模式最多可比較每個結果集中的 5,000 列資料。 當結果集超過 5,000 列,且 Genie 產生的結果與 SQL 答案的列序不同時,這種截斷可能導致匹配的結果集被評為 「壞」。 為避免這種情況,可以寫出回傳少於 5,000 列的 SQL Answer 查詢,或在 ORDER BY 和預期的 Genie 輸出中都加上一個子句,讓列序保持一致。
當結果被評為 「差」時,說明會指出不匹配的類型。
需要手動檢閱:當 Genie 無法評估正確性或 Genie 產生的查詢結果未包含與所提供 SQL 回應的結果完全相符時,回應會標示為此標籤。 任何不包含 SQL 答案的基準問題都必須手動檢閱。
代理模式評級
LLM 評審會評分代理模式的回應,而非使用 SQL 比較。 如果你提供了 評估備註,LLM 裁判在評估回應時會將其作為指引,包括 Agent 模式產生的文字報告中任何預期應包含的內容。 評審會將符合評分標準的回答評為 良好。
存取基準評估
您可以存取所有基準評估,以追蹤您的 Genie Agent 中準確率隨時間的變化。 當你開啟代理程式的 基準測試 時,評估 索引標籤中會顯示依時間戳記列出的評估執行清單。若找不到任何評估執行,請參閱 新增基準問題 或 執行基準問題。
[評估] 標籤頁顯示評估的概觀及其在下列類別中的表現:
評估名稱:指出評估執行發生時間的時間戳記。 按一下時間戳記以查看該評估的詳細資料。 執行狀態:指出評估是否已完成、暫停或不成功。 如果評估回合包括沒有預先定義 SQL 答案的基準問題,則會在此資料欄中標示為檢閱。 正確性:所有基準問題當中的正確性數值評估。 針對需要手動檢閱的評估回合,正確性度量值只會在已經檢閱這些問題之後出現。 建立者:指出執行評估的使用者名稱。
查看個人評估
您可以檢閱個別評估,詳細查看每個回覆。 您可以編輯任何問題的評定,並且更新需要手動檢閱的任何項目。
若要檢閱個別評估:
在 Genie Agent 的頂端附近,點擊 Benchmark。
在評估名稱資料欄中按一下任何評估的時間戳記,開啟該測試回合的詳細檢視。
使用螢幕左側的問題清單查看每個問題的詳細視圖。
檢閱並比較模型輸出回應與基準真相回應。
對於評等為不正確的結果,會出現一個說明,說明結果被評為 「不良」的原因。 這可協助您瞭解產生的輸出與預期的基本事實之間的特定差異。
Note
這些回應的結果會顯示在評估詳細資料中,為期一週。 一週之後就不會再顯示結果。 產生的 SQL 陳述式和範例 SQL 陳述式會維持不變。
按一下 [更新基本事實 ] ,將回應儲存為此問題的新 基本事實 。 如果不存在基本事實,或者回應比現有的基本事實陳述更好或更準確,這很有用。
按一下標籤上的
以編輯評定。將每個結果標示為良好或不良,以取得此評估的準確分數。
使用 Genie Code 分析基準測試
基準測試完成後,使用Genie Code回顧整個測試結果,而非逐題逐題檢查。 從評估中啟動 Genie Code,並要求它分析這次執行。 Genie Code 會審查預期結果、代理產生的內容,以及代理目前的情境,找出缺口,然後建議指示和情境改進方案,讓你檢視並保存。