語言

ToolCallAccuracyEvaluator 類別

定義

評估 IEvaluator AI 系統使用所提供工具的效能。

public ref class ToolCallAccuracyEvaluator sealed : Microsoft::Extensions::AI::Evaluation::IEvaluator
[System.Diagnostics.CodeAnalysis.Experimental("AIEVAL001")]
public sealed class ToolCallAccuracyEvaluator : Microsoft.Extensions.AI.Evaluation.IEvaluator
public sealed class ToolCallAccuracyEvaluator : Microsoft.Extensions.AI.Evaluation.IEvaluator
[<System.Diagnostics.CodeAnalysis.Experimental("AIEVAL001")>]
type ToolCallAccuracyEvaluator = class
    interface IEvaluator
type ToolCallAccuracyEvaluator = class
    interface IEvaluator
Public NotInheritable Class ToolCallAccuracyEvaluator
Implements IEvaluator
繼承
ToolCallAccuracyEvaluator
屬性
實作

備註

ToolCallAccuracyEvaluator 透過檢視所提供回應中出現的工具呼叫(即 s), FunctionCallContent來衡量 AI 系統對工具的使用準確度,以評估這些工具呼叫與對話的相關性、這些工具呼叫在透過 所提供 ToolDefinitions工具定義的參數正確性,以及從所提供對話中擷取參數值的準確性。

請注意, ToolCallAccuracyEvaluator 目前只支援評估定義為 AIFunctionDeclarations 的工具呼叫。 AITool其他由 提供的ToolDefinitions定義將被忽略。

ToolCallAccuracyEvaluator 回傳包含「工具呼叫準確度」分數的 a BooleanMetric 。 分數是工具 false 調用是否無關或包含對話中未出現的資訊,以及 true 該工具調用是否相關且從對話中適當提取的參數。

註:ToolCallAccuracyEvaluator 是一款基於 AI 的評估器,使用 AI 模型來進行評估。 雖然評估者用來執行評估的提示詞設計為模型中立,但該提示(及最終評估)的表現會因所用模型而異,尤其當使用較小或局部的模型時,表現會更差。

該 ToolCallAccuracyEvaluator 提示詞已針對以下模型進行測試並調整以適合使用。 因此,使用這個評估器搭配以下清單中的模型,通常能產生最佳結果。 (所用模型可透過以下 ChatClient方式配置。)

GPT-4o

建構函式

名稱 Description
ToolCallAccuracyEvaluator()

評估 IEvaluator AI 系統使用所提供工具的效能。

屬性

名稱 Description
EvaluationMetricNames

由Name此IEvaluator產生 s 的 s EvaluationMetric。

ToolCallAccuracyMetricName

得到 Name 的 BooleanMetric 由 返回 ToolCallAccuracyEvaluator。

方法

名稱 Description
EvaluateAsync(IEnumerable<ChatMessage>, ChatResponse, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

評估所提供的 modelResponse ,並回傳包含 EvaluationResult 一個或多個 EvaluationMetrics。

擴充方法

名稱 Description
EvaluateAsync(IEvaluator, ChatMessage, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

評估所提供的 modelResponse ,並回傳包含 EvaluationResult 一個或多個 EvaluationMetrics。

EvaluateAsync(IEvaluator, ChatMessage, ChatMessage, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

評估所提供的 modelResponse ,並回傳包含 EvaluationResult 一個或多個 EvaluationMetrics。

EvaluateAsync(IEvaluator, ChatMessage, ChatResponse, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

評估所提供的 modelResponse ,並回傳包含 EvaluationResult 一個或多個 EvaluationMetrics。

EvaluateAsync(IEvaluator, ChatResponse, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

評估所提供的 modelResponse ,並回傳包含 EvaluationResult 一個或多個 EvaluationMetrics。

EvaluateAsync(IEvaluator, String, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

評估所提供的 modelResponse ,並回傳包含 EvaluationResult 一個或多個 EvaluationMetrics。

EvaluateAsync(IEvaluator, String, String, ChatConfiguration, IEnumerable<EvaluationContext>, CancellationToken)

評估所提供的 modelResponse ,並回傳包含 EvaluationResult 一個或多個 EvaluationMetrics。

適用於