VoiceAgentInputTranscription interface

非同步輸入-音訊轉錄配置。 擴展 OpenAI 即時轉錄選項,加入 Azure 與 MAI 轉錄模型、自訂語音模型及短語提示。

屬性

custom_speech

可選客戶自訂語音部署配置,依地點定位。

delay

控制模型在發出轉錄文字前等待的時間。 較高的數值可以提升轉錄準確度,但代價是延遲。 僅支援 gpt-realtime-whisper GA 即時會話。

keywords

用詞語或片語來引導輸入音訊的轉錄。 由 gpt-transcribe 和 gpt-live-transcribe支援。

language

輸入音訊的語言。 以 ISO-639-1 格式 en提供輸入語言可改善精確度和延遲。

languages

輸入音訊的可能語言,採用 ISO-639-1 格式。 由 gpt-transcribe 和 gpt-live-transcribe支援。

model

轉錄模型識別碼。 在 中配置客戶自訂語音部署。custom_speech

phrase_list

可選詞語暗示對領域詞的認知偏向。

prompt

可選文字用來引導模型風格或延續先前的音訊片段。 對於 whisper-1, 提示詞是一串關鍵字。 對於 gpt-4o-transcribe 模型(不含 gpt-4o-transcribe-diarize),提示詞為自由文字串,例如「expect words related to technology」。 在 GA 的即時會話中不支援 gpt-realtime-whisper 提示詞。

屬性詳細資料

custom_speech

可選客戶自訂語音部署配置,依地點定位。

custom_speech?: Record<string, string>

屬性值

Record<string, string>

delay

控制模型在發出轉錄文字前等待的時間。 較高的數值可以提升轉錄準確度,但代價是延遲。 僅支援 gpt-realtime-whisper GA 即時會話。

delay?: "low" | "medium" | "high" | "minimal" | "xhigh"

屬性值

"low" | "medium" | "high" | "minimal" | "xhigh"

keywords

用詞語或片語來引導輸入音訊的轉錄。 由 gpt-transcribe 和 gpt-live-transcribe支援。

keywords?: string[]

屬性值

string[]

language

輸入音訊的語言。 以 ISO-639-1 格式 en提供輸入語言可改善精確度和延遲。

language?: string

屬性值

string

languages

輸入音訊的可能語言,採用 ISO-639-1 格式。 由 gpt-transcribe 和 gpt-live-transcribe支援。

languages?: string[]

屬性值

string[]

model

轉錄模型識別碼。 在 中配置客戶自訂語音部署。custom_speech

model: VoiceAgentInputTranscriptionModel

屬性值

phrase_list

可選詞語暗示對領域詞的認知偏向。

phrase_list?: string[]

屬性值

string[]

prompt

可選文字用來引導模型風格或延續先前的音訊片段。 對於 whisper-1, 提示詞是一串關鍵字。 對於 gpt-4o-transcribe 模型(不含 gpt-4o-transcribe-diarize),提示詞為自由文字串,例如「expect words related to technology」。 在 GA 的即時會話中不支援 gpt-realtime-whisper 提示詞。

prompt?: string

屬性值

string