VoiceAgentInputTranscription interface
非同步輸入-音訊轉錄配置。 擴展 OpenAI 即時轉錄選項,加入 Azure 與 MAI 轉錄模型、自訂語音模型及短語提示。
屬性
| custom_speech | 可選客戶自訂語音部署配置,依地點定位。 |
| delay | 控制模型在發出轉錄文字前等待的時間。
較高的數值可以提升轉錄準確度,但代價是延遲。
僅支援 |
| keywords | 用詞語或片語來引導輸入音訊的轉錄。 由 |
| language | 輸入音訊的語言。 以 ISO-639-1 格式 |
| languages | 輸入音訊的可能語言,採用 ISO-639-1 格式。 由 |
| model | 轉錄模型識別碼。 在 中配置客戶自訂語音部署。 |
| phrase_list | 可選詞語暗示對領域詞的認知偏向。 |
| prompt | 可選文字用來引導模型風格或延續先前的音訊片段。
對於 |
屬性詳細資料
custom_speech
可選客戶自訂語音部署配置,依地點定位。
custom_speech?: Record<string, string>
屬性值
Record<string, string>
delay
控制模型在發出轉錄文字前等待的時間。
較高的數值可以提升轉錄準確度,但代價是延遲。
僅支援 gpt-realtime-whisper GA 即時會話。
delay?: "low" | "medium" | "high" | "minimal" | "xhigh"
屬性值
"low" | "medium" | "high" | "minimal" | "xhigh"
keywords
用詞語或片語來引導輸入音訊的轉錄。 由 gpt-transcribe 和 gpt-live-transcribe支援。
keywords?: string[]
屬性值
string[]
language
languages
輸入音訊的可能語言,採用 ISO-639-1 格式。 由 gpt-transcribe 和 gpt-live-transcribe支援。
languages?: string[]
屬性值
string[]
model
轉錄模型識別碼。 在 中配置客戶自訂語音部署。custom_speech
model: VoiceAgentInputTranscriptionModel
屬性值
phrase_list
可選詞語暗示對領域詞的認知偏向。
phrase_list?: string[]
屬性值
string[]
prompt
可選文字用來引導模型風格或延續先前的音訊片段。
對於 whisper-1, 提示詞是一串關鍵字。
對於 gpt-4o-transcribe 模型(不含 gpt-4o-transcribe-diarize),提示詞為自由文字串,例如「expect words related to technology」。
在 GA 的即時會話中不支援 gpt-realtime-whisper 提示詞。
prompt?: string
屬性值
string