översikt över Azure Speech i Foundry Tools för Azure MCP Server

Använd Azure MCP Server för att hantera funktionerna Azure Speech i Foundry Tools, till exempel tal till text (STT) och text till tal (TTS) med frågor om naturligt språk.

Anmärkning

Tool-parametrar: Verktygen Azure MCP Server definierar parametrar för data som de behöver för att slutföra uppgifter. Vissa av dessa parametrar är specifika för varje verktyg och dokumenteras här. Andra parametrar är globala och delas av alla verktyg. Mer information finns i Verktygsparametrar.

Tal till text: Identifiera

Identifiera tal från en ljudfil med hjälp av Azure Speech i Foundry Tools. Det här kommandot tar en ljudfil och konverterar den till text med hjälp av avancerade funktioner för taligenkänning. Ljudformat som stöds är WAV, MP3, OPUS/OGG, FLAC, ALAW, MULAW, MP4, M4A och AAC. Komprimerade format kräver att GStreamer installeras på systemet.

Exempel på frågor är:

  • Grundläggande konvertering: "Konvertera ljudfilen ./meeting-recording.wav till text med hjälp av slutpunkten https://myservice.cognitiveservices.azure.com/ med Azure Speech i Foundry Tools."
  • Med språkidentifiering: "Identifiera tal från filen ./recording.mp3 med slutpunkten https://myservice.cognitiveservices.azure.com/ med språkidentifiering"
  • Med svordomsfiltrering: "Transkribera tal från filen ./interview.wav med slutpunkten https://myservice.cognitiveservices.azure.com/ med alternativet svordomar borttaget"
  • Specify-slutpunkt: "Konvertera tal till text från fil ./audio.wav med slutpunkten https://myservice.cognitiveservices.azure.com/"
  • Spanish language: "Transkribera ljudfilen ./session.wav med slutpunkten https://myservice.cognitiveservices.azure.com/ på es-ES språk"
  • Detaljerad utdata: "Konvertera tal till text från filen ./audio.wav med hjälp av endpoint https://myservice.cognitiveservices.azure.com/ med detaljerad utdataformat"
  • Med frastips: "Identifiera tal från filen ./notes.wav med slutpunkten https://myservice.cognitiveservices.azure.com/ med frastips "Azure" för bättre noggrannhet"
  • Flera frasledtrådar: "Transkribera filen ./meeting.wav vid slutpunkten https://myservice.cognitiveservices.azure.com/ med frasledtrådar: "Azure", "kognitiva tjänster", "maskininlärning""
  • Komma-avgränsade indikationer: "Konvertera tal till text från fil ./podcast.mp3 med slutpunkten https://myservice.cognitiveservices.azure.com/ med frasindikationer: 'Azure, Cognitive Services, API'"
  • Raw profanity output: "Transkribera ljud från filen ./audio.wav med användning av slutpunkt https://myservice.cognitiveservices.azure.com/ och med profanity-alternativet rå"
Parameter Obligatorisk eller valfri Description
Slutpunkt Krävs URL:en för Azure AI Services slutpunkt (till exempel https://your-service.cognitiveservices.azure.com/).
Arkiv Krävs Sökväg till den lokala ljudfilen som ska identifieras.
Språk Valfritt Språket för taligenkänning (till exempel en-US, es-ES). Standard är en-US.
Fraser Valfritt Frastips för att förbättra igenkänningens noggrannhet. Kan anges flera gånger eller som kommaavgränsade värden.
Format Valfritt Utdataformat: simple eller detailed.
Svordomar Valfritt Svordomsfilter: masked, removedeller raw. Standard är masked.

Tool-anteckningstips:

Destruktiv Idempotent Öppen värld Skrivskyddad Secret Lokalt obligatoriskt

Text till tal: Syntetisera

Konvertera text till tal med hjälp av Azure Speech i Foundry Tools. Det här kommandot tar textindata och genererar en ljudfil med hjälp av avancerade funktioner för neural text till tal.

Exempel på frågor är:

  • Grundläggande syntes: "Konvertera texten 'Hello, welcome to Foundry Tools' till tal med hjälp av slutpunkt https://myservice.cognitiveservices.azure.com/ och spara till output.wav"
  • Med anpassad röst: "Syntetisera "Tack för att du använder vår tjänst" till ljudfil greeting.mp3 med hjälp av min anpassade röst my-custom-voice under tjänst https://myservice.cognitiveservices.azure.com/ - och slutpunkts-ID guid-endpoint"
  • Olika språk: "Generera spanskt tal för 'Bienvenido a Azure' och spara som welcome-es.wav med hjälp av min tal-endpoint https://myresource.cognitiveservices.azure.com/ på språket es-ES"
Parameter Obligatorisk eller valfri Description
Slutpunkt Krävs URL:en för Azure AI Services slutpunkt (till exempel https://your-service.cognitiveservices.azure.com/).
Text Krävs Texten som ska konverteras till tal.
Utdatafilens sökväg Krävs Sökväg där den syntetiserade ljudfilen sparas.
Språk Valfritt Språket för taligenkänning (till exempel en-US, es-ES). Standard är en-US.
Röst Valfritt Den röst som ska användas för talsyntes (till exempel en-US-JennyNeural). Om inget anges används standardrösten för språket.
Format Valfritt Utdataformat: Riff24Khz16BitMonoPcm, Audio16Khz32KBitRateMonoMp3, Audio24Khz96KBitRateMonoMp3, Ogg16Khz16BitMonoOpus, Raw16Khz16BitMonoPcm. Standard är Riff24Khz16BitMonoPcm.
Slutpunkts-ID Valfritt Slutpunkts-ID för en anpassad röstmodell för talsyntes.

Tool-anteckningstips:

Destruktiv Idempotent Öppen värld Skrivskyddad Secret Lokalt obligatoriskt