Visão geral de Fala do Azure nas Foundry Tools para o Servidor MCP do Azure

Use o Servidor MCP do Azure para gerenciar as funcionalidades do Azure Speech no Foundry Tools, como fala para texto (STT) e texto para fala (TTS), com comandos em linguagem natural.

Observação

parâmetros Tool: as ferramentas do servidor MCP Azure definem parâmetros para os dados necessários para concluir tarefas. Alguns desses parâmetros são específicos para cada ferramenta e estão documentados aqui. Outros parâmetros são globais e compartilhados por todas as ferramentas. Para obter mais informações, consulte parâmetros de ferramenta.

Conversão de fala em texto: reconhecimento

Reconheça a fala de um arquivo de áudio usando Fala do Azure no Foundry Tools. Esse comando usa um arquivo de áudio e o converte em texto usando recursos avançados de reconhecimento de fala. Os formatos de áudio com suporte incluem WAV, MP3, OPUS/OGG, FLAC, ALAW, MULAW, MP4, M4A e AAC. Os formatos compactados exigem que o GStreamer seja instalado no sistema.

Os prompts de exemplo incluem:

  • Conversão básica: "Converta o arquivo de áudio ./meeting-recording.wav em texto usando o endpoint https://myservice.cognitiveservices.azure.com/ com a Fala do Azure no Foundry Tools."
  • Com detecção de idioma: "Reconhecer fala do arquivo ./recording.mp3 usando o endpoint https://myservice.cognitiveservices.azure.com/ com detecção de idioma"
  • Com filtragem de palavrões: "Transcrever a fala do arquivo ./interview.wav usando o ponto de extremidade https://myservice.cognitiveservices.azure.com/ com a opção de palavrões removida"
  • Especificar ponto de extremidade: "Converter fala em texto do arquivo ./audio.wav usando o ponto de extremidade https://myservice.cognitiveservices.azure.com/"
  • Spanish language: "Transcreva o arquivo de áudio ./session.wav utilizando o endpoint https://myservice.cognitiveservices.azure.com/ em es-ES"
  • Saída detalhada: "Converter a fala em texto do arquivo ./audio.wav utilizando o ponto de extremidade https://myservice.cognitiveservices.azure.com/ no formato de saída detalhada"
  • Com dicas de palavras: "Reconhecer fala do arquivo ./notes.wav usando ponto de extremidade https://myservice.cognitiveservices.azure.com/ com dicas de palavras 'Azure' para melhor precisão"
  • Várias dicas de frase: "Transcrever arquivo ./meeting.wav usando o ponto de extremidade https://myservice.cognitiveservices.azure.com/ com dicas de frase: 'Azure', 'serviços cognitivos', 'machine learning'"
  • Dicas separadas por vírgula: "Converter fala em texto do arquivo ./podcast.mp3 usando o ponto de extremidade https://myservice.cognitiveservices.azure.com/ com dicas de frases: 'Azure, serviços cognitivos, API'"
  • Saída de palavrões bruta: "Transcrever áudio do arquivo ./audio.wav com o uso do ponto de extremidade https://myservice.cognitiveservices.azure.com/ e a opção de palavrões bruta"
Parâmetro Obrigatório ou opcional Description
Ponto de extremidade Obrigatório URL do endpoint do Azure AI Services (por exemplo, https://your-service.cognitiveservices.azure.com/).
Arquivo Obrigatório Caminho para o arquivo de áudio local a ser reconhecido.
Language Opcional O idioma para reconhecimento de fala (por exemplo, en-US, es-ES). O padrão é en-US.
Frases Opcional Dicas de frase para melhorar a precisão do reconhecimento. Pode ser especificado várias vezes ou como valores separados por vírgulas.
Formato Opcional Formato de saída: simple ou detailed.
Profanidade Opcional Filtro de palavrões: masked, removed ou raw. O padrão é masked.

Dicas de anotação de ferramenta:

Destrutivo Idempotente Mundo Aberto Somente leitura Secret Local obrigatório

Conversão de texto em fala: sintetizar

Converta texto em fala usando o Azure Speech nas Ferramentas do Foundry. Esse comando usa a entrada de texto e gera um arquivo de áudio usando recursos avançados de conversão de texto em fala neural.

Os prompts de exemplo incluem:

  • Síntese básica: "Converter o texto 'Olá, bem-vindo às Foundry Tools' em fala usando o ponto de extremidade https://myservice.cognitiveservices.azure.com/ e salvar em output.wav"
  • Com voz personalizada: "Sintetize 'Obrigado por usar nosso serviço' no arquivo de áudio greeting.mp3 com minha voz personalizada my-custom-voice no serviço https://myservice.cognitiveservices.azure.com/ e com o ID do ponto de extremidade guid-endpoint"
  • Idioma diferente: "Gerar fala em espanhol para 'Bienvenido a Azure' e salvar em welcome-es.wav usando meu ponto de extremidade de fala https://myresource.cognitiveservices.azure.com/ na língua es-ES"
Parâmetro Obrigatório ou opcional Description
Ponto de extremidade Obrigatório URL do endpoint do Azure AI Services (por exemplo, https://your-service.cognitiveservices.azure.com/).
Texto Obrigatório O texto a ser convertido em fala.
Caminho do arquivo de saída Obrigatório Caminho em que o arquivo de áudio sintetizado será salvo.
Language Opcional O idioma para reconhecimento de fala (por exemplo, en-US, es-ES). O padrão é en-US.
Voz Opcional A voz a ser usada para síntese de fala (por exemplo, en-US-JennyNeural). Se não for especificado, a voz padrão do idioma será usada.
Formato Opcional Formato de saída: Riff24Khz16BitMonoPcm, , Audio16Khz32KBitRateMonoMp3, Audio24Khz96KBitRateMonoMp3, Ogg16Khz16BitMonoOpus, Raw16Khz16BitMonoPcm. O padrão é Riff24Khz16BitMonoPcm.
ID do Ponto de Extremidade Opcional O ID do ponto de extremidade de um modelo de voz personalizada para síntese de fala.

Dicas de anotação de ferramenta:

Destrutivo Idempotente Mundo Aberto Somente leitura Secret Local obrigatório