Información general sobre Azure Speech en Foundry Tools para el servidor Azure MCP

Use el servidor MCP de Azure para administrar las funcionalidades de Azure Speech en Foundry Tools, como la conversión de voz a texto (STT) y la conversión de texto a voz (TTS), mediante indicaciones en lenguaje natural.

Nota:

parámetros Tool: las herramientas de servidor MCP de Azure definen parámetros para los datos que necesitan para completar tareas. Algunos de estos parámetros son específicos de cada herramienta y se documentan aquí. Otros parámetros son globales y compartidos por todas las herramientas. Para obtener más información, consulte Parámetros de la herramienta.

Conversión de voz en texto: Reconocimiento

Reconocer voz a partir de un archivo de audio con Voz de Azure en Foundry Tools. Este comando toma un archivo de audio y lo convierte en texto mediante funcionalidades avanzadas de reconocimiento de voz. Los formatos de audio admitidos incluyen WAV, MP3, OPUS/OGG, FLAC, ALAW, MULAW, MP4, M4A y AAC. Los formatos comprimidos requieren que GStreamer esté instalado en el sistema.

Algunos ejemplos de solicitudes incluyen:

  • Conversión básica: "Convierta el archivo de audio ./meeting-recording.wav en texto usando el punto de conexión https://myservice.cognitiveservices.azure.com/ con Azure Speech en Foundry Tools."
  • Con detección de idioma: "Reconocimiento de voz del archivo ./recording.mp3 mediante el punto de conexión https://myservice.cognitiveservices.azure.com/ con detección de idioma"
  • Con filtrado de palabras soeces: "Transcribe la voz desde el archivo ./interview.wav mediante el punto de conexión https://myservice.cognitiveservices.azure.com/ con la opción de palabras soeces desactivada"
  • Especificar punto final: "Convertir voz a texto desde el archivo ./audio.wav usando el punto final https://myservice.cognitiveservices.azure.com/"
  • Spanish language: "Transcribe el archivo de audio ./session.wav mediante el endpoint https://myservice.cognitiveservices.azure.com/ en el idioma es-ES"
  • Salida detallada: "Convertir la voz en texto desde el archivo ./audio.wav usando el punto de acceso https://myservice.cognitiveservices.azure.com/ con formato de salida detallado"
  • Con sugerencias de frases: "Reconoce la voz del archivo ./notes.wav utilizando el punto de conexión https://myservice.cognitiveservices.azure.com/ con sugerencias de frases 'Azure' para mejorar la precisión"
  • Múltiples sugerencias de frases: "Transcribe el archivo ./meeting.wav usando el punto de conexión https://myservice.cognitiveservices.azure.com/ con sugerencias de frases: 'Azure', 'cognitive services', 'machine learning'"
  • Sugerencias separadas por comas: "Convierte voz a texto desde el archivo ./podcast.mp3 usando el punto de conexión https://myservice.cognitiveservices.azure.com/ con sugerencias de frases: 'Azure, cognitive services, API'"
  • Resultado de palabras soeces en bruto: "Transcribe audio desde el archivo ./audio.wav mediante el punto de conexión https://myservice.cognitiveservices.azure.com/ con la opción de palabras soeces en bruto"
Parámetro Obligatorio u opcional Description
Punto final Obligatorio Dirección URL del punto de conexión de Azure AI Services (por ejemplo, https://your-service.cognitiveservices.azure.com/).
Archivo Obligatorio Ruta de acceso al archivo de audio local que se va a reconocer.
Language Opcional Idioma para el reconocimiento de voz (por ejemplo, en-US, es-ES). El valor predeterminado es en-US.
Frases Opcional Sugerencias de frase para mejorar la precisión del reconocimiento. Se puede especificar varias veces o como valores separados por comas.
Formato Opcional Formato de salida: simple o detailed.
Profanidad Opcional Filtro de palabras soeces: masked, removed o raw. El valor predeterminado es masked.

Sugerencias de anotación de herramientas :

Destructivo Idempotente Abrir mundo Solo lectura Secret Se requiere un recurso local

Texto a voz: sintetizar

Convierta texto a voz mediante Azure Voz en Foundry Tools. Este comando toma la entrada de texto y genera un archivo de audio mediante funcionalidades avanzadas de texto a voz neuronal.

Algunos ejemplos de solicitudes incluyen:

  • Síntesis básica: "Convierte el texto 'Hola, bienvenido a Foundry Tools' a voz usando el endpoint https://myservice.cognitiveservices.azure.com/ y guárdalo en output.wav"
  • Con voz personalizada: "Sintetiza "Gracias por usar nuestro servicio" en el archivo de audio greeting.mp3 con mi voz personalizada my-custom-voice con el servicio https://myservice.cognitiveservices.azure.com/ y el identificador de punto de conexión guid-endpoint"
  • Idioma diferente: "Genera un texto de voz en español para 'Bienvenido a Azure' y guárdalo en welcome-es.wav usando mi punto de conexión de voz https://myresource.cognitiveservices.azure.com/ en el idioma es-ES"
Parámetro Obligatorio u opcional Description
Punto final Obligatorio Dirección URL del punto de conexión de Azure AI Services (por ejemplo, https://your-service.cognitiveservices.azure.com/).
Text Obligatorio Texto que se va a convertir en voz.
Ruta de acceso del archivo de salida Obligatorio Ruta de acceso donde se guardará el archivo de audio sintetizado.
Language Opcional Idioma para el reconocimiento de voz (por ejemplo, en-US, es-ES). El valor predeterminado es en-US.
Voz Opcional La voz que se utilizará para la síntesis de voz (por ejemplo, en-US-JennyNeural). Si no se especifica, se usará la voz predeterminada para el idioma.
Formato Opcional Formato de salida: Riff24Khz16BitMonoPcm, Audio16Khz32KBitRateMonoMp3, Audio24Khz96KBitRateMonoMp3, Ogg16Khz16BitMonoOpus, . Raw16Khz16BitMonoPcm El valor predeterminado es Riff24Khz16BitMonoPcm.
Endpoint ID (Id. del punto de conexión) Opcional ID de punto de conexión de un modelo de voz personalizado para la síntesis de voz.

Sugerencias de anotación de herramientas :

Destructivo Idempotente Abrir mundo Solo lectura Secret Se requiere un recurso local