Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Use el servidor MCP de Azure para administrar las funcionalidades de Azure Speech en Foundry Tools, como la conversión de voz a texto (STT) y la conversión de texto a voz (TTS), mediante indicaciones en lenguaje natural.
Nota:
parámetros Tool: las herramientas de servidor MCP de Azure definen parámetros para los datos que necesitan para completar tareas. Algunos de estos parámetros son específicos de cada herramienta y se documentan aquí. Otros parámetros son globales y compartidos por todas las herramientas. Para obtener más información, consulte Parámetros de la herramienta.
Conversión de voz en texto: Reconocimiento
Reconocer voz a partir de un archivo de audio con Voz de Azure en Foundry Tools. Este comando toma un archivo de audio y lo convierte en texto mediante funcionalidades avanzadas de reconocimiento de voz. Los formatos de audio admitidos incluyen WAV, MP3, OPUS/OGG, FLAC, ALAW, MULAW, MP4, M4A y AAC. Los formatos comprimidos requieren que GStreamer esté instalado en el sistema.
Algunos ejemplos de solicitudes incluyen:
-
Conversión básica: "Convierta el archivo de audio ./meeting-recording.wav en texto usando el punto de conexión
https://myservice.cognitiveservices.azure.com/con Azure Speech en Foundry Tools." -
Con detección de idioma: "Reconocimiento de voz del archivo ./recording.mp3 mediante el punto de conexión
https://myservice.cognitiveservices.azure.com/con detección de idioma" -
Con filtrado de palabras soeces: "Transcribe la voz desde el archivo ./interview.wav mediante el punto de conexión
https://myservice.cognitiveservices.azure.com/con la opción de palabras soeces desactivada" -
Especificar punto final: "Convertir voz a texto desde el archivo ./audio.wav usando el punto final
https://myservice.cognitiveservices.azure.com/" -
Spanish language: "Transcribe el archivo de audio ./session.wav mediante el endpoint
https://myservice.cognitiveservices.azure.com/en el idioma es-ES" -
Salida detallada: "Convertir la voz en texto desde el archivo ./audio.wav usando el punto de acceso
https://myservice.cognitiveservices.azure.com/con formato de salida detallado" -
Con sugerencias de frases: "Reconoce la voz del archivo ./notes.wav utilizando el punto de conexión
https://myservice.cognitiveservices.azure.com/con sugerencias de frases 'Azure' para mejorar la precisión" -
Múltiples sugerencias de frases: "Transcribe el archivo ./meeting.wav usando el punto de conexión
https://myservice.cognitiveservices.azure.com/con sugerencias de frases: 'Azure', 'cognitive services', 'machine learning'" -
Sugerencias separadas por comas: "Convierte voz a texto desde el archivo ./podcast.mp3 usando el punto de conexión
https://myservice.cognitiveservices.azure.com/con sugerencias de frases: 'Azure, cognitive services, API'" -
Resultado de palabras soeces en bruto: "Transcribe audio desde el archivo ./audio.wav mediante el punto de conexión
https://myservice.cognitiveservices.azure.com/con la opción de palabras soeces en bruto"
| Parámetro | Obligatorio u opcional | Description |
|---|---|---|
| Punto final | Obligatorio | Dirección URL del punto de conexión de Azure AI Services (por ejemplo, https://your-service.cognitiveservices.azure.com/). |
| Archivo | Obligatorio | Ruta de acceso al archivo de audio local que se va a reconocer. |
| Language | Opcional | Idioma para el reconocimiento de voz (por ejemplo, en-US, es-ES). El valor predeterminado es en-US. |
| Frases | Opcional | Sugerencias de frase para mejorar la precisión del reconocimiento. Se puede especificar varias veces o como valores separados por comas. |
| Formato | Opcional | Formato de salida: simple o detailed. |
| Profanidad | Opcional | Filtro de palabras soeces: masked, removed o raw. El valor predeterminado es masked. |
Sugerencias de anotación de herramientas :
| Destructivo | Idempotente | Abrir mundo | Solo lectura | Secret | Se requiere un recurso local |
|---|---|---|---|---|---|
| ❌ | ✅ | ❌ | ✅ | ❌ | ✅ |
Texto a voz: sintetizar
Convierta texto a voz mediante Azure Voz en Foundry Tools. Este comando toma la entrada de texto y genera un archivo de audio mediante funcionalidades avanzadas de texto a voz neuronal.
Algunos ejemplos de solicitudes incluyen:
-
Síntesis básica: "Convierte el texto 'Hola, bienvenido a Foundry Tools' a voz usando el endpoint
https://myservice.cognitiveservices.azure.com/y guárdalo en output.wav" -
Con voz personalizada: "Sintetiza "Gracias por usar nuestro servicio" en el archivo de audio greeting.mp3 con mi voz personalizada my-custom-voice con el servicio
https://myservice.cognitiveservices.azure.com/y el identificador de punto de conexiónguid-endpoint" - Idioma diferente: "Genera un texto de voz en español para 'Bienvenido a Azure' y guárdalo en welcome-es.wav usando mi punto de conexión de voz https://myresource.cognitiveservices.azure.com/ en el idioma es-ES"
| Parámetro | Obligatorio u opcional | Description |
|---|---|---|
| Punto final | Obligatorio | Dirección URL del punto de conexión de Azure AI Services (por ejemplo, https://your-service.cognitiveservices.azure.com/). |
| Text | Obligatorio | Texto que se va a convertir en voz. |
| Ruta de acceso del archivo de salida | Obligatorio | Ruta de acceso donde se guardará el archivo de audio sintetizado. |
| Language | Opcional | Idioma para el reconocimiento de voz (por ejemplo, en-US, es-ES). El valor predeterminado es en-US. |
| Voz | Opcional | La voz que se utilizará para la síntesis de voz (por ejemplo, en-US-JennyNeural). Si no se especifica, se usará la voz predeterminada para el idioma. |
| Formato | Opcional | Formato de salida: Riff24Khz16BitMonoPcm, Audio16Khz32KBitRateMonoMp3, Audio24Khz96KBitRateMonoMp3, Ogg16Khz16BitMonoOpus, . Raw16Khz16BitMonoPcm El valor predeterminado es Riff24Khz16BitMonoPcm. |
| Endpoint ID (Id. del punto de conexión) | Opcional | ID de punto de conexión de un modelo de voz personalizado para la síntesis de voz. |
Sugerencias de anotación de herramientas :
| Destructivo | Idempotente | Abrir mundo | Solo lectura | Secret | Se requiere un recurso local |
|---|---|---|---|---|---|
| ❌ | ✅ | ❌ | ❌ | ❌ | ✅ |