Azure Speech dans Foundry Tools pour l'aperçu du serveur Azure MCP Server

Utilisez l’Azure MCP Server pour gérer les fonctionnalités Azure Speech dans Foundry Tools, telles que la reconnaissance vocale (STT) et la synthèse vocale (TTS), à l’aide d’invites en langage naturel.

Note

paramètres Tool : les outils Azure MCP Server définissent des paramètres pour les données dont ils ont besoin pour effectuer des tâches. Certains de ces paramètres sont spécifiques à chaque outil et sont documentés ici. D’autres paramètres sont globaux et partagés par tous les outils. Pour plus d’informations, consultez Paramètres de l’outil.

Reconnaissance vocale : reconnaître

Reconnaître la voix à partir d’un fichier audio à l’aide de Azure Speech dans Les outils Foundry. Cette commande prend un fichier audio et le convertit en texte à l’aide de fonctionnalités avancées de reconnaissance vocale. Les formats audio pris en charge incluent WAV, MP3, OPUS/OGG, FLAC, ALAW, MULAW, MP4, M4A et AAC. Les formats compressés nécessitent l’installation de GStreamer sur le système.

Voici quelques exemples d'instructions :

  • Conversion de base : « Convertir le fichier audio ./meeting-recording.wav en texte à l’aide du point de terminaison https://myservice.cognitiveservices.azure.com/ avec Azure Speech dans Les outils Foundry ».
  • Avec détection de la langue : « Reconnaître le discours à partir du fichier ./recording.mp3 en utilisant le point de terminaison https://myservice.cognitiveservices.azure.com/ avec détection de la langue »
  • Avec le filtrage des propos vulgaires : « Transcrire le contenu vocal du fichier ./interview.wav à l'aide du point de terminaison https://myservice.cognitiveservices.azure.com/, en désactivant l'option de filtrage des grossièretés »
  • point de terminaison Specify : « Convertir la parole en texte à partir du fichier ./audio.wav à l’aide du point de terminaison https://myservice.cognitiveservices.azure.com/ »
  • Spanish language : « Transcrire le fichier audio ./session.wav en utilisant le point de terminaison https://myservice.cognitiveservices.azure.com/ en langue es-ES »
  • Sortie détaillée : « Convertir la voix en texte à partir du fichier ./audio.wav à l’aide du point de terminaison https://myservice.cognitiveservices.azure.com/ avec le format détaillé de sortie »
  • Avec des indices de phrases : "Reconnaître le discours du fichier ./notes.wav en utilisant le point de terminaison https://myservice.cognitiveservices.azure.com/ avec des indices de phrases 'Azure' pour une meilleure précision"
  • Indicateurs de phrases multiples : « Transcrire le fichier ./meeting.wav à l'aide du point de terminaison https://myservice.cognitiveservices.azure.com/ avec des hints de phrases : « Azure », « cognitive services », « machine learning »
  • Indicateurs séparés par des virgules : « Convertir la parole en texte à partir du fichier ./podcast.mp3 à l'aide du point de terminaison https://myservice.cognitiveservices.azure.com/ avec des indicateurs d'expression : « Azure, cognitive services, API »
  • Sortie de grossièretés brutes : « Transcrire l’audio à partir du fichier ./audio.wav à l’aide du point de terminaison https://myservice.cognitiveservices.azure.com/ avec l’option de grossièretés brutes »
Paramètre Obligatoire ou facultatif Descriptif
Point de terminaison Obligatoire URL du point de terminaison Azure AI Services (par exemple, https://your-service.cognitiveservices.azure.com/).
File Obligatoire Chemin d’accès au fichier audio local à reconnaître.
Language Optional Langue de la reconnaissance vocale (par exemple, en-US, es-ES). La valeur par défaut est en-US.
Expressions Optional Indicateurs d’expression pour améliorer la précision de la reconnaissance. Peut être spécifié plusieurs fois ou sous forme de valeurs séparées par des virgules.
Format Optional Format de sortie : simple ou detailed.
Blasphème Optional Filtre de profanité : masked, removedou raw. La valeur par défaut est masked.

Utilise les indicateurs d’annotation :

Destructeur Idempotent Open World Lecture seule Secret Paramètres régionaux requis

Synthèse vocale : synthétiser

Convertissez du texte en parole à l’aide de Azure Speech dans Les outils Foundry. Cette commande prend l’entrée de texte et génère un fichier audio à l’aide de fonctionnalités de synthèse vocale neuronale avancées.

Voici quelques exemples d'instructions :

  • Synthèse basique : « Convertir le texte "Hello, bienvenue dans les outils Foundry" en discours à l'aide du point de terminaison https://myservice.cognitiveservices.azure.com/ et enregistrer dans output.wav »
  • Avec une voix personnalisée : « Synthétisez “Merci d’utiliser notre service” dans le fichier audio greeting.mp3 à l’aide de ma voix personnalisée my-custom-voice sous le service https://myservice.cognitiveservices.azure.com/ et l’ID de point de terminaison guid-endpoint »
  • Different language : « Générer le discours espagnol pour 'Bienvenido a Azure' et l'enregistrer sous welcome-es.wav en utilisant mon point de terminaison vocal https://myresource.cognitiveservices.azure.com/ en langue es-ES »
Paramètre Obligatoire ou facultatif Descriptif
Point de terminaison Obligatoire URL du point de terminaison Azure AI Services (par exemple, https://your-service.cognitiveservices.azure.com/).
Texte Obligatoire Texte à convertir en parole.
Chemin d’accès du fichier de sortie Obligatoire Chemin d’accès où le fichier audio synthétisé sera enregistré.
Language Optional Langue de la reconnaissance vocale (par exemple, en-US, es-ES). La valeur par défaut est en-US.
Voix Optional Voix à utiliser pour la synthèse vocale (par exemple, en-US-JennyNeural). S’il n’est pas spécifié, la voix par défaut de la langue est utilisée.
Format Optional Format de sortie : Riff24Khz16BitMonoPcm, , Audio16Khz32KBitRateMonoMp3Audio24Khz96KBitRateMonoMp3, . Ogg16Khz16BitMonoOpusRaw16Khz16BitMonoPcm La valeur par défaut est Riff24Khz16BitMonoPcm.
ID de point de terminaison Optional ID de point de terminaison d’un modèle vocal personnalisé pour la synthèse vocale.

Utilise les indicateurs d’annotation :

Destructeur Idempotent Open World Lecture seule Secret Paramètres régionaux requis