Extraire des informations de l’audio et de la vidéo

Effectué

Tip

Pour plus d’informations, consultez l’onglet Texte et images !

Les informations professionnelles sont de plus en plus trouvées dans des formats multimédias tels que des fichiers audio et vidéo. Par exemple, les entreprises enregistrent souvent des appels pour les analyser ultérieurement. La croissance de la vidéoconférence signifie que les informations utiles sont souvent capturées dans les réunions enregistrées. Azure Content Understanding prend en charge l’extraction et l’analyse des données audio et vidéo.

Extraction de données structurées à partir de l’audio

Vous pouvez utiliser Azure Content Understanding pour fournir des transcriptions, des résumés et d’autres informations clés à partir de fichiers audio.

Supposons que vous souhaitiez que l’IA récapitule votre messagerie vocale. Vous pouvez définir un schéma d’insights clés à extraire de chaque appel enregistré, comme suit :

  • Appelant
  • Résumé du message
  • Actions demandées
  • Numéro de rappel
  • Autres coordonnées

Supposons maintenant qu’un appelant vous laisse le message vocal suivant :

Hi, this is Ava from Contoso.

Just calling to follow up on our meeting last week.

I wanted to let you know that I've run the numbers and I think we can meet your price expectations.

Please call me back on 555-12345 or send me an e-mail at Ava@contoso.com and we'll discuss next steps.

Thanks, bye!

L’utilisation d’Azure Content Understanding pour analyser l’enregistrement audio et appliquer votre schéma produit les résultats suivants :

  • Appelant : Ava de Contoso
  • Résumé du message : Ava de Contoso a appelé pour faire le point sur une réunion et a mentionné qu'elle peut répondre aux attentes en matière de prix. Ils ont demandé un rappel ou un e-mail pour discuter des étapes suivantes.
  • Actions demandées : rappelez ou envoyez un e-mail pour discuter des étapes suivantes.
  • Numéro de rappel : 555-12345
  • Autres coordonnées : Ava@contoso.com

Analyse de l’audio dans le portail Foundry

Comme pour l’analyse de document, l’utilisation de Content Understanding dans le nouveau portail Foundry est un moyen rapide de vérifier que votre analyseur retourne les champs attendus avant d’automatiser le flux de travail dans le code.

Dans le portail, vous pouvez :

  • Sélectionnez un analyseur audio ou vidéo et exécutez-le sur un fichier multimédia.
  • Passez en revue les sorties telles que les transcriptions audio et les analyses extraites en fonction de votre schéma.
  • Affichez les résultats JSON retournés pour un traitement supplémentaire dans les systèmes en aval.

Examinons comment nous pouvons utiliser la compréhension du contenu pour analyser un enregistrement d’appel. Au lieu d’écouter l’ensemble de l’appel, vous pouvez exécuter l’analyseur audio prédéfini pour extraire des informations de l’audio. Une fois l’analyse effectuée, vous pouvez voir une transcription écrite de l’appel.

Screenshot du nouveau portail Foundry avec l’audio analysé avec Azure Content Understanding.

Dans les résultats retournés, vous pouvez voir des informations spécifiques concernant l'appel. Comme avec d’autres analyseurs dans la compréhension du contenu, les résultats sont au format JSON pour un traitement ultérieur.

Capture d’écran du nouveau portail Foundry dans lequel l’audio est analysé et JSON est retourné.

Extraction de données structurées à partir de la vidéo

Azure Content Understanding prend également en charge l’analyse vidéo. Par exemple, vous pouvez analyser une vidéoconférence enregistrée pour extraire les détails de la présence, de l’emplacement et d’autres informations.

Examinons d’abord une image de la caméra de la salle de conférence. Supposons que vous avez défini le schéma suivant :

  • Emplacement
  • Participants en personne
  • Participants à distance
  • Nombre total de participants

Vous pouvez utiliser Azure Content Understanding pour analyser une image à partir de la caméra de salle de conférence :

Photographie d'une personne dans une salle de conférence, en communication avec trois participants à distance.

Après avoir appliqué le schéma à l’image, Azure Content Understanding a retourné des données structurées :

  • Emplacement : Salle de conférence
  • Participants en personne : 1
  • Participants distants : 3
  • Nombre total de participants : 4

Considérez ce que vous pouvez ajouter au schéma pour un enregistrement vidéo de la réunion. Vous pouvez inclure le nombre de présences à différents intervalles de temps, les détails de qui ont parlé pendant l’appel et ce qu’ils ont dit, un résumé de la discussion et une liste d’actions affectées de la réunion.

Création d’une application cliente avec des analyseurs audio ou vidéo

Pour analyser l’audio ou la vidéo par programmation, vous pouvez créer une application cliente légère à l’aide de l’API Content Understanding.

Examinons un exemple utilisant le Kit de développement logiciel (SDK) Python. Lorsque vous exécutez le code suivant, il analyse un fichier audio à l’aide d’un analyseur prédéfini. L’analyseur prédéfini est identifié comme prebuilt-audioSearch.

import os
from azure.ai.contentunderstanding import ContentUnderstandingClient
from azure.core.credentials import AzureKeyCredential

# Endpoint and key for your Foundry resource
endpoint = os.environ["FOUNDRY_ENDPOINT"]  # e.g., "https://<resource>.services.ai.azure.com/"
key = os.environ["FOUNDRY_KEY"]

client = ContentUnderstandingClient(
    endpoint=endpoint,
    credential=AzureKeyCredential(key)
)

# Choose a prebuilt analyzer for audio
# (The documents module lists examples like prebuilt-audioSearch / prebuilt-videoSearch.)
analyzer_id = "prebuilt-audioSearch"

# Provide an input audio file (URL shown here; you can swap in your own accessible media URL)
inputs = [
    {"url": "https://<your-host>/samples/voicemail.wav"}
]

# Start analysis (asynchronous long-running operation)
poller = client.begin_analyze(analyzer_id=analyzer_id, inputs=inputs)

# Wait for completion (SDK polls under the hood)
result = poller.result()

# Inspect the structured output (JSON-like objects)
for content in result.contents:
    # Some analyzers may return a transcript and/or extracted fields depending on the analyzer and schema
    print("=== MARKDOWN / TRANSCRIPT (if provided) ===")
    print(getattr(content, "markdown", None))

    print("\n=== EXTRACTED FIELDS ===")
    print(getattr(content, "fields", None))

L’analyse audio et vidéo avec compréhension du contenu dans Microsoft Foundry ouvre toute une gamme d’opportunités pour déverrouiller le potentiel des données métier dans n’importe quel format. Ensuite, essayez Content Understanding pour vous-même.