Informatie extraheren uit audio en video

Voltooid

Tip

Zie het tabblad Tekst en afbeeldingen voor meer informatie.

Bedrijfsgegevens worden steeds vaker gevonden in multimedia-indelingen, zoals audio- en videobestanden. Bedrijven registreren bijvoorbeeld vaak aanroepen om ze later te analyseren. De groei van videovergaderingen betekent dat nuttige informatie vaak wordt vastgelegd in opgenomen vergaderingen. Azure Content Understanding biedt ondersteuning voor zowel audio- als videogegevensextractie en -analyse.

Gestructureerde gegevens extraheren uit audio

U kunt Azure Content Understanding gebruiken om transcripties, samenvattingen en andere belangrijke inzichten uit audiobestanden te bieden.

Stel dat u AI wilt gebruiken om uw voicemail samen te vatten. U kunt een schema van belangrijke inzichten definiëren om uit elke opgenomen aanroep te extraheren, zoals hieronder:

  • Beller
  • Berichtoverzicht
  • Aangevraagde acties
  • Nummer van terugbeloproep
  • Alternatieve contactgegevens

Stel dat een beller u het volgende voicemailbericht laat zien:

Hi, this is Ava from Contoso.

Just calling to follow up on our meeting last week.

I wanted to let you know that I've run the numbers and I think we can meet your price expectations.

Please call me back on 555-12345 or send me an e-mail at Ava@contoso.com and we'll discuss next steps.

Thanks, bye!

Het gebruik van Azure Content Understanding voor het analyseren van de audio-opname en het toepassen van uw schema levert de volgende resultaten op:

  • Beller: Ava van Contoso
  • Berichtsamenvatting: Ava van Contoso heeft gebeld om een vergadering op te volgen en vermeld dat ze aan de prijsverwachtingen kunnen voldoen. Ze hebben een callback of een e-mailbericht gevraagd om de volgende stappen te bespreken.
  • Aangevraagde acties: Terugbellen of een e-mailbericht verzenden om de volgende stappen te bespreken.
  • Terugbelnummer: 555-12345
  • Alternatieve contactgegevens: Ava@contoso.com

Audio analyseren in de Foundry-portal

Net als bij documentanalyse is het gebruik van Content Understanding in de nieuwe Foundry-portal een snelle manier om te valideren dat uw analyse de velden retourneert die u verwacht voordat u de werkstroom in code automatiseert.

In de portal kunt u het volgende doen:

  • Selecteer een audio- of videoanalyse en voer deze uit op een mediabestand.
  • Bekijk uitvoer zoals transcripties (voor audio) en geëxtraheerde inzichten op basis van uw schema.
  • Bekijk de geretourneerde JSON-resultaten voor verdere verwerking in downstreamsystemen.

Laten we eens kijken hoe we inhoudskennis kunnen gebruiken om een gespreksopname te analyseren. In plaats van naar het hele gesprek te luisteren, kunt u de vooraf samengestelde audioanalyse uitvoeren om informatie uit de audio te extraheren. Wanneer de analyse is voltooid, kunt u een geschreven transcript van de aanroep zien.

Schermopname van de nieuwe Foundry-portal met audio geanalyseerd met Azure Content Understanding.

In de geretourneerde resultaten ziet u specifieke informatie uit de oproep. Net als bij andere analyses in inhoudskennis zijn de resultaten in JSON-indeling voor verdere verwerking.

Schermopname van de nieuwe Foundry-portal waar audio wordt geanalyseerd en JSON wordt geretourneerd.

Gestructureerde gegevens extraheren uit video

Azure Content Understanding biedt ook ondersteuning voor videoanalyse. U kunt bijvoorbeeld een opgenomen videovergadering analyseren om details van aanwezigheid, locatie en andere informatie te extraheren.

Laten we eerst één afbeelding van de camera van de vergaderruimte bekijken. Stel dat u het volgende schema hebt gedefinieerd:

  • Locatie
  • Fysiek aanwezige deelnemers
  • Externe deelnemers
  • Totaal aantal deelnemers

U kunt Azure Content Understanding gebruiken om een afbeelding van de camera van de vergaderruimte te analyseren:

Foto van een persoon in een vergaderruimte tijdens een gesprek met drie externe deelnemers.

Nadat het schema op de afbeelding is toegepast, heeft Azure Content Understanding gestructureerde gegevens geretourneerd:

  • Locatie: Vergaderruimte
  • Deelnemers in persoon: 1
  • Externe deelnemers: 3
  • Totaal aantal deelnemers: 4

Bedenk wat u aan het schema kunt toevoegen voor een video-opname van de vergadering. U kunt aanwezigheidsaantallen opnemen met verschillende tijdsintervallen, details van wie heeft gesproken tijdens het gesprek en wat ze zeiden, een samenvatting van de discussie en een lijst met toegewezen acties van de vergadering.

Een clienttoepassing bouwen met audio- of videoanalyses

Als u audio of video programmatisch wilt analyseren, kunt u een lichtgewicht clienttoepassing bouwen met behulp van de Content Understanding-API.

Laten we eens kijken naar een voorbeeld met behulp van de Python SDK. Wanneer u de volgende code uitvoert, wordt een audiobestand geanalyseerd met behulp van een vooraf samengestelde analyse. De vooraf gebouwde analyzer wordt geïdentificeerd als prebuilt-audioSearch.

import os
from azure.ai.contentunderstanding import ContentUnderstandingClient
from azure.core.credentials import AzureKeyCredential

# Endpoint and key for your Foundry resource
endpoint = os.environ["FOUNDRY_ENDPOINT"]  # e.g., "https://<resource>.services.ai.azure.com/"
key = os.environ["FOUNDRY_KEY"]

client = ContentUnderstandingClient(
    endpoint=endpoint,
    credential=AzureKeyCredential(key)
)

# Choose a prebuilt analyzer for audio
# (The documents module lists examples like prebuilt-audioSearch / prebuilt-videoSearch.)
analyzer_id = "prebuilt-audioSearch"

# Provide an input audio file (URL shown here; you can swap in your own accessible media URL)
inputs = [
    {"url": "https://<your-host>/samples/voicemail.wav"}
]

# Start analysis (asynchronous long-running operation)
poller = client.begin_analyze(analyzer_id=analyzer_id, inputs=inputs)

# Wait for completion (SDK polls under the hood)
result = poller.result()

# Inspect the structured output (JSON-like objects)
for content in result.contents:
    # Some analyzers may return a transcript and/or extracted fields depending on the analyzer and schema
    print("=== MARKDOWN / TRANSCRIPT (if provided) ===")
    print(getattr(content, "markdown", None))

    print("\n=== EXTRACTED FIELDS ===")
    print(getattr(content, "fields", None))

Audio- en videoanalyse met inhoudsbegrip in Microsoft Foundry opent een hele reeks mogelijkheden om het potentieel van zakelijke gegevens in elke indeling te ontgrendelen. Probeer vervolgens Content Understanding voor uzelf uit.