Extrahera information från ljud och video

Slutförd

Tip

Mer information finns på fliken Text och bilder !

Affärsinformation finns allt mer i multimediaformat som ljud- och videofiler. Företag registrerar till exempel ofta anrop för att analysera dem senare. Tillväxten av videokonferenser innebär att användbar information ofta samlas in i inspelade möten. Azure Content Understanding stöder både extrahering och analys av ljud- och videodata.

Extrahera strukturerade data från ljud

Du kan använda Azure Content Understanding för att tillhandahålla transkriptioner, sammanfattningar och andra viktiga insikter från ljudfiler.

Anta att du vill att AI ska sammanfatta din röstbrevlåda. Du kan definiera ett schema med viktiga insikter som ska extraheras från varje inspelat anrop, så här:

  • Den som ringer
  • Meddelandesammanfattning
  • Begärda åtgärder
  • Återanropsnummer
  • Alternativa kontaktuppgifter

Anta nu att en uppringare lämnar följande röstmeddelande:

Hi, this is Ava from Contoso.

Just calling to follow up on our meeting last week.

I wanted to let you know that I've run the numbers and I think we can meet your price expectations.

Please call me back on 555-12345 or send me an e-mail at Ava@contoso.com and we'll discuss next steps.

Thanks, bye!

Om du använder Azure Content Understanding för att analysera ljudinspelningen och tillämpa schemat får du följande resultat:

  • Uppringaren: Ava från Contoso
  • Meddelandesammanfattning: Ava från Contoso ringde för att följa upp ett möte och nämnde att de kan uppfylla prisförväntningarna. De begärde ett återanrop eller ett e-postmeddelande för att diskutera nästa steg.
  • Begärda åtgärder: Ring tillbaka eller skicka ett e-postmeddelande för att diskutera nästa steg.
  • Återanropsnummer: 555-12345
  • Alternativa kontaktuppgifter: Ava@contoso.com

Analysera ljud i Foundry-portalen

Precis som med dokumentanalys är det snabbt att använda Content Understanding i den nya Foundry-portalen för att verifiera att analysatorn returnerar de fält du förväntar dig innan du automatiserar arbetsflödet i kod.

I portalen kan du:

  • Välj en ljud- eller videoanalysator och kör den på en mediefil.
  • Granska utdata, till exempel avskrifter (för ljud) och extraherade insikter baserat på ditt schema.
  • Visa de returnerade JSON-resultaten för ytterligare bearbetning i underordnade system.

Nu ska vi ta en titt på hur vi kan använda innehållstolkning för att analysera en samtalsinspelning. I stället för att lyssna på hela samtalet kan du köra den fördefinierade ljudanalysatorn för att extrahera information från ljudet. När analysen är klar kan du se en skriftlig avskrift av anropet.

Skärmbild av den nya Foundry-portalen med ljud analyserat med Azure Content Understanding.

I de returnerade resultaten kan du se specifik information från anropet. Precis som med andra analysverktyg i innehållstolkning är resultaten i JSON-format för vidare bearbetning.

Skärmbild av den nya Foundry-portalen där ljud analyseras och JSON returneras.

Extrahera strukturerade data från video

Azure Content Understanding stöder även videoanalys. Du kan till exempel analysera en inspelad videokonferens för att extrahera information om närvaro, plats och annan information.

Låt oss först titta på en bild från konferensrumskameran. Anta att du har definierat följande schema:

  • Plats
  • Personliga deltagare
  • Fjärrdeltagare
  • Totalt antal deltagare

Du kan använda Azure Content Understanding för att analysera en bild från konferensrumskameran:

Foto av en person i ett konferensrum på ett samtal med tre fjärranslutna deltagare.

När schemat har tillämpats på avbildningen returnerade Azure Content Understanding strukturerade data:

  • Plats: Konferensrum
  • Personliga deltagare: 1
  • Fjärrdeltagare: 3
  • Totalt antal deltagare: 4

Tänk på vad du kan lägga till i schemat för en videoinspelning av mötet. Du kan inkludera antal deltagare vid olika tidsintervall, information om vem som talade under samtalet och vad de sa, en sammanfattning av diskussionen och en lista över tilldelade åtgärder från mötet.

Skapa ett klientprogram med ljud- eller videoanalysverktyg

Om du vill analysera ljud eller video programmatiskt kan du skapa ett enkelt klientprogram med hjälp av API:et Content Understanding.

Låt oss ta en titt på ett exempel med hjälp av Python SDK. När du kör följande kod analyserar den en ljudfil med hjälp av en fördefinierad analysator. Den fördefinierade analysatorn identifieras som prebuilt-audioSearch.

import os
from azure.ai.contentunderstanding import ContentUnderstandingClient
from azure.core.credentials import AzureKeyCredential

# Endpoint and key for your Foundry resource
endpoint = os.environ["FOUNDRY_ENDPOINT"]  # e.g., "https://<resource>.services.ai.azure.com/"
key = os.environ["FOUNDRY_KEY"]

client = ContentUnderstandingClient(
    endpoint=endpoint,
    credential=AzureKeyCredential(key)
)

# Choose a prebuilt analyzer for audio
# (The documents module lists examples like prebuilt-audioSearch / prebuilt-videoSearch.)
analyzer_id = "prebuilt-audioSearch"

# Provide an input audio file (URL shown here; you can swap in your own accessible media URL)
inputs = [
    {"url": "https://<your-host>/samples/voicemail.wav"}
]

# Start analysis (asynchronous long-running operation)
poller = client.begin_analyze(analyzer_id=analyzer_id, inputs=inputs)

# Wait for completion (SDK polls under the hood)
result = poller.result()

# Inspect the structured output (JSON-like objects)
for content in result.contents:
    # Some analyzers may return a transcript and/or extracted fields depending on the analyzer and schema
    print("=== MARKDOWN / TRANSCRIPT (if provided) ===")
    print(getattr(content, "markdown", None))

    print("\n=== EXTRACTED FIELDS ===")
    print(getattr(content, "fields", None))

Ljud- och videoanalys med innehållsförståelse i Microsoft Foundry öppnar upp en hel rad möjligheter för att frigöra affärsdatas potential i alla format. Prova sedan Content Understanding för dig själv.