Wyodrębnianie informacji z audio i wideo
Wskazówka
Aby uzyskać więcej szczegółów, zobacz kartę Tekst i obrazy .
Informacje biznesowe są coraz częściej spotykane w formatach multimedialnych, takich jak pliki audio i wideo. Na przykład firmy często nagrywają połączenia w celu późniejszego analizowania ich. Wzrost wideokonferencji oznacza, że przydatne informacje są często przechwytywane w nagranych spotkaniach. Usługa Azure Content Understanding obsługuje wyodrębnianie i analizowanie danych audio i wideo.
Wyodrębnianie danych ustrukturyzowanych z dźwięku
Usługa Azure Content Understanding umożliwia udostępnianie transkrypcji, podsumowań i innych kluczowych szczegółowych informacji z plików audio.
Załóżmy, że chcesz mieć sztuczną inteligencję podsumowującą pocztę głosową. Możesz zdefiniować schemat kluczowych informacji do wyodrębnienia z każdej zarejestrowanej rozmowy, na przykład:
- Dzwoniący
- Podsumowanie wiadomości
- Żądane akcje
- Numer do oddzwonienia
- Alternatywne dane kontaktowe
Teraz załóżmy, że obiekt wywołujący pozostawia następujący komunikat głosowy:
Hi, this is Ava from Contoso.
Just calling to follow up on our meeting last week.
I wanted to let you know that I've run the numbers and I think we can meet your price expectations.
Please call me back on 555-12345 or send me an e-mail at Ava@contoso.com and we'll discuss next steps.
Thanks, bye!
Użycie usługi Azure Content Understanding do analizowania nagrania audio i zastosowania schematu daje następujące wyniki:
- Dzwoniący: Ava z Contoso
- Podsumowanie komunikatu: Ava z firmy Contoso zadzwoniła, aby kontynuować spotkanie i wspomniała, że mogą spełnić oczekiwania dotyczące ceny. Poprosili o oddzwonienie lub wiadomość e-mail, aby omówić następne kroki.
- Żądane działania: Oddzwoń lub wyślij wiadomość e-mail, aby omówić następne kroki.
- Numer telefonu do oddzwonienia: 555-12345
- Alternatywne dane kontaktowe: Ava@contoso.com
Analizowanie dźwięku w portalu Foundry
Podobnie jak w przypadku analizy dokumentów, użycie usługi Content Understanding w nowym portalu rozwiązania Foundry to szybki sposób sprawdzania, czy analizator zwraca oczekiwane pola przed zautomatyzowanie przepływu pracy w kodzie.
W portalu można wykonywać następujące czynności:
- Wybierz analizator audio lub wideo i uruchom go w pliku multimedialnym.
- Przejrzyj dane wyjściowe, takie jak transkrypcje (dla dźwięku) i uzyskane wnioski na podstawie schematu.
- Wyświetl zwrócone wyniki JSON w celu dalszego przetwarzania w systemach podrzędnych.
Przyjrzyjmy się, jak możemy użyć zrozumienia zawartości do analizowania nagrania rozmowy. Zamiast nasłuchiwać całego wywołania, możesz uruchomić wstępnie utworzony analizator audio, aby wyodrębnić informacje z dźwięku. Po zakończeniu analizy można zobaczyć napisaną transkrypcję wywołania.
W zwróconych wynikach możesz zobaczyć określone informacje dotyczące wywołania. Podobnie jak w przypadku innych analizatorów w zrozumieniu zawartości, wyniki są w formacie JSON do dalszego przetwarzania.
Wyodrębnianie danych ustrukturyzowanych z wideo
Usługa Azure Content Understanding obsługuje również analizę wideo. Możesz na przykład przeanalizować nagraną konferencję wideo, aby wyodrębnić szczegóły obecności, lokalizacji i innych informacji.
Najpierw przyjrzyjmy się jednemu obrazowi z kamery sali konferencyjnej. Załóżmy, że zdefiniowano następujący schemat:
- Lokalizacja
- Uczestnicy obecni fizycznie
- Uczestnicy zdalni
- Łączna liczba uczestników
Usługa Azure Content Understanding umożliwia analizowanie obrazu z kamery sali konferencyjnej:
Po zastosowaniu schematu do obrazu usługa Azure Content Understanding zwróciła dane ustrukturyzowane:
- Lokalizacja: Sala konferencyjna
- Uczestnicy osobiście: 1
- Uczestnicy zdalni: 3
- Łączna liczba uczestników: 4
Zastanów się, co można dodać do schematu na potrzeby nagrania wideo spotkania. Możesz uwzględnić liczbę frekwencji w różnych odstępach czasu, szczegóły osób, które mówiły podczas rozmowy i co powiedzieli, podsumowanie dyskusji i listę przypisanych akcji ze spotkania.
Tworzenie aplikacji klienckiej za pomocą analizatorów audio lub wideo
Aby programowo analizować dźwięk lub wideo, możesz utworzyć uproszczoną aplikację kliencką przy użyciu interfejsu API usługi Content Understanding.
Przyjrzyjmy się przykładowi przy użyciu zestawu SDK języka Python. Po uruchomieniu następującego kodu analizuje plik audio przy użyciu wstępnie utworzonego analizatora. Wstępnie utworzony analizator jest identyfikowany jako prebuilt-audioSearch.
import os
from azure.ai.contentunderstanding import ContentUnderstandingClient
from azure.core.credentials import AzureKeyCredential
# Endpoint and key for your Foundry resource
endpoint = os.environ["FOUNDRY_ENDPOINT"] # e.g., "https://<resource>.services.ai.azure.com/"
key = os.environ["FOUNDRY_KEY"]
client = ContentUnderstandingClient(
endpoint=endpoint,
credential=AzureKeyCredential(key)
)
# Choose a prebuilt analyzer for audio
# (The documents module lists examples like prebuilt-audioSearch / prebuilt-videoSearch.)
analyzer_id = "prebuilt-audioSearch"
# Provide an input audio file (URL shown here; you can swap in your own accessible media URL)
inputs = [
{"url": "https://<your-host>/samples/voicemail.wav"}
]
# Start analysis (asynchronous long-running operation)
poller = client.begin_analyze(analyzer_id=analyzer_id, inputs=inputs)
# Wait for completion (SDK polls under the hood)
result = poller.result()
# Inspect the structured output (JSON-like objects)
for content in result.contents:
# Some analyzers may return a transcript and/or extracted fields depending on the analyzer and schema
print("=== MARKDOWN / TRANSCRIPT (if provided) ===")
print(getattr(content, "markdown", None))
print("\n=== EXTRACTED FIELDS ===")
print(getattr(content, "fields", None))
Analiza audio i wideo dzięki zrozumieniu zawartości w rozwiązaniu Microsoft Foundry otwiera całą gamę możliwości odblokowania potencjału danych biznesowych w dowolnym formacie. Następnie wypróbuj usługę Content Understanding dla siebie.