Wprowadzenie

Ukończone

Możliwości mowy sztucznej inteligencji umożliwiają nam zarządzanie systemami za pomocą instrukcji głosowych, uzyskiwanie odpowiedzi z komputerów pod kątem wypowiadanych pytań, generowanie podpisów na podstawie dźwięku i wiele innych. Interfejsy oparte na głosach zapewniają bardziej naturalny sposób angażowania się w oprogramowanie sztucznej inteligencji. Możliwość interakcji za pośrednictwem języka mówionego może zwiększyć dostępność i inkluzywność aplikacji i agentów.

Aby umożliwić taką interakcję, system sztucznej inteligencji musi obsługiwać co najmniej dwie możliwości:

  • Rozpoznawanie mowy: możliwość wykrywania i interpretowania wypowiedzianych danych wejściowych
  • Synteza mowy: możliwość generowania mówionych danych wyjściowych

Przykłady tych możliwości to:

  • Dyktowanie kliniczne i sporządzanie notatek w opiece zdrowotnej: Lekarze mogą mówić na głos notatki pacjenta w trakcie lub po wizytach. Aplikacja do rozpoznawania mowy sztucznej inteligencji konwertuje dźwięk na dokładny tekst medyczny, zmniejszając ręczne wpisywanie i oszczędność czasu.

  • Transkrypcja połączeń w pomocy technicznej klienta: Centra kontaktów transkrypują połączenia klientów w czasie rzeczywistym, ułatwiając przeglądanie konwersacji, wykrywanie problemów i analizowanie tonacji.

  • Automatyczne transkrypcje w mediach i rozrywkach: platformy wideo generują transkrypcje na żywo lub nagrywane dla pokazów i transmisji strumieniowej, zwiększając dostępność i wspierając wielojęzycznych odbiorców.

  • Nauka języka i opinie na temat wymowy w edukacji: aplikacje szkoleniowe korzystają z funkcji mowy sztucznej inteligencji, aby słuchać uczniów mówić i przekazywać opinie o wymowie, pomagając uczniom ćwiczyć i poprawiać umiejętności językowe mówione.

  • Asystentzy z obsługą głosu w handlu detalicznym i elektronicznym: Wirtualni asystenci zakupów używają rozpoznawania mowy, aby zrozumieć wypowiedziane żądania klientów i zamianę tekstu na mowę w odpowiedzi na informacje o produkcie lub stan zamówienia.

Usługa Azure Speech w narzędziu Microsoft Foundry Tools udostępnia funkcje zamiany mowy na tekst, zamianę tekstu na mowę i tłumaczenie mowy za pomocą rozpoznawania i syntezy mowy. Możesz użyć wstępnie utworzonych i niestandardowych modeli usługi Rozpoznawanie mowy dla różnych zadań, od transkrypcji dźwięku po tekst z wysoką dokładnością, do identyfikowania osób mówiących w konwersacjach, tworzenia niestandardowych głosów i nie tylko. Następnie dowiedz się, jak włączyć rozpoznawanie mowy do aplikacji za pomocą usługi Azure Speech.

Uwaga / Notatka

Zdajemy sobie sprawę, że różni ludzie lubią uczyć się na różne sposoby. Możesz ukończyć ten moduł w formacie wideo lub przeczytać zawartość jako tekst i obrazy. Tekst zawiera więcej szczegółów niż filmy wideo, więc w niektórych przypadkach możesz chcieć odwoływać się do niego jako materiał uzupełniający do prezentacji wideo.