Introduction
Usługa Azure Speech in Foundry Tools udostępnia funkcje zamiany mowy na tekst i zamianę tekstu na mowę, które można zintegrować z aplikacjami sztucznej inteligencji. Dzięki tym funkcjom można transkrybować dźwięk do tekstu i syntetyzować naturalnie brzmiącą mowę z tekstu.
Te możliwości można wywoływać bezpośrednio za pośrednictwem zestawu SPEECH SDK lub interfejsów API REST, ale można je również udostępnić agentowi sztucznej inteligencji za pośrednictwem serwera MCP (Azure Speech Model Context Protocol). Takie podejście umożliwia agentowi obsługę zadań mowy na podstawie żądania języka naturalnego użytkownika bez konieczności pisania określonego kodu dla każdej operacji mowy.
Załóżmy na przykład, że pracujesz w firmie, która musi przetwarzać połączenia z pomocą techniczną klienta. Twój zespół musi transkrybować zarejestrowane rozmowy na tekst do analizy i generować odpowiedzi audio, które mogą być odtwarzane klientom. Zamiast tworzyć oddzielne integracje na potrzeby transkrypcji i syntezy, można utworzyć agenta sztucznej inteligencji, który używa serwera MCP usługi Azure Speech do wykonywania obu zadań za pośrednictwem jednego połączenia narzędzia.
W tym module dowiesz się, jak działa serwer MCP usługi Azure Speech, jak połączyć go z agentem sztucznej inteligencji w rozwiązaniu Microsoft Foundry oraz jak utworzyć aplikację kliencką, która programowo współdziała z agentem.
Uwaga / Notatka
Zdajemy sobie sprawę, że różni ludzie lubią uczyć się na różne sposoby. Możesz ukończyć ten moduł w formacie wideo lub przeczytać zawartość jako tekst i obrazy. Tekst zawiera więcej szczegółów niż filmy wideo, więc w niektórych przypadkach możesz chcieć odwoływać się do niego jako materiał uzupełniający do prezentacji wideo.
Uwaga / Notatka
Serwer MCP usługi Azure Speech jest obecnie w publicznej wersji zapoznawczej. Szczegóły opisane w tym module mogą ulec zmianie.