Omówienie serwera usługi Azure Speech MCP

Ukończone

Wskazówka

Aby uzyskać więcej szczegółów, zobacz kartę Tekst i obrazy .

Serwer MCP usługi Azure Speech łączy agentów sztucznej inteligencji z usługą Azure Speech w narzędziach Foundry za pośrednictwem protokołu MCP (Model Context Protocol). Przed rozpoczęciem eksplorowania serwera MCP usługi Mowa, warto zrozumieć, czym jest MCP i jak umożliwia agentom korzystanie z narzędzi zewnętrznych.

Co to jest protokół Model Context Protocol?

Protokół MCP (Model Context Protocol) to otwarty protokół definiujący sposób interakcji agentów sztucznej inteligencji z narzędziami zewnętrznymi, źródłami danych i usługami. Program MCP używa architektury klient-serwer z następującymi składnikami:

  • Host: aplikacja, która uruchamia agenta (np. Microsoft Foundry lub aplikację niestandardową).
  • Klient: składnik na hoście, który zarządza połączeniami z serwerami MCP i obsługuje komunikację.
  • Serwer: program, który udostępnia narzędzia, zasoby i monity, które agent może odkryć i wywołać.

Gdy agent łączy się z serwerem MCP, otrzymuje wykaz dostępnych narzędzi wraz z opisami tego, co robi każde narzędzie. Agent może następnie wybrać odpowiednie narzędzie na podstawie żądania użytkownika. Takie podejście jest nazywane dynamicznym odnajdywaniem narzędzi — agent nie potrzebuje zakodowanej na stałe wiedzy na temat każdego narzędzia. Zamiast tego wysyła zapytanie do serwera MCP w czasie wykonywania, aby dowiedzieć się, co jest dostępne.

Kluczową zaletą mcp dla agentów sztucznej inteligencji jest elastyczność. Narzędzia można dodawać, aktualizować lub usuwać na serwerze bez modyfikowania samego agenta. Agent zawsze ma dostęp do najnowszych definicji narzędzi, co ułatwia konserwację i skalowanie rozwiązań opartych na programie MCP.

Wskazówka

Aby dowiedzieć się więcej o architekturze MCP i sposobie tworzenia niestandardowych integracji narzędzi MCP, zobacz moduł Integrowanie narzędzi MCP z agentami AI platformy Azure .

Możliwości serwera usługi Azure Speech MCP

Serwer MCP usługi Azure Speech uwidacznia dwie podstawowe funkcje mowy jako narzędzia, które może wywołać dowolny agent zgodny z MCP.

Zdolność Opis
Zamiana mowy na tekst (Rozpoznawanie) Konwertuje pliki audio na tekst przy użyciu zaawansowanego rozpoznawania mowy. Obsługuje formatY WAV, MP3, OGG, FLAC, MP4, M4A, AAC i inne typowe formaty audio. Zawiera opcje wyboru języka, wskazówek fraz w celu zwiększenia dokładności, filtrowania wulgaryzmów oraz szczegółowych lub prostych formatów danych wyjściowych.
Zamiana tekstu na mowę (syntezowanie) Konwertuje tekst wejściowy na naturalnie brzmiące pliki audio przy użyciu głosów neuronowych technologii zamiany tekstu na mowę. Obsługuje wiele języków i głosów (na przykład en-US-JennyNeuralen-GB-SoniaNeural) i generuje dane wyjściowe w formatach WAV, MP3 lub innych.

Po połączeniu serwera MCP usługi Mowa z agentem agent otrzymuje dostępne narzędzia mowy i ich opisy. Na podstawie monitu użytkownika agent decyduje o tym, które narzędzie ma być wywoływane. Jeśli na przykład użytkownik mówi "Transkrypcja tego pliku audio", agent wywołuje narzędzie zamiany mowy na tekst. Jeśli użytkownik mówi "Generuj mowę z tego tekstu", agent wywołuje narzędzie zamiany tekstu na mowę.

Jak agent wybiera narzędzia

Proces wyboru narzędzia działa w następujący sposób:

  1. Użytkownik wysyła monit do agenta.
  2. Agent analizuje monit i określa, które zadanie mowy należy wykonać.
  3. Agent sprawdza dostępne narzędzia MCP i ich opisy, aby znaleźć najlepsze dopasowanie.
  4. Agent wywołuje wybrane narzędzie za pośrednictwem serwera MCP, przekazując odpowiednie dane wejściowe (adres URL pliku audio lub tekst).
  5. Serwer MCP przetwarza żądanie przy użyciu usługi Azure Speech i zwraca wyniki (transkrypowany tekst lub link do pliku audio).
  6. Agent przedstawia użytkownikowi wyniki w odpowiedzi języka naturalnego.

Agent obsługuje wybór narzędzi autonomicznie, więc nie trzeba pisać logiki routingu w celu określenia, czy monit wymaga zamiany mowy na tekst, czy zamiany tekstu na mowę.

Wymagania dotyczące magazynowania

W przeciwieństwie do narzędzi MCP tylko do tekstu serwer MCP usługi Azure Speech współpracuje z plikami audio, które wymagają konta usługi Azure Storage.

  • Zamiana tekstu na mowę: serwer MCP usługi Mowa zapisuje wygenerowane pliki audio w kontenerze usługi Azure Blob Storage. Odpowiedź agenta zawiera link do wygenerowanego pliku audio.
  • Zamiana mowy na tekst: agent może transkrybować pliki audio z publicznie dostępnego adresu URL lub z kontenera usługi Azure Blob Storage dostępnego za pomocą adresu URL z sygnaturą dostępu współdzielonego (SAS).

Po połączeniu serwera Speech MCP z agentem, należy podać SAS URL dla kontenera obiektów blob. Adres URL SAS przyznaje serwerowi MCP uprawnienia do odczytu i zapisu plików w tym kontenerze.

Ważna

Traktuj SAS URL jako tajne informacje. Użyj najkrótszego praktycznego czasu wygaśnięcia, określ zakres dla pojedynczego kontenera i nie osadzaj ich w kodzie źródłowym, monitach agenta ani transkrypcjach czatów.

Wymagania wstępne

Aby użyć serwera usługi Azure Speech MCP z agentem, potrzebne są następujące elementy:

  • Subskrypcja platformy Azure.
  • Zasób i projekt Foundry — potrzebujesz roli Współtwórca lub Właściciel w grupie zasobów. Zasób Foundry zawiera możliwości głosowe.
  • Konto magazynu Azure z kontenerem blob do przechowywania plików audio.
  • SAS URL dla kontenera obiektów blob z uprawnieniami do odczytu, zapisu, dodawania, tworzenia i przeglądania listy.

Zagadnienia dotyczące zabezpieczeń

Serwer usługi Azure Speech MCP używa uwierzytelniania opartego na kluczach. Podczas tworzenia połączenia należy podać klucz zasobu i URL sygnatury dostępu współdzielonego (SAS) kontenera obiektów blob. Postępuj zgodnie z najlepszymi rozwiązaniami:

  • Przechowuj klucze i adresy URL sygnatur dostępu współdzielonego w bezpiecznym magazynie tajnych i regularnie je zmieniaj.
  • Unikaj osadzania kluczy lub adresów URL sygnatur dostępu współdzielonego bezpośrednio w kodzie źródłowym, skryptach lub dokumentacji.
  • Użyj najkrótszego praktycznego czasu wygaśnięcia SAS i ogranicz jego zakres do minimum wymaganego dla zasobu.
  • Obracaj klucze natychmiast, jeśli podejrzewasz, że są narażone.