Konfiguruj agentów w czasie rzeczywistym

Uwaga / Notatka

W tym artykule opisano funkcje używane w agentach lub przepływach agentów obsługiwanych przez standardowe środowisko uruchomieniowe.

Aby wdrożyć agenta czasu rzeczywistego, włącz model czasu rzeczywistego, skonfiguruj podstawowe ustawienia agenta, a następnie ustaw wymagane funkcje specyficzne dla kanału. Możesz wdrożyć tego samego agenta na kanał głosowy, kanały wiadomości cyfrowych lub oba.

Uwaga / Notatka

Agenci w czasie rzeczywistym są w wersji zapoznawczej dla kanałów komunikacji cyfrowej. Funkcje w wersji zapoznawczej nie są przeznaczone do użytku w środowiskach produkcyjnych i mogą mieć ograniczoną funkcjonalność. Te funkcje podlegają dodatkowym warunkom użytkowania. Microsoft udostępnia je przed oficjalnym wydaniem, aby klienci mogli uzyskać wcześniejszy dostęp i przekazać opinie.

Konfiguruj i włączaj agentów w czasie rzeczywistym

  1. Utwórz nowego agenta i skonfiguruj jego podstawowe szczegóły, takie jak nazwa opisowa i przeznaczenie agenta w opisie.

  2. Wejdź do ustawień głosu agenta i włącz Włączenie głosu. W polu Typ głosu wybierz Real-time.

    Ważna

    To ustawienie jest jednorazowym wyborem. Po wybraniu Czasu Rzeczywistego nie możesz wrócić do podstawowego typu agenta. Aby korzystać z podstawowego agenta, stwórz nowego agenta. To ustawienie jest wymagane nawet jeśli korzystasz z agenta na kanale komunikacji cyfrowej.

  3. Wybierz model, którego chcesz użyć: GPT-Realtime, GPT-Realtime-Mini lub GPT-5-Chat (Podgląd). GPT-5-Chat (Preview) to głosowy model LLM oparty na tekście, który generuje odpowiedzi głosowe przy użyciu technologii Microsoft Neural Text-to-Speech (TTS).
    Dowiedz się więcej o tym, jak działają te modele, na podstawie ich wspieranych regionów oraz aspektów wdrożenia. Poniższa tabela opisuje scenariusze, w których można używać różnych modeli.

    Scenario GPT-Realtime GPT-5-Chat (Zapowiedź)
    Styl konwersacji Interakcje między osobami posługującymi się tym samym językiem Mowa jest przekształcana w tekst do rozumowania, a następnie syntetyzowana z powrotem do mowy
    Opóźnienie Najniższe opóźnienie w naturalnych rozmowach Wyższe opóźnienia niż GPT-Realtime
    Personalizacja głosu Obsługuje wbudowane opcje głosu w czasie rzeczywistym dostępne dla agentów głosowych w czasie rzeczywistym Obsługuje Microsoft Neural Text-to-Speech (TTS), w tym szerszy katalog głosu oraz niestandardowe modele głosowe
    Doświadczenia głosowe marki Ograniczone opcje personalizacji Polecam, gdy potrzebujesz niestandardowego lub markowego doświadczenia głosowego
    Elastyczność regionalnego wdrożenia Ograniczone do obsługiwanych regionów dla modeli czasu rzeczywistego Większa elastyczność dzięki rozpoznawaniu mowy i usługom TTS
    Najlepiej nadaje się do Naturalne rozmowy głosowe o niskich opóźnieniach i interakcje o otwartym charakterze Scenariusze wymagające zaawansowanej personalizacji głosu, niestandardowych głosów, wymagań zgodności lub elastyczności regionalnego wdrożenia

    Porada

    • Używaj GPT-Realtime, gdy podstawą są naturalna jakość rozmów i niskie opóźnienia.
    • Używaj GPT-Realtime-Mini (Podgląd ) w sytuacjach wymagających szybkich interakcji mowy z niższym opóźnieniem i niższym zużyciem zasobów.
    • Używaj GPT-5-Chat (Wersja zapoznawcza), gdy personalizacja głosu, niestandardowe modele głosowe lub elastyczność wdrożenia są ważniejsze niż opóźnienie odpowiedzi.
  4. Przejdź do ustawień zabezpieczeń agenta i wybierz pozycję Brak uwierzytelniania.

Wiedza i narzędzia

Agenta można skonfigurować tak, aby używał wiedzy i narzędzi. Dowiedz się więcej w Podsumowaniu źródeł wiedzy, Dodaj narzędzia do agentów niestandardowych i Narzędzia, wiedzę, MCP i interfejs API.

Zagnieżdżeni agenci (wersja próbna)

Agenci działający w czasie rzeczywistym obsługują tylko agentów podrzędnych.

Ważna

Upewnij się, że opisy agentów podrzędnych nie nakładają się na opisy tematów. Jawnie zdefiniuj kolejność wywołań w instrukcjach agenta.

Topics

Agenci w czasie rzeczywistym obsługują wszystkie tematy skonfigurowane w Copilot Studio. Używaj tematów do definiowania zachowań deterministycznych, takich jak powitania, reguły biznesowe i eskalacja, podczas gdy wybrany model zarządza odpowiedziami konwersacyjnymi w czasie działania. Dowiedz się więcej w artykule Wybieranie sposobu kontrolowania konwersacji.

Najlepsze rozwiązania

  • Używaj tematów tylko wtedy, gdy wymagane jest zachowanie deterministyczne.

  • Użyj statycznego tekstu w wiadomościach powitania, aby uzyskać najszybszą pierwszą odpowiedź. Komunikaty dynamiczne ze zmiennymi i wyrażeniami zwiększają opóźnienie początkowe.

  • Wyłącz temat Rozpoczęcie rozmowy , jeśli chcesz, aby model agenta w czasie rzeczywistym zajmował się powitaniem. W przeciwnym razie powitanie skonfigurowane w temacie Rozpoczęcie konwersacji jest odtwarzane zamiast powitania modelu głosowego.

  • Pozwól modelowi agenta w czasie rzeczywistym zarządzać ogólną rozmową i pytaniami uzupełniającymi.

  • Dodaj jawne działanie w sekcji On Error, takie jak transfer lub zakończenie połączenia. Obsługa błędów oparta wyłącznie na komunikatach nie jest wystarczająca. Bez deterministycznego kolejnego kroku klienci mogą doświadczać ciszy ze strony agentów głosowych lub zablokowanych połączeń w kanałach komunikatorów, co prowadzi do zamieszania i złego doświadczenia klienta.

  • Użyj jawnych opisów tematów i narzędzi, aby zadeklarować własność zbierania danych. Dowiedz się więcej w artykule Pisanie skutecznych tematów i opisów narzędzi.

Obsługa węzłów tematycznych

Poniższa lista zawiera opis obsługi tematów w agentach w czasie rzeczywistym:

Węzeł Warunek

Feature Support
Rozgałęzienie If/Else Obsługiwane
Wyrażenia Power Fx Obsługiwane
Ponowne przetwarzanie wypełnienia gniazda Obsługiwane

Węzeł komunikatowy

Funkcja Support
Komunikat podstawowy Obsługiwane
Odmiany komunikatów Supported
Wstawienie zmiennej Supported
SSML Tylko kanał głosowy
Multimedia interaktywne/karty adaptacyjne  Obsługiwane tylko dla kanałów komunikacji cyfrowej. Ta funkcja jest dostępna w wersji zapoznawczej. 
Szybkie odpowiedzi Obsługiwane tylko dla kanałów komunikacji cyfrowej. Ta funkcja jest dostępna w wersji zapoznawczej. 

Węzeł Pytanie

Feature Support
Tekst zachęty Supported
Automatyczne wstrzymanie Niewspierane
Wypełnianie slotów Supported
Zachowanie pomijania/nadmiarowe wypełnianie gniazd Supported
Ponowny monit/ponowienie próby Supported
Nieprawidłowa obsługa odpowiedzi Supported
Przerwa w temacie Supported
Wkraczanie Obsługiwane tylko dla kanału głosowego.
Wiadomość niestandardowa z ponownym poleceniem Supported
Dane wejściowe DTMF Obsługiwane tylko dla kanału głosowego.
Wykrywanie ciszy Obsługiwane tylko dla kanału głosowego.

Węzeł HTTP

Funkcja Support
Metody HTTP: GET, POST, PUT, PATCH, DELETE Obsługiwane
Punkty końcowe adresu URL Obsługiwane
Nagłówki i ładunki Obsługiwane
Analizowanie odpowiedzi i schemat Obsługiwane
Mapowanie zmiennych Obsługiwane
Obsługa błędów Obsługiwane

Węzeł narzędzia

Feature Support
Przepływ Power Automate Supported
Wywołanie narzędzia Supported
Mapowanie danych wejściowych/wyjściowych Supported
Nowy monit Supported

Ustawianie węzła wartości zmiennej

Funkcja Support
Przypisanie literału Obsługiwane
Przypisanie wyrażenia Obsługiwane
Zmienna do zmiennej Obsługiwane

Węzeł zarządzania tematami

Funkcja Support
Zakończ bieżący temat Obsługiwane
Kończ wszystkie tematy Obsługiwane
Zakończ konwersację Obsługiwane
Przejdź do kroku Obsługiwane
Dane wejściowe użytkownika do rozpoznawania intencji Obsługiwane
Przejdź do innego tematu Obsługiwane

Przenoszenie węzła konwersacji

Funkcja Support
Przekaż do agenta Obsługiwane
Transfer numeru telefonu zewnętrznego Obsługiwane tylko dla kanału głosowego. 

Zaawansowany

Feature Support
Tworzenie odpowiedzi generacyjnych Obsługiwane

Obsługa wyzwalacza systemu

Trigger Support Details
Po rozpoczęciu konwersacji Supported Uruchamia się, gdy rozpoczyna się nowa konwersacja
Rozmowa z przedstawicielem Supported Transfery do agenta ludzkiego
Nieznany temat/w nieznanej intencji Niewspierane Zapasowe rozwiązanie, gdy żaden temat nie pasuje
OnSelectIntent (wiele dopasowanych tematów) Niewspierane Rozróżnienie pomiędzy podobnymi tematami
Resetuj konwersację (OnSystemRedirect) Supported Czyści zmienne i ponownie uruchamia przepływ
Podczas logowania Niewspierane
Naciśnięcie nieznanego klawisza DTMF Supported Niemapowane wejście na klawiaturze. Dotyczy tylko kanałów głosowych.
Agent wybiera / Użytkownik mówi frazę Supported Agent wybiera temat na podstawie intencji
Zostaje odebrana wiadomość Niewspierane Zwiększa opóźnienie
Występuje niestandardowe zdarzenie klienta Niewspierane Tylko podczas rozpoczęcia sesji
Aktualizacja konwersacji Niewspierane Członkowie dodani lub usunięci, zmiany sesji
Jest wywoływany Niewspierane Wymaga synchronicznego interfejsu użytkownika
Nastąpi przekierowanie Supported
Użytkownik jest nieaktywny przez określony czas. Supported Limit czasu bezczynności użytkownika Dotyczy tylko kanałów wiadomości cyfrowych.
Wykrywanie ciszy Supported Dotyczy tylko kanałów głosowych.
Plan zostaje ukończony Niewspierane
Wygenerowana odpowiedź sztucznej inteligencji Niewspierane
W przypadku błędu Supported Obsługuje błędy orkiestracji

Przekazywanie zmiennych między tematami a modelem językowym

Jeśli używasz tematów w hybrydowym przepływie konwersacji, zrozumienie sposobu przekazywania zmiennych między tematami i modelem języka w czasie rzeczywistym ma kluczowe znaczenie dla tworzenia niezawodnych, stanowych interakcji. Proces ten dotyczy wszystkich kanałów.

Ta funkcja działa w ramach następującego procesu:

  • Zmienne wejściowe zdefiniowane dla tematu są przekazywane do niego w momencie wywołania, dzięki czemu model językowy może dostarczać dane ustrukturyzowane przepływowi deterministycznemu.

  • Zmienne wyjściowe zdefiniowane w temacie są zwracane do modelu językowego na końcu wykonywania tematu jako ustrukturyzowane pary klucz-wartość.

  • Wyniki wywołań narzędzi przebiegają według tego samego wzoru.

  • Model językowy jest wypełniany kontekstem konwersacyjnym, w tym parami klucz-wartość danych wyjściowych wywołania narzędzia. Jednak zwracane są tylko jawnie zdefiniowane zmienne wyjściowe jako dane ustrukturyzowane.

  • Opis zmiennej pomaga modelowi zrozumieć, jak używać tej zmiennej podczas rozmowy. Dostarcz jasne i opisowe definicje.

Dowiedz się więcej w temacie Manage topic inputs and outputs (Zarządzanie danymi wejściowymi i wyjściowymi tematu).

Obsługa wielu języków

Dodaj wszystkie potrzebne języki pomocnicze. Ciągi lokalizacji nie są wymagane w przypadku żadnych przepływów w czasie rzeczywistym. Jednak w przypadku komunikatów dotyczących tematów deterministycznych należy podać przetłumaczone komunikaty. Dowiedz się więcej w temacie Konfigurowanie i tworzenie agentów wielojęzycznych.

Model w czasie rzeczywistym może zrozumieć i odpowiedzieć w wielu językach. Jednak Microsoft nie weryfikuje formalnie wszystkich języków pod kątem ogólnej dostępności.

Na czerwiec 2026 roku następujące języki zostały formalnie zatwierdzone:

  • Język niderlandzki (Holandia) (nl-NL)
  • Angielski (Australia) (en-AU)
  • Język angielski (Stany Zjednoczone) (en-US)
  • Angielski (Zjednoczone Królestwo) (en-GB)
  • Francuski (Kanada) (fr-CA)
  • Francuski (Francja) (fr-FR)
  • Niemiecki (Niemcy) (de-DE)
  • Włoski (Włochy) (it-IT)
  • Portugalski (Brazylia) (pt-BR)
  • Hiszpański (Hiszpania) (es-ES)
  • Hiszpański (Stany Zjednoczone) (es-US)

Firma Microsoft nadal weryfikuje inne języki i dodaje je po zakończeniu certyfikacji. Możesz dodać dowolny język obsługiwany przez copilot Studio. Jednak języki, które nie są w pełni certyfikowane pod kątem jakości ogólnie dostępnej, powinny być dokładnie przetestowane przed wdrożeniem produkcyjnym.

Ważna

Możliwości języka technicznego nie są równoznaczne z obsługiwanym ani certyfikowanym językiem. Jeśli zamierzasz wdrożyć agentów w językach innych niż angielski, przed rozpoczęciem pracy na żywo należy przeprowadzić obszerne testy przy użyciu rzeczywistych rozmówców i przepływów połączeń.

Zmienne kontekstu

Agent działający w czasie rzeczywistym wspiera zmienne kontekstowe, które pozwalają mu działać bardziej inteligentnie, przekazując informacje o rozmowie i kliencie. Dostępne zmienne kontekstowe zależą od kanału. Ten zestaw obejmuje:

Zmienna kontekstu Opis
Identyfikator kanału Identyfikuje kanał komunikacyjny używany do interakcji. Dotyczy tylko kanałów głosowych.
Numer telefonu rozmówców (ANI) Źródłowy numer telefonu rozmówcy. Dotyczy tylko kanałów głosowych.
Numer docelowy (DNIS) Docelowy numer telefonu wybrany przez rozmówcę. Dotyczy tylko kanałów głosowych.
Identyfikator konwersacji Unikatowy identyfikator aktywnej sesji połączenia.
Nagłówki SIP Zestaw obsługiwanych par klucz-wartość nagłówków SIP powiązanych z połączeniem. Dotyczy tylko kanałów głosowych.
Bieżąca data (UTC) Bieżąca data w uniwersalnym czasie koordynowanym (UTC) udostępniana w czasie działania w celu umożliwienia odpowiedzi uwzględniających daty.
Bieżąca godzina (UTC) Bieżący czas w uniwersalnym czasie koordynowanym (UTC), podany w czasie wykonywania, aby umożliwić odpowiedzi uwzględniające czas.

Dowiedz się więcej o wszystkich pozostałych zmiennych kontekstowych, w tym o wiadomościach cyfrowych i niestandardowych zmiennych kontekstowych, w sekcji Konfiguruj zmienne kontekstu dla agentów.

Ustawienia kanałów głosowych

Te ustawienia obowiązują, gdy wdrażasz agenta na kanale głosowym.

Głos agenta

Wybierz głos, którego używa Twój agent, wybierając swojego agenta i przechodząc do Ustawień>Wybierz głos>.

Agenty głosowe GPT-Realtime

Agenci głosowi w czasie rzeczywistym korzystają z wbudowanego modelu mowy w czasie rzeczywistym i obsługują następujące czcionki głosowe:

  • Alloy
  • Popiół
  • Ballada
  • Coral
  • Echo
  • Sage
  • Migotanie
  • Wiersz tekstu
  • Marin
  • Cedar

GPT-5-Chat i SMS agentów LLM

Agenci korzystający z GPT-5-Chat generują odpowiedzi mowy za pomocą Microsoft Neural Text-to-Speech (TTS). Ci agenci wspierają:

  • Szerszy katalog głosów
  • Czcionki głosowe w językach wtórnych
  • Opcje kształtowania mowy, takie jak szybkość mówienia i wysokość głosu

Dostępne ustawienia obejmują:

  • Imię głosu: Wybierz głos, którego używa Twój agent.
  • Języki drugorzędne (tylko GPT-5-Chat): Konfiguruj czcionki głosowe dla języków drugorzędnych obsługiwanych przez Twojego agenta.
  • Szybkość mówienia (tylko GPT-5-Chat): Wolna, Normalna lub Szybka.
  • Wysokość głosu (tylko GPT-5-Chat): niska, średnia lub wysoka.

Uwaga / Notatka

  • Dla agentów połączonych z Dynamics Contact Center głos wybrany w Copilot Studio (Settings > Voice) jest głosem używanym przez agenta. Ustawienia głosu skonfigurowane w centrum administracyjnym usługi Dynamics Copilot Service nie zastępują ustawień głosu agenta.
  • Aby dopasować głosy komunikatów systemowych Dynamics do głosu agenta, użyj jednego ze wspólnych obsługiwanych głosów: Alloy, Ash, Echo lub Shimmer.

Czułość mowy

Wykrywanie aktywności głosu z uwzględnieniem czułości (VAD) określa, kiedy agent powinien odpowiedzieć po tym, jak rozmówca zakończy mówienie.

Zrozumienie typów VAD

Agenty działające w czasie rzeczywistym obsługują dwa podejścia VAD:

Zrzut ekranu przedstawiający okno dialogowe Czułość mowy.

  • VaD oparty na serwerze — oparty na dźwięku (milczenie)

    • Wykrywa koniec mowy na podstawie sygnałów dźwiękowych (czas trwania ciszy, głośność)

    • Reaguje szybko, gdy wykryje się cisza.

    • Najlepsze do uporządkowanych interakcji, krótkich odpowiedzi, hałaśliwych środowisk.

  • Semantyczna vaD — oparta na kontekście zdania

    • Określa zakończenie obrotu w oparciu o znaczenie tego, co zostało powiedziane

    • Dostosowuje się do naturalnych pauz, wypełniaczy i kończącej wypowiedzi.

    • Najlepsze do: interakcji konwersacyjnych, złożonych pytań, otwartych dyskusji.

Wybierz właściwy VAD

Użyj opartej na serwerze VAD, jeśli spełnione są wszystkie następujące warunki:

  • Interakcje mają strukturę (nawigacja w menu stylu IVR).
  • Odpowiedzi są krótkie i przewidywalne.
  • Szum tła jest problemem (semantyczny VAD może zbyt długo zwlekać).
  • Potrzebujesz szybkich, płynnych tur.

Użyj semantycznego VAD, gdy wszystkie następujące warunki są spełnione:

  • Konwersacje są otwarte.
  • Rozmówcy mogą się wahać lub używać wyrazów wypełniających, takich jak "yyy" lub "daj mi pomyśleć...".
  • Pytania są złożone (dzwoniący wyjaśniają sytuacje).
  • Priorytetem jest naturalny przepływ konwersacji.

Konfigurowanie serwerowej detekcji aktywności głosowej

Przejdź do Ustawienia>Głos>Konfiguracja telefonu>Wprowadzanie mowy>Wrażliwość>Na podstawie dźwięku (ciszy).

Zrzut ekranu przedstawiający okno dialogowe Czułość mowy ustawione na wartość Na podstawie dźwięku (ciszy).

Parametr Opis Wartość domyślna Zalecany zakres
Threshold Wrażliwość na głos a hałas (skala 0–1) 0,6 0.5-0.7
Dopełnianie prefiksów (ms) Dźwięk przechwytywany przed rozpoczęciem mowy 300 ms 200–500 ms
Czas trwania ciszy (ms) Milczenie jest wymagane do zakończenia rundy 750 milisekund 750–1000 ms
Threshold
  • Dolna (0,3–0,4): bardziej wrażliwa; wyłapuje cichą mowę, może wyzwalać dźwięki tła.
  • Wyższa (0,7-0,9): Mniej wrażliwa; wymaga głośniejszej mowy, zmniejsza liczbę fałszywych wyzwalaczy.
  • Zalecane: Zacznij od 0,5; Zwiększaj, jeśli szum tła powoduje fałszywe wyzwalacze.
Dopełnienie prefiksu
  • Przechwytuje dźwięk przed wykryciem mowy (uniemożliwia odcięcie pierwszego słowa).
  • Dolna (200 ms): szybsza odpowiedź; może przegapić pierwszą sylabę.
  • Wyższa (500 ms): Bezpieczniejsze przechwytywanie; niewielkie opóźnienie.
  • Zalecane: 300 ms (dobra równowaga).
Czas trwania ciszy
  • Jak długo obiekt wywołujący musi milczeć, zanim agent odpowie.
  • Dolna (500 ms): szybkie tury; możliwe zakłócenia, jeśli osoba dzwoniąca robi przerwę w połowie zdania.
  • Wyższa (1000 ms): Bardziej cierpliwy; może wydawać się wolniejszy.
  • Zalecane: Zacznij od 750 ms.

Skonfiguruj semantyczny moduł VAD

Przejdź do Ustawienia>Głos>Konfiguracja telefonu>Wprowadzanie mowy>Czułość>Na podstawie kontekstu zdania.

Zrzut ekranu przedstawiający okno dialogowe Czułość mowy ustawione na wartość Na podstawie kontekstu zdania.

Parametr: Chętność (jak szybko agent zareaguje po zakończeniu analizy semantycznej)

Setting Behavior Najlepsze dla
Low Czeka dłużej, bardzo cierpliwie Rozmówcy, którzy myślą głośno, częste przerwy
Medium Zrównoważony (wartość domyślna) Konwersacje ogólne
Wysoki Szybko reaguje Szybkie interakcje, proste pytania

Konfiguracja DTMF

Dual-Tone Multi-Frequency (DTMF) pozwala dzwoniącym wprowadzać informacje za pomocą klawiatury telefonu.

Możesz włączyć DTMF dla agenta zarówno na poziomie tematu, jak i na poziomie globalnym. Aby ustawić go na poziomie globalnym, wybierz agenta i przejdź do Ustawienia, Głos, Zachowanie rozmowy, DTMF.

Ważna

Podczas tworzenia interfejsów obsługiwanych wyłącznie za pomocą DTMF skonfiguruj obsługę danych wejściowych DTMF dla każdego węzła wejścia, w tym wyborów w menu oraz wielocyfrowych danych wejściowych, takich jak numery kont lub kody PIN. Upewnij się, że wszystkie możliwe ścieżki wejściowe dla klientów mają odpowiednie mapowania DTMF, aby użytkownicy mogli nawigować i kończyć rozmowę wyłącznie za pomocą klawiatury.

Wykrywanie ciszy

Wykrywanie ciszy pozwala agentom w czasie rzeczywistym rozpoznać, kiedy dzwoniący nie udziela żadnych danych przez określony czas. Skonfiguruj wykrywanie ciszy jako globalne ustawienie głosu dla agenta, przechodząc do Ustawienia>Głos>Zachowanie konwersacji>Wykrywanie ciszy.

Ważna

  • Wykrywanie ciszy nie jest domyślnie włączone. Jeśli użytkownik nie mówi, agent czeka na czas nieokreślony bez monitowania. Jawne włączenie wykrywania ciszy i konfiguracja komunikatu ponownego monitu do obsługi milczącego rozmówcy.
  • Domyślny limit czasu wykrywania ciszy wynosi 7000 ms (7 sekund). Przed wdrożeniem w środowisku produkcyjnym zweryfikuj tę wartość względem określonego przypadku użycia i środowiska wywołującego. Siedem sekund może wydawać się zbyt długie dla niektórych rozmówców lub zbyt krótki dla innych w zależności od charakteru interakcji, na przykład złożonych pytań lub hałaśliwych środowisk. Przetestuj przy użyciu rzeczywistych danych wywołań, aby określić odpowiedni próg dla danego scenariusza.
  • Przed włączeniem wykrywania ciszy upewnij się, że zachowanie skonfigurowane w temacie wykrywania ciszy (na przykład Eskalacja, Zawieszanie się, Reprompt) jest zamierzone i odpowiednie dla danego przypadku użycia. Nieprawidłowo skonfigurowane zachowanie rezerwowe, takie jak nieumyślne ustawienie eskalacji jako działania rezerwowego, gdy intencją jest rozłączenie, lub odwrotnie, może prowadzić do nieoczekiwanych wyników połączenia.

Wiadomości o opóźnieniu

Dodaj komunikat o opóźnieniu lub muzykę do agenta, gdy operacje w tle trwają dłużej niż oczekiwano. Aby skonfigurować komunikaty o opóźnieniach, przejdź do Ustawienia>Głos>Zachowanie konwersacji>Komunikaty o opóźnieniach.

Ważna

Ponieważ rozwiązanie Text LLM dla agentów czasu rzeczywistego wykorzystuje wiele kolejnych kroków (ASR, LLM, TTS), dzwoniący doświadczają kilku sekund ciszy między mówieniem a słyszeniem odpowiedzi. Ustal odpowiednie oczekiwania wobec użytkowników, na przykład, używając zwrotu typu "Chwileczkę, proszę, sprawdzę to dla ciebie...".

Zrzut ekranu przedstawiający okno dialogowe obsługi komunikatów o opóźnieniu.

Ocena agentów w czasie rzeczywistym

Agenty czasu rzeczywistego obsługują wysyłanie tekstu w trakcie oceny, ale nie obsługują przetwarzania audio.

Ustawienia kanału wiadomości cyfrowej (podgląd)

Te ustawienia obowiązują, gdy wdrażasz agenta na kanale wiadomości cyfrowych.

Zachowanie komunikatowe

Agenci w czasie rzeczywistym na kanałach komunikacji cyfrowej komunikują się za pomocą tekstu. Konwersacja korzysta z tego samego modelu AI, ale funkcje specyficzne dla głosu, takie jak DTMF, VAD, wtargnięcie i wybór głosu, nie mają zastosowania.

Obsługa bezczynności

Ustaw sposób, w jaki agent reaguje, gdy klient przestaje odpowiadać w konwersacji tekstowej. Użyj wyzwalaczy nieaktywności , aby zdefiniować zachowanie swojego agenta, gdy użytkownik jest nieaktywny.