Konfigurieren Sie Echtzeitagenten

Note

Dieser Artikel beschreibt Funktionen, die in Agenten oder Agent-Abläufen verwendet werden, die auf dem Standard-Harness basieren.

Um einen Echtzeit-Agenten bereitzustellen, aktivieren Sie das Echtzeitmodell, konfigurieren Sie die Kern-Agenteneinstellungen und richten Sie dann die erforderlichen kanalspezifischen Funktionen ein. Du kannst denselben Agenten auf den Sprachkanal, digitale Nachrichtenkanäle oder beide einsetzen.

Note

Echtzeit-Agenten sind für digitale Nachrichtenkanäle als Vorschau verfügbar. Funktionen in der Vorschauversion sind nicht für den Produktionseinsatz gedacht und können eine eingeschränkte Funktionalität aufweisen. Diese Features unterliegen ergänzenden Nutzungsbedingungen. Microsoft stellt sie vor einer offiziellen Veröffentlichung zur Verfügung, damit Kunden frühzeitig Zugang erhalten und Feedback geben können.

Einrichtung und Aktivierung von Echtzeitagenten

  1. Erstellen Sie einen neuen Agent, und konfigurieren Sie die grundlegenden Details, z. B. einen beschreibenden Namen und den Zweck des Agents in der Beschreibung.

  2. Gehe in die Sprach-Einstellungen des Agenten und aktiviere Stimme aktivieren. Wählen Sie unter StimmtypEchtzeit aus.

    Important

    Diese Einstellung ist eine einmalige Auswahl. Nachdem du Real-time ausgewählt hast, kannst du nicht mehr zu einem einfachen Agententyp zurückwechseln. Um einen einfachen Agenten zu verwenden, erstelle einen neuen Agenten. Diese Einstellung ist auch dann erforderlich, wenn Sie den Agenten auf einem digitalen Nachrichtenkanal verwenden.

  3. Wählen Sie das Modell aus, das Sie verwenden möchten: GPT-Realtime, GPT-Realtime-Mini oder GPT-5-Chat (Vorschau). GPT-5-Chat (Vorschau) ist ein Text-LLM-Sprachmodell, das Sprachantworten über Microsoft Neural Text-to-Speech (TTS) generiert.
    Erfahren Sie mehr darüber, wie diese Modelle basierend auf ihren unterstützten Regionen und Bereitstellungsüberlegungen funktionieren. Die folgende Tabelle beschreibt die Szenarien, in denen Sie verschiedene Modelle verwenden können.

    Scenario GPT-Realtime GPT-5-Chat (Vorschau)
    Konversationsstil Natürliche Sprach-zu-Sprach-Interaktionen Sprache wird zum Schlussfolgern in Text umgewandelt und dann wieder in die Sprache synthetisiert
    Latenz Niedrigste Latenz für natürliche Gespräche Höhere Latenz als GPT-Realtime
    Sprachanpassung Unterstützt die integrierten Echtzeit-Sprachoptionen, die für Echtzeit-Sprachagenten verfügbar sind Unterstützt Microsoft Neural Text-to-Speech (TTS), einschließlich eines breiteren Sprachkatalogs und benutzerdefinierter Sprachmodelle
    Markenspezifische Spracherlebnisse Begrenzte Anpassungsmöglichkeiten Empfohlen, wenn Sie eine individuelle oder gebrandete Spracherfahrung benötigen
    Regionale Einsatzflexibilität Beschränkt auf unterstützte Echtzeitmodellregionen Größere Flexibilität durch Spracherkennung und TTS-Dienste
    Am besten geeignet für Natürliche, latenzarme Sprachgespräche und offene Interaktionen Szenarien, die fortschrittliche Sprachanpassung, benutzerdefinierte Stimmen, Compliance-Anforderungen oder regionale Bereitstellungsflexibilität erfordern

    Tip

    • Nutzen Sie GPT-Echtzeit, wenn natürliche Gesprächsqualität und geringe Latenz die Hauptanforderungen sind.
    • Verwenden Sie GPT-Realtime-Mini (Vorschau) für Szenarien, die schnelle Sprachinteraktionen mit geringerer Latenz und Ressourcenverbrauch erfordern.
    • Verwenden Sie GPT-5-Chat (Vorschau), wenn Sprachanpassung, benutzerdefinierte Sprachmodelle oder Flexibilität in der Bereitstellung wichtiger sind als die Antwortlatenz.
  4. Wechseln Sie zu den Sicherheitseinstellungen des Agents, und wählen Sie "Keine Authentifizierung" aus.

Wissen und Tools

Sie können Ihren Agent für die Verwendung von Wissen und Tools konfigurieren. Erfahren Sie mehr in der Zusammenfassung der Wissensquellen, Hinzufügen von Tools zu benutzerdefinierten Agents und Tools, Wissen, MCP und API.

Geschachtelte Agenten (Vorschau)

Echtzeitagenten unterstützen nur Kinderagenten.

Important

Stellen Sie sicher, dass sich die Beschreibungen der Kindagenten nicht mit den Themenbeschreibungen überschneiden. Definieren Sie die Aufrufreihenfolge explizit in den Anweisungen des Agenten.

Themen

Echtzeit-Agenten unterstützen alle im Copilot Studio konfigurierten Themen. Verwenden Sie Themen, um deterministische Verhaltensweisen wie Begrüßungen, Geschäftsregeln und Eskalation zu definieren, während das von Ihnen gewählte Modell die konversationellen Antworten zur Laufzeit verwaltet. Erfahren Sie mehr in Auswahlmöglichkeiten zur Steuerung der Konversation.

Bewährte Methoden

  • Verwenden Sie Themen nur, wenn deterministisches Verhalten erforderlich ist.

  • Verwenden Sie statischen Text in Begrüßungsnachrichten für die schnellste erste Antwort. Dynamische Nachrichten mit Variablen und Ausdrücken erhöhen die anfängliche Latenz.

  • Deaktiviere das Thema Gesprächsstart, wenn du möchtest, dass das Echtzeit-Agentenmodell die Begrüßung übernimmt. Andernfalls wird die im Thema " Unterhaltungsstart " konfigurierte Begrüßung anstelle der Sprachmodell-Begrüßung wiedergegeben.

  • Lassen Sie das Echtzeit-Agentenmodell allgemeine Gespräche und Anschlussfragen übernehmen.

  • Fügen Sie eine explizite Aktion in das Thema " On Error " ein, z. B. "Übertragung" oder "Anruf beenden". Die Fehlerbehandlung nur für Nachrichten reicht nicht aus. Ohne einen deterministischen nächsten Schritt könnten Kunden für Sprachagenten Stille oder festgefahrene Anrufe für Nachrichtenkanäle erleben, was zu Verwirrung und schlechtem Kundenerlebnis führt.

  • Verwenden Sie explizite Themen- und Toolbeschreibungen, um den Besitz der Datensammlung zu deklarieren. Weitere Informationen finden Sie unter "Effektive Themen und Toolbeschreibungen schreiben".

Unterstützung von Themenknoten

Die folgende Liste beschreibt die Themenunterstützung in Echtzeitagenten:

Bedingungsknoten

Funktion Support
If/Else-Verzweigung Unterstützt
Power Fx-Ausdrücke Unterstützt
Neuverarbeitung der Steckplatzfüllung Unterstützt

Nachrichtenknoten

Feature Support
Grundlegende Nachricht Unterstützt
Nachrichtenvariationen Unterstützt
Variable Einfügung Unterstützt
SSML Nur Sprachkanal
Rich Media/Adaptive Karten  Wird nur für digitale Nachrichtenkanäle unterstützt. Diese Funktion befindet sich in der Vorschauversion. 
Schnelle Antworten Wird nur für digitale Nachrichtenkanäle unterstützt. Diese Funktion befindet sich in der Vorschauversion. 

Fragenknoten

Funktion Support
Prompttext Unterstützt
Automatische Haltefunktion Nicht unterstützt
Slot-Füllung Unterstützt
Überspringverhalten/Gieriges Slots-Ausfüllen Unterstützt
Erneute Eingabeaufforderung/Wiederholen Unterstützt
Ungültige Antwortbehandlung Unterstützt
Themenunterbrechung Unterstützt
Unterbrechung Unterstützt nur für den Sprachkanal.
Benutzerdefinierte erneute Eingabeaufforderung Unterstützt
DTMF-Eingabe Unterstützt nur für den Sprachkanal.
Stille-Erkennung Unterstützt nur für den Sprachkanal.

HTTP-Knoten

Feature Support
HTTP-Methoden: GET, POST, PUT, PATCH, DELETE Unterstützt
URL-Endpunkte Unterstützt
Header und Nutzlasten Unterstützt
Antwortanalyse und -schema Unterstützt
Variable Zuordnung Unterstützt
Fehlerbehandlung Unterstützt

Toolknoten

Funktion Support
Power Automate-Flow Unterstützt
Toolaufruf Unterstützt
Eingabe-/Ausgabezuordnung Unterstützt
Neue Eingabeaufforderung Unterstützt

Festlegen des Variablenwertknotens

Feature Support
Literalzuordnung Unterstützt
Ausdruckszuweisung Unterstützt
Variable zu Variable Unterstützt

Themenverwaltungsknoten

Feature Support
Aktuelles Thema beenden Unterstützt
Alle Themen beenden Unterstützt
Unterhaltung beenden Unterstützt
Zu Schritt gehen Unterstützt
Benutzereingabe zur Erkennung von Absichten Unterstützt
Wechseln sie zu einem anderen Thema Unterstützt

Transfer-Konversationsknoten

Feature Support
An Agent übertragen Unterstützt
Übertragung externer Telefonnummern Unterstützt nur für den Sprachkanal. 

Advanced

Funktion Support
Generative Antworten erstellen Unterstützt

Unterstützung für Systemtrigger

Auslöser Support Details
Beim Beginn der Konversation Unterstützt Wird ausgelöst, wenn eine neue Unterhaltung beginnt
Bei Kontaktaufnahme mit einem Vertreter Unterstützt Übertragung an menschliche Agenten
Unbekanntes Thema/unbekannte Absicht Nicht unterstützt Fallback, wenn kein passendes Thema gefunden wird
OnSelectIntent (mehrere Themen abgeglichen) Nicht unterstützt Mehrdeutigkeit zwischen ähnlichen Themen
Unterhaltung zurücksetzen (OnSystemRedirect) Unterstützt Löscht Variablen und startet den Ablauf neu
Beim Anmelden Nicht unterstützt
Unbekannte DTMF-Tastenbetätigung Unterstützt Nicht zugeordnete Tastatureingabe. Anwendbar nur für den Sprachkanal.
Der Agent wählt / Der Benutzer sagt einen Ausdruck Unterstützt Agent wählt Thema basierend auf Absicht aus.
Eine Nachricht wird empfangen Nicht unterstützt Erhöht die Latenz
Es wird ein benutzerdefiniertes Client-Ereignis ausgeführt Nicht unterstützt Nur beim Start der Sitzung
Die Gesprächsaktualisierung Nicht unterstützt Hinzugefügte oder entfernte Mitglieder, Sitzungsänderungen
Es wird aufgerufen Nicht unterstützt Erfordert synchrone UI
Es wird umgeleitet Unterstützt
Der Nutzer ist für einen bestimmten Zeitraum inaktiv. Unterstützt Timeout bei Benutzerinaktivität. Gilt nur für digitale Nachrichtenkanäle.
Stille-Erkennung Unterstützt Anwendbar nur für den Sprachkanal.
Der Plan ist abgeschlossen Nicht unterstützt
KI-Antwort generiert Nicht unterstützt
Bei einem Fehler Unterstützt Behandelt Orchestrierungsfehler

Variablen zwischen Themen und dem Sprachmodell übergeben

Wenn Sie Themen in einem hybriden Gesprächsfluss verwenden, ist ein Verständnis dafür, wie man Variablen zwischen Themen und dem Echtzeit-Sprachmodell übergibt, entscheidend für die Erstellung zuverlässiger, zustandsbehafteter Interaktionen. Dieser Prozess gilt über alle Kanäle hinweg.

Diese Funktionalität funktioniert durch den folgenden Prozess:

  • Sie übergeben Eingabevariablen, die für ein Thema definiert sind, zur Aufrufzeit an das Thema, sodass das Sprachmodell strukturierte Daten für den deterministischen Fluss bereitstellen kann.

  • Sie geben Ausgabevariablen, die für ein Thema definiert sind, an das Sprachmodell am Ende der Themenausführung als strukturierte Schlüsselwertpaare zurück.

  • Die Ausgaben von Werkzeugaufrufen folgen demselben Muster.

  • Das Sprachmodell wird mit konversationsbezogenem Kontext aufgefüllt, einschließlich Ausgabe aus Toolaufrufen in Schlüssel-Wert-Paaren. Sie geben jedoch nur explizit definierte Ausgabevariablen als strukturierte Daten zurück.

  • Die Variablenbeschreibung hilft dem Modell zu verstehen, wie die Variable während eines Gesprächs verwendet werden soll. Geben Sie klare und beschreibende Definitionen an.

Weitere Informationen finden Sie unter "Themeneingaben und -ausgaben verwalten".

Mehrsprachiger Support

Fügen Sie alle gewünschten sekundären Sprachen hinzu. Lokalisierungszeichenfolgen sind für Echtzeitflüsse nicht erforderlich. Für deterministische Themennachrichten müssen Sie jedoch die übersetzten Nachrichten bereitstellen. Weitere Informationen finden Sie unter Konfigurieren und Erstellen mehrsprachiger Agents.

Das Echtzeitmodell kann viele Sprachen verstehen und beantworten. Microsoft überprüft jedoch nicht formal alle Sprachen für die allgemeine Verfügbarkeit.

Stand Juni 2026 sind die folgenden Sprachen formell validiert:

  • Niederländisch (Niederlande) (nl-NL)
  • Englisch (Australien) (en-AU)
  • Englisch (Vereinigte Staaten) (en-US)
  • Englisch (Vereinigtes Königreich) (en-GB)
  • Französisch (Kanada) (fr-CA)
  • Französisch (Frankreich) (fr-FR)
  • Deutsch (Deutschland) (de-DE)
  • Italienisch (Italien) (it-IT)
  • Portugiesisch (Brasilien) (pt-BR)
  • Spanisch (Spanien) (es-ES)
  • Spanisch (USA) (es-US)

Microsoft überprüft weiterhin andere Sprachen und fügt sie nach Abschluss der Zertifizierung hinzu. Sie können jede sprache hinzufügen, die von Copilot Studio unterstützt wird. Sprachen, die nicht vollständig für die Qualität auf GA-Ebene zertifiziert sind, sollten jedoch vor der Produktionsbereitstellung gründlich getestet werden.

Important

Die technische Sprachfunktion ist nicht gleich einer unterstützten oder zertifizierten Sprache. Wenn Sie Agents in anderen Sprachen als Englisch bereitstellen möchten, sollten Sie umfangreiche Tests mit realen Anrufern und Anrufflüssen durchführen, bevor Sie live gehen.

Kontextvariablen

Ein Echtzeitagent unterstützt Kontextvariablen, die es ihm ermöglichen, intelligenter zu handeln, indem er Informationen über das Gespräch und den Kunden transportiert. Die verfügbaren Kontextvariablen hängen vom Kanal ab. Dieses Set umfasst:

Contextvariable Description
Kanal-ID Identifiziert den Kommunikationskanal, der für die Interaktion verwendet wird. Anwendbar nur für den Sprachkanal.
Telefonnummer des Anrufers (ANI) Die ursprüngliche Telefonnummer des Anrufers. Anwendbar nur für den Sprachkanal.
Nummer des Angerufenen (DNIS) Die Zieltelefonnummer, die der Anrufer gewählt hat. Anwendbar nur für den Sprachkanal.
Konversations-ID Ein eindeutiger Bezeichner für eine aktive Anrufsitzung.
SIP-Header Unterstützte SIP-Header-Schlüssel/Wert-Paare, die dem Anruf zugeordnet sind. Anwendbar nur für den Sprachkanal.
Aktuelles Datum (UTC) Das aktuelle Datum in koordinierter Weltzeit (COORDINATED Universal Time, UTC), das zur Laufzeit bereitgestellt wird, um datumsbezogene Antworten zuzulassen.
Aktuelle Uhrzeit (UTC) Die aktuelle Zeit in koordinierter Weltzeit (COORDINATED Universal Time, UTC), die zur Laufzeit bereitgestellt wird, um zeitbewusste Antworten zu ermöglichen.

Erfahren Sie mehr über alle anderen Kontextvariablen, einschließlich digitaler Nachrichten und benutzerdefinierter Kontextvariablen, in Configure context Variables for agents.

Kanalspezifische Einstellungen

Agentstimme

Wählen Sie die Stimme aus, die Ihr Agent verwendet, indem Sie Ihren Agenten auswählen und zu Einstellungen>Stimme>Stimme auswählen wechseln. Echtzeit-Agenten unterstützen folgende Stimmen:

  • Legierung
  • Asche
  • Ballade
  • Koralle
  • Echo
  • Salbei
  • Schimmer
  • Vers
  • Marin
  • Zeder

Note

  • Die Agentenstimme ist für Ihren Echtzeit-Agenten und nicht die, die im Copilot Service Admin Center konfiguriert ist.
  • Um die Nachrichtenstimmen deines Dynamics-Systems mit deinem Echtzeit-Agenten abzugleichen, verwenden Sie nur die folgenden unterstützten Stimmen: Alloy, Echo, Shimmer oder Ash.
  • Agenten, die Text-LLM, GPT-5-Chat (Preview) verwenden, erzeugen Sprachantworten über Microsoft Neural Text-to-Speech (TTS). Dieses Modell unterstützt einen breiteren Sprachkatalog und maßgeschneiderte Sprachmodelle, was es für Organisationen geeignet macht, die gebrandete Spracherlebnisse oder fortschrittliche Sprachanpassungen benötigen.

Sprachsensitivität

Die Sprachempfindlichkeits-Sprachaktivitätserkennung (Speech Sensitivity Voice Activity Detection, VAD) bestimmt, wann der Agent reagieren soll, nachdem der Anrufer das Sprechen beendet hat.

Verständnis von VAD-Typen

Echtzeit-Agenten unterstützen zwei VAD-Ansätze:

Screenshot des Dialogfelds

Serverbasierte VAD – Basierend auf Sound (Stille)

  • Erkennt das Ende der Spracherkennung basierend auf Audiosignalen (Stille Dauer, Lautstärke)

  • Reagiert schnell, sobald Stille erkannt wird

  • Am besten geeignet für strukturierte Interaktionen, kurze Antworten, laute Umgebungen

Semantischer VAD - Basierend auf Satzkontext

  • Bestimmt den Abschluss anhand der Bedeutung dessen, was gesagt wurde

  • Passt sich an natürliche Pausen, Füllwörter, nachfolgende Sprache an.

  • Am besten geeignet für: Unterhaltungsinteraktionen, komplexe Fragen, offene Diskussionen

Wählen Sie das richtige VAD aus

Verwenden Sie serverbasierte VAD, wenn alle folgenden Bedingungen erfüllt sind:

  • Interaktionen sind strukturiert (Menünavigation im IVR-Stil).
  • Antworten sind kurz und vorhersehbar.
  • Hintergrundgeräusche sind ein Problem (semantische Spracherkennung, VAD, kann zu lange warten).
  • Sie möchten schnelle, flüssige Dialogwechsel.

Verwenden Sie semantische VAD, wenn alle folgenden Bedingungen erfüllt sind:

  • Unterhaltungen sind offen gestaltet.
  • Anrufer können zögern oder Füllwörter verwenden ("um", "Lassen Sie mich denken...").
  • Fragen sind komplex (Anrufer erklären Situationen).
  • Der natürliche Gesprächsfluss wird priorisiert.

Konfigurieren Sie serverbasiertes VAD

Wechseln Sie zu Einstellungen>Sprache>Telefoneinstellungen>Spracheingabeempfindlichkeit>Sensitivität>basierend auf Geräusch (Stille).

Screenshot des Dialogfelds

Parameter Description Vorgabe Empfohlener Bereich
Schwellenwert Empfindlichkeit gegenüber Stimme versus Geräuschen (0-1-Skala) 0,6 0.5-0.7
Präfixabstand (ms) Vor dem Start der Spracherkennung aufgenommene Audiodaten 300 ms 200–500 ms
Stille Dauer (ms) Stille, die zum Beenden der Drehung erforderlich ist 750 Millisekunden 750–1000 ms

Threshold

  • Niedriger (0.3-0.4): Empfindlicher; nimmt ruhige Sprache auf, kann bei Hintergrundgeräuschen ausgelöst werden.
  • Höher (0,7-0,9): Weniger empfindlich; erfordert eine lautere Sprache, reduziert falsch ausgelöste Trigger.
  • Empfohlen: Beginnen Sie mit 0,5; Erhöht sich, wenn Hintergrundgeräusche falsche Auslöser verursachen.

Präfixauffüllung

  • Erfasst Audio vor der Spracherkennung (verhindert das Abschneiden des ersten Worts).
  • Niedriger (200 ms): Schnellere Antwort; könnte die erste Silbe verpassen.
  • Höher (500 ms): Sicherere Erfassung; geringe Verzögerung.
  • Empfohlen: 300 ms (guter Saldo).

Dauer der Stille

  • Wie lange der Anrufer still sein muss, bevor der Agent reagiert.
  • Niedrig (500 ms): Schneller Gesprächswechsel; könnte unterbrechen, falls der Anrufer mitten im Gedanken innehält.
  • Höher (1000 ms): Geduldiger; kann langsam wirken.
  • Empfohlen: Beginnen Sie mit 750 ms.

Konfigurieren Sie semantisches VAD

Wechseln Sie zu Einstellungen>Sprache>Telefoneinrichtung>Spracheingabe>Empfindlichkeit>Basierend auf dem Satzkontext.

Screenshot des Dialogfelds

Parameter: Eifer (wie schnell der Agent nach dem semantischen Abschluss reagiert)

Setting Behavior Am besten geeignet für:
Niedrig Wartet länger, sehr geduldig Anrufer, die laut denken und häufig Pausen machen
Medium Ausgeglichen (Standard) Allgemeine Unterhaltungen
Hoch Reagiert schnell Schnelle Interaktionen, einfache Fragen

DTMF-Konfiguration

Dual-Tone Multi-Frequency (DTMF) ermöglicht es Anrufern, Informationen über die Tastatur ihres Telefons einzugeben.

Sie können DTMF für Ihren Agenten sowohl auf der Themen- als auch auf globaler Ebene aktivieren. Wenn Sie es auf globaler Ebene festlegen möchten, wählen Sie Ihren Agenten aus und gehen Sie zu Einstellungen>Voice>Konversationsverhalten>DTMF.

Important

Beim Erstellen reiner DTMF-Erlebnisse konfigurieren Sie DTMF-Eingaben für jeden Eingabeknoten, einschließlich Menüauswahlen und mehrstelliger Eingaben wie Kontonummern oder PINs. Stellen Sie sicher, dass alle möglichen Kundeneingabepfade entsprechende DTMF-Zuordnungen haben, damit Nutzer die Konversation allein mit der Tastatureingabe navigieren und abschließen können.

Stille-Erkennung

Die Stilleerkennung ermöglicht es Echtzeitagenten, zu erkennen, wenn ein Anrufer für einen bestimmten Zeitraum keine Eingabe liefert. Richten Sie die Stille-Erkennung als globale Stimmeinstellung für den Agenten ein, indem Sie zu Einstellungen>Stimme>Gesprächsverhalten>Stille-Erkennung wechseln.

Important

  • Die Stilleerkennung ist standardmäßig nicht aktiviert. Wenn der Benutzer nicht spricht, wartet der Agent auf unbestimmte Zeit, ohne dazu aufzufordern. Aktivieren Sie die Erkennung von Stille explizit und konfigurieren Sie eine Nachricht zur erneuten Aufforderung, um stille Anrufer zu verarbeiten.
  • Das Standardmäßige Timeout für die Stilleerkennung beträgt 7.000 ms (7 Sekunden). Überprüfen Sie diesen Wert anhand Ihrer spezifischen Anwendungsfall- und Anruferumgebung, bevor Sie sie in der Produktion bereitstellen. Sieben Sekunden können für einige Anrufer zu lang oder zu kurz für andere sein, je nach Art der Interaktion, z. B. komplexe Fragen oder laute Umgebungen. Testen Sie mit realen Anrufdaten, um den geeigneten Schwellenwert für Ihr Szenario zu ermitteln.
  • Bevor Sie die Stilleerkennung aktivieren, stellen Sie sicher, dass das Verhalten, das Sie in Ihrem konfigurierten Stilleerkennungsthema festlegen (z. B. Eskalieren, Auflegen, Wiederaufforderung), beabsichtigt und für Ihren Anwendungsfall geeignet ist. Falsch konfiguriertes Fallbackverhalten, z. B. versehentliches Festlegen des Fallbacks auf Eskalieren, wenn die Absicht besteht, aufzulegen, oder umgekehrt, kann zu unerwarteten Anrufergebnissen führen.

Latenznachrichten

Fügen Sie Ihrem Agent Latenznachrichten oder Musik hinzu, wenn Hintergrundvorgänge länger als erwartet dauern. Um Latenznachrichten zu konfigurieren, gehen Sie zu Einstellungen>Sprach>Unterhaltung-Verhalten>Latenznachrichten.

Important

Da die Text LLM-Echtzeitagentenlösung mehrere aufeinanderfolgende Schritte (ASR, LLM, TTS) verwendet, erleben Anrufer einige Sekunden Stille zwischen dem Sprechen und dem Hören einer Antwort. Setze passende Erwartungen bei den Nutzern, zum Beispiel indem du einen Satz wie "Einen Moment bitte, ich schaue das für dich nach ..." verwenden.

Screenshot des Dialogfelds

Echtzeit-Agentenbewertung

Echtzeitagenten unterstützen das Senden von Text während der Auswertung, jedoch wird die Audioverarbeitung nicht unterstützt.