Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Note
Dieser Artikel beschreibt Funktionen, die in Agenten oder Agent-Abläufen verwendet werden, die auf dem Standard-Harness basieren.
Um einen Echtzeit-Agenten bereitzustellen, aktivieren Sie das Echtzeitmodell, konfigurieren Sie die Kern-Agenteneinstellungen und richten Sie dann die erforderlichen kanalspezifischen Funktionen ein. Du kannst denselben Agenten auf den Sprachkanal, digitale Nachrichtenkanäle oder beide einsetzen.
Note
Echtzeit-Agenten sind für digitale Nachrichtenkanäle als Vorschau verfügbar. Funktionen in der Vorschauversion sind nicht für den Produktionseinsatz gedacht und können eine eingeschränkte Funktionalität aufweisen. Diese Features unterliegen ergänzenden Nutzungsbedingungen. Microsoft stellt sie vor einer offiziellen Veröffentlichung zur Verfügung, damit Kunden frühzeitig Zugang erhalten und Feedback geben können.
Einrichtung und Aktivierung von Echtzeitagenten
Erstellen Sie einen neuen Agent, und konfigurieren Sie die grundlegenden Details, z. B. einen beschreibenden Namen und den Zweck des Agents in der Beschreibung.
Gehe in die Sprach-Einstellungen des Agenten und aktiviere Stimme aktivieren. Wählen Sie unter StimmtypEchtzeit aus.
Important
Diese Einstellung ist eine einmalige Auswahl. Nachdem du Real-time ausgewählt hast, kannst du nicht mehr zu einem einfachen Agententyp zurückwechseln. Um einen einfachen Agenten zu verwenden, erstelle einen neuen Agenten. Diese Einstellung ist auch dann erforderlich, wenn Sie den Agenten auf einem digitalen Nachrichtenkanal verwenden.
Wählen Sie das Modell aus, das Sie verwenden möchten: GPT-Realtime, GPT-Realtime-Mini oder GPT-5-Chat (Vorschau). GPT-5-Chat (Vorschau) ist ein Text-LLM-Sprachmodell, das Sprachantworten über Microsoft Neural Text-to-Speech (TTS) generiert.
Erfahren Sie mehr darüber, wie diese Modelle basierend auf ihren unterstützten Regionen und Bereitstellungsüberlegungen funktionieren. Die folgende Tabelle beschreibt die Szenarien, in denen Sie verschiedene Modelle verwenden können.Scenario GPT-Realtime GPT-5-Chat (Vorschau) Konversationsstil Natürliche Sprach-zu-Sprach-Interaktionen Sprache wird zum Schlussfolgern in Text umgewandelt und dann wieder in die Sprache synthetisiert Latenz Niedrigste Latenz für natürliche Gespräche Höhere Latenz als GPT-Realtime Sprachanpassung Unterstützt die integrierten Echtzeit-Sprachoptionen, die für Echtzeit-Sprachagenten verfügbar sind Unterstützt Microsoft Neural Text-to-Speech (TTS), einschließlich eines breiteren Sprachkatalogs und benutzerdefinierter Sprachmodelle Markenspezifische Spracherlebnisse Begrenzte Anpassungsmöglichkeiten Empfohlen, wenn Sie eine individuelle oder gebrandete Spracherfahrung benötigen Regionale Einsatzflexibilität Beschränkt auf unterstützte Echtzeitmodellregionen Größere Flexibilität durch Spracherkennung und TTS-Dienste Am besten geeignet für Natürliche, latenzarme Sprachgespräche und offene Interaktionen Szenarien, die fortschrittliche Sprachanpassung, benutzerdefinierte Stimmen, Compliance-Anforderungen oder regionale Bereitstellungsflexibilität erfordern Tip
- Nutzen Sie GPT-Echtzeit, wenn natürliche Gesprächsqualität und geringe Latenz die Hauptanforderungen sind.
- Verwenden Sie GPT-Realtime-Mini (Vorschau) für Szenarien, die schnelle Sprachinteraktionen mit geringerer Latenz und Ressourcenverbrauch erfordern.
- Verwenden Sie GPT-5-Chat (Vorschau), wenn Sprachanpassung, benutzerdefinierte Sprachmodelle oder Flexibilität in der Bereitstellung wichtiger sind als die Antwortlatenz.
Wechseln Sie zu den Sicherheitseinstellungen des Agents, und wählen Sie "Keine Authentifizierung" aus.
Wissen und Tools
Sie können Ihren Agent für die Verwendung von Wissen und Tools konfigurieren. Erfahren Sie mehr in der Zusammenfassung der Wissensquellen, Hinzufügen von Tools zu benutzerdefinierten Agents und Tools, Wissen, MCP und API.
Geschachtelte Agenten (Vorschau)
Echtzeitagenten unterstützen nur Kinderagenten.
Important
Stellen Sie sicher, dass sich die Beschreibungen der Kindagenten nicht mit den Themenbeschreibungen überschneiden. Definieren Sie die Aufrufreihenfolge explizit in den Anweisungen des Agenten.
Themen
Echtzeit-Agenten unterstützen alle im Copilot Studio konfigurierten Themen. Verwenden Sie Themen, um deterministische Verhaltensweisen wie Begrüßungen, Geschäftsregeln und Eskalation zu definieren, während das von Ihnen gewählte Modell die konversationellen Antworten zur Laufzeit verwaltet. Erfahren Sie mehr in Auswahlmöglichkeiten zur Steuerung der Konversation.
Bewährte Methoden
Verwenden Sie Themen nur, wenn deterministisches Verhalten erforderlich ist.
Verwenden Sie statischen Text in Begrüßungsnachrichten für die schnellste erste Antwort. Dynamische Nachrichten mit Variablen und Ausdrücken erhöhen die anfängliche Latenz.
Deaktiviere das Thema Gesprächsstart, wenn du möchtest, dass das Echtzeit-Agentenmodell die Begrüßung übernimmt. Andernfalls wird die im Thema " Unterhaltungsstart " konfigurierte Begrüßung anstelle der Sprachmodell-Begrüßung wiedergegeben.
Lassen Sie das Echtzeit-Agentenmodell allgemeine Gespräche und Anschlussfragen übernehmen.
Fügen Sie eine explizite Aktion in das Thema " On Error " ein, z. B. "Übertragung" oder "Anruf beenden". Die Fehlerbehandlung nur für Nachrichten reicht nicht aus. Ohne einen deterministischen nächsten Schritt könnten Kunden für Sprachagenten Stille oder festgefahrene Anrufe für Nachrichtenkanäle erleben, was zu Verwirrung und schlechtem Kundenerlebnis führt.
Verwenden Sie explizite Themen- und Toolbeschreibungen, um den Besitz der Datensammlung zu deklarieren. Weitere Informationen finden Sie unter "Effektive Themen und Toolbeschreibungen schreiben".
Unterstützung von Themenknoten
Die folgende Liste beschreibt die Themenunterstützung in Echtzeitagenten:
Bedingungsknoten
| Funktion | Support |
|---|---|
| If/Else-Verzweigung | Unterstützt |
| Power Fx-Ausdrücke | Unterstützt |
| Neuverarbeitung der Steckplatzfüllung | Unterstützt |
Nachrichtenknoten
| Feature | Support |
|---|---|
| Grundlegende Nachricht | Unterstützt |
| Nachrichtenvariationen | Unterstützt |
| Variable Einfügung | Unterstützt |
| SSML | Nur Sprachkanal |
| Rich Media/Adaptive Karten | Wird nur für digitale Nachrichtenkanäle unterstützt. Diese Funktion befindet sich in der Vorschauversion. |
| Schnelle Antworten | Wird nur für digitale Nachrichtenkanäle unterstützt. Diese Funktion befindet sich in der Vorschauversion. |
Fragenknoten
| Funktion | Support |
|---|---|
| Prompttext | Unterstützt |
| Automatische Haltefunktion | Nicht unterstützt |
| Slot-Füllung | Unterstützt |
| Überspringverhalten/Gieriges Slots-Ausfüllen | Unterstützt |
| Erneute Eingabeaufforderung/Wiederholen | Unterstützt |
| Ungültige Antwortbehandlung | Unterstützt |
| Themenunterbrechung | Unterstützt |
| Unterbrechung | Unterstützt nur für den Sprachkanal. |
| Benutzerdefinierte erneute Eingabeaufforderung | Unterstützt |
| DTMF-Eingabe | Unterstützt nur für den Sprachkanal. |
| Stille-Erkennung | Unterstützt nur für den Sprachkanal. |
HTTP-Knoten
| Feature | Support |
|---|---|
| HTTP-Methoden: GET, POST, PUT, PATCH, DELETE | Unterstützt |
| URL-Endpunkte | Unterstützt |
| Header und Nutzlasten | Unterstützt |
| Antwortanalyse und -schema | Unterstützt |
| Variable Zuordnung | Unterstützt |
| Fehlerbehandlung | Unterstützt |
Toolknoten
| Funktion | Support |
|---|---|
| Power Automate-Flow | Unterstützt |
| Toolaufruf | Unterstützt |
| Eingabe-/Ausgabezuordnung | Unterstützt |
| Neue Eingabeaufforderung | Unterstützt |
Festlegen des Variablenwertknotens
| Feature | Support |
|---|---|
| Literalzuordnung | Unterstützt |
| Ausdruckszuweisung | Unterstützt |
| Variable zu Variable | Unterstützt |
Themenverwaltungsknoten
| Feature | Support |
|---|---|
| Aktuelles Thema beenden | Unterstützt |
| Alle Themen beenden | Unterstützt |
| Unterhaltung beenden | Unterstützt |
| Zu Schritt gehen | Unterstützt |
| Benutzereingabe zur Erkennung von Absichten | Unterstützt |
| Wechseln sie zu einem anderen Thema | Unterstützt |
Transfer-Konversationsknoten
| Feature | Support |
|---|---|
| An Agent übertragen | Unterstützt |
| Übertragung externer Telefonnummern | Unterstützt nur für den Sprachkanal. |
Advanced
| Funktion | Support |
|---|---|
| Generative Antworten erstellen | Unterstützt |
Unterstützung für Systemtrigger
| Auslöser | Support | Details |
|---|---|---|
| Beim Beginn der Konversation | Unterstützt | Wird ausgelöst, wenn eine neue Unterhaltung beginnt |
| Bei Kontaktaufnahme mit einem Vertreter | Unterstützt | Übertragung an menschliche Agenten |
| Unbekanntes Thema/unbekannte Absicht | Nicht unterstützt | Fallback, wenn kein passendes Thema gefunden wird |
| OnSelectIntent (mehrere Themen abgeglichen) | Nicht unterstützt | Mehrdeutigkeit zwischen ähnlichen Themen |
| Unterhaltung zurücksetzen (OnSystemRedirect) | Unterstützt | Löscht Variablen und startet den Ablauf neu |
| Beim Anmelden | Nicht unterstützt | |
| Unbekannte DTMF-Tastenbetätigung | Unterstützt | Nicht zugeordnete Tastatureingabe. Anwendbar nur für den Sprachkanal. |
| Der Agent wählt / Der Benutzer sagt einen Ausdruck | Unterstützt | Agent wählt Thema basierend auf Absicht aus. |
| Eine Nachricht wird empfangen | Nicht unterstützt | Erhöht die Latenz |
| Es wird ein benutzerdefiniertes Client-Ereignis ausgeführt | Nicht unterstützt | Nur beim Start der Sitzung |
| Die Gesprächsaktualisierung | Nicht unterstützt | Hinzugefügte oder entfernte Mitglieder, Sitzungsänderungen |
| Es wird aufgerufen | Nicht unterstützt | Erfordert synchrone UI |
| Es wird umgeleitet | Unterstützt | |
| Der Nutzer ist für einen bestimmten Zeitraum inaktiv. | Unterstützt | Timeout bei Benutzerinaktivität. Gilt nur für digitale Nachrichtenkanäle. |
| Stille-Erkennung | Unterstützt | Anwendbar nur für den Sprachkanal. |
| Der Plan ist abgeschlossen | Nicht unterstützt | |
| KI-Antwort generiert | Nicht unterstützt | |
| Bei einem Fehler | Unterstützt | Behandelt Orchestrierungsfehler |
Variablen zwischen Themen und dem Sprachmodell übergeben
Wenn Sie Themen in einem hybriden Gesprächsfluss verwenden, ist ein Verständnis dafür, wie man Variablen zwischen Themen und dem Echtzeit-Sprachmodell übergibt, entscheidend für die Erstellung zuverlässiger, zustandsbehafteter Interaktionen. Dieser Prozess gilt über alle Kanäle hinweg.
Diese Funktionalität funktioniert durch den folgenden Prozess:
Sie übergeben Eingabevariablen, die für ein Thema definiert sind, zur Aufrufzeit an das Thema, sodass das Sprachmodell strukturierte Daten für den deterministischen Fluss bereitstellen kann.
Sie geben Ausgabevariablen, die für ein Thema definiert sind, an das Sprachmodell am Ende der Themenausführung als strukturierte Schlüsselwertpaare zurück.
Die Ausgaben von Werkzeugaufrufen folgen demselben Muster.
Das Sprachmodell wird mit konversationsbezogenem Kontext aufgefüllt, einschließlich Ausgabe aus Toolaufrufen in Schlüssel-Wert-Paaren. Sie geben jedoch nur explizit definierte Ausgabevariablen als strukturierte Daten zurück.
Die Variablenbeschreibung hilft dem Modell zu verstehen, wie die Variable während eines Gesprächs verwendet werden soll. Geben Sie klare und beschreibende Definitionen an.
Weitere Informationen finden Sie unter "Themeneingaben und -ausgaben verwalten".
Mehrsprachiger Support
Fügen Sie alle gewünschten sekundären Sprachen hinzu. Lokalisierungszeichenfolgen sind für Echtzeitflüsse nicht erforderlich. Für deterministische Themennachrichten müssen Sie jedoch die übersetzten Nachrichten bereitstellen. Weitere Informationen finden Sie unter Konfigurieren und Erstellen mehrsprachiger Agents.
Das Echtzeitmodell kann viele Sprachen verstehen und beantworten. Microsoft überprüft jedoch nicht formal alle Sprachen für die allgemeine Verfügbarkeit.
Stand Juni 2026 sind die folgenden Sprachen formell validiert:
- Niederländisch (Niederlande) (nl-NL)
- Englisch (Australien) (en-AU)
- Englisch (Vereinigte Staaten) (en-US)
- Englisch (Vereinigtes Königreich) (en-GB)
- Französisch (Kanada) (fr-CA)
- Französisch (Frankreich) (fr-FR)
- Deutsch (Deutschland) (de-DE)
- Italienisch (Italien) (it-IT)
- Portugiesisch (Brasilien) (pt-BR)
- Spanisch (Spanien) (es-ES)
- Spanisch (USA) (es-US)
Microsoft überprüft weiterhin andere Sprachen und fügt sie nach Abschluss der Zertifizierung hinzu. Sie können jede sprache hinzufügen, die von Copilot Studio unterstützt wird. Sprachen, die nicht vollständig für die Qualität auf GA-Ebene zertifiziert sind, sollten jedoch vor der Produktionsbereitstellung gründlich getestet werden.
Important
Die technische Sprachfunktion ist nicht gleich einer unterstützten oder zertifizierten Sprache. Wenn Sie Agents in anderen Sprachen als Englisch bereitstellen möchten, sollten Sie umfangreiche Tests mit realen Anrufern und Anrufflüssen durchführen, bevor Sie live gehen.
Kontextvariablen
Ein Echtzeitagent unterstützt Kontextvariablen, die es ihm ermöglichen, intelligenter zu handeln, indem er Informationen über das Gespräch und den Kunden transportiert. Die verfügbaren Kontextvariablen hängen vom Kanal ab. Dieses Set umfasst:
| Contextvariable | Description |
|---|---|
| Kanal-ID | Identifiziert den Kommunikationskanal, der für die Interaktion verwendet wird. Anwendbar nur für den Sprachkanal. |
| Telefonnummer des Anrufers (ANI) | Die ursprüngliche Telefonnummer des Anrufers. Anwendbar nur für den Sprachkanal. |
| Nummer des Angerufenen (DNIS) | Die Zieltelefonnummer, die der Anrufer gewählt hat. Anwendbar nur für den Sprachkanal. |
| Konversations-ID | Ein eindeutiger Bezeichner für eine aktive Anrufsitzung. |
| SIP-Header | Unterstützte SIP-Header-Schlüssel/Wert-Paare, die dem Anruf zugeordnet sind. Anwendbar nur für den Sprachkanal. |
| Aktuelles Datum (UTC) | Das aktuelle Datum in koordinierter Weltzeit (COORDINATED Universal Time, UTC), das zur Laufzeit bereitgestellt wird, um datumsbezogene Antworten zuzulassen. |
| Aktuelle Uhrzeit (UTC) | Die aktuelle Zeit in koordinierter Weltzeit (COORDINATED Universal Time, UTC), die zur Laufzeit bereitgestellt wird, um zeitbewusste Antworten zu ermöglichen. |
Erfahren Sie mehr über alle anderen Kontextvariablen, einschließlich digitaler Nachrichten und benutzerdefinierter Kontextvariablen, in Configure context Variables for agents.
Kanalspezifische Einstellungen
Agentstimme
Wählen Sie die Stimme aus, die Ihr Agent verwendet, indem Sie Ihren Agenten auswählen und zu Einstellungen>Stimme>Stimme auswählen wechseln. Echtzeit-Agenten unterstützen folgende Stimmen:
- Legierung
- Asche
- Ballade
- Koralle
- Echo
- Salbei
- Schimmer
- Vers
- Marin
- Zeder
Note
- Die Agentenstimme ist für Ihren Echtzeit-Agenten und nicht die, die im Copilot Service Admin Center konfiguriert ist.
- Um die Nachrichtenstimmen deines Dynamics-Systems mit deinem Echtzeit-Agenten abzugleichen, verwenden Sie nur die folgenden unterstützten Stimmen: Alloy, Echo, Shimmer oder Ash.
- Agenten, die Text-LLM, GPT-5-Chat (Preview) verwenden, erzeugen Sprachantworten über Microsoft Neural Text-to-Speech (TTS). Dieses Modell unterstützt einen breiteren Sprachkatalog und maßgeschneiderte Sprachmodelle, was es für Organisationen geeignet macht, die gebrandete Spracherlebnisse oder fortschrittliche Sprachanpassungen benötigen.
Sprachsensitivität
Die Sprachempfindlichkeits-Sprachaktivitätserkennung (Speech Sensitivity Voice Activity Detection, VAD) bestimmt, wann der Agent reagieren soll, nachdem der Anrufer das Sprechen beendet hat.
Verständnis von VAD-Typen
Echtzeit-Agenten unterstützen zwei VAD-Ansätze:
Serverbasierte VAD – Basierend auf Sound (Stille)
Erkennt das Ende der Spracherkennung basierend auf Audiosignalen (Stille Dauer, Lautstärke)
Reagiert schnell, sobald Stille erkannt wird
Am besten geeignet für strukturierte Interaktionen, kurze Antworten, laute Umgebungen
Semantischer VAD - Basierend auf Satzkontext
Bestimmt den Abschluss anhand der Bedeutung dessen, was gesagt wurde
Passt sich an natürliche Pausen, Füllwörter, nachfolgende Sprache an.
Am besten geeignet für: Unterhaltungsinteraktionen, komplexe Fragen, offene Diskussionen
Wählen Sie das richtige VAD aus
Verwenden Sie serverbasierte VAD, wenn alle folgenden Bedingungen erfüllt sind:
- Interaktionen sind strukturiert (Menünavigation im IVR-Stil).
- Antworten sind kurz und vorhersehbar.
- Hintergrundgeräusche sind ein Problem (semantische Spracherkennung, VAD, kann zu lange warten).
- Sie möchten schnelle, flüssige Dialogwechsel.
Verwenden Sie semantische VAD, wenn alle folgenden Bedingungen erfüllt sind:
- Unterhaltungen sind offen gestaltet.
- Anrufer können zögern oder Füllwörter verwenden ("um", "Lassen Sie mich denken...").
- Fragen sind komplex (Anrufer erklären Situationen).
- Der natürliche Gesprächsfluss wird priorisiert.
Konfigurieren Sie serverbasiertes VAD
Wechseln Sie zu Einstellungen>Sprache>Telefoneinstellungen>Spracheingabeempfindlichkeit>Sensitivität>basierend auf Geräusch (Stille).
| Parameter | Description | Vorgabe | Empfohlener Bereich |
|---|---|---|---|
| Schwellenwert | Empfindlichkeit gegenüber Stimme versus Geräuschen (0-1-Skala) | 0,6 | 0.5-0.7 |
| Präfixabstand (ms) | Vor dem Start der Spracherkennung aufgenommene Audiodaten | 300 ms | 200–500 ms |
| Stille Dauer (ms) | Stille, die zum Beenden der Drehung erforderlich ist | 750 Millisekunden | 750–1000 ms |
Threshold
- Niedriger (0.3-0.4): Empfindlicher; nimmt ruhige Sprache auf, kann bei Hintergrundgeräuschen ausgelöst werden.
- Höher (0,7-0,9): Weniger empfindlich; erfordert eine lautere Sprache, reduziert falsch ausgelöste Trigger.
- Empfohlen: Beginnen Sie mit 0,5; Erhöht sich, wenn Hintergrundgeräusche falsche Auslöser verursachen.
Präfixauffüllung
- Erfasst Audio vor der Spracherkennung (verhindert das Abschneiden des ersten Worts).
- Niedriger (200 ms): Schnellere Antwort; könnte die erste Silbe verpassen.
- Höher (500 ms): Sicherere Erfassung; geringe Verzögerung.
- Empfohlen: 300 ms (guter Saldo).
Dauer der Stille
- Wie lange der Anrufer still sein muss, bevor der Agent reagiert.
- Niedrig (500 ms): Schneller Gesprächswechsel; könnte unterbrechen, falls der Anrufer mitten im Gedanken innehält.
- Höher (1000 ms): Geduldiger; kann langsam wirken.
- Empfohlen: Beginnen Sie mit 750 ms.
Konfigurieren Sie semantisches VAD
Wechseln Sie zu Einstellungen>Sprache>Telefoneinrichtung>Spracheingabe>Empfindlichkeit>Basierend auf dem Satzkontext.
Parameter: Eifer (wie schnell der Agent nach dem semantischen Abschluss reagiert)
| Setting | Behavior | Am besten geeignet für: |
|---|---|---|
| Niedrig | Wartet länger, sehr geduldig | Anrufer, die laut denken und häufig Pausen machen |
| Medium | Ausgeglichen (Standard) | Allgemeine Unterhaltungen |
| Hoch | Reagiert schnell | Schnelle Interaktionen, einfache Fragen |
DTMF-Konfiguration
Dual-Tone Multi-Frequency (DTMF) ermöglicht es Anrufern, Informationen über die Tastatur ihres Telefons einzugeben.
Sie können DTMF für Ihren Agenten sowohl auf der Themen- als auch auf globaler Ebene aktivieren. Wenn Sie es auf globaler Ebene festlegen möchten, wählen Sie Ihren Agenten aus und gehen Sie zu Einstellungen>Voice>Konversationsverhalten>DTMF.
Important
Beim Erstellen reiner DTMF-Erlebnisse konfigurieren Sie DTMF-Eingaben für jeden Eingabeknoten, einschließlich Menüauswahlen und mehrstelliger Eingaben wie Kontonummern oder PINs. Stellen Sie sicher, dass alle möglichen Kundeneingabepfade entsprechende DTMF-Zuordnungen haben, damit Nutzer die Konversation allein mit der Tastatureingabe navigieren und abschließen können.
Stille-Erkennung
Die Stilleerkennung ermöglicht es Echtzeitagenten, zu erkennen, wenn ein Anrufer für einen bestimmten Zeitraum keine Eingabe liefert. Richten Sie die Stille-Erkennung als globale Stimmeinstellung für den Agenten ein, indem Sie zu Einstellungen>Stimme>Gesprächsverhalten>Stille-Erkennung wechseln.
Important
- Die Stilleerkennung ist standardmäßig nicht aktiviert. Wenn der Benutzer nicht spricht, wartet der Agent auf unbestimmte Zeit, ohne dazu aufzufordern. Aktivieren Sie die Erkennung von Stille explizit und konfigurieren Sie eine Nachricht zur erneuten Aufforderung, um stille Anrufer zu verarbeiten.
- Das Standardmäßige Timeout für die Stilleerkennung beträgt 7.000 ms (7 Sekunden). Überprüfen Sie diesen Wert anhand Ihrer spezifischen Anwendungsfall- und Anruferumgebung, bevor Sie sie in der Produktion bereitstellen. Sieben Sekunden können für einige Anrufer zu lang oder zu kurz für andere sein, je nach Art der Interaktion, z. B. komplexe Fragen oder laute Umgebungen. Testen Sie mit realen Anrufdaten, um den geeigneten Schwellenwert für Ihr Szenario zu ermitteln.
- Bevor Sie die Stilleerkennung aktivieren, stellen Sie sicher, dass das Verhalten, das Sie in Ihrem konfigurierten Stilleerkennungsthema festlegen (z. B. Eskalieren, Auflegen, Wiederaufforderung), beabsichtigt und für Ihren Anwendungsfall geeignet ist. Falsch konfiguriertes Fallbackverhalten, z. B. versehentliches Festlegen des Fallbacks auf Eskalieren, wenn die Absicht besteht, aufzulegen, oder umgekehrt, kann zu unerwarteten Anrufergebnissen führen.
Latenznachrichten
Fügen Sie Ihrem Agent Latenznachrichten oder Musik hinzu, wenn Hintergrundvorgänge länger als erwartet dauern. Um Latenznachrichten zu konfigurieren, gehen Sie zu Einstellungen>Sprach>Unterhaltung-Verhalten>Latenznachrichten.
Important
Da die Text LLM-Echtzeitagentenlösung mehrere aufeinanderfolgende Schritte (ASR, LLM, TTS) verwendet, erleben Anrufer einige Sekunden Stille zwischen dem Sprechen und dem Hören einer Antwort. Setze passende Erwartungen bei den Nutzern, zum Beispiel indem du einen Satz wie "Einen Moment bitte, ich schaue das für dich nach ..." verwenden.
Echtzeit-Agentenbewertung
Echtzeitagenten unterstützen das Senden von Text während der Auswertung, jedoch wird die Audioverarbeitung nicht unterstützt.