Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Note
Denna artikel beskriver funktioner i agenter eller agentflöden som använder standard harness.
För att distribuera en realtidsagent, aktivera realtidsmodellen, konfigurera kärninställningarna för agenten och ställ sedan in de nödvändiga kanalspecifika funktionerna. Du kan distribuera samma agent till röstkanalen, digitala meddelandekanaler eller båda.
Note
Real-time agents är i förhandsversion för digitala meddelandekanaler. Förhandsversionsfunktioner ska inte användas i produktion och funktionerna kan vara begränsade. Dessa funktioner omfattas av kompletterande användningsvillkor. Microsoft tillhandahåller dem innan en officiell lansering så att kunder kan få tidig tillgång och ge feedback.
Sätt upp och aktivera realtidsagenter
Skapa en ny agent och konfigurera dess grundläggande information, till exempel ett beskrivande namn och syftet med agenten i beskrivningen.
Gå till agentens röstinställningar och slå på Aktivera röst. I Rösttyp, välj Real-time.
Important
Den här inställningen är ett engångsval. Efter att du valt Real-time kan du inte byta tillbaka till en grundläggande agenttyp. För att använda en grundläggande agent, skapa en ny agent. Denna inställning krävs även om du använder agenten på en digital meddelandekanal.
Välj den modell du vill använda, GPT-Realtime, GPT-Realtime-Mini eller GPT-5-Chat (Förhandsvisning). GPT-5-Chat (Förhandsgranskning) är en text-LLM-röstmodell som genererar röstsvar via Microsoft Neural Text-to-Speech (TTS).
Lär dig mer om hur dessa modeller fungerar baserat på deras stödda regioner och implementeringsöverväganden. Följande tabell beskriver scenarier där du kan använda olika modeller.Scenario GPT-Realtime GPT-5-Chat (Förhandsvisning) Konversationsformat Inhemska tal-till-tal-interaktioner Tal omvandlas till text för resonemang och syntetiseras sedan tillbaka till tal Fördröjning Lägst latens för naturliga konversationer Högre latens än GPT-Realtime Röstanpassning Stöder de inbyggda röstalternativen i realtid som finns för realtidsröstagenter Stöder Microsoft Neural Text-to-Speech (TTS), inklusive en bredare röstkatalog och anpassade röstmodeller Varumärkesbaserade röstupplevelser Begränsade anpassningsmöjligheter Rekommenderas när du behöver en anpassad eller varumärkesanpassad röstupplevelse Regional utplaceringsflexibilitet Begränsat till stödda realtidsmodellregioner Större flexibilitet genom taligenkänning och TTS-tjänster Passar bäst för Naturliga röstsamtal med låg latens och öppna interaktioner Scenarier som kräver avancerad röstanpassning, anpassade röster, efterlevnadskrav eller regional distributionsflexibilitet Tips/Råd
- Använd GPT-Realtime när naturlig konversationskvalitet och låg latens är de främsta kraven.
- Använd GPT-Realtime-Mini (Förhandsgranskning) för scenarier som kräver snabba talinteraktioner med lägre latens och resursanvändning.
- Använd GPT-5-Chat (Förhandsvisning) när röstanpassning, anpassade röstmodeller eller distribution av flexibilitet är viktigare än svarsfördröjning.
Gå till agentens säkerhetsinställningar och välj Ingen autentisering.
Kunskap och verktyg
Du kan konfigurera din agent så att den använder kunskap och verktyg. Läs mer i Sammanfattning av kunskapskällor, Lägg till verktyg till anpassade agenter och verktyg, kunskap, MCP och API.
Kapslade agenter (förhandsversion)
Realtidsagenter har bara stöd för underagenter.
Important
Se till att agentbeskrivningar för underordnade inte överlappar ämnesbeskrivningar. Definiera uttryckligen anropsordning i agentens instruktioner.
Ämnen
Realtidsagenter stödjer alla ämnen konfigurerade i Copilot Studio. Använd ämnen för att definiera deterministiska beteenden såsom hälsningar, affärsregler och eskalering, medan modellen du valt hanterar konversationssvar under körning. Läs mer i Välj hur du styr konversationen.
Metodtips
Använd endast ämnen när deterministiskt beteende krävs.
Använd statisk text i hälsningsmeddelanden för det snabbaste första svaret. Dynamiska meddelanden med variabler och uttryck ökar den inledande svarstiden.
Inaktivera ämnet Samtalsstart om du vill att realtidsagentmodellen ska hantera hälsningen. Annars spelas hälsningen som konfigurerats i konversationsstartavsnittet upp i stället för röstmodellens hälsning.
Låt realtidsagentmodellen hantera allmänna samtal och följdfrågor.
Inkludera en explicit åtgärd i avsnittet Vid fel , till exempel överföring eller slutanrop. Felhantering endast för meddelanden räcker inte. Utan ett förutbestämt nästa steg kan kunder möta tystnad i röstagenter eller konversationer som fastnar i meddelandekanaler, vilket leder till förvirring och en dålig kundupplevelse.
Använd explicita avsnitts- och verktygsbeskrivningar för att deklarera ägarskap för datainsamling. Läs mer i Skriva effektiva ämnes- och verktygsbeskrivningar.
Stöd för ämnesnod
Följande lista beskriver ämnesstöd i realtidsagenter:
Villkorsnod
| Feature | Support |
|---|---|
| If/Else-förgrening | Understödd |
| Power Fx-uttryck | Understödd |
| Ombearbetning av fackfyllning | Understödd |
Meddelandenod
| Feature | Support |
|---|---|
| Grundläggande meddelande | Understödd |
| Meddelandevariationer | Understödd |
| Variabelinsättning | Understödd |
| SSML | Endast röstkanal |
| Rich Media/Adaptive Cards | Stöds endast för digitala meddelandekanaler. Den här funktionen är i förhandsversion. |
| Snabbsvar | Stöds endast för digitala meddelandekanaler. Den här funktionen är i förhandsversion. |
Frågeknutpunkt
| Feature | Support |
|---|---|
| Uppmaningstext | Understödd |
| Automatiskt uppehåll | Stöds ej |
| Platsfyllning | Understödd |
| Hoppa över beteende/girig platsfyllning | Understödd |
| Reprompt/Försök igen | Understödd |
| Ogiltig svarshantering | Understödd |
| Ämnesavbrott | Understödd |
| Inhopp | Stöds endast för röstkanal. |
| Anpassat reprompt-meddelande | Understödd |
| DTMF-indata | Stöds endast för röstkanal. |
| Tysthetsdetektering | Stöds endast för röstkanal. |
HTTP-nod
| Feature | Support |
|---|---|
| HTTP-metoder: GET, POST, PUT, PATCH, DELETE | Understödd |
| URL-slutpunkter | Understödd |
| Rubriker och nyttolaster | Understödd |
| Svarsparsning och schema | Understödd |
| Variabelmappning | Understödd |
| Felhantering | Understödd |
Verktygsnod
| Feature | Support |
|---|---|
| Power Automate-flow | Understödd |
| Anrop av verktyg | Understödd |
| In-/utdatamappning | Understödd |
| Ny fråga | Understödd |
Nod för att ange variabelvärde
| Feature | Support |
|---|---|
| Literal tilldelning | Understödd |
| Uttryckstilldelning | Understödd |
| Variabel till variabel | Understödd |
Nod för ämneshantering
| Feature | Support |
|---|---|
| Avsluta aktuellt ämne | Understödd |
| Avsluta alla ämnen | Understödd |
| Avsluta konversation | Understödd |
| Gå till steget | Understödd |
| Användarindata för att känna igen avsikt | Understödd |
| Gå till ett annat ämne | Understödd |
Överföra konversationsnod
| Feature | Support |
|---|---|
| Överföra till agent | Understödd |
| Överföring av externt telefonnummer | Stöds endast för röstkanal. |
Advanced
| Feature | Support |
|---|---|
| Skapa generativa svar | Understödd |
Stöd för systemtriggermekanism
| Trigger | Support | Detaljer |
|---|---|---|
| Vid samtalsstart | Understödd | Utlöses när en ny konversation börjar |
| Vid samtal med representant | Understödd | Överföringar till mänsklig agent |
| Okänt ämne/okänd avsikt | Stöds ej | Reservlösning när ingen kategori matchar |
| OnSelectIntent (flera ämnen matchade) | Stöds ej | Tvetydighet mellan liknande ämnen |
| Återställ konversation (OnSystemRedirect) | Understödd | Rensar variabler och startar om flödet |
| Vid inloggning | Stöds ej | |
| Okänd DTMF-tangenttryckning | Understödd | Inmatning från knappsatsen är inte mappad. Gäller endast för röstkanal. |
| Agenten väljer/Användaren säger en fras | Understödd | Agenten väljer ämne baserat på avsikt |
| Ett meddelande tas emot | Stöds ej | Ökar svarstiden |
| En anpassad klienthändelse inträffar | Stöds ej | Endast vid sessionsstart |
| Konversationsuppdateringen | Stöds ej | Medlemmar har lagts till eller tagits bort, sessionsändringar |
| Har anropats | Stöds ej | Kräver synkront användargränssnitt |
| Den omdirigeras | Understödd | |
| Användaren är inaktiv under en specificerad period. | Understödd | Tidsgräns för användarinaktivitet. Gäller endast digitala meddelandekanaler. |
| Tysthetsdetektering | Understödd | Gäller endast för röstkanal. |
| En plan har slutförts | Stöds ej | |
| AI-svar som genererats | Stöds ej | |
| Vid felhändelse | Understödd | Hanterar orkestreringsfel |
Skicka variabler mellan ämnen och språkmodellen
När du använder ämnen i ett hybridsamtalsflöde är det viktigt att förstå hur du skickar variabler mellan ämnen och realtidsspråkmodellen för att skapa tillförlitliga, tillståndskänsliga interaktioner. Denna process gäller över alla kanaler.
Den här funktionen fungerar genom följande process:
Du skickar indatavariabler som definierats i ett ämne till ämnet vid anropstillfället, så att språkmodellen kan tillhandahålla strukturerade data till det deterministiska flödet.
Du returnerar utdatavariabler som definierats i ett ämne till språkmodellen i slutet av utförandet av ämnet som strukturerade nyckel-värdepar.
Utdata från verktygsanrop följer samma mönster.
Språkmodellen fylls i med konversationskontext, inklusive nyckel/värde-par för utdata för verktygsanrop. Du returnerar dock endast explicit definierade utdatavariabler som strukturerade data.
Variabelbeskrivningen hjälper modellen att förstå hur variabeln ska användas under en konversation. Ge tydliga och beskrivande definitioner.
Läs mer i Hantera ämnesindata och utdata.
Flerspråkigt stöd
Lägg till alla sekundära språk som du vill ha. Lokaliseringssträngar krävs inte för realtidsflöden. För deterministiska ämnesmeddelanden måste du dock ange de översatta meddelandena. Läs mer i Konfigurera och skapa flerspråkiga agenter.
Realtidsmodellen kan förstå och svara på många språk. Men Microsoft validerar inte formellt alla språk för allmän tillgänglighet.
Från och med juni 2026 är följande språk formellt validerade:
- Nederländska (Nederländerna) (nl-NL)
- Engelska (Australien) (en-AU)
- Engelska (Amerikas förenta stater) (en-US)
- Engelska (Storbritannien) (en-GB)
- Franska (Kanada) (fr-CA)
- Franska (Frankrike) (fr-FR)
- Tyska (Tyskland) (de-DE)
- Italienska (Italien) (it-IT)
- Portugisiska (Brasilien) (pt-BR)
- Spanska (Spanien) (es-ES)
- Spanska (Förenta staterna) (es-US)
Microsoft fortsätter att validera andra språk och lägger till dem när certifieringen har slutförts. Du kan lägga till valfritt språk som stöds av Copilot Studio. Språk som inte är helt certifierade för kvalitet på GA-nivå bör dock testas noggrant före produktionsdistributionen.
Important
Den tekniska språkfunktionen är inte lika med ett språk som stöds eller är certifierat. Om du tänker distribuera agenter på andra språk än engelska bör du utföra omfattande tester med verkliga uppringare och samtalsflöden innan du går live.
Kontextvariabler
En realtidsagent stödjer kontextvariabler som gör att den kan agera mer intelligent genom att bära information om samtalet och kunden. De tillgängliga kontextvariablerna beror på kanalen. Den här uppsättningen innehåller:
| Kontextvariabel | Description |
|---|---|
| Kanal-ID | Identifierar den kommunikationskanal som används för interaktionen. Gäller endast för röstkanal. |
| Telefonnummer för uppringare (ANI) | Uppringarens ursprungliga telefonnummer. Gäller endast för röstkanal. |
| Nummer på samtalsmottagare (DNIS) | Det måltelefonnummer som anroparen ringde. Gäller endast för röstkanal. |
| Konversations-ID | En unik identifierare för den aktiva samtalssessionen. |
| SIP-huvuden | Stödde SIP-header-nyckel-värdepar kopplade till samtalet. Gäller endast för röstkanal. |
| Aktuellt datum (UTC) | Aktuellt datum i Coordinated Universal Time (UTC), som tillhandahålls under körning för att möjliggöra datummedvetna svar. |
| Aktuell tid (UTC) | Den aktuella tiden i Koordinerad Världstid (UTC), ges vid körning för att möjliggöra tidsmedvetna svar. |
Lär dig mer om alla andra kontextvariabler, inklusive digitala meddelanden och anpassade kontextvariabler, i Konfigurera kontextvariabler för agenter.
Kanalspecifika inställningar
Agentröst
Välj den röst som din agent använder genom att välja din agent och gå till Inställningar>Röstval> röst. Realtidsagenter stödjer följande röster:
- Legering
- Aska
- Ballad
- Coral
- Echo
- Sage
- Skimmer
- Vers
- Marin
- Ceder
Note
- Agentrösten är för din realtidsagent och är inte den som konfigureras i Copilot Service admin center.
- För att matcha dina Dynamics-systemmeddelanderöster med din realtidsagent, använd endast följande stödda röster: Alloy, Echo, Shimmer eller Ash.
- Agenter som använder Text LLM, GPT-5-Chat (Preview), genererar röstsvar via Microsoft Neural Text-to-Speech (TTS). Denna modell stödjer en bredare röstkatalog och anpassade röstmodeller, vilket gör den lämplig för organisationer som kräver varumärkesbaserade röstupplevelser eller avancerad röstanpassning.
Talkänslighet
Identifiering av talkänslighetsröstaktivitet (VAD) avgör när agenten ska svara när anroparen har talat klart.
Förståelse av VAD-typer
Realtidsagenter stödjer två VAD-metoder:
Serverbaserad VAD – baserat på ljud (tystnad)
Identifierar slutet av tal baserat på ljudsignaler (varaktighet för tystnad, volym)
Svarar snabbt när tystnaden har identifierats
Bäst för strukturerade interaktioner, korta svar, bullriga miljöer
Semantisk VAD – baserat på meningskontext
Avgör slutförande av tur baserat på innebörden av vad som sades
Anpassar sig till naturliga pauser, fyllnadsord, avslutande tal
Bäst för: Konversationsinteraktioner, komplexa frågor, öppna diskussioner
Välj rätt VAD
Använd serverbaserat VAD när alla följande villkor är uppfyllda:
- Interaktioner är strukturerade (menynavigering i IVR-stil).
- Svaren är korta och förutsägbara.
- Bakgrundsbrus är ett problem (semantisk VAD kan vänta för länge).
- Du vill ha snabb, tydlig turordning.
Använd semantisk VAD när alla följande villkor är uppfyllda:
- Konversationer är öppna.
- Uppringare kanske tvekar eller använder fyllnadsord ("um", "låt mig tänka...").
- Frågor är komplexa (anropare förklarar situationer).
- Naturligt konversationsflöde prioriteras.
Konfigurera serverbaserad VAD
Gå till Inställningar>Röst>Telefoninställningar>Talinmatning>Känslighet>Baserat på ljud (tystnad).
| Parameter | Description | Standardinställning | Rekommenderat intervall |
|---|---|---|---|
| Threshold | Känslighet för röst kontra brus (skala 0–1) | 0,6 | 0.5-0.7 |
| Prefixutfyllnad (ms) | Ljud som samlas in innan talet börjar | 300 ms | 200-500 ms |
| Varaktighet för tystnad (ms) | Tystnad krävs för att avsluta svängen | 750 ms (millisekunder) | 750-1000 ms |
Threshold
- Lägre (0,3-0,4): Känsligare; hämtar tyst tal, kan utlösas vid bakgrundsbrus.
- Högre (0,7-0,9): Mindre känslig; kräver högre tal, minskar falska utlösare.
- Rekommenderat: Börja med 0,5; öka om bakgrundsljud orsakar falska triggers.
Prefixutfyllnad
- Samlar in ljud före talidentifiering (förhindrar att första ordet skärs av).
- Lägre (200 ms): Snabbare svar; kan missa den första stavelsen.
- Högre (500 ms): Säkrare avbildning; liten fördröjning.
- Rekommenderas: 300 ms (bra balans).
Tystnadens längd
- Hur länge anroparen måste vara tyst innan agenten svarar.
- Lägre (500 ms): Snabb vändning; kan avbryta om uppringaren pausar mitt i en tanke.
- Högre (1000 ms): Mer tålmodig; kan kännas långsam.
- Rekommenderas: Börja med 750 ms.
Konfigurera semantisk VAD
Gå till Inställningar>Talinmatningskänslighet>> förrösttelefoninställningar>>Baserat på meningskontext.
Parameter: Iver (hur snabbt agenten svarar efter semantiskt slutförande)
| Inställning | Behavior | Bäst för |
|---|---|---|
| Låg | Väntar längre, mycket tålmodig | Uppringare som tänker högt, ofta pausar |
| Medel | Balanserad (standard) | Allmänna konversationer |
| High | Svarar snabbt | Snabba interaktioner, enkla frågor |
DTMF-konfiguration
Dual-Tone Multi-Frequency (DTMF) tillåter uppringare att mata in information genom att använda telefonens knappsats.
Du kan aktivera DTMF för din agent på både ämnesnivå och global nivå. Om du vill ange den på global nivå väljer du din agent och går till Inställningar>Röstkonversation> beteende >DTMF.
Important
När du bygger enbart DTMF-upplevelser, konfigurera DTMF-indata för varje inmatningsnod, inklusive menyval och flersiffriga inmatningar som kontonummer eller PIN-koder. Se till att alla möjliga kundinmatningsvägar har motsvarande DTMF-mappningar så att användare kan navigera och slutföra konversationen enbart med knappsatsinmatning.
Tysthetsdetektering
Tystnadsdetektion gör det möjligt för realtidsagenter att känna igen när en uppringare inte ger någon inmatning under en viss period. Konfigurera tystnadsdetektering som en global röstinställning för agenten genom att gå till Inställningar>Röst>Samtalsbeteende>Tystnadsdetektering.
Important
- Tystnadsdetektering är inte aktiverad som standardinställning. Om användaren inte talar väntar agenten på obestämd tid utan att fråga. Aktivera explicit identifiering av tystnad och konfigurera ett reprompt-meddelande för att hantera tyst anropare.
- Standardtimeouten för tyst identifiering är 7 000 ms (7 sekunder). Verifiera det här värdet mot ditt specifika användningsfall och anroparmiljön innan du distribuerar till produktion. Sju sekunder kan kännas för lång för vissa uppringare eller för korta för andra beroende på interaktionens natur, till exempel komplexa frågor eller bullriga miljöer. Testa med verkliga anropsdata för att fastställa lämpligt tröskelvärde för ditt scenario.
- Innan du aktiverar tystnadsidentifiering ska du se till att det beteende som du konfigurerar i ämnet för tystnadsidentifiering (till exempel Escalate, Hang Up, Reprompt) är avsiktligt och lämpligt för ditt användningsfall. Felkonfigurerat återställningsbeteende, till exempel att oavsiktligt ställa in återställningen till Eskalera när avsikten är att lägga på, eller vice versa, kan resultera i oväntade samtalsresultat.
Fördröjningsmeddelanden
Lägg till svarstidsmeddelande eller musik till din agent när bakgrundsåtgärder tar längre tid än förväntat. Om du vill konfigurera svarstidsmeddelanden går du till Inställningar>Röstkonversation> beteende >Svarstidsmeddelanden.
Important
Eftersom Text LLM:s realtidsagentlösning använder flera sekventiella steg (ASR, LLM, TTS), upplever uppringare några sekunders tystnad mellan att de talar och hör ett svar. Sätt lämpliga förväntningar hos användarna, till exempel genom att använda en fras som "Ett ögonblick, jag kollar upp det åt dig...".
Realtidsutvärdering av agenter
Realtidsagenter stödjer att skicka text under utvärdering, men ljudbehandling stöds inte.