Konfigurera realtidsagenter

Note

Denna artikel beskriver funktioner i agenter eller agentflöden som använder standard harness.

För att distribuera en realtidsagent, aktivera realtidsmodellen, konfigurera kärninställningarna för agenten och ställ sedan in de nödvändiga kanalspecifika funktionerna. Du kan distribuera samma agent till röstkanalen, digitala meddelandekanaler eller båda.

Note

Real-time agents är i förhandsversion för digitala meddelandekanaler. Förhandsversionsfunktioner ska inte användas i produktion och funktionerna kan vara begränsade. Dessa funktioner omfattas av kompletterande användningsvillkor. Microsoft tillhandahåller dem innan en officiell lansering så att kunder kan få tidig tillgång och ge feedback.

Sätt upp och aktivera realtidsagenter

  1. Skapa en ny agent och konfigurera dess grundläggande information, till exempel ett beskrivande namn och syftet med agenten i beskrivningen.

  2. Gå till agentens röstinställningar och slå på Aktivera röst. I Rösttyp, välj Real-time.

    Important

    Den här inställningen är ett engångsval. Efter att du valt Real-time kan du inte byta tillbaka till en grundläggande agenttyp. För att använda en grundläggande agent, skapa en ny agent. Denna inställning krävs även om du använder agenten på en digital meddelandekanal.

  3. Välj den modell du vill använda, GPT-Realtime, GPT-Realtime-Mini eller GPT-5-Chat (Förhandsvisning). GPT-5-Chat (Förhandsgranskning) är en text-LLM-röstmodell som genererar röstsvar via Microsoft Neural Text-to-Speech (TTS).
    Lär dig mer om hur dessa modeller fungerar baserat på deras stödda regioner och implementeringsöverväganden. Följande tabell beskriver scenarier där du kan använda olika modeller.

    Scenario GPT-Realtime GPT-5-Chat (Förhandsvisning)
    Konversationsformat Inhemska tal-till-tal-interaktioner Tal omvandlas till text för resonemang och syntetiseras sedan tillbaka till tal
    Fördröjning Lägst latens för naturliga konversationer Högre latens än GPT-Realtime
    Röstanpassning Stöder de inbyggda röstalternativen i realtid som finns för realtidsröstagenter Stöder Microsoft Neural Text-to-Speech (TTS), inklusive en bredare röstkatalog och anpassade röstmodeller
    Varumärkesbaserade röstupplevelser Begränsade anpassningsmöjligheter Rekommenderas när du behöver en anpassad eller varumärkesanpassad röstupplevelse
    Regional utplaceringsflexibilitet Begränsat till stödda realtidsmodellregioner Större flexibilitet genom taligenkänning och TTS-tjänster
    Passar bäst för Naturliga röstsamtal med låg latens och öppna interaktioner Scenarier som kräver avancerad röstanpassning, anpassade röster, efterlevnadskrav eller regional distributionsflexibilitet

    Tips/Råd

    • Använd GPT-Realtime när naturlig konversationskvalitet och låg latens är de främsta kraven.
    • Använd GPT-Realtime-Mini (Förhandsgranskning) för scenarier som kräver snabba talinteraktioner med lägre latens och resursanvändning.
    • Använd GPT-5-Chat (Förhandsvisning) när röstanpassning, anpassade röstmodeller eller distribution av flexibilitet är viktigare än svarsfördröjning.
  4. Gå till agentens säkerhetsinställningar och välj Ingen autentisering.

Kunskap och verktyg

Du kan konfigurera din agent så att den använder kunskap och verktyg. Läs mer i Sammanfattning av kunskapskällor, Lägg till verktyg till anpassade agenter och verktyg, kunskap, MCP och API.

Kapslade agenter (förhandsversion)

Realtidsagenter har bara stöd för underagenter.

Important

Se till att agentbeskrivningar för underordnade inte överlappar ämnesbeskrivningar. Definiera uttryckligen anropsordning i agentens instruktioner.

Ämnen

Realtidsagenter stödjer alla ämnen konfigurerade i Copilot Studio. Använd ämnen för att definiera deterministiska beteenden såsom hälsningar, affärsregler och eskalering, medan modellen du valt hanterar konversationssvar under körning. Läs mer i Välj hur du styr konversationen.

Metodtips

  • Använd endast ämnen när deterministiskt beteende krävs.

  • Använd statisk text i hälsningsmeddelanden för det snabbaste första svaret. Dynamiska meddelanden med variabler och uttryck ökar den inledande svarstiden.

  • Inaktivera ämnet Samtalsstart om du vill att realtidsagentmodellen ska hantera hälsningen. Annars spelas hälsningen som konfigurerats i konversationsstartavsnittet upp i stället för röstmodellens hälsning.

  • Låt realtidsagentmodellen hantera allmänna samtal och följdfrågor.

  • Inkludera en explicit åtgärd i avsnittet Vid fel , till exempel överföring eller slutanrop. Felhantering endast för meddelanden räcker inte. Utan ett förutbestämt nästa steg kan kunder möta tystnad i röstagenter eller konversationer som fastnar i meddelandekanaler, vilket leder till förvirring och en dålig kundupplevelse.

  • Använd explicita avsnitts- och verktygsbeskrivningar för att deklarera ägarskap för datainsamling. Läs mer i Skriva effektiva ämnes- och verktygsbeskrivningar.

Stöd för ämnesnod

Följande lista beskriver ämnesstöd i realtidsagenter:

Villkorsnod

Feature Support
If/Else-förgrening Understödd
Power Fx-uttryck Understödd
Ombearbetning av fackfyllning Understödd

Meddelandenod

Feature Support
Grundläggande meddelande Understödd
Meddelandevariationer Understödd
Variabelinsättning Understödd
SSML Endast röstkanal
Rich Media/Adaptive Cards  Stöds endast för digitala meddelandekanaler. Den här funktionen är i förhandsversion. 
Snabbsvar Stöds endast för digitala meddelandekanaler. Den här funktionen är i förhandsversion. 

Frågeknutpunkt

Feature Support
Uppmaningstext Understödd
Automatiskt uppehåll Stöds ej
Platsfyllning Understödd
Hoppa över beteende/girig platsfyllning Understödd
Reprompt/Försök igen Understödd
Ogiltig svarshantering Understödd
Ämnesavbrott Understödd
Inhopp Stöds endast för röstkanal.
Anpassat reprompt-meddelande Understödd
DTMF-indata Stöds endast för röstkanal.
Tysthetsdetektering Stöds endast för röstkanal.

HTTP-nod

Feature Support
HTTP-metoder: GET, POST, PUT, PATCH, DELETE Understödd
URL-slutpunkter Understödd
Rubriker och nyttolaster Understödd
Svarsparsning och schema Understödd
Variabelmappning Understödd
Felhantering Understödd

Verktygsnod

Feature Support
Power Automate-flow Understödd
Anrop av verktyg Understödd
In-/utdatamappning Understödd
Ny fråga Understödd

Nod för att ange variabelvärde

Feature Support
Literal tilldelning Understödd
Uttryckstilldelning Understödd
Variabel till variabel Understödd

Nod för ämneshantering

Feature Support
Avsluta aktuellt ämne Understödd
Avsluta alla ämnen Understödd
Avsluta konversation Understödd
Gå till steget Understödd
Användarindata för att känna igen avsikt Understödd
Gå till ett annat ämne Understödd

Överföra konversationsnod

Feature Support
Överföra till agent Understödd
Överföring av externt telefonnummer Stöds endast för röstkanal. 

Advanced

Feature Support
Skapa generativa svar Understödd

Stöd för systemtriggermekanism

Trigger Support Detaljer
Vid samtalsstart Understödd Utlöses när en ny konversation börjar
Vid samtal med representant Understödd Överföringar till mänsklig agent
Okänt ämne/okänd avsikt Stöds ej Reservlösning när ingen kategori matchar
OnSelectIntent (flera ämnen matchade) Stöds ej Tvetydighet mellan liknande ämnen
Återställ konversation (OnSystemRedirect) Understödd Rensar variabler och startar om flödet
Vid inloggning Stöds ej
Okänd DTMF-tangenttryckning Understödd Inmatning från knappsatsen är inte mappad. Gäller endast för röstkanal.
Agenten väljer/Användaren säger en fras Understödd Agenten väljer ämne baserat på avsikt
Ett meddelande tas emot Stöds ej Ökar svarstiden
En anpassad klienthändelse inträffar Stöds ej Endast vid sessionsstart
Konversationsuppdateringen Stöds ej Medlemmar har lagts till eller tagits bort, sessionsändringar
Har anropats Stöds ej Kräver synkront användargränssnitt
Den omdirigeras Understödd
Användaren är inaktiv under en specificerad period. Understödd Tidsgräns för användarinaktivitet. Gäller endast digitala meddelandekanaler.
Tysthetsdetektering Understödd Gäller endast för röstkanal.
En plan har slutförts Stöds ej
AI-svar som genererats Stöds ej
Vid felhändelse Understödd Hanterar orkestreringsfel

Skicka variabler mellan ämnen och språkmodellen

När du använder ämnen i ett hybridsamtalsflöde är det viktigt att förstå hur du skickar variabler mellan ämnen och realtidsspråkmodellen för att skapa tillförlitliga, tillståndskänsliga interaktioner. Denna process gäller över alla kanaler.

Den här funktionen fungerar genom följande process:

  • Du skickar indatavariabler som definierats i ett ämne till ämnet vid anropstillfället, så att språkmodellen kan tillhandahålla strukturerade data till det deterministiska flödet.

  • Du returnerar utdatavariabler som definierats i ett ämne till språkmodellen i slutet av utförandet av ämnet som strukturerade nyckel-värdepar.

  • Utdata från verktygsanrop följer samma mönster.

  • Språkmodellen fylls i med konversationskontext, inklusive nyckel/värde-par för utdata för verktygsanrop. Du returnerar dock endast explicit definierade utdatavariabler som strukturerade data.

  • Variabelbeskrivningen hjälper modellen att förstå hur variabeln ska användas under en konversation. Ge tydliga och beskrivande definitioner.

Läs mer i Hantera ämnesindata och utdata.

Flerspråkigt stöd

Lägg till alla sekundära språk som du vill ha. Lokaliseringssträngar krävs inte för realtidsflöden. För deterministiska ämnesmeddelanden måste du dock ange de översatta meddelandena. Läs mer i Konfigurera och skapa flerspråkiga agenter.

Realtidsmodellen kan förstå och svara på många språk. Men Microsoft validerar inte formellt alla språk för allmän tillgänglighet.

Från och med juni 2026 är följande språk formellt validerade:

  • Nederländska (Nederländerna) (nl-NL)
  • Engelska (Australien) (en-AU)
  • Engelska (Amerikas förenta stater) (en-US)
  • Engelska (Storbritannien) (en-GB)
  • Franska (Kanada) (fr-CA)
  • Franska (Frankrike) (fr-FR)
  • Tyska (Tyskland) (de-DE)
  • Italienska (Italien) (it-IT)
  • Portugisiska (Brasilien) (pt-BR)
  • Spanska (Spanien) (es-ES)
  • Spanska (Förenta staterna) (es-US)

Microsoft fortsätter att validera andra språk och lägger till dem när certifieringen har slutförts. Du kan lägga till valfritt språk som stöds av Copilot Studio. Språk som inte är helt certifierade för kvalitet på GA-nivå bör dock testas noggrant före produktionsdistributionen.

Important

Den tekniska språkfunktionen är inte lika med ett språk som stöds eller är certifierat. Om du tänker distribuera agenter på andra språk än engelska bör du utföra omfattande tester med verkliga uppringare och samtalsflöden innan du går live.

Kontextvariabler

En realtidsagent stödjer kontextvariabler som gör att den kan agera mer intelligent genom att bära information om samtalet och kunden. De tillgängliga kontextvariablerna beror på kanalen. Den här uppsättningen innehåller:

Kontextvariabel Description
Kanal-ID Identifierar den kommunikationskanal som används för interaktionen. Gäller endast för röstkanal.
Telefonnummer för uppringare (ANI) Uppringarens ursprungliga telefonnummer. Gäller endast för röstkanal.
Nummer på samtalsmottagare (DNIS) Det måltelefonnummer som anroparen ringde. Gäller endast för röstkanal.
Konversations-ID En unik identifierare för den aktiva samtalssessionen.
SIP-huvuden Stödde SIP-header-nyckel-värdepar kopplade till samtalet. Gäller endast för röstkanal.
Aktuellt datum (UTC) Aktuellt datum i Coordinated Universal Time (UTC), som tillhandahålls under körning för att möjliggöra datummedvetna svar.
Aktuell tid (UTC) Den aktuella tiden i Koordinerad Världstid (UTC), ges vid körning för att möjliggöra tidsmedvetna svar.

Lär dig mer om alla andra kontextvariabler, inklusive digitala meddelanden och anpassade kontextvariabler, i Konfigurera kontextvariabler för agenter.

Kanalspecifika inställningar

Agentröst

Välj den röst som din agent använder genom att välja din agent och gå till Inställningar>Röstval> röst. Realtidsagenter stödjer följande röster:

  • Legering
  • Aska
  • Ballad
  • Coral
  • Echo
  • Sage
  • Skimmer
  • Vers
  • Marin
  • Ceder

Note

  • Agentrösten är för din realtidsagent och är inte den som konfigureras i Copilot Service admin center.
  • För att matcha dina Dynamics-systemmeddelanderöster med din realtidsagent, använd endast följande stödda röster: Alloy, Echo, Shimmer eller Ash.
  • Agenter som använder Text LLM, GPT-5-Chat (Preview), genererar röstsvar via Microsoft Neural Text-to-Speech (TTS). Denna modell stödjer en bredare röstkatalog och anpassade röstmodeller, vilket gör den lämplig för organisationer som kräver varumärkesbaserade röstupplevelser eller avancerad röstanpassning.

Talkänslighet

Identifiering av talkänslighetsröstaktivitet (VAD) avgör när agenten ska svara när anroparen har talat klart.

Förståelse av VAD-typer

Realtidsagenter stödjer två VAD-metoder:

Skärmbild av dialogrutan Talkänslighet.

Serverbaserad VAD – baserat på ljud (tystnad)

  • Identifierar slutet av tal baserat på ljudsignaler (varaktighet för tystnad, volym)

  • Svarar snabbt när tystnaden har identifierats

  • Bäst för strukturerade interaktioner, korta svar, bullriga miljöer

Semantisk VAD – baserat på meningskontext

  • Avgör slutförande av tur baserat på innebörden av vad som sades

  • Anpassar sig till naturliga pauser, fyllnadsord, avslutande tal

  • Bäst för: Konversationsinteraktioner, komplexa frågor, öppna diskussioner

Välj rätt VAD

Använd serverbaserat VAD när alla följande villkor är uppfyllda:

  • Interaktioner är strukturerade (menynavigering i IVR-stil).
  • Svaren är korta och förutsägbara.
  • Bakgrundsbrus är ett problem (semantisk VAD kan vänta för länge).
  • Du vill ha snabb, tydlig turordning.

Använd semantisk VAD när alla följande villkor är uppfyllda:

  • Konversationer är öppna.
  • Uppringare kanske tvekar eller använder fyllnadsord ("um", "låt mig tänka...").
  • Frågor är komplexa (anropare förklarar situationer).
  • Naturligt konversationsflöde prioriteras.

Konfigurera serverbaserad VAD

Gå till Inställningar>Röst>Telefoninställningar>Talinmatning>Känslighet>Baserat på ljud (tystnad).

Skärmbild av dialogrutan Talkänslighet när den är inställd på Baserat på ljud (tystnad).

Parameter Description Standardinställning Rekommenderat intervall
Threshold Känslighet för röst kontra brus (skala 0–1) 0,6 0.5-0.7
Prefixutfyllnad (ms) Ljud som samlas in innan talet börjar 300 ms 200-500 ms
Varaktighet för tystnad (ms) Tystnad krävs för att avsluta svängen 750 ms (millisekunder) 750-1000 ms

Threshold

  • Lägre (0,3-0,4): Känsligare; hämtar tyst tal, kan utlösas vid bakgrundsbrus.
  • Högre (0,7-0,9): Mindre känslig; kräver högre tal, minskar falska utlösare.
  • Rekommenderat: Börja med 0,5; öka om bakgrundsljud orsakar falska triggers.

Prefixutfyllnad

  • Samlar in ljud före talidentifiering (förhindrar att första ordet skärs av).
  • Lägre (200 ms): Snabbare svar; kan missa den första stavelsen.
  • Högre (500 ms): Säkrare avbildning; liten fördröjning.
  • Rekommenderas: 300 ms (bra balans).

Tystnadens längd

  • Hur länge anroparen måste vara tyst innan agenten svarar.
  • Lägre (500 ms): Snabb vändning; kan avbryta om uppringaren pausar mitt i en tanke.
  • Högre (1000 ms): Mer tålmodig; kan kännas långsam.
  • Rekommenderas: Börja med 750 ms.

Konfigurera semantisk VAD

Gå till Inställningar>Talinmatningskänslighet>> förrösttelefoninställningar>>Baserat på meningskontext.

Skärmbild av dialogrutan Talkänslighet när den är inställd på Baserat på meningskontext.

Parameter: Iver (hur snabbt agenten svarar efter semantiskt slutförande)

Inställning Behavior Bäst för
Låg Väntar längre, mycket tålmodig Uppringare som tänker högt, ofta pausar
Medel Balanserad (standard) Allmänna konversationer
High Svarar snabbt Snabba interaktioner, enkla frågor

DTMF-konfiguration

Dual-Tone Multi-Frequency (DTMF) tillåter uppringare att mata in information genom att använda telefonens knappsats.

Du kan aktivera DTMF för din agent på både ämnesnivå och global nivå. Om du vill ange den på global nivå väljer du din agent och går till Inställningar>Röstkonversation> beteende >DTMF.

Important

När du bygger enbart DTMF-upplevelser, konfigurera DTMF-indata för varje inmatningsnod, inklusive menyval och flersiffriga inmatningar som kontonummer eller PIN-koder. Se till att alla möjliga kundinmatningsvägar har motsvarande DTMF-mappningar så att användare kan navigera och slutföra konversationen enbart med knappsatsinmatning.

Tysthetsdetektering

Tystnadsdetektion gör det möjligt för realtidsagenter att känna igen när en uppringare inte ger någon inmatning under en viss period. Konfigurera tystnadsdetektering som en global röstinställning för agenten genom att gå till Inställningar>Röst>Samtalsbeteende>Tystnadsdetektering.

Important

  • Tystnadsdetektering är inte aktiverad som standardinställning. Om användaren inte talar väntar agenten på obestämd tid utan att fråga. Aktivera explicit identifiering av tystnad och konfigurera ett reprompt-meddelande för att hantera tyst anropare.
  • Standardtimeouten för tyst identifiering är 7 000 ms (7 sekunder). Verifiera det här värdet mot ditt specifika användningsfall och anroparmiljön innan du distribuerar till produktion. Sju sekunder kan kännas för lång för vissa uppringare eller för korta för andra beroende på interaktionens natur, till exempel komplexa frågor eller bullriga miljöer. Testa med verkliga anropsdata för att fastställa lämpligt tröskelvärde för ditt scenario.
  • Innan du aktiverar tystnadsidentifiering ska du se till att det beteende som du konfigurerar i ämnet för tystnadsidentifiering (till exempel Escalate, Hang Up, Reprompt) är avsiktligt och lämpligt för ditt användningsfall. Felkonfigurerat återställningsbeteende, till exempel att oavsiktligt ställa in återställningen till Eskalera när avsikten är att lägga på, eller vice versa, kan resultera i oväntade samtalsresultat.

Fördröjningsmeddelanden

Lägg till svarstidsmeddelande eller musik till din agent när bakgrundsåtgärder tar längre tid än förväntat. Om du vill konfigurera svarstidsmeddelanden går du till Inställningar>Röstkonversation> beteende >Svarstidsmeddelanden.

Important

Eftersom Text LLM:s realtidsagentlösning använder flera sekventiella steg (ASR, LLM, TTS), upplever uppringare några sekunders tystnad mellan att de talar och hör ett svar. Sätt lämpliga förväntningar hos användarna, till exempel genom att använda en fras som "Ett ögonblick, jag kollar upp det åt dig...".

Skärmbild av dialogrutan Meddelandesvarstid.

Realtidsutvärdering av agenter

Realtidsagenter stödjer att skicka text under utvärdering, men ljudbehandling stöds inte.