Konfigurer realtidsagenter

Bemærkning

Denne artikel beskriver funktioner, der anvendes i agenter eller agentstrømme, drevet af standardledningsnettet.

For at implementere en realtidsagent skal du aktivere realtidsmodellen, konfigurere kerneindstillingerne for agenten og derefter opsætte de nødvendige kanalspecifikke funktioner. Du kan udrulle den samme agent til talekanalen, digitale beskedkanaler eller begge dele.

Bemærkning

Realtidsagenter er i prøveversion for digitale beskedkanaler. Prøveversionsfunktioner er ikke beregnet til produktionsbrug og kan have begrænset funktionalitet. Disse funktioner er underlagt supplerende vilkår for anvendelse. Microsoft leverer dem før en officiel udgivelse, så kunderne kan få tidlig adgang og give feedback.

Opsæt og aktiver realtidsagenter

  1. Opret en ny agent, og konfigurer de grundlæggende oplysninger, f.eks. et beskrivende navn og agentens formål i beskrivelsen.

  2. Gå til agentens stemmeindstillinger og slå Voice til (aktiver tale). I Stemmetype, vælg Real-time.

    Vigtigt!

    Denne indstilling er en engangsmarkering. Når du har valgt Real-time, kan du ikke skifte tilbage til en simpel agenttype. For at bruge en grundlæggende agent, opret en ny agent. Denne indstilling er påkrævet, selv hvis du bruger agenten på en digital beskedkanal.

  3. Vælg den model, du vil bruge, GPT-Realtime, GPT-Realtime-Mini eller GPT-5-Chat (Forhåndsvisning). GPT-5-Chat (Preview) er en tekst-LLM-stemmemodel, der genererer stemmesvar via Microsoft Neural Text-to-Speech (TTS).
    Lær mere om, hvordan disse modeller fungerer baseret på deres understøttede regioner og implementeringsovervejelser. Følgende tabel beskriver de scenarier, hvor du kan bruge forskellige modeller.

    Scenarie GPT-Realtime GPT-5-Chat (Forhåndsvisning)
    Samtaletypografi Indbyggede tale-til-tale-interaktioner Tale omdannes til tekst for at ræsonnere og syntetiseres derefter tilbage til tale
    Latenstid Laveste latenstid for naturlige samtaler Højere latenstid end GPT-Realtime
    Stemmetilpasning Understøtter de indbyggede realtidsstemmeindstillinger for realtidsstemmeagenter Understøtter Microsoft Neural Text-to-Speech (TTS), inklusive et bredere stemmekatalog og brugerdefinerede stemmemodeller
    Brandede stemmeoplevelser Begrænsede tilpasningsmuligheder Anbefales, når du har brug for en special- eller brandet stemmeoplevelse
    Regional udsendelsesfleksibilitet Begrænset til understøttede realtidsmodelregioner Større fleksibilitet gennem talegenkendelse og TTS-tjenester
    Bedst egnet til Naturlige stemmesamtaler med lav latenstid og åbne samtaler og interaktioner Scenarier, der kræver avanceret stemmetilpasning, brugerdefinerede stemmer, compliance-krav eller regional implementeringsfleksibilitet

    Tip

    • Brug GPT-Realtime, når naturlig samtalekvalitet og lav latenstid er de primære krav.
    • Brug GPT-Realtime-Mini (Forhåndsvisning) til scenarier, der kræver hurtige taleinteraktioner med lavere latenstid og ressourceforbrug.
    • Brug GPT-5-Chat (Forhåndsvisning), når stemmetilpasning, tilpassede stemmemodeller eller implementeringsfleksibilitet er vigtigere end responslatens.
  4. Gå til agentens sikkerhedsindstillinger , og vælg Ingen godkendelse.

Viden og værktøjer

Du kan konfigurere din agent til at bruge viden og værktøjer. Få mere at vide i oversigten over videnkilder, Føj værktøjer til brugerdefinerede agenter og Værktøjer, viden, MCP og API.

Indlejrede agenter (prøveversion)

Agenter i realtid støtter kun børneagenter.

Vigtigt!

Sørg for, at beskrivelser af underordnede agenter ikke overlapper emnebeskrivelser. Definer eksplicit aktiveringsrækkefølgen i agentens instruktioner.

Emner

Realtime-agenter understøtter alle emner, der er konfigureret i Copilot Studio. Brug emner til at definere deterministiske adfærdsmønstre såsom hilsner, forretningsregler og eskalering, mens den model, du har valgt, håndterer samtalebaserede svar under kørsel. Få mere at vide under Vælg, hvordan du styrer samtalen.

Bedste praksis

  • Brug kun emner, når deterministisk funktionsmåde er påkrævet.

  • Brug statisk tekst i lykønskningsmeddelelser for at få det hurtigste svar. Dynamiske meddelelser med variabler og udtryk øger den indledende ventetid.

  • Deaktiver emnet Samtalestart , hvis du vil have realtidsagentmodellen til at håndtere hilsenen. Ellers afspilles den hilsen, der er konfigureret i emnet Samtalestart , i stedet for en hilsen til stemmemodellen.

  • Lad agentmodellen i realtid håndtere generelle samtaler og opfølgende spørgsmål.

  • Medtag en eksplicit handling i emnet VedFejl , f.eks. viderestille eller afslutte opkald. Fejlhåndtering kun for meddelelser er ikke tilstrækkelig. Uden et deterministisk næste skridt kan kunderne opleve tavshed for stemmeagenter eller fastlåste opkald til beskedkanaler, hvilket fører til forvirring og dårlig kundeoplevelse.

  • Brug eksplicitte emne- og værktøjsbeskrivelser til at erklære ejerskab over dataindsamling. Få mere at vide under Skriv effektive emne- og værktøjsbeskrivelser.

Understøttelse af emnenoder

Følgende liste beskriver emneunderstøttelse i realtidsagenter:

Betingelsesnode

Funktion Støtte
If/Else-struktur Understøttes
Power Fx-udtryk Understøttes
Genbearbejdning af spalteudfyldning Understøttes

Meddelelse-node

Funktion Støtte
Grundlæggende meddelelse Understøttes
Meddelelsesvariationer Understøttet
Indsættelse af variabel Understøttet
SSML Kun talekanal
Rich Media/Adaptive kort  Understøttes kun for digitale beskedkanaler. Denne funktion er en prøveversionsfunktion. 
Hurtige svar Understøttes kun for digitale beskedkanaler. Denne funktion er en prøveversionsfunktion. 

Spørgsmålsnode

Funktion Støtte
Prompttekst Understøttet
Automatisk hold Ikke understøttet
Udfyldning af rubrik Understøttet
Spring over adfærd/Grådig slotudfyldning Understøttet
Reprompt/Forsøg igen Understøttet
Ugyldig svarhåndtering Understøttet
Emneafbrydelse Understøttet
Bryd ind Understøttet kun til talekanal.
Brugerdefineret meddelelse om omprompt Understøttet
DTMF-adresseinput Understøttet kun til talekanal.
Registrering af stilhed Understøttet kun til talekanal.

HTTP-node

Funktion Støtte
HTTP-metoder: GET, POST, PUT, PATCH, DELETE Understøttes
URL-slutpunkter Understøttes
Overskrifter og nyttedata Understøttes
Fortolkning af svar og skema Understøttes
Variabeltilknytning Understøttes
Fejlhåndtering Understøttes

Værktøjsnode

Funktion Støtte
Power Automate-flow Understøttet
Aktivering af værktøj Understøttet
Input-/outputtilknytning Understøttet
Ny prompt Understøttet

Sæt variabelværdi node

Funktion Støtte
Konstanttildeling Understøttes
Tildeling af udtryk Understøttes
Variabel til variabel Understøttes

Emneadministrationsnode

Funktion Støtte
Afslut det aktuelle emne Understøttes
Afslut alle emner Understøttes
Afslut samtale Understøttes
Gå til trin Understøttes
Brugerinput til genkendelsesformål Understøttes
Gå til et andet emne Understøttes

Overfør samtalenode

Funktion Støtte
Overfør til agent Understøttes
Overførsel af eksternt telefonnummer Understøttet kun til talekanal. 

Avanceret

Funktion Støtte
Opret generative svar Understøttes

Understøttelse af systemudløser

Udløser Støtte Oplysninger
Ved start af samtale Understøttet Udløses, når en ny samtale starter
På Tal med repræsentant Understøttet Overførsler til menneskelig agent
Ukendt emne/på ukendt hensigt Ikke understøttet Fallback, når der ikke er noget emne der passer
OnSelectIntent (flere emner matcher) Ikke understøttet Fjernelse af flertydige udtryk mellem lignende emner
Nulstil samtale (OnSystemRedirect) Understøttet Rydder variabler og genstarter flowet
Ved log ind Ikke understøttet
Ukendt DTMF-tasttryk Understøttet Ikke-tilknyttet tastaturinput. Gælder kun for talekanalen.
Agenten vælger/Bruger siger et udtryk Understøttet Agent vælger emne baseret på hensigt
Der modtages en meddelelse Ikke understøttet Øger ventetiden
Der forekommer en brugerdefineret klienthændelse Ikke understøttet Kun ved sessionens start
Opdateringen af samtalen Ikke understøttet Medlemmer tilføjet eller fjernet, sessionsændringer
Det aktiveres Ikke understøttet Kræver synkron brugergrænseflade
Den omdirigeres Understøttet
Brugeren er inaktiv i en specificeret periode. Understøttet Timeout ved brugerinaktivitet. Gælder kun for digitale beskedkanaler.
Registrering af stilhed Understøttet Gælder kun for talekanalen.
En plan fuldføres Ikke understøttet
AI-svar genereret Ikke understøttet
Ved fejltilstand Understøttet Håndterer orkestreringsfejl

Overfør variabler mellem emner og sprogmodellen

Når du bruger emner i et hybridt samtaleflow, er det afgørende for at skabe pålidelige, stateful interaktioner, at du forstår, hvordan du overfører variabler mellem emner og realtidssprogmodellen. Denne proces gælder på tværs af kanaler.

Denne funktionalitet fungerer gennem følgende proces:

  • Du overfører inputvariabler, der er defineret for et emne, til emnet på aktiveringstidspunktet, så sprogmodellen kan levere strukturerede data til det deterministiske flow.

  • Du returnerer outputvariabler, der er defineret for et emne, til sprogmodellen i slutningen af emneudførelsen som strukturerede nøgleværdipar.

  • Værktøjskaldsuddata følger samme mønster.

  • Sprogmodellen udfyldes med samtalekontekst, herunder nøgleværdipar for værktøjskald. Du returnerer dog kun eksplicit definerede outputvariabler som strukturerede data.

  • Variabelbeskrivelsen hjælper modellen med at forstå, hvordan den skal bruges under en samtale. Giv klare og beskrivende definitioner.

Få mere at vide under Administrer emneinput og -output.

Understøttelse af flere sprog

Tilføj alle de sekundære sprog, du vil bruge. Lokaliseringsstrenge er ikke påkrævet for nogen flow i realtid. Men for deterministiske emnemeddelelser skal du angive de oversatte meddelelser. Få mere at vide i Konfigurer og opret flersprogede agenter.

Modellen i realtid kan forstå og reagere på mange sprog. Microsoft validerer dog ikke formelt alle sprog for generel tilgængelighed.

Fra juni 2026 er følgende sprog formelt valideret:

  • Nederlandsk (Nederlandene) (nl-NL)
  • Engelsk (Australien) (en-AU)
  • Engelsk (USA) (en-US)
  • Engelsk (Storbritannien) (en-GB)
  • Fransk (Canada) (fr-CA)
  • Fransk (Frankrig) (fr-FR)
  • Tysk (Tyskland) (de-DE)
  • Italiensk (Italien) (it-IT)
  • Portugisisk (Brasilien) (pt-BR)
  • Spansk (Spanien) (es-ES)
  • Spansk (USA) (es-US)

Microsoft fortsætter med at validere andre sprog og tilføjer dem, når certificeringen er fuldført. Du kan tilføje et hvilket som helst sprog, der understøttes af Copilot Studio. Sprog, der ikke er fuldt certificeret i forhold til kvalitet på GA-niveau, skal dog testes grundigt, før udrulningen af produktionen.

Vigtigt!

Teknisk sprogfunktion er ikke lig med et understøttet eller certificeret sprog. Hvis du har til hensigt at udrulle agenter på andre sprog end engelsk, skal du udføre omfattende test med opkald fra den virkelige verden og opkaldsflow, før du går live.

Kontekstvariabler

En realtidsagent understøtter kontekstvariabler, der gør det muligt for den at opføre sig mere intelligent ved at bære information om samtalen og kunden. De tilgængelige kontekstvariabler afhænger af kanalen. Dette sæt omfatter:

Kontekstvariabel Beskrivelse
Kanal-id Identificerer den kommunikationskanal, der bruges til interaktionen. Gælder kun for talekanalen.
Opkaldstelefonnummer (ANI) Opkaldets oprindelige telefonnummer. Gælder kun for talekanalen.
Opkaldsnummer (DNIS) Destinationstelefonnummeret, som opkalderen ringede til. Gælder kun for talekanalen.
Samtale-ID Et entydigt id for den aktive opkaldssession.
SIP-overskrifter Understøttede SIP-header-nøgle-værdi-par forbundet med opkaldet. Gælder kun for talekanalen.
Dags dato (UTC) Den aktuelle dato i UTC (Coordinated Universal Time), der leveres på kørselstidspunktet for at tillade datoorienterede svar.
Aktuelt klokkeslæt (UTC) Det aktuelle klokkeslæt i UTC (Coordinated Universal Time), der leveres på kørselstidspunktet for at tillade tidsorienterede svar.

Lær mere om alle andre kontekstvariabler, inklusive digital beskedudveksling og brugerdefinerede kontekstvariabler, i Konfigurér kontekstvariabler for agenter.

Kanalspecifikke indstillinger

Agentstemme

Vælg den stemme, som din agent bruger, ved at vælge din agent, og gå til Indstillinger>Stemme>vælg stemme. Realtidsagenter understøtter følgende stemmer:

  • Legering
  • Ash
  • Balladen
  • Koral
  • Ekko
  • Salvie
  • Glitre
  • Vers
  • Marin
  • Cedertræ

Bemærkning

  • Agentstemmen er til din realtidsagent og er ikke den, der er konfigureret i Copilot Service administrationscenter.
  • For at matche dine Dynamics-system-beskedstemmer med din realtidsagent, brug kun følgende understøttede stemmer: Alloy, Echo, Shimmer eller Ash.
  • Agenter, der bruger Text LLM, GPT-5-Chat (Preview), genererer stemmesvar via Microsoft Neural Text-to-Speech (TTS). Denne model understøtter et bredere stemmekatalog og tilpassede stemmemodeller, hvilket gør den velegnet til organisationer, der har brug for brandede stemmeoplevelser eller avanceret stemmetilpasning.

Talefølsomhed

VAD (Speech Sensitivity Voice Activity Detection) bestemmer, hvornår agenten skal svare, når opkalderen er færdig med at tale.

Forståelse af VAD-typer

Realtidsagenter understøtter to VAD-tilgange:

Skærmbillede af dialogboksen Talefølsomhed.

Serverbaseret VAD – baseret på lyd (tavshed)

  • Registrerer slutningen af tale baseret på lydsignaler (stilhedens varighed, lydstyrke)

  • Reagerer hurtigt, når der registreres tavshed

  • Bedst til strukturerede interaktioner, korte svar, støjende miljøer

Semantisk VAD – baseret på sætningskontekst

  • Bestemmer fuldførelsen af turn baseret på betydningen af det, der blev sagt

  • Tilpasser sig naturlige pauser, fyldord, efterstillet tale

  • Bedst til: Samtaleinteraktioner, komplekse spørgsmål, åbne diskussioner

Vælg den rette VAD

Brug serverbaseret VAD, når alle følgende betingelser er opfyldt:

  • Interaktioner er strukturerede (menunavigation i IVR-stil).
  • Svarene er korte og forudsigelige.
  • Baggrundsstøj er et problem (semantisk VAD kan vente for længe).
  • Du vil have hurtig og præcis skift af tur.

Brug semantisk VAD, når alle følgende betingelser er opfyldt:

  • Samtaler er åbne.
  • Opkaldere kan tøve eller bruge fyldstof ord ("um", "lad mig tænke ...").
  • Spørgsmål er komplekse (opkaldere forklarer situationer).
  • Naturligt samtaleflow prioriteres.

Konfigurer serverbaseret VAD

Gå til Indstillinger>Tale>Telefonopsætning>Taleinput>Følsomhed>baseret på lyd (stilhed)

Skærmbillede af dialogboksen Talefølsomhed, når den er angivet til Baseret på lyd (stilhed).

Parameter Beskrivelse Standardindstilling Anbefalet område
Tærskel Følsomhed over for stemme i forhold til støj (0-1 skala) 0.6 0.5-0.7
Præfiksmargen (ms) Lyd, der optages, før talen starter 300 ms 200-500 ms
Tavshedsvarighed (ms) Der kræves tavshed for at afslutte svinget 750 ms 750-1000 ms

Tærskel

  • Lavere (0,3-0,4): Mere følsom; opfanger stille tale, kan udløse baggrundsstøj.
  • Højere (0,7-0,9): Mindre følsom; kræver højere tale, reducerer falske udløsere.
  • Anbefalet: Start med 0,5; Øg hvis baggrundsstøj forårsager falske triggere.

Præfiksudfyldning

  • Registrerer lyd før taleregistrering (forhindrer, at første ord afbrydes).
  • Lavere (200 ms): Hurtigere svar; kan gå glip af den første staves.
  • Højere (500 ms): Sikrere hentning; en lille forsinkelse.
  • Anbefalet: 300 ms (en god balance).

Stilhedens varighed

  • Hvor lang tid opkaldet skal være uovervåget, før agenten svarer.
  • Lavere (500 ms): Hurtig turn-taking; afbryde, hvis den, der ringer op, holder pause midt i tanken.
  • Højere (1000 ms): Mere patient; føler sig måske langsom.
  • Anbefalet: Start med 750 ms.

Konfigurer semantisk VAD

Gå til>Stemmekontrol>Taleinput>Baseret på sætningskontekst.

Skærmbillede af dialogboksen Talefølsomhed, når den er angivet til Baseret på sætningskontekst.

Parameter: Iver (hvor hurtigt agenten reagerer efter semantisk fuldførelse)

Setting Adfærd Bedst til
Lav Venter længere, meget tålmodig Opkaldere, der tænker højt, hyppige pauser
Mellem Balanceret (standardindstilling) Generelle samtaler
Høj Reagerer hurtigt Hurtige interaktioner, enkle spørgsmål

DTMF-konfiguration

Dual-Tone Multi-Frequency (DTMF) tillader opkaldere at indtaste information ved at bruge telefonens tastatur.

Du kan slå DTMF til for din agent på både emneniveau og globalt niveau. Hvis du vil angive den på globalt niveau, skal du vælge din agent og gå til Indstillinger>>>DTMF.

Vigtigt!

Når du bygger DTMF-only oplevelser, skal du konfigurere DTMF-input for hver inputnode, inklusive menuvalg og flercifrede input såsom kontonumre eller PIN-koder. Sørg for, at alle mulige kundeindtastningsstier har tilsvarende DTMF-mapping, så brugerne kan navigere og gennemføre samtalen udelukkende ved hjælp af tastaturinput.

Registrering af stilhed

Stilhedsdetektion gør det muligt for realtidsagenter at genkende, når en opkalder ikke giver input i en bestemt periode. Konfigurer lyddæmperregistrering som en global stemmeindstilling for agenten ved at gå til Indstillinger>Funktionsmåde> forstemmesamtale>Lyddæmper.

Vigtigt!

  • Registrering af tavshed er ikke aktiveret som standard. Hvis brugeren ikke taler, venter agenten på ubestemt tid uden at spørge. Aktivér eksplicit registrering af tavshed, og konfigurer en meddelelse, der skal sendes igen, for at håndtere uovervåget opkald.
  • Standardtimeout for registrering af stilhed er 7.000 ms (7 sekunder). Valider denne værdi i forhold til dit specifikke use case- og kaldermiljø, før du udruller til produktion. Syv sekunder kan føles for længe for nogle opkaldere eller for korte for andre, afhængigt af karakteren af interaktionen, f.eks. komplekse spørgsmål eller støjende miljøer. Test med opkaldsdata fra den virkelige verden for at bestemme den relevante grænse for dit scenarie.
  • Før du aktiverer registrering af tavshed, skal du sikre dig, at den funktionsmåde, du konfigurerer i emnet registrering af tavshed (f.eks. Eskaler, Læg på, Reprompt), er bevidst og passende for din use case. Forkert konfigureret tilbagefaldsadfærd, såsom utilsigtet at sætte tilbagefaldet til eskalering, når hensigten er at lægge på, eller omvendt, kan resultere i uventede opkaldsresultater.

Forsinkelsesmeddelelse

Føj ventetidsmeddelelse eller musik til din agent, når handlinger i baggrunden tager længere tid end forventet. Hvis du vil konfigurere ventetidsmeddelelser, skal du gå til Indstillinger>>Talesamtalefunktionsventetidsbeskeder>.

Vigtigt!

Fordi Text LLM realtidsagentløsningen bruger flere sekventielle trin (ASR, LLM, TTS), oplever opkaldere et par sekunders stilhed mellem at tale og høre et svar. Sæt passende forventninger til brugerne, for eksempel ved at bruge en sætning som "Et øjeblik, jeg slår det op for dig...".

Skærmbillede af dialogboksen Ventetidsmeddelelser.

Evaluering af agenter i realtid

Realtime-agenter understøtter at sende tekst under evaluering, men lydbehandling understøttes ikke.