Configurar agentes em tempo real

Note

Este artigo descreve recursos usados em agentes ou fluxos de agentes baseados no harness padrão.

Para implantar um agente em tempo real, ative-se o modelo em tempo real, configure as configurações principais do agente e, em seguida, configure os recursos específicos de cada canal necessários. Você pode implantar o mesmo agente no canal de voz, canais de mensagens digitais ou ambos.

Note

Agentes em tempo real estão em versão preliminar para canais de mensagens digitais. As versões prévias do recurso não foram criadas para uso em ambientes de produção e podem ter funcionalidade restrita. Esses recursos estão sujeitos a termos de uso complementares. A Microsoft os fornece antes de um lançamento oficial para que os clientes possam obter acesso antecipado e fornecer feedback.

Configurar e habilitar agentes em tempo real

  1. Crie um novo agente e configure seus detalhes básicos, como um nome descritivo e a finalidade do agente na descrição.

  2. Vá nas configurações de Voz do agente e ative Habilitar voz. Em Tipo de voz, selecione Em tempo real.

    Important

    Essa configuração é uma seleção única. Depois de selecionar o Tempo Real, não é possível voltar para um tipo básico de agente. Para usar um agente básico, crie um novo agente. Essa configuração é necessária mesmo se você estiver usando o agente em um canal de mensagens digitais.

  3. Selecione o modelo que deseja usar, GPT-Realtime, GPT-Realtime-Mini ou GPT-5-Chat (Prévia). GPT-5-Chat (Prévia) é um modelo de voz de LLM textual que gera respostas de voz por meio do Microsoft Neural Text-to-Speech (TTS).
    Saiba mais sobre como esses modelos funcionam com base em suas regiões suportadas e considerações de implantação. A tabela a seguir descreve os cenários em que você pode usar diferentes modelos.

    Scenario GPT-Realtime GPT-5-Chat (Prévia)
    Estilo de conversa Interações nativas de fala para fala A fala é convertida em texto para raciocínio e depois sintetizada de volta para fala
    Latency Menor latência para conversas naturais Latência maior que GPT-Realtime
    Personalização de voz Suporta as opções de voz em tempo real integradas disponíveis para agentes de voz em tempo real Suporta o Microsoft Neural Text-to-Speech (TTS), incluindo um catálogo de voz mais amplo e modelos de voz personalizados
    Experiências de voz de marca Opções de personalização limitadas Recomendado quando você precisa de uma experiência de voz personalizada ou com marca
    Flexibilidade de implantação regional Limitado a regiões de modelo em tempo real suportadas Maior flexibilidade por meio de reconhecimento de fala e serviços TTS
    Mais adequado para Conversas de voz naturais, de baixa latência, e interações abertas Cenários que exigem customização avançada de voz, vozes personalizadas, requisitos de conformidade ou flexibilidade regional para implantação

    Dica

    • Use GPT-Realtime quando a qualidade natural da conversa e baixa latência são os requisitos principais.
    • Use o GPT-Realtime-Mini (Prévia) para cenários que exigem interações rápidas de fala com menor latência e uso de recursos.
    • Use o GPT-5-Chat (Prévia) quando a personalização de voz, modelos de voz personalizados ou flexibilidade de implantação são mais importantes do que a latência de resposta.
  4. Vá para as configurações de Segurança do agente e selecione Nenhuma Autenticação.

Conhecimento e ferramentas

Você pode configurar seu agente para usar o conhecimento e as ferramentas. Saiba mais em Resumo de fontes de conhecimento, adicionar ferramentas a agentes personalizados e ferramentas, conhecimento, MCP e API.

Agentes aninhados (versão prévia)

Os agentes em tempo real suportam apenas agentes filhos.

Important

Certifique-se de que as descrições dos subagentes não se sobreponham às descrições dos tópicos. Defina explicitamente a ordem de invocação nas instruções do agente.

Tópicos

Agentes em tempo real suportam todos os tópicos configurados no Copilot Studio. Use tópicos para definir comportamentos determinísticos, como cumprimentos, regras de negócio e escalonamento, enquanto o modelo que você escolheu gerencia as respostas conversacionais em tempo de execução. Saiba mais em Escolher como controlar a conversa.

Práticas recomendadas

  • Use tópicos somente quando o comportamento determinístico for necessário.

  • Use texto estático em mensagens de saudação para a primeira resposta mais rápida. Mensagens dinâmicas com variáveis e expressões aumentam a latência inicial.

  • Desative o tópico Iniciar Conversa se quiser que o modelo de agente em tempo real cuide da saudação. Caso contrário, a saudação configurada no tópico Início da Conversa será reproduzida em vez da saudação do modelo de voz.

  • Deixe o modelo de agente em tempo real cuidar da conversa geral e das perguntas de acompanhamento.

  • Inclua uma ação explícita no tópico On Error , como transferência ou chamada final. O tratamento de erros baseado apenas em mensagens não é suficiente. Sem um próximo passo determinístico, os clientes podem experimentar silêncio para agentes de voz ou chamadas travadas nos canais de mensagens, levando à confusão e a má experiência do cliente.

  • Use descrições explícitas de tópicos e ferramentas para declarar a propriedade da coleta de dados. Saiba mais em Escrever tópicos efetivos e descrições de ferramentas.

Suporte ao nó de tema

A lista a seguir descreve o suporte a tópicos nos agentes em tempo real:

Nó Condição

Característica Suporte
Ramificação If/Else Com suporte
Expressões do Power Fx Com suporte
Reprocessamento de preenchimento de slot Com suporte

Nó de Mensagem

Recurso Suporte
Mensagem básica Com suporte
Variações de mensagem Suportado
Inserção de variável Suportado
SSML Apenas canal de voz
Rich Media/Cartões Adaptáveis  Suportado apenas para canais de mensagens digitais. Este recurso está em versão prévia. 
Respostas Rápidas Suportado apenas para canais de mensagens digitais. Este recurso está em versão prévia. 

Nó de Pergunta

Característica Suporte
Texto de comando Suportado
Retenção automática Sem suporte
Preenchimento de ranhuras Suportado
Ignorar comportamento/Preenchimento ávido de slot Suportado
Reprompt/Tentar novamente Suportado
Tratamento de resposta inválido Suportado
Interrupção do tópico Suportado
Interrupção Suportado apenas para canal de voz.
Mensagem de reprompt personalizada Suportado
Entrada DTMF Suportado apenas para canal de voz.
Detecção de silêncio Suportado apenas para canal de voz.

Nó HTTP

Recurso Suporte
Métodos HTTP: GET, POST, PUT, PATCH, DELETE Com suporte
Pontos de extremidade de URL Com suporte
Cabeçalhos e cargas Com suporte
Análise de resposta e esquema Com suporte
Mapeamento de variável Com suporte
Tratamento de erros Com suporte

Nó de ferramenta

Característica Suporte
Fluxo do Power Automate Suportado
Invocação de ferramenta Suportado
Mapeamento de entrada/saída Suportado
Novo prompt Suportado

Definir nó de valor variável

Recurso Suporte
Atribuição literal Com suporte
Atribuição de expressão Com suporte
De variável para variável Com suporte

Nó de gerenciamento de tópicos

Recurso Suporte
Fim do tópico atual Com suporte
Encerrar todos os tópicos Com suporte
Encerrar a conversa Com suporte
Ir para a etapa Com suporte
Entrada do usuário para identificar intenção Com suporte
Ir para outro tópico Com suporte

Nó Transferir conversa

Recurso Suporte
Transferir para o agente Com suporte
Transferência de número de telefone externo Suportado apenas para canal de voz. 

Avançado

Característica Suporte
Criar respostas gerativas Com suporte

Suporte ao disparador do sistema

Trigger Suporte Detalhes
No início da conversa Suportado Aciona quando uma nova conversa começa
Iniciar conversa com o representante Suportado Transferências para o agente humano
Tópico desconhecido/sobre intenção desconhecida Sem suporte Fallback quando nenhum tópico for correspondente
OnSelectIntent (vários tópicos correspondentes) Sem suporte Desambiguação entre tópicos semelhantes
Reiniciar conversa (OnSystemRedirect) Suportado Limpa variáveis e reinicia o fluxo
Ao Entrar Sem suporte
Tecla DTMF desconhecida Suportado Entrada no teclado não mapeada. Aplicável apenas ao canal de voz.
O agente escolhe/O usuário diz uma frase Suportado Agente seleciona tópico com base na intenção
Uma mensagem foi recebida Sem suporte Aumenta a latência
Um evento de cliente personalizado ocorre Sem suporte Somente no início da sessão
A atualização da conversa Sem suporte Membros adicionados ou removidos, alterações de sessão
É invocado Sem suporte Requer interface do usuário síncrona
É redirecionado Suportado
O usuário fica inativo por um período especificado. Suportado Tempo limite de inatividade do usuário. Aplicável apenas a canais de mensagens digitais.
Detecção de silêncio Suportado Aplicável apenas ao canal de voz.
Um plano se completa Sem suporte
Resposta gerada por IA Sem suporte
Em Caso de Erro Suportado Manipula erros de orquestração

Passar variáveis entre tópicos e entre o modelo de linguagem

Quando você usa tópicos em um fluxo de conversa híbrido, entender como passar variáveis entre tópicos e o modelo de linguagem em tempo real é fundamental para criar interações confiáveis e com estado. Esse processo se aplica a todos os canais.

Essa funcionalidade funciona por meio do seguinte processo:

  • Você passa variáveis de entrada definidas em um tópico para o tópico no momento da invocação, para que o modelo de linguagem possa fornecer dados estruturados para o fluxo determinístico.

  • Você retorna variáveis de saída definidas em um tópico para o modelo de linguagem no final da execução do tópico como pares chave-valor estruturados.

  • As saídas das chamadas de ferramenta seguem o mesmo padrão.

  • O modelo de linguagem é preenchido com contexto conversacional, incluindo pares de chave e valor produzidos pela saída de chamadas de ferramentas. No entanto, você só retorna variáveis de saída definidas explicitamente como dados estruturados.

  • A descrição da variável ajuda o modelo a entender como usar a variável durante uma conversa. Forneça definições claras e descritivas.

Saiba mais em Gerenciar entradas e saídas de tópico.

Suporte multilíngue

Adicione todos os idiomas secundários desejados. Cadeias de caracteres de localização não são necessárias para fluxos em tempo real. No entanto, para mensagens de tópico determinísticas, você precisa fornecer as mensagens traduzidas. Saiba mais em Configurar e criar agentes multilíngues.

O modelo em tempo real pode entender e responder em muitos idiomas. No entanto, Microsoft não valida formalmente todos os idiomas para disponibilidade geral.

Em junho de 2026, as seguintes linguagens estão formalmente validadas:

  • Holandês (Países Baixos) (nl-NL)
  • Inglês (Austrália) (en-AU)
  • Inglês (Estados Unidos) (en-US)
  • Inglês (Reino Unido) (en-GB)
  • Francês (Canadá) (fr-CA)
  • Francês (França) (fr-FR)
  • Alemão (Alemanha) (de-DE)
  • Italiano (Itália) (it-IT)
  • Português (Brasil) (pt-BR)
  • Espanhol (Espanha) (es-ES)
  • Espanhol (Estados Unidos) (es-US)

A Microsoft continua a validar outros idiomas e adicioná-los após a conclusão da certificação. Você pode adicionar qualquer idioma compatível com o Copilot Studio. No entanto, os idiomas que não são totalmente certificados para qualidade no nível de GA devem ser completamente testados antes da implantação de produção.

Important

A funcionalidade de linguagem técnica não é igual a um idioma com suporte ou certificado. Se você pretende implantar agentes em idiomas diferentes do inglês, deverá realizar testes extensivos com chamadores do mundo real e fluxos de chamadas antes de entrar no ar.

Variáveis de contexto

Um agente em tempo real suporta variáveis de contexto que permitem que ele se comporte de forma mais inteligente, transportando informações sobre a conversa e o cliente. As variáveis de contexto disponíveis dependem do canal. Esse conjunto inclui:

Variável de contexto Description
ID do Canal Identifica o canal de comunicação usado para a interação. Aplicável apenas ao canal de voz.
Número de telefone do chamador (ANI) O número de telefone de origem do chamador. Aplicável apenas ao canal de voz.
Número do destinatário do chamado (DNIS) O número de telefone de destino que o chamador ligou. Aplicável apenas ao canal de voz.
ID da conversa Um identificador exclusivo para a sessão de chamada ativa.
Cabeçalhos SIP Suportavam pares chave-valor de cabeçalho SIP associados à chamada. Aplicável apenas ao canal de voz.
Data atual (UTC) A data atual em UTC (Tempo Universal Coordenado), fornecida em runtime para permitir respostas com reconhecimento de data.
Hora atual (UTC) O tempo atual em UTC (Tempo Universal Coordenado), fornecido em runtime para permitir respostas com reconhecimento de tempo.

Saiba mais sobre todas as outras variáveis de contexto, incluindo mensagens digitais e variáveis de contexto personalizadas, em Configurar variáveis de contexto para agentes.

Configurações específicas do canal

Voz do agente

Selecione a voz que seu agente usa selecionando seu agente e vá para Configurações>Voz>Selecionar voz. Agentes em tempo real oferecem suporte às seguintes vozes:

  • Liga
  • Cinzas
  • Balada
  • Coral
  • Eco
  • Sage
  • Cintilação
  • Verse
  • Marin
  • Cedro

Note

  • A voz do agente é para o seu agente em tempo real e não é a configurada no centro de administração do Copilot Service.
  • Para combinar as vozes das mensagens do seu sistema Dynamics com seu agente em tempo real, use apenas as seguintes vozes suportadas: Alloy, Echo, Shimmer ou Ash.
  • Agentes que utilizam Text LLM, GPT-5-Chat (Preview), geram respostas de voz por meio do Microsoft Neural Text-to-Speech (TTS). Esse modelo suporta um catálogo de voz mais amplo e modelos personalizados, tornando-o adequado para organizações que exigem experiências de voz com marca ou customização avançada de voz.

Sensibilidade à fala

A detecção de atividade de voz sensível à fala (VAD) determina quando o agente deve responder depois que o chamador terminar de falar.

Entendendo os tipos de VAD

Agentes em tempo real oferecem suporte a duas abordagens de VAD:

Captura de tela da caixa de diálogo de sensibilidade de fala.

VAD baseado em servidor – Com base no som (silêncio)

  • Detecta o fim da fala com base em sinais de áudio (duração do silêncio, volume)

  • Responde rapidamente quando o silêncio é detectado

  • Melhor para interações estruturadas, respostas curtas, ambientes barulhentos

VAD semântico – Com base no contexto da frase

  • Determina a conclusão da curva com base no significado do que foi dito

  • Adapta-se a pausas naturais, vícios de linguagem, frases interrompidas

  • Melhor para: interações conversacionais, perguntas complexas, discussões abertas

Selecione o VAD certo

Use o VAD baseado em servidor quando todas as seguintes condições forem verdadeiras:

  • As interações são estruturadas (navegação no menu no estilo IVR).
  • As respostas são curtas e previsíveis.
  • O ruído de fundo é uma preocupação (a detecção automática de voz, ou VAD, semântica pode demorar muito).
  • Você quer uma troca de turnos rápida e eficiente.

Use VAD semântico quando todas as seguintes condições forem verdadeiras:

  • As conversas são abertas e sem conclusão definida.
  • Os chamadores podem hesitar ou usar palavras de preenchimento ("hum", "deixe-me pensar...").
  • As perguntas são complexas (os chamadores explicam situações).
  • O fluxo de conversa natural é priorizado.

Configurar VAD baseado em servidor

Vá para Configurações>Voz>Configuração do Telefone>Entrada de Fala>Sensibilidade>Com base no som (silêncio).

Captura de tela da caixa de diálogo de sensibilidade de fala quando definida como Com base no som (silêncio).

Parâmetro Description Padrão Intervalo recomendado
Limite Sensibilidade à voz versus ruído (escala de 0 a 1) 0,6 0.5-0.7
Preenchimento de prefixo (ms) Áudio capturado antes do início da fala 300 ms 200-500 ms
Duração do Silêncio (ms) Silêncio necessário para encerrar a curva 750 ms 750-1000 ms

Threshold

  • Mais baixo (0,3-0,4): mais sensível; detecta fala baixa, pode disparar em presença de ruído de fundo.
  • Superior (0.7-0.9): menos sensível; requer fala mais alta, reduz gatilhos falsos.
  • Recomendado: Comece com 0,5; Aumente se o ruído de fundo causar falsos gatilhos.

Preenchimento de prefixo

  • Captura áudio antes da detecção de fala (impede o corte da primeira palavra).
  • Menor (200 ms): resposta mais rápida; pode perder a primeira sílaba.
  • Maior (500 ms): captura mais segura; pequeno atraso.
  • Recomendado: 300 ms (bom equilíbrio).

Duração do Silêncio

  • Por quanto tempo o chamador deve ficar em silêncio antes que o agente responda.
  • Baixo (500 ms): Rápida troca de turnos; pode interromper se o chamador pausar no meio do pensamento.
  • Maior (1000 ms): mais paciente; pode parecer lento.
  • Recomendado: comece com 750 ms.

Configurar VAD semântico

Vá para Configurações>Voz>Configuração do Telefone>Entrada de Fala>Sensibilidade>Com Base no Contexto da Frase.

Captura de tela da caixa de diálogo Sensibilidade da Fala quando definida como Baseada no contexto da sentença.

Parâmetro: Rapidez (a rapidez com que o agente responde após a conclusão do sentido da frase)

Configurações Comportamento Melhor para
Baixo Espera mais, muito paciente Chamadores que pensam em voz alta, pausas frequentes
Medium Balanceado (padrão) Conversas gerais
Alto Responde rapidamente Interações rápidas, perguntas simples

Configuração de DTMF

Dual-Tone Multifrequencial (DTMF) permite que os usuários insiram informações por meio do teclado do telefone.

Você pode ativar o DTMF para seu agente nos níveis de tópico e global. Para defini-lo no nível global, selecione seu agente e vá para Configurações>Voz>Comportamento de Conversa>DTMF.

Important

Ao criar experiências baseadas apenas em DTMF, configure a entrada DTMF para cada nó de entrada, incluindo opções de menu e entradas de vários dígitos, como números de conta ou PINs. Garanta que todos os caminhos possíveis de entrada do cliente tenham mapeamentos DTMF correspondentes para que os usuários possam navegar e concluir a conversa usando apenas a entrada do teclado.

Detecção de silêncio

A detecção de silêncio permite que agentes em tempo real reconheçam quando um chamador não fornece entrada por um período especificado. Configure a detecção de silêncio como uma configuração global de voz para o agente acessando Configurações>Voz>Comportamento de Conversa>Detecção de Silêncio.

Important

  • A detecção de silêncio não está ativada por padrão. Se o usuário não falar, o agente aguardará indefinidamente sem solicitar. Ative explicitamente a detecção de silêncio e configure uma mensagem de nova solicitação para lidar com chamadores silenciosos.
  • O tempo limite padrão de detecção de silêncio é de 7.000 ms (7 segundos). Valide este valor de acordo com o seu caso de uso específico e o ambiente do chamador antes de implantar em produção. Sete segundos podem parecer muito longos para alguns chamadores ou muito curtos para outros, dependendo da natureza da interação, por exemplo, perguntas complexas ou ambientes barulhentos. Teste com dados de chamada do mundo real para determinar o limite apropriado para seu cenário.
  • Antes de habilitar a detecção de silêncio, verifique se o comportamento configurado no tópico de detecção de silêncio (por exemplo, Escalonar, Desligar, Repromptar) é intencional e apropriado para seu caso de uso. O comportamento de contingência/alternativa configurado incorretamente, como definir inadvertidamente a contingência/alternativa para Escalonar quando a intenção é desligar ou vice-versa, pode levar a desfechos inesperados nas chamadas.

Latência de mensagens

Adicione uma mensagem de latência ou música ao agente quando as operações em segundo plano levarem mais tempo do que o esperado. Para configurar a mensagem de latência, acesse Configurações>Voz>Comportamento de Conversa>Mensagens de Latência.

Important

Como a solução agente em tempo real do Text LLM utiliza múltiplos passos sequenciais (ASR, LLM, TTS), os chamadores experimentam alguns segundos de silêncio entre falar e ouvir uma resposta. Estabeleça expectativas apropriadas com os usuários, por exemplo, usando uma frase como "Um momento, por favor, estou pesquisando isso para você...".

Captura de tela da caixa de diálogo Mensagens de Latência.

Avaliação de agentes em tempo real

Agentes em tempo real suportam o envio de texto durante a avaliação, porém, o processamento de áudio não é suportado.