Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Note
Este artigo descreve recursos usados em agentes ou fluxos de agentes baseados no harness padrão.
Para implantar um agente em tempo real, ative-se o modelo em tempo real, configure as configurações principais do agente e, em seguida, configure os recursos específicos de cada canal necessários. Você pode implantar o mesmo agente no canal de voz, canais de mensagens digitais ou ambos.
Note
Agentes em tempo real estão em versão preliminar para canais de mensagens digitais. As versões prévias do recurso não foram criadas para uso em ambientes de produção e podem ter funcionalidade restrita. Esses recursos estão sujeitos a termos de uso complementares. A Microsoft os fornece antes de um lançamento oficial para que os clientes possam obter acesso antecipado e fornecer feedback.
Configurar e habilitar agentes em tempo real
Crie um novo agente e configure seus detalhes básicos, como um nome descritivo e a finalidade do agente na descrição.
Vá nas configurações de Voz do agente e ative Habilitar voz. Em Tipo de voz, selecione Em tempo real.
Important
Essa configuração é uma seleção única. Depois de selecionar o Tempo Real, não é possível voltar para um tipo básico de agente. Para usar um agente básico, crie um novo agente. Essa configuração é necessária mesmo se você estiver usando o agente em um canal de mensagens digitais.
Selecione o modelo que deseja usar, GPT-Realtime, GPT-Realtime-Mini ou GPT-5-Chat (Prévia). GPT-5-Chat (Prévia) é um modelo de voz de LLM textual que gera respostas de voz por meio do Microsoft Neural Text-to-Speech (TTS).
Saiba mais sobre como esses modelos funcionam com base em suas regiões suportadas e considerações de implantação. A tabela a seguir descreve os cenários em que você pode usar diferentes modelos.Scenario GPT-Realtime GPT-5-Chat (Prévia) Estilo de conversa Interações nativas de fala para fala A fala é convertida em texto para raciocínio e depois sintetizada de volta para fala Latency Menor latência para conversas naturais Latência maior que GPT-Realtime Personalização de voz Suporta as opções de voz em tempo real integradas disponíveis para agentes de voz em tempo real Suporta o Microsoft Neural Text-to-Speech (TTS), incluindo um catálogo de voz mais amplo e modelos de voz personalizados Experiências de voz de marca Opções de personalização limitadas Recomendado quando você precisa de uma experiência de voz personalizada ou com marca Flexibilidade de implantação regional Limitado a regiões de modelo em tempo real suportadas Maior flexibilidade por meio de reconhecimento de fala e serviços TTS Mais adequado para Conversas de voz naturais, de baixa latência, e interações abertas Cenários que exigem customização avançada de voz, vozes personalizadas, requisitos de conformidade ou flexibilidade regional para implantação Dica
- Use GPT-Realtime quando a qualidade natural da conversa e baixa latência são os requisitos principais.
- Use o GPT-Realtime-Mini (Prévia) para cenários que exigem interações rápidas de fala com menor latência e uso de recursos.
- Use o GPT-5-Chat (Prévia) quando a personalização de voz, modelos de voz personalizados ou flexibilidade de implantação são mais importantes do que a latência de resposta.
Vá para as configurações de Segurança do agente e selecione Nenhuma Autenticação.
Conhecimento e ferramentas
Você pode configurar seu agente para usar o conhecimento e as ferramentas. Saiba mais em Resumo de fontes de conhecimento, adicionar ferramentas a agentes personalizados e ferramentas, conhecimento, MCP e API.
Agentes aninhados (versão prévia)
Os agentes em tempo real suportam apenas agentes filhos.
Important
Certifique-se de que as descrições dos subagentes não se sobreponham às descrições dos tópicos. Defina explicitamente a ordem de invocação nas instruções do agente.
Tópicos
Agentes em tempo real suportam todos os tópicos configurados no Copilot Studio. Use tópicos para definir comportamentos determinísticos, como cumprimentos, regras de negócio e escalonamento, enquanto o modelo que você escolheu gerencia as respostas conversacionais em tempo de execução. Saiba mais em Escolher como controlar a conversa.
Práticas recomendadas
Use tópicos somente quando o comportamento determinístico for necessário.
Use texto estático em mensagens de saudação para a primeira resposta mais rápida. Mensagens dinâmicas com variáveis e expressões aumentam a latência inicial.
Desative o tópico Iniciar Conversa se quiser que o modelo de agente em tempo real cuide da saudação. Caso contrário, a saudação configurada no tópico Início da Conversa será reproduzida em vez da saudação do modelo de voz.
Deixe o modelo de agente em tempo real cuidar da conversa geral e das perguntas de acompanhamento.
Inclua uma ação explícita no tópico On Error , como transferência ou chamada final. O tratamento de erros baseado apenas em mensagens não é suficiente. Sem um próximo passo determinístico, os clientes podem experimentar silêncio para agentes de voz ou chamadas travadas nos canais de mensagens, levando à confusão e a má experiência do cliente.
Use descrições explícitas de tópicos e ferramentas para declarar a propriedade da coleta de dados. Saiba mais em Escrever tópicos efetivos e descrições de ferramentas.
Suporte ao nó de tema
A lista a seguir descreve o suporte a tópicos nos agentes em tempo real:
Nó Condição
| Característica | Suporte |
|---|---|
| Ramificação If/Else | Com suporte |
| Expressões do Power Fx | Com suporte |
| Reprocessamento de preenchimento de slot | Com suporte |
Nó de Mensagem
| Recurso | Suporte |
|---|---|
| Mensagem básica | Com suporte |
| Variações de mensagem | Suportado |
| Inserção de variável | Suportado |
| SSML | Apenas canal de voz |
| Rich Media/Cartões Adaptáveis | Suportado apenas para canais de mensagens digitais. Este recurso está em versão prévia. |
| Respostas Rápidas | Suportado apenas para canais de mensagens digitais. Este recurso está em versão prévia. |
Nó de Pergunta
| Característica | Suporte |
|---|---|
| Texto de comando | Suportado |
| Retenção automática | Sem suporte |
| Preenchimento de ranhuras | Suportado |
| Ignorar comportamento/Preenchimento ávido de slot | Suportado |
| Reprompt/Tentar novamente | Suportado |
| Tratamento de resposta inválido | Suportado |
| Interrupção do tópico | Suportado |
| Interrupção | Suportado apenas para canal de voz. |
| Mensagem de reprompt personalizada | Suportado |
| Entrada DTMF | Suportado apenas para canal de voz. |
| Detecção de silêncio | Suportado apenas para canal de voz. |
Nó HTTP
| Recurso | Suporte |
|---|---|
| Métodos HTTP: GET, POST, PUT, PATCH, DELETE | Com suporte |
| Pontos de extremidade de URL | Com suporte |
| Cabeçalhos e cargas | Com suporte |
| Análise de resposta e esquema | Com suporte |
| Mapeamento de variável | Com suporte |
| Tratamento de erros | Com suporte |
Nó de ferramenta
| Característica | Suporte |
|---|---|
| Fluxo do Power Automate | Suportado |
| Invocação de ferramenta | Suportado |
| Mapeamento de entrada/saída | Suportado |
| Novo prompt | Suportado |
Definir nó de valor variável
| Recurso | Suporte |
|---|---|
| Atribuição literal | Com suporte |
| Atribuição de expressão | Com suporte |
| De variável para variável | Com suporte |
Nó de gerenciamento de tópicos
| Recurso | Suporte |
|---|---|
| Fim do tópico atual | Com suporte |
| Encerrar todos os tópicos | Com suporte |
| Encerrar a conversa | Com suporte |
| Ir para a etapa | Com suporte |
| Entrada do usuário para identificar intenção | Com suporte |
| Ir para outro tópico | Com suporte |
Nó Transferir conversa
| Recurso | Suporte |
|---|---|
| Transferir para o agente | Com suporte |
| Transferência de número de telefone externo | Suportado apenas para canal de voz. |
Avançado
| Característica | Suporte |
|---|---|
| Criar respostas gerativas | Com suporte |
Suporte ao disparador do sistema
| Trigger | Suporte | Detalhes |
|---|---|---|
| No início da conversa | Suportado | Aciona quando uma nova conversa começa |
| Iniciar conversa com o representante | Suportado | Transferências para o agente humano |
| Tópico desconhecido/sobre intenção desconhecida | Sem suporte | Fallback quando nenhum tópico for correspondente |
| OnSelectIntent (vários tópicos correspondentes) | Sem suporte | Desambiguação entre tópicos semelhantes |
| Reiniciar conversa (OnSystemRedirect) | Suportado | Limpa variáveis e reinicia o fluxo |
| Ao Entrar | Sem suporte | |
| Tecla DTMF desconhecida | Suportado | Entrada no teclado não mapeada. Aplicável apenas ao canal de voz. |
| O agente escolhe/O usuário diz uma frase | Suportado | Agente seleciona tópico com base na intenção |
| Uma mensagem foi recebida | Sem suporte | Aumenta a latência |
| Um evento de cliente personalizado ocorre | Sem suporte | Somente no início da sessão |
| A atualização da conversa | Sem suporte | Membros adicionados ou removidos, alterações de sessão |
| É invocado | Sem suporte | Requer interface do usuário síncrona |
| É redirecionado | Suportado | |
| O usuário fica inativo por um período especificado. | Suportado | Tempo limite de inatividade do usuário. Aplicável apenas a canais de mensagens digitais. |
| Detecção de silêncio | Suportado | Aplicável apenas ao canal de voz. |
| Um plano se completa | Sem suporte | |
| Resposta gerada por IA | Sem suporte | |
| Em Caso de Erro | Suportado | Manipula erros de orquestração |
Passar variáveis entre tópicos e entre o modelo de linguagem
Quando você usa tópicos em um fluxo de conversa híbrido, entender como passar variáveis entre tópicos e o modelo de linguagem em tempo real é fundamental para criar interações confiáveis e com estado. Esse processo se aplica a todos os canais.
Essa funcionalidade funciona por meio do seguinte processo:
Você passa variáveis de entrada definidas em um tópico para o tópico no momento da invocação, para que o modelo de linguagem possa fornecer dados estruturados para o fluxo determinístico.
Você retorna variáveis de saída definidas em um tópico para o modelo de linguagem no final da execução do tópico como pares chave-valor estruturados.
As saídas das chamadas de ferramenta seguem o mesmo padrão.
O modelo de linguagem é preenchido com contexto conversacional, incluindo pares de chave e valor produzidos pela saída de chamadas de ferramentas. No entanto, você só retorna variáveis de saída definidas explicitamente como dados estruturados.
A descrição da variável ajuda o modelo a entender como usar a variável durante uma conversa. Forneça definições claras e descritivas.
Saiba mais em Gerenciar entradas e saídas de tópico.
Suporte multilíngue
Adicione todos os idiomas secundários desejados. Cadeias de caracteres de localização não são necessárias para fluxos em tempo real. No entanto, para mensagens de tópico determinísticas, você precisa fornecer as mensagens traduzidas. Saiba mais em Configurar e criar agentes multilíngues.
O modelo em tempo real pode entender e responder em muitos idiomas. No entanto, Microsoft não valida formalmente todos os idiomas para disponibilidade geral.
Em junho de 2026, as seguintes linguagens estão formalmente validadas:
- Holandês (Países Baixos) (nl-NL)
- Inglês (Austrália) (en-AU)
- Inglês (Estados Unidos) (en-US)
- Inglês (Reino Unido) (en-GB)
- Francês (Canadá) (fr-CA)
- Francês (França) (fr-FR)
- Alemão (Alemanha) (de-DE)
- Italiano (Itália) (it-IT)
- Português (Brasil) (pt-BR)
- Espanhol (Espanha) (es-ES)
- Espanhol (Estados Unidos) (es-US)
A Microsoft continua a validar outros idiomas e adicioná-los após a conclusão da certificação. Você pode adicionar qualquer idioma compatível com o Copilot Studio. No entanto, os idiomas que não são totalmente certificados para qualidade no nível de GA devem ser completamente testados antes da implantação de produção.
Important
A funcionalidade de linguagem técnica não é igual a um idioma com suporte ou certificado. Se você pretende implantar agentes em idiomas diferentes do inglês, deverá realizar testes extensivos com chamadores do mundo real e fluxos de chamadas antes de entrar no ar.
Variáveis de contexto
Um agente em tempo real suporta variáveis de contexto que permitem que ele se comporte de forma mais inteligente, transportando informações sobre a conversa e o cliente. As variáveis de contexto disponíveis dependem do canal. Esse conjunto inclui:
| Variável de contexto | Description |
|---|---|
| ID do Canal | Identifica o canal de comunicação usado para a interação. Aplicável apenas ao canal de voz. |
| Número de telefone do chamador (ANI) | O número de telefone de origem do chamador. Aplicável apenas ao canal de voz. |
| Número do destinatário do chamado (DNIS) | O número de telefone de destino que o chamador ligou. Aplicável apenas ao canal de voz. |
| ID da conversa | Um identificador exclusivo para a sessão de chamada ativa. |
| Cabeçalhos SIP | Suportavam pares chave-valor de cabeçalho SIP associados à chamada. Aplicável apenas ao canal de voz. |
| Data atual (UTC) | A data atual em UTC (Tempo Universal Coordenado), fornecida em runtime para permitir respostas com reconhecimento de data. |
| Hora atual (UTC) | O tempo atual em UTC (Tempo Universal Coordenado), fornecido em runtime para permitir respostas com reconhecimento de tempo. |
Saiba mais sobre todas as outras variáveis de contexto, incluindo mensagens digitais e variáveis de contexto personalizadas, em Configurar variáveis de contexto para agentes.
Configurações específicas do canal
Voz do agente
Selecione a voz que seu agente usa selecionando seu agente e vá para Configurações>Voz>Selecionar voz. Agentes em tempo real oferecem suporte às seguintes vozes:
- Liga
- Cinzas
- Balada
- Coral
- Eco
- Sage
- Cintilação
- Verse
- Marin
- Cedro
Note
- A voz do agente é para o seu agente em tempo real e não é a configurada no centro de administração do Copilot Service.
- Para combinar as vozes das mensagens do seu sistema Dynamics com seu agente em tempo real, use apenas as seguintes vozes suportadas: Alloy, Echo, Shimmer ou Ash.
- Agentes que utilizam Text LLM, GPT-5-Chat (Preview), geram respostas de voz por meio do Microsoft Neural Text-to-Speech (TTS). Esse modelo suporta um catálogo de voz mais amplo e modelos personalizados, tornando-o adequado para organizações que exigem experiências de voz com marca ou customização avançada de voz.
Sensibilidade à fala
A detecção de atividade de voz sensível à fala (VAD) determina quando o agente deve responder depois que o chamador terminar de falar.
Entendendo os tipos de VAD
Agentes em tempo real oferecem suporte a duas abordagens de VAD:
VAD baseado em servidor – Com base no som (silêncio)
Detecta o fim da fala com base em sinais de áudio (duração do silêncio, volume)
Responde rapidamente quando o silêncio é detectado
Melhor para interações estruturadas, respostas curtas, ambientes barulhentos
VAD semântico – Com base no contexto da frase
Determina a conclusão da curva com base no significado do que foi dito
Adapta-se a pausas naturais, vícios de linguagem, frases interrompidas
Melhor para: interações conversacionais, perguntas complexas, discussões abertas
Selecione o VAD certo
Use o VAD baseado em servidor quando todas as seguintes condições forem verdadeiras:
- As interações são estruturadas (navegação no menu no estilo IVR).
- As respostas são curtas e previsíveis.
- O ruído de fundo é uma preocupação (a detecção automática de voz, ou VAD, semântica pode demorar muito).
- Você quer uma troca de turnos rápida e eficiente.
Use VAD semântico quando todas as seguintes condições forem verdadeiras:
- As conversas são abertas e sem conclusão definida.
- Os chamadores podem hesitar ou usar palavras de preenchimento ("hum", "deixe-me pensar...").
- As perguntas são complexas (os chamadores explicam situações).
- O fluxo de conversa natural é priorizado.
Configurar VAD baseado em servidor
Vá para Configurações>Voz>Configuração do Telefone>Entrada de Fala>Sensibilidade>Com base no som (silêncio).
| Parâmetro | Description | Padrão | Intervalo recomendado |
|---|---|---|---|
| Limite | Sensibilidade à voz versus ruído (escala de 0 a 1) | 0,6 | 0.5-0.7 |
| Preenchimento de prefixo (ms) | Áudio capturado antes do início da fala | 300 ms | 200-500 ms |
| Duração do Silêncio (ms) | Silêncio necessário para encerrar a curva | 750 ms | 750-1000 ms |
Threshold
- Mais baixo (0,3-0,4): mais sensível; detecta fala baixa, pode disparar em presença de ruído de fundo.
- Superior (0.7-0.9): menos sensível; requer fala mais alta, reduz gatilhos falsos.
- Recomendado: Comece com 0,5; Aumente se o ruído de fundo causar falsos gatilhos.
Preenchimento de prefixo
- Captura áudio antes da detecção de fala (impede o corte da primeira palavra).
- Menor (200 ms): resposta mais rápida; pode perder a primeira sílaba.
- Maior (500 ms): captura mais segura; pequeno atraso.
- Recomendado: 300 ms (bom equilíbrio).
Duração do Silêncio
- Por quanto tempo o chamador deve ficar em silêncio antes que o agente responda.
- Baixo (500 ms): Rápida troca de turnos; pode interromper se o chamador pausar no meio do pensamento.
- Maior (1000 ms): mais paciente; pode parecer lento.
- Recomendado: comece com 750 ms.
Configurar VAD semântico
Vá para Configurações>Voz>Configuração do Telefone>Entrada de Fala>Sensibilidade>Com Base no Contexto da Frase.
Parâmetro: Rapidez (a rapidez com que o agente responde após a conclusão do sentido da frase)
| Configurações | Comportamento | Melhor para |
|---|---|---|
| Baixo | Espera mais, muito paciente | Chamadores que pensam em voz alta, pausas frequentes |
| Medium | Balanceado (padrão) | Conversas gerais |
| Alto | Responde rapidamente | Interações rápidas, perguntas simples |
Configuração de DTMF
Dual-Tone Multifrequencial (DTMF) permite que os usuários insiram informações por meio do teclado do telefone.
Você pode ativar o DTMF para seu agente nos níveis de tópico e global. Para defini-lo no nível global, selecione seu agente e vá para Configurações>Voz>Comportamento de Conversa>DTMF.
Important
Ao criar experiências baseadas apenas em DTMF, configure a entrada DTMF para cada nó de entrada, incluindo opções de menu e entradas de vários dígitos, como números de conta ou PINs. Garanta que todos os caminhos possíveis de entrada do cliente tenham mapeamentos DTMF correspondentes para que os usuários possam navegar e concluir a conversa usando apenas a entrada do teclado.
Detecção de silêncio
A detecção de silêncio permite que agentes em tempo real reconheçam quando um chamador não fornece entrada por um período especificado. Configure a detecção de silêncio como uma configuração global de voz para o agente acessando Configurações>Voz>Comportamento de Conversa>Detecção de Silêncio.
Important
- A detecção de silêncio não está ativada por padrão. Se o usuário não falar, o agente aguardará indefinidamente sem solicitar. Ative explicitamente a detecção de silêncio e configure uma mensagem de nova solicitação para lidar com chamadores silenciosos.
- O tempo limite padrão de detecção de silêncio é de 7.000 ms (7 segundos). Valide este valor de acordo com o seu caso de uso específico e o ambiente do chamador antes de implantar em produção. Sete segundos podem parecer muito longos para alguns chamadores ou muito curtos para outros, dependendo da natureza da interação, por exemplo, perguntas complexas ou ambientes barulhentos. Teste com dados de chamada do mundo real para determinar o limite apropriado para seu cenário.
- Antes de habilitar a detecção de silêncio, verifique se o comportamento configurado no tópico de detecção de silêncio (por exemplo, Escalonar, Desligar, Repromptar) é intencional e apropriado para seu caso de uso. O comportamento de contingência/alternativa configurado incorretamente, como definir inadvertidamente a contingência/alternativa para Escalonar quando a intenção é desligar ou vice-versa, pode levar a desfechos inesperados nas chamadas.
Latência de mensagens
Adicione uma mensagem de latência ou música ao agente quando as operações em segundo plano levarem mais tempo do que o esperado. Para configurar a mensagem de latência, acesse Configurações>Voz>Comportamento de Conversa>Mensagens de Latência.
Important
Como a solução agente em tempo real do Text LLM utiliza múltiplos passos sequenciais (ASR, LLM, TTS), os chamadores experimentam alguns segundos de silêncio entre falar e ouvir uma resposta. Estabeleça expectativas apropriadas com os usuários, por exemplo, usando uma frase como "Um momento, por favor, estou pesquisando isso para você...".
Avaliação de agentes em tempo real
Agentes em tempo real suportam o envio de texto durante a avaliação, porém, o processamento de áudio não é suportado.