Configurar agentes em tempo real

Note

Este artigo descreve as funcionalidades usadas em agentes ou fluxos de agentes alimentados pelo arnês padrão.

Para implementar um agente em tempo real, ativar o modelo em tempo real, configurar as definições principais do agente e depois configurar as funcionalidades específicas do canal necessárias. Pode implementar o mesmo agente no canal de voz, nos canais de mensagens digitais, ou em ambos.

Note

Os agentes em tempo real estão em pré-visualização para os canais de mensagens digitais. As funcionalidades de pré-visualização não se destinam a utilização em produção e podem ter uma funcionalidade restrita. Estas funcionalidades estão sujeitas a termos de utilização suplementares. A Microsoft disponibiliza-os antes de um lançamento oficial para que os clientes possam obter acesso antecipado e fornecer feedback.

Configurar e ativar agentes em tempo real

  1. Crie um novo agente e configure os seus detalhes básicos, como um nome descritivo e o propósito do agente na descrição.

  2. Aceda às definições de Voz do agente e ative Ativar voz. Em Tipo de voz, selecione Tempo real.

    Importante

    Esta definição só pode ser selecionada uma vez. Depois de selecionares Tempo Real, não podes voltar a um tipo básico de agente. Para usar um agente básico, crie um novo agente. Esta configuração é obrigatória mesmo que esteja a usar o agente num canal de mensagens digitais.

  3. Selecione o modelo que pretende usar, GPT-Realtime, GPT-Realtime-Mini ou GPT-5-Chat (Pré-visualização). GPT-5-Chat (Pré-visualização) é um modelo de voz baseado num LLM de texto que gera respostas de voz por meio do Microsoft Neural Text-to-Speech (TTS).
    Saiba mais sobre como estes modelos funcionam com base nas suas regiões suportadas e considerações de implantação. A tabela seguinte descreve os cenários em que pode usar diferentes modelos.

    Scenario GPT-Realtime GPT-5-Chat (Pré-visualização)
    Estilo de conversa Interações nativas de voz para voz A fala é convertida em texto para raciocínio e depois sintetizada de volta para fala
    Latency Menor latência para conversas naturais Latência superior à GPT-Realtime
    Personalização de voz Suporta as opções de voz em tempo real integradas disponíveis para agentes de voz em tempo real Suporta o Microsoft Neural Text-to-Speech (TTS), incluindo um catálogo de voz mais amplo e modelos de voz personalizados
    Experiências de voz de marca Opções de personalização limitadas Recomendado quando precisa de uma experiência de voz personalizada ou de marca
    Flexibilidade de implantação regional Limitado a regiões de modelos em tempo real suportadas Maior flexibilidade através de reconhecimento de voz e serviços TTS
    Mais indicado para Conversas de voz naturais, de baixa latência, e interações abertas Cenários que exigem personalização avançada de voz, vozes personalizadas, requisitos de conformidade ou flexibilidade regional para a implementação

    Sugestão

    • Use GPT-Realtime quando a qualidade natural da conversa e baixa latência são os requisitos principais.
    • Utilize GPT-Realtime-Mini (Pré-visualização) para cenários que necessitem de interações de voz rápidas, com menor latência e menor utilização de recursos.
    • Utilize GPT-5-Chat (Pré-visualização) quando a personalização da voz, os modelos de voz personalizados ou a flexibilidade de implementação forem mais importantes do que a latência nas respostas.
  4. Vá às definições de Segurança do agente e selecione Sem Autenticação.

Conhecimento e ferramentas

Pode configurar o seu agente para usar conhecimento e ferramentas. Saiba mais em Resumo de fontes de conhecimento, Adicionar ferramentas a agentes personalizados, e Ferramentas, conhecimento, MCP e API.

Agentes aninhados (pré-visualização)

Os agentes em tempo real suportam apenas agentes filhos.

Importante

Garante que as descrições dos agentes infantis não se sobrepõem às descrições dos tópicos. Defina explicitamente a ordem de invocação nas instruções do agente.

Tópicos

Os agentes em tempo real suportam todos os tópicos configurados no Copilot Studio. Use tópicos para definir comportamentos determinísticos, como cumprimentos, regras de negócio e escalonamento, enquanto o modelo selecionado gere as respostas conversacionais em tempo de execução. Saiba mais em Escolha como controlar a conversa.

Melhores práticas

  • Use tópicos apenas quando for necessário comportamento determinístico.

  • Use texto estático nas mensagens de saudação para obter a resposta inicial mais rápida. Mensagens dinâmicas com variáveis e expressões aumentam a latência inicial.

  • Desative o tópico Início de Conversa se quiser que o modelo de agente em tempo real trate da saudação. Caso contrário, a saudação configurada no tópico Início de Conversa é reproduzida em vez da saudação do modelo de voz.

  • Deixe o modelo de agente em tempo real tratar da conversa geral e das perguntas de seguimento.

  • Inclua uma ação explícita no tópico On Error , como transferência ou terminar chamada. O tratamento de erros apenas por mensagens não é suficiente. Sem um passo seguinte determinista, os clientes podem experienciar silêncio para agentes de voz ou chamadas bloqueadas para canais de mensagens, levando a confusão e má experiência do cliente.

  • Use descrições explícitas de tópicos e ferramentas para declarar a propriedade da recolha de dados. Saiba mais em Escrever descrições eficazes de temas e ferramentas.

Suporte de nós tópicos

A lista seguinte descreve o suporte de tópicos em agentes em tempo real:

Nó de condição

Feature Support
Ramificação If/Else Suportado
Expressões do Power Fx Suportado
Reprocessamento de preenchimento de slots Suportado

Nó Mensagem

Feature Support
Mensagem básica Suportado
Variações das mensagens Suportado
Inserção variável Suportado
SSML Apenas canal de voz
Rich Media/Cartões Adaptativos  Suportado apenas para canais de mensagens digitais. Este recurso está em pré-visualização. 
Respostas Rápidas Suportado apenas para canais de mensagens digitais. Este recurso está em pré-visualização. 

Nó Pergunta

Feature Support
Texto prompt Suportado
Retenção automática Não suportado
Preenchimento de lacunas Suportado
Comportamento de ignorar/Preenchimento imediato de slots Suportado
Re-prompt/Tentar Novamente Suportado
Tratamento de respostas inválido Suportado
Interrupção do tema Suportado
Interrupção Suportado apenas para canal de voz.
Mensagem personalizada de aviso de retorno Suportado
Entrada DTMF Suportado apenas para canal de voz.
Deteção de silêncio Suportado apenas para canal de voz.

Nó HTTP

Feature Support
Métodos HTTP: OBTER, PUBLICAR, COLOCAR, ATUALIZAR, ELIMINAR Suportado
Pontos finais de URL Suportado
Cabeçalhos e cargas úteis Suportado
Análise sintática de resposta e esquema Suportado
Mapeamento variável Suportado
Tratamento de erros Suportado

Nó de ferramenta

Feature Support
Fluxo do Power Automate Suportado
Invocação de ferramentas Suportado
Mapeamento de entrada/saída Suportado
Novo prompt Suportado

Nó de definição de valor de variável

Feature Support
Atribuição literal Suportado
Atribuição de expressão Suportado
Variável para variável Suportado

Nó de gestão de tópicos

Feature Support
Fim do tópico atual Suportado
Fim de todos os tópicos Suportado
Fim da conversa Suportado
Ir para o passo Suportado
Entrada do utilizador para reconhecer intenção Suportado
Vai para outro tópico Suportado

Nó de transferência de conversação

Feature Support
Transferência para agente Suportado
Transferência externa de número de telefone Suportado apenas para canal de voz. 

Avançado

Feature Support
Crie respostas generativas Suportado

Suporte para gatilhos do sistema

Trigger Support Detalhes
No início da conversa Suportado Aciona quando uma nova conversa começa
Falar com o representante Suportado Transferências para agente humano
Tema Desconhecido/Sobre Intenção Desconhecida Não suportado Alternativa quando nenhum assunto corresponde
OnSelectIntent (vários tópicos correspondidos) Não suportado Desambiguação entre tópicos semelhantes
Reiniciar Sessão (OnSystemRedirect) Suportado Limpa variáveis e reinicia o fluxo
Ao iniciar sessão Não suportado
Pressão de tecla DTMF desconhecida Suportado Entrada de teclado não mapeada. Aplicável apenas ao canal de voz.
O agente escolhe / O utilizador diz uma frase Suportado O agente escolhe o tema com base na intenção
Uma mensagem é recebida Não suportado Aumenta a latência
Ocorre um evento de cliente personalizado Não suportado Só no início da sessão
A atualização do chat Não suportado Membros adicionados ou removidos, alterações nas sessões
É invocado Não suportado Requer uma interface de utilizador síncrona
Está redirecionado Suportado
O utilizador está inativo durante um período especificado. Suportado Tempo limite de inatividade do utilizador. Aplicável apenas a canais de mensagens digitais.
Deteção de silêncio Suportado Aplicável apenas ao canal de voz.
Um plano está concluído Não suportado
Resposta de IA gerada Não suportado
Em caso de erro Suportado Lida com erros de orquestração

Variáveis de passagem entre tópicos e o modelo de linguagem

Quando utiliza tópicos num fluxo conversacional híbrido, compreender como passar variáveis entre tópicos e o modelo de linguagem em tempo real é fundamental para criar interações fiáveis e com monitorização de estado. Este processo aplica-se a todos os canais.

Esta funcionalidade funciona através do seguinte processo:

  • Passa-se variáveis de entrada definidas num tema para o tema no momento da invocação, para que o modelo de linguagem possa fornecer dados estruturados ao fluxo determinístico.

  • Devolve variáveis de saída definidas num tópico ao modelo de linguagem no final da execução do tópico como pares estruturados chave-valor.

  • As saídas das invocações de ferramentas seguem o mesmo padrão.

  • O modelo de linguagem é preenchido com contexto conversacional, incluindo pares-chave-valor de saída de chamadas de ferramenta. No entanto, só devolve variáveis de saída explicitamente definidas como dados estruturados.

  • A descrição da variável ajuda o modelo a perceber como usar a variável durante uma conversa. Forneça definições claras e descritivas.

Saiba mais em Gerir entradas e saídas de tópicos.

Suporte multilíngue

Adiciona todas as línguas secundárias que quiseres. As strings de localização não são necessárias para fluxos em tempo real. No entanto, para mensagens de tópico determinísticas, é necessário fornecer as mensagens traduzidas. Saiba mais em Configurar e criar agentes multilíngues.

O modelo em tempo real pode compreender e responder em muitas línguas. No entanto, a Microsoft não valida formalmente todas as linguagens para disponibilidade geral.

Em junho de 2026, as seguintes linguagens estão formalmente validadas:

  • Neerlandês (Países Baixos) (nl-NL)
  • Inglês (Austrália) (en-AU)
  • Inglês (Estados Unidos) (en-US)
  • Inglês (Reino Unido) (en-GB)
  • Francês (Canadá) (fr-CA)
  • Francês (França) (fr-FR)
  • Alemão (Alemanha) (de-DE)
  • Italiano (Itália) (it-IT)
  • Português (Brasil) (pt-BR)
  • Espanhol (Espanha) (es-ES)
  • Espanhol (Estados Unidos) (es-US)

A Microsoft continua a validar outras linguagens e adiciona-as após a conclusão da certificação. Pode adicionar qualquer linguagem suportada pelo Copilot Studio. No entanto, linguagens que não estejam totalmente certificadas para qualidade ao nível de GA devem ser testadas minuciosamente antes da implementação em produção.

Importante

A capacidade de linguagem técnica não equivale a uma linguagem suportada ou certificada. Se pretende implementar agentes em línguas diferentes do inglês, deve realizar testes extensivos com interlocutores e fluxos de chamadas do mundo real antes de iniciar as operações.

Variáveis de contexto

Um agente em tempo real suporta variáveis de contexto que lhe permitem comportar-se de forma mais inteligente, transportando informações sobre a conversa e o cliente. As variáveis de contexto disponíveis dependem do canal. Este conjunto inclui:

Variável de contexto Description
ID do canal Identifica o canal de comunicação utilizado para a interação. Aplicável apenas ao canal de voz.
Número de telefone do chamador (ANI) O número de telefone de origem do chamador. Aplicável apenas ao canal de voz.
Número do destinatário da chamada (DNIS) O número de destino que o chamador marcou. Aplicável apenas ao canal de voz.
ID da conversação Um identificador único para a sessão de chamada ativa.
Cabeçalhos SIP Suportavam pares chave de cabeçalho SIP associados à chamada. Aplicável apenas ao canal de voz.
Data atual (UTC) A data atual em Tempo Universal Coordenado (UTC), fornecida em tempo de execução para permitir respostas que considerem a data.
Hora atual (UTC) O tempo atual em Tempo Universal Coordenado (UTC), fornecido em tempo de execução para permitir respostas sensíveis ao tempo.

Saiba mais sobre todas as outras variáveis de contexto, incluindo mensagens digitais e variáveis de contexto personalizadas, em Configurar variáveis de contexto para agentes.

Definições específicas do canal

Voz do agente

Selecione a voz que o seu agente usa selecionando o seu agente e vá a Definições>Voz>Selecionar voz. Os agentes em tempo real suportam as seguintes vozes:

  • Liga
  • Cinza
  • Balada
  • Coral
  • Eco
  • Sage
  • Shimmer
  • Verse
  • Marin
  • Cedro

Note

  • A voz do agente é para o seu agente em tempo real e não é a que está configurada no centro de administração do Copilot Service.
  • Para comparar as vozes das mensagens do seu sistema Dynamics com o seu agente em tempo real, use apenas as seguintes vozes suportadas: Alloy, Echo, Shimmer ou Ash.
  • Agentes que utilizam Text LLM, GPT-5-Chat (Pré-visualização), geram respostas de voz através do Microsoft Neural Text-to-Speech (TTS). Este modelo suporta um catálogo de voz mais amplo e modelos de voz personalizados, tornando-o adequado para organizações que necessitam de experiências de voz de marca ou personalização avançada de voz.

Sensibilidade da voz

A deteção de atividade de voz (VAD) por sensibilidade à fala determina quando o agente deve responder após o interlocutor terminar de falar.

Compreensão dos tipos VAD

Os agentes em tempo real suportam duas abordagens de VAD:

Captura de ecrã da janela de diálogo de sensibilidade à fala.

VAD baseado em servidor - Baseado no som (silêncio)

  • Deteta o fim da fala com base em sinais de áudio (duração do silêncio, volume)

  • Responde rapidamente assim que o silêncio é detetado

  • Ideal para interações estruturadas, respostas curtas, ambientes ruidosos

VAD semântico - Baseado no contexto da frase

  • Determina a conclusão do turno com base no significado do que foi dito

  • Adapta‑se a pausas naturais, palavras de preenchimento e voz arrastada

  • Ideal para: Interações conversacionais, perguntas complexas, discussões abertas

Selecione o VAD certo

Use VAD baseado em servidor quando todas as seguintes condições forem verdadeiras:

  • As interações são estruturadas (navegação por menus ao estilo IVR).
  • As respostas são curtas e previsíveis.
  • O ruído de fundo é uma preocupação (o VAD semântico pode demorar demasiado).
  • Queres fazer turnos rápidos e precisos.

Use VAD semântico quando todas as seguintes condições forem verdadeiras.

  • As conversas são abertas e sem fim determinado.
  • Os ouvintes podem hesitar ou usar palavras de enchimento ("hum", "deixa-me pensar...").
  • As perguntas são complexas (os ouvintes explicam as situações).
  • O fluxo natural da conversa é priorizado.

Configurar VAD baseado em servidor

Vai a Definições>Voz>Configuração do Telemóvel>Entrada de voz>Sensibilidade>Baseada no som (silêncio).

Captura de ecrã do diálogo de sensibilidade à fala quando definido como Baseado no som (silêncio).

Parâmetro Description Predefinição Gama recomendada
Limite Sensibilidade à voz versus ruído (escala 0-1) 0,6 0.5-0.7
Preenchimento de prefixo (ms) Áudio captado antes do início da fala 300 ms 200-500 ms
Duração do Silêncio (ms) Silêncio necessário para terminar o turno 750 ms 750-1000 ms

Threshold

  • Mais baixo (0,3-0,4): Mais sensível; capta fala suave, pode ser acionado com ruído de fundo.
  • Maior (0,7-0,9): Menos sensível; requer fala mais alta, reduz os falsos gatilhos.
  • Recomendado: Comece com 0,5; aumenta se o ruído de fundo causar falsos gatilhos.

Enchimento de prefixo

  • Captura áudio antes da deteção de fala (evita cortar a primeira palavra).
  • Menor (200 ms): Resposta mais rápida; pode falhar a primeira sílaba.
  • Maior (500 ms): Captura mais segura; Pequeno atraso.
  • Recomendado: 300 ms (bom equilíbrio).

Duração do Silêncio

  • Quanto tempo o interlocutor deve ficar em silêncio antes de o agente responder.
  • Inferior (500 ms): Troca rápida de turnos; pode interromper se o interlocutor parar a meio de uma ideia.
  • Mais alto (1000 ms): Mais paciente; pode parecer lento.
  • Recomendado: Comece com 750 ms.

Configurar VAD Semântico

Vá a Definições>Voz>Configuração>Introdução de fala>Sensibilidade>com base no contexto da frase.

Captura de ecrã do diálogo de sensibilidade à fala quando definido como Baseado no contexto da frase.

Parâmetro: Entusiasmo (quão rápido o agente responde após a conclusão semântica)

Setting Behavior Melhor para
Baixo Espera mais tempo, muito paciente Ouvintes que pensam em voz alta, pausas frequentes
Médio Equilibrado (por padrão) Conversas gerais
High Responde rapidamente Interações rápidas, perguntas simples

Configuração DTMF

Dual-Tone Multi-Frequência (DTMF) permite aos ouvintes introduzir informações usando o teclado do seu telemóvel.

Podes ativar o DTMF para o teu agente, tanto a nível temático como global. Para definir a nível global, selecione o seu agente e vá a Definições>Voz>Comportamento de Conversa>DTMF.

Importante

Ao criar experiências baseadas exclusivamente em DTMF, configure a entrada DTMF para cada nó de entrada, incluindo opções de menu e entradas de vários dígitos, como números de conta ou PINs. Garantir que todos os caminhos de entrada possíveis dos clientes tenham correspondentes mapeamentos DTMF para que os utilizadores possam navegar e concluir a conversa apenas usando a entrada por teclado.

Deteção de silêncio

A deteção de silêncio permite que os agentes em tempo real reconheçam quando um chamador não fornece entrada durante um período especificado. Configura a deteção de silêncio como uma definição global de voz para o agente acesse Definições>Voz>Comportamento de Conversa>Deteção de Silêncio.

Importante

  • A deteção de silêncio não está ativada por defeito. Se o utilizador não falar, o agente espera indefinidamente sem fazer qualquer alerta. Ative explicitamente a deteção de silêncio e configure uma mensagem de reaviso para lidar com chamadas silenciosas.
  • O tempo limite padrão para deteção de silêncio é de 7.000 ms (7 segundos). Valide este valor em relação ao seu caso de uso específico e ao ambiente do chamador antes de implementar em produção. Sete segundos podem parecer demasiado longos para alguns ou curtos para outros, dependendo da natureza da interação, por exemplo, perguntas complexas ou ambientes barulhentos. Teste com dados de chamadas do mundo real para determinar o limiar adequado para o seu cenário.
  • Antes de ativar a deteção de silêncio, certifique-se de que o comportamento que configura no tópico de deteção de silêncio (por exemplo, Escalar, Desligar, Repetir pedido) é intencional e adequado ao seu caso de utilização. Um comportamento de contingência mal configurado, como definir inadvertidamente a contingência para Escalar quando a intenção era desligar, ou vice‑versa, pode resultar em resultados inesperados na chamada.

Latência das mensagens

Adicione mensagem de latência ou música ao seu agente quando as operações em segundo plano demorarem mais do que o esperado. Para configurar mensagens de latência, vá a Definições>Voz>Comportamento de Conversa>Mensagens de Latência.

Importante

Como a solução de agente em tempo real Text LLM utiliza múltiplos passos sequenciais (ASR, LLM, TTS), os chamadores experienciam alguns segundos de silêncio entre falar e ouvir uma resposta. Defina expectativas adequadas com os utilizadores, por exemplo, usando uma frase como "Um momento, por favor, estou a pesquisar isso para si...".

Captura de ecrã do diálogo de mensagens de latência.

Avaliação de agentes em tempo real

Os agentes em tempo real suportam o envio de texto durante a avaliação, no entanto, o processamento de áudio não é suportado.