Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Note
Este artigo descreve as funcionalidades usadas em agentes ou fluxos de agentes alimentados pelo arnês padrão.
Para implementar um agente em tempo real, ativar o modelo em tempo real, configurar as definições principais do agente e depois configurar as funcionalidades específicas do canal necessárias. Pode implementar o mesmo agente no canal de voz, nos canais de mensagens digitais, ou em ambos.
Note
Os agentes em tempo real estão em pré-visualização para os canais de mensagens digitais. As funcionalidades de pré-visualização não se destinam a utilização em produção e podem ter uma funcionalidade restrita. Estas funcionalidades estão sujeitas a termos de utilização suplementares. A Microsoft disponibiliza-os antes de um lançamento oficial para que os clientes possam obter acesso antecipado e fornecer feedback.
Configurar e ativar agentes em tempo real
Crie um novo agente e configure os seus detalhes básicos, como um nome descritivo e o propósito do agente na descrição.
Aceda às definições de Voz do agente e ative Ativar voz. Em Tipo de voz, selecione Tempo real.
Importante
Esta definição só pode ser selecionada uma vez. Depois de selecionares Tempo Real, não podes voltar a um tipo básico de agente. Para usar um agente básico, crie um novo agente. Esta configuração é obrigatória mesmo que esteja a usar o agente num canal de mensagens digitais.
Selecione o modelo que pretende usar, GPT-Realtime, GPT-Realtime-Mini ou GPT-5-Chat (Pré-visualização). GPT-5-Chat (Pré-visualização) é um modelo de voz baseado num LLM de texto que gera respostas de voz por meio do Microsoft Neural Text-to-Speech (TTS).
Saiba mais sobre como estes modelos funcionam com base nas suas regiões suportadas e considerações de implantação. A tabela seguinte descreve os cenários em que pode usar diferentes modelos.Scenario GPT-Realtime GPT-5-Chat (Pré-visualização) Estilo de conversa Interações nativas de voz para voz A fala é convertida em texto para raciocínio e depois sintetizada de volta para fala Latency Menor latência para conversas naturais Latência superior à GPT-Realtime Personalização de voz Suporta as opções de voz em tempo real integradas disponíveis para agentes de voz em tempo real Suporta o Microsoft Neural Text-to-Speech (TTS), incluindo um catálogo de voz mais amplo e modelos de voz personalizados Experiências de voz de marca Opções de personalização limitadas Recomendado quando precisa de uma experiência de voz personalizada ou de marca Flexibilidade de implantação regional Limitado a regiões de modelos em tempo real suportadas Maior flexibilidade através de reconhecimento de voz e serviços TTS Mais indicado para Conversas de voz naturais, de baixa latência, e interações abertas Cenários que exigem personalização avançada de voz, vozes personalizadas, requisitos de conformidade ou flexibilidade regional para a implementação Sugestão
- Use GPT-Realtime quando a qualidade natural da conversa e baixa latência são os requisitos principais.
- Utilize GPT-Realtime-Mini (Pré-visualização) para cenários que necessitem de interações de voz rápidas, com menor latência e menor utilização de recursos.
- Utilize GPT-5-Chat (Pré-visualização) quando a personalização da voz, os modelos de voz personalizados ou a flexibilidade de implementação forem mais importantes do que a latência nas respostas.
Vá às definições de Segurança do agente e selecione Sem Autenticação.
Conhecimento e ferramentas
Pode configurar o seu agente para usar conhecimento e ferramentas. Saiba mais em Resumo de fontes de conhecimento, Adicionar ferramentas a agentes personalizados, e Ferramentas, conhecimento, MCP e API.
Agentes aninhados (pré-visualização)
Os agentes em tempo real suportam apenas agentes filhos.
Importante
Garante que as descrições dos agentes infantis não se sobrepõem às descrições dos tópicos. Defina explicitamente a ordem de invocação nas instruções do agente.
Tópicos
Os agentes em tempo real suportam todos os tópicos configurados no Copilot Studio. Use tópicos para definir comportamentos determinísticos, como cumprimentos, regras de negócio e escalonamento, enquanto o modelo selecionado gere as respostas conversacionais em tempo de execução. Saiba mais em Escolha como controlar a conversa.
Melhores práticas
Use tópicos apenas quando for necessário comportamento determinístico.
Use texto estático nas mensagens de saudação para obter a resposta inicial mais rápida. Mensagens dinâmicas com variáveis e expressões aumentam a latência inicial.
Desative o tópico Início de Conversa se quiser que o modelo de agente em tempo real trate da saudação. Caso contrário, a saudação configurada no tópico Início de Conversa é reproduzida em vez da saudação do modelo de voz.
Deixe o modelo de agente em tempo real tratar da conversa geral e das perguntas de seguimento.
Inclua uma ação explícita no tópico On Error , como transferência ou terminar chamada. O tratamento de erros apenas por mensagens não é suficiente. Sem um passo seguinte determinista, os clientes podem experienciar silêncio para agentes de voz ou chamadas bloqueadas para canais de mensagens, levando a confusão e má experiência do cliente.
Use descrições explícitas de tópicos e ferramentas para declarar a propriedade da recolha de dados. Saiba mais em Escrever descrições eficazes de temas e ferramentas.
Suporte de nós tópicos
A lista seguinte descreve o suporte de tópicos em agentes em tempo real:
Nó de condição
| Feature | Support |
|---|---|
| Ramificação If/Else | Suportado |
| Expressões do Power Fx | Suportado |
| Reprocessamento de preenchimento de slots | Suportado |
Nó Mensagem
| Feature | Support |
|---|---|
| Mensagem básica | Suportado |
| Variações das mensagens | Suportado |
| Inserção variável | Suportado |
| SSML | Apenas canal de voz |
| Rich Media/Cartões Adaptativos | Suportado apenas para canais de mensagens digitais. Este recurso está em pré-visualização. |
| Respostas Rápidas | Suportado apenas para canais de mensagens digitais. Este recurso está em pré-visualização. |
Nó Pergunta
| Feature | Support |
|---|---|
| Texto prompt | Suportado |
| Retenção automática | Não suportado |
| Preenchimento de lacunas | Suportado |
| Comportamento de ignorar/Preenchimento imediato de slots | Suportado |
| Re-prompt/Tentar Novamente | Suportado |
| Tratamento de respostas inválido | Suportado |
| Interrupção do tema | Suportado |
| Interrupção | Suportado apenas para canal de voz. |
| Mensagem personalizada de aviso de retorno | Suportado |
| Entrada DTMF | Suportado apenas para canal de voz. |
| Deteção de silêncio | Suportado apenas para canal de voz. |
Nó HTTP
| Feature | Support |
|---|---|
| Métodos HTTP: OBTER, PUBLICAR, COLOCAR, ATUALIZAR, ELIMINAR | Suportado |
| Pontos finais de URL | Suportado |
| Cabeçalhos e cargas úteis | Suportado |
| Análise sintática de resposta e esquema | Suportado |
| Mapeamento variável | Suportado |
| Tratamento de erros | Suportado |
Nó de ferramenta
| Feature | Support |
|---|---|
| Fluxo do Power Automate | Suportado |
| Invocação de ferramentas | Suportado |
| Mapeamento de entrada/saída | Suportado |
| Novo prompt | Suportado |
Nó de definição de valor de variável
| Feature | Support |
|---|---|
| Atribuição literal | Suportado |
| Atribuição de expressão | Suportado |
| Variável para variável | Suportado |
Nó de gestão de tópicos
| Feature | Support |
|---|---|
| Fim do tópico atual | Suportado |
| Fim de todos os tópicos | Suportado |
| Fim da conversa | Suportado |
| Ir para o passo | Suportado |
| Entrada do utilizador para reconhecer intenção | Suportado |
| Vai para outro tópico | Suportado |
Nó de transferência de conversação
| Feature | Support |
|---|---|
| Transferência para agente | Suportado |
| Transferência externa de número de telefone | Suportado apenas para canal de voz. |
Avançado
| Feature | Support |
|---|---|
| Crie respostas generativas | Suportado |
Suporte para gatilhos do sistema
| Trigger | Support | Detalhes |
|---|---|---|
| No início da conversa | Suportado | Aciona quando uma nova conversa começa |
| Falar com o representante | Suportado | Transferências para agente humano |
| Tema Desconhecido/Sobre Intenção Desconhecida | Não suportado | Alternativa quando nenhum assunto corresponde |
| OnSelectIntent (vários tópicos correspondidos) | Não suportado | Desambiguação entre tópicos semelhantes |
| Reiniciar Sessão (OnSystemRedirect) | Suportado | Limpa variáveis e reinicia o fluxo |
| Ao iniciar sessão | Não suportado | |
| Pressão de tecla DTMF desconhecida | Suportado | Entrada de teclado não mapeada. Aplicável apenas ao canal de voz. |
| O agente escolhe / O utilizador diz uma frase | Suportado | O agente escolhe o tema com base na intenção |
| Uma mensagem é recebida | Não suportado | Aumenta a latência |
| Ocorre um evento de cliente personalizado | Não suportado | Só no início da sessão |
| A atualização do chat | Não suportado | Membros adicionados ou removidos, alterações nas sessões |
| É invocado | Não suportado | Requer uma interface de utilizador síncrona |
| Está redirecionado | Suportado | |
| O utilizador está inativo durante um período especificado. | Suportado | Tempo limite de inatividade do utilizador. Aplicável apenas a canais de mensagens digitais. |
| Deteção de silêncio | Suportado | Aplicável apenas ao canal de voz. |
| Um plano está concluído | Não suportado | |
| Resposta de IA gerada | Não suportado | |
| Em caso de erro | Suportado | Lida com erros de orquestração |
Variáveis de passagem entre tópicos e o modelo de linguagem
Quando utiliza tópicos num fluxo conversacional híbrido, compreender como passar variáveis entre tópicos e o modelo de linguagem em tempo real é fundamental para criar interações fiáveis e com monitorização de estado. Este processo aplica-se a todos os canais.
Esta funcionalidade funciona através do seguinte processo:
Passa-se variáveis de entrada definidas num tema para o tema no momento da invocação, para que o modelo de linguagem possa fornecer dados estruturados ao fluxo determinístico.
Devolve variáveis de saída definidas num tópico ao modelo de linguagem no final da execução do tópico como pares estruturados chave-valor.
As saídas das invocações de ferramentas seguem o mesmo padrão.
O modelo de linguagem é preenchido com contexto conversacional, incluindo pares-chave-valor de saída de chamadas de ferramenta. No entanto, só devolve variáveis de saída explicitamente definidas como dados estruturados.
A descrição da variável ajuda o modelo a perceber como usar a variável durante uma conversa. Forneça definições claras e descritivas.
Saiba mais em Gerir entradas e saídas de tópicos.
Suporte multilíngue
Adiciona todas as línguas secundárias que quiseres. As strings de localização não são necessárias para fluxos em tempo real. No entanto, para mensagens de tópico determinísticas, é necessário fornecer as mensagens traduzidas. Saiba mais em Configurar e criar agentes multilíngues.
O modelo em tempo real pode compreender e responder em muitas línguas. No entanto, a Microsoft não valida formalmente todas as linguagens para disponibilidade geral.
Em junho de 2026, as seguintes linguagens estão formalmente validadas:
- Neerlandês (Países Baixos) (nl-NL)
- Inglês (Austrália) (en-AU)
- Inglês (Estados Unidos) (en-US)
- Inglês (Reino Unido) (en-GB)
- Francês (Canadá) (fr-CA)
- Francês (França) (fr-FR)
- Alemão (Alemanha) (de-DE)
- Italiano (Itália) (it-IT)
- Português (Brasil) (pt-BR)
- Espanhol (Espanha) (es-ES)
- Espanhol (Estados Unidos) (es-US)
A Microsoft continua a validar outras linguagens e adiciona-as após a conclusão da certificação. Pode adicionar qualquer linguagem suportada pelo Copilot Studio. No entanto, linguagens que não estejam totalmente certificadas para qualidade ao nível de GA devem ser testadas minuciosamente antes da implementação em produção.
Importante
A capacidade de linguagem técnica não equivale a uma linguagem suportada ou certificada. Se pretende implementar agentes em línguas diferentes do inglês, deve realizar testes extensivos com interlocutores e fluxos de chamadas do mundo real antes de iniciar as operações.
Variáveis de contexto
Um agente em tempo real suporta variáveis de contexto que lhe permitem comportar-se de forma mais inteligente, transportando informações sobre a conversa e o cliente. As variáveis de contexto disponíveis dependem do canal. Este conjunto inclui:
| Variável de contexto | Description |
|---|---|
| ID do canal | Identifica o canal de comunicação utilizado para a interação. Aplicável apenas ao canal de voz. |
| Número de telefone do chamador (ANI) | O número de telefone de origem do chamador. Aplicável apenas ao canal de voz. |
| Número do destinatário da chamada (DNIS) | O número de destino que o chamador marcou. Aplicável apenas ao canal de voz. |
| ID da conversação | Um identificador único para a sessão de chamada ativa. |
| Cabeçalhos SIP | Suportavam pares chave de cabeçalho SIP associados à chamada. Aplicável apenas ao canal de voz. |
| Data atual (UTC) | A data atual em Tempo Universal Coordenado (UTC), fornecida em tempo de execução para permitir respostas que considerem a data. |
| Hora atual (UTC) | O tempo atual em Tempo Universal Coordenado (UTC), fornecido em tempo de execução para permitir respostas sensíveis ao tempo. |
Saiba mais sobre todas as outras variáveis de contexto, incluindo mensagens digitais e variáveis de contexto personalizadas, em Configurar variáveis de contexto para agentes.
Definições específicas do canal
Voz do agente
Selecione a voz que o seu agente usa selecionando o seu agente e vá a Definições>Voz>Selecionar voz. Os agentes em tempo real suportam as seguintes vozes:
- Liga
- Cinza
- Balada
- Coral
- Eco
- Sage
- Shimmer
- Verse
- Marin
- Cedro
Note
- A voz do agente é para o seu agente em tempo real e não é a que está configurada no centro de administração do Copilot Service.
- Para comparar as vozes das mensagens do seu sistema Dynamics com o seu agente em tempo real, use apenas as seguintes vozes suportadas: Alloy, Echo, Shimmer ou Ash.
- Agentes que utilizam Text LLM, GPT-5-Chat (Pré-visualização), geram respostas de voz através do Microsoft Neural Text-to-Speech (TTS). Este modelo suporta um catálogo de voz mais amplo e modelos de voz personalizados, tornando-o adequado para organizações que necessitam de experiências de voz de marca ou personalização avançada de voz.
Sensibilidade da voz
A deteção de atividade de voz (VAD) por sensibilidade à fala determina quando o agente deve responder após o interlocutor terminar de falar.
Compreensão dos tipos VAD
Os agentes em tempo real suportam duas abordagens de VAD:
VAD baseado em servidor - Baseado no som (silêncio)
Deteta o fim da fala com base em sinais de áudio (duração do silêncio, volume)
Responde rapidamente assim que o silêncio é detetado
Ideal para interações estruturadas, respostas curtas, ambientes ruidosos
VAD semântico - Baseado no contexto da frase
Determina a conclusão do turno com base no significado do que foi dito
Adapta‑se a pausas naturais, palavras de preenchimento e voz arrastada
Ideal para: Interações conversacionais, perguntas complexas, discussões abertas
Selecione o VAD certo
Use VAD baseado em servidor quando todas as seguintes condições forem verdadeiras:
- As interações são estruturadas (navegação por menus ao estilo IVR).
- As respostas são curtas e previsíveis.
- O ruído de fundo é uma preocupação (o VAD semântico pode demorar demasiado).
- Queres fazer turnos rápidos e precisos.
Use VAD semântico quando todas as seguintes condições forem verdadeiras.
- As conversas são abertas e sem fim determinado.
- Os ouvintes podem hesitar ou usar palavras de enchimento ("hum", "deixa-me pensar...").
- As perguntas são complexas (os ouvintes explicam as situações).
- O fluxo natural da conversa é priorizado.
Configurar VAD baseado em servidor
Vai a Definições>Voz>Configuração do Telemóvel>Entrada de voz>Sensibilidade>Baseada no som (silêncio).
| Parâmetro | Description | Predefinição | Gama recomendada |
|---|---|---|---|
| Limite | Sensibilidade à voz versus ruído (escala 0-1) | 0,6 | 0.5-0.7 |
| Preenchimento de prefixo (ms) | Áudio captado antes do início da fala | 300 ms | 200-500 ms |
| Duração do Silêncio (ms) | Silêncio necessário para terminar o turno | 750 ms | 750-1000 ms |
Threshold
- Mais baixo (0,3-0,4): Mais sensível; capta fala suave, pode ser acionado com ruído de fundo.
- Maior (0,7-0,9): Menos sensível; requer fala mais alta, reduz os falsos gatilhos.
- Recomendado: Comece com 0,5; aumenta se o ruído de fundo causar falsos gatilhos.
Enchimento de prefixo
- Captura áudio antes da deteção de fala (evita cortar a primeira palavra).
- Menor (200 ms): Resposta mais rápida; pode falhar a primeira sílaba.
- Maior (500 ms): Captura mais segura; Pequeno atraso.
- Recomendado: 300 ms (bom equilíbrio).
Duração do Silêncio
- Quanto tempo o interlocutor deve ficar em silêncio antes de o agente responder.
- Inferior (500 ms): Troca rápida de turnos; pode interromper se o interlocutor parar a meio de uma ideia.
- Mais alto (1000 ms): Mais paciente; pode parecer lento.
- Recomendado: Comece com 750 ms.
Configurar VAD Semântico
Vá a Definições>Voz>Configuração>Introdução de fala>Sensibilidade>com base no contexto da frase.
Parâmetro: Entusiasmo (quão rápido o agente responde após a conclusão semântica)
| Setting | Behavior | Melhor para |
|---|---|---|
| Baixo | Espera mais tempo, muito paciente | Ouvintes que pensam em voz alta, pausas frequentes |
| Médio | Equilibrado (por padrão) | Conversas gerais |
| High | Responde rapidamente | Interações rápidas, perguntas simples |
Configuração DTMF
Dual-Tone Multi-Frequência (DTMF) permite aos ouvintes introduzir informações usando o teclado do seu telemóvel.
Podes ativar o DTMF para o teu agente, tanto a nível temático como global. Para definir a nível global, selecione o seu agente e vá a Definições>Voz>Comportamento de Conversa>DTMF.
Importante
Ao criar experiências baseadas exclusivamente em DTMF, configure a entrada DTMF para cada nó de entrada, incluindo opções de menu e entradas de vários dígitos, como números de conta ou PINs. Garantir que todos os caminhos de entrada possíveis dos clientes tenham correspondentes mapeamentos DTMF para que os utilizadores possam navegar e concluir a conversa apenas usando a entrada por teclado.
Deteção de silêncio
A deteção de silêncio permite que os agentes em tempo real reconheçam quando um chamador não fornece entrada durante um período especificado. Configura a deteção de silêncio como uma definição global de voz para o agente acesse Definições>Voz>Comportamento de Conversa>Deteção de Silêncio.
Importante
- A deteção de silêncio não está ativada por defeito. Se o utilizador não falar, o agente espera indefinidamente sem fazer qualquer alerta. Ative explicitamente a deteção de silêncio e configure uma mensagem de reaviso para lidar com chamadas silenciosas.
- O tempo limite padrão para deteção de silêncio é de 7.000 ms (7 segundos). Valide este valor em relação ao seu caso de uso específico e ao ambiente do chamador antes de implementar em produção. Sete segundos podem parecer demasiado longos para alguns ou curtos para outros, dependendo da natureza da interação, por exemplo, perguntas complexas ou ambientes barulhentos. Teste com dados de chamadas do mundo real para determinar o limiar adequado para o seu cenário.
- Antes de ativar a deteção de silêncio, certifique-se de que o comportamento que configura no tópico de deteção de silêncio (por exemplo, Escalar, Desligar, Repetir pedido) é intencional e adequado ao seu caso de utilização. Um comportamento de contingência mal configurado, como definir inadvertidamente a contingência para Escalar quando a intenção era desligar, ou vice‑versa, pode resultar em resultados inesperados na chamada.
Latência das mensagens
Adicione mensagem de latência ou música ao seu agente quando as operações em segundo plano demorarem mais do que o esperado. Para configurar mensagens de latência, vá a Definições>Voz>Comportamento de Conversa>Mensagens de Latência.
Importante
Como a solução de agente em tempo real Text LLM utiliza múltiplos passos sequenciais (ASR, LLM, TTS), os chamadores experienciam alguns segundos de silêncio entre falar e ouvir uma resposta. Defina expectativas adequadas com os utilizadores, por exemplo, usando uma frase como "Um momento, por favor, estou a pesquisar isso para si...".
Avaliação de agentes em tempo real
Os agentes em tempo real suportam o envio de texto durante a avaliação, no entanto, o processamento de áudio não é suportado.