Configurar agentes de voz básicos

Note

Os recursos deste artigo são baseados no standard harness, que usa as opções de faturamento descritas em Licenciamento para agentes baseados no standard harness. Aprenda como acessar recursos padrão em agentes e fluxos de agentes padrão do Access.

Este artigo descreve como configurar agentes básicos de resposta de voz interativa (IVR) para uso em aplicativos do Dynamics 365 Contact Center. Normalmente, agentes de voz básicos usam orquestração clássica. Saiba mais em Integrar um agente habilitado para voz com o Dynamics 365 Contact Center.

Ligue a voz básica

Um agente habilitado para voz é diferente de um agente baseado em chat. O agente compatível com voz inclui tópicos específicos do sistema para lidar com cenários de voz. Um agente baseado em chat usa a modalidade Text . Um agente habilitado para voz usa a modalidade Speech &DTMF . As duas modalidades são mutuamente exclusivas.

  1. Vá até a página de Configurações do seu agente e selecione Voz.

  2. Selecione Habilitar voz. Fazer com que a voz seja a modalidade padrão para criar e atualizar dentro dos tópicos é selecionada por padrão.

  3. Selecione Básico se você planeja usar tópicos e orquestração clássica para seu agente. Saiba mais em Escolher como controlar a conversa e escolher como lidar com a fala.

Note

Selecione voz em tempo real se você planeja usar a orquestração generativa para seu agente.

Ao ativar Habilitar voz e tornar a voz a modalidade padrão para criar e atualizar em tópicos, o agente receberá as seguintes atualizações:

  • A capacidade de criar recursos de voz quando alternado de texto para Voz & DTMF.
  • Os tópicos do sistema de voz Detecção de Silêncio, Fala não reconhecida e Tecla de discagem não reconhecida são automaticamente adicionados para lidar com cenários relacionados à fala.
  • Aumentar a precisão com os dados do agente (ativados por padrão), o que melhora a precisão do reconhecimento de fala.
  • O fluxo do agente existente não muda (como o tópico Menu Principal, usado para iniciar interações com gatilhos DTMF mapeados).

Importante

  • A configuração Habilitar voz altera apenas os recursos de criação de voz, não a configuração do canal. Ative o canal de Telefonia para um agente com voz totalmente habilitada.
  • Além disso, habilitar voz em um agente que não foi originalmente configurado para recursos de voz significa que o agente não tem o tópico Menu Principal (versão prévia). Você deve recriar esse tópico, se necessário.
  • Se você não conseguir ativar o recurso de voz, verifique se o ambiente do Power Platform que hospeda seu agente está com o recebimento antecipado de novos recursos desativado. Para obter mais informações, consulte Não é possível ativar Otimizar para voz.
  • A configuração de aumento de precisão com dados do agente só funciona quando o agente com habilitação de voz usa frases de gatilho. Se o agente estiver configurado para usar descrições de tópico, não haverá efeito sobre a precisão.

Desligue a otimização para voz

Desative a opção Habilitar voz na criação do agente se não usar o canal de Telefonia. Depois de desativar Habilitar voz, você verá as seguintes alterações:

  • Nenhuma criação de agente para recursos de voz, como DTMF e interrupção.
  • A modalidade padrão texto é definida.
  • Nenhuma melhora no reconhecimento de fala, uma vez que não há reconhecimento de fala.
  • Nenhum tópico do sistema de voz ou tópico de DTMF global.

    Note

    Alguns tópicos podem apresentar erros ao publicar se ainda fizerem referência ao tópico DTMF (agora desativado).

  • Não há alteração no fluxo do agente e na configuração do canal, pois desativar a otimização não remove o canal de telefonia.
  • Ativar ou desativar a opção Habilitar voz não terá efeito até que você publique o seu agente. Se você ativá-lo ou desativá-lo acidentalmente, e o agente alternar entre as modalidades, você terá tempo para corrigi-lo.

Importante

Se seus canais de Telefonia estiverem habilitados, desabilitar a opção Habilitar voz poderá prejudicar seu agente, pois todos os gatilhos DTMF serão desabilitados automaticamente.

Use a voz como modo principal de criação

Quando você ativa a opção Habilitar voz, a opção Criar voz padrão para criar e atualizar dentro de tópicos é ativada automaticamente. Se você desativar essa opção, selecione a modalidade Fala & DTMF em cada nó onde deseja adicionar mensagens de voz.

Disponibilidade de mensagem

Usar a modalidade de texto ou de fala pode afetar seu canal de forma diferente.

Modalidade de texto Modalidade de fala Canal de texto e voz do agente
Mensagem disponível Mensagem vazia Mensagem disponível
Mensagem vazia Mensagem disponível Mensagem não disponível

Reconhecimento de fala automático personalizado

Agentes habilitados para voz para um domínio específico, como médico ou financeiro, podem encontrar usuários que usam termos financeiros ou jargões médicos. Alguns termos e jargões são difíceis para o agente ativado por voz converter de fala em texto.

Note

A configuração de aumento de precisão com dados do agente só funciona quando o agente com habilitação de voz usa frases de gatilho. Se o agente estiver configurado para usar descrições de tópico, não haverá efeito sobre a precisão.

Para garantir que a entrada de fala seja reconhecida com precisão, melhore o reconhecimento de fala:

  1. Selecione Configurações>Voz em seu agente.

  2. Selecione Aumentar a precisão com dados do agente para habilitar as configurações de reconhecimento de fala automático personalizadas do agente.

  3. Selecione Salvar para confirmar suas alterações.

  4. Publique seu agente para ver as novas alterações.

Referência de opções de voz no nível do agente

Use as configurações de Voz para configurar os timeouts de vários recursos relacionados à voz.

Para fazer alterações nas opções de tempo limite no nível do agente:

  1. Vá até a página de Configurações do seu agente e selecione Voz.

  2. Revise as configurações e faça as mudanças que quiser.

  3. Selecione Salvar para confirmar suas alterações. Suas configurações ajustadas se tornam o padrão para os tópicos que você cria neste agente.

Configurações em nível de agente

A tabela a seguir lista cada opção e como ela se relaciona com as configurações de nível de nó.

Seção com suporte a voz no nível do agente Configurações Description Valor padrão Substituir nível de nó
DTMF Tempo limite entre um dígito e outro Tempo máximo em milissegundos permitido enquanto aguarda a próxima entrada de chave DTMF. Aplica a entrada DTMF com vários dígitos somente quando os usuários não atingem o comprimento máximo de entrada. 3.000 ms Nó de pergunta com propriedades de voz para entrada DTMF de vários dígitos
DTMF Tempo limite de finalização Duração máxima em milissegundos para aguardar por uma chave DTMF de término. O limite se aplica quando o usuário atinge o tamanho máximo de entrada e não pressiona a chave de término. Aplica-se somente à entrada DTMF de vários dígitos.

Depois que o limite expira e a tecla DTMF de término não chegar, o agente encerrará o reconhecimento e retornará o resultado até aquele ponto.

Se definido como "continuar sem esperar", o agente não aguarda a tecla de encerramento. O agente retorna logo após o usuário inserir o tamanho máximo.
2.000 ms Nó de pergunta com propriedades de voz para entrada DTMF de vários dígitos
Detecção de silêncio Tempo limite de detecção de silêncio Silêncio máximo em milissegundos permitido enquanto aguarda a entrada do usuário. O limite se aplica quando o agente não detecta nenhuma entrada do usuário. O padrão é sem tempo de silêncio. O agente espera indefinidamente pela entrada do usuário.

A detecção de silêncio para voz mede o período após o término da fala.
Nenhum tempo limite de silêncio Nó de pergunta com propriedades de voz para entrada DTMF de vários dígitos

Tópico do sistema (propriedades do gatilho de detecção de silêncio) para Configurar a detecção de silêncio e tempos limite
Coleta de fala Tempo limite de término do enunciado O limite se aplica quando o usuário pausa durante ou após a fala. Se a pausa for maior do que o limite de tempo, o agente presume que o usuário terminou de falar.

O valor máximo para o timeout no fim da enunciação é 3.000 ms. Qualquer valor acima de 3.000 ms é reduzido para 3.000 ms.
1.500 ms Nó de pergunta com propriedades de voz
Coleta de fala Tempo limite de reconhecimento de fala Determina por quanto tempo o agente aguarda a fala do usuário depois que o usuário começa a falar. O valor padrão é 12.000 milissegundos (cerca de 12 segundos). Sem tempo limite de reconhecimento significa tempo ilimitado. O agente reformula a pergunta. Se não houver resposta, a voz estará além do Tempo limite de reconhecimento de fala. 12.000 ms Nó de pergunta com propriedades de voz
Latência de mensagens Atraso no envio de mensagens Determina quanto tempo o agente espera antes de entregar a mensagem de latência após o início de uma solicitação de operação em segundo plano. O tempo é definido em milissegundos. 500 ms Propriedades do nó de ação para operação de longa duração
Mensagens de latência Tempo mínimo de reprodução A mensagem de latência será reproduzida por um período mínimo de tempo, mesmo se a operação em segundo plano for concluída enquanto a mensagem estiver sendo reproduzida. O tempo é definido em milissegundos. 5.000 ms Propriedades do modo de Ação para operação de execução prolongada
Sensibilidade à fala Sensitivity Controla como o sistema equilibra a detecção de fala e ruído de fundo. Reduza a sensibilidade para ambientes barulhentos, espaços públicos e uso sem as mãos. Aumente a sensibilidade para ambientes silenciosos, usuários de fala suave ou detecção de comandos de voz. A configuração padrão é 0,5. 0,5 There não há substituições de nível de nó para este controle.

Note

  • Os agentes com frases de gatilho e tamanhos de entidade grandes demoram mais tempo para serem publicados.
  • Se vários usuários publicarem o mesmo agente ao mesmo tempo, sua ação de publicação pode ser bloqueada. Publique o agente novamente depois que outros terminarem de editá-lo.

Saiba mais em Principais conceitos – Publicar e implantar seu agente.

Ativar interrupção

Ao ativar a interrupção, os usuários de agente podem interromper o agente. Esse recurso é útil quando o usuário do agente não precisa ouvir a mensagem inteira. Por exemplo, os chamadores podem já conhecer as opções do menu, porque as ouviram no passado. Com a interrupção ativada, o usuário do agente pode inserir a opção que deseja, mesmo que o agente não tenha terminado de listar todas as opções.

Quando desativar a interrupção

Desative a interrupção para mensagens como:

  • Uma mensagem que você atualizou recentemente.
  • Uma mensagem de conformidade que não deveria ser interrompida.
  • A primeira mensagem do agente, para garantir que os usuários do agente estejam cientes de informações novas ou essenciais.

Specifications

  • O Barge-in oferece suporte a interrupções baseadas em DTMF e em voz do usuário agente.

  • Você pode controlar a interrupção com cada mensagem em um lote. Posicione nós barge-in-disabled em sequência antes de cada nó em que a interrupção seja permitida. Caso contrário, o sistema tratará o barge-in-disabled como uma mensagem para permitir interrupção.

    Captura de tela dos posicionamentos de interrupção e de interrupção desabilitada nos nós de mensagem.

    Quando uma fila de processamento em lote é concluída, a configuração automática de intervenção é redefinida para o próximo lote. O sinalizador de interrupção em cada mensagem subsequente regula isso. Você poderá posicionar nós de interrupção desabilitada quando a sequência for iniciada novamente.

Dica

Se houver nós de Mensagem consecutivos, seguidos por um nó de Pergunta, as mensagens de voz para esses nós serão definidas como um lote. Um lote começa com um nó de mensagem e é parado no nó da pergunta, que aguarda a entrada do usuário.

Evite desabilitar a interrupção para mensagens longas, especialmente se você espera que os usuários agentes interajam com o agente com frequência. Se o usuário do agente já conhece as opções do menu, permita que ele navegue sozinho até a opção desejada.

Configurar a interrupção

  1. Selecione um nó de Mensagem ou Pergunta e defina a modalidade desejada como Speech & DTMF.

  2. Selecione os três pontos (...) para o nó e selecione Propriedades.

    • Em nós de Mensagem, o painel Enviar propriedades da atividade será aberto na lateral da tela de criação.

      Selecione Permitir interrupção.

    • Em nós de Pergunta, o painel Propriedades da pergunta será aberto. Selecione Voz.

      Nas propriedades de Voz, selecione Permitir interrupção.

  3. Salve o tópico.

Configurar a detecção de silêncio e tempos limite

A detecção de silêncio permite que você configure quanto tempo o agente aguarda a entrada do usuário e a ação que ele toma se o agente não receber nenhuma entrada. A detecção de silêncio é mais útil em resposta a uma pergunta no nível do nó ou quando o Agente aguarda uma frase de gatilho para iniciar um novo tópico.

Você pode configurar os tempos limite padrão dos tópicos no nível de agente.

Configure o comportamento de detecção de silêncio quando um agente espera uma resposta a uma pergunta

Para substituir o comportamento da detecção de silêncio padrão para um nó Pergunta:

  1. Selecione os três pontos (...) para o nó e selecione Propriedades. O painel Propriedades da pergunta será aberto.

  2. Selecione Voz. O painel de propriedades de Voz aparece.

  3. Para o tempo limite da detecção de silêncio, selecione a opção que você quer:

    • Use a configuração do agente: Use a configuração global para detecção de silêncio.
    • Desativar para este nó: aguarde indefinidamente uma resposta.
    • Personalize em milissegundos: Espere o tempo especificado antes de repetir a pergunta.
  4. Para Quantos novos prompts em silêncio, selecione o comportamento desejado:

    • Repita até 2 vezes
    • Não repita
    • Repita uma vez
  5. Opcionalmente, configure uma mensagem de nova solicitação.

  6. Para Ação de fallback, selecione o comportamento desejado:

    • Desligar: encerre a conversa. É o comportamento padrão.
    • Escalonar: redirecione o usuário para o tópico do sistema Escalonar.
    • Definir variável para valor: defina a variável de saída para um valor e passe para o próximo nó. Insira ou selecione o valor que deseja em Valor padrão da entidade.
    • Definir variável como vazia (sem valor): limpe a variável de saída e vá para o próximo nó. Você pode usar um Nó de condição posteriormente para verificar se a variável tem um valor.
    • Redirecione para um tópico: Redirecione o usuário para o tópico especificado.
  7. Opcionalmente, expanda Avançado e ajuste as seguintes configurações:

    • Tempo limite de término do enunciado: quanto tempo o agente aguarda após o usuário terminar de falar.
    • Tempo limite de reconhecimento de fala: quanto tempo o agente dá ao usuário quando ele começa a responder.

Configure o comportamento de detecção de silêncio quando um agente espera por uma frase de gatilho

Para configurar o comportamento de detecção de silêncio quando seu agente espera por uma frase de gatilho:

  1. Vá para o tópico do sistema de detecção de silêncio .

  2. Selecione os três pontos () do nó Gatilho. O painel Propriedades de silêncio detectado aparece.

  3. Selecione o comportamento que deseja:

    • Use a configuração do agente: Use a configuração global para detecção de silêncio.
    • Desativar para este nó: aguarde indefinidamente uma frase de gatilho.
    • Personalize em milissegundos: Espere o tempo especificado antes de encerrar a conversa.

Adicionar uma mensagem de latência para operações de execução prolongada

Para operações de back-end longas, seu agente pode enviar uma mensagem aos usuários para notificá-los sobre os processos mais longos. Os agentes em um canal de mensagens também podem enviar uma mensagem de latência.

  • Reprodução de áudio da mensagem de latência: Continua em loop até que a operação seja concluída.
  • Mensagem de latência no chat: Enviada apenas uma vez quando a latência especificada é atingida.

Se você quer que seu agente repita uma mensagem após acionar um fluxo do Power Automate:

  1. Vá até o tópico que chama o fluxo do Power Automate.

  2. Selecione os três pontos (...) do nó Ação e então selecione Propriedades. O painel Propriedades da ação será aberto.

  3. Selecione Enviar uma mensagem.

  4. Na seção Mensagem, insira o que você deseja que o agente diga. Use SSML para modificar o som da mensagem. O agente repete a mensagem até que o fluxo seja concluído.

  5. Opcionalmente, ajuste quanto tempo o agente deve esperar antes de repetir a mensagem e o tempo mínimo de reprodução da mensagem.

Configurar o encerramento da chamada

Para configurar o agente para encerrar a chamada e finalizar a conversa, adicione um novo nó (+) e selecione Gerenciamento de tópicos>Encerrar conversa.

Captura de tela de um novo menu de nó com Gerenciamento de tópicos e Encerrar a conversa realçados.

Detectar secretárias eletrônicas

Você pode configurar seu agente para detectar um computador de resposta e deixar uma mensagem com o usuário do agente após a conclusão da mensagem do usuário do agente. O tópico do sistema Detecção de Computador de Atendimento permite que você crie uma mensagem personalizada para cenários quando o agente encontrar a caixa postal de um usuário. No nó Mensagem, defina a mensagem a ser deixada quando o agente encontra uma secretária eletrônica.

Captura de tela do tópico Computador de Atendimento Detectado, realçando o nó da mensagem.

Formatar síntese de fala com SSML

Use a SSML (linguagem de marcação de síntese de fala) para alterar a forma como o agente soa quando lê mensagens em voz alta. Por exemplo, você pode alterar o tom ou a frequência das palavras faladas, a velocidade e o volume.

SSML usa marcas para delimitar o texto que você deseja modificar, semelhante ao HTML. Use as seguintes tags no Copilot Studio:

Marca SSML Description Link para a documentação do serviço de voz
<audio src="_URL to an audio file_"/> Adicione a URL de um arquivo de áudio na tag. O arquivo deve ser acessível para o usuário do agente. Adicionar áudio gravado
<break /> Insira pausas ou interrupções entre as palavras. Insira opções de quebra na tag. Adicionar um intervalo
<emphasis> Texto que você deseja modificar</emphasis> Adicione níveis de estresse às palavras ou frases. Adicione opções de ênfase na tag de abertura. Adicione a marca de fechamento após o texto que você deseja modificar. Ajustar opções de ênfase
<prosody> Texto que você deseja modificar</prosody> Especifique as alterações de tom, contorno, gama, ritmo e volume. Adicione opções de prosódia na tag de abertura. Adicione a marca de fechamento após o texto que você deseja modificar. Ajustar opções de prosódia
<lang xml:lang="xx-XX"> Texto que você deseja modificar</lang> Ajuste o idioma falado dentro da mesma mensagem ao usar uma voz neural multilíngue. Ajustar os idiomas falados

Note

Ao usar a tag <audio src="_URL to an audio file_"/>, se você armazenar a URL em uma variável, codifique a URL antes de inseri-la na tag SSML de src de áudio na mensagem. Use a função EncodeHTML Power Fx para codificar a URL ao atribuí-la a uma variável na ação de atribuição.

Captura de tela de uma mensagem de fala com tags SSML adicionadas.

Encontrar e usar uma tag

SSML usa marcas para delimitar o texto que você deseja modificar, como o HTML.

Use as seguintes tags no Copilot Studio:

  1. Selecione um nó de Mensagem ou de Pergunta. Altere o modo para Fala &DTMF.

  2. Selecione o menu Marcas SSML e selecione uma marca.

    A caixa de mensagem é preenchida com a tag. Se já houver texto na caixa de mensagem, o código da tag será acrescentado ao final da sua mensagem.

  3. Envolva o texto que deseja modificar com as marcas de abertura e fechamento. Você pode combinar várias marcas e personalizar partes individuais da mensagem com marcas individuais.

Dica

Você também pode inserir manualmente as marcas SSML que não aparecem no menu auxiliar. Saiba mais em Melhorar a síntese com a Linguagem de Marcação de Síntese de Fala.

Transferir uma chamada para um representante ou número de telefone externo

Você pode configurar o agente para transferir a chamada para um número de telefone externo. Os agentes do Copilot Studio dão suporte à transferência cega para um número de telefone PSTN e para o número de roteamento direto.

Note

Você também pode usar cabeçalhos SIP X para lidar com transferências de chamadas. Saiba mais em Configurar cabeçalhos SIP X para agentes habilitados por voz.

Para transferir para um número de telefone externo:

  1. No tópico que você deseja modificar, adicione um novo nó (+). No menu do nó, selecione Gerenciamento de tópicos e selecione Transferir conversa.

  2. Em Tipo de transferência, selecione Transferência para número de telefone externo e insira o número de telefone.

  3. (Opcionalmente) adicione um cabeçalho de Informações de Usuário para Usuário (UUI) do Protocolo de Iniciação de Sessão (SIP) à chamada telefônica.

    Esse cabeçalho é uma cadeia de pares key=value, sem espaços ou caracteres especiais, exibida para leitura por sistemas externos.

    1. Selecione os três pontos (...) do nó e, em seguida, selecione Propriedades. O painel Propriedades da transferência da conversa é aberto.

    2. Em cabeçalho SIP UUI, insira as informações que deseja enviar com a transferência de chamada. Não há suporte a variáveis durante a transferência para um número de telefone externo.

    Caution

    Apenas os primeiros 256 caracteres da string são enviados. O cabeçalho aceita somente números, letras, sinais de igualdade (=) e ponto e vírgula (;). Não há suporte a todos os outros caracteres, incluindo espaços, chaves e colchetes, ou fórmulas, e podem causar uma falha na transferência.

Dica

Inclua um + no número de telefone para o código do país correspondente.

A saída de transferência com SIP UUI para o número de telefone de destino deve usar roteamento direto. Os números de telefone da rede telefônica pública comutada (PSTN) não oferecem suporte a transferências do cabeçalho SIP UUI.

Para transferir para um representante, consulte Gatilhos explícitos.

Usar variáveis de voz

Os agentes do Copilot Studio suportam variáveis. Você pode usar variáveis predefinidas ou criar as personalizadas.

Note

Um agente habilitado para voz no Copilot Studio dá suporte a variáveis de contexto. Essas variáveis ajudam você a integrar suas conversas de agente com Dynamics 365 Contact Center ao transferir uma chamada.

Para obter mais informações sobre variáveis de contexto no Dynamics 365 Contact Center, consulte Context variáveis para bots do Copilot Studio.

Esta integração oferece suporte a estes cenários com as seguintes variáveis quando você transfere:

Variable Tipo Description
System.Activity.From.Name String O identificador de chamadas do usuário agente
System.Activity.Recipient.Name String O número usado para ligar ou conectar-se ao agente
System.Conversation.SipUuiHeaderValue String Valor do cabeçalho SIP ao transferir por meio de um número de telefone de roteamento direto
System.Activity.UserInputType String Se o usuário do agente usou DTMF ou fala na conversa
System.Activity.InputDTMFKey String A entrada DTMF bruta do usuário do agente
System.Conversation.OnlyAllowDTMF booleano A voz ignora a entrada de fala quando definida como true
System.Activity.SpeechRecognition.Confidence Number O valor de confiança (entre 0 e 1) do último evento de reconhecimento de fala
System.Activity.SpeechRecognition.MinimalFormattedText String Resultados de reconhecimento de fala (como texto bruto) antes de o Copilot Studio aplicar seu modelo dedicado de reconhecimento vocal natural

Note

Ao usar a variável System.Conversation.OnlyAllowDTMF definida como true, certifique-se de usar a seguinte configuração:

  • Todos os nós de Mensagem que não esperam por interação do usuário estão com interrupção desativado ou são seguidos por nós de Pergunta com mapeamentos DTMF apropriados.
  • Evite enviar mensagens informativas entre nós Pergunta quando somente DTMF estiver ativado globalmente.
  • Use um mapeamento de DTMF por pergunta em vez de uma configuração global somente para DTMF para ter mais controle.

Mensagens informativas enviadas enquanto o modo somente DTMF está ativado podem fazer com que a plataforma gere gramática DTMF vazia, resultando em erros de telefonia. Por essa razão, é preferível usar um mapeamento DTMF por pergunta.