Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Os agentes de Copilot Studio prontos para produção precisam de mais do que licenciamento e planejamento total de volume de mensagens. Eles também precisam planejar a taxa de transferência. O planejamento da taxa de transferência abrange a rapidez com que o tráfego chega, quais serviços de plataforma a solução utiliza e quais limites se aplicam em toda a solução.
Este artigo ajuda arquitetos de soluções, criadores e administradores do Power Platform a preparar implantações de alto volume do Copilot Studio para tráfego de produção, UAT (testes de aceitação do usuário), testes de carga, cenários B2C (business-to-customer) e cargas de trabalho autônomas.
O provisionamento de taxa é separado do provisionamento de licenças
O planejamento do Copilot Studio em produção tem dois fluxos de trabalho relacionados, mas separados:
- Provisionamento de licenças abrange direito e consumo comercial, como licenças, créditos, capacidade pré-paga, pacotes de mensagens e cobrança conforme o uso.
- Provisionamento de taxa cobre a velocidade com que o tráfego pode ser processado antes que controles de limitação ou proteção de serviço sejam aplicados.
Observação
A Microsoft usa o termo cotas para os limites de taxa do Copilot Studio. No vocabulário mais amplo do setor, essa atividade de planejamento é frequentemente chamada de provisionamento de taxa. Revise os limites publicados, projete as taxas de solicitação em horários de pico e planeje antes da chegada do tráfego de produção.
O pagamento conforme o uso pode aumentar os limites disponíveis em comparação com configurações de menor capacidade, mas a taxa de transferência não é infinita. Verifique os limites atuais do Copilot Studio, as alocações de solicitações do Power Platform, os limites do Power Automate, os limites de proteção de serviço do Dataverse, as regras de limitação de conectores e os limites das APIs downstream.
O que acontece quando há limitação?
Limitação é um comportamento de proteção de serviço. Ela protege serviços compartilhados de padrões de tráfego que excedam limites publicados, controles de intermitência ou capacidade de serviço. O sintoma exato depende de qual serviço é limitado.
Quando um limite é atingido, a consequência vai além de uma questão de planejamento. As solicitações podem ser limitadas, atrasadas, bloqueadas ou rejeitadas. Em conversas voltadas para o usuário, esse comportamento pode aparecer como uma interrupção temporária do serviço. Por exemplo, o usuário pode não conseguir enviar a próxima mensagem, receber uma mensagem de agente indisponível ou de limite de uso, ou ter uma etapa com falha porque um fluxo, conector, chamada do Dataverse, serviço de IA ou API downstream atingiu seu limite.
Saiba mais sobre sintomas específicos do Copilot Studio e mensagens de erro em Resolver erros de limite de uso em agentes.
Como os limites de taxa são medidos
Limites de taxa medem quanto tráfego um serviço pode aceitar durante uma janela de tempo específica. Pense nessas janelas de forma granular: por minuto, por cinco minutos, por 10 minutos, por hora, por dia, por semana e por mês. O volume mensal ou semanal ajuda a estimar a demanda total, mas intervalos menores são importantes para o provisionamento da taxa, porque a limitação de taxa geralmente decorre da concentração de tráfego.
Por exemplo, uma empresa B2C pode receber a maior parte do tráfego de seu agente durante uma única hora de campanha focada. A média semanal pode parecer baixa, mas essa única hora ainda pode criar pressão de taxa de transferência suficiente para causar limitação ou interrupções de serviço. Um projeto que parece seguro em nível semanal ou mensal ainda pode exceder os limites durante um pico de uma hora.
Entender o escopo dos limites
Os limites não se aplicam apenas ao nível do agente individual. Dependendo do serviço, os limites podem se aplicar nos níveis do ambiente, da ferramenta, da API, do conector, do canal ou do serviço downstream.
Por exemplo, os limites de mensagens para agente do Copilot Studio se aplicam por ambiente do Dataverse. Ao estimar o tráfego, inclua todas as fontes que enviam mensagens para agentes nesse ambiente, incluindo canais voltados para o usuário, integrações, cargas de trabalho autônomas e habilidades do Azure Bot Framework. Verifique os valores atuais e o escopo em Cotas e limites do Copilot Studio.
Determinar se o provisionamento de taxa se aplica ao seu agente
Nem todo agente precisa de um trabalho detalhado de provisionamento de taxa. Um agente interno de FAQ simples, com um público-alvo pequeno, uso previsível e poucas ou nenhuma chamada para serviços downstream, dificilmente atingirá limites de taxa. O provisionamento de taxa torna-se importante quando um agente pode exceder os limites de solicitações por minuto ou por hora, mesmo que o volume mensal pareça baixo.
Pense no tráfego esperado no início do projeto, paralelamente ao design da solução. Antes do início do UAT (teste de aceitação do usuário) e do teste de carga, a equipe deve garantir que o design do agente, o ambiente, os serviços conectados e os sistemas downstream possam dar suporte ao perfil de taxa de transferência esperado.
Essa orientação é especialmente importante para agentes empresariais maiores e mais intensivos, onde o tráfego pode chegar em picos, muitos usuários ou eventos podem acionar o agente simultaneamente ou cada interação depende de múltiplos serviços de plataforma. Isso também pode se aplicar a agentes menores com padrões de uso concentrados, como uma janela de lançamento curta, um evento departamental, um processo agendado ou um fluxo de trabalho que gera muitas solicitações em poucos minutos.
Agentes B2C e autônomos requerem provisionamento antecipado de taxa
Agentes B2C voltados para o cliente podem receber tráfego de campanhas, sites públicos, portais para clientes, comunicações de incidentes, lançamentos de produtos ou demanda sazonal. Agentes autônomos podem gerar tráfego de alta frequência a partir de agendamentos, eventos, processos em segundo plano ou quando chamam várias ferramentas e fluxos de trabalho.
Dica
Trate casos de uso B2C e autônomos como cenários prioritários para provisionamento de taxa. Eles podem gerar tráfego intermitente, múltiplas solicitações simultâneas e atividade em segundo plano de alta frequência de forma mais rápida do que muitas experiências de chat voltadas para funcionários.
Utilize janelas de pico, não apenas os totais mensais
Pergunte se o agente é capaz de gerar solicitações concentradas em questão de um minuto ou de uma hora. Mesmo um cenário menor ainda pode exigir provisionamento de taxa se um teste de carga, uma campanha, uma resposta a uma interrupção ou um gatilho automatizado fizer com que mensagens, chamadas de IA generativa, ações de fluxo de trabalho, chamadas de conectores ou solicitações ao Dataverse sejam enviadas pelo ambiente em excesso durante uma janela curta.
O volume mensal é útil para estimar a demanda total, mas não é suficiente para o provisionamento de taxa. Converta o uso esperado em janelas de tempo menores para que você possa comparar o design com as RPMs (solicitações por minuto), as RPHs (solicitações por hora), a intermitência e os limites diários das páginas vinculadas.
Elabore tanto um perfil de tráfego médio quanto um perfil de tráfego de pico. Por exemplo, se a maior parte do tráfego acontece diariamente entre 17:00 e 18:00, o pico por hora deve refletir essa concentração. A estimativa diária não precisa ser 24 vezes o valor do horário de pico se o tráfego estiver concentrado em uma única janela.
Em que outros casos a limitação pode ocorrer?
A limitação também pode ocorrer quando:
- Um grande número de funcionários utiliza o agente durante um período de pico previsível, como um evento departamental ou treinamento.
- Uma campanha de marketing, uma interrupção, um lançamento ou um evento de negócios agendado gera um pico de tráfego curto.
- Os fluxos do Power Automate incluem loops, novas tentativas, paginação ou fluxos filho que ampliam o volume de solicitações.
- Relatórios, auditoria, exportação de telemetria ou captura de transcrições são executados de forma síncrona no caminho da interação do usuário.
- Múltiplos agentes ou cargas de trabalho compartilham o mesmo ambiente, identidade, conector ou capacidade de API downstream.
- Os testes de carga aumentam mais rápido do que a arquitetura de produção ou o processo de suporte conseguem acompanhar.
Onde consultar os limites de taxa relevantes
O Copilot Studio tem seus próprios limites, e o caminho de runtime do agente pode incluir outros serviços com seus próprios limites. Revise todos os limites relevantes para os serviços que seu agente utiliza.
Limites do Copilot Studio
| Área de provisionamento de taxa | O que procurar | Onde verificar os valores atuais | Como usar |
|---|---|---|---|
| Mensagens a um agente | Limite atual de RPM/RPH e escopo para mensagens enviadas ao agente. | Cotas e limites do Copilot Studio | Compare o número esperado de mensagens por minuto e por hora para o ambiente alvo do Dataverse. |
| Mensagens de IA generativa | Limite atual para orquestração generativa, ações de agentes, ferramentas de IA, ações de fluxo de trabalho de agentes e respostas generativas. | Mensagens de IA generativa para um agente | Modele cenários intensivos em IA e autônomos em relação aos limites atualmente publicados. |
| Nós de gatilho autônomo | Limites atuais que se aplicam quando um agente autônomo é disparado por eventos, agendamentos ou processos em segundo plano. | Cotas e limites do Copilot Studio | Modele cargas de trabalho orientadas a eventos e agendadas separadamente do tráfego interativo de chat. |
| Limites de solicitação de assinatura do Copilot Studio | Limites atuais de solicitação do Power Platform que se aplicam ao uso do Copilot Studio. | Limites de assinatura do Copilot Studio | Use esses valores com o planejamento de limites de taxa para fluxos, Dataverse e serviços conectados. |
Outros limites de plataforma a considerar
O limite mais baixo no caminho de runtime determina a experiência do usuário. Um agente do Copilot Studio pode estar dentro de seus próprios limites enquanto um fluxo, conector, chamada do Dataverse, serviço de idioma ou API externa é limitado.
Observação
Outros limites de plataforma poderão afetar o agente se ele usar outros componentes no caminho de solicitação do agente. Leve esses limites em consideração também, incluindo Power Platform, Power Automate, Dataverse, conectores, serviços de linguagem e sistemas downstream.
| Área de runtime | O que observar | Perguntas sobre provisionamento de taxa | Onde consultar os limites atuais |
|---|---|---|---|
| Plano de solicitações do Power Platform | Solicitações realizadas no Power Automate, chamadas de fluxos de trabalho do Copilot Studio, uso do Dataverse, Power Apps e Dynamics 365. | Qual usuário, conexão, usuário de aplicativo ou entidade de serviço gera as solicitações? As alocações de solicitações são suficientes para a carga de trabalho diária e de pico esperada? | Limites e alocações de solicitações |
| Fluxos do Power Automate | Gatilhos, ações, loops, fluxos filho, ações HTTP, ações de conector, tentativas, paginação e simultaneidade. | Quantas ações são criadas por turno de agente? Os limites de intermitência, simultaneidade, gatilho e conector estão no escopo? |
Entenda os limites da plataforma e evite a limitação Limites de fluxos automatizados, agendados e instantâneos |
| Dataverse | Operações CRUD, plug-ins, fluxos de trabalho, operações de atribuição/compartilhamento, chamadas de conector e operações de sistema necessários para completar transações. | Quais usuários, usuários de aplicativo ou entidades de serviço geram chamadas ao Dataverse? É provável que os limites de proteção do serviço ou o comportamento de nova tentativa sejam aplicados? |
Limites de API da proteção do serviço Visão geral dos limites de API do Dataverse |
| Conectores | Conectores padrão, conectores premium, conectores personalizados, limitação específica do conector e APIs subsequentes. | Qual conector é o gargalo? O serviço downstream aplica seu próprio limite de taxa? |
Limites de taxa de transferência da API nos conectores Referência de conector do Power Automate |
| CLU (Compreensão da Linguagem Coloquial) e serviços de IA | Chamadas de CLU, prompts de IA, operações de pesquisa e resumo, ferramentas com suporte de modelo, tamanho da carga e limites específicos do serviço. | Cada interação do usuário chama um serviço de linguagem ou de IA? Essas chamadas são repetidas durante novas tentativas ou orquestração? |
Limites da compreensão da linguagem coloquial Cotas e limites do Copilot Studio |
| APIs externas e sistemas de linha de negócios | APIs de fornecedores, APIs internas, bancos de dados, middleware, gateways e serviços personalizados. | Qual limite o proprietário downstream impõe? Há uma estratégia de repetição de contrato, fila ou controle de pressão? | Use os limites atuais do proprietário do serviço downstream, o SLA (contrato de nível de serviço) e o processo de suporte. |
Projeto para reduzir a pressão da taxa de transferência
Evite usar aumentos de taxa como primeira solução de design. Primeiro, revise o design do agente e otimize a eficiência. Se o agente precisar consultar algo, mantenha as chamadas externas controladas, otimize as chamadas à API e evite volumes desnecessários de solicitação em todo o Copilot Studio, Power Automate, Dataverse, conectores e sistemas downstream.
Após otimização do design, controle a taxa de transferência para que o tráfego chegue à plataforma de maneira previsível:
- Para limites de nível de ambiente, considere distribuir os agentes entre múltiplos ambientes se essa abordagem estiver alinhada ao seu projeto operacional. Essa abordagem pode ajudar a impedir que agentes de alto volume, unidades de negócio, regiões ou cargas de trabalho autônomas concorram com cargas de trabalho não relacionadas pelos mesmos limites definidos no escopo do ambiente.
- Para agentes autônomos, use filas, envio em lote, filtros de gatilho, processamento agendado, controles de nova tentativa e monitoramento para que o trabalho em segundo plano não chegue de uma só vez, de forma descontrolada.
- Transfira os trabalhos agendados, de relatórios, de exportação de auditoria e de telemetria para fora do caminho do chat interativo, sempre que possível.
- Revise os resultados dos testes de carga e a telemetria de produção para identificar onde as solicitações se concentram. Em seguida, ajuste o agente, os fluxos, os conectores e as APIs downstream antes de solicitar limites mais altos.
Os agentes autônomos estão em uma posição única para maximizar o uso de sua capacidade alocada, com previsibilidade e observabilidade robustas, ao enfileirar solicitações e controlar suas taxas de gatilho.
O que fazer se os limites de taxa padrão não forem suficientes
Se a estimativa de pico de tráfego indicar que o agente ou qualquer serviço conectado pode ultrapassar os limites atualmente publicados, inicie o processo de suporte para provisionamento de taxa antes do UAT, do teste de carga ou do lançamento em produção. Não espere pela primeira falha de produção.
Observação
O Copilot Studio é um serviço SaaS com limites de taxa para proteger o serviço para todos os clientes. Com a devida justificativa, a engenharia pode habilitar limites personalizados para cenários aprovados.
Abrir uma solicitação de suporte
Os administradores podem solicitar suporte no Centro de administração do Power Platform.
Abra o tíquete antecipadamente e inclua as melhores estimativas disponíveis. Quanto mais detalhes você fornecer, mais fácil será o processo de avaliação. Atualize a solicitação conforme o projeto é refinado ou os testes de carga fornecem dados observados.
Informações essenciais a serem incluídas
| Informações | descrição |
|---|---|
| ID do Ambiente | O ambiente do Dataverse onde o agente é executado. |
| Nome ou identificador do agente | O agente afetado pela solicitação. |
| Impacto de negócios | Impacto crítico se os limites padrão não forem suficientes. |
| Informações conhecidas | O que se sabe sobre o cenário, o canal, o contexto de lançamento, a criticidade para o negócio e se é B2C, autônomo, voltado a funcionários ou apenas interno. |
| Instantâneo de agente | Um instantâneo ou uma exportação que ajude os revisores a entender a configuração, o design, os serviços conectados e as configurações relevantes do agente. |
| Design de agente | Descrição de alto nível dos tópicos, uso de IA generativa, fontes de conhecimento, ações, fluxos, conectores, chamadas ao Dataverse e APIs externas usadas pelo agente. |
| Estimativa média de tráfego | Tráfego médio esperado por hora, dia, semana ou mês. |
| Estimativa de pico de tráfego | Mensagens de pico esperadas, sessões, chamadas à IA generativa, ações de fluxo, chamadas de conectores, solicitações do Dataverse e chamadas à API externa, quando aplicável. |
Mais detalhes que podem ajudar
| Informações | descrição |
|---|---|
| Intervalo de datas | Data de início e término do aumento solicitado. Separe os intervalos de datas de teste de carga, teste de aceitação do usuário e produção, caso sejam diferentes. |
| Padrão de pico | Janelas de pico, fusos horários, fatores esperados que geram picos e se o tráfego está concentrado em um curto período diário. |
| Perfil da sessão | Sessões simultâneas, duração média e de pico das sessões, mensagens por sessão e perguntas por sessão. |
| Exemplos típicos de sessão | Caminhos representativos dos usuários, etapas típicas realizadas, ferramentas usadas e IDs de sessões de exemplo quando disponíveis. |
| Caminho de runtime | Fluxos, ações, prompts de IA, consultas à base de conhecimento, solicitações ao Dataverse, conectores e APIs por interação. |
| Picos no nível de recurso | Volume máximo por agente, recurso, usuário, ambiente, conector, minuto, hora e dia, quando conhecido. |
| Produtos que precisam de revisão | Se a solicitação envolve Copilot Studio, alocações de solicitações do Power Platform, Power Automate, conectores, Dataverse, serviços de CLU/IA ou APIs externas. |
| Evidência | IDs de sessão de exemplo, erros, IDs de correlação, logs, resultados de teste de carga ou observações de produção. |
| Atenuações | Resuma o que você já tentou para reduzir a pressão da taxa de transferência. Consulte as orientações Design para reduzir a pressão de taxa de transferência, incluindo revisão de design, chamadas externas otimizadas, segmentação de ambientes, envio em lote, enfileiramento, filtragem de gatilhos, agendamento, distribuição da carga de trabalho e outras otimizações já implementadas. |
Importante
Não há garantia de aumento de taxa de transferência. O Suporte da Microsoft analisa solicitações com base em cenário, ambiente, intervalo de datas solicitado, tráfego esperado, elegibilidade, limites atuais e capacidade de serviço.
Informações relacionadas
- Cotas e limites do Copilot Studio
- Práticas recomendadas para otimizar o desempenho de agentes conversacionais
- Resolver erros de limite de uso em agentes
- Limites e alocações de solicitações
- Entenda os limites da plataforma e evite a limitação
- Limites de fluxos automatizados, agendados e instantâneos
- Limites de API da proteção do serviço
- Visão geral dos limites de API do Dataverse
- Limites da compreensão da linguagem coloquial
- Obter suporte no Centro de administração do Power Platform