Memória no serviço Microsoft Foundry Agent (versão prévia)

Importante

A Memória (versão prévia) no Serviço Foundry Agent e a API do Armazenamento de Memória (versão prévia) são licenciadas a você como parte da sua assinatura do Azure e estão sujeitas aos termos aplicáveis a "Versões prévias" nos Termos de Produto da Microsoft, no Adendo de Proteção de Dados de Produtos e Serviços da Microsoft e nos Termos de Uso Suplementares para Versões Prévias do Microsoft Azure.

A versão prévia mais recente oferece novos recursos e aprimoramentos, incluindo:

  • Operações de item de memória para criar, ler, atualizar, listar e excluir registros de memória individuais.
  • Controles padrão de retenção no nível do repositório, incluindo o TTL padrão para repositórios de memória recém-criados.
  • Comportamento direto do comando de memória sincronizada de memorização ou esquecimento.

A memória no Serviço Foundry Agent da Microsoft é uma solução de memória gerenciada e duradoura. Ele permite a continuidade do agente entre sessões, dispositivos e fluxos de trabalho. Ao criar e gerenciar repositórios de memória, você pode criar agentes que retêm as preferências do usuário, mantêm o histórico de conversas e oferecem experiências personalizadas.

Este artigo fornece uma visão geral da memória do agente, incluindo seus conceitos, casos de uso e limitações. Para obter instruções de uso, consulte Criar e usar memória no Serviço do Foundry Agent.

O que é memória?

A memória é um conhecimento persistente retido por um agente entre sessões. Em geral, a memória do agente se enquadra em duas categorias:

  • A memória de curto prazo acompanha a conversa da sessão atual e mantém o contexto imediato para interações contínuas. As estruturas de orquestração do agente normalmente gerenciam essa memória como parte do contexto da sessão.

  • A memória de longo prazo retém o conhecimento destilado entre sessões. O modelo pode se lembrar e se basear em interações anteriores do usuário ao longo do tempo. A memória de longo prazo requer um sistema persistente que extrai, consolide e gerencie o conhecimento.

A capacidade de armazenagem no Serviço do Foundry Agent foi projetada para armazenamento de longo prazo. Ele extrai informações significativas de conversas, consolida-as em conhecimento durável e disponibiliza-as entre sessões.

Como a memória funciona

Nos bastidores, as memórias são armazenadas como itens em um repositório de memória gerenciado. O sistema pode aplicar a consolidação e a lógica de resolução de conflitos quando aplicável, como mesclar informações de perfil de usuário duplicadas ou sobrepostas.

Nota

O comportamento de consolidação pode variar de acordo com o tipo de memória e pode mudar durante a visualização. Para obter o comportamento mais recente, consulte Criar e usar memória no Serviço do Foundry Agent.

A memória opera nas seguintes fases:

  1. Extração: Quando um usuário interage com um agente, o sistema extrai ativamente informações importantes da conversa, como preferências do usuário, fatos e contexto relevante. Por exemplo, preferências como "alérgico a laticínios" e resumos de atividades recentes são identificadas e armazenadas.

  2. Consolidação: As memórias extraídas são consolidadas para manter o repositório de memória eficiente e relevante. O sistema usa LLMs para mesclar tópicos semelhantes ou duplicados para que o agente não armazene informações redundantes. Fatos conflitantes, como uma nova alergia, são resolvidos para manter uma memória precisa.

  3. Recuperação: Quando o agente precisa recuperar informações, ele pesquisa o repositório de memória para obter as memórias mais relevantes. Isso permite que o agente revele rapidamente o contexto certo, tornando as conversas mais naturais e informadas. Para obter melhores resultados, recupere informações estáveis do perfil do usuário no início da conversa para que o agente possa personalizar as respostas.

Aqui está um exemplo de como a memória pode melhorar e personalizar interações entre um agente de receita e um usuário que expressou anteriormente uma alergia alimentar:

Diagrama que mostra a extração, o armazenamento e a recuperação de memória para um agente entre sessões.

Dica

Precisa de ajuda para decidir quando usar a memória? Considere estas diretrizes:

  • Use a memória para capturar o contexto específico do usuário ou do agente que é aprendido e persiste por meio de interações ao longo do tempo.
  • Use uma base de dados de conhecimento do Foundry IQ para fundamentar seu agente no conteúdo organizacional coletado.
  • Use a ferramenta de pesquisa de arquivos para pesquisar documentos fornecidos pelo usuário durante uma interação.

Tipos de memória

A memória no Serviço do Foundry Agent extrai e armazena três tipos de memória de longo prazo:

Tipo de memória Descrição Diretrizes de recuperação Configuração
Memória do perfil do usuário Preferências de usuário duráveis e contexto pessoal, como preferência de idioma, padrões de produto ou necessidades de acessibilidade. Recupere perto do início de cada conversa para estabelecer um contexto de personalização estável. Habilitado por padrão. Para configurar e desabilitar, consulte Criar um repositório de memória.
Memória de resumo do chat Resumos destilados de tópicos e threads de conversa anteriores. Recupere por turno usando mensagens de conversa atuais para exibir o contexto de continuidade relevante. Habilitado por padrão. Para configurar e desabilitar, consulte Criar um repositório de memória.
Memória procedimental Rotinas de instruções reutilizáveis e padrões operacionais inferidos de interações anteriores. Recupere quando o usuário pedir um fluxo de trabalho ou uma tarefa recorrente que o agente já executou anteriormente. Habilitado por padrão. Para configurar e desabilitar, consulte Criar um repositório de memória.

Gerenciamento e retenção de memória

A memória do Foundry Agent Service oferece suporte a controles granulares de gerenciamento e retenção para cenários de produção:

Com esses controles, você pode equilibrar a qualidade da personalização com requisitos de privacidade, conformidade e ciclo de vida de dados.

Trabalhando com memória

Há duas maneiras de usar a memória para interações de agente:

  • Ferramenta de pesquisa de memória: Anexe a ferramenta de pesquisa de memória a um agente de prompt para habilitar a leitura e gravação no repositório de memória durante as conversas. Essa abordagem é ideal para a maioria dos cenários porque simplifica o gerenciamento de memória. Para obter mais informações, consulte Utilize memórias com uma ferramenta de agente.

  • APIs do repositório de memória: Interaja diretamente com o repositório de memória usando as APIs de baixo nível. Essa abordagem fornece mais controle e flexibilidade para casos de uso avançado, incluindo controle direto sobre registros de memória individuais, comportamento de retenção e operações explícitas de ciclo de vida de memória. Para obter mais informações, consulte Usar memórias por meio de APIs.

Casos de uso

Os exemplos a seguir ilustram como a memória pode aprimorar vários tipos de agentes.

  • Um agente de suporte ao cliente que se lembra de seu nome, problemas e resoluções anteriores, números de tíquete e seu método de contato preferido (chat, email ou chamada de volta). Essa memória ajuda você a evitar a repetição de informações, para que as conversas sejam mais eficientes e satisfatórias.

  • Um assistente de compras pessoal que memoriza seu tamanho em marcas específicas, cores preferidas, devoluções anteriores e compras recentes. O agente pode sugerir itens relevantes assim que você iniciar uma sessão e evitar recomendar produtos que você já possui.

Riscos de segurança

Quando você trabalha com memória no Serviço do Foundry Agent, o LLM (modelo de linguagem grande) extrai e consolida memórias com base em conversas. Proteja a memória contra ameaças como injeção de prompt e corrupção de memória. Esses riscos surgem quando dados incorretos ou prejudiciais são armazenados na memória do agente, potencialmente influenciando as respostas e as ações do agente.

Para atenuar os riscos de segurança, considere estas ações:

Limitações e cotas

As seguintes limitações e cotas se aplicam à memória no Serviço do Foundry Agent. Para obter limitações e cotas mais abrangentes, consulte Serviço do Foundry Agent: limites, cotas e suporte regional.

Limitações

  • Atualmente, a memória requer implantações de modelo de chat e embedding do OpenAI do Azure compatíveis. Para obter uma lista de modelos com suporte, consulte Foundry Models vendidos por Azure.

  • Para APIs de memória de baixo nível, você deve definir scope explicitamente em cada solicitação. A resolução automática de escopo a partir da identidade do chamador só é compatível quando você usa a ferramenta de busca na memória com scope definido como {{$userId}}. Para obter mais informações, consulte Noções básicas sobre o escopo.

  • Não há suporte para integração de VNet (rede virtual) para repositórios de memória.

Nota

Na versão prévia mais recente, algumas opções padrão do repositório de memória (como habilitar a memória processual e definir um TTL padrão) são configuradas no momento da criação do repositório. Verifique o suporte para atualizações pós-criação em sua versão de API.

Quotas

  • Escopos máximos por repositório de memória: 100
  • Máximo de memórias por escopo: 10.000
  • Pesquisar memórias: 1.000 solicitações por minuto
  • Atualizar memórias: 1.000 solicitações por minuto

Disponibilidade da região

A memória está disponível nas seguintes regiões:

  • Leste da Austrália
  • Sul do Brasil
  • Leste do Canadá
  • Leste dos EUA 2
  • França Central
  • Norte da Itália
  • Leste do Japão
  • Coreia Central
  • Centro-Norte dos EUA
  • Leste da Noruega
  • Norte da África do Sul
  • Sul da Índia
  • Suécia Central
  • Norte da Suíça
  • Norte dos EAU
  • Sul do Reino Unido
  • Oeste dos EUA
  • Oeste dos EUA 2
  • Oeste dos EUA 3

Preços

A memória está em versão prévia pública. Os preços e a cobrança da memória e da API do Repositório de Memória podem ser alterados durante a visualização.

Você é cobrado pelo uso dos modelos de chat e inserção subjacentes que você configura. Para obter detalhes de preços atuais, consulte os detalhes de preços do Serviço do Foundry Agent.