Plataformas de incidentes no Agente SRE do Azure

Uma plataforma de incidentes é o sistema que informa ao seu agente quando algo dá errado. Se você conectar sua plataforma de incidentes ao seu agente, seu agente poderá receber alertas, investigar problemas e tomar medidas automaticamente. Você não precisa esperar que alguém inicie um bate-papo.

Fluxograma mostrando a plataforma de incidentes enviando alertas por meio de planos de resposta para a investigação e as ações do agente.

Sem uma plataforma de incidentes, seu agente é reativo: os usuários fazem perguntas e ele investiga sob demanda. Com uma plataforma de incidentes conectada, seu agente se torna proativo: ele capta incidentes no momento em que eles ocorrem.

Plataformas com suporte

Plataforma O que ele fornece
Azure Monitor É possível conectar-se por meio do assistente, e os alertas dos seus grupos de recursos gerenciados são enviados automaticamente. Azure Monitor mescla alertas recorrentes em um thread. Você não precisa fornecer credenciais.
PagerDuty Alerta você sobre incidentes e fornece gerenciamento de plantão com integração baseada em APIs.
ServiceNow Ele se integra ao gerenciamento de serviços de TI corporativo.

Somente uma plataforma de incidentes pode estar ativa por vez. Mudar para uma plataforma diferente desconectará a atual.

O que a conexão de uma plataforma de incidentes permite

Depois de conectar uma plataforma de incidentes ao seu agente, seu agente obtém vários recursos, incluindo recepção automática de incidentes e interação com incidentes. As próximas seções fornecem mais detalhes sobre esses recursos.

Recepção automática de incidentes

Os incidentes fluem para o agente assim que são criados na sua plataforma. Ninguém precisa copiar e colar alertas ou iniciar manualmente uma investigação. O agente captura incidentes automaticamente.

Cartões detalhados de incidentes

Incidentes recebidos de todas as plataformas com suporte, incluindo PagerDuty, ServiceNow e Azure Monitor são exibidos como cartões avançados na interface de chat. Cada card mostra:

Campo Detalhes
Selo de severidade Codificado por cor por prioridade (por exemplo, P1/Sev0 = vermelho, P2/Sev1 = laranja)
Timestamp Quando o incidente ocorreu
Title Título do incidente com o prefixo da plataforma
Status Estado atual (por exemplo, "Acionado" ou "Confirmado")
Description Resumo de incidentes
Plano de resposta Link para o plano de resposta que está tratando o incidente (se configurado)
Exibir detalhes Link para o incidente em sua plataforma de origem

Os cartões detalhados substituem as notificações de incidente de texto sem formatação usadas anteriormente, facilitando a visualização dos detalhes do incidente rapidamente.

Interação de incidentes

Seu agente pode ler e gravar de volta no incidente. Essas ferramentas estão disponíveis automaticamente quando você conecta a plataforma correspondente.

Plataforma Recursos de leitura Capacidades de escrita
Azure Monitor Detalhes do alerta, gravidade, recursos afetados Reconhecer alertas e fechar alertas
PagerDuty Detalhes do incidente, diagnóstico Reconhecer, resolver, adicionar anotações
ServiceNow Detalhes do incidente Publique entradas de discussão, reconheça, resolva

Planos de resposta

Os planos de resposta definem o que o agente faz quando tipos específicos de incidentes chegam. Você configura regras com base na gravidade dos incidentes, modelos de título ou outros critérios, e o agente executa o plano automaticamente. Para saber mais, confira os planos de resposta a incidentes.

Um plano de resposta pode:

  • Execute etapas de investigação específicas.

  • Use conectores e ferramentas específicos.

  • Operar em um nível de autonomia definido (de "coletar informações somente" para "tomar medidas corretivas").

  • Tente novamente a investigação automaticamente (até um limite configurável), antes de escalar para um humano.

Os planos de resposta transformam seu agente de um assistente de uso geral em um respondente de incidentes, com procedimentos definidos para tipos de incidentes conhecidos.

Plano de resposta de início rápido

Importante

Quando você conecta uma plataforma de incidentes pela primeira vez, um plano de resposta de início rápido padrão é criado automaticamente. Se você criar seus próprios planos de resposta, o plano de início rápido será executado junto com eles e poderá fazer com que os incidentes sejam roteados para o agente personalizado incorreto ou processados duas vezes. Para evitar conflitos, acesseos planos de resposta a Incidentes do >, alterne para o modo de exibição Tabela e exclua o plano de início rápido.

Ao conectar uma plataforma de incidentes, você pode habilitar esse recurso para criar automaticamente um plano de resposta padrão. Este plano faz com que você comece imediatamente:

Plataforma Identificadores de plano padrão Nível de autonomia
Azure Monitor Alertas sev0, Sev1, Sev2 Autônomo
PagerDuty Incidentes P1 Autônomo

O Azure Monitor dá suporte a todos os níveis de severidade (Sev0–Sev4). O plano de início rápido tem como destino os alertas de prioridade mais alta por padrão. Você pode personalizar esse recurso para incluir outras severidades ou criar planos separados para alertas de prioridade mais baixa.

O plano de início rápido cria um plano de resposta chamado quickstart_handler :

  • Corresponde a incidentes por prioridade ou gravidade.
  • Abrange todos os serviços afetados.
  • É executado no modo totalmente autônomo.
  • Pode ser personalizado ou desativado posteriormente.

Você pode personalizar esse plano padrão ou criar outros planos de resposta com diferentes filtros e níveis de autonomia.

Monitorar o valor do incidente

Você pode acompanhar o valor do incidente para saber como seu agente lida com incidentes ao longo do tempo. Na interface do usuário do Agente SRE do Azure, você verá essas informações indo até Monitor>Métricas de incidentes. Para obter mais informações, consulte Rastrear o valor do incidente.

Métrica O que ele mostra
Incidentes revisados Total de incidentes que o agente processa.
Mitigado pelo agente Incidentes que o agente resolve de forma autônoma.
Assistido por agente Incidentes em que o agente ajuda e o usuário conclui a resolução.
Mitigado pelo usuário Incidentes que o usuário resolve com informações fornecidas pelo agente.
Ação do usuário pendente Incidentes aguardando intervenção humana.

Use essas métricas para entender a eficácia do agente e identificar os planos de resposta que talvez seja necessário ajustar.

Plataformas de gestão de incidentes vs. conectores

As plataformas de incidentes e os conectores funcionam juntos. Seu agente usa ambos os recursos: a plataforma de incidentes dispara a investigação, e os conectores fornecem as ferramentas para investigar.

Comparison Plataformas de incidentes Conectores
Purpose De onde vêm os alertas Dados e ações que o agente pode usar
Configurado em Construtor → plataforma de incidentes Construtor → conectores
Direction Entrada (os incidentes são direcionados para o agente) Saída (o agente inicia contato com os sistemas)
Example PagerDuty envia um alerta → o agente investiga O agente consulta o Kusto → localiza a causa raiz