Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Durante incidentes, você frequentemente encontra contextos espalhados por alertas, dashboards, tickets e repositórios. O Azure SRE Agent conecta seus recursos Azure, ferramentas de observabilidade, plataformas de incidentes e repositórios de código-fonte para que você possa investigar problemas com mais contexto operacional em um só lugar. Use-o para coletar sinais, comparar problemas atuais com investigações anteriores e executar automação governada dentro de permissões, modos de execução e políticas configurados.
O que você pode fazer
O Azure SRE Agent ajuda sua equipe a investigar incidentes e responder mais rápido. Ele coleta contexto, identifica causas prováveis e sugere ou, quando configurado, executa mitigações.
Por exemplo, durante um incidente relacionado à memória, o SRE Agent pode:
- Detectar tendências de memória: consultar o Application Insights para identificar uma tendência de memória que começou 40 minutos antes do alerta
- Correlacione implantações: Vincule a tendência a um evento de implantação de repositório GitHub duas horas antes
- Proponha mitigações: Identifique o commit específico e proponha reiniciar o pod afetado ou ajustar o limite de escalonamento de memória (Horizontal Pod Autoscaler, ou HPA)
- Preencher tickets de incidentes: Crie um ticket ServiceNow, PagerDuty ou canal de incidente com o resumo completo da investigação pré-preenchido
Esses fluxos de trabalho configurados notificam as pessoas apropriadas enquanto o Agente SRE trabalha em uma proposta de mitigação. No modo de Revisão, um administrador do Agente SRE revisa o resumo com o contexto do runbook anexado e aprova as ações que exigem aprovação. A investigação permanece em um único fio, reduzindo a troca de ferramentas. Se o agente aplica uma mitigação automaticamente ou espera aprovação depende do seu modo de execução configurado.
Esse padrão se aplica a serviços e integrações do Azure configurados, incluindo computação, armazenamento, rede, dados e serviços relacionados de monitoramento e gerenciamento. Amplie-o com operações permitidas do CLI do Azure por meio de habilidades, runbooks aprovados ou agentes personalizados. Use ganchos de agente para adicionar checkpoints de governança que possam permitir ou bloquear ações.
O trabalho do agente segue três padrões:
Automatize a gestão de incidentes: Ao receber um alerta, o agente consulta suas ferramentas de monitoramento, correlaciona sinais entre sistemas, identifica a provável causa raiz e propõe medidas de mitigação.
Automatize fluxos de trabalho programados: Programe checagens proativas de saúde, varreduras de conformidade e tarefas operacionais rotineiras. Os resultados aparecem na plataforma de incidentes conectada ou no canal de notificação.
Investigue e aconselhe: Faça perguntas em linguagem natural sobre seu ambiente, como "o que mudou na última hora?" ou "por que esse serviço está degradado?", e obtenha respostas fundamentadas e citadas por fontes.
Como funciona
O SRE Agent combina conhecimento específico do produto do Azure com personalização que você controla. Por padrão, ele pode consultar e agir sobre recursos do Azure dentro das permissões atribuídas, com comportamento incorporado para tarefas operacionais comuns.
O agente opera por meio de cinco pontos de extensão que você pode personalizar:
Habilidades: funcionalidades discretas, incluindo runbooks do marketplace e scripts CLI do Azure, que estendem o alcance operacional do agente sem a necessidade de código personalizado.
Agentes personalizados: Agentes desenvolvidos especialmente para domínios operacionais específicos. Vários agentes especializados já vêm prontos para uso, e você pode criar o seu próprio no construtor de agentes. Consulte agentes personalizados.
Ferramentas em Python: lógica personalizada, transformações de dados e integrações com APIs para cenários que exigem código em vez de configuração.
Servidores MCP: Conecte-se a conectores parceiros pré-configurados para plataformas de observabilidade como Datadog, Splunk, New Relic, Dynatrace e Elasticsearch, ou conecte qualquer ferramenta personalizada por meio do padrão Model Context Protocol. Veja conectores e ferramentas MCP.
Ganchos de agente: Automações acionadas por eventos que rodam em pontos definidos do ciclo de vida do agente, como após a execução de uma ferramenta ou quando o agente para. Use ganchos para impor políticas, emitir telemetria ou integrar-se a fluxos de trabalho de aprovação externa. Veja ganchos de agente.
Cada chamada de ferramenta proposta passa por controles de governança antes de ser executada, então sua equipe define os limites mesmo para fluxos de trabalho totalmente automatizados. Para obter mais informações, consulte Segurança e governança.
Integrations
O Azure SRE Agent conecta às ferramentas que sua equipe já utiliza:
Monitoramento e observabilidade:
- Azure Monitor (métricas, logs, alertas, pastas de trabalho)
- Application Insights
- Análise de Logs
Gerenciamento de incidentes:
- Alertas do Azure Monitor
- PagerDuty
- ServiceNow
Controle do código-fonte e CI/CD:
- GitHub (repositórios, problemas)
- Azure DevOps (repositórios, itens de trabalho)
Fontes de dados:
- Clusters do Azure Data Explorer (Kusto)
- Servidores MCP (Model Context Protocol)
Comunicação e notificações:
- Equipes da Microsoft
- Outlook
Dependendo da sua configuração, o Azure SRE Agent também oferece conectores gerenciados, um sistema separado de conectores que pode conectar seu agente a serviços SaaS como Google Drive, SharePoint, Notion e Confluence.
Segurança e governança
Equipes de segurança e plataforma podem aplicar controles em camadas em rede, identidade, autorização e governança organizacional:
Isolamento de rede: A integração com VNet roteia o tráfego do espaço de trabalho dos agentes através da sua rede virtual. As regras do seu grupo de segurança de rede (NSG) se aplicam enquanto seu DNS privado resolve as requisições. Quando você configura corretamente o roteamento de rede, DNS e permissões, pode acessar endpoints privados, APIs internas e recursos bloqueados como qualquer outro recurso na sua rede virtual (VNet).
Identidade e RBAC: O agente autentica com identidade gerenciada e opera sob controle de acesso baseado em função (RBAC) do Azure. Para código-fonte, o suporte do GitHub Enterprise permite que o agente se autentique usando uma identidade de serviço gerenciada por meio do modelo Bring Your Own GitHub App.
Controle de acesso em nível de ferramenta: Configure cada ferramenta usada pelo agente para permitir, perguntar ou negar. Administradores definem limites globais, líderes de equipe personalizam cada agente personalizado e os usuários aprovam ferramentas dentro da conversa. As opções disponíveis, os valores padrão e a precedência dependem do escopo e da política em vigor. Para detalhes, veja políticas de acesso à ferramenta.
Infraestrutura como Código: Implante o agente, sua configuração de rede, sua identidade e suas políticas de ferramenta via templates Bicep (a linguagem infraestrutura como código do Azure) e CLI do Azure pelos mesmos pipelines CI/CD que você usa para todos os outros recursos do Azure.
Distribuição de habilidades governada: As equipes da plataforma podem publicar habilidades aprovadas em um repositório privado do GitHub usando o Private Plugins Marketplace. Agentes em todo o locatário instalam habilidades aprovadas do mesmo catálogo controlado.
Reutilizar contexto operacional
O Azure SRE Agent mantém o contexto de investigações anteriores e utiliza geração de insights de fundo e insights de sessão para reconhecer padrões recorrentes ou contextos relacionados. O contexto retido pode incluir causas raiz, etapas de resolução, preferências e padrões operacionais. Reutilizá-lo pode limitar a coleta repetida de contexto, reduzir a dependência de conhecimento individual não documentado e fornecer aos engenheiros de plantão informações iniciais mais consistentes.
Tip
Exemplo de equipe: Um novo engenheiro entra de plantão. O agente já conhece padrões de implantação, incidentes passados e procedimentos da equipe, então ele começa com mais contexto desde o primeiro dia.
Exemplo solo: Você sai de férias. O contexto operacional capturado pelo agente fica disponível para quem assumir o atendimento, para não precisar começar do zero.
| Stage | O que acontece |
|---|---|
| Configuração inicial | Conecte suas ferramentas e use o conhecimento do Azure integrado durante uma investigação. |
| Após investigações repetidas | O contexto retido pode incluir topologia do ambiente, padrões recorrentes de falha e preferências de escalonamento. |
| À medida que o contexto compartilhado se acumula | Os membros da equipe podem reutilizar as causas raízes anteriores e etapas de resolução com menos dependência do conhecimento individual não documentado. |
Introdução
Escolha o caminho que corresponde ao seu objetivo: agendar uma tarefa, lidar com um incidente ou criar um agente personalizado.
Use tarefas agendadas para automatizar o trabalho operacional de rotina (verificações de integridade, limpeza e varreduras de conformidade) sem escrever código de infraestrutura.
Selecione a guia Agendar tarefas .
Insira detalhes da tarefa.
Defina o agendamento para executar sua tarefa.
Crie instruções personalizadas para agentes para a tarefa.
Selecione Criar tarefa agendada.
Você vê os resultados da sua tarefa agendada na plataforma de incidentes ou canal de notificações conectado.
Conteúdo relacionado
Use esses recursos para planejar implantação, governança, faturamento e integração de equipes:
| Recurso | O que você encontra |
|---|---|
| Preços e cobrança | Preços baseados no uso, calculados em Azure Agent Units (AAUs), mais planejamento de capacidade |
| Visão geral de segurança | Tratamento de dados, privacidade e isolamento de execução |
| Criar e configurar | Implante um agente e conceda a ele acesso a recursos selecionados do Azure. |
| Configuração e funções da equipe e papéis e permissões de usuário | Como os papéis controlam quem pode conversar, aprovar e administrar o agente, além de como ensinar o agente sobre sua equipe, serviços e procedimentos |