Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O Azure SRE Agent automatiza de forma segura o trabalho operacional e reduz as tarefas repetitivas, para que a sua equipa passe menos tempo na triagem de incidentes e em procedimentos manuais, e mais tempo a desenvolver.
Liga as suas ferramentas de observabilidade, plataformas de incidentes e repositórios de código-fonte num único fluxo de trabalho automatizado. Quando algo falha às 3 da manhã, em vez de saltar entre Grafana, PagerDuty e Slack, recebes uma investigação com respostas já existentes, incluindo o que mudou, o que foi afetado e o que fazer a seguir.
O agente propõe alterações e a tua equipa aprova. Nenhuma alteração é implementada sem aprovação humana.
Cada investigação conduzida pelo agente constrói conhecimento institucional que persiste nas conversas e se acumula ao longo do tempo, quer sejas uma equipa de vinte pessoas ou a única pessoa que sabe como funciona o sistema.
Agente SRE em ação
Imagine alertas a serem acionados às 2:47 da manhã para o seu serviço de pagamentos, a partir do Azure Monitor, do PagerDuty ou de qualquer plataforma de monitorização ligada.
Em poucos minutos, Agente SRE:
- Consulta o Application Insights e identifica uma tendência de memória que começou 40 minutos antes do alerta
- Correlaciona a tendência com um evento de deployment do seu repositório GitHub duas horas antes
- Identifica o commit específico e propõe duas mitigações: reiniciar o pod afetado e ajustar o limiar de escala de memória (HPA)
- Cria um ticket no ServiceNow, PagerDuty ou no seu canal de incidentes com o resumo completo da investigação pré-preenchido
Surge uma notificação sobre a mitigação proposta. O engenheiro de chamada revê o resumo e aprova com uma única ação, sem necessidade de livro de execuções e sem alteração de contexto. A investigação resolve-se em 7 minutos num único tópico, sem sala de guerra e sem troca de separadores entre Grafana, PagerDuty e Slack.
Capacidades de gestão de serviços Azure
O SRE Agent pode gerir toda a gama de serviços Azure em que a sua equipa depende:
Serviços de computação: Máquinas virtuais, Serviço de Aplicações do Azure, Azure Container Apps, Azure Kubernetes Service (AKS), Funções do Azure, e mais.
Serviços de armazenamento: Armazenamento blob, partilhas de ficheiros, discos geridos e contas de armazenamento.
Serviços de rede: Redes virtuais, balanceadores de carga, gateways de aplicações e grupos de segurança de rede.
Serviços de base de dados: Base de Dados SQL do Azure, Azure Cosmos DB, PostgreSQL, MySQL e Redis.
Monitorização e gestão: Azure Monitor, Log Analytics, Application Insights e Azure Resource Manager.
Podes automatizar qualquer operação de CLI do Azure através do SRE Agent usando runbooks, subagentes e hooks de agentes.
Casos de uso primários
Automatizar incidentes: Quando um alerta dispara, o agente consulta as suas ferramentas de monitorização, correlaciona sinais entre sistemas, identifica a causa raiz provável e propõe mitigações. Este processo reduz o tempo médio até à recuperação (MTTR), melhora a disponibilidade do serviço e deteta padrões de falhas antes que se tornem incidentes.
Automatize fluxos de trabalho agendados: Execute verificações proativas de saúde, varreduras de conformidade e tarefas operacionais rotineiras dentro de um cronograma definido. Os resultados aparecem na sua plataforma de gestão de incidentes ligada ou no canal de notificações ligado.
Investigue e aconselhe: Faça perguntas em linguagem natural sobre o seu ambiente, como "o que mudou na última hora?" ou "porque é que este serviço está degradado?", e obtenha respostas fundamentadas com citações de fontes.
Como funciona o SRE Agent?
O SRE Agent combina conhecimentos apurados em Azure com capacidades completas de personalização. Por defeito, compreende e gere os recursos do Azure com os valores definidos para tarefas operacionais comuns.
O agente opera através de cinco primitivas de extensão:
Competências: Capacidades discretas, incluindo runbooks de marketplace e scripts CLI do Azure, que estendem o alcance operacional do agente sem necessidade de código personalizado.
Subagentes: Agentes construídos de propósito para domínios operacionais específicos. Seis subagentes genéricos embarcam integrados: Explorar, Planear, Revisão de Código, Bash, Verificação e Uso Geral. O agente pode paralelizar trabalhos de investigação, planeamento, revisão, shell e verificação entre subagentes incorporados e personalizados.
Ferramentas Python: Lógica personalizada, transformações de dados e integrações de API para cenários que requerem código em vez de configuração.
Servidores MCP: Ligue-se a 40+ conectores geridos (Datadog, New Relic, Splunk, Elasticsearch, Dynatrace e outros) ou a qualquer ferramenta personalizada através do padrão Model Context Protocol.
Ganchos do agente: Automações desencadeadas por eventos que são executadas em pontos definidos do ciclo de vida do agente, seja antes da investigação ou após a resolução. São suportados dois tipos de executores: ganchos de comando executam operações de CLI determinísticas, e ganchos de prompt produzem saída JSON estruturada avaliada pelo LLM. Use ganchos para aplicar políticas, emitir telemetria ou integrar com fluxos de trabalho de aprovação externos. Ver ganchos de agente.
Um mecanismo de permissões controla os cinco primitivos. Esta camada de segurança pré-execução avalia cada chamada de ferramenta proposta antes de esta ser executada. Os operadores podem exigir aprovação humana, aplicar regras de políticas ou bloquear operações proibidas, garantindo que a sua equipa se mantém no controlo mesmo durante fluxos de trabalho totalmente automatizados. Audite as rotas de telemetria para a sua própria instância de Application Insights para maior visibilidade de conformidade.
Para a taxonomia primitiva completa, incluindo o âmbito RBAC, atribuição de custos e padrões de trilhos de auditoria, veja Subagentes e extensibilidade e ganchos de Agente.
Conhecimento que nunca abandona
Cada investigação ensina algo novo ao seu agente, e esse conhecimento permanece mesmo quando já cá não estiver. Captura as causas raiz, passos de resolução, preferências e padrões operacionais. Se fores o único que sabe como o sistema funciona, isso já não é um ponto único de falha. Para as equipas, os novos membros crescem mais rapidamente, a qualidade de chamada mantém-se consistente independentemente de quem seja chamado, e a vossa experiência coletiva cresce automaticamente.
Sugestão
Exemplo da equipa: Um novo engenheiro junta-se ao serviço de plantão. O agente já conhece os padrões de implementação, incidentes passados e procedimentos da equipa, proporcionando qualidade consistente desde o primeiro dia.
Exemplo único: Você vai de férias. O agente carrega o teu contexto operacional, por isso quem cobre não começa do zero.
Integrations
O Azure SRE Agent integra-se com o seu ecossistema operacional das seguintes formas:
Monitorização e observabilidade:
- Azure Monitor (métricas, registos, alertas, livros de exercícios)
- Application Insights
- Análise de Registos
- Grafana
Gestão de incidentes:
- Alertas do Azure Monitor
- PagerDuty
- ServiceNow
Controlo de versões e CI/CD:
- GitHub (repositórios, problemas)
- Azure DevOps (repositórios, itens de trabalho)
Fontes de dados:
- Azure Data Explorer (Kusto) agrupamentos
- Servidores MCP (Model Context Protocol)
Comunicação e notificações:
- Slack
- Microsoft Teams
Introdução
Comece a trabalhar com o Azure SRE Agent agendando uma tarefa, lidando com um incidente ou construindo um agente personalizado.
Use tarefas agendadas para automatizar o trabalho operacional rotineiro (verificações de saúde, limpeza e varreduras de conformidade) sem escrever código de infraestrutura.
Selecione o separador de Agendar tarefas.
Introduza os detalhes da tarefa.
Defina o horário para executar a sua tarefa.
Elabore instruções para agentes personalizados para a tarefa.
Selecione Criar tarefa agendada.
Os resultados da sua tarefa agendada aparecem na plataforma de incidentes ou canal de notificações conectado.
Valor ao longo do tempo
O SRE Agent oferece valor progressivo ao aprender o seu ambiente, os seus padrões e o seu histórico operacional.
| Marco | O que acontece |
|---|---|
| Dia 1 | Liga as tuas ferramentas, faz triagem do teu primeiro incidente e obtém valor diagnóstico imediato com o conhecimento incorporado do Azure. |
| Semana 1 | O agente aprende a topologia do seu ambiente, padrões comuns de falhas e preferências de escalonamento. As investigações tornam-se mais rápidas e precisas. |
| Mês 1 | O conhecimento institucional acumula-se. As equipas reportam detetar padrões de falhas antes que estes escalem. Os novos membros da equipa contribuem desde o seu primeiro turno de plantão, sem necessidade de conhecimento tribal. |
As organizações que utilizam o Azure SRE Agent reportam reduções significativas no tempo médio de recuperação e na sobrecarga operacional durante os primeiros pilotos.
Avalie para a sua organização
Quer esteja a avaliar para uma equipa ou a gerir operações sozinho, comece pela tabela de valores progressivos na secção anterior. Depois explora:
| Recurso | O que encontra |
|---|---|
| Preços e faturação | Preços baseados na utilização, elegibilidade para níveis gratuitos e planeamento de capacidade |
| Descrição geral da segurança | Gestão de dados, privacidade, integração de rede |
| Criar e configurar | Como gerir um piloto estruturado |
| Estrutura da equipa e funções | Funções de Administrador vs. Utilizador Padrão, guia para implementação faseada |
Considerations
Tenha em mente as seguintes considerações ao usar o Azure SRE Agent:
- O inglês é o único idioma suportado na interface de chat.
- Para mais informações sobre como o Azure SRE Agent gere os dados, consulte a política de privacidade da Microsoft.
- A disponibilidade varia de acordo com a região e a configuração do locatário.
- Os custos são baseados na utilização. Consulte Preços e faturação para o modelo tarifário atual e detalhes do escalão gratuito.
- Como em qualquer sistema de IA, o SRE Agent pode, por vezes, produzir conclusões erradas ou propor mitigações que não se aplicam ao seu ambiente. Revise sempre as ações propostas antes de aprovar.
Quando cria um agente, os seguintes recursos também são automaticamente criados para si:
- Aplicação Azure Insights
- área de trabalho do Log Analytics
- Identidade gerenciada
Estes recursos apoiam a observabilidade do agente e a gestão de identidade. Pode visualizá-los e geri-los na sua subscrição do Azure.