Centro de Operações no Azure SRE Agent

O SRE Agent Operations Hub dá-lhe visibilidade em tempo real sobre o desempenho do seu Azure SRE Agent através de incidentes, automações, integrações e saúde operacional num só local. Em vez de verificar threads individuais, páginas de configuração e automações separadamente, vê-se os sinais unificados que importam: saúde do agente, ações pendentes, prontidão dos conectores e fiabilidade da automação.

Gorjeta

Pontos principais:

  • Veja análises de incidentes, automação, saúde e métricas diárias num único painel, sem alternar entre páginas.
  • Três separadores: Visão Geral (métricas e estado de funcionamento do sistema), Análise de Incidentes (horas poupadas, taxas de resolução, tempo até à mitigação), Automação (KPIs de tarefas e acionadores).
  • Selecione qualquer cartão KPI para ver gráficos detalhados e desagregações.
  • Disponível para todos os agentes. Aparece automaticamente na barra lateral.

O que é o Centro de Operações?

O Operations Hub consolida a inteligência operacional sobre o seu Agente SRE em três painéis focados. Sem uma visão central, as equipas reconstroem manualmente o estado dos agentes, abrindo conversas individuais de incidentes, verificando as automatizações uma a uma e revendo as integrações em páginas distintas. Esta abordagem manual torna-se incontrolável à medida que o ambiente cresce. O Operations Hub faz a sua equipa passar de uma investigação reativa para uma gestão proativa, ao revelar indicadores avançados dos problemas antes que estes impactem a resposta a incidentes.

Como funciona o painel do Operations Hub

O Operations Hub reúne a monitorização em três separadores acessíveis na barra lateral. Selecione o Centro de Operações na barra lateral esquerda para abrir o painel.

Captura de ecrã do separador de Visão Geral do Centro de Operações mostrando a barra de estado, o gráfico de métricas e as secções de ações pendentes e Saúde do Sistema.

Separador Visão geral

Pergunta: O que precisa da minha atenção agora?

A vista padrão mostra o estado operacional do seu agente num instante:

Seção O que mostra
Barra de status Saúde da ligação à fonte de dados, quais conectores estão configurados e quais necessitam de atenção. Selecione Configuração completa para configurar diretamente as fontes em falta.
Gráfico de métricas Volume Diário por Fonte, Consumo Diário de Fluxo Ativo (AAU) ou Chamadas Diárias de Ferramentas Personalizadas. Selecione a partir do menu suspenso.
Ações pendentes Número de conversas à espera da tua intervenção, incluindo aprovações, perguntas, intervenções em incidentes e execuções de comandos pendentes.
Saúde do Sistema Estado do processo do agente ao vivo e saúde do conector.

Use o seletor de intervalo de tempo no topo para ajustar o período de reporte (padrão: últimos 7 dias). Selecione Atualizar para carregar os dados mais recentes.

Análise de Incidentes

Pergunta: O agente está realmente a ajudar durante incidentes?

A análise de incidentes mede a eficácia, não apenas a atividade. Um painel interativo de análise com quatro cartões de KPI:

Cartão O que mostra
Tempo de engenharia estimado poupado Horas totais poupadas pelo seu agente, com desagregação diária e possibilidade de aprofundamento
Taxa de resolução com apoio de agentes Percentagem de incidentes resolvidos, com distribuição de resultados: mitigado por agente, mitigado por humanos (assistido por agente), mitigado por humanos (sem agente) e em andamento
Tempo mediano para mitigar Comparação P50, tempo de resolução do agente vs. tempo de resolução humana
Pontuação de avaliação IntentMet Classificação de qualidade (escala 1-5 com visualização de estrelas) baseada na eficácia com que o agente resolveu incidentes

Captura de ecrã do separador Análise de Incidentes mostrando quatro cartões de KPI para o tempo poupado, taxa de resolução, tempo mediano para mitigar e pontuação IntentMet.

Selecione qualquer cartão de KPI para expandir uma vista detalhada com gráficos detalhados. Por baixo dos cartões de KPI, o gráfico de Volume de Incidentes e Resultados mostra as tendências dos incidentes ao longo do tempo.

Separador de Automação

Pergunta: Os meus fluxos de trabalho recorrentes e orientados por eventos são saudáveis e fiáveis?

Um painel para monitorizar tarefas agendadas e triggers HTTP:

Cartão O que mostra
Automações Totais Contagem de automações ativas, dividida por tarefas agendadas e gatilhos
Total de Corridas Contagem de execuções com comparação de tendência com o período anterior
Taxa de Sucesso Percentagem de corridas bem-sucedidas com contagem de sucessos/falhados
Duração média da corrida Tempo médio de execução com mediana e percentil P95

Captura de ecrã do separador de Automação mostrando quatro cartões de KPI e a lista de Visão Geral de Automação com entradas individuais de automação.

Por baixo dos cartões KPI, a secção de Visão Geral de Automação lista cada automação com o seu tipo (Tarefa Agendada ou Gatilho HTTP), agenda, modo de autonomia, contagem de execuções e taxa de sucesso. Expanda qualquer carta para ver um resumo gerado por IA das execuções recentes.

Use a caixa de pesquisa e o filtro de Tipo para encontrar automações específicas.

Como o Operations Hub melhora a gestão proativa

O Operations Hub transforma a sua equipa de uma investigação reativa para uma gestão proativa. Em vez de descobrir problemas depois de abrir um tópico ou ao rever fluxos de trabalho que falharam, vê indicadores antecedentes desde cedo:

  • Acumulação de ações pendentes: Ações à espera de aprovação ou entrada do utilizador.
  • Degradação do conector: Estado da integração a degradar-se ao longo do tempo.
  • Mudanças na tendência da atividade: Alterações nos padrões de utilização dos agentes.
  • Diminuição da fiabilidade da automação: Aumento das taxas de falha ou da duração da execução.
  • Alterações na eficácia dos incidentes: Alterações que sugerem redução do impacto na resposta ao incidente.

Esta visibilidade proativa cria confiança no seu Agente SRE. Pode confiar mais no agente quando pode monitorizar o seu comportamento de relance, em vez de apenas depois de ocorrerem problemas.

Quando usar o Operations Hub

Use o Operations Hub quando precisar:

  • Monitorizar a saúde geral do agente: Obter uma visão do sistema em vez de verificar componentes individuais.

  • Acompanhe a contribuição da resposta a incidentes: Meça se o agente melhora os seus resultados de incidente.

  • Gerir a fiabilidade da automação: Identificar padrões no desempenho da automação antes que provoquem falhas.

  • Estabelecer linhas de base operacionais: Compreender o comportamento normal para detetar anomalias precocemente.

Antes e depois de utilizar o Operations Hub

Antes Depois de
Verificação da saúde do agente Visite várias páginas: Monitor, Definições, tarefas individuais Open Operations Hub: um painel de controlo, três separadores
Análise de incidentes Aceda a vistas de métricas separadas, faça a referência cruzada manualmente Separador de Análise de Incidentes com cartões de KPI e gráficos com detalhamento
Monitorização de automação Selecione cada tarefa agendada individualmente O separador Automação mostra todas as automatizações com indicadores de estado.
Consumo de AAU Ir a Definições > Consumo de agentes O gráfico de métricas do separador de visão geral inclui dados AAU
Aprovações pendentes Analisar os tópicos de chat à procura de itens à espera de resposta Contagem de Ações pendentes visível no separador Visão Geral

Limitações

  • O Operations Hub apresenta dados dos últimos 30 dias por defeito. O acesso a dados históricos para além deste período requer consultas arquivísticas.

  • Atualmente, a análise de automação suporta execuções desencadeadas pela interface do Operations Hub. Webhook e gatilhos programáticos mostram visibilidade limitada nas primeiras versões.