Centro de operaciones en el Agente de SRE de Azure

El centro de operaciones del agente SRE le proporciona visibilidad en tiempo real sobre cómo funciona el agente de SRE de Azure en incidentes, automatizaciones, integraciones y estado operativo en un solo lugar. En lugar de comprobar los subprocesos individuales, las páginas de configuración y las automatizaciones por separado, verá las señales unificadas que importan: estado del agente, acciones pendientes, preparación del conector y confiabilidad de automatización.

Sugerencia

Puntos clave:

  • Consulte análisis de incidentes, estado de automatización y métricas diarias en un panel, sin cambiar entre páginas.
  • Tres pestañas: Información general (métricas y estado del sistema), Análisis de incidentes (horas guardadas, velocidades de resolución, tiempo de mitigación), Automatización (KPI de tareas y desencadenadores).
  • Seleccione cualquier tarjeta KPI para explorar gráficos detallados y desgloses.
  • Disponible para todos los agentes. Aparece automáticamente en la barra lateral.

¿Qué es Operations Hub?

Operations Hub consolida la inteligencia operativa sobre el agente de SRE en tres paneles centrados. Sin una vista central, los equipos vuelven a generar el estado del agente manualmente abriendo subprocesos de incidentes individuales, comprobando las automatizaciones una por una y revisando las integraciones en páginas independientes. Este enfoque manual se vuelve inadministrable a medida que crece el entorno. Operations Hub mueve al equipo de la investigación reactiva a la administración proactiva mediante la exposición de indicadores principales de problemas antes de que afecten a la respuesta a incidentes.

Funcionamiento del panel de Operations Hub

Operations Hub combina la supervisión en tres pestañas accesibles desde la barra lateral. Seleccione Operations Hub en la barra lateral izquierda para abrir el panel.

Captura de pantalla de la pestaña Información general de Operations Hub que muestra la barra de estado, el gráfico de métricas y las acciones pendientes y las secciones Estado del sistema.

Pestaña de información general

Pregunta: ¿Qué necesita mi atención en este momento?

La vista predeterminada muestra el estado operativo del agente de un vistazo:

Section Lo que muestra
Barra de estado Estado de conexión del origen de datos, qué conectores están configurados y que necesitan atención. Seleccione Completar configuración para configurar directamente los orígenes que faltan.
Gráfico de métricas Volumen diario por origen, consumo de flujo activo diario (AAU) o llamadas a herramientas personalizadas diarias. Seleccione en la lista desplegable.
Acciones pendientes Número de hilos de conversación en espera de su intervención, incluidas aprobaciones, preguntas, aportaciones sobre incidentes y ejecuciones de comandos pendientes.
Estado del sistema Estado del proceso del agente activo y estado del conector.

Use el selector intervalo de tiempo en la parte superior para ajustar el período de informes (valor predeterminado: últimos 7 días). Seleccione Actualizar para cargar los datos más recientes.

Pestaña de análisis de incidentes

Pregunta: ¿El agente realmente ayuda durante incidentes?

El análisis de incidentes mide la eficacia, no solo la actividad. Un panel de análisis interactivo con cuatro tarjetas de KPI:

Tarjeta Lo que muestra
Tiempo estimado de ingeniería ahorrado Total de horas que ahorró tu agente, con posibilidad de consultar el desglose diario
Tasa de resolución con asistencia de agente Porcentaje de incidentes resueltos, con un desglose de resultados: mitigado por el agente, mitigado por humanos (con asistencia del agente), mitigado por humanos (sin agente) y en curso
Tiempo medio de mitigación Comparativa de P50: tiempo de resolución del agente frente al tiempo de resolución de un humano
Puntuación de evaluación de IntentMet Clasificación de calidad (escala de 1 a 5 con visualización de estrellas) en función de la eficacia de los incidentes resueltos por el agente

Captura de pantalla de la pestaña Análisis de incidentes que muestra cuatro tarjetas KPI para ahorrar tiempo, velocidad de resolución, tiempo medio para mitigar y puntuación de IntentMet.

Seleccione una tarjeta KPI para ampliar una vista detallada con gráficos detallados. Debajo de las tarjetas KPI, el gráfico Volumen de incidentes y resoluciones muestra la evolución de los incidentes a lo largo del tiempo.

Pestaña de automatización

Pregunta: ¿Mis flujos de trabajo periódicos y controlados por eventos son correctos y confiables?

Panel para supervisar tareas programadas y desencadenadores HTTP:

Tarjeta Lo que muestra
Automatizaciones totales Recuento de automatizaciones activas, divididas por tareas programadas y desencadenadores
Total de ejecuciones Recuento de ejecuciones con comparación de tendencias con el período anterior
Tasa de éxito Porcentaje de ejecuciones exitosas con recuentos de ejecuciones exitosas/fallidas
Duración media de la ejecución Tiempo medio de ejecución con percentiles medio y P95

Captura de pantalla de la pestaña Automation que muestra cuatro tarjetas KPI y la lista información general de Automation con entradas de automatización individuales.

Debajo de las tarjetas KPI, en la sección Información general de Automation se muestra cada automatización con su tipo (tarea programada o desencadenador HTTP), programación, modo de autonomía, recuento de ejecuciones y tasa de éxito. Amplía cualquier tarjeta para ver un resumen de las ejecuciones recientes generado por la IA.

Use el cuadro de búsqueda y el filtro Tipo para buscar automatizaciones específicas.

Cómo mejora la administración proactiva del centro de operaciones

Operations Hub hace pasar a tu equipo de una investigación reactiva a una gestión proactiva. En lugar de descubrir problemas después de abrir un hilo o revisar flujos de trabajo fallidos, verá señales tempranas:

  • Compilación de acciones pendientes: acciones que esperan la aprobación o la entrada del usuario.
  • Degradación del conector: el estado de la integración disminuye con el tiempo.
  • Cambios en la tendencia de actividad: cambios en los patrones de uso del agente.
  • Disminución de confiabilidad de automatización: aumento de las tasas de error o la duración de la ejecución.
  • Cambios en la eficacia de los incidentes: cambios que sugieren un impacto reducido en la respuesta a incidentes.

Esta visibilidad proactiva crea confianza en el agente de SRE. Puede confiar con más confianza en el agente cuando pueda supervisar su comportamiento de un vistazo, en lugar de solo después de que se produzcan problemas.

Cuándo usar Operations Hub

Utilice Operations Hub cuando necesite:

  • Supervisar el estado general del agente: obtenga una vista del sistema en lugar de comprobar los componentes individuales.

  • Haz un seguimiento de la contribución a la respuesta ante incidentes: mide si el agente mejora los resultados de la gestión de incidentes.

  • Administrar la confiabilidad de la automatización: identifique patrones en el rendimiento de la automatización antes de provocar interrupciones.

  • Establecer líneas base operativas: comprenda el comportamiento normal para detectar anomalías al principio.

Antes y después de usar Operations Hub

antes de después de
Comprobación del estado del agente Visite varias páginas: Supervisión, configuración, tareas individuales Open Operations Hub: un panel, tres pestañas
Análisis de incidentes Ve a vistas separadas de métricas y compáralas manualmente. Pestaña de análisis de incidentes con tarjetas KPI y gráficos de desglose
Supervisión de automatización Seleccionar cada tarea programada individualmente La pestaña Automatización muestra todas las automatizaciones con indicadores de estado
Consumo de AAU Vaya a Configuración > Consumo del agente El gráfico de métricas de la pestaña Información general incluye datos de AAU
Aprobaciones pendientes Revisar los hilos de chat en busca de elementos pendientes de respuesta Recuento de acciones pendientes visible en la pestaña Información general

Limitaciones

  • El Centro de operaciones muestra los datos de los últimos 30 días de forma predeterminada. El acceso a datos históricos más allá de este período requiere consultas de archivado.

  • Actualmente, el análisis de automatización admite ejecuciones desencadenadas desde la interfaz de usuario de Operations Hub. Los webhooks y los desencadenadores mediante programación tienen visibilidad limitada en las primeras versiones.