Plataformas de incidentes en el agente de SRE de Azure

Una plataforma de incidentes es el sistema que indica al agente cuando algo va mal. Si conecta la plataforma de incidentes al agente, el agente puede recibir alertas, investigar problemas y tomar medidas automáticamente. No tienes que esperar a que alguien inicie un chat.

Diagrama de flujo que muestra la plataforma de incidentes que envía alertas a través de planes de respuesta a la investigación y las acciones del agente.

Sin una plataforma de incidentes, el agente es reactivo: los usuarios hacen preguntas e investigan a petición. Con una plataforma de incidentes conectada, el agente se vuelve proactivo: recoge incidentes en el momento en que se producen.

Plataformas compatibles

Plataforma Qué proporciona
Azure Monitor Puede conectarse en el asistente y las alertas de sus grupos de recursos administrados se transmiten automáticamente. Azure Monitor combina las alertas recurrentes en un solo hilo. No es necesario proporcionar ninguna credencial.
PagerDuty Le avisa de incidentes y proporciona administración de llamadas con integración basada en API.
ServiceNow Se integra con la administración de servicios de TI empresariales.

Solo una plataforma de incidentes puede estar activa a la vez. Al cambiar a otra plataforma, se desconecta la actual.

¿Qué habilita la conexión de una plataforma de incidentes?

Después de conectar una plataforma de incidentes al agente, el agente obtiene varias funcionalidades, incluida la recepción automática de incidentes y la interacción de incidentes. En las secciones siguientes se proporcionan más detalles sobre estas funcionalidades.

Recepción automática de incidentes

Los incidentes son enviados a tu agente en el momento en que se crean en tu plataforma. Nadie necesita copiar y pegar alertas o iniciar manualmente una investigación. El agente recoge los incidentes automáticamente.

Tarjetas de incidente detalladas

Los incidentes que se reciben de todas las plataformas compatibles como PagerDuty, ServiceNow y Azure Monitor, se muestran como como tarjetas enriquecidas en la interfaz del chat. Cada tarjeta muestra:

Campo Detalles
Distintivo de gravedad Codificado por prioridad (por ejemplo, P1/Sev0 = rojo, P2/Sev1 = naranja)
Marca de tiempo Cuándo se desencadenó el incidente
Title Título del incidente con prefijo de plataforma
Situación Estado actual (por ejemplo, "Desencadenado" o "Confirmado")
Description Resumen de incidentes
Plan de respuesta Vínculo al plan de respuesta que controla el incidente (si está configurado)
Ver detalles Vínculo al incidente en su plataforma de origen

Las tarjetas enriquecidas reemplazan las notificaciones de incidentes de texto sin formato usadas anteriormente, lo que facilita analizar los detalles del incidente de un vistazo.

Interacción de incidentes

El agente puede leer y registrar cambios en el incidente. Estas herramientas están disponibles automáticamente al conectar la plataforma correspondiente.

Plataforma Funcionalidades de lectura Funcionalidades de escritura
Azure Monitor Detalles de la alerta, gravedad, recursos afectados Confirmación de alertas, cierre de alertas
PagerDuty Detalles del incidente, diagnósticos Confirmar, resolver, agregar notas
ServiceNow Detalles del incidente Publicar entradas de discusión, reconocer, resolver

Planes de respuesta

Los planes de respuesta definen lo que hace el agente cuando llegan tipos específicos de incidentes. Configuras reglas según la gravedad del incidente, los patrones en el título u otros criterios, y el agente sigue el plan de manera automática. Para más información, consulte Planes de respuesta a incidentes.

Un plan de respuesta puede:

  • Ejecute pasos de investigación específicos.

  • Use conectores y herramientas concretos.

  • Operar en un nivel de autonomía definido (de "recopilar información solo" para "tomar medidas correctivas").

  • Reintentar automáticamente la investigación (hasta un límite configurable) antes de derivarla a una persona.

Los planes de respuesta convierten al agente de un asistente de uso general en un respondedor de incidentes, con procedimientos definidos para tipos de incidentes conocidos.

Plan de respuesta de inicio rápido

Importante

Cuando se conecta por primera vez una plataforma de incidentes, se crea automáticamente un plan de respuesta de inicio rápido predeterminado. Si crea sus propios planes de respuesta, el plan de inicio rápido se ejecuta junto con ellos y puede hacer que los incidentes se enruten al agente personalizado incorrecto o se procesen dos veces. Para evitar conflictos, vaya a Builder>Planes de respuesta a incidentes, cambie a Vista de tabla y elimine el plan de inicio rápido.

Al conectar una plataforma de incidentes, puede habilitar esta característica para crear automáticamente un plan de respuesta predeterminado. Este plan le ayudará a empezar inmediatamente:

Plataforma Identificadores de plan predeterminados Nivel de autonomía
Azure Monitor Alertas de Sev0, Sev1, Sev2 Autónomo
PagerDuty Incidentes P1 Autónomo

Azure Monitor admite todos los niveles de gravedad (Sev0-Sev4). El plan de inicio rápido tiene como destino las alertas de prioridad más alta de forma predeterminada. Puede personalizar esta característica para incluir otras gravedades o crear planes independientes para alertas de prioridad inferior.

El plan de inicio rápido crea un plan de respuesta denominado quickstart_handler que:

  • Empareja incidentes por prioridad o gravedad.
  • Cubre todos los servicios afectados.
  • Se ejecuta en modo totalmente autónomo.
  • Se puede personalizar o desactivar más adelante.

Puede personalizar este plan predeterminado o crear otros planes de respuesta con diferentes filtros y niveles de autonomía.

Seguimiento del valor del incidente

Puede realizar un seguimiento del valor de incidente para obtener información sobre cómo el agente controla los incidentes a lo largo del tiempo. En la interfaz de usuario del agente de SRE de Azure, verá esta información; para ello, vaya a Supervisión> demétricas de incidentes. Para obtener más información, consulte Seguimiento del valor del incidente.

Métrica Lo que muestra
Incidentes revisados Total de incidentes que procesa el agente.
Mitigado por el agente Incidentes que el agente resuelve de forma autónoma.
Asistido por el agente Incidentes en los que el agente ayuda y el usuario completa la resolución.
Mitigado por el usuario Incidentes que el usuario resuelve con información proporcionada por el agente.
Acción pendiente del usuario Incidencias a la espera de intervención humana.

Use estas métricas para comprender la eficacia del agente e identificar los planes de respuesta que es posible que necesite optimizar.

Plataformas de incidentes frente a conectores

Las plataformas de incidentes y los conectores funcionan conjuntamente. Tu agente utiliza ambos: la plataforma de incidentes inicia la investigación y los conectores proporcionan las herramientas necesarias para investigar.

Comparación Plataformas para la gestión de incidentes Conectores
propósito Dónde proceden las alertas Datos y acciones que el agente puede usar
Configurado en Builder → plataforma de incidentes Generador → conectores
Direction Entrante (los incidentes fluyen al agente) De salida (el agente se comunica con los sistemas)
Example PagerDuty envía una alerta → el agente investiga El agente consulta a Kusto → encuentra la causa principal.