Plateformes d’incident dans Azure SRE Agent

Une plateforme d’incidents est le système qui indique à votre agent quand un problème se produit. Si vous connectez votre plateforme d’incident à votre agent, votre agent peut recevoir des alertes, examiner les problèmes et prendre des mesures automatiquement. Vous n’avez pas à attendre que quelqu’un démarre une conversation.

Diagramme de flux montrant la plateforme de gestion des incidents envoyant des alertes via des plans de réponse jusqu’à l’enquête et aux actions de l’agent.

Sans plateforme de gestion des incidents, votre agent est réactif : les utilisateurs posent des questions et votre agent enquête à la demande. Avec une plateforme d’incidents connectée, votre agent devient proactif : il récupère les incidents au moment où ils se produisent.

Plateformes prises en charge

Plate-forme Ce qu’il fournit
Azure Monitor. Il peut se connecter dans l’Assistant, et les alertes de vos groupes de ressources gérés sont transmises automatiquement. Azure Monitor fusionne les alertes périodiques en un seul thread. Vous n’avez pas besoin de fournir d’informations d’identification.
PagerDuty Il vous avertit des incidents et fournit une gestion des appels avec l’intégration basée sur l’API.
ServiceNow Il s’intègre à la gestion des services informatiques d’entreprise.

Une seule plateforme d’incidents peut être active à la fois. Le passage à une autre plateforme déconnecte celui actuel.

Que permet la connexion d’une plateforme d’incidents

Une fois que vous avez connecté une plateforme d’incidents à votre agent, votre agent bénéficie de plusieurs fonctionnalités, notamment la réception automatique des incidents et l’interaction avec les incidents. Les sections suivantes fournissent plus de détails sur ces fonctionnalités.

Réception automatique des incidents

Les incidents circulent vers votre agent le moment où ils sont créés dans votre plateforme. Personne n’a besoin de copier et coller des alertes, ou de démarrer manuellement une investigation. L'agent capte automatiquement les incidents.

Cartes d'incident détaillées

Les incidents entrants provenant de toutes les plateformes prises en charge, notamment PagerDuty, ServiceNow et Azure Monitor, s’affichent sous forme de rich cards dans l’interface de conversation. Chaque carte affiche :

Champ Détails
Badge de gravité Couleur codée par priorité (par exemple, P1/Sev0 = rouge, P2/Sev1 = orange)
Horodatage Lorsque l’incident a été déclenché
Title Titre de l’incident avec préfixe de plateforme
État État actuel (par exemple, « Déclenché » ou « Reconnu »)
Description Résumé des incidents
Plan de réponse Lien vers le plan de réponse qui gère l’incident (s’il est configuré)
Afficher des détails Lien vers l’incident dans sa plateforme source

Les cartes enrichies remplacent les notifications d’incident en texte brut utilisées précédemment, ce qui facilite l’analyse des détails des incidents en un clin d’œil.

Interaction avec les incidents

Votre agent peut lire et réécrire l’incident. Ces outils sont disponibles automatiquement lorsque vous connectez la plateforme correspondante.

Plate-forme Fonctionnalités de lecture Fonctionnalités d’écriture
Moniteur de Azure Détails de l’alerte, gravité, ressources affectées Accuser réception des alertes, fermer les alertes
PagerDuty Détails de l’incident, diagnostics Reconnaître, résoudre, ajouter des notes
ServiceNow Détails de l’incident Publier des entrées de discussion, reconnaître, résoudre

Plans de réponse

Les plans de réponse définissent ce que fait votre agent lorsque des types spécifiques d’incidents arrivent. Vous configurez des règles en fonction de la gravité des incidents, des modèles de titre ou d’autres critères, et l’agent suit automatiquement le plan. Pour en savoir plus, consultez les plans de réponse aux incidents.

Un plan de réponse peut :

  • Exécutez des étapes d’investigation spécifiques.

  • Utilisez des connecteurs et des outils particuliers.

  • Fonctionner à un niveau d’autonomie défini (de « collecter des informations uniquement » à « prendre des mesures correctives »).

  • Nouvelle tentative d’investigation automatiquement (jusqu’à une limite configurable), avant de passer à un humain.

Les plans de réponse transforment votre agent d’un assistant à usage général en répondeur d’incident, avec des procédures définies pour les types d’incidents connus.

Plan de réponse de démarrage rapide

Important

Lorsque vous connectez pour la première fois une plateforme d’incidents, un plan de réponse de démarrage rapide par défaut est créé automatiquement. Si vous créez vos propres plans de réponse, le plan de démarrage rapide s’exécute en parallèle et peut entraîner l’acheminement des incidents vers le mauvais agent personnalisé ou leur traitement en double. Pour éviter les conflits, accédez auxplans de réponse aux incidents du >, basculez vers la vue Table et supprimez le plan de démarrage rapide.

Lorsque vous connectez une plateforme d’incidents, vous pouvez activer cette fonctionnalité pour créer automatiquement un plan de réponse par défaut. Ce plan vous permet de commencer immédiatement :

Plate-forme Descripteurs par défaut du plan Niveau d’autonomie
Moniteur de Azure Alertes Sev0, Sev1, Sev2 Autonome
PagerDuty Incidents P1 Autonome

Azure Monitor prend en charge tous les niveaux de gravité (Sev0-Sev4). Le plan de démarrage rapide cible les alertes de priorité la plus élevée par défaut. Vous pouvez personnaliser cette fonctionnalité pour inclure d’autres niveaux de gravité ou créer des plans séparés pour les alertes de priorité inférieure.

Le plan de démarrage rapide crée un plan de réponse nommé quickstart_handler :

  • Correspond aux incidents par priorité ou gravité.
  • Couvre tous les services impactés.
  • S’exécute en mode entièrement autonome.
  • Peut être personnalisé ou désactivé ultérieurement.

Vous pouvez personnaliser ce plan par défaut ou créer d’autres plans de réponse avec différents filtres et niveaux d’autonomie.

Suivre la valeur de l’incident

Vous pouvez suivre la valeur de l’incident pour en savoir plus sur la façon dont votre agent gère les incidents au fil du temps. Dans l’interface utilisateur de l’agent SRE Azure, vous pouvez voir ces informations en allant à Surveiller>Métriques d’incident. Pour plus d’informations, consultez Suivi de la valeur de l’incident.

Unité de mesure Ce qu’il montre
Incidents examinés Nombre total d’incidents que l’agent traite.
Atténué par agent Incidents résolus par l’agent de manière autonome.
Assisté par agent Incidents où l’agent aide et l’utilisateur termine la résolution.
Atténué par l’utilisateur Incidents résolus par l’utilisateur avec des informations fournies par l’agent.
Action utilisateur en attente Incidents en attente d’intervention humaine.

Utilisez ces métriques pour comprendre l’efficacité de votre agent et identifier les plans de réponse que vous devrez peut-être régler.

Plateformes d’incident et connecteurs

Les plateformes de gestion des incidents et les connecteurs fonctionnent ensemble. Votre agent utilise ces deux éléments : la plateforme de gestion des incidents déclenche l’investigation, et les connecteurs fournissent les outils nécessaires à l’investigation.

Comparison Plateformes d’incident Connectors
Purpose Où proviennent les alertes Données et actions que l’agent peut utiliser
Configuré dans Builder → plateforme d’incident Builder → connecteurs
Direction Entrant (flux d’incidents vers l’agent) Sortant (l’agent contacte les systèmes)
Example PagerDuty envoie une alerte → l’agent examine L’agent interroge Kusto → trouve la cause racine