Incident-Plattformen in Azure SRE Agent

Eine Vorfallplattform ist das System, das Ihren Agenten informiert, wenn etwas schief geht. Wenn Sie Ihre Vorfallplattform mit Ihrem Agent verbinden, kann Ihr Agent Warnungen empfangen, Probleme untersuchen und automatisch Maßnahmen ergreifen. Sie müssen nicht warten, bis jemand einen Chat startet.

Flussdiagramm, das zeigt, wie eine Plattform für Vorfälle Warnungen über Reaktionspläne an die Untersuchung und Maßnahmen des Agenten sendet.

Ohne eine Vorfallplattform bleibt Ihr Agent reaktiv: Benutzer stellen Fragen, und der Agent untersucht diese bei Bedarf. Mit einer verbundenen Vorfallplattform wird Ihr Agent proaktiv: Er erfasst Vorfälle im Moment, in dem sie auftreten.

Unterstützte Plattformen

Plattform Was es bietet
Azure Monitor. Es kann im Assistenten eine Verbindung herstellen, und Warnungen aus Ihren verwalteten Ressourcengruppen werden automatisch weitergeleitet. Azure Monitor führt wiederkehrende Warnungen in einem Thread zusammen. Sie müssen keine Anmeldeinformationen angeben.
PagerDuty Es benachrichtigt Sie bei Vorfällen und bietet die On-Call-Verwaltung mit API-basierter Integration.
ServiceNow Sie ist in die Unternehmens-IT-Dienstverwaltung integriert.

Es kann jeweils nur eine Vorfallplattform aktiv sein. Durch den Wechsel zu einer anderen Plattform wird die aktuelle Verbindung getrennt.

Was die Anbindung einer Vorfallplattform ermöglicht

Nachdem Sie eine Vorfallplattform mit Ihrem Agent verbunden haben, erhält Ihr Agent mehrere Funktionen, einschließlich automatischer Vorfallempfang und Vorfallinteraktion. Die nächsten Abschnitte enthalten weitere Details zu diesen Funktionen.

Automatische Ereigniserfassung

Vorfälle werden unmittelbar nach ihrer Erstellung auf Ihrer Plattform an Ihren Agenten weitergeleitet. Niemand muss Warnungen kopieren und einfügen oder eine Untersuchung manuell starten. Der Agent nimmt Vorfälle automatisch auf.

Umfangreiche Incident-Karten

Eingehende Vorfälle aus allen unterstützten Plattformen, darunter PagerDuty, ServiceNow und Azure Monitor, werden in der Chatoberfläche als umfangreiche Karten angezeigt. Jede Karte zeigt Folgendes an:

Feld Einzelheiten
Schweregradabzeichen Farbcodiert nach Priorität (z. B. P1/Sev0 = rot, P2/Sev1 = orange)
Zeitstempel Wann der Incident ausgelöst wurde
Titel Vorfalltitel mit Plattformpräfix
Status Aktueller Status (z. B. "Ausgelöst" oder "Bestätigt")
Description Vorfallzusammenfassung
Antwortplan Verknüpfen mit dem Reaktionsplan zur Behandlung des Vorfalls (falls konfiguriert)
Details anzeigen Link zum Vorfall in der Quellplattform

Rich-Karten ersetzen die zuvor verwendeten Nur-Text-Vorfallbenachrichtigungen und erleichtern das Scannen von Vorfalldetails auf einen Blick.

Vorfallinteraktion

Ihr Agent kann den Vorfall lesen und zurückschreiben. Diese Tools sind automatisch verfügbar, wenn Sie die entsprechende Plattform verbinden.

Plattform Lesefunktionen Schreibfunktionen
Azure Monitor Warnungsdetails, Schweregrad, betroffene Ressourcen Benachrichtigungen bestätigen, Warnungen schließen
PagerDuty Vorfalldetails, Diagnose Bestätigen, Auflösen, Hinzufügen von Notizen
ServiceNow Vorfalldetails Posten von Diskussionseinträgen, Bestätigen, Auflösen

Antwortpläne

Reaktionspläne definieren , was Ihr Agent tut , wenn bestimmte Arten von Vorfällen eingehen. Sie konfigurieren Regeln basierend auf Vorfallschweregrad, Titelmustern oder anderen Kriterien, und der Agent folgt dem Plan automatisch. Weitere Informationen finden Sie unter Vorfallreaktionspläne.

Ein Antwortplan kann:

  • Führen Sie bestimmte Untersuchungsschritte aus.

  • Verwenden Sie bestimmte Verbinder und Tools.

  • Arbeiten Sie auf einer definierten Autonomieebene (von "Nur Informationen sammeln" bis hin zu "Korrekturmaßnahmen").

  • Wiederholen Sie die Untersuchung automatisch (bis zu einem konfigurierbaren Grenzwert), bevor Sie zu einem Menschen eskalieren.

Reaktionspläne verwandeln Ihren Agent von einem allgemeinen Assistenten in einen Vorfall-Responder mit definierten Verfahren für bekannte Vorfalltypen.

Schnellstart-Antwortplan

Important

Wenn Sie eine Vorfallplattform zum ersten Mal verbinden, wird automatisch ein Standardmäßiger Schnellstart-Reaktionsplan erstellt. Wenn Sie eigene Reaktionspläne erstellen, wird der Schnellstartplan zusammen mit ihnen ausgeführt und kann dazu führen, dass Vorfälle zweimal an den falschen benutzerdefinierten Agent weitergeleitet oder verarbeitet werden. Um Konflikte zu vermeiden, wechseln Sie zuGenerator-Vorfallreaktionsplänen>, wechseln Sie zur Tabellenansicht, und löschen Sie den Schnellstartplan.

Wenn Sie eine Vorfallplattform verbinden, können Sie dieses Feature aktivieren, um automatisch einen Standardreaktionsplan zu erstellen. Dieser Plan bringt Sie sofort auf den Weg:

Plattform Plan-Standardhandles Autonomiestufe
Azure Monitor Sev0, Sev1, Sev2 Warnungen Autonom
PagerDuty P1-Vorfälle Autonom

Azure Monitor unterstützt alle Schweregrade (Sev0–Sev4). Der Schnellstartplan zielt standardmäßig auf Warnungen mit der höchsten Priorität ab. Sie können dieses Feature anpassen, um andere Schweregrade einzuschließen oder separate Pläne für Warnungen mit niedrigerer Priorität zu erstellen.

Der Schnellstartplan erstellt einen Antwortplan mit dem Namen quickstart_handler :

  • Gleicht Vorfälle nach Priorität oder Schweregrad ab.
  • Deckt alle betroffenen Dienste ab.
  • Wird im vollständig autonomen Modus ausgeführt.
  • Kann später angepasst oder deaktiviert werden.

Sie können diesen Standardplan anpassen oder andere Antwortpläne mit unterschiedlichen Filtern und Autonomiestufen erstellen.

Vorfallwert nachverfolgen

Sie können den Vorfallwert nachverfolgen, um zu erfahren, wie Ihr Agent Vorfälle im Laufe der Zeit verarbeitet. In der Azure SRE Agent-Benutzeroberfläche sehen Sie diese Informationen, indem Sie zu Monitor>Vorfallmetriken wechseln. Weitere Informationen finden Sie unter "Vorfallwert nachverfolgen".

Metric Was es zeigt
Überprüfte Vorfälle Gesamtzahl der Vorfälle, die der Agent verarbeitet.
Abgemildert durch Agent Vorfälle, die der Agent autonom löst.
Unterstützt durch einen Agenten Vorfälle, bei denen der Agent hilft und der Benutzer die Lösung abschließt.
Durch den Benutzer gemindert Vorfälle, die der Benutzer mit vom Agent bereitgestellten Informationen löst.
Ausstehende Benutzeraktion Vorfälle, die auf menschliche Eingabe warten.

Verwenden Sie diese Metriken, um die Effektivität Ihres Agents zu verstehen und Reaktionspläne zu identifizieren, die Sie möglicherweise optimieren müssen.

Incident-Plattformen im Vergleich zu Konnektoren

Plattformen für Vorfälle und Konnektoren arbeiten zusammen. Ihr Agent nutzt dabei beides: Die Plattform für Vorfälle löst die Ermittlung aus, und Konnektoren stellen die Tools für die Ermittlung bereit.

Vergleich Zwischenfallplattformen Verbinder
Purpose Woher Warnungen stammen Daten und Aktionen, die der Agent verwenden kann
Konfiguriert in Builder → Incident-Platform Builder → Konnektoren
Direction Eingehend (Fluss der Vorfälle zum Agenten) Ausgehend (der Agent kontaktiert Systeme)
Example PagerDuty sendet eine Warnung → der Agent untersucht. Der Agent fragt Kusto → die Ursache findet