Übersicht über den Azure SRE-Agent

Bei Vorfällen findet man oft Kontext, der über Warnungen, Dashboards, Tickets und Repositorien verteilt ist. Der Azure SRE Agent verbindet sich mit Ihren Azure-Ressourcen, Observability-Tools, Incident-Plattformen und Quellcode-Repositories, sodass Sie Probleme mit mehr operativem Kontext an einem Ort untersuchen können. Nutze es, um Signale zu sammeln, aktuelle Probleme mit früheren Untersuchungen zu vergleichen und regulierte Automatisierungen innerhalb konfigurierter Berechtigungen, Laufmodi und Richtlinien auszuführen.

Mögliche Aktionen

Der Azure SRE Agent hilft Ihrem Team, Vorfälle zu untersuchen und schneller zu reagieren. Sie sammelt Kontext, identifiziert wahrscheinliche Ursachen und schlägt Milderungen vor oder, wenn sie konfiguriert ist, führt sie aus.

Zum Beispiel kann der SRE-Agent während eines speicherbezogenen Vorfalls:

  • Speichertrends erkennen: Abfragen von Application Insights, um einen Speichertrend zu identifizieren, der 40 Minuten vor der Warnung begann
  • Korrelate Deployments: Verknüpfen Sie den Trend mit einem GitHub-Repository-Deployment-Event zwei Stunden früher
  • Minderungsmaßnahmen vorschlagen: Identifizieren Sie den spezifischen Commit und empfehlen Sie, den betroffenen Pod neu zu starten oder den Schwellenwert für die Speicherskalierung anzupassen (Horizontal Pod Autoscaler, HPA)
  • Vorfall-Tickets vorab ausfüllen: Erstellen Sie ein Ticket in ServiceNow, PagerDuty oder für einen Incident-Channel, das bereits mit der vollständigen Untersuchungszusammenfassung vorausgefüllt ist

Diese konfigurierten Arbeitsabläufe benachrichtigen die zuständigen Personen, während der SRE-Agent an einem vorgeschlagenen Minderungsvorhaben arbeitet. Im Review-Modus überprüft ein SRE-Agent-Administrator die Zusammenfassung mit angehängtem Runbook-Kontext und genehmigt Aktionen, die eine Genehmigung erfordern. Die Analyse bleibt in einem Thread, wodurch das Wechseln zwischen Tools reduziert wird. Ob der Agent automatisch eine Minderung anwendet oder auf die Genehmigung wartet, hängt vom konfigurierten Laufmodus ab.

Dieses Muster gilt für konfigurierte Azure-Dienste und Integrationen, einschließlich Rechenleistung, Speicher, Netzwerk, Daten sowie verwandter Überwachungs- und Managementdienste. Erweitern Sie es mithilfe von zulässigen Azure CLI-Vorgängen durch Skills, genehmigte Runbooks oder benutzerdefinierte Agenten. Nutze Agenten-Hooks , um Governance-Checkpoints hinzuzufügen, die Aktionen erlauben oder blockieren können.

Die Arbeit des Agenten folgt drei Mustern:

  • Automatisieren Sie Vorfälle: Bei Alarmbereitschaft fragt der Agent Ihre Überwachungstools ab, korreliert Signale systemübergreifend, identifiziert die wahrscheinliche Ursache und schlägt Maßnahmen vor.

  • Automatisierte geplante Arbeitsabläufe: Planen Sie proaktive Gesundheitschecks, Compliance-Durchsuchungen und routinemäßige Betriebsaufgaben. Ergebnisse werden in Ihrer verbundenen Vorfallplattform oder in Ihrem Benachrichtigungskanal angezeigt.

  • Untersuche und gib Rat: Stelle Fragen in natürlicher Sprache zu deiner Umgebung, wie zum Beispiel "Was hat sich in der letzten Stunde verändert?" oder "Warum ist dieser Service schlecht?", und hol dir bodenständige, quellenbasierte Antworten.

So funktioniert es

SRE Agent verbindet Azure-spezifisches Produktwissen mit der von dir kontrollierten Anpassung. Standardmäßig kann es Azure-Ressourcen innerhalb der zugewiesenen Berechtigungen abfragen und darauf reagieren, mit integriertem Verhalten für gängige operative Aufgaben.

Der Agent arbeitet über fünf Erweiterungspunkte, die Sie individuell anpassen können:

  • Fähigkeiten: Diskrete Funktionen, einschließlich Marketplace-Runbooks und Azure CLI-Skripts, die die operative Reichweite des Agents erweitern, ohne dass benutzerdefinierter Code erforderlich ist.

  • Individuelle Agenten: Speziell entwickelte Agenten für spezifische operative Bereiche. Mehrere spezialisierte Agenten werden gebrauchsfertig ausgeliefert, und Sie können Ihren eigenen Agenten im Agent-Builder erstellen. Siehe "Benutzerdefinierte Agents".

  • Python Tools: Benutzerdefinierte Logik, Datentransformationen und API-Integrationen für Szenarien, die Code anstelle der Konfiguration erfordern.

  • MCP-Server: Verbinden Sie sich mit vorkonfigurierten Partner-Connectors für Observabilitätsplattformen wie Datadog, Splunk, New Relic, Dynatrace und Elasticsearch oder verbinden Sie ein individuelles Tool über den Model Context Protocol-Standard. Siehe MCP-Stecker und Werkzeuge.

  • Agenten-Hooks: Ereignisgesteuerte Automatisierungen, die an definierten Punkten im Agentenlebenszyklus ausgeführt werden, zum Beispiel nachdem ein Tool ausgeführt wird oder wenn der Agent eingestellt wird. Verwenden Sie Hooks, um Richtlinien zu erzwingen, Telemetrie auszustrahlen oder in externe Genehmigungsworkflows zu integrieren. Siehe Agent Hooks.

Jeder vorgeschlagene Tool-Call durchläuft die Governance-Kontrollen, bevor er ausgeführt wird, sodass dein Team die Grenzen selbst für vollautomatisierte Workflows definiert. Weitere Informationen finden Sie unter Sicherheit und Governance.

Integrationen

Der Azure SRE Agent verbindet sich mit den Werkzeugen, die Ihr Team bereits verwendet:

Überwachung und Beobachtbarkeit:

  • Azure Monitor (Metriken, Protokolle, Warnungen, Arbeitsmappen)
  • Application Insights
  • Log Analytics

Vorfallverwaltung:

  • Azure Monitor-Warnungen
  • PagerDuty
  • ServiceNow

Quellcodeverwaltung und CI/CD:

  • GitHub (Repositorys, Probleme)
  • Azure DevOps (Repositorien, Arbeitsaufgaben)

Datenquellen:

  • Azure Data Explorer (Kusto)-Cluster
  • Model Context Protocol (MCP) Server

Kommunikation und Benachrichtigungen:

  • Microsoft Teams
  • Outlook

Je nach Ihrer Konfiguration bietet der Azure SRE Agent auch verwaltete Connectors an, ein separates Connector-System, das Ihren Agenten mit SaaS-Diensten wie Google Drive, SharePoint, Notion und Confluence verbinden kann.

Sicherheit und Governance

Sicherheits- und Plattformteams können geschichtete Kontrollen über Netzwerk, Identität, Autorisierung und organisatorische Governance anwenden:

  • Netzwerkisolation: Die VNet-Integration leitet den Arbeitsverkehr des Agenten durch Ihr virtuelles Netzwerk. Die Regeln Ihrer Netzwerksicherheitsgruppe (NSG) gelten, während Ihr privater DNS Anfragen auflöst. Wenn Sie Netzwerkrouting, DNS und Berechtigungen korrekt konfigurieren, können Sie private Endpunkte, interne APIs und gesperrte Ressourcen wie jede andere Ressource in Ihrem virtuellen Netzwerk (VNet) erreichen.

  • Identität und RBAC: Der Agent authentifiziert sich mit einer verwalteten Identität und arbeitet unter Azure rollenbasierter Zugriffskontrolle (RBAC). Für den Quellcode erlaubt der GitHub Enterprise-Support dem Agenten, sich als regulierte Service-Identität über ein Bring Your Own GitHub App-Modell zu authentifizieren.

  • Zugriffskontrolle auf Werkzeugebene: Setzen Sie jedes Werkzeug, das der Agent verwendet, um zuzulassen, zu fragen oder abzulehnen. Administratoren setzen globale Leitplanken, Teamleiter passen jeden benutzerdefinierten Agenten an, und Nutzer genehmigen Tools in ihrem Gespräch. Die verfügbaren Optionen, Standardwerte und Priorität richten sich nach dem Geltungsbereich und der geltenden Richtlinie. Details finden Sie unter den Tool-Zugriffsrichtlinien.

  • Infrastructure as Code: Setzen Sie den Agenten, seine Netzwerkkonfiguration, seine Identität und seine Tool-Richtlinien über Bicep-Vorlagen (Azure-Infrastructure-as-Code-Sprache) und Azure CLI über dieselben CI/CD-Pipelines bereit, die Sie für alle anderen Azure-Ressourcen verwenden.

  • Verwaltete Skill-Verteilung: Plattformteams können genehmigte Fähigkeiten über den Private Plugins Marketplace in einem privaten GitHub-Repository veröffentlichen. Agenten im gesamten Mandanten installieren genehmigte Skills aus demselben verwalteten Katalog.

Wiederverwendung des operativen Kontexts

Azure SRE Agent behält Kontext aus früheren Untersuchungen und verwendet Hintergrund-Einblicke sowie Sitzungsinnblicke, um wiederkehrende Muster oder verwandten Kontext zu erkennen. Gespeicherter Kontext kann Ursachen, Lösungsschritte, Präferenzen und Betriebsmuster umfassen. Die Wiederverwendung kann wiederholte Kontextsammlungen einschränken, die Abhängigkeit von undokumentiertem individuellem Wissen verringern und Bereitschafts-Ingenieuren konsistentere Ausgangsinformationen geben.

Tip

Beispiel aus dem Team: Ein neuer Ingenieur kommt in den Bereitschaftsdienst. Der Agent kennt bereits Einsatzmuster, frühere Vorfälle und Teamabläufe, daher beginnt er von Anfang an mit mehr Kontext.

Solobeispiel: Sie fahren in den Urlaub. Der erfasste Arbeitskontext des Agenten steht jeder Person zur Verfügung, die die Vertretung übernimmt, damit sie nicht bei null anfangen muss.

Stage Was ist los
Anfangsaufbau Verbinden Sie Ihre Tools und nutzen Sie während einer Untersuchung das integrierte Azure-Wissen.
Nach wiederholten Untersuchungen Behaltener Kontext kann die Topologie der Umwelt, wiederkehrende Fehlermuster und Eskalationspräferenzen umfassen.
Da sich gemeinsamer Kontext ansammelt Teammitglieder können frühere Ursachen und Lösungsschritte wiederverwenden, ohne weniger auf undokumentiertes individuelles Wissen angewiesen zu sein.

Get started

Wählen Sie den Weg, der Ihrem Ziel entspricht: planen Sie eine Aufgabe, bearbeiten Sie einen Vorfall oder erstellen Sie einen individuellen Agenten.

Verwenden Sie geplante Aufgaben, um routinemäßige Betriebsaufgaben (Zustandsprüfungen, Bereinigungen und Compliance-Prüfungen) zu automatisieren, ohne Infrastrukturcode schreiben zu müssen.

  1. Wählen Sie die Registerkarte "Vorgänge planen" aus .

  2. Geben Sie Vorgangsdetails ein.

  3. Definieren Sie den Zeitplan für die Ausführung Ihrer Aufgabe.

  4. Erstellen Sie benutzerdefinierte Agent-Anweisungen für die Aufgabe.

  5. Wählen Sie "Geplante Aufgabe erstellen" aus.

Sie sehen Ergebnisse Ihrer geplanten Aufgabe in Ihrer verbundenen Vorfallplattform oder im Benachrichtigungskanal.

Nutzen Sie diese Ressourcen zur Planung von Deployment, Governance, Abrechnung und Team-Onboarding:

Ressource Was Sie finden
Preise und Abrechnung Nutzungsbasierte Preismessung in Azure Agent Units (AAUs) sowie Kapazitätsplanung
Sicherheitsübersicht Datenverarbeitung, Datenschutz und Ausführungsisolation
Erstellen und Einrichten Setzen Sie einen Agenten ein und gewähren Sie ihm Zugriff auf ausgewählte Azure-Ressourcen.
Teamaufbau und Rollen sowie Benutzerrollen und Berechtigungen Wie die Rollen steuern, wer chatten, den Agenten genehmigen und verwalten darf, sowie wie man den Agenten über das Team, die Dienstleistungen und die Abläufe informiert

Nächster Schritt