Panoramica dell'agente SRE di Azure

Durante gli incidenti, spesso trovi il contesto sparso tra allarme, dashboard, ticket e repository. Azure SRE Agent si collega alle tue risorse Azure, agli strumenti di osservabilità, alle piattaforme di incidenti e ai repository di codice sorgente, così puoi indagare problemi con più contesto operativo in un unico posto. Usalo per raccogliere segnali, confrontare problemi attuali con indagini precedenti ed eseguire automazioni governate all'interno di permessi, modalità di esecuzione e policy configurate.

Cosa puoi fare

Azure SRE Agent aiuta il tuo team a indagare sugli incidenti e a rispondere più rapidamente. Raccoglie contesto, identifica cause probabili e suggerisce o, quando configurato, applica mitigazioni.

Ad esempio, durante un incidente legato alla memoria, l'Agente SRE può:

  • Rilevare tendenze di memoria: Interrogare Application Insights per identificare una tendenza di memoria iniziata 40 minuti prima dell'allarme
  • Correla i deployment: collega l’andamento a un evento di deployment in un repository GitHub avvenuto due ore prima
  • Proponi mitigazioni: Identifica il commit specifico e proponi di riavviare il pod interessato o di regolare la soglia di scalabilità della memoria (scalatore automatico di pod orizzontale, o HPA)
  • Precompila i ticket di incidente: crea un ticket in ServiceNow, PagerDuty o nel canale degli incidenti con il riepilogo completo dell'indagine già precompilato

Questi flussi di lavoro configurati notificano le persone appropriate mentre l'Agente SRE lavora su una proposta di mitigazione. In modalità Revisione, un amministratore SRE Agent esamina il riassunto con il contesto del runbook allegato e approva le azioni che richiedono approvazione. L'analisi rimane in un unico thread, riducendo la necessità di passare da uno strumento all'altro. Se l'agente applica automaticamente una mitigazione o aspetta l'approvazione dipende dalla modalità di esecuzione configurata.

Questo schema si applica a servizi e integrazioni Azure configurati, inclusi calcolo, archiviazione, reti, dati e servizi correlati di monitoraggio e gestione. Estendilo con operazioni interfaccia della riga di comando di Azure autorizzate tramite abilità, runbook approvati o agenti personalizzati. Usa gli agganci degli agenti per aggiungere checkpoint di governance che possono permettere o bloccare azioni.

Il lavoro dell'agente segue tre schemi:

  • Automatizza gli incidenti: In stato di allerta, l'agente interroga i tuoi strumenti di monitoraggio, correla i segnali tra i sistemi, identifica la causa radice probabile e propone misure di mitigazione.

  • Automatizza i flussi di lavoro programmati: Programma controlli proattivi di salute, controlli di conformità e compiti operativi di routine. I risultati vengono visualizzati nella piattaforma di eventi imprevisti connessi o nel canale di notifica.

  • Indaga e consiglia: fai domande in linguaggio naturale sul tuo ambiente, come "cosa è cambiato nell'ultima ora?" o "perché questo servizio è degradato?", e ottieni risposte fondate e citate dalle fonti.

Come funziona

SRE Agent combina conoscenze specifiche del prodotto Azure con personalizzazioni che controlli. Di default, può interrogare e agire sulle risorse Azure entro i permessi assegnati, con il comportamento integrato per compiti operativi comuni.

L'agente opera attraverso cinque punti di estensione che puoi personalizzare:

  • Competenze: funzionalità discrete, inclusi i runbook del marketplace e gli script interfaccia della riga di comando di Azure, che estendono la portata operativa dell'agente senza richiedere codice personalizzato.

  • Custom agent: Agenti appositamente costruiti per specifici domini operativi. Diversi agenti specializzati sono disponibili pronti all'uso e puoi crearne uno personalizzato nel generatore di agenti. Vedere Agenti personalizzati.

  • Python strumenti: logica personalizzata, trasformazioni dei dati e integrazioni API per scenari che richiedono codice anziché configurazione.

  • Server MCP: Connettiti a connettori partner preconfigurati per piattaforme di osservabilità come Datadog, Splunk, New Relic, Dynatrace ed Elasticsearch, oppure collega qualsiasi strumento personalizzato tramite lo standard Model Context Protocol. Vedi connettori e strumenti MCP.

  • Agganci agenti: Automazioni attivate da eventi che si attivano in punti definiti del ciclo di vita dell'agente, ad esempio dopo l'esecuzione di uno strumento o quando l'agente si ferma. Usa gli hook per far rispettare i criteri, emettere dati di telemetria o per l'integrazione con flussi di lavoro di approvazione esterni. Vedi Agent hooks.

Ogni chiamata di strumento proposta passa attraverso controlli di governance prima di essere eseguita, così il tuo team definisce i confini anche per flussi di lavoro completamente automatizzati. Per altre informazioni, vedere Sicurezza e governance.

Integrations

Azure SRE Agent si collega agli strumenti che il tuo team già utilizza:

Monitoraggio e osservabilità:

  • Monitoraggio di Azure (metriche, log, avvisi, cartelle di lavoro)
  • Approfondimenti sulle Applicazioni
  • Log Analytics

Gestione degli eventi imprevisti:

  • Avvisi di Monitoraggio di Azure
  • PagerDuty
  • ServiceNow

Controllo del codice sorgente e CI/CD:

  • GitHub (repository, problemi)
  • Azure DevOps (repository, elementi di lavoro)

Origini dati:

  • Cluster di Esplora dati di Azure (Kusto)
  • Server MCP (Model Context Protocol)

Comunicazione e notifiche:

  • Microsoft Teams
  • Outlook

A seconda della tua configurazione, Azure SRE Agent offre anche connettori gestiti, un sistema di connettori separato che può collegare il tuo agente a servizi SaaS come Google Drive, SharePoint, Notion e Confluence.

Sicurezza e gestione

I team di sicurezza e piattaforma possono applicare controlli stratificati su rete, identità, autorizzazione e governance organizzativa:

  • Isolamento di rete: l'integrazione VNet instrada il traffico degli spazi di lavoro degli agenti attraverso la tua rete virtuale. Le regole del tuo gruppo di sicurezza di rete (NSG) si applicano mentre il tuo DNS privato risolve le richieste. Quando configuri correttamente il routing di rete, il DNS e i permessi, puoi raggiungere endpoint privati, API interne e risorse bloccate come qualsiasi altra risorsa nella tua rete virtuale (VNet).

  • Identità e RBAC: L'agente autentica con l'identità gestita e opera sotto il controllo di accesso basato sul ruolo (RBAC) di Azure. Per il codice sorgente, il supporto GitHub Enterprise permette all'agente di autenticarsi come identità di servizio governato tramite un modello Bring Your Own GitHub App.

  • Controllo di accesso a livello di strumento: imposta ogni strumento utilizzato dall'agente per permettere, chiedere o negare. Gli amministratori impostano delle barriere globali, i team lead personalizzano ogni agente personalizzato e gli utenti approvano gli strumenti all'interno della loro conversazione. Le opzioni disponibili, i valori predefiniti e la precedenza dipendono dall'ambito e dalla politica in vigore. Per dettagli, consulta le politiche di accesso agli strumenti.

  • Infrastruttura come codice: distribuisci l'agente, la sua configurazione di rete, la sua identità e le sue policy di strumento tramite template Bicep (il linguaggio infrastructure-as-code di Azure) e interfaccia della riga di comando di Azure tramite le stesse pipeline CI/CD che usi per tutte le altre risorse Azure.

  • Distribuzione delle competenze regolata: i team della piattaforma possono pubblicare competenze approvate in un repository privato di GitHub utilizzando il Private Plugin Marketplace. Gli agenti in tutto il tenant installano skill approvate dallo stesso catalogo controllato.

Riutilizzo del contesto operativo

Azure SRE Agent conserva il contesto delle indagini precedenti e utilizza la generazione di insight background e le intuizioni delle sessioni per riconoscere schemi ricorrenti o contesti correlati. Il contesto trattenuto può includere cause profonde, passaggi di risoluzione, preferenze e modelli operativi. Il riutilizzo può limitare la raccolta ripetuta di contesti, ridurre la dipendenza da conoscenze individuali non documentate e fornire agli ingegneri reperibili informazioni iniziali più coerenti.

Tip

Esempio di team: un nuovo tecnico partecipa alla chiamata. L'agente conosce già i modelli di deployment, gli incidenti passati e le procedure del team, quindi inizia con più contesto dal primo giorno.

Un solo esempio: Tu vai in vacanza. Il contesto operativo raccolto dall'agente è disponibile a chi subentra, in modo da non dover ripartire da zero.

Stage Che succede
Configurazione iniziale Collega i tuoi strumenti e utilizza le informazioni integrate di Azure durante una ricerca.
Dopo ripetute indagini Il contesto mantenuto può includere la topologia dell'ambiente, gli schemi di errore ricorrenti e le preferenze di escalation.
Man mano che il contesto condiviso si accumula I membri del team possono riutilizzare le cause alla radice e i passaggi di risoluzione precedenti con meno dipendenza da conoscenze individuali non documentate.

Get started

Scegli il percorso che corrisponde al tuo obiettivo: programmare un compito, gestire un incidente o creare un agente personalizzato.

Usa le attività pianificate per automatizzare le attività operative di routine (controlli dello stato, pulizia e verifiche di conformità) senza scrivere codice infrastrutturale.

  1. Selezionare la scheda Pianifica attività .

  2. Immettere i dettagli dell'attività.

  3. Definire la pianificazione per eseguire l'attività.

  4. Creare istruzioni personalizzate per l'agente per il compito.

  5. Selezionare Crea attività pianificata.

Vedi i risultati del compito programmato sulla piattaforma di incidenti o nel canale di notifiche connesso.

Usa queste risorse per pianificare il deployment, la governance, la fatturazione e l'onboarding del team:

risorsa Cosa trovi
Prezzi e fatturazione Prezzi basati sull'uso misurati in Azure Agent Units (AAUs), più pianificazione della capacità
Panoramica della sicurezza Gestione dei dati, privacy e isolamento dell'esecuzione
Creare e configurare Distribuisci un agente e concedigli l'accesso a risorse Azure selezionate.
Configurazione del team e ruoli e ruoli e permessi utente Come i ruoli controllano chi può chattare, approvare e amministrare l'agente, oltre a insegnare all'agente il tuo team, i servizi e le procedure

Passo successivo