Tenere traccia del valore dell'incidente nell'agente SRE di Azure

Senza dati consolidati, spesso è necessario interrogare manualmente i dati di telemetria, incrociare i ticket di incidente e stimare quali piani di risposta siano efficaci. Ciò rende difficile stabilire se un piano di risposta risolve 80% di eventi imprevisti in modo autonomo o inoltra la maggior parte degli eventi imprevisti agli esseri umani. Rende inoltre difficile dimostrare che l'agente ha risolto gli eventi imprevisti durante la notte o decidere dove investire in un'automazione aggiuntiva.

Il dashboard delle metriche degli eventi imprevisti offre una visualizzazione consolidata. Usalo per misurare i tassi di mitigazione, il tempo risparmiato e le tendenze della qualità nei vari incidenti gestiti dal tuo agente, suddivise per piano di risposta.

Suggerimento

  • Selezionare qualsiasi segmento del grafico, barra della gravità o riquadro della causa principale per visualizzare nel dettaglio gli incidenti corrispondenti.
  • Filtrare l'intero dashboard in base a un singolo piano di risposta. Tutte le schede KPI, i grafici e l'aggiornamento della mappa ad albero.
  • Le schede KPI presentano metriche chiave, ad esempio ore salvate, frequenza di riuscita, tempo medio per attenuare e punteggio di qualità con valutazioni a stella da 1 a 5.
  • I dati di analisi vengono caricati progressivamente, in modo che ogni scheda e grafico esegua il rendering non appena i dati sono pronti e i risultati vengano visualizzati più velocemente.
  • I grafici ruotano automaticamente le etichette delle date e normalizzano le barre di confronto per la leggibilità in qualsiasi intervallo di tempo.

Screenshot del dashboard delle metriche degli eventi imprevisti che mostra schede KPI con tendenze sparkline e un grafico a linee di riepilogo degli eventi imprevisti.

L'agente registra uno snapshot delle attività ogni volta che elabora un evento imprevisto. Questi snapshot catturano il risultato, se l'agente ha mitigato l'incidente in modo autonomo, ha assistito l'indagine o è stato scalato a un essere umano. Il dashboard delle metriche degli eventi imprevisti aggrega questi snapshot in schede KPI in tempo reale, un grafico di tendenza e una suddivisione in base al piano di risposta.

Passare a Monitorare>le metriche degli eventi imprevisti per visualizzare il dashboard.

Il grafico Riepilogo eventi imprevisti traccia le metriche chiave nel tempo, in modo da individuare le tendenze.

Ogni scheda mostra un conteggio, la sua percentuale in relazione al totale degli incidenti esaminati e un grafico sparkline che mostra la variazione percentuale rispetto al periodo precedente.

Le metriche degli eventi imprevisti principali includono:

Metrica Cosa ti dice
Eventi imprevisti esaminati Incidenti distinti totali che il tuo agente ha investigato nel periodo di tempo selezionato
Attenuazione dell'agente completata Eventi imprevisti risolti in modo autonomo dall'agente
Assistito dall'agente Incidenti in cui l'agente ha fornito i dati di indagine e il completamento della risoluzione da parte dell'utente.
Mitigato dall'utente Incidenti risolti interamente da un operatore umano. Si tratta di potenziali opportunità di automazione
Azione utente in sospeso Eventi imprevisti in attesa dell'input umano. Questo è il backlog corrente

Punteggio di qualità

Quando un grafico di tendenza dei dettagli visualizza più di dieci punti dati, il grafico ruota automaticamente le etichette di data dell'asse x di 45 gradi e aumenta il margine inferiore. Questo comportamento viene in genere visualizzato quando l'intervallo di tempo selezionato si estende su due o più settimane. La rotazione impedisce la sovrapposizione delle etichette e mantiene le date leggibili se si sta esaminando una tendenza di 14 giorni o un mese completo. Si applica ai grafici di tendenza per ore salvate, percentuale di successo, TTM mediano e punteggio di qualità.

La scheda di confronto Tempo mediano di mitigazione normalizza la larghezza delle barre in proporzione al tempo totale di risoluzione. Se il tuo agente risolve gli incidenti con una mediana di 10 minuti e gli operatori umani impiegano 30 minuti, la barra dell'agente viene visualizzata con una larghezza del 25% e la barra degli operatori umani del 75%. Ciò rende visibile il divario di velocità senza leggere i numeri.

Caricamento progressivo dei dati

Il dashboard delle metriche degli eventi imprevisti esegue le query sui dati in parallelo ed esegue il rendering di ogni risultato in modo indipendente. Quando si apre il dashboard o si modifica l'intervallo di tempo, le singole schede e i grafici visualizzano i dati non appena viene completata la query di backup. Non si attende che ogni metrica venga caricata prima di visualizzare i risultati.

In pratica:

  • Schede metriche (conteggi degli incidenti, metriche di attenuazione e TTM) di solito vengono visualizzate per prime perché queste metriche sono più semplici da aggregare
  • I grafici (riepilogo degli eventi imprevisti, causa radice, distribuzione della gravità) vengono visualizzati man mano che arrivano i dati
  • La griglia dei piani di risposta viene caricata per ultima perché calcola le metriche per ciascun piano su tutti gli incidenti

Quando si modifica l'intervallo di tempo o si seleziona Aggiorna, il dashboard annulla le query precedenti e ne avvia di nuove. Ogni risultato viene visualizzato man mano che arriva.

Leggibilità del grafico

La scheda Quality Score usa una valutazione a 5 stelle per rendere il punteggio Intent Met facilmente comprensibile. La stessa classificazione a stella viene visualizzata nella colonna Qualità della griglia del piano di risposta.

Drill-down interattivo

Ogni visualizzazione nel dashboard è interattiva. Seleziona un segmento per aprire una finestra modale di drill-down che mostra gli incidenti corrispondenti.

Selection Cosa mostra il modale
Pannello mappa ad albero della causa principale Incidenti con tale causa di fondo
Barra di distribuzione di gravità Eventi imprevisti a tale livello di gravità
Punto dati del grafico del volume Eventi imprevisti da tale data, facoltativamente filtrati in base al risultato
Etichetta della legenda del grafico del volume Tutti gli eventi imprevisti con quel tipo di risultato

Il modale di drill-down visualizza fino a 200 eventi imprevisti con colonne ordinabili: ID, Titolo, Gravità, Data di creazione, Assistito dall'agente e mitigato da. Usare la casella di ricerca per filtrare in base al titolo, all'ID, alla gravità o allo stato dell'evento imprevisto.

Selezionare un titolo dell'incidente per aprire il filo dell'indagine in una barra laterale. È possibile esaminare le operazioni che l'agente ha fatto senza uscire dalla pagina di analisi.

Mappa ad albero della causa radice

Le cause principali vengono visualizzate come riquadri dimensionati proporzionalmente. I riquadri grandi indicano più incidenti con quella causa principale. Ogni riquadro visualizza il nome della causa radice e il numero di eventi imprevisti. Selezionare qualsiasi riquadro per approfondire gli incidenti con quella causa principale.

Grafico del volume degli eventi imprevisti

Un grafico a barre in pila mostra il volume degli incidenti nel tempo, suddiviso in base al risultato: mitigato dall'agente, assistito dall'agente, mitigato dall'intervento umano e attivo/in sospeso. Alternare le visualizzazioni dell'area e del grafico a barre usando i pulsanti in alto a destra del grafico.

Selezionare un punto dati per approfondire gli incidenti di quel giorno. Selezionare un'etichetta di legenda per visualizzare tutti gli eventi imprevisti di quel tipo di risultato.

Grafico di distribuzione della gravità

Un grafico a barre in pila orizzontale suddivide gli eventi imprevisti in base al livello di gravità. Ogni barra mostra le proporzioni dei risultati. Selezionare una barra per approfondire gli incidenti con tale gravità.

Prestazioni del piano di risposta

Sotto i grafici, una griglia delle prestazioni del piano di risposta mostra le metriche per piano con colonne ordinabili.

Column Descrzione
Nome piano di risposta Selezionare questa opzione per filtrare l'intero dashboard in base a questo piano
Mode Badge del livello di autonomia (autonomo, Copilot e così via)
Eventi imprevisti Numero di incidenti distinti
Agent Mitigated Conteggio delle risoluzioni autonome
Tasso di successo Percentuale con codifica a colori
TTM medio Tempo medio per attenuare
Qualità Classificazione a stelle più punteggio numerico di soddisfazione dell'intento

Selezionare qualsiasi riga per filtrare l'intero dashboard. Tutte le schede KPI, i grafici e la mappa ad albero vengono aggiornati per visualizzare i dati soltanto per quel piano di risposta. Viene visualizzata una freccia indietro nella parte superiore. Selezionarlo per tornare alla panoramica.

Questa griglia è la posizione in cui prendere decisioni. È possibile vedere a colpo d'occhio quali piani vengono eseguiti in modalità autonoma e risolvere gli eventi imprevisti senza coinvolgimento umano rispetto ai piani in modalità di revisione che richiedono ancora l'approvazione. Se un piano mostra costantemente una bassa percentuale di successo o zero mitigazioni autonome, modificare le istruzioni del piano di risposta o aumentare il livello di autonomia.

Punteggio Intento raggiunto

Il punteggio Intento raggiunto misura l'efficienza con cui l'agente svolge il lavoro, che si tratti dell'indagine su un incidente o dell'esecuzione di un'attività pianificata. Al termine di ogni thread, una valutazione automatizzata assegna un punteggio al risultato su una scala da 1 a 5:

Punteggio Meaning
5 Risolto in modo eccezionale. Ha superato le aspettative con informazioni aggiuntive
4 Risolto bene. Si è concluso con successo con chiari segni di soddisfazione
3 Risolto parzialmente. Sono stati compiuti progressi, ma il problema non è stato completamente risolto, oppure il thread è in attesa di un'azione dell'utente
2 Svolgimento non adeguato. Ha tentato il compito, ma ha fallito gravemente.
1 Completamente irrisolto. Non è riuscito a risolvere l'obiettivo principale

La scheda Intento raggiunto nel dashboard Panoramica mostra il punteggio medio in tutti i thread degli ultimi 30 giorni con un grafico sparkline di tendenza giornaliero.

La scheda del punteggio Intento raggiunto nel dashboard Panoramica mostra:

  • Punteggio medio: visualizzato come X/5 in tutti i thread valutati negli ultimi 30 giorni
  • Sparkline di tendenza: punteggi medi giornalieri per tenere traccia della qualità nel tempo

Il punteggio combina thread di eventi imprevisti, thread attività pianificati e conversazioni in un'unica metrica di qualità. Misura l'automazione proattiva, ad esempio controlli di integrità pianificati, analisi di conformità e monitoraggio dei costi, insieme alla risposta reattiva agli eventi imprevisti.

L'assegnazione dei punteggi per il riconoscimento dell'intento è completamente automatica. Non è necessaria alcuna configurazione. Ogni incidente completato e ogni thread di attività pianificata vengono valutati utilizzando gli stessi criteri di valutazione. Le attività pianificate che sono ancora in attesa di un'azione dell'utente ricevono un punteggio pari a 3, riflettendo il risultato indeterminato.

Suggerimento

Se il punteggio di Intent Met è inferiore al previsto, esaminare le singole conversazioni nei thread in Monitoraggio → Informazioni dettagliate sulla sessione per capire dove l'agente ha avuto difficoltà. I miglioramenti comuni includono istruzioni più chiare sulle attività, l'aggiunta di connettori pertinenti o la modifica degli strumenti dell'agente.

Prima e dopo

Prima Dopo
Valutazione del valore dell'agente Eseguire query di telemetria, confrontare i ticket, scrivere report manuali Aprire un dashboard. La frequenza di mitigazione, la tendenza e la suddivisione per piano diventano immediatamente visibili
Sapere quali piani funzionano Supporre in base al feedback aneddotico La griglia per piano mostra i conteggi di mitigazione esatti insieme al livello di autonomia
Aggiornamenti degli stakeholder Compilare riepiloghi settimanali a mano Report giornalieri generati automaticamente con conteggi degli eventi imprevisti, stato di integrità e azioni consigliate
Identificazione delle lacune di automazione Nessuna visibilità sul motivo per cui gli eventi imprevisti aumentano Esaminare un piano di risposta per vedere le categorie delle cause principali e quali incidenti l'agente non è riuscito a risolvere
Misurazione della qualità dell'attività pianificata Leggere la trascrizione dei thread di ogni attività e giudicare manualmente se l'obiettivo è stato soddisfatto Il punteggio automatico Intent Met valuta ogni thread completato, con incidenti e attività pianificate riuniti in un’unica metrica di qualità
Caricamento del dashboard Tutti i riquadri e i grafici restano vuoti finché tutte le query non sono terminate Ogni scheda e grafico esegue il rendering in modo indipendente man mano che arrivano i dati, in modo da poter iniziare a leggere le metriche in pochi secondi
Lettura di grafici su oltre 30 giorni Le etichette di data si sovrappongono e diventano illeggibili, quindi è necessario attenersi a intervalli più brevi o passare il puntatore su singoli punti Le etichette ruotano automaticamente a 45 gradi e le barre TTM mostrano larghezze proporzionali, che mantiene i grafici leggibili in qualsiasi intervallo di tempo

Panoramica degli eventi imprevisti

Per una visualizzazione in tempo reale di ogni evento imprevisto gestito dall'agente, passare a Eventi imprevisti nella barra laterale sinistra.

La pagina mostra le schede di riepilogo per lo stato degli incidenti (attivato, riconosciuto) e lo stato di indagine dell'agente (input dell'utente in attesa, In corso, Completato), oltre a una griglia filtrabile di tutti gli incidenti. Filtrare in base all'intervallo di tempo, alla priorità, allo stato, allo stato dell'indagine o alla ricerca di eventi imprevisti specifici.

Ogni riga è collegata al thread di indagine dell'agente, quindi è possibile esaminare esattamente le operazioni dell'agente, quali strumenti ha chiamato, quali prove ha trovato e cosa consigliato.

Report giornalieri

L'agente genera report giornalieri automatizzati accessibili nei report giornalieri nella barra laterale sinistra.

Screenshot del report giornaliero che mostra i risultati della sicurezza, il riepilogo degli eventi imprevisti, le metriche di integrità delle risorse e le azioni consigliate.

Selezionare una data per visualizzare il report di quel giorno. Ogni report riguarda:

  • Risultati della sicurezza: CVE vulnerabilità nei repository connessi, raggruppati per gravità
  • Eventi imprevisti: conteggi attivi, mitigati e risolti con dettagli di indagine per evento imprevisto
  • Integrità e prestazioni: stato di integrità per risorsa con metriche di disponibilità, CPU e memoria
  • Ottimizzazioni del codice: raccomandazioni sulle prestazioni identificate dall'agente
  • Azioni consigliate: elementi di azione con priorità con descrizioni e lavoro stimato

I rapporti giornalieri sostituiscono la routine "cosa è successo durante la notte?". Invece di chiedere all'agente o interrogare i cruscotti, le informazioni sono già raccolte e in attesa.

Limiti

risorsa Limit
Risultati del drill-down Fino a 200 eventi imprevisti per ogni query di drill-down
Report giornalieri Generato una volta al giorno
Punteggio Intento raggiunto Applicato agli eventi imprevisti e alle attività pianificate

Inizia subito

Il rilevamento degli eventi imprevisti è integrato. Aprire Operations Hub > Incident Analytics dopo che l'agente inizia a gestire gli eventi imprevisti.

risorsa Cosa imparerai
Configurare un piano di risposta Configurare i piani di risposta che generano dati di rilevamento