Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Questo articolo contiene tutte le informazioni di riferimento per il monitoraggio di questo servizio.
Per informazioni dettagliate sui dati che è possibile raccogliere per Azure OpenAI nei modelli Microsoft Foundry e su come usarli, vedere Monitor Azure OpenAI.
Metrics
Questa sezione elenca tutte le metriche raccolte automaticamente per questa piattaforma per questo servizio. Queste metriche fanno anche parte dell'elenco globale delle metriche all supportate in Monitoraggio di Azure.
Per informazioni sulla conservazione delle metriche, vedi Monitoraggio di Azure Panoramica delle metriche.
Metriche supportate per Microsoft. CognitiveServices/account
Monitorare le metriche più importanti per Azure OpenAI. Più avanti in questo articolo è disponibile un elenco più lungo di tutte le metriche disponibili per questo spazio dei nomi, che contiene altri dettagli sulle metriche in questo elenco più breve. Per informazioni sulla data più up-to, vedere l'elenco seguente. Il team Azure sta lavorando per aggiornare le tabelle nelle sezioni seguenti.
Importante
Non confondere le metriche in questa sezione con quelle legacy Latency elencate sotto Cognitive Services - HTTP Requests più avanti in questo articolo. La metrica legacy Latency non è pensata per Azure carichi di lavoro OpenAI e produce risultati fuorvianti quando viene usata per diagnosticare Azure latenza OpenAI. Per Azure monitoraggio della latenza OpenAI, usa Tempo di Risposta (AzureOpenAITimeToResponse), Tempo all'ultimo byte (AzureOpenAITTLTInMS), Tempo tra i token (AzureOpenAINormalizedTBTInMS), o Tempo normalizzato al primo byte (AzureOpenAINormalizedTTFTInMS). Per indicazioni sull'interpretazione di queste metriche, vedi Performance e latency.
- Azure richieste OpenAI
- Token attivi
- Gettoni di completamento generati
- Elaborato le ore di formazione fineTuned
- Token di Inferenza Processati
- Token di prompt processati
- Utilizzo gestito tramite provisioning V2
- Tasso di corrispondenza della cache del token prompt
- Tempo per la risposta
- Tempo tra i gettoni
- Tempo per l'ultimo byte
- Tempo normalizzato al primo byte
- Gettoni al secondo
È anche possibile monitorare le metriche di Sicurezza del contenuto usate da altri servizi correlati.
- Volume bloccato
- Volume dannoso rilevato
- Potenziale numero di utenti abusivi
- Evento del Sistema di Sicurezza
- Volume totale inviato per il controllo di sicurezza
Note
La metrica di utilizzo gestita tramite Provisioned è ora obsoleta e non è più raccomandata. Questa metrica viene sostituita dalla metrica Utilizzo gestito con provisioning V2 . I token al secondo, il tempo di risposta e il tempo tra i token non sono attualmente disponibili per le distribuzioni Standard.
Riferimento rapido: metriche chiave per caso d'uso
Usa questa tabella per trovare la metrica giusta per un obiettivo di monitoraggio specifico. Per indicazioni end-to-end sull'interpretazione di queste metriche, vedi Performance e latency.
| Voglio monitorare... | Usa questa metrica | Nome API REST |
|---|---|---|
| Tempo di risposta complessivo | Tempo per l'ultimo byte | AzureOpenAITTLTInMS |
| Risposta al primo token (streaming) | Tempo per la risposta | AzureOpenAITimeToResponse |
| Velocità di generazione dei token | Tempo tra i gettoni | AzureOpenAINormalizedTBTInMS |
| Efficienza del primo token normalizzata in base alla dimensione del prompt | Tempo normalizzato al primo byte | AzureOpenAINormalizedTTFTInMS |
| Volume di token di output per richiesta | Gettoni di completamento generati | GeneratedTokens |
| Volume di token di input per richiesta | Token di prompt processati | ProcessedPromptTokens |
| Utilizzo della capacità PTU | Utilizzo gestito tramite provisioning V2 | AzureOpenAIProvisionedManagedUtilizationV2 |
| Volume delle richieste ed errori | Azure richieste OpenAI | AzureOpenAIRequests |
Tip
Abbina sempre una metrica di latenza a una metrica di conteggio dei token. Un aumento della latenza senza un corrispondente aumento del token potrebbe indicare un problema reale. Un aumento di latenza con un aumento proporzionale del token è un comportamento atteso.
Warning
Le metriche sotto Cognitive Services - HTTP Requests più avanti in questo articolo sono metriche legacy dei Cognitive Services e non sono progettate per carichi di lavoro Azure OpenAI. In particolare, la metrica Latency in quella categoria non è la stessa delle metriche di latenza di Azure OpenAI (tempo per rispondere, tempo per l'ultimo byte, tempo tra i token, tempo normalizzato fino al primo byte). L'uso della metrica legacy Latency per Azure risoluzione dei problemi OpenAI produce risultati fuorvianti. Utilizza invece le metriche Azure OpenAI elencate in questa sezione.
La tabella seguente elenca le metriche disponibili per Microsoft. CognitiveServices/tipo di risorsa account.
- Tutte le colonne potrebbero non essere presenti in ogni tabella.
- Alcune colonne potrebbero essere oltre l'area di visualizzazione della pagina. Seleziona Espandi tabella per visualizzare tutte le colonne disponibili.
Intestazioni di tabella
- Categoria - Il gruppo o classificazione delle metriche.
- Metric - Il nome visualizzato metrico così come appare nel portale Azure.
- Nome nell'API REST - Il nome della metrica come indicato nell'API REST.
- Unità - Unità di misura.
- Aggregazione - Il tipo di aggregazione predefinito. Valori validi: Media (Media), Minimo (Min), Massimo (Max), Totale (Somma), Conteggio.
- Dimensioni - Dimensioni disponibili per la metrica.
-
Granelli - del TempoIntervalli in cui la metrica viene campionata. Ad esempio,
PT1Mindica che la metrica viene campionata ogni minuto,PT30Mogni 30 minuti,PT1Hogni ora, e così via. - DS Export- Se la metrica è esportabile in Monitoraggio di Azure Logs tramite le impostazioni diagnostiche. Per informazioni sull'esportazione delle metriche, consulta Crea impostazioni diagnostiche in Monitoraggio di Azure.
Categoria: Azure OpenAI - Richieste HTTP
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Azure OpenAI Tasso di Disponibilità Percentuale di disponibilità con il seguente calcolo: (Chiamate totali - errori del server)/Chiamate totali. Gli errori del server includono qualsiasi risposta >HTTP =500. |
AzureOpenAIAvailabilityRate |
No | Percentuale | Minimo, Massimo, Medio |
ApiName, OperationName, Region, StreamTypeModelDeploymentName, , ModelNameModelVersion |
PT1M | No |
|
Azure Richieste OpenAI Numero di chiamate effettuate all'API OpenAI di Azure nel corso del tempo. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go. Per suddividere le richieste API, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName, ModelVersion, StatusCode (successo, client errors, errori del server), IsSpillover per le informazioni di spillover, ServiceTier, StreamType (richieste streaming vs non-streaming) e operazione. |
AzureOpenAIRequests |
No | Conteggio | Totale (somma) |
ApiName, OperationName, , Region, StreamTypeModelDeploymentName, ModelNameModelVersionStatusCode, IsSpilloverServiceTierRequestServiceTierResponse |
PT1M | Sì |
Categoria: Azure OpenAI - Latenza
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Tempo tra i gettoni Per le richieste di streaming; Tasso di generazione dei token modelli, misurato in millisecondi. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. |
AzureOpenAINormalizedTBTInMS |
No | Millisecondi | Massimo, Minimo, Medio |
Region, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse |
PT1M | Sì |
|
Tempo normalizzato al primo byte Per richieste di streaming e non streaming; Il tempo necessario perché il primo byte dei dati di risposta venga ricevuto dopo che la richiesta è stata effettuata dal modello, normalizzata dal token. Si applica a PTU, implementazioni gestite da PTU e Pay-as-you-go. |
AzureOpenAINormalizedTTFTInMS |
No | Millisecondi | Massimo, Minimo, Medio |
Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | Sì |
|
Tempo per la risposta Misura raccomandata di latenza (reattività) per le richieste di streaming. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. Calcolata come tempo impiegato affinché la prima risposta apparga dopo che un utente invia un prompt, misurato dal gateway API. Questo numero aumenta man mano che la dimensione del prompt aumenta e/o la dimensione dei colpi della cache si riduce. Per suddividere la metrica tempo-risposta, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName e ModelVersion. Nota: questa metrica è un'approssimazione, poiché la latenza misurata dipende fortemente da molteplici fattori, inclusi chiamate concorrenti e il modello complessivo di carico di lavoro. Inoltre, non tiene conto di eventuali latenze lato client che possano esistere tra il tuo client e l'endpoint API. Si prega di consultare il tuo logging per un monitoraggio ottimale della latenza. |
AzureOpenAITimeToResponse |
No | Millisecondi | Minimo, Massimo, Medio |
ApiName, OperationName, RegionStreamType, , ModelDeploymentName, ModelName, ModelVersion, ,StatusCode |
PT1M | Sì |
|
Gettoni al secondo Elenca la velocità di generazione per una data risposta del modello Azure OpenAI. Il totale dei token generati viene diviso per il tempo necessario per generarli, in secondi. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. |
AzureOpenAITokenPerSecond |
No | Conteggio | Massimo, Minimo, Medio |
Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | Sì |
|
Tempo per l'ultimo byte Per richieste di streaming e non streaming; Il tempo impiega perché l'ultimo byte dei dati di risposta venga ricevuto dopo che la richiesta è stata effettuata dal modello. Si applica a PTU, implementazioni gestite da PTU e Pay-as-you-go. |
AzureOpenAITTLTInMS |
No | Millisecondi | Massimo, Minimo, Medio |
Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | Sì |
Categoria: Azure OpenAI - Utilizzo
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Token attivi Token totali meno token memorizzati nella cache nel corso del tempo. Si applica alle implementazioni gestite da PTU e PTU. Usa questa metrica per comprendere l'utilizzo basato su TPS o TPM per le PTU e confronta con i tuoi benchmark per il TPS target o TPM per i tuoi scenari. Per suddividere le richieste API, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName, e ModelVersion. |
ActiveTokens |
No | Conteggio | Minimo, Massimo, Medio, Totale (Somma) |
Region, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse |
PT1M | Sì |
|
Token di completamento audio Numero di token audio prompt generati (output) su un modello OpenAI. Si applica alle implementazioni gestite da PTU e modello Pay-as-you-go. |
AudioCompletionTokens |
No | Conteggio | Totale (somma) |
ModelDeploymentName, ModelName, ModelVersionRegion |
PT1M | Sì |
|
Gettoni di prompt audio Numero di token audio prompt elaborati (input) su un modello OpenAI. Si applica alle implementazioni gestite da PTU e modello Pay-as-you-go. |
AudioPromptTokens |
No | Conteggio | Totale (somma) |
ModelDeploymentName, ModelName, ModelVersionRegion |
PT1M | Sì |
|
Tasso di corrispondenza della cache del token prompt Percentuale di token prompt che arrivano nella cache. Si applica alle implementazioni gestite da PTU e PTU. |
AzureOpenAIContextTokensCacheMatchRate |
No | Percentuale | Minimo, Massimo, Medio |
Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | No |
|
Utilizzo gestionato tramite provisioning (deprecato) L'utilizzo % per un deployment gestito provvisoriamente, calcolato come (PTU consumate / PTU dispiegate) x 100. Quando l'utilizzo è maggiore o uguale a 100%, le chiamate vengono limitate e viene restituito il codice di errore 429. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName, ModelVersion e StreamType (Richieste streaming vs non streaming) |
AzureOpenAIProvisionedManagedUtilization |
No | Percentuale | Minimo, Massimo, Medio |
Region, StreamType, ModelDeploymentName, ModelNameModelVersion |
PT1M | No |
|
Utilizzo gestito tramite provisioning V2 L'utilizzo % per un deployment gestito provvisoriamente, calcolato come (PTU consumate / PTU dispiegate) x 100. Quando l'utilizzo è maggiore o uguale a 100%, le chiamate vengono limitate e viene restituito il codice di errore 429. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName, ModelVersion e StreamType (Richieste streaming vs non streaming) |
AzureOpenAIProvisionedManagedUtilizationV2 |
No | Percentuale | Minimo, Massimo, Medio |
Region, StreamType, ModelDeploymentName, ModelNameModelVersion |
PT1M | No |
|
Elaborato le ore di formazione fineTuned Numero di ore di addestramento elaborate su un modello OpenAI fineTuned |
FineTunedTrainingHours |
No | Conteggio | Totale (somma) |
ApiName, ModelDeploymentName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Gettoni di completamento generati Numero di token generati (output) da un modello OpenAI. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName e ModelName. |
GeneratedTokens |
No | Conteggio | Totale (somma) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, RegionModelVersion |
PT1M | Sì |
|
Token di prompt processati Numero di token di prompt elaborati (input) su un modello OpenAI. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName e ModelName. |
ProcessedPromptTokens |
No | Conteggio | Totale (somma) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, RegionModelVersion |
PT1M | Sì |
|
Secondi API in tempo reale utilizzati RealtimeAPI numero di secondi utilizzati |
RealtimeUsageTime |
No | Conteggio | Totale (somma) |
Region, ModelDeploymentName |
PT1M | Sì |
|
Token di Inferenza Processati Numero di token di inferenza elaborati su un modello OpenAI. Calcolati come token prompt (input) più token generati (output). Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName e ModelName. |
TokenTransaction |
No | Conteggio | Totale (somma) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, RegionModelVersion |
PT1M | Sì |
Categoria: Servizi cognitivi - Richieste HTTP
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
| Chiamate bloccate Numero di chiamate che hanno superato il limite di tasso o quota. Non usare per Azure il servizio OpenAI. |
BlockedCalls |
No | Conteggio | Totale (somma) |
ApiName, OperationName, RegionRatelimitKey |
PT1M | Sì |
|
Errori del client Numero di chiamate con errore lato client (codice risposta HTTP 4xx). Non usare per Azure il servizio OpenAI. |
ClientErrors |
No | Conteggio | Totale (somma) |
ApiName, OperationName, RegionRatelimitKey |
PT1M | Sì |
|
Dati in entrata Dimensione dei dati in ingresso in byte. Non usare per Azure il servizio OpenAI. |
DataIn |
No | Bytes | Totale (somma) |
ApiName, OperationName, Region |
PT1M | Sì |
|
Dati in uscita Dimensione dei dati in uscita in byte. Non usare per Azure il servizio OpenAI. |
DataOut |
No | Bytes | Totale (somma) |
ApiName, OperationName, Region |
PT1M | Sì |
|
Latenza Latenza in millisecondi. Non usare per Azure il servizio OpenAI. |
Latency |
No | Millisecondi | Medio |
ApiName, OperationName, RegionRatelimitKey |
PT1M | Sì |
|
Ratelimit Il limite di velocità attuale della chiave di limite di velocità. Non usare per Azure il servizio OpenAI. |
Ratelimit |
No | Conteggio | Totale (somma) |
Region, RatelimitKey |
PT1M | Sì |
|
Errori del server Numero di chiamate con errore interno del servizio (codice risposta HTTP 5xx). Non usare per Azure il servizio OpenAI. |
ServerErrors |
No | Conteggio | Totale (somma) |
ApiName, OperationName, RegionRatelimitKey |
PT1M | Sì |
|
Chiamate riuscite Numero di chiamate riuscite. Non usare per Azure il servizio OpenAI. |
SuccessfulCalls |
No | Conteggio | Totale (somma) |
ApiName, OperationName, RegionRatelimitKey |
PT1M | Sì |
|
Totale chiamate Numero totale di chiamate. Non usare per Azure il servizio OpenAI. |
TotalCalls |
No | Conteggio | Totale (somma) |
ApiName, OperationName, RegionRatelimitKey |
PT1M | Sì |
|
Errori totali Numero totale di chiamate con risposta di errore (codice risposta HTTP 4xx o 5xx). Non usare per Azure il servizio OpenAI. |
TotalErrors |
No | Conteggio | Totale (somma) |
ApiName, OperationName, RegionRatelimitKey |
PT1M | Sì |
|
Total chiamate con token Numero totale di chiamate di token. |
TotalTokenCalls |
No | Conteggio | Totale (somma) |
ApiName, OperationName, Region |
PT1M | Sì |
Categoria: Servizi Cognitivi - SLI
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
AvailabilityRate Percentuale di disponibilità con il seguente calcolo: (Chiamate totali - errori del server)/Chiamate totali. Gli errori del server includono qualsiasi risposta >HTTP =500. Non usare per Azure il servizio OpenAI. |
SuccessRate |
No | Percentuale | Minimo, Massimo, Medio |
ApiName, OperationName, RegionRatelimitKey |
PT1M | No |
Categoria: Comprensione dei contenuti - Utilizzo
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Transazioni viso Numero di chiamate API effettuate al servizio Face |
FaceApiTransactions |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Minuti audio elaborati Minuti di audio elaborati |
ProcessedAudioMinutes |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Pagine elaborate Numero di pagine di documento elaborate |
ProcessedDocumentPages |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Immagini elaborate Numero di immagini elaborate |
ProcessedImageCount |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Minuti video processati Minuti di video elaborati |
ProcessedVideoMinutes |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Token Numero di token consumati |
Tokens |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
Categoria: ContenutiSicurezza - Rischi e Sicurezza
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Volume dannoso rilevato Numero di chiamate effettuate ad Azure OpenAI API e rilevate come dannose (sia modello a blocchi che modalità annotazione) tramite filtro di contenuto applicato nel tempo. Puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName e TextType. |
RAIHarmfulRequests |
No | Conteggio | Totale (somma) |
Region, ModelDeploymentName, ModelNameModelVersion, , ApiName, TextType, Category, ,Severity |
PT1M | Sì |
|
Volume bloccato Numero di chiamate effettuate a Azure OpenAI API e rifiutate da un filtro di contenuto applicato nel corso del tempo. Puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName e TextType. |
RAIRejectedRequests |
No | Conteggio | Totale (somma) |
Region, ModelDeploymentName, ModelName, ModelVersionApiName, , TextTypeCategory |
PT1M | Sì |
|
Evento del Sistema di Sicurezza Evento di sistema per il monitoraggio dei rischi e della sicurezza. Puoi aggiungere un filtro o applicare la suddivisione per la seguente dimensione: EventType. |
RAISystemEvent |
No | Conteggio | Medio |
Region, EventType |
PT1M | Sì |
|
Volume totale inviato per il controllo di sicurezza Numero di chiamate effettuate all'API OpenAI di Azure e rilevate dal filtro di contenuto applicato nel corso del tempo. Puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName. |
RAITotalRequests |
No | Conteggio | Totale (somma) |
Region, ModelDeploymentName, ModelName, ModelVersionApiName |
PT1M | Sì |
Categoria: Contenuto Sicurezza - Utilizzo
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Conteggio delle chiamate per la moderazione delle immagini Numero di richieste di moderazione delle immagini. |
ContentSafetyImageAnalyzeRequestCount |
No | Conteggio | Totale (somma) | ApiVersion |
PT1M | Sì |
|
Conteggio delle chiamate per la moderazione dei testi Numero di richieste di moderazione dei testi. |
ContentSafetyTextAnalyzeRequestCount |
No | Conteggio | Totale (somma) | ApiVersion |
PT1M | Sì |
Categoria: Lingua - Lavori
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Durata del lavoro (Anteprima) Nota: questo valore dipende fortemente dalla dimensione dell'input, dal numero di documenti e dalla complessità del compito. Questo è un valore aggregato per tutte le attività del lavoro. |
JobDuration |
No | Millisecondi | Minimo, Massimo, Medio |
JobStatus, JobType |
PT1M | Sì |
Categoria: Modelli - Richieste HTTP
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Tasso di disponibilità dei modelli Percentuale di disponibilità con il seguente calcolo: (Chiamate totali - errori del server)/Chiamate totali. Gli errori del server includono qualsiasi risposta >HTTP =500. |
ModelAvailabilityRate |
No | Percentuale | Minimo, Massimo, Medio |
Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | No |
|
Richieste di modello Numero di chiamate effettuate all'API del modello nel corso del tempo. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go. |
ModelRequests |
No | Conteggio | Totale (somma) |
ApiName, OperationName, , Region, StreamTypeModelDeploymentName, ModelNameModelVersionStatusCode, IsSpilloverServiceTierRequestServiceTierResponse |
PT1M | Sì |
Categoria: Modelli - Latenza
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Tempo tra i gettoni Tasso di generazione dei token modelli, misurato in millisecondi. Si applica alle implementazioni gestite da PTU e PTU. Per le richieste non in streaming, questo valore è una stima. |
NormalizedTimeBetweenTokens |
No | Millisecondi | Massimo, Minimo, Medio |
ApiName, OperationName, Region, StreamTypeModelDeploymentName, , ModelNameModelVersion |
PT1M | Sì |
|
Tempo normalizzato al primo byte Il tempo necessario per ricevere il primo byte dei dati di risposta dopo che la richiesta è stata effettuata dal modello, normalizzata dal token. Si applica a PTU, implementazioni gestite da PTU e Pay-as-you-go. Per le richieste non in streaming, questo valore è una stima. |
NormalizedTimeToFirstToken |
No | Millisecondi | Massimo, Minimo, Medio |
ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, , ServiceTierRequestServiceTierResponse |
PT1M | Sì |
|
Tempo per l'ultimo byte Il tempo necessario per ricevere l'ultimo byte dei dati di risposta dopo che la richiesta è stata effettuata dal modello. Si applica a PTU, implementazioni gestite da PTU e Pay-as-you-go. Per le richieste non in streaming, questo valore è una stima. |
TimeToLastByte |
No | Millisecondi | Massimo, Minimo, Medio |
ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, , ServiceTierRequestServiceTierResponse |
PT1M | Sì |
|
Tempo per la risposta Misura consigliata di latenza (reattività). Si applica alle implementazioni gestite da PTU e PTU. Calcolata come tempo impiegato affinché la prima risposta apparga dopo che un utente invia un prompt, misurato dal gateway API. Questo numero aumenta man mano che la dimensione del prompt aumenta e/o la dimensione dei colpi della cache si riduce. Per suddividere la metrica tempo-risposta, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName e ModelVersion. Nota: questa metrica è un'approssimazione, poiché la latenza misurata dipende fortemente da molteplici fattori, inclusi chiamate concorrenti e il modello complessivo di carico di lavoro. Inoltre, non tiene conto di eventuali latenze lato client che possano esistere tra il tuo client e l'endpoint API. Per le richieste non in streaming, questo valore è una stima. Si prega di consultare il tuo logging per un monitoraggio ottimale della latenza. |
TimeToResponse |
No | Millisecondi | Minimo, Massimo, Medio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, StatusCode, ServiceTierRequest, ServiceTierResponse |
PT1M | Sì |
|
Gettoni al secondo Elenca la velocità di generazione per una data risposta del modello. Il totale dei token generati viene diviso per il tempo necessario per generarli, in secondi. Si applica alle implementazioni gestite da PTU e PTU. Per le richieste non in streaming, questo valore è una stima. |
TokensPerSecond |
No | Conteggio | Massimo, Minimo, Medio |
ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, , ServiceTierRequestServiceTierResponse |
PT1M | Sì |
Categoria: Modelli - Utilizzo
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Pagine con annotazioni Numero totale di pagine elaborate con annotazioni. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go. |
AnnotatedPages |
No | Conteggio | Totale (somma) |
ApiName, Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | Sì |
|
Token di ingresso audio Numero di token audio prompt elaborati (input) su un modello OpenAI. Si applica alle implementazioni di modelli gestiti da PTU. |
AudioInputTokens |
No | Conteggio | Totale (somma) |
ModelDeploymentName, ModelName, ModelVersionRegion |
PT1M | Sì |
|
Token di uscita audio Numero di token audio prompt generati (output) su un modello OpenAI. Si applica alle implementazioni di modelli gestiti da PTU. |
AudioOutputTokens |
No | Conteggio | Totale (somma) |
ModelDeploymentName, ModelName, ModelVersionRegion |
PT1M | Sì |
|
Token prompt letti dalla cache Numero totale di token letti dalla cache. Si applica alle implementazioni di modelli Anthropic. Emerso nella sezione di utilizzo delle risposte come cache_read_input_tokens |
cacheReadInputTokens |
No | Conteggio | Totale (somma) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersionContextLength |
PT1M | Sì |
|
Token prompt scritti nella cache (TTL di 1 ora) Il numero di token prompt usati per creare l'ingresso di 1 ora. Si applica alle implementazioni di modelli Anthropic. Emerso nella sezione di utilizzo delle risposte come cache_creation.ephemeral_1h_input_tokens |
ephemeral1hInputTokens |
No | Conteggio | Totale (somma) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersionContextLength |
PT1M | Sì |
|
Token prompt scritti nella cache (TTL di 5 minuti) Il numero di token di prompt usati per creare l'inserimento della cache in 5 minuti. Si applica alle implementazioni di modelli Anthropic. Emerso nella sezione di utilizzo delle risposte come cache_creation.ephemeral_5m_input_tokens |
ephemeral5mInputTokens |
No | Conteggio | Totale (somma) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersionContextLength |
PT1M | Sì |
|
Immagini generate Numero totale di immagini generate. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go. |
GeneratedImages |
No | Conteggio | Totale (somma) |
ApiName, Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | Sì |
|
Token di input Numero di token prompt elaborati (input) su un modello. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go. |
InputTokens |
No | Conteggio | Totale (somma) |
ApiName, Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | Sì |
|
Token di uscita Numero di token generati (output) da un modello OpenAI. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go. |
OutputTokens |
No | Conteggio | Totale (somma) |
ApiName, Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | Sì |
|
Utilizzo assegnato L'utilizzo % per un deployment gestito provvisoriamente, calcolato come (PTU consumate / PTU dispiegate) x 100. Quando l'utilizzo è maggiore o uguale a 100%, le chiamate vengono limitate e viene restituito il codice di errore 429. |
ProvisionedUtilization |
No | Percentuale | Minimo, Massimo, Medio |
Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | No |
|
Totale pagine Numero totale di pagine elaborate. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go. |
TotalPages |
No | Conteggio | Totale (somma) |
ApiName, Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | Sì |
|
Totale token Numero di token di inferenza elaborati su un modello. Calcolati come token prompt (input) più token generati (output). Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go. |
TotalTokens |
No | Conteggio | Totale (somma) |
ApiName, Region, ModelDeploymentName, ModelNameModelVersion |
PT1M | Sì |
Categoria: Servizi di Voce - Utilizzo
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Secondi audio trascritti in batch Numero di secondi trascritti in batch |
AudioSecondsBatchTranscribed |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Secondi audio Sussurro in batch trascritto Numero di secondi trascritti nel sussurro batch |
AudioSecondsBatchWhisperTranscribed |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Secondi audio trascritti rapidamente Numero rapido di secondi trascritto |
AudioSecondsFastTranscribed |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Secondi audio Sussurro Veloce Trascritto Numero di secondi trascritti in un sussurro veloce |
AudioSecondsFastWhisperTranscribed |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Secondi audio trascritti Numero di secondi trascritti |
AudioSecondsTranscribed |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Secondi audio tradotti Numero di secondi tradotti |
AudioSecondsTranslated |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Modelli Avatar che ospitano i secondi Numero di secondi. |
AvatarModelHostingSeconds |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Secondi di Addestramento Modello Avatar Numero di secondi. |
AvatarModelTrainingSeconds |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Orari di conduzione del modello di discorso Numero di ore di conduzione del modello di discorso |
SpeechModelHostingHours |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Caratteri sintetizzati Numero di personaggi. |
SynthesizedCharacters |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Secondi Video Sintetizzati Numero di secondi sintetizzati |
VideoSecondsSynthesized |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Token di ingresso audio live vocale Numero di token di ingresso audio, esclusi quelli memorizzati nella cache. |
VoiceLiveAudioInputTokens |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Token di uscita audio live vocale Numero di token di uscita audio. |
VoiceLiveAudioOutputTokens |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Token audio audio in cache Voice Live Numero di token audio di ingresso memorizzati nella cache. |
VoiceLiveCachedAudioInputTokens |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Token di input di testo in cache Voice Live Numero di token di input di testo memorizzati nella cache. |
VoiceLiveCachedTextInputTokens |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Token di input vocale Live Text Numero di token di input testuale, escludendo quelli memorizzati nella cache. |
VoiceLiveTextInputTokens |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Token di uscita live text vocale Numero di token di output testuale. |
VoiceLiveTextOutputTokens |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Orari di conduzione dei modelli vocali Numero di ore. |
VoiceModelHostingHours |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Minuti di addestramento dei modelli vocali Numero di minuti. |
VoiceModelTrainingMinutes |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
Categoria: Servizi di traduzione - Utilizzo
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Caratteri del documento tradotti Numero di caratteri nella richiesta di traduzione del documento. |
DocumentCharactersTranslated |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Caratteri personalizzati del documento tradotti Numero di caratteri nella richiesta di traduzione di un documento personalizzato. |
DocumentCustomCharactersTranslated |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Caratteri di sincronizzazione del documento tradotti Numero di caratteri nella richiesta di traduzione del documento (sincrona). |
OneDocumentCharactersTranslated |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Identificazione Documenti Caratteri Personalizzati Tradotti Numero di caratteri nella richiesta di traduzione di documento personalizzato (sincrona). |
OneDocumentCustomCharactersTranslated |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Caratteri di testo tradotti Numero di caratteri nella richiesta di traduzione del testo in arrivo. |
TextCharactersTranslated |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Caratteri personalizzati di testo tradotti Numero di caratteri nella richiesta di traduzione di testo personalizzata in arrivo. |
TextCustomCharactersTranslated |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Caratteri addestrati al testo Numero di caratteri addestrati usando la traduzione del testo. |
TextTrainedCharacters |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Translator Pro App Secondi Numero di secondi di utilizzo dell'app Translator Pro. |
TranslatorProAppSeconds |
No | Seconds | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
Categoria: Uso
| Metrica | Nome nell'API REST | Metriche avanzate della piattaforma | Unità | Aggregation | Dimensioni | Granularità temporale | Esportazione DS |
|---|---|---|---|---|---|---|---|
|
Visione artificiale Transazioni Numero di transazioni di Visione artificiale |
ComputerVisionTransactions |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Tempo di Allenamento Personalizzato per la Visione Tempo di addestramento Custom Vision |
CustomVisionTrainingTime |
No | Seconds | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Transazioni Visioni Personalizzate Numero di transazioni di previsione Custom Vision |
CustomVisionTransactions |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Immagini del volto addestrate Numero di immagini addestrate. 1.000 immagini addestrate per transazione. |
FaceImagesTrained |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Visi archiviati Numero di volti memorizzati, proporzionato giornalieramente. Il numero di volti memorizzati viene riportato quotidianamente. |
FacesStored |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Transazioni viso Numero di chiamate API effettuate al servizio Face |
FaceTransactions |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Immagini archiviate Numero di immagini Custom Vision memorizzate. |
ImagesStored |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Eventi analizzati Numero di eventi appresi. |
LearnedEvents |
No | Conteggio | Totale (somma) |
IsMatchBaseline, Mode, RunId |
PT1M | Sì |
|
Richieste di Intervento LUIS Numero di richieste di comprensione LUIS dal rapporto tra voce e intento |
LUISSpeechRequests |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Richieste di testo LUIS Numero di richieste di testo LUIS |
LUISTextRequests |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Premi corrispondenti Numero di ricompense abbinate. |
MatchedRewards |
No | Conteggio | Totale (somma) |
Mode, RunId |
PT1M | Sì |
|
Eventi Non Attivati Numero di eventi saltati. |
NonActivatedEvents |
No | Conteggio | Totale (somma) |
Mode, RunId |
PT1M | Sì |
|
Ricompense osservate Numero di ricompense osservate. |
ObservedRewards |
No | Conteggio | Totale (somma) |
Mode, RunId |
PT1M | Sì |
|
Caratteri elaborati Numero di caratteri elaborati da Strumento di lettura immersiva. |
ProcessedCharacters |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Cartelle Cliniche Processate Numero di cartelle cliniche processate |
ProcessedHealthTextRecords |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Immagini elaborate Numero di immagini elaborate |
ProcessedImages |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Pagine elaborate Numero di pagine elaborate |
ProcessedPages |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Record di testo processati Conteggio dei registri di testo. |
ProcessedTextRecords |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Registri di testo QA Numero di record di testo processati |
QuestionAnsweringTextRecords |
No | Conteggio | Totale (somma) |
ApiName, FeatureName, UsageChannelRegion |
PT1M | Sì |
|
Totale eventi Numero di eventi. |
TotalEvents |
No | Conteggio | Totale (somma) |
Mode, RunId |
PT1M | Sì |
|
Transazioni totali (Deprecate) Numero totale di transazioni. |
TotalTransactions |
No | Conteggio | Totale (somma) | <nessuna> | PT1M | Sì |
Dimensioni delle metriche
Per informazioni su quali siano le dimensioni delle metriche, vedi Metriche multidimensionali.
Questo servizio ha le seguenti dimensioni associate alle sue metriche.
- ApiName
- NomeCaratteristica
- ModelDeploymentName
- ModelName
- ModelVersion
- Nome dell'operazione
- Area geografica
- Codice di stato
- StreamType
- UsageChannel
Log delle risorse
Questa sezione elenca i tipi di log delle risorse che puoi raccogliere per questo servizio. La sezione prende ispirazione dall'elenco dei tipi di categorie all resource logs supportati in Monitoraggio di Azure.
Log di risorse supportati per Microsoft. CognitiveServices/account
| Categoria | Costi di esportazione | Tabella dei log | Supporta un piano di log di base | Supporta la trasformazione del tempo di ingestione | Interrogazioni di esempio |
|---|---|---|---|---|---|
| Audit | No |
AzureDiagnostics Log da più risorse Azure. |
No | No | |
| AzureOpenAIRequestUsage | Sì |
AzureDiagnostics Log da più risorse Azure. |
No | No | |
| ManagedNetworkEvent | Sì |
AzureDiagnostics Log da più risorse Azure. |
No | No | |
| Requestresponse | No |
AzureDiagnostics Log da più risorse Azure. |
No | No | |
| Traccia | No |
AzureDiagnostics Log da più risorse Azure. |
No | No |
Tabelle dei log di Monitoraggio di Azure
Questa sezione elenca le tabelle Monitoraggio di Azure Logs rilevanti per questo servizio, che sono disponibili per la query da parte di Log Analytics tramite Kusto queries. Le tabelle contengono dati di log delle risorse e possibilmente anche di più, a seconda di ciò che viene raccolto e instradato ad esse.
Azure OpenAI microsoft.cognitiveservices/accounts
Registro delle attività
La tabella collegata elenca le operazioni che possono essere registrate nel registro attività per questo servizio. Queste operazioni sono un sottoinsieme di tutte le possibili operazioni del fornitore di risorse nel registro attività.
Per ulteriori informazioni sullo schema delle voci del registro delle attività, vedi Schema del registro delle attività.
Contenuti correlati
- Per una descrizione del monitoraggio Azure OpenAI, vedere Monitor Azure OpenAI.
- Per informazioni dettagliate sul monitoraggio delle risorse di Azure, vedere Monitorare le risorse di Azure con Monitoraggio di Azure.