Referência de dados de monitoramento do Azure OpenAI

Este artigo contém todas as informações de referência de monitoramento para este serviço.

Para obter detalhes sobre os dados que você pode coletar para Azure OpenAI no Microsoft Foundry Models e como usá-los, consulte Monitor Azure OpenAI.

Métricas

Esta seção lista todas as métricas coletadas automaticamente pela plataforma para esse serviço. Essas métricas também fazem parte da lista global de métricas todas as plataformas suportadas em Azure Monitor.

Para informações sobre retenção de métricas, veja Azure Monitor Visão geral das métricas.

Métricas suportadas para a Microsoft. CognitiveServices/contas

Monitore as métricas mais importantes para Azure OpenAI. Posteriormente neste artigo, você encontrará uma lista mais longa de todas as métricas disponíveis para esse namespace, que contém mais detalhes sobre as métricas nesta lista mais curta. Consulte a lista a seguir para obter as informações mais up-to-date. A equipe de Azure está trabalhando na atualização das tabelas nas seções a seguir.

Importante

Não confunda as métricas desta seção com a métrica legada Latency listada em Serviços Cognitivos - HTTP Requests mais adiante neste artigo. A métrica legada Latency não foi projetada para cargas de trabalho Azure OpenAI e produz resultados enganosos quando usada para diagnosticar Azure latência OpenAI. Para Azure monitoramento de latência do OpenAI, use Tempo para Resposta (AzureOpenAITimeToResponse), Tempo até o Último Byte (AzureOpenAITTLTInMS), Tempo Entre Tokens (AzureOpenAINormalizedTBTInMS), ou Tempo Normalizado até o Primeiro Byte (AzureOpenAINormalizedTTFTInMS). Para orientações sobre como interpretar essas métricas, veja Desempenho e latência.

  • Azure solicitações openai
  • Tokens Ativos
  • Tokens de Conclusão Gerados
  • Processou horas de treinamento finamente ajustadas
  • Tokens de Inferência Processados
  • Tokens de Prompt Processados
  • Utilização gerenciada por provisões V2
  • Taxa de Correspondência do Cache de Token de Prompt
  • Hora de Responder
  • Tempo Entre as Fichas
  • Hora do Último Byte
  • Tempo Normalizado até o Primeiro Byte
  • Tokens por segundo

Você também pode monitorar as métricas de Segurança de Conteúdo que outros serviços relacionados usam.

  • Volume Bloqueado
  • Volume Nocivo Detectado
  • Potencial Número de Usuários Abusivos
  • Evento do Sistema de Segurança
  • Volume Total Enviado para Verificação de Segurança

Note

A métrica de Utilização gerenciada por provisões agora está obsoleta e não é mais recomendada. Essa métrica é substituída pela métrica de Utilização V2 gerenciada por provisionamento . Tokens por segundo, tempo de resposta e tempo entre tokens não estão disponíveis atualmente para implantações Standard.

Referência rápida: Métricas-chave por caso de uso

Use esta tabela para encontrar a métrica certa para um objetivo específico de monitoramento. Para orientações de ponta a ponta sobre como interpretar essas métricas, veja Desempenho e latência.

Quero monitorar... Use essa métrica Nome da API REST
Tempo de resposta total Hora do Último Byte AzureOpenAITTLTInMS
Resposta ao primeiro token (streaming) Hora de Responder AzureOpenAITimeToResponse
Velocidade de geração de tokens Tempo Entre as Fichas AzureOpenAINormalizedTBTInMS
Eficiência do primeiro token normalizada pelo tamanho do prompt Tempo Normalizado até o Primeiro Byte AzureOpenAINormalizedTTFTInMS
Volume de token de saída por requisição Tokens de Conclusão Gerados GeneratedTokens
Volume de token de entrada por requisição Tokens de Prompt Processados ProcessedPromptTokens
Utilização da capacidade da PTU Utilização gerenciada por provisões V2 AzureOpenAIProvisionedManagedUtilizationV2
Volume de solicitações e erros Azure solicitações openai AzureOpenAIRequests

Tip

Sempre pareie uma métrica de latência com uma métrica de contagem de tokens. Um aumento de latência sem o aumento correspondente do token pode indicar um problema real. Um aumento de latência com um aumento proporcional de token é um comportamento esperado.

Aviso

As métricas sob Serviços Cognitivos - HTTP Requests mais adiante neste artigo são métricas legadas de Serviços Cognitivos e não foram projetadas para cargas de trabalho Azure OpenAI. Em particular, a métrica Latency nessa categoria não é a mesma que as métricas de latência Azure OpenAI (Tempo até a resposta, tempo até o último byte, tempo entre tokens, tempo normalizado até o primeiro byte). Usar a métrica legada Latency para Azure solução de problemas da OpenAI produz resultados enganosos. Use as métricas do Azure OpenAI listadas nesta seção em vez disso.

A tabela a seguir lista as métricas disponíveis para a Microsoft. Serviços cognitivos/tipo de recurso de contas.

  • Nem todas as colunas podem estar presentes em todas as tabelas.
  • Algumas colunas podem estar além da área de visualização da página. Selecione Expandir tabela para ver todas as colunas disponíveis.

Títulos de tabela

  • Categoria - O grupo ou classificação de métricas.
  • Metric - O nome de exibição métrico conforme aparece no portal Azure.
  • Nome na API REST - O nome da métrica referido na API REST.
  • Unidade - Unidade de medida.
  • Agregação - O tipo padrão de agregação . Valores válidos: Média (Média), Mínimo (Mínimo), Máximo (Máximo), Total (Soma), Contagem.
  • Dimensões - Dimensões disponíveis para a métrica.
  • Grãos - do TempoIntervalos nos quais a métrica é amostrada. Por exemplo, PT1M indica que a métrica é amostrada a cada minuto, PT30M a cada 30 minutos, PT1H a cada hora, e assim por diante.
  • DS Export- Se a métrica pode ser exportada para Azure Monitor Logs via configurações de diagnóstico. Para informações sobre exportação de métricas, veja Criar configurações de diagnóstico em Azure Monitor.

Categoria: Azure OpenAI - Requisições HTTP

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Taxa de Disponibilidade do Azure OpenAI

Percentual de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem qualquer resposta >HTTP =500.
AzureOpenAIAvailabilityRate No Porcentagem Mínimo, Máximo, Médio ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion PT1M No
Azure Solicitações OpenAI

Número de chamadas feitas para a API do Azure OpenAI ao longo do tempo. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go. Para detalhar as solicitações da API, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion, StatusCode (bem-sucedido, erros do cliente, erros do servidor), IsSpillover para informações de spillover, ServiceTier, StreamType (requisições de streaming vs não streaming) e operação.
AzureOpenAIRequests No Count Soma (Total) ApiName, , , , , , OperationNameRegionStreamTypeModelDeploymentNameModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse PT1M Yes

Categoria: Azure OpenAI - Latência

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Tempo Entre os Tokens

Para pedidos de streaming; taxa de geração de tokens de modelo, medida em milissegundos. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go.
AzureOpenAINormalizedTBTInMS No MilliSeconds Máximo, Mínimo, Médio Region, ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse PT1M Yes
Tempo Normalizado até o Primeiro Byte

Para solicitações de streaming e não streaming; O tempo leva para o primeiro byte dos dados de resposta ser recebido após a solicitação ser feita pelo modelo, normalizada pelo token. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go.
AzureOpenAINormalizedTTFTInMS No MilliSeconds Máximo, Mínimo, Médio Region, ModelDeploymentName, , ModelNameModelVersion PT1M Yes
Hora de Responder

Medida recomendada de latência (responsividade) para requisições de streaming. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Calculado como o tempo levado para a primeira resposta aparecer após o usuário enviar um prompt, conforme medido pelo gateway da API. Esse número aumenta conforme o tamanho do prompt aumenta e/ou o tamanho do hit do cache diminui. Para detalhar a métrica de tempo até resposta, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion.

Nota: essa métrica é uma aproximação, pois a latência medida depende fortemente de múltiplos fatores, incluindo chamadas concorrentes e padrão geral de carga de trabalho. Além disso, ele não leva em conta qualquer latência do lado do cliente que possa existir entre seu cliente e o endpoint da API. Por favor, consulte seu próprio registro para monitorar a latência ideal.
AzureOpenAITimeToResponse No MilliSeconds Mínimo, Máximo, Médio ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, , StatusCode PT1M Yes
Tokens por Segundo

Enumera a velocidade de geração para uma resposta dada do modelo Azure OpenAI. O total de tokens gerados é dividido pelo tempo para gerar os tokens, em segundos. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go.
AzureOpenAITokenPerSecond No Count Máximo, Mínimo, Médio Region, ModelDeploymentName, , ModelNameModelVersion PT1M Yes
Hora do Último Byte

Para solicitações de streaming e não streaming; O tempo que leva para o último byte dos dados de resposta ser recebido após a requisição ser feita pelo modelo. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go.
AzureOpenAITTLTInMS No MilliSeconds Máximo, Mínimo, Médio Region, ModelDeploymentName, , ModelNameModelVersion PT1M Yes

Categoria: Azure OpenAI - Uso

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Tokens ativos

Total de tokens menos tokens armazenados em cache ao longo de um período de tempo. Aplica-se a implantações gerenciadas pela PTU e PTU. Use essa métrica para entender sua utilização baseada em TPS ou TPM para PTUs e compare com seus benchmarks para TPS ou TPM alvo para seus cenários. Para detalhar as requisições da API, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion.
ActiveTokens No Count Mínimo, Máximo, Média, Total (Soma) Region, ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse PT1M Yes
Tokens de Conclusão de Áudio

Número de tokens de prompt de áudio gerados (saída) em um modelo OpenAI. Vale para implantações gerenciadas por PTU e modelos Pay-as-you-go.
AudioCompletionTokens No Count Soma (Total) ModelDeploymentName, ModelName, , ModelVersionRegion PT1M Yes
Tokens de Prompt de Áudio

Número de tokens de prompt de áudio processados (entrada) em um modelo OpenAI. Vale para implantações gerenciadas por PTU e modelos Pay-as-you-go.
AudioPromptTokens No Count Soma (Total) ModelDeploymentName, ModelName, , ModelVersionRegion PT1M Yes
Taxa de Correspondência do Cache de Token de Prompt

Porcentagem de tokens de prompt que entram no cache. Aplica-se a implantações gerenciadas pela PTU e PTU.
AzureOpenAIContextTokensCacheMatchRate No Porcentagem Mínimo, Máximo, Médio Region, ModelDeploymentName, , ModelNameModelVersion PT1M No
Utilização gerenciada por provisionamento (obsoleta)

Utilização % para uma implantação gerenciada com provisonsões, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 retornado. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion e StreamType (Solicitações de streaming vs não-streaming)
AzureOpenAIProvisionedManagedUtilization No Porcentagem Mínimo, Máximo, Médio Region, StreamType, ModelDeploymentName, , ModelNameModelVersion PT1M No
Utilização gerenciada por provisões V2

Utilização % para uma implantação gerenciada com provisonsões, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 retornado. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion e StreamType (Solicitações de streaming vs não-streaming)
AzureOpenAIProvisionedManagedUtilizationV2 No Porcentagem Mínimo, Máximo, Médio Region, StreamType, ModelDeploymentName, , ModelNameModelVersion PT1M No
Processou horas de treinamento finamente ajustadas

Número de horas de treinamento processadas em um modelo OpenAI FineTuned
FineTunedTrainingHours No Count Soma (Total) ApiName, ModelDeploymentName, FeatureName, , UsageChannelRegion PT1M Yes
Tokens de Conclusão Gerados

Número de tokens gerados (output) a partir de um modelo OpenAI. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName e ModelName.
GeneratedTokens No Count Soma (Total) ApiName, ModelDeploymentName, FeatureName, UsageChannel, , RegionModelVersion PT1M Yes
Tokens de Prompt Processados

Número de tokens de prompt processados (entrada) em um modelo OpenAI. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName e ModelName.
ProcessedPromptTokens No Count Soma (Total) ApiName, ModelDeploymentName, FeatureName, UsageChannel, , RegionModelVersion PT1M Yes
Segundos de API em tempo real usados

Número de segundos usados no RealtimeAPI
RealtimeUsageTime No Count Soma (Total) Region, ModelDeploymentName PT1M Yes
Tokens de Inferência Processados

Número de tokens de inferência processados em um modelo OpenAI. Calculado como tokens de prompt (entrada) mais tokens gerados (saída). Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName e ModelName.
TokenTransaction No Count Soma (Total) ApiName, ModelDeploymentName, FeatureName, UsageChannel, , RegionModelVersion PT1M Yes

Categoria: Serviços Cognitivos - Solicitações HTTP

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Chamadas bloqueadas

Número de chamadas que excederam o limite de taxa ou cota. Não use para o serviço OpenAI do Azure.
BlockedCalls No Count Soma (Total) ApiName, OperationName, , RegionRatelimitKey PT1M Yes
Erros do cliente

Número de chamadas com erro do lado do cliente (código de resposta HTTP 4xx). Não use para o serviço OpenAI do Azure.
ClientErrors No Count Soma (Total) ApiName, OperationName, , RegionRatelimitKey PT1M Yes
Entrada de dados

Tamanho dos dados recebidos em bytes. Não use para o serviço OpenAI do Azure.
DataIn No Bytes Soma (Total) ApiName, , OperationNameRegion PT1M Yes
Saída de dados

Tamanho dos dados de saída em bytes. Não use para o serviço OpenAI do Azure.
DataOut No Bytes Soma (Total) ApiName, , OperationNameRegion PT1M Yes
Latência

Latência em milissegundos. Não use para o serviço OpenAI do Azure.
Latency No MilliSeconds Mediana ApiName, OperationName, , RegionRatelimitKey PT1M Yes
Limite de taxa

O limite de taxa atual da chave de limite. Não use para o serviço OpenAI do Azure.
Ratelimit No Count Soma (Total) Region, RatelimitKey PT1M Yes
Erros do Servidor

Número de chamadas com erro interno do serviço (código de resposta HTTP 5xx). Não use para o serviço OpenAI do Azure.
ServerErrors No Count Soma (Total) ApiName, OperationName, , RegionRatelimitKey PT1M Yes
Chamadas bem-sucedidas

Número de chamadas bem-sucedidas. Não use para o serviço OpenAI do Azure.
SuccessfulCalls No Count Soma (Total) ApiName, OperationName, , RegionRatelimitKey PT1M Yes
Total de chamadas

Número total de ligações. Não use para o serviço OpenAI do Azure.
TotalCalls No Count Soma (Total) ApiName, OperationName, , RegionRatelimitKey PT1M Yes
Total de Erros

Número total de chamadas com resposta de erro (código de resposta HTTP 4xx ou 5xx). Não use para o serviço OpenAI do Azure.
TotalErrors No Count Soma (Total) ApiName, OperationName, , RegionRatelimitKey PT1M Yes
Total de Chamadas de Token

Número total de chamadas de token.
TotalTokenCalls No Count Soma (Total) ApiName, , OperationNameRegion PT1M Yes

Categoria: Serviços Cognitivos - SLI

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Taxa de disponibilidade

Percentual de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem qualquer resposta >HTTP =500. Não use para o serviço OpenAI do Azure.
SuccessRate No Porcentagem Mínimo, Máximo, Médio ApiName, OperationName, , RegionRatelimitKey PT1M No

Categoria: Compreensão de Conteúdo - Uso

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Transações Face-a-Face

Número de chamadas API feitas para o serviço Face
FaceApiTransactions No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Minutos de Áudio Processados

Minutos de áudio processados
ProcessedAudioMinutes No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Páginas processadas

Número de páginas de documento processadas
ProcessedDocumentPages No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Imagens processadas

Número de imagens processadas
ProcessedImageCount No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Minutos de Vídeo Processados

Minutos de vídeo processados
ProcessedVideoMinutes No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Tokens

Número de tokens consumidos
Tokens No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes

Categoria: ConteúdoSegurança - Riscos e Segurança

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Volume Nocivo Detectado

Número de chamadas feitas para a API OpenAI do Azure e detectadas como prejudiciais (tanto modelo em bloco quanto em modo de anotação) pelo filtro de conteúdo aplicado ao longo do tempo. Você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e TextType.
RAIHarmfulRequests No Count Soma (Total) Region, ModelDeploymentName, ModelName, ModelVersion, ApiName, TextType, Category, , Severity PT1M Yes
Volume bloqueado

Número de chamadas feitas para a API OpenAI do Azure e rejeitadas pelo filtro de conteúdo aplicado ao longo do tempo. Você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e TextType.
RAIRejectedRequests No Count Soma (Total) Region, ModelDeploymentName, ModelName, ModelVersion, , ApiName, TextType, Category PT1M Yes
Evento do Sistema de Segurança

Evento do sistema para monitoramento de riscos e segurança. Você pode adicionar um filtro ou aplicar divisão pela seguinte dimensão: EventType.
RAISystemEvent No Count Mediana Region, EventType PT1M Yes
Volume Total Enviado para Verificação de Segurança

Número de chamadas feitas para a API OpenAI do Azure e detectadas pelo filtro de conteúdo aplicado ao longo do tempo. Você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName.
RAITotalRequests No Count Soma (Total) Region, ModelDeploymentName, ModelName, , ModelVersionApiName PT1M Yes

Categoria: Conteúdo Segurança - Uso

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Contagem de Chamadas para Moderação de Imagens

Número de pedidos de moderação de imagens.
ContentSafetyImageAnalyzeRequestCount No Count Soma (Total) ApiVersion PT1M Yes
Contagem de Chamadas para Moderação de Mensagens

Número de pedidos de moderação de texto.
ContentSafetyTextAnalyzeRequestCount No Count Soma (Total) ApiVersion PT1M Yes

Categoria: Idioma - Empregos

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Duração do Trabalho (Prévia)

Nota: esse valor depende fortemente do tamanho da entrada, número de documentos e complexidade da tarefa. Esse é um valor agregado para todas as tarefas do cargo.
JobDuration No MilliSeconds Mínimo, Máximo, Médio JobStatus, JobType PT1M Yes

Categoria: Modelos - Solicitações HTTP

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Taxa de Disponibilidade de Modelos

Percentual de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem qualquer resposta >HTTP =500.
ModelAvailabilityRate No Porcentagem Mínimo, Máximo, Médio Region, ModelDeploymentName, , ModelNameModelVersion PT1M No
Solicitações de modelo

Número de chamadas feitas para a API do modelo ao longo do tempo. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go.
ModelRequests No Count Soma (Total) ApiName, , , , , , OperationNameRegionStreamTypeModelDeploymentNameModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse PT1M Yes

Categoria: Modelos - Latência

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Tempo Entre as Fichas

Taxa de geração de tokens de modelo, medida em milissegundos. Aplica-se a implantações gerenciadas pela PTU e PTU. Para requisições não em streaming, esse valor é uma estimativa.
NormalizedTimeBetweenTokens No MilliSeconds Máximo, Mínimo, Médio ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion PT1M Yes
Tempo Normalizado até o Primeiro Byte

Tempo que leva para o primeiro byte dos dados de resposta ser recebido após a requisição ser feita pelo modelo, normalizada pelo token. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para requisições não em streaming, esse valor é uma estimativa.
NormalizedTimeToFirstToken No MilliSeconds Máximo, Mínimo, Médio ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse PT1M Yes
Hora do Último Byte

O tempo que leva para o último byte dos dados de resposta ser recebido após a requisição ser feita pelo modelo. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para requisições não em streaming, esse valor é uma estimativa.
TimeToLastByte No MilliSeconds Máximo, Mínimo, Médio ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse PT1M Yes
Hora de Responder

Medida recomendada de latência (responsividade). Aplica-se a implantações gerenciadas pela PTU e PTU. Calculado como o tempo levado para a primeira resposta aparecer após o usuário enviar um prompt, conforme medido pelo gateway da API. Esse número aumenta conforme o tamanho do prompt aumenta e/ou o tamanho do hit do cache diminui. Para detalhar a métrica de tempo até resposta, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion.

Nota: essa métrica é uma aproximação, pois a latência medida depende fortemente de múltiplos fatores, incluindo chamadas concorrentes e padrão geral de carga de trabalho. Além disso, ele não leva em conta qualquer latência do lado do cliente que possa existir entre seu cliente e o endpoint da API. Para requisições não em streaming, esse valor é uma estimativa. Por favor, consulte seu próprio registro para monitorar a latência ideal.
TimeToResponse No MilliSeconds Mínimo, Máximo, Médio ApiName, OperationName, Region, StreamType, ModelDeploymentName, , ModelName, ModelVersion, , StatusCode, ServiceTierRequest, ServiceTierResponse PT1M Yes
Tokens por Segundo

Enumera a velocidade de geração para uma dada resposta do modelo. O total de tokens gerados é dividido pelo tempo para gerar os tokens, em segundos. Aplica-se a implantações gerenciadas pela PTU e PTU. Para requisições não em streaming, esse valor é uma estimativa.
TokensPerSecond No Count Máximo, Mínimo, Médio ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse PT1M Yes

Categoria: Modelos - Uso

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Páginas anotadas

Número total de páginas processadas com anotações. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go.
AnnotatedPages No Count Soma (Total) ApiName, Region, ModelDeploymentName, , ModelNameModelVersion PT1M Yes
Tokens de Entrada de Áudio

Número de tokens de prompt de áudio processados (entrada) em um modelo OpenAI. Aplica-se a implantações de modelos gerenciados por PTU.
AudioInputTokens No Count Soma (Total) ModelDeploymentName, ModelName, , ModelVersionRegion PT1M Yes
Tokens de Saída de Áudio

Número de tokens de prompt de áudio gerados (saída) em um modelo OpenAI. Aplica-se a implantações de modelos gerenciados por PTU.
AudioOutputTokens No Count Soma (Total) ModelDeploymentName, ModelName, , ModelVersionRegion PT1M Yes
Tokens de prompt lidos do cache

Número total de tokens lidos do cache. Aplica-se a implantações de modelos Anthropic. Surgiu na seção de uso de resposta como cache_read_input_tokens
cacheReadInputTokens No Count Soma (Total) ApiName, Region, ModelDeploymentName, ModelName, , ModelVersionContextLength PT1M Yes
Tokens de prompt escritos no cache (TTL de 1 hora)

O número de tokens de prompt usados para criar a entrada de 1 hora. Aplica-se a implantações de modelos Anthropic. Surgiu na seção de uso de resposta como cache_creation.ephemeral_1h_input_tokens
ephemeral1hInputTokens No Count Soma (Total) ApiName, Region, ModelDeploymentName, ModelName, , ModelVersionContextLength PT1M Yes
Tokens de prompt escritos no cache (TTL de 5 minutos)

O número de tokens de prompt usados para criar a entrada de cache de 5 minutos. Aplica-se a implantações de modelos Anthropic. Surgiu na seção de uso de resposta como cache_creation.ephemeral_5m_input_tokens
ephemeral5mInputTokens No Count Soma (Total) ApiName, Region, ModelDeploymentName, ModelName, , ModelVersionContextLength PT1M Yes
Imagens geradas

Número total de imagens geradas. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go.
GeneratedImages No Count Soma (Total) ApiName, Region, ModelDeploymentName, , ModelNameModelVersion PT1M Yes
Tokens de entrada

Número de tokens de prompt processados (entrada) em um modelo. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go.
InputTokens No Count Soma (Total) ApiName, Region, ModelDeploymentName, , ModelNameModelVersion PT1M Yes
Tokens de saída

Número de tokens gerados (output) a partir de um modelo OpenAI. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go.
OutputTokens No Count Soma (Total) ApiName, Region, ModelDeploymentName, , ModelNameModelVersion PT1M Yes
Utilização provisionada

Utilização % para uma implantação gerenciada com provisonsões, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 retornado.
ProvisionedUtilization No Porcentagem Mínimo, Máximo, Médio Region, ModelDeploymentName, , ModelNameModelVersion PT1M No
Total de Páginas

Número total de páginas processadas. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go.
TotalPages No Count Soma (Total) ApiName, Region, ModelDeploymentName, , ModelNameModelVersion PT1M Yes
Total Tokens

Número de tokens de inferência processados em um modelo. Calculado como tokens de prompt (entrada) mais tokens gerados (saída). Vale para implantações de PTU, PTU-Managed e Pay-as-you-go.
TotalTokens No Count Soma (Total) ApiName, Region, ModelDeploymentName, , ModelNameModelVersion PT1M Yes

Categoria: Serviços de Voz - Uso

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Segundos de Áudio Transcritos em Lote

Número de segundos em lote transcritos
AudioSecondsBatchTranscribed No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Segundos de Áudio Sussurro em Batch Transcrito

Número de segundos transcritos por lote de sussurros
AudioSecondsBatchWhisperTranscribed No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Segundos de Áudio Transcritos Rápidos

Número rápido de segundos transcrito
AudioSecondsFastTranscribed No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Segundos de Áudio Sussurros Rápidos Transcreídos

Número de segundos transcrevidos em sussurros rápidos
AudioSecondsFastWhisperTranscribed No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Segundos de Áudio Transcritos

Número de segundos transcritos
AudioSecondsTranscribed No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Segundos de Áudio Traduzidos

Número de segundos traduzidos
AudioSecondsTranslated No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Modelos Avatar Apresentando Segundos

Número de segundos.
AvatarModelHostingSeconds No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Segundos de Treinamento do Modelo Avatar

Número de segundos.
AvatarModelTrainingSeconds No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Horas de Apresentação do Modelo de Discurso

Número de horas de apresentação do modelo de discurso
SpeechModelHostingHours No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Caracteres Sintetizados

Número de caracteres.
SynthesizedCharacters No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Segundos de Vídeo Sintetizados

Número de segundos sintetizados
VideoSecondsSynthesized No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Tokens de Entrada de Áudio ao Vivo por Voz

Número de tokens de entrada de áudio, excluindo tokens em cache.
VoiceLiveAudioInputTokens No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Tokens de Saída de Áudio ao Vivo por Voz

Número de tokens de saída de áudio.
VoiceLiveAudioOutputTokens No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Tokens de Áudio Cache Voice Live

Número de tokens de entrada de áudio em cache.
VoiceLiveCachedAudioInputTokens No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Tokens de Entrada de Texto em Cache Voice Live

Número de tokens de entrada de texto em cache.
VoiceLiveCachedTextInputTokens No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Tokens de Entrada de Texto ao Vivo por Voz

Número de tokens de entrada de texto, excluindo tokens em cache.
VoiceLiveTextInputTokens No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Tokens de Saída de Texto ao Vivo por Voz

Número de tokens de saída de texto.
VoiceLiveTextOutputTokens No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Horário de Apresentação de Modelos de Voz

Número de horas.
VoiceModelHostingHours No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Minutos de Treinamento de Modelos de Voz

Número de minutos.
VoiceModelTrainingMinutes No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes

Categoria: Serviços de Tradução - Uso

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Caracteres do Documento Traduzidos

Número de caracteres no pedido de tradução do documento.
DocumentCharactersTranslated No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Caracteres Personalizados do Documento Traduzidos

Número de caracteres em um pedido de tradução de documento personalizado.
DocumentCustomCharactersTranslated No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Caracteres de Sincronização de Documentos Traduzidos

Número de caracteres na solicitação de tradução de documentos (síncrona).
OneDocumentCharactersTranslated No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Sincronização de Documentos Caracteres Personalizados Traduzidos

Número de caracteres na solicitação de tradução personalizada de documentos (síncrona).
OneDocumentCustomCharactersTranslated No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Caracteres de Texto Traduzidos

Número de caracteres na solicitação de tradução de texto recebida.
TextCharactersTranslated No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Caracteres Personalizados de Texto Traduzidos

Número de caracteres na solicitação de tradução personalizada recebida.
TextCustomCharactersTranslated No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Caracteres treinados em texto

Número de caracteres treinados usando tradução de texto.
TextTrainedCharacters No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Segundo do aplicativo Translator Pro

Número de segundos de uso do aplicativo Translator Pro.
TranslatorProAppSeconds No Seconds Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes

Categoria: uso

Métrica Nome na API REST Métricas avançadas da plataforma Unidade Agregação Dimensões Intervalos de Tempo Exportação de DS
Pesquisa Visual Computacional Transações

Número de Transações de Pesquisa Visual Computacional
ComputerVisionTransactions No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Tempo de Treinamento Personalizado de Visão

Tempo de treinamento Custom Vision
CustomVisionTrainingTime No Seconds Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Transações Personalizadas com Visão

Número de transações de previsão Custom Vision
CustomVisionTransactions No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Imagens Faciais Treinadas

Número de imagens treinadas. 1.000 imagens treinadas por transação.
FaceImagesTrained No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Rostos armazenados

Número de rostos armazenados, proporcionalmente diário. O número de rostos armazenados é reportado diariamente.
FacesStored No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Transações Face-a-Face

Número de chamadas API feitas para o serviço Face
FaceTransactions No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Imagens armazenadas

Número de imagens Custom Vision armazenadas.
ImagesStored No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Eventos Aprendidos

Número de Eventos Aprendidos.
LearnedEvents No Count Soma (Total) IsMatchBaseline, , ModeRunId PT1M Yes
Pedidos de Fala do LUIS

Número de solicitações de compreensão de fala para intenção do LUIS
LUISSpeechRequests No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Solicitações de Texto LUIS

Número de solicitações de texto LUIS
LUISTextRequests No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Recompensas Correspondentes

Número de recompensas combinadas.
MatchedRewards No Count Soma (Total) Mode, RunId PT1M Yes
Eventos Não Ativados

Número de eventos pulados.
NonActivatedEvents No Count Soma (Total) Mode, RunId PT1M Yes
Recompensas observadas

Número de recompensas observadas.
ObservedRewards No Count Soma (Total) Mode, RunId PT1M Yes
Caracteres processados

Número de caracteres processados pelo Leitura Avançada.
ProcessedCharacters No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Registros de Texto de Saúde Processados

Número de registros de texto de saúde processados
ProcessedHealthTextRecords No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Imagens processadas

Número de imagens processadas
ProcessedImages No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Páginas processadas

Número de páginas processadas
ProcessedPages No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Registros de Texto Processados

Contagem de registros de texto.
ProcessedTextRecords No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Registros de Texto de QA

Número de registros de texto processados
QuestionAnsweringTextRecords No Count Soma (Total) ApiName, FeatureName, , UsageChannelRegion PT1M Yes
Total de eventos

Número de eventos.
TotalEvents No Count Soma (Total) Mode, RunId PT1M Yes
Transações Totais (Desempregadas)

Número total de transações.
TotalTransactions No Count Soma (Total) <nenhum> PT1M Yes

Dimensões métricas

Para informações sobre o que são dimensões métricas, veja Métricas multidimensionais.

Este serviço possui as seguintes dimensões associadas às suas métricas.

  • ApiName
  • NomeDaFuncionalidade
  • ModelDeploymentName
  • ModelName
  • ModelVersion
  • Nome da Operação
  • Região
  • CódigoDeStatus
  • StreamType
  • UsageChannel

Logs de recursos

Esta seção lista os tipos de registros de recursos que você pode coletar para esse serviço. A seção extrai da lista de tipos de categorias de logs todos suportados em Azure Monitor.

Logs de recursos suportados para a Microsoft. CognitiveServices/contas

Categoria Custos de exportação Tabela de log Suporta o plano básico de logs Suporta transformação no tempo de ingestão Consultas de exemplo
Audit No AzureDiagnostics

Logs de múltiplos recursos do Azure.

No No
AzureOpenAIRequestUsage Yes AzureDiagnostics

Logs de múltiplos recursos do Azure.

No No
ManagedNetworkEvent Yes AzureDiagnostics

Logs de múltiplos recursos do Azure.

No No
Requestresponse No AzureDiagnostics

Logs de múltiplos recursos do Azure.

No No
Rastrear No AzureDiagnostics

Logs de múltiplos recursos do Azure.

No No

Tabelas de Logs do Azure Monitor

Esta seção lista as tabelas de Azure Monitor Logs relevantes para este serviço, que estão disponíveis para consulta pelo Log Analytics usando consultas Kusto. As tabelas contêm dados de registros de recursos e possivelmente mais, dependendo do que é coletado e roteado para elas.

Azure OpenAI microsoft.cognitiveservices/accounts

Log de atividades

A tabela vinculada lista as operações que podem ser registradas no registro de atividades desse serviço. Essas operações são um subconjunto de todas as possíveis operações de provedores de recursos no registro de atividade.

Para mais informações sobre o esquema das entradas do registro de atividade, veja Esquema do Registro de Atividades.