Referência de dados de monitorização Azure OpenAI

Este artigo contém toda a informação de referência de monitorização para este serviço.

Para detalhes sobre os dados que pode recolher para Azure OpenAI em Microsoft Foundry Models e como os utilizar, veja Monitor Azure OpenAI.

Métricas

Esta secção lista todas as métricas de plataforma recolhidas automaticamente para este serviço. Estas métricas fazem também parte da lista global de métricas all da plataforma suportadas em Azure Monitor.

Para informações sobre retenção de métricas, consulte Azure Monitor Visão geral das métricas.

Métricas suportadas para a Microsoft. CognitiveServices/contas

Monitorize as métricas mais importantes para o Azure OpenAI. Mais adiante neste artigo, encontrará uma lista mais longa de todas as métricas disponíveis para este namespace, que contém mais detalhes sobre métricas nesta lista mais curta. Por favor, consulte a lista seguinte para as informações mais up-todatas. A equipa do Azure está a trabalhar na atualização das tabelas nas secções seguintes.

Important

Não confunda as métricas desta secção com a métrica legada Latency listada em Serviços Cognitivos - HTTP Requests mais adiante neste artigo. A métrica legada Latency não foi concebida para cargas de trabalho Azure OpenAI e produz resultados enganadores quando usada para diagnosticar latência Azure OpenAI. Para monitorização de latência Azure OpenAI, use Tempo até à Resposta (AzureOpenAITimeToResponse), Tempo até ao Último Byte (AzureOpenAITTLTInMS), Tempo Entre Tokens (AzureOpenAINormalizedTBTInMS), ou Tempo Normalizado até ao Primeiro Byte (AzureOpenAINormalizedTTFTInMS). Para orientações sobre a interpretação destas métricas, consulte Desempenho e latência.

  • Azure OpenAI Requests
  • Tokens Ativos
  • Tokens de Conclusão Gerados
  • Horas de treino processadas FinAjustadas
  • Tokens de Inferência Processados
  • Tokens de Prompt Processados
  • Utilização gerida por provisões V2
  • Taxa de Correspondência do Cache do Token de Prompt
  • Tempo para a Resposta
  • Tempo Entre Fichas
  • Tempo para o Último Byte
  • Tempo Normalizado até ao Primeiro Byte
  • Tokens por Segundo

Também pode monitorizar métricas de Segurança de Conteúdo que outros serviços relacionados utilizam.

  • Volume Bloqueado
  • Volume Nocivo Detetado
  • Potencial Número de Utilizadores Abusivos
  • Evento do Sistema de Segurança
  • Volume Total Enviado para Verificação de Segurança

Note

A métrica de Utilização Gerida por Provisões está agora obsoleta e já não é recomendada. Esta métrica é substituída pela métrica de Utilização V2 gerida por providência . Tokens por Segundo, Tempo de Resposta e Tempo Entre Tokens não estão atualmente disponíveis para implementações Standard.

Referência rápida: Métricas-chave por caso de uso

Use esta tabela para encontrar a métrica certa para um objetivo específico de monitorização. Para orientações de ponta a ponta sobre a interpretação destas métricas, consulte Desempenho e latência.

Quero monitorizar... Use esta métrica Nome da API REST
Tempo de resposta global Tempo para o Último Byte AzureOpenAITTLTInMS
Resposta ao primeiro token (streaming) Tempo para a Resposta AzureOpenAITimeToResponse
Velocidade de geração de tokens Tempo Entre Fichas AzureOpenAINormalizedTBTInMS
Eficiência do primeiro token normalizada pelo tamanho do prompt Tempo Normalizado até ao Primeiro Byte AzureOpenAINormalizedTTFTInMS
Volume de token de saída por pedido Tokens de Conclusão Gerados GeneratedTokens
Volume de token de entrada por pedido Tokens de Prompt Processados ProcessedPromptTokens
Utilização da capacidade da PTU Utilização gerida por provisões V2 AzureOpenAIProvisionedManagedUtilizationV2
Volume de pedidos e erros Azure OpenAI Requests AzureOpenAIRequests

Tip

Emparelhe sempre uma métrica de latência com uma métrica de contagem de tokens. Um aumento de latência sem um aumento correspondente do token pode indicar um problema real. Um aumento de latência com um aumento proporcional do token é um comportamento esperado.

Warning

As métricas em Serviços Cognitivos - HTTP Requests mais adiante neste artigo são métricas legadas de Serviços Cognitivos e não foram concebidas para cargas de trabalho Azure OpenAI. Em particular, a métrica Latency nessa categoria não é a mesma que as métricas de latência do Azure OpenAI (tempo até à resposta, tempo até ao último byte, tempo entre tokens, tempo normalizado até ao primeiro byte). Usar a métrica legada Latency para Azure resolução de problemas da OpenAI produz resultados enganadores. Use as métricas do Azure OpenAI listadas nesta secção.

A tabela seguinte lista as métricas disponíveis para a Microsoft. Serviços cognitivos/tipo de recurso de contas.

  • Todas as colunas podem não estar presentes em todas as tabelas.
  • Algumas colunas podem estar para além da área de visualização da página. Selecione Expandir tabela para ver todas as colunas disponíveis.

Cabeçalhos de tabela

  • Categoria - O grupo de métricas ou classificação.
  • Metric - O nome de visualização métrico tal como aparece no portal Azure.
  • Nome na API REST - O nome da métrica referido na API REST.
  • Unidade - Unidade de medida.
  • Agregação - O tipo padrão de agregação . Valores válidos: Média (Média), Mínimo (Mínimo), Máximo (Máximo), Total (Soma), Contagem.
  • Dimensões - Dimensões disponíveis para a métrica.
  • Grãos - do TempoIntervalos em que a métrica é amostrada. Por exemplo, PT1M indica que a métrica é amostrada a cada minuto, PT30M a cada 30 minutos, PT1H a cada hora, e assim sucessivamente.
  • DS Export- Se a métrica é exportável para Azure Monitor Logs através das definições de diagnóstico. Para informações sobre exportação de métricas, consulte Criar definições de diagnóstico em Azure Monitor.

Categoria: Azure OpenAI - Pedidos HTTP

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Azure OpenAI AvailabilityRate

Percentagem de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem quaisquer respostas >HTTP =500.
AzureOpenAIAvailabilityRate No Percentagem Mínimo, Máximo, Médio ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion PT1M No
Azure Pedidos OpenAI

Número de chamadas feitas para a API OpenAI do Azure ao longo do tempo. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go. Para detalhar os pedidos da API, pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion, StatusCode (sucesso, clientes erros, erros do servidor), IsSpillover para informação de spillover, ServiceTier, StreamType (pedidos de streaming vs não-streaming) e operação.
AzureOpenAIRequests No Count Total (Quantidade) ApiName, OperationName, RegionStreamType, , ModelDeploymentName, , ModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse PT1M Yes

Categoria: Azure OpenAI - Latência

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Tempo Entre Fichas

Para pedidos de streaming; taxa de geração de tokens de modelo, medida em milissegundos. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go.
AzureOpenAINormalizedTBTInMS No Milissegundos Máximo, Mínimo, Médio Region, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse PT1M Yes
Tempo Normalizado até ao Primeiro Byte

Para pedidos de streaming e não-streaming; O tempo que demora até o primeiro byte dos dados de resposta ser recebido após o pedido ser feito pelo modelo, normalizado pelo token. Aplica-se a implementações PTU, geridas por PTU e Pay-as-you-go.
AzureOpenAINormalizedTTFTInMS No Milissegundos Máximo, Mínimo, Médio Region, ModelDeploymentName, ModelName, ModelVersion PT1M Yes
Tempo para a Resposta

Medida recomendada de latência (responsividade) para pedidos de streaming. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. Calculado como o tempo necessário para a primeira resposta aparecer após o utilizador enviar um prompt, medido pelo gateway da API. Este número aumenta à medida que o tamanho do prompt aumenta e/ou diminui o tamanho das visualizações do cache. Para analisar a métrica de tempo até resposta, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion.

Nota: esta métrica é uma aproximação, pois a latência medida depende fortemente de múltiplos fatores, incluindo chamadas simultâneas e o padrão global de carga de trabalho. Além disso, não tem em conta qualquer latência do lado do cliente que possa existir entre o seu cliente e o endpoint da API. Por favor, consulte o seu próprio registo para um rastreio de latência otimizado.
AzureOpenAITimeToResponse No Milissegundos Mínimo, Máximo, Médio ApiName, OperationName, RegionStreamType, , ModelDeploymentName, ModelName, ModelVersion,StatusCode PT1M Yes
Tokens por Segundo

Enumera a velocidade de geração para a resposta de um dado modelo Azure OpenAI. O total de tokens gerados é dividido pelo tempo para gerar os tokens, em segundos. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go.
AzureOpenAITokenPerSecond No Count Máximo, Mínimo, Médio Region, ModelDeploymentName, ModelName, ModelVersion PT1M Yes
Tempo para o Último Byte

Para pedidos de streaming e não-streaming; O tempo que demora até o último byte dos dados de resposta ser recebido após o pedido ser feito pelo modelo. Aplica-se a implementações PTU, geridas por PTU e Pay-as-you-go.
AzureOpenAITTLTInMS No Milissegundos Máximo, Mínimo, Médio Region, ModelDeploymentName, ModelName, ModelVersion PT1M Yes

Categoria: Azure OpenAI - Utilização

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Tokens Ativos

Total de tokens menos tokens armazenados em cache ao longo de um período de tempo. Aplica-se a implantações PTU e geridas pela PTU. Use esta métrica para compreender a sua utilização baseada em TPS ou TPM para PTUs e compare com os seus benchmarks para TPS ou TPM alvo para os seus cenários. Para detalhar os pedidos da API, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion.
ActiveTokens No Count Mínimo, Máximo, Médio, Total (Soma) Region, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse PT1M Yes
Tokens de Conclusão de Áudio

Número de tokens de prompt de áudio gerados (output) num modelo OpenAI. Aplica-se a implementações gerenciadas por PTU e modelos Pay-as-you-go.
AudioCompletionTokens No Count Total (Quantidade) ModelDeploymentName, ModelName, ModelVersion, Region PT1M Yes
Tokens de Prompt de Áudio

Número de tokens de prompt áudio processados (entrada) num modelo OpenAI. Aplica-se a implementações gerenciadas por PTU e modelos Pay-as-you-go.
AudioPromptTokens No Count Total (Quantidade) ModelDeploymentName, ModelName, ModelVersion, Region PT1M Yes
Taxa de Correspondência do Cache do Token de Prompt

Percentagem de tokens de prompt que entram na cache. Aplica-se a implantações PTU e geridas pela PTU.
AzureOpenAIContextTokensCacheMatchRate No Percentagem Mínimo, Máximo, Médio Region, ModelDeploymentName, ModelName, ModelVersion PT1M No
Utilização gerida por provisionamento (obsoleta)

Utilização % para uma implantação gerida provisionalmente, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 é devolvido. Para detalhar esta métrica, pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion e StreamType (Pedidos de streaming vs não-streaming)
AzureOpenAIProvisionedManagedUtilization No Percentagem Mínimo, Máximo, Médio Region, StreamType, ModelDeploymentName, ModelName, ModelVersion PT1M No
Utilização gerida por provisões V2

Utilização % para uma implantação gerida provisionalmente, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 é devolvido. Para detalhar esta métrica, pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion e StreamType (Pedidos de streaming vs não-streaming)
AzureOpenAIProvisionedManagedUtilizationV2 No Percentagem Mínimo, Máximo, Médio Region, StreamType, ModelDeploymentName, ModelName, ModelVersion PT1M No
Horas de treino processadas FinAjustadas

Número de horas de treino processadas num modelo OpenAI FineTuned
FineTunedTrainingHours No Count Total (Quantidade) ApiName, ModelDeploymentName, FeatureName, UsageChannel, Region PT1M Yes
Tokens de Conclusão Gerados

Número de tokens gerados (output) a partir de um modelo OpenAI. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. Para detalhar esta métrica, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName e ModelName.
GeneratedTokens No Count Total (Quantidade) ApiName, ModelDeploymentName, FeatureName, UsageChannel, Region, ModelVersion PT1M Yes
Tokens de Prompt Processados

Número de tokens de prompt processados (entrada) num modelo OpenAI. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. Para detalhar esta métrica, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName e ModelName.
ProcessedPromptTokens No Count Total (Quantidade) ApiName, ModelDeploymentName, FeatureName, UsageChannel, Region, ModelVersion PT1M Yes
Segundos de API em tempo real utilizados

Número de segundos usados na RealtimeAPI
RealtimeUsageTime No Count Total (Quantidade) Region, ModelDeploymentName PT1M Yes
Tokens de Inferência Processados

Número de tokens de inferência processados num modelo OpenAI. Calculado como tokens de prompt (entrada) mais tokens gerados (output). Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. Para detalhar esta métrica, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName e ModelName.
TokenTransaction No Count Total (Quantidade) ApiName, ModelDeploymentName, FeatureName, UsageChannel, Region, ModelVersion PT1M Yes

Categoria: Serviços Cognitivos - Pedidos HTTP

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Chamadas bloqueadas

Número de chamadas que excederam o limite de taxa ou quota. Não use para o serviço Azure OpenAI.
BlockedCalls No Count Total (Quantidade) ApiName, OperationName, Region, RatelimitKey PT1M Yes
Erros do cliente

Número de chamadas com erro do lado do cliente (código de resposta HTTP 4xx). Não use para o serviço Azure OpenAI.
ClientErrors No Count Total (Quantidade) ApiName, OperationName, Region, RatelimitKey PT1M Yes
Dados de Entrada

Tamanho dos dados recebidos em bytes. Não use para o serviço Azure OpenAI.
DataIn No Bytes Total (Quantidade) ApiName, OperationName, Region PT1M Yes
Saída de dados

Tamanho dos dados de saída em bytes. Não use para o serviço Azure OpenAI.
DataOut No Bytes Total (Quantidade) ApiName, OperationName, Region PT1M Yes
Latência

Latência em milissegundos. Não use para o serviço Azure OpenAI.
Latency No Milissegundos Mediano ApiName, OperationName, Region, RatelimitKey PT1M Yes
Limite de taxa

O limite de taxa atual da chave de limite. Não use para o serviço Azure OpenAI.
Ratelimit No Count Total (Quantidade) Region, RatelimitKey PT1M Yes
Erros do servidor

Número de chamadas com erro interno do serviço (código de resposta HTTP 5xx). Não use para o serviço Azure OpenAI.
ServerErrors No Count Total (Quantidade) ApiName, OperationName, Region, RatelimitKey PT1M Yes
Chamadas bem-sucedidas

Número de chamadas bem-sucedidas. Não use para o serviço Azure OpenAI.
SuccessfulCalls No Count Total (Quantidade) ApiName, OperationName, Region, RatelimitKey PT1M Yes
Total de chamadas

Número total de chamadas. Não use para o serviço Azure OpenAI.
TotalCalls No Count Total (Quantidade) ApiName, OperationName, Region, RatelimitKey PT1M Yes
Total de erros

Número total de chamadas com resposta de erro (código de resposta HTTP 4xx ou 5xx). Não use para o serviço Azure OpenAI.
TotalErrors No Count Total (Quantidade) ApiName, OperationName, Region, RatelimitKey PT1M Yes
Total de Chamadas de Token

Número total de chamadas de token.
TotalTokenCalls No Count Total (Quantidade) ApiName, OperationName, Region PT1M Yes

Categoria: Serviços Cognitivos - SLI

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
DisponibilidadeTaxa

Percentagem de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem quaisquer respostas >HTTP =500. Não use para o serviço Azure OpenAI.
SuccessRate No Percentagem Mínimo, Máximo, Médio ApiName, OperationName, Region, RatelimitKey PT1M No

Categoria: Compreensão de Conteúdo - Utilização

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Transações de Face

Número de chamadas API feitas para o serviço Face
FaceApiTransactions No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Minutos de Áudio Processados

Minutos de áudio processados
ProcessedAudioMinutes No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Páginas Processadas

Número de páginas de documento processadas
ProcessedDocumentPages No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Imagens Processadas

Número de imagens processadas
ProcessedImageCount No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Minutos de Vídeo Processados

Minutos de vídeo processados
ProcessedVideoMinutes No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Tokens

Número de tokens consumidos
Tokens No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes

Categoria: ConteúdoSegurança - Riscos e Segurança

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Volume Nocivo Detetado

Número de chamadas feitas para a API OpenAI do Azure e detetadas como prejudiciais (tanto modelo de bloco como modo de anotação) pelo filtro de conteúdo aplicado ao longo do tempo. Pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e TextType.
RAIHarmfulRequests No Count Total (Quantidade) Region, ModelDeploymentName, ModelNameModelVersion, , ApiName, TextType, Category,Severity PT1M Yes
Volume Bloqueado

Número de chamadas feitas para a API OpenAI do Azure e rejeitadas pelo filtro de conteúdo aplicado ao longo do tempo. Pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e TextType.
RAIRejectedRequests No Count Total (Quantidade) Region, ModelDeploymentName, ModelName, ModelVersion, ApiName, TextType, Category PT1M Yes
Evento do Sistema de Segurança

Evento do sistema para monitorização de riscos e segurança. Pode adicionar um filtro ou aplicar divisão pela seguinte dimensão: EventType.
RAISystemEvent No Count Mediano Region, EventType PT1M Yes
Volume Total Enviado para Verificação de Segurança

Número de chamadas feitas para a API OpenAI do Azure e detetadas pelo filtro de conteúdo aplicado ao longo do tempo. Pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName.
RAITotalRequests No Count Total (Quantidade) Region, ModelDeploymentName, ModelName, ModelVersion, ApiName PT1M Yes

Categoria: Conteúdo Segurança - Utilização

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Contagem de Chamadas para Moderação de Imagem

Número de pedidos de moderação de imagens.
ContentSafetyImageAnalyzeRequestCount No Count Total (Quantidade) ApiVersion PT1M Yes
Contagem de Chamadas para Moderação de Mensagens

Número de chamadas para moderação de texto.
ContentSafetyTextAnalyzeRequestCount No Count Total (Quantidade) ApiVersion PT1M Yes

Categoria: Língua - Empregos

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Duração do Trabalho (Pré-visualização)

Nota: este valor depende fortemente do tamanho da entrada, número de documentos e complexidade da tarefa. Este é um valor agregado em todas as tarefas do trabalho.
JobDuration No Milissegundos Mínimo, Máximo, Médio JobStatus, JobType PT1M Yes

Categoria: Modelos - Pedidos HTTP

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Taxa de Disponibilidade de Modelos

Percentagem de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem quaisquer respostas >HTTP =500.
ModelAvailabilityRate No Percentagem Mínimo, Máximo, Médio Region, ModelDeploymentName, ModelName, ModelVersion PT1M No
Solicitações de modelo

Número de chamadas feitas para a API do modelo ao longo do tempo. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go.
ModelRequests No Count Total (Quantidade) ApiName, OperationName, RegionStreamType, , ModelDeploymentName, , ModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse PT1M Yes

Categoria: Modelos - Latência

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Tempo Entre Fichas

Taxa de geração de tokens de modelo, medida em milissegundos. Aplica-se a implantações PTU e geridas pela PTU. Para pedidos não em streaming, este valor é uma estimativa.
NormalizedTimeBetweenTokens No Milissegundos Máximo, Mínimo, Médio ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion PT1M Yes
Tempo Normalizado até ao Primeiro Byte

Tempo que demora até o primeiro byte dos dados de resposta ser recebido após o pedido ser feito pelo modelo, normalizado pelo token. Aplica-se a implementações PTU, geridas por PTU e Pay-as-you-go. Para pedidos não em streaming, este valor é uma estimativa.
NormalizedTimeToFirstToken No Milissegundos Máximo, Mínimo, Médio ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse PT1M Yes
Tempo para o Último Byte

O tempo que demora até o último byte dos dados de resposta ser recebido após o pedido ser feito pelo modelo. Aplica-se a implementações PTU, geridas por PTU e Pay-as-you-go. Para pedidos não em streaming, este valor é uma estimativa.
TimeToLastByte No Milissegundos Máximo, Mínimo, Médio ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse PT1M Yes
Tempo para a Resposta

Medida recomendada de latência (responsividade). Aplica-se a implantações PTU e geridas pela PTU. Calculado como o tempo necessário para a primeira resposta aparecer após o utilizador enviar um prompt, medido pelo gateway da API. Este número aumenta à medida que o tamanho do prompt aumenta e/ou diminui o tamanho das visualizações do cache. Para analisar a métrica de tempo até resposta, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion.

Nota: esta métrica é uma aproximação, pois a latência medida depende fortemente de múltiplos fatores, incluindo chamadas simultâneas e o padrão global de carga de trabalho. Além disso, não tem em conta qualquer latência do lado do cliente que possa existir entre o seu cliente e o endpoint da API. Para pedidos não em streaming, este valor é uma estimativa. Por favor, consulte o seu próprio registo para um rastreio de latência otimizado.
TimeToResponse No Milissegundos Mínimo, Máximo, Médio ApiName, OperationName, StreamTypeRegion, , ModelDeploymentName, , ServiceTierRequestModelVersionStatusCodeModelNameServiceTierResponse PT1M Yes
Tokens por Segundo

Enumera a velocidade de geração para uma dada resposta do modelo. O total de tokens gerados é dividido pelo tempo para gerar os tokens, em segundos. Aplica-se a implantações PTU e geridas pela PTU. Para pedidos não em streaming, este valor é uma estimativa.
TokensPerSecond No Count Máximo, Mínimo, Médio ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse PT1M Yes

Categoria: Modelos - Utilização

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Páginas Anotadas

Número total de páginas processadas com anotações. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go.
AnnotatedPages No Count Total (Quantidade) ApiName, Region, ModelDeploymentName, ModelName, ModelVersion PT1M Yes
Tokens de Entrada de Áudio

Número de tokens de prompt áudio processados (entrada) num modelo OpenAI. Aplica-se a implementações de modelos geridos por PTU.
AudioInputTokens No Count Total (Quantidade) ModelDeploymentName, ModelName, ModelVersion, Region PT1M Yes
Tokens de Saída de Áudio

Número de tokens de prompt de áudio gerados (output) num modelo OpenAI. Aplica-se a implementações de modelos geridos por PTU.
AudioOutputTokens No Count Total (Quantidade) ModelDeploymentName, ModelName, ModelVersion, Region PT1M Yes
Tokens de prompt lidos da cache

Número total de tokens lidos da cache. Aplica-se a implementações de modelos Anthropic. Surgiu na secção de utilização de resposta como cache_read_input_tokens
cacheReadInputTokens No Count Total (Quantidade) ApiName, Region, ModelDeploymentName, ModelName, ModelVersion, ContextLength PT1M Yes
Tokens de prompt escritos para cache (TTL de 1 hora)

O número de tokens de prompt usados para criar a entrada de 1 hora. Aplica-se a implementações de modelos Anthropic. Surgiu na secção de utilização de resposta como cache_creation.ephemeral_1h_input_tokens
ephemeral1hInputTokens No Count Total (Quantidade) ApiName, Region, ModelDeploymentName, ModelName, ModelVersion, ContextLength PT1M Yes
Tokens de prompt escritos para cache (TTL de 5 minutos)

O número de tokens de prompt usados para criar a entrada do cache de 5 minutos. Aplica-se a implementações de modelos Anthropic. Surgiu na secção de utilização de resposta como cache_creation.ephemeral_5m_input_tokens
ephemeral5mInputTokens No Count Total (Quantidade) ApiName, Region, ModelDeploymentName, ModelName, ModelVersion, ContextLength PT1M Yes
Imagens Geradas

Número total de imagens geradas. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go.
GeneratedImages No Count Total (Quantidade) ApiName, Region, ModelDeploymentName, ModelName, ModelVersion PT1M Yes
Tokens de Entrada

Número de tokens de prompt processados (entrada) num modelo. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go.
InputTokens No Count Total (Quantidade) ApiName, Region, ModelDeploymentName, ModelName, ModelVersion PT1M Yes
Tokens de saída

Número de tokens gerados (output) a partir de um modelo OpenAI. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go.
OutputTokens No Count Total (Quantidade) ApiName, Region, ModelDeploymentName, ModelName, ModelVersion PT1M Yes
Utilização provisionada

Utilização % para uma implantação gerida provisionalmente, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 é devolvido.
ProvisionedUtilization No Percentagem Mínimo, Máximo, Médio Region, ModelDeploymentName, ModelName, ModelVersion PT1M No
Total de Páginas

Número total de páginas processadas. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go.
TotalPages No Count Total (Quantidade) ApiName, Region, ModelDeploymentName, ModelName, ModelVersion PT1M Yes
Total Tokens

Número de tokens de inferência processados num modelo. Calculado como tokens de prompt (entrada) mais tokens gerados (output). Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go.
TotalTokens No Count Total (Quantidade) ApiName, Region, ModelDeploymentName, ModelName, ModelVersion PT1M Yes

Categoria: Serviços de Voz - Utilização

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Segundos de Áudio Transcritos em Lote

Número de segundos em lote transcritos
AudioSecondsBatchTranscribed No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Segundos de Áudio Sussurros em Batch Transcritos

Número de segundos do sussurro em lote transcrito
AudioSecondsBatchWhisperTranscribed No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Segundos de áudio transcritos rapidamente

Número rápido de segundos transcrito
AudioSecondsFastTranscribed No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Áudio Segundos Sussurros Rápidos Transcritos

Número de segundos transcrevidos em sussurros rápidos
AudioSecondsFastWhisperTranscribed No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Segundos de Áudio Transcritos

Número de segundos transcritos
AudioSecondsTranscribed No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Segundos de Áudio Traduzidos

Número de segundos traduzidos
AudioSecondsTranslated No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Modelos Avatar Hosting Seconds

Número de segundos.
AvatarModelHostingSeconds No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Segundos de Treino do Modelo Avatar

Número de segundos.
AvatarModelTrainingSeconds No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Horas de Apresentação do Modelo de Discurso

Número de horas de apresentação de modelos de fala
SpeechModelHostingHours No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Caracteres sintetizados

Número de personagens.
SynthesizedCharacters No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Segundos de Vídeo Sintetizados

Número de segundos sintetizados
VideoSecondsSynthesized No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Tokens de Entrada de Áudio ao Vivo por Voz

Número de tokens de entrada áudio, excluindo tokens em cache.
VoiceLiveAudioInputTokens No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Tokens de Saída de Áudio ao Vivo de Voz

Número de tokens de saída áudio.
VoiceLiveAudioOutputTokens No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Tokens de Entrada de Áudio em Cache de Voz ao Vivo

Número de tokens de entrada áudio em cache.
VoiceLiveCachedAudioInputTokens No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Tokens de Entrada de Texto em Cache Voice Live

Número de tokens de entrada de texto em cache.
VoiceLiveCachedTextInputTokens No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Tokens de Entrada de Texto ao Vivo por Voz

Número de tokens de entrada de texto, excluindo tokens em cache.
VoiceLiveTextInputTokens No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Tokens de Saída de Texto ao Vivo por Voz

Número de tokens de saída de texto.
VoiceLiveTextOutputTokens No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Horas de Apresentação de Modelos de Voz

Número de horas.
VoiceModelHostingHours No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Minutos de Treino de Modelos de Voz

Número de minutos.
VoiceModelTrainingMinutes No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes

Categoria: Serviços de Tradução - Utilização

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Caracteres do Documento Traduzidos

Número de caracteres no pedido de tradução do documento.
DocumentCharactersTranslated No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Caracteres Personalizados do Documento Traduzidos

Número de caracteres no pedido de tradução de documentos personalizados.
DocumentCustomCharactersTranslated No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Caracteres de Sincronização de Documentos Traduzidos

Número de caracteres no pedido de tradução de documentos (síncrono).
OneDocumentCharactersTranslated No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Sincronização de Documentos Caracteres Personalizados Traduzidos

Número de caracteres no pedido de tradução personalizada de documentos (síncrono).
OneDocumentCustomCharactersTranslated No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Caracteres de Texto Traduzidos

Número de caracteres no pedido de tradução de texto recebido.
TextCharactersTranslated No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Caracteres Personalizados de Texto Traduzidos

Número de caracteres no pedido de tradução de texto personalizado recebido.
TextCustomCharactersTranslated No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Caracteres treinados por texto

Número de caracteres treinados usando tradução de texto.
TextTrainedCharacters No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Segundo da aplicação Translator Pro

Número de segundos de utilização da aplicação Translator Pro.
TranslatorProAppSeconds No Seconds Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes

Categoria: Uso

Métrico Nome na API REST Métricas avançadas de plataforma Unit Agregação Dimensões Segmentos de tempo DS Exportar
Imagem Digitalizada Transações

Número de Transações de Imagem Digitalizada
ComputerVisionTransactions No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Tempo de Treino Personalizado de Visão

Tempo de treino Custom Vision
CustomVisionTrainingTime No Seconds Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Transações de Visão Personalizadas

Número de transações de previsão do Custom Vision
CustomVisionTransactions No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Imagens Faciais Treinadas

Número de imagens treinadas. 1.000 imagens treinadas por transação.
FaceImagesTrained No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Rostos Armazenados

Número de rostos armazenados, proporcional diariamente. O número de faces armazenadas é reportado diariamente.
FacesStored No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Transações de Face

Número de chamadas API feitas para o serviço Face
FaceTransactions No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Imagens armazenadas

Número de imagens Custom Vision armazenadas.
ImagesStored No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Eventos Académicos

Número de Eventos Aprendidos.
LearnedEvents No Count Total (Quantidade) IsMatchBaseline, Mode, RunId PT1M Yes
Pedidos de Discurso LUIS

Número de pedidos de compreensão de LUIS de fala para intenção
LUISSpeechRequests No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Pedidos de Texto LUIS

Número de pedidos de texto LUIS
LUISTextRequests No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Recompensas Combinadas

Número de recompensas igualadas.
MatchedRewards No Count Total (Quantidade) Mode, RunId PT1M Yes
Eventos Não Ativados

Número de eventos saltados.
NonActivatedEvents No Count Total (Quantidade) Mode, RunId PT1M Yes
Recompensas Observadas

Número de recompensas observadas.
ObservedRewards No Count Total (Quantidade) Mode, RunId PT1M Yes
Caracteres Processados

Número de caracteres processados pelo Leitura Avançada.
ProcessedCharacters No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Registos de Texto de Saúde Processados

Número de registos de texto de saúde processados
ProcessedHealthTextRecords No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Imagens Processadas

Número de imagens processadas
ProcessedImages No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Páginas Processadas

Número de páginas processadas
ProcessedPages No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Registos de Texto Processados

Contagem de registos de texto.
ProcessedTextRecords No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Registos de Texto de QA

Número de registos de texto processados
QuestionAnsweringTextRecords No Count Total (Quantidade) ApiName, FeatureName, UsageChannel, Region PT1M Yes
Total de Eventos

Número de eventos.
TotalEvents No Count Total (Quantidade) Mode, RunId PT1M Yes
Transações Totais (Descontinuadas)

Número total de transações.
TotalTransactions No Count Total (Quantidade) <nenhum> PT1M Yes

Dimensões métricas

Para informações sobre o que são dimensões métricas, veja Métricas multidimensionais.

Este serviço tem as seguintes dimensões associadas às suas métricas.

  • ApiName
  • Nome da Funcionalidade
  • ModelDeploymentName
  • Nome do modelo
  • ModelVersion
  • Nome da operação
  • Região
  • Código de estado
  • StreamType
  • UsageChannel

Logs de recursos

Esta secção lista os tipos de registos de recursos que pode recolher para este serviço. A secção retira da lista de tipos de categorias de registos todos os recursos suportados em Azure Monitor.

Registos de recursos suportados para a Microsoft. CognitiveServices/contas

Categoria Custos de exportação Tabela de logs Suporta o plano básico de registos Suporta a transformação do tempo de ingestão Exemplos de consultas
Audit No AzureDiagnostics

Registos de múltiplos recursos do Azure.

No No
AzureOpenAIRequestUsage Yes AzureDiagnostics

Registos de múltiplos recursos do Azure.

No No
EventoNetworkGerenciado Yes AzureDiagnostics

Registos de múltiplos recursos do Azure.

No No
RequestResponse No AzureDiagnostics

Registos de múltiplos recursos do Azure.

No No
Rastreio No AzureDiagnostics

Registos de múltiplos recursos do Azure.

No No

Tabelas de Logs do Azure Monitor

Esta secção lista as tabelas Azure Monitor Logs relevantes para este serviço, que estão disponíveis para consulta pela Log Analytics usando consultas Kusto. As tabelas contêm dados de registo de recursos e possivelmente mais, dependendo do que é recolhido e encaminhado para elas.

Azure OpenAI microsoft.cognitiveservices/accounts

Registo de atividades

A tabela ligada lista as operações que podem ser registadas no registo de atividades deste serviço. Estas operações são um subconjunto de todas as possíveis operações de fornecedores de recursos no registo de atividade.

Para mais informações sobre o esquema das entradas do registo de atividade, consulte Esquema do Registo de Atividades.