Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Este artigo contém todas as informações de referência de monitoramento para este serviço.
Para obter detalhes sobre os dados que você pode coletar para Azure OpenAI no Microsoft Foundry Models e como usá-los, consulte Monitor Azure OpenAI.
Métricas
Esta seção lista todas as métricas coletadas automaticamente pela plataforma para esse serviço. Essas métricas também fazem parte da lista global de métricas todas as plataformas suportadas em Azure Monitor.
Para informações sobre retenção de métricas, veja Azure Monitor Visão geral das métricas.
Métricas suportadas para a Microsoft. CognitiveServices/contas
Monitore as métricas mais importantes para Azure OpenAI. Posteriormente neste artigo, você encontrará uma lista mais longa de todas as métricas disponíveis para esse namespace, que contém mais detalhes sobre as métricas nesta lista mais curta. Consulte a lista a seguir para obter as informações mais up-to-date. A equipe de Azure está trabalhando na atualização das tabelas nas seções a seguir.
Importante
Não confunda as métricas desta seção com a métrica legada Latency listada em Serviços Cognitivos - HTTP Requests mais adiante neste artigo. A métrica legada Latency não foi projetada para cargas de trabalho Azure OpenAI e produz resultados enganosos quando usada para diagnosticar Azure latência OpenAI. Para Azure monitoramento de latência do OpenAI, use Tempo para Resposta (AzureOpenAITimeToResponse), Tempo até o Último Byte (AzureOpenAITTLTInMS), Tempo Entre Tokens (AzureOpenAINormalizedTBTInMS), ou Tempo Normalizado até o Primeiro Byte (AzureOpenAINormalizedTTFTInMS). Para orientações sobre como interpretar essas métricas, veja Desempenho e latência.
- Azure solicitações openai
- Tokens Ativos
- Tokens de Conclusão Gerados
- Processou horas de treinamento finamente ajustadas
- Tokens de Inferência Processados
- Tokens de Prompt Processados
- Utilização gerenciada por provisões V2
- Taxa de Correspondência do Cache de Token de Prompt
- Hora de Responder
- Tempo Entre as Fichas
- Hora do Último Byte
- Tempo Normalizado até o Primeiro Byte
- Tokens por segundo
Você também pode monitorar as métricas de Segurança de Conteúdo que outros serviços relacionados usam.
- Volume Bloqueado
- Volume Nocivo Detectado
- Potencial Número de Usuários Abusivos
- Evento do Sistema de Segurança
- Volume Total Enviado para Verificação de Segurança
Note
A métrica de Utilização gerenciada por provisões agora está obsoleta e não é mais recomendada. Essa métrica é substituída pela métrica de Utilização V2 gerenciada por provisionamento . Tokens por segundo, tempo de resposta e tempo entre tokens não estão disponíveis atualmente para implantações Standard.
Referência rápida: Métricas-chave por caso de uso
Use esta tabela para encontrar a métrica certa para um objetivo específico de monitoramento. Para orientações de ponta a ponta sobre como interpretar essas métricas, veja Desempenho e latência.
| Quero monitorar... | Use essa métrica | Nome da API REST |
|---|---|---|
| Tempo de resposta total | Hora do Último Byte | AzureOpenAITTLTInMS |
| Resposta ao primeiro token (streaming) | Hora de Responder | AzureOpenAITimeToResponse |
| Velocidade de geração de tokens | Tempo Entre as Fichas | AzureOpenAINormalizedTBTInMS |
| Eficiência do primeiro token normalizada pelo tamanho do prompt | Tempo Normalizado até o Primeiro Byte | AzureOpenAINormalizedTTFTInMS |
| Volume de token de saída por requisição | Tokens de Conclusão Gerados | GeneratedTokens |
| Volume de token de entrada por requisição | Tokens de Prompt Processados | ProcessedPromptTokens |
| Utilização da capacidade da PTU | Utilização gerenciada por provisões V2 | AzureOpenAIProvisionedManagedUtilizationV2 |
| Volume de solicitações e erros | Azure solicitações openai | AzureOpenAIRequests |
Tip
Sempre pareie uma métrica de latência com uma métrica de contagem de tokens. Um aumento de latência sem o aumento correspondente do token pode indicar um problema real. Um aumento de latência com um aumento proporcional de token é um comportamento esperado.
Aviso
As métricas sob Serviços Cognitivos - HTTP Requests mais adiante neste artigo são métricas legadas de Serviços Cognitivos e não foram projetadas para cargas de trabalho Azure OpenAI. Em particular, a métrica Latency nessa categoria não é a mesma que as métricas de latência Azure OpenAI (Tempo até a resposta, tempo até o último byte, tempo entre tokens, tempo normalizado até o primeiro byte). Usar a métrica legada Latency para Azure solução de problemas da OpenAI produz resultados enganosos. Use as métricas do Azure OpenAI listadas nesta seção em vez disso.
A tabela a seguir lista as métricas disponíveis para a Microsoft. Serviços cognitivos/tipo de recurso de contas.
- Nem todas as colunas podem estar presentes em todas as tabelas.
- Algumas colunas podem estar além da área de visualização da página. Selecione Expandir tabela para ver todas as colunas disponíveis.
Títulos de tabela
- Categoria - O grupo ou classificação de métricas.
- Metric - O nome de exibição métrico conforme aparece no portal Azure.
- Nome na API REST - O nome da métrica referido na API REST.
- Unidade - Unidade de medida.
- Agregação - O tipo padrão de agregação . Valores válidos: Média (Média), Mínimo (Mínimo), Máximo (Máximo), Total (Soma), Contagem.
- Dimensões - Dimensões disponíveis para a métrica.
-
Grãos - do TempoIntervalos nos quais a métrica é amostrada. Por exemplo,
PT1Mindica que a métrica é amostrada a cada minuto,PT30Ma cada 30 minutos,PT1Ha cada hora, e assim por diante. - DS Export- Se a métrica pode ser exportada para Azure Monitor Logs via configurações de diagnóstico. Para informações sobre exportação de métricas, veja Criar configurações de diagnóstico em Azure Monitor.
Categoria: Azure OpenAI - Requisições HTTP
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Taxa de Disponibilidade do Azure OpenAI Percentual de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem qualquer resposta >HTTP =500. |
AzureOpenAIAvailabilityRate |
No | Porcentagem | Mínimo, Máximo, Médio |
ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion |
PT1M | No |
|
Azure Solicitações OpenAI Número de chamadas feitas para a API do Azure OpenAI ao longo do tempo. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go. Para detalhar as solicitações da API, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion, StatusCode (bem-sucedido, erros do cliente, erros do servidor), IsSpillover para informações de spillover, ServiceTier, StreamType (requisições de streaming vs não streaming) e operação. |
AzureOpenAIRequests |
No | Count | Soma (Total) |
ApiName, , , , , , OperationNameRegionStreamTypeModelDeploymentNameModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse |
PT1M | Yes |
Categoria: Azure OpenAI - Latência
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Tempo Entre os Tokens Para pedidos de streaming; taxa de geração de tokens de modelo, medida em milissegundos. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. |
AzureOpenAINormalizedTBTInMS |
No | MilliSeconds | Máximo, Mínimo, Médio |
Region, ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse |
PT1M | Yes |
|
Tempo Normalizado até o Primeiro Byte Para solicitações de streaming e não streaming; O tempo leva para o primeiro byte dos dados de resposta ser recebido após a solicitação ser feita pelo modelo, normalizada pelo token. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. |
AzureOpenAINormalizedTTFTInMS |
No | MilliSeconds | Máximo, Mínimo, Médio |
Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Yes |
|
Hora de Responder Medida recomendada de latência (responsividade) para requisições de streaming. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Calculado como o tempo levado para a primeira resposta aparecer após o usuário enviar um prompt, conforme medido pelo gateway da API. Esse número aumenta conforme o tamanho do prompt aumenta e/ou o tamanho do hit do cache diminui. Para detalhar a métrica de tempo até resposta, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion. Nota: essa métrica é uma aproximação, pois a latência medida depende fortemente de múltiplos fatores, incluindo chamadas concorrentes e padrão geral de carga de trabalho. Além disso, ele não leva em conta qualquer latência do lado do cliente que possa existir entre seu cliente e o endpoint da API. Por favor, consulte seu próprio registro para monitorar a latência ideal. |
AzureOpenAITimeToResponse |
No | MilliSeconds | Mínimo, Máximo, Médio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, , StatusCode |
PT1M | Yes |
|
Tokens por Segundo Enumera a velocidade de geração para uma resposta dada do modelo Azure OpenAI. O total de tokens gerados é dividido pelo tempo para gerar os tokens, em segundos. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. |
AzureOpenAITokenPerSecond |
No | Count | Máximo, Mínimo, Médio |
Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Yes |
|
Hora do Último Byte Para solicitações de streaming e não streaming; O tempo que leva para o último byte dos dados de resposta ser recebido após a requisição ser feita pelo modelo. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. |
AzureOpenAITTLTInMS |
No | MilliSeconds | Máximo, Mínimo, Médio |
Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Yes |
Categoria: Azure OpenAI - Uso
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Tokens ativos Total de tokens menos tokens armazenados em cache ao longo de um período de tempo. Aplica-se a implantações gerenciadas pela PTU e PTU. Use essa métrica para entender sua utilização baseada em TPS ou TPM para PTUs e compare com seus benchmarks para TPS ou TPM alvo para seus cenários. Para detalhar as requisições da API, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion. |
ActiveTokens |
No | Count | Mínimo, Máximo, Média, Total (Soma) |
Region, ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse |
PT1M | Yes |
|
Tokens de Conclusão de Áudio Número de tokens de prompt de áudio gerados (saída) em um modelo OpenAI. Vale para implantações gerenciadas por PTU e modelos Pay-as-you-go. |
AudioCompletionTokens |
No | Count | Soma (Total) |
ModelDeploymentName, ModelName, , ModelVersionRegion |
PT1M | Yes |
|
Tokens de Prompt de Áudio Número de tokens de prompt de áudio processados (entrada) em um modelo OpenAI. Vale para implantações gerenciadas por PTU e modelos Pay-as-you-go. |
AudioPromptTokens |
No | Count | Soma (Total) |
ModelDeploymentName, ModelName, , ModelVersionRegion |
PT1M | Yes |
|
Taxa de Correspondência do Cache de Token de Prompt Porcentagem de tokens de prompt que entram no cache. Aplica-se a implantações gerenciadas pela PTU e PTU. |
AzureOpenAIContextTokensCacheMatchRate |
No | Porcentagem | Mínimo, Máximo, Médio |
Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | No |
|
Utilização gerenciada por provisionamento (obsoleta) Utilização % para uma implantação gerenciada com provisonsões, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 retornado. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion e StreamType (Solicitações de streaming vs não-streaming) |
AzureOpenAIProvisionedManagedUtilization |
No | Porcentagem | Mínimo, Máximo, Médio |
Region, StreamType, ModelDeploymentName, , ModelNameModelVersion |
PT1M | No |
|
Utilização gerenciada por provisões V2 Utilização % para uma implantação gerenciada com provisonsões, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 retornado. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion e StreamType (Solicitações de streaming vs não-streaming) |
AzureOpenAIProvisionedManagedUtilizationV2 |
No | Porcentagem | Mínimo, Máximo, Médio |
Region, StreamType, ModelDeploymentName, , ModelNameModelVersion |
PT1M | No |
|
Processou horas de treinamento finamente ajustadas Número de horas de treinamento processadas em um modelo OpenAI FineTuned |
FineTunedTrainingHours |
No | Count | Soma (Total) |
ApiName, ModelDeploymentName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Tokens de Conclusão Gerados Número de tokens gerados (output) a partir de um modelo OpenAI. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName e ModelName. |
GeneratedTokens |
No | Count | Soma (Total) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, , RegionModelVersion |
PT1M | Yes |
|
Tokens de Prompt Processados Número de tokens de prompt processados (entrada) em um modelo OpenAI. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName e ModelName. |
ProcessedPromptTokens |
No | Count | Soma (Total) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, , RegionModelVersion |
PT1M | Yes |
|
Segundos de API em tempo real usados Número de segundos usados no RealtimeAPI |
RealtimeUsageTime |
No | Count | Soma (Total) |
Region, ModelDeploymentName |
PT1M | Yes |
|
Tokens de Inferência Processados Número de tokens de inferência processados em um modelo OpenAI. Calculado como tokens de prompt (entrada) mais tokens gerados (saída). Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para detalhar essa métrica, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName e ModelName. |
TokenTransaction |
No | Count | Soma (Total) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, , RegionModelVersion |
PT1M | Yes |
Categoria: Serviços Cognitivos - Solicitações HTTP
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Chamadas bloqueadas Número de chamadas que excederam o limite de taxa ou cota. Não use para o serviço OpenAI do Azure. |
BlockedCalls |
No | Count | Soma (Total) |
ApiName, OperationName, , RegionRatelimitKey |
PT1M | Yes |
|
Erros do cliente Número de chamadas com erro do lado do cliente (código de resposta HTTP 4xx). Não use para o serviço OpenAI do Azure. |
ClientErrors |
No | Count | Soma (Total) |
ApiName, OperationName, , RegionRatelimitKey |
PT1M | Yes |
|
Entrada de dados Tamanho dos dados recebidos em bytes. Não use para o serviço OpenAI do Azure. |
DataIn |
No | Bytes | Soma (Total) |
ApiName, , OperationNameRegion |
PT1M | Yes |
|
Saída de dados Tamanho dos dados de saída em bytes. Não use para o serviço OpenAI do Azure. |
DataOut |
No | Bytes | Soma (Total) |
ApiName, , OperationNameRegion |
PT1M | Yes |
|
Latência Latência em milissegundos. Não use para o serviço OpenAI do Azure. |
Latency |
No | MilliSeconds | Mediana |
ApiName, OperationName, , RegionRatelimitKey |
PT1M | Yes |
|
Limite de taxa O limite de taxa atual da chave de limite. Não use para o serviço OpenAI do Azure. |
Ratelimit |
No | Count | Soma (Total) |
Region, RatelimitKey |
PT1M | Yes |
|
Erros do Servidor Número de chamadas com erro interno do serviço (código de resposta HTTP 5xx). Não use para o serviço OpenAI do Azure. |
ServerErrors |
No | Count | Soma (Total) |
ApiName, OperationName, , RegionRatelimitKey |
PT1M | Yes |
|
Chamadas bem-sucedidas Número de chamadas bem-sucedidas. Não use para o serviço OpenAI do Azure. |
SuccessfulCalls |
No | Count | Soma (Total) |
ApiName, OperationName, , RegionRatelimitKey |
PT1M | Yes |
|
Total de chamadas Número total de ligações. Não use para o serviço OpenAI do Azure. |
TotalCalls |
No | Count | Soma (Total) |
ApiName, OperationName, , RegionRatelimitKey |
PT1M | Yes |
|
Total de Erros Número total de chamadas com resposta de erro (código de resposta HTTP 4xx ou 5xx). Não use para o serviço OpenAI do Azure. |
TotalErrors |
No | Count | Soma (Total) |
ApiName, OperationName, , RegionRatelimitKey |
PT1M | Yes |
|
Total de Chamadas de Token Número total de chamadas de token. |
TotalTokenCalls |
No | Count | Soma (Total) |
ApiName, , OperationNameRegion |
PT1M | Yes |
Categoria: Serviços Cognitivos - SLI
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Taxa de disponibilidade Percentual de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem qualquer resposta >HTTP =500. Não use para o serviço OpenAI do Azure. |
SuccessRate |
No | Porcentagem | Mínimo, Máximo, Médio |
ApiName, OperationName, , RegionRatelimitKey |
PT1M | No |
Categoria: Compreensão de Conteúdo - Uso
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Transações Face-a-Face Número de chamadas API feitas para o serviço Face |
FaceApiTransactions |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Minutos de Áudio Processados Minutos de áudio processados |
ProcessedAudioMinutes |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Páginas processadas Número de páginas de documento processadas |
ProcessedDocumentPages |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Imagens processadas Número de imagens processadas |
ProcessedImageCount |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Minutos de Vídeo Processados Minutos de vídeo processados |
ProcessedVideoMinutes |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Tokens Número de tokens consumidos |
Tokens |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
Categoria: ConteúdoSegurança - Riscos e Segurança
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Volume Nocivo Detectado Número de chamadas feitas para a API OpenAI do Azure e detectadas como prejudiciais (tanto modelo em bloco quanto em modo de anotação) pelo filtro de conteúdo aplicado ao longo do tempo. Você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e TextType. |
RAIHarmfulRequests |
No | Count | Soma (Total) |
Region, ModelDeploymentName, ModelName, ModelVersion, ApiName, TextType, Category, , Severity |
PT1M | Yes |
|
Volume bloqueado Número de chamadas feitas para a API OpenAI do Azure e rejeitadas pelo filtro de conteúdo aplicado ao longo do tempo. Você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e TextType. |
RAIRejectedRequests |
No | Count | Soma (Total) |
Region, ModelDeploymentName, ModelName, ModelVersion, , ApiName, TextType, Category |
PT1M | Yes |
|
Evento do Sistema de Segurança Evento do sistema para monitoramento de riscos e segurança. Você pode adicionar um filtro ou aplicar divisão pela seguinte dimensão: EventType. |
RAISystemEvent |
No | Count | Mediana |
Region, EventType |
PT1M | Yes |
|
Volume Total Enviado para Verificação de Segurança Número de chamadas feitas para a API OpenAI do Azure e detectadas pelo filtro de conteúdo aplicado ao longo do tempo. Você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName. |
RAITotalRequests |
No | Count | Soma (Total) |
Region, ModelDeploymentName, ModelName, , ModelVersionApiName |
PT1M | Yes |
Categoria: Conteúdo Segurança - Uso
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Contagem de Chamadas para Moderação de Imagens Número de pedidos de moderação de imagens. |
ContentSafetyImageAnalyzeRequestCount |
No | Count | Soma (Total) | ApiVersion |
PT1M | Yes |
|
Contagem de Chamadas para Moderação de Mensagens Número de pedidos de moderação de texto. |
ContentSafetyTextAnalyzeRequestCount |
No | Count | Soma (Total) | ApiVersion |
PT1M | Yes |
Categoria: Idioma - Empregos
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Duração do Trabalho (Prévia) Nota: esse valor depende fortemente do tamanho da entrada, número de documentos e complexidade da tarefa. Esse é um valor agregado para todas as tarefas do cargo. |
JobDuration |
No | MilliSeconds | Mínimo, Máximo, Médio |
JobStatus, JobType |
PT1M | Yes |
Categoria: Modelos - Solicitações HTTP
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Taxa de Disponibilidade de Modelos Percentual de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem qualquer resposta >HTTP =500. |
ModelAvailabilityRate |
No | Porcentagem | Mínimo, Máximo, Médio |
Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | No |
|
Solicitações de modelo Número de chamadas feitas para a API do modelo ao longo do tempo. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go. |
ModelRequests |
No | Count | Soma (Total) |
ApiName, , , , , , OperationNameRegionStreamTypeModelDeploymentNameModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse |
PT1M | Yes |
Categoria: Modelos - Latência
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Tempo Entre as Fichas Taxa de geração de tokens de modelo, medida em milissegundos. Aplica-se a implantações gerenciadas pela PTU e PTU. Para requisições não em streaming, esse valor é uma estimativa. |
NormalizedTimeBetweenTokens |
No | MilliSeconds | Máximo, Mínimo, Médio |
ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
|
Tempo Normalizado até o Primeiro Byte Tempo que leva para o primeiro byte dos dados de resposta ser recebido após a requisição ser feita pelo modelo, normalizada pelo token. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para requisições não em streaming, esse valor é uma estimativa. |
NormalizedTimeToFirstToken |
No | MilliSeconds | Máximo, Mínimo, Médio |
ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse |
PT1M | Yes |
|
Hora do Último Byte O tempo que leva para o último byte dos dados de resposta ser recebido após a requisição ser feita pelo modelo. Vale para implantações PTU, gerenciadas por PTU e Pay-as-you-go. Para requisições não em streaming, esse valor é uma estimativa. |
TimeToLastByte |
No | MilliSeconds | Máximo, Mínimo, Médio |
ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse |
PT1M | Yes |
|
Hora de Responder Medida recomendada de latência (responsividade). Aplica-se a implantações gerenciadas pela PTU e PTU. Calculado como o tempo levado para a primeira resposta aparecer após o usuário enviar um prompt, conforme medido pelo gateway da API. Esse número aumenta conforme o tamanho do prompt aumenta e/ou o tamanho do hit do cache diminui. Para detalhar a métrica de tempo até resposta, você pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion. Nota: essa métrica é uma aproximação, pois a latência medida depende fortemente de múltiplos fatores, incluindo chamadas concorrentes e padrão geral de carga de trabalho. Além disso, ele não leva em conta qualquer latência do lado do cliente que possa existir entre seu cliente e o endpoint da API. Para requisições não em streaming, esse valor é uma estimativa. Por favor, consulte seu próprio registro para monitorar a latência ideal. |
TimeToResponse |
No | MilliSeconds | Mínimo, Máximo, Médio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, , ModelName, ModelVersion, , StatusCode, ServiceTierRequest, ServiceTierResponse |
PT1M | Yes |
|
Tokens por Segundo Enumera a velocidade de geração para uma dada resposta do modelo. O total de tokens gerados é dividido pelo tempo para gerar os tokens, em segundos. Aplica-se a implantações gerenciadas pela PTU e PTU. Para requisições não em streaming, esse valor é uma estimativa. |
TokensPerSecond |
No | Count | Máximo, Mínimo, Médio |
ApiName, OperationName, Region, StreamType, , ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequestServiceTierResponse |
PT1M | Yes |
Categoria: Modelos - Uso
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Páginas anotadas Número total de páginas processadas com anotações. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go. |
AnnotatedPages |
No | Count | Soma (Total) |
ApiName, Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Yes |
|
Tokens de Entrada de Áudio Número de tokens de prompt de áudio processados (entrada) em um modelo OpenAI. Aplica-se a implantações de modelos gerenciados por PTU. |
AudioInputTokens |
No | Count | Soma (Total) |
ModelDeploymentName, ModelName, , ModelVersionRegion |
PT1M | Yes |
|
Tokens de Saída de Áudio Número de tokens de prompt de áudio gerados (saída) em um modelo OpenAI. Aplica-se a implantações de modelos gerenciados por PTU. |
AudioOutputTokens |
No | Count | Soma (Total) |
ModelDeploymentName, ModelName, , ModelVersionRegion |
PT1M | Yes |
|
Tokens de prompt lidos do cache Número total de tokens lidos do cache. Aplica-se a implantações de modelos Anthropic. Surgiu na seção de uso de resposta como cache_read_input_tokens |
cacheReadInputTokens |
No | Count | Soma (Total) |
ApiName, Region, ModelDeploymentName, ModelName, , ModelVersionContextLength |
PT1M | Yes |
|
Tokens de prompt escritos no cache (TTL de 1 hora) O número de tokens de prompt usados para criar a entrada de 1 hora. Aplica-se a implantações de modelos Anthropic. Surgiu na seção de uso de resposta como cache_creation.ephemeral_1h_input_tokens |
ephemeral1hInputTokens |
No | Count | Soma (Total) |
ApiName, Region, ModelDeploymentName, ModelName, , ModelVersionContextLength |
PT1M | Yes |
|
Tokens de prompt escritos no cache (TTL de 5 minutos) O número de tokens de prompt usados para criar a entrada de cache de 5 minutos. Aplica-se a implantações de modelos Anthropic. Surgiu na seção de uso de resposta como cache_creation.ephemeral_5m_input_tokens |
ephemeral5mInputTokens |
No | Count | Soma (Total) |
ApiName, Region, ModelDeploymentName, ModelName, , ModelVersionContextLength |
PT1M | Yes |
|
Imagens geradas Número total de imagens geradas. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go. |
GeneratedImages |
No | Count | Soma (Total) |
ApiName, Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Yes |
|
Tokens de entrada Número de tokens de prompt processados (entrada) em um modelo. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go. |
InputTokens |
No | Count | Soma (Total) |
ApiName, Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Yes |
|
Tokens de saída Número de tokens gerados (output) a partir de um modelo OpenAI. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go. |
OutputTokens |
No | Count | Soma (Total) |
ApiName, Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Yes |
|
Utilização provisionada Utilização % para uma implantação gerenciada com provisonsões, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 retornado. |
ProvisionedUtilization |
No | Porcentagem | Mínimo, Máximo, Médio |
Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | No |
|
Total de Páginas Número total de páginas processadas. Vale para implantações de PTU, PTU-Managed e Pay-as-you-go. |
TotalPages |
No | Count | Soma (Total) |
ApiName, Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Yes |
|
Total Tokens Número de tokens de inferência processados em um modelo. Calculado como tokens de prompt (entrada) mais tokens gerados (saída). Vale para implantações de PTU, PTU-Managed e Pay-as-you-go. |
TotalTokens |
No | Count | Soma (Total) |
ApiName, Region, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Yes |
Categoria: Serviços de Voz - Uso
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Segundos de Áudio Transcritos em Lote Número de segundos em lote transcritos |
AudioSecondsBatchTranscribed |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Segundos de Áudio Sussurro em Batch Transcrito Número de segundos transcritos por lote de sussurros |
AudioSecondsBatchWhisperTranscribed |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Segundos de Áudio Transcritos Rápidos Número rápido de segundos transcrito |
AudioSecondsFastTranscribed |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Segundos de Áudio Sussurros Rápidos Transcreídos Número de segundos transcrevidos em sussurros rápidos |
AudioSecondsFastWhisperTranscribed |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Segundos de Áudio Transcritos Número de segundos transcritos |
AudioSecondsTranscribed |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Segundos de Áudio Traduzidos Número de segundos traduzidos |
AudioSecondsTranslated |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Modelos Avatar Apresentando Segundos Número de segundos. |
AvatarModelHostingSeconds |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Segundos de Treinamento do Modelo Avatar Número de segundos. |
AvatarModelTrainingSeconds |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Horas de Apresentação do Modelo de Discurso Número de horas de apresentação do modelo de discurso |
SpeechModelHostingHours |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Caracteres Sintetizados Número de caracteres. |
SynthesizedCharacters |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Segundos de Vídeo Sintetizados Número de segundos sintetizados |
VideoSecondsSynthesized |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Tokens de Entrada de Áudio ao Vivo por Voz Número de tokens de entrada de áudio, excluindo tokens em cache. |
VoiceLiveAudioInputTokens |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Tokens de Saída de Áudio ao Vivo por Voz Número de tokens de saída de áudio. |
VoiceLiveAudioOutputTokens |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Tokens de Áudio Cache Voice Live Número de tokens de entrada de áudio em cache. |
VoiceLiveCachedAudioInputTokens |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Tokens de Entrada de Texto em Cache Voice Live Número de tokens de entrada de texto em cache. |
VoiceLiveCachedTextInputTokens |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Tokens de Entrada de Texto ao Vivo por Voz Número de tokens de entrada de texto, excluindo tokens em cache. |
VoiceLiveTextInputTokens |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Tokens de Saída de Texto ao Vivo por Voz Número de tokens de saída de texto. |
VoiceLiveTextOutputTokens |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Horário de Apresentação de Modelos de Voz Número de horas. |
VoiceModelHostingHours |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Minutos de Treinamento de Modelos de Voz Número de minutos. |
VoiceModelTrainingMinutes |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
Categoria: Serviços de Tradução - Uso
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Caracteres do Documento Traduzidos Número de caracteres no pedido de tradução do documento. |
DocumentCharactersTranslated |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Caracteres Personalizados do Documento Traduzidos Número de caracteres em um pedido de tradução de documento personalizado. |
DocumentCustomCharactersTranslated |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Caracteres de Sincronização de Documentos Traduzidos Número de caracteres na solicitação de tradução de documentos (síncrona). |
OneDocumentCharactersTranslated |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Sincronização de Documentos Caracteres Personalizados Traduzidos Número de caracteres na solicitação de tradução personalizada de documentos (síncrona). |
OneDocumentCustomCharactersTranslated |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Caracteres de Texto Traduzidos Número de caracteres na solicitação de tradução de texto recebida. |
TextCharactersTranslated |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Caracteres Personalizados de Texto Traduzidos Número de caracteres na solicitação de tradução personalizada recebida. |
TextCustomCharactersTranslated |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Caracteres treinados em texto Número de caracteres treinados usando tradução de texto. |
TextTrainedCharacters |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Segundo do aplicativo Translator Pro Número de segundos de uso do aplicativo Translator Pro. |
TranslatorProAppSeconds |
No | Seconds | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
Categoria: uso
| Métrica | Nome na API REST | Métricas avançadas da plataforma | Unidade | Agregação | Dimensões | Intervalos de Tempo | Exportação de DS |
|---|---|---|---|---|---|---|---|
|
Pesquisa Visual Computacional Transações Número de Transações de Pesquisa Visual Computacional |
ComputerVisionTransactions |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Tempo de Treinamento Personalizado de Visão Tempo de treinamento Custom Vision |
CustomVisionTrainingTime |
No | Seconds | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Transações Personalizadas com Visão Número de transações de previsão Custom Vision |
CustomVisionTransactions |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Imagens Faciais Treinadas Número de imagens treinadas. 1.000 imagens treinadas por transação. |
FaceImagesTrained |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Rostos armazenados Número de rostos armazenados, proporcionalmente diário. O número de rostos armazenados é reportado diariamente. |
FacesStored |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Transações Face-a-Face Número de chamadas API feitas para o serviço Face |
FaceTransactions |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Imagens armazenadas Número de imagens Custom Vision armazenadas. |
ImagesStored |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Eventos Aprendidos Número de Eventos Aprendidos. |
LearnedEvents |
No | Count | Soma (Total) |
IsMatchBaseline, , ModeRunId |
PT1M | Yes |
|
Pedidos de Fala do LUIS Número de solicitações de compreensão de fala para intenção do LUIS |
LUISSpeechRequests |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Solicitações de Texto LUIS Número de solicitações de texto LUIS |
LUISTextRequests |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Recompensas Correspondentes Número de recompensas combinadas. |
MatchedRewards |
No | Count | Soma (Total) |
Mode, RunId |
PT1M | Yes |
|
Eventos Não Ativados Número de eventos pulados. |
NonActivatedEvents |
No | Count | Soma (Total) |
Mode, RunId |
PT1M | Yes |
|
Recompensas observadas Número de recompensas observadas. |
ObservedRewards |
No | Count | Soma (Total) |
Mode, RunId |
PT1M | Yes |
|
Caracteres processados Número de caracteres processados pelo Leitura Avançada. |
ProcessedCharacters |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Registros de Texto de Saúde Processados Número de registros de texto de saúde processados |
ProcessedHealthTextRecords |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Imagens processadas Número de imagens processadas |
ProcessedImages |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Páginas processadas Número de páginas processadas |
ProcessedPages |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Registros de Texto Processados Contagem de registros de texto. |
ProcessedTextRecords |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Registros de Texto de QA Número de registros de texto processados |
QuestionAnsweringTextRecords |
No | Count | Soma (Total) |
ApiName, FeatureName, , UsageChannelRegion |
PT1M | Yes |
|
Total de eventos Número de eventos. |
TotalEvents |
No | Count | Soma (Total) |
Mode, RunId |
PT1M | Yes |
|
Transações Totais (Desempregadas) Número total de transações. |
TotalTransactions |
No | Count | Soma (Total) | <nenhum> | PT1M | Yes |
Dimensões métricas
Para informações sobre o que são dimensões métricas, veja Métricas multidimensionais.
Este serviço possui as seguintes dimensões associadas às suas métricas.
- ApiName
- NomeDaFuncionalidade
- ModelDeploymentName
- ModelName
- ModelVersion
- Nome da Operação
- Região
- CódigoDeStatus
- StreamType
- UsageChannel
Logs de recursos
Esta seção lista os tipos de registros de recursos que você pode coletar para esse serviço. A seção extrai da lista de tipos de categorias de logs todos suportados em Azure Monitor.
Logs de recursos suportados para a Microsoft. CognitiveServices/contas
| Categoria | Custos de exportação | Tabela de log | Suporta o plano básico de logs | Suporta transformação no tempo de ingestão | Consultas de exemplo |
|---|---|---|---|---|---|
| Audit | No |
AzureDiagnostics Logs de múltiplos recursos do Azure. |
No | No | |
| AzureOpenAIRequestUsage | Yes |
AzureDiagnostics Logs de múltiplos recursos do Azure. |
No | No | |
| ManagedNetworkEvent | Yes |
AzureDiagnostics Logs de múltiplos recursos do Azure. |
No | No | |
| Requestresponse | No |
AzureDiagnostics Logs de múltiplos recursos do Azure. |
No | No | |
| Rastrear | No |
AzureDiagnostics Logs de múltiplos recursos do Azure. |
No | No |
Tabelas de Logs do Azure Monitor
Esta seção lista as tabelas de Azure Monitor Logs relevantes para este serviço, que estão disponíveis para consulta pelo Log Analytics usando consultas Kusto. As tabelas contêm dados de registros de recursos e possivelmente mais, dependendo do que é coletado e roteado para elas.
Azure OpenAI microsoft.cognitiveservices/accounts
Log de atividades
A tabela vinculada lista as operações que podem ser registradas no registro de atividades desse serviço. Essas operações são um subconjunto de todas as possíveis operações de provedores de recursos no registro de atividade.
Para mais informações sobre o esquema das entradas do registro de atividade, veja Esquema do Registro de Atividades.
Conteúdo relacionado
- Para obter uma descrição do monitoramento Azure OpenAI, consulte Monitor Azure OpenAI.
- Para obter detalhes sobre como monitorar recursos do Azure, consulte Monitorar recursos do Azure com o Azure Monitor.