Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Este artigo contém toda a informação de referência de monitorização para este serviço.
Para detalhes sobre os dados que pode recolher para Azure OpenAI em Microsoft Foundry Models e como os utilizar, veja Monitor Azure OpenAI.
Métricas
Esta secção lista todas as métricas de plataforma recolhidas automaticamente para este serviço. Estas métricas fazem também parte da lista global de métricas all da plataforma suportadas em Azure Monitor.
Para informações sobre retenção de métricas, consulte Azure Monitor Visão geral das métricas.
Métricas suportadas para a Microsoft. CognitiveServices/contas
Monitorize as métricas mais importantes para o Azure OpenAI. Mais adiante neste artigo, encontrará uma lista mais longa de todas as métricas disponíveis para este namespace, que contém mais detalhes sobre métricas nesta lista mais curta. Por favor, consulte a lista seguinte para as informações mais up-todatas. A equipa do Azure está a trabalhar na atualização das tabelas nas secções seguintes.
Important
Não confunda as métricas desta secção com a métrica legada Latency listada em Serviços Cognitivos - HTTP Requests mais adiante neste artigo. A métrica legada Latency não foi concebida para cargas de trabalho Azure OpenAI e produz resultados enganadores quando usada para diagnosticar latência Azure OpenAI. Para monitorização de latência Azure OpenAI, use Tempo até à Resposta (AzureOpenAITimeToResponse), Tempo até ao Último Byte (AzureOpenAITTLTInMS), Tempo Entre Tokens (AzureOpenAINormalizedTBTInMS), ou Tempo Normalizado até ao Primeiro Byte (AzureOpenAINormalizedTTFTInMS). Para orientações sobre a interpretação destas métricas, consulte Desempenho e latência.
- Azure OpenAI Requests
- Tokens Ativos
- Tokens de Conclusão Gerados
- Horas de treino processadas FinAjustadas
- Tokens de Inferência Processados
- Tokens de Prompt Processados
- Utilização gerida por provisões V2
- Taxa de Correspondência do Cache do Token de Prompt
- Tempo para a Resposta
- Tempo Entre Fichas
- Tempo para o Último Byte
- Tempo Normalizado até ao Primeiro Byte
- Tokens por Segundo
Também pode monitorizar métricas de Segurança de Conteúdo que outros serviços relacionados utilizam.
- Volume Bloqueado
- Volume Nocivo Detetado
- Potencial Número de Utilizadores Abusivos
- Evento do Sistema de Segurança
- Volume Total Enviado para Verificação de Segurança
Note
A métrica de Utilização Gerida por Provisões está agora obsoleta e já não é recomendada. Esta métrica é substituída pela métrica de Utilização V2 gerida por providência . Tokens por Segundo, Tempo de Resposta e Tempo Entre Tokens não estão atualmente disponíveis para implementações Standard.
Referência rápida: Métricas-chave por caso de uso
Use esta tabela para encontrar a métrica certa para um objetivo específico de monitorização. Para orientações de ponta a ponta sobre a interpretação destas métricas, consulte Desempenho e latência.
| Quero monitorizar... | Use esta métrica | Nome da API REST |
|---|---|---|
| Tempo de resposta global | Tempo para o Último Byte | AzureOpenAITTLTInMS |
| Resposta ao primeiro token (streaming) | Tempo para a Resposta | AzureOpenAITimeToResponse |
| Velocidade de geração de tokens | Tempo Entre Fichas | AzureOpenAINormalizedTBTInMS |
| Eficiência do primeiro token normalizada pelo tamanho do prompt | Tempo Normalizado até ao Primeiro Byte | AzureOpenAINormalizedTTFTInMS |
| Volume de token de saída por pedido | Tokens de Conclusão Gerados | GeneratedTokens |
| Volume de token de entrada por pedido | Tokens de Prompt Processados | ProcessedPromptTokens |
| Utilização da capacidade da PTU | Utilização gerida por provisões V2 | AzureOpenAIProvisionedManagedUtilizationV2 |
| Volume de pedidos e erros | Azure OpenAI Requests | AzureOpenAIRequests |
Tip
Emparelhe sempre uma métrica de latência com uma métrica de contagem de tokens. Um aumento de latência sem um aumento correspondente do token pode indicar um problema real. Um aumento de latência com um aumento proporcional do token é um comportamento esperado.
Warning
As métricas em Serviços Cognitivos - HTTP Requests mais adiante neste artigo são métricas legadas de Serviços Cognitivos e não foram concebidas para cargas de trabalho Azure OpenAI. Em particular, a métrica Latency nessa categoria não é a mesma que as métricas de latência do Azure OpenAI (tempo até à resposta, tempo até ao último byte, tempo entre tokens, tempo normalizado até ao primeiro byte). Usar a métrica legada Latency para Azure resolução de problemas da OpenAI produz resultados enganadores. Use as métricas do Azure OpenAI listadas nesta secção.
A tabela seguinte lista as métricas disponíveis para a Microsoft. Serviços cognitivos/tipo de recurso de contas.
- Todas as colunas podem não estar presentes em todas as tabelas.
- Algumas colunas podem estar para além da área de visualização da página. Selecione Expandir tabela para ver todas as colunas disponíveis.
Cabeçalhos de tabela
- Categoria - O grupo de métricas ou classificação.
- Metric - O nome de visualização métrico tal como aparece no portal Azure.
- Nome na API REST - O nome da métrica referido na API REST.
- Unidade - Unidade de medida.
- Agregação - O tipo padrão de agregação . Valores válidos: Média (Média), Mínimo (Mínimo), Máximo (Máximo), Total (Soma), Contagem.
- Dimensões - Dimensões disponíveis para a métrica.
-
Grãos - do TempoIntervalos em que a métrica é amostrada. Por exemplo,
PT1Mindica que a métrica é amostrada a cada minuto,PT30Ma cada 30 minutos,PT1Ha cada hora, e assim sucessivamente. - DS Export- Se a métrica é exportável para Azure Monitor Logs através das definições de diagnóstico. Para informações sobre exportação de métricas, consulte Criar definições de diagnóstico em Azure Monitor.
Categoria: Azure OpenAI - Pedidos HTTP
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Azure OpenAI AvailabilityRate Percentagem de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem quaisquer respostas >HTTP =500. |
AzureOpenAIAvailabilityRate |
No | Percentagem | Mínimo, Máximo, Médio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion |
PT1M | No |
|
Azure Pedidos OpenAI Número de chamadas feitas para a API OpenAI do Azure ao longo do tempo. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go. Para detalhar os pedidos da API, pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion, StatusCode (sucesso, clientes erros, erros do servidor), IsSpillover para informação de spillover, ServiceTier, StreamType (pedidos de streaming vs não-streaming) e operação. |
AzureOpenAIRequests |
No | Count | Total (Quantidade) |
ApiName, OperationName, RegionStreamType, , ModelDeploymentName, , ModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse |
PT1M | Yes |
Categoria: Azure OpenAI - Latência
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Tempo Entre Fichas Para pedidos de streaming; taxa de geração de tokens de modelo, medida em milissegundos. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. |
AzureOpenAINormalizedTBTInMS |
No | Milissegundos | Máximo, Mínimo, Médio |
Region, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse |
PT1M | Yes |
|
Tempo Normalizado até ao Primeiro Byte Para pedidos de streaming e não-streaming; O tempo que demora até o primeiro byte dos dados de resposta ser recebido após o pedido ser feito pelo modelo, normalizado pelo token. Aplica-se a implementações PTU, geridas por PTU e Pay-as-you-go. |
AzureOpenAINormalizedTTFTInMS |
No | Milissegundos | Máximo, Mínimo, Médio |
Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
|
Tempo para a Resposta Medida recomendada de latência (responsividade) para pedidos de streaming. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. Calculado como o tempo necessário para a primeira resposta aparecer após o utilizador enviar um prompt, medido pelo gateway da API. Este número aumenta à medida que o tamanho do prompt aumenta e/ou diminui o tamanho das visualizações do cache. Para analisar a métrica de tempo até resposta, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion. Nota: esta métrica é uma aproximação, pois a latência medida depende fortemente de múltiplos fatores, incluindo chamadas simultâneas e o padrão global de carga de trabalho. Além disso, não tem em conta qualquer latência do lado do cliente que possa existir entre o seu cliente e o endpoint da API. Por favor, consulte o seu próprio registo para um rastreio de latência otimizado. |
AzureOpenAITimeToResponse |
No | Milissegundos | Mínimo, Máximo, Médio |
ApiName, OperationName, RegionStreamType, , ModelDeploymentName, ModelName, ModelVersion,StatusCode |
PT1M | Yes |
|
Tokens por Segundo Enumera a velocidade de geração para a resposta de um dado modelo Azure OpenAI. O total de tokens gerados é dividido pelo tempo para gerar os tokens, em segundos. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. |
AzureOpenAITokenPerSecond |
No | Count | Máximo, Mínimo, Médio |
Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
|
Tempo para o Último Byte Para pedidos de streaming e não-streaming; O tempo que demora até o último byte dos dados de resposta ser recebido após o pedido ser feito pelo modelo. Aplica-se a implementações PTU, geridas por PTU e Pay-as-you-go. |
AzureOpenAITTLTInMS |
No | Milissegundos | Máximo, Mínimo, Médio |
Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
Categoria: Azure OpenAI - Utilização
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Tokens Ativos Total de tokens menos tokens armazenados em cache ao longo de um período de tempo. Aplica-se a implantações PTU e geridas pela PTU. Use esta métrica para compreender a sua utilização baseada em TPS ou TPM para PTUs e compare com os seus benchmarks para TPS ou TPM alvo para os seus cenários. Para detalhar os pedidos da API, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion. |
ActiveTokens |
No | Count | Mínimo, Máximo, Médio, Total (Soma) |
Region, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse |
PT1M | Yes |
|
Tokens de Conclusão de Áudio Número de tokens de prompt de áudio gerados (output) num modelo OpenAI. Aplica-se a implementações gerenciadas por PTU e modelos Pay-as-you-go. |
AudioCompletionTokens |
No | Count | Total (Quantidade) |
ModelDeploymentName, ModelName, ModelVersion, Region |
PT1M | Yes |
|
Tokens de Prompt de Áudio Número de tokens de prompt áudio processados (entrada) num modelo OpenAI. Aplica-se a implementações gerenciadas por PTU e modelos Pay-as-you-go. |
AudioPromptTokens |
No | Count | Total (Quantidade) |
ModelDeploymentName, ModelName, ModelVersion, Region |
PT1M | Yes |
|
Taxa de Correspondência do Cache do Token de Prompt Percentagem de tokens de prompt que entram na cache. Aplica-se a implantações PTU e geridas pela PTU. |
AzureOpenAIContextTokensCacheMatchRate |
No | Percentagem | Mínimo, Máximo, Médio |
Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | No |
|
Utilização gerida por provisionamento (obsoleta) Utilização % para uma implantação gerida provisionalmente, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 é devolvido. Para detalhar esta métrica, pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion e StreamType (Pedidos de streaming vs não-streaming) |
AzureOpenAIProvisionedManagedUtilization |
No | Percentagem | Mínimo, Máximo, Médio |
Region, StreamType, ModelDeploymentName, ModelName, ModelVersion |
PT1M | No |
|
Utilização gerida por provisões V2 Utilização % para uma implantação gerida provisionalmente, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 é devolvido. Para detalhar esta métrica, pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName, ModelVersion e StreamType (Pedidos de streaming vs não-streaming) |
AzureOpenAIProvisionedManagedUtilizationV2 |
No | Percentagem | Mínimo, Máximo, Médio |
Region, StreamType, ModelDeploymentName, ModelName, ModelVersion |
PT1M | No |
|
Horas de treino processadas FinAjustadas Número de horas de treino processadas num modelo OpenAI FineTuned |
FineTunedTrainingHours |
No | Count | Total (Quantidade) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Tokens de Conclusão Gerados Número de tokens gerados (output) a partir de um modelo OpenAI. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. Para detalhar esta métrica, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName e ModelName. |
GeneratedTokens |
No | Count | Total (Quantidade) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, Region, ModelVersion |
PT1M | Yes |
|
Tokens de Prompt Processados Número de tokens de prompt processados (entrada) num modelo OpenAI. Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. Para detalhar esta métrica, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName e ModelName. |
ProcessedPromptTokens |
No | Count | Total (Quantidade) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, Region, ModelVersion |
PT1M | Yes |
|
Segundos de API em tempo real utilizados Número de segundos usados na RealtimeAPI |
RealtimeUsageTime |
No | Count | Total (Quantidade) |
Region, ModelDeploymentName |
PT1M | Yes |
|
Tokens de Inferência Processados Número de tokens de inferência processados num modelo OpenAI. Calculado como tokens de prompt (entrada) mais tokens gerados (output). Aplica-se a implementações PTU, PTU-managed e Pay-as-you-go. Para detalhar esta métrica, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName e ModelName. |
TokenTransaction |
No | Count | Total (Quantidade) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, Region, ModelVersion |
PT1M | Yes |
Categoria: Serviços Cognitivos - Pedidos HTTP
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Chamadas bloqueadas Número de chamadas que excederam o limite de taxa ou quota. Não use para o serviço Azure OpenAI. |
BlockedCalls |
No | Count | Total (Quantidade) |
ApiName, OperationName, Region, RatelimitKey |
PT1M | Yes |
|
Erros do cliente Número de chamadas com erro do lado do cliente (código de resposta HTTP 4xx). Não use para o serviço Azure OpenAI. |
ClientErrors |
No | Count | Total (Quantidade) |
ApiName, OperationName, Region, RatelimitKey |
PT1M | Yes |
|
Dados de Entrada Tamanho dos dados recebidos em bytes. Não use para o serviço Azure OpenAI. |
DataIn |
No | Bytes | Total (Quantidade) |
ApiName, OperationName, Region |
PT1M | Yes |
|
Saída de dados Tamanho dos dados de saída em bytes. Não use para o serviço Azure OpenAI. |
DataOut |
No | Bytes | Total (Quantidade) |
ApiName, OperationName, Region |
PT1M | Yes |
|
Latência Latência em milissegundos. Não use para o serviço Azure OpenAI. |
Latency |
No | Milissegundos | Mediano |
ApiName, OperationName, Region, RatelimitKey |
PT1M | Yes |
|
Limite de taxa O limite de taxa atual da chave de limite. Não use para o serviço Azure OpenAI. |
Ratelimit |
No | Count | Total (Quantidade) |
Region, RatelimitKey |
PT1M | Yes |
|
Erros do servidor Número de chamadas com erro interno do serviço (código de resposta HTTP 5xx). Não use para o serviço Azure OpenAI. |
ServerErrors |
No | Count | Total (Quantidade) |
ApiName, OperationName, Region, RatelimitKey |
PT1M | Yes |
|
Chamadas bem-sucedidas Número de chamadas bem-sucedidas. Não use para o serviço Azure OpenAI. |
SuccessfulCalls |
No | Count | Total (Quantidade) |
ApiName, OperationName, Region, RatelimitKey |
PT1M | Yes |
|
Total de chamadas Número total de chamadas. Não use para o serviço Azure OpenAI. |
TotalCalls |
No | Count | Total (Quantidade) |
ApiName, OperationName, Region, RatelimitKey |
PT1M | Yes |
|
Total de erros Número total de chamadas com resposta de erro (código de resposta HTTP 4xx ou 5xx). Não use para o serviço Azure OpenAI. |
TotalErrors |
No | Count | Total (Quantidade) |
ApiName, OperationName, Region, RatelimitKey |
PT1M | Yes |
|
Total de Chamadas de Token Número total de chamadas de token. |
TotalTokenCalls |
No | Count | Total (Quantidade) |
ApiName, OperationName, Region |
PT1M | Yes |
Categoria: Serviços Cognitivos - SLI
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
DisponibilidadeTaxa Percentagem de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem quaisquer respostas >HTTP =500. Não use para o serviço Azure OpenAI. |
SuccessRate |
No | Percentagem | Mínimo, Máximo, Médio |
ApiName, OperationName, Region, RatelimitKey |
PT1M | No |
Categoria: Compreensão de Conteúdo - Utilização
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Transações de Face Número de chamadas API feitas para o serviço Face |
FaceApiTransactions |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Minutos de Áudio Processados Minutos de áudio processados |
ProcessedAudioMinutes |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Páginas Processadas Número de páginas de documento processadas |
ProcessedDocumentPages |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Imagens Processadas Número de imagens processadas |
ProcessedImageCount |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Minutos de Vídeo Processados Minutos de vídeo processados |
ProcessedVideoMinutes |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Tokens Número de tokens consumidos |
Tokens |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
Categoria: ConteúdoSegurança - Riscos e Segurança
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Volume Nocivo Detetado Número de chamadas feitas para a API OpenAI do Azure e detetadas como prejudiciais (tanto modelo de bloco como modo de anotação) pelo filtro de conteúdo aplicado ao longo do tempo. Pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e TextType. |
RAIHarmfulRequests |
No | Count | Total (Quantidade) |
Region, ModelDeploymentName, ModelNameModelVersion, , ApiName, TextType, Category,Severity |
PT1M | Yes |
|
Volume Bloqueado Número de chamadas feitas para a API OpenAI do Azure e rejeitadas pelo filtro de conteúdo aplicado ao longo do tempo. Pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e TextType. |
RAIRejectedRequests |
No | Count | Total (Quantidade) |
Region, ModelDeploymentName, ModelName, ModelVersion, ApiName, TextType, Category |
PT1M | Yes |
|
Evento do Sistema de Segurança Evento do sistema para monitorização de riscos e segurança. Pode adicionar um filtro ou aplicar divisão pela seguinte dimensão: EventType. |
RAISystemEvent |
No | Count | Mediano |
Region, EventType |
PT1M | Yes |
|
Volume Total Enviado para Verificação de Segurança Número de chamadas feitas para a API OpenAI do Azure e detetadas pelo filtro de conteúdo aplicado ao longo do tempo. Pode adicionar um filtro ou aplicar divisão pelas seguintes dimensões: ModelDeploymentName, ModelName. |
RAITotalRequests |
No | Count | Total (Quantidade) |
Region, ModelDeploymentName, ModelName, ModelVersion, ApiName |
PT1M | Yes |
Categoria: Conteúdo Segurança - Utilização
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Contagem de Chamadas para Moderação de Imagem Número de pedidos de moderação de imagens. |
ContentSafetyImageAnalyzeRequestCount |
No | Count | Total (Quantidade) | ApiVersion |
PT1M | Yes |
|
Contagem de Chamadas para Moderação de Mensagens Número de chamadas para moderação de texto. |
ContentSafetyTextAnalyzeRequestCount |
No | Count | Total (Quantidade) | ApiVersion |
PT1M | Yes |
Categoria: Língua - Empregos
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Duração do Trabalho (Pré-visualização) Nota: este valor depende fortemente do tamanho da entrada, número de documentos e complexidade da tarefa. Este é um valor agregado em todas as tarefas do trabalho. |
JobDuration |
No | Milissegundos | Mínimo, Máximo, Médio |
JobStatus, JobType |
PT1M | Yes |
Categoria: Modelos - Pedidos HTTP
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Taxa de Disponibilidade de Modelos Percentagem de disponibilidade com o seguinte cálculo: (Total de Chamadas - Erros de Servidor)/Total de Chamadas. Erros de servidor incluem quaisquer respostas >HTTP =500. |
ModelAvailabilityRate |
No | Percentagem | Mínimo, Máximo, Médio |
Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | No |
|
Solicitações de modelo Número de chamadas feitas para a API do modelo ao longo do tempo. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go. |
ModelRequests |
No | Count | Total (Quantidade) |
ApiName, OperationName, RegionStreamType, , ModelDeploymentName, , ModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse |
PT1M | Yes |
Categoria: Modelos - Latência
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Tempo Entre Fichas Taxa de geração de tokens de modelo, medida em milissegundos. Aplica-se a implantações PTU e geridas pela PTU. Para pedidos não em streaming, este valor é uma estimativa. |
NormalizedTimeBetweenTokens |
No | Milissegundos | Máximo, Mínimo, Médio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
|
Tempo Normalizado até ao Primeiro Byte Tempo que demora até o primeiro byte dos dados de resposta ser recebido após o pedido ser feito pelo modelo, normalizado pelo token. Aplica-se a implementações PTU, geridas por PTU e Pay-as-you-go. Para pedidos não em streaming, este valor é uma estimativa. |
NormalizedTimeToFirstToken |
No | Milissegundos | Máximo, Mínimo, Médio |
ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse |
PT1M | Yes |
|
Tempo para o Último Byte O tempo que demora até o último byte dos dados de resposta ser recebido após o pedido ser feito pelo modelo. Aplica-se a implementações PTU, geridas por PTU e Pay-as-you-go. Para pedidos não em streaming, este valor é uma estimativa. |
TimeToLastByte |
No | Milissegundos | Máximo, Mínimo, Médio |
ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse |
PT1M | Yes |
|
Tempo para a Resposta Medida recomendada de latência (responsividade). Aplica-se a implantações PTU e geridas pela PTU. Calculado como o tempo necessário para a primeira resposta aparecer após o utilizador enviar um prompt, medido pelo gateway da API. Este número aumenta à medida que o tamanho do prompt aumenta e/ou diminui o tamanho das visualizações do cache. Para analisar a métrica de tempo até resposta, pode adicionar um filtro ou aplicar a divisão pelas seguintes dimensões: ModelDeploymentName, ModelName e ModelVersion. Nota: esta métrica é uma aproximação, pois a latência medida depende fortemente de múltiplos fatores, incluindo chamadas simultâneas e o padrão global de carga de trabalho. Além disso, não tem em conta qualquer latência do lado do cliente que possa existir entre o seu cliente e o endpoint da API. Para pedidos não em streaming, este valor é uma estimativa. Por favor, consulte o seu próprio registo para um rastreio de latência otimizado. |
TimeToResponse |
No | Milissegundos | Mínimo, Máximo, Médio |
ApiName, OperationName, StreamTypeRegion, , ModelDeploymentName, , ServiceTierRequestModelVersionStatusCodeModelNameServiceTierResponse |
PT1M | Yes |
|
Tokens por Segundo Enumera a velocidade de geração para uma dada resposta do modelo. O total de tokens gerados é dividido pelo tempo para gerar os tokens, em segundos. Aplica-se a implantações PTU e geridas pela PTU. Para pedidos não em streaming, este valor é uma estimativa. |
TokensPerSecond |
No | Count | Máximo, Mínimo, Médio |
ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, ServiceTierRequest, ServiceTierResponse |
PT1M | Yes |
Categoria: Modelos - Utilização
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Páginas Anotadas Número total de páginas processadas com anotações. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go. |
AnnotatedPages |
No | Count | Total (Quantidade) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
|
Tokens de Entrada de Áudio Número de tokens de prompt áudio processados (entrada) num modelo OpenAI. Aplica-se a implementações de modelos geridos por PTU. |
AudioInputTokens |
No | Count | Total (Quantidade) |
ModelDeploymentName, ModelName, ModelVersion, Region |
PT1M | Yes |
|
Tokens de Saída de Áudio Número de tokens de prompt de áudio gerados (output) num modelo OpenAI. Aplica-se a implementações de modelos geridos por PTU. |
AudioOutputTokens |
No | Count | Total (Quantidade) |
ModelDeploymentName, ModelName, ModelVersion, Region |
PT1M | Yes |
|
Tokens de prompt lidos da cache Número total de tokens lidos da cache. Aplica-se a implementações de modelos Anthropic. Surgiu na secção de utilização de resposta como cache_read_input_tokens |
cacheReadInputTokens |
No | Count | Total (Quantidade) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersion, ContextLength |
PT1M | Yes |
|
Tokens de prompt escritos para cache (TTL de 1 hora) O número de tokens de prompt usados para criar a entrada de 1 hora. Aplica-se a implementações de modelos Anthropic. Surgiu na secção de utilização de resposta como cache_creation.ephemeral_1h_input_tokens |
ephemeral1hInputTokens |
No | Count | Total (Quantidade) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersion, ContextLength |
PT1M | Yes |
|
Tokens de prompt escritos para cache (TTL de 5 minutos) O número de tokens de prompt usados para criar a entrada do cache de 5 minutos. Aplica-se a implementações de modelos Anthropic. Surgiu na secção de utilização de resposta como cache_creation.ephemeral_5m_input_tokens |
ephemeral5mInputTokens |
No | Count | Total (Quantidade) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersion, ContextLength |
PT1M | Yes |
|
Imagens Geradas Número total de imagens geradas. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go. |
GeneratedImages |
No | Count | Total (Quantidade) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
|
Tokens de Entrada Número de tokens de prompt processados (entrada) num modelo. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go. |
InputTokens |
No | Count | Total (Quantidade) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
|
Tokens de saída Número de tokens gerados (output) a partir de um modelo OpenAI. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go. |
OutputTokens |
No | Count | Total (Quantidade) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
|
Utilização provisionada Utilização % para uma implantação gerida provisionalmente, calculada como (PTUs consumidas / PTUs implantadas) x 100. Quando a utilização é maior ou igual a 100%, as chamadas são limitadas e o código de erro 429 é devolvido. |
ProvisionedUtilization |
No | Percentagem | Mínimo, Máximo, Médio |
Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | No |
|
Total de Páginas Número total de páginas processadas. Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go. |
TotalPages |
No | Count | Total (Quantidade) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
|
Total Tokens Número de tokens de inferência processados num modelo. Calculado como tokens de prompt (entrada) mais tokens gerados (output). Aplica-se a implantações PTU, PTU-Managed e Pay-as-you-go. |
TotalTokens |
No | Count | Total (Quantidade) |
ApiName, Region, ModelDeploymentName, ModelName, ModelVersion |
PT1M | Yes |
Categoria: Serviços de Voz - Utilização
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Segundos de Áudio Transcritos em Lote Número de segundos em lote transcritos |
AudioSecondsBatchTranscribed |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Segundos de Áudio Sussurros em Batch Transcritos Número de segundos do sussurro em lote transcrito |
AudioSecondsBatchWhisperTranscribed |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Segundos de áudio transcritos rapidamente Número rápido de segundos transcrito |
AudioSecondsFastTranscribed |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Áudio Segundos Sussurros Rápidos Transcritos Número de segundos transcrevidos em sussurros rápidos |
AudioSecondsFastWhisperTranscribed |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Segundos de Áudio Transcritos Número de segundos transcritos |
AudioSecondsTranscribed |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Segundos de Áudio Traduzidos Número de segundos traduzidos |
AudioSecondsTranslated |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Modelos Avatar Hosting Seconds Número de segundos. |
AvatarModelHostingSeconds |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Segundos de Treino do Modelo Avatar Número de segundos. |
AvatarModelTrainingSeconds |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Horas de Apresentação do Modelo de Discurso Número de horas de apresentação de modelos de fala |
SpeechModelHostingHours |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Caracteres sintetizados Número de personagens. |
SynthesizedCharacters |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Segundos de Vídeo Sintetizados Número de segundos sintetizados |
VideoSecondsSynthesized |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Tokens de Entrada de Áudio ao Vivo por Voz Número de tokens de entrada áudio, excluindo tokens em cache. |
VoiceLiveAudioInputTokens |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Tokens de Saída de Áudio ao Vivo de Voz Número de tokens de saída áudio. |
VoiceLiveAudioOutputTokens |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Tokens de Entrada de Áudio em Cache de Voz ao Vivo Número de tokens de entrada áudio em cache. |
VoiceLiveCachedAudioInputTokens |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Tokens de Entrada de Texto em Cache Voice Live Número de tokens de entrada de texto em cache. |
VoiceLiveCachedTextInputTokens |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Tokens de Entrada de Texto ao Vivo por Voz Número de tokens de entrada de texto, excluindo tokens em cache. |
VoiceLiveTextInputTokens |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Tokens de Saída de Texto ao Vivo por Voz Número de tokens de saída de texto. |
VoiceLiveTextOutputTokens |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Horas de Apresentação de Modelos de Voz Número de horas. |
VoiceModelHostingHours |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Minutos de Treino de Modelos de Voz Número de minutos. |
VoiceModelTrainingMinutes |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
Categoria: Serviços de Tradução - Utilização
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Caracteres do Documento Traduzidos Número de caracteres no pedido de tradução do documento. |
DocumentCharactersTranslated |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Caracteres Personalizados do Documento Traduzidos Número de caracteres no pedido de tradução de documentos personalizados. |
DocumentCustomCharactersTranslated |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Caracteres de Sincronização de Documentos Traduzidos Número de caracteres no pedido de tradução de documentos (síncrono). |
OneDocumentCharactersTranslated |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Sincronização de Documentos Caracteres Personalizados Traduzidos Número de caracteres no pedido de tradução personalizada de documentos (síncrono). |
OneDocumentCustomCharactersTranslated |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Caracteres de Texto Traduzidos Número de caracteres no pedido de tradução de texto recebido. |
TextCharactersTranslated |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Caracteres Personalizados de Texto Traduzidos Número de caracteres no pedido de tradução de texto personalizado recebido. |
TextCustomCharactersTranslated |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Caracteres treinados por texto Número de caracteres treinados usando tradução de texto. |
TextTrainedCharacters |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Segundo da aplicação Translator Pro Número de segundos de utilização da aplicação Translator Pro. |
TranslatorProAppSeconds |
No | Seconds | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
Categoria: Uso
| Métrico | Nome na API REST | Métricas avançadas de plataforma | Unit | Agregação | Dimensões | Segmentos de tempo | DS Exportar |
|---|---|---|---|---|---|---|---|
|
Imagem Digitalizada Transações Número de Transações de Imagem Digitalizada |
ComputerVisionTransactions |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Tempo de Treino Personalizado de Visão Tempo de treino Custom Vision |
CustomVisionTrainingTime |
No | Seconds | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Transações de Visão Personalizadas Número de transações de previsão do Custom Vision |
CustomVisionTransactions |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Imagens Faciais Treinadas Número de imagens treinadas. 1.000 imagens treinadas por transação. |
FaceImagesTrained |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Rostos Armazenados Número de rostos armazenados, proporcional diariamente. O número de faces armazenadas é reportado diariamente. |
FacesStored |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Transações de Face Número de chamadas API feitas para o serviço Face |
FaceTransactions |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Imagens armazenadas Número de imagens Custom Vision armazenadas. |
ImagesStored |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Eventos Académicos Número de Eventos Aprendidos. |
LearnedEvents |
No | Count | Total (Quantidade) |
IsMatchBaseline, Mode, RunId |
PT1M | Yes |
|
Pedidos de Discurso LUIS Número de pedidos de compreensão de LUIS de fala para intenção |
LUISSpeechRequests |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Pedidos de Texto LUIS Número de pedidos de texto LUIS |
LUISTextRequests |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Recompensas Combinadas Número de recompensas igualadas. |
MatchedRewards |
No | Count | Total (Quantidade) |
Mode, RunId |
PT1M | Yes |
|
Eventos Não Ativados Número de eventos saltados. |
NonActivatedEvents |
No | Count | Total (Quantidade) |
Mode, RunId |
PT1M | Yes |
|
Recompensas Observadas Número de recompensas observadas. |
ObservedRewards |
No | Count | Total (Quantidade) |
Mode, RunId |
PT1M | Yes |
|
Caracteres Processados Número de caracteres processados pelo Leitura Avançada. |
ProcessedCharacters |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Registos de Texto de Saúde Processados Número de registos de texto de saúde processados |
ProcessedHealthTextRecords |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Imagens Processadas Número de imagens processadas |
ProcessedImages |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Páginas Processadas Número de páginas processadas |
ProcessedPages |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Registos de Texto Processados Contagem de registos de texto. |
ProcessedTextRecords |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Registos de Texto de QA Número de registos de texto processados |
QuestionAnsweringTextRecords |
No | Count | Total (Quantidade) |
ApiName, FeatureName, UsageChannel, Region |
PT1M | Yes |
|
Total de Eventos Número de eventos. |
TotalEvents |
No | Count | Total (Quantidade) |
Mode, RunId |
PT1M | Yes |
|
Transações Totais (Descontinuadas) Número total de transações. |
TotalTransactions |
No | Count | Total (Quantidade) | <nenhum> | PT1M | Yes |
Dimensões métricas
Para informações sobre o que são dimensões métricas, veja Métricas multidimensionais.
Este serviço tem as seguintes dimensões associadas às suas métricas.
- ApiName
- Nome da Funcionalidade
- ModelDeploymentName
- Nome do modelo
- ModelVersion
- Nome da operação
- Região
- Código de estado
- StreamType
- UsageChannel
Logs de recursos
Esta secção lista os tipos de registos de recursos que pode recolher para este serviço. A secção retira da lista de tipos de categorias de registos todos os recursos suportados em Azure Monitor.
Registos de recursos suportados para a Microsoft. CognitiveServices/contas
| Categoria | Custos de exportação | Tabela de logs | Suporta o plano básico de registos | Suporta a transformação do tempo de ingestão | Exemplos de consultas |
|---|---|---|---|---|---|
| Audit | No |
AzureDiagnostics Registos de múltiplos recursos do Azure. |
No | No | |
| AzureOpenAIRequestUsage | Yes |
AzureDiagnostics Registos de múltiplos recursos do Azure. |
No | No | |
| EventoNetworkGerenciado | Yes |
AzureDiagnostics Registos de múltiplos recursos do Azure. |
No | No | |
| RequestResponse | No |
AzureDiagnostics Registos de múltiplos recursos do Azure. |
No | No | |
| Rastreio | No |
AzureDiagnostics Registos de múltiplos recursos do Azure. |
No | No |
Tabelas de Logs do Azure Monitor
Esta secção lista as tabelas Azure Monitor Logs relevantes para este serviço, que estão disponíveis para consulta pela Log Analytics usando consultas Kusto. As tabelas contêm dados de registo de recursos e possivelmente mais, dependendo do que é recolhido e encaminhado para elas.
Azure OpenAI microsoft.cognitiveservices/accounts
Registo de atividades
A tabela ligada lista as operações que podem ser registadas no registo de atividades deste serviço. Estas operações são um subconjunto de todas as possíveis operações de fornecedores de recursos no registo de atividade.
Para mais informações sobre o esquema das entradas do registo de atividade, consulte Esquema do Registo de Atividades.
Conteúdo relacionado
- Para uma descrição da monitorização Azure OpenAI, veja Monitor Azure OpenAI.
- Para detalhes sobre monitorização de recursos Azure, consulte Monitorizar recursos Azure com Azure Monitor.