Referencia de datos de monitorización Azure OpenAI

Este artículo contiene toda la información de referencia de monitorización para este servicio.

Para obtener más información sobre los datos que puede recopilar para Azure OpenAI en Microsoft Foundry Models y cómo usarlo, consulte Monitor Azure OpenAI.

Metrics

Esta sección enumera todas las métricas de plataforma recogidas automáticamente para este servicio. Estas métricas también forman parte de la lista global de métricas all de plataforma soportadas en Azure Monitor.

Para información sobre la retención de métricas, véase Azure Monitor Resumen de métricas.

Métricas compatibles para Microsoft. CognitiveServices/cuentas

Supervise las métricas más importantes para Azure OpenAI. Más adelante en este artículo, encontrará una lista más larga de todas las métricas disponibles para este espacio de nombres, que contiene más detalles sobre las métricas de esta lista más corta. Consulte la lista siguiente para obtener la información más up-to-date. El equipo de Azure está trabajando para actualizar las tablas en las secciones siguientes.

Importante

No confundas las métricas de esta sección con la métrica heredada Latency que aparece en Servicios Cognitivos - Solicitudes HTTP más adelante en este artículo. La métrica heredada Latency no está diseñada para cargas de trabajo Azure OpenAI y produce resultados engañosos cuando se usa para diagnosticar latencia Azure OpenAI. Para Azure monitorización de latencia de OpenAI, usa Tiempo de Respuesta (AzureOpenAITimeToResponse), Tiempo hasta el último byte (AzureOpenAITTLTInMS), Tiempo entre Tokens (AzureOpenAINormalizedTBTInMS), o Tiempo normalizado hasta el primer byte (AzureOpenAINormalizedTTFTInMS). Para orientación sobre cómo interpretar estas métricas, véase Rendimiento y latencia.

  • solicitudes de OpenAI de Azure
  • Tokens activos
  • Tokens de Completación Generados
  • Procesado Horas de Entrenamiento FinAjustadas
  • Tokens de Inferencia Procesados
  • Tokens de Prompt Procesados
  • Utilización gestionada por provisiones V2
  • Tasa de coincidencia de la caché de tokens de prompt
  • Tiempo para responder
  • Tiempo entre fichas
  • Tiempo para el último byte
  • Tiempo normalizado hasta el primer byte
  • Fichas por segundo

También puede supervisar las métricas de seguridad de contenido que usan otros servicios relacionados.

  • Volumen bloqueado
  • Volumen perjudicial detectado
  • Posible recuento de usuarios abusivos
  • Evento del Sistema de Seguridad
  • Volumen total enviado para revisión de seguridad

Nota:

La métrica de Utilización gestionada por provisiones ya está obsoleta y ya no se recomienda. Esta métrica se reemplaza por la métrica Uso administrado aprovisionado V2 . Los tokens por segundo, el tiempo de respuesta y el tiempo entre tokens no están disponibles actualmente para las implementaciones estándar.

Referencia rápida: métricas clave por caso de uso

Utiliza esta tabla para encontrar la métrica adecuada para un objetivo específico de monitorización. Para orientación de extremo a extremo sobre cómo interpretar estas métricas, véase Rendimiento y latencia.

Quiero vigilar... Utiliza esta métrica Nombre de la API REST
Tiempo de respuesta total Tiempo para el último byte AzureOpenAITTLTInMS
Respuesta al primer token (streaming) Tiempo para responder AzureOpenAITimeToResponse
Velocidad de generación de tokens Tiempo entre fichas AzureOpenAINormalizedTBTInMS
Eficiencia del primer token normalizada por el tamaño del prompt Tiempo normalizado hasta el primer byte AzureOpenAINormalizedTTFTInMS
Volumen de token de salida por solicitud Tokens de Completación Generados GeneratedTokens
Volumen de token de entrada por solicitud Tokens de Prompt Procesados ProcessedPromptTokens
Utilización de la capacidad de la PTU Utilización gestionada por provisiones V2 AzureOpenAIProvisionedManagedUtilizationV2
Volumen de solicitudes y errores solicitudes de OpenAI de Azure AzureOpenAIRequests

Sugerencia

Siempre empareja una métrica de latencia con una métrica de recuento de tokens. Un aumento de latencia sin un aumento correspondiente en el token podría indicar un problema real. Un aumento de latencia con un aumento proporcional del token es un comportamiento esperado.

Advertencia

Las métricas bajo Servicios Cognitivos - HTTP Requests más adelante en este artículo son métricas heredadas de Servicios Cognitivos y no están diseñadas para cargas de trabajo Azure OpenAI. En particular, la métrica Latency en esa categoría no es la misma que la de Azure métricas de latencia de OpenAI (tiempo hasta responder, tiempo hasta el último byte, tiempo entre tokens, tiempo normalizado hasta el primer byte). Utilizar la métrica heredada Latency para Azure resolución de problemas de OpenAI produce resultados engañosos. Utiliza las métricas de Azure OpenAI que aparecen en esta sección en su lugar.

La siguiente tabla enumera las métricas disponibles para Microsoft. Servicios cognitivos/tipo de recurso.

  • Puede que no todas las columnas estén presentes en todas las tablas.
  • Algunas columnas pueden estar fuera del área de visualización de la página. Seleccione Expandir tabla para ver todas las columnas disponibles.

Encabezados de tabla

  • Categoría - El grupo de métricas o clasificación.
  • Metric - El nombre de visualización de la métrica tal como aparece en el portal Azure.
  • Nombre en la API REST - El nombre de la métrica tal como se refiere en la API REST.
  • Unidad - Unidad de medida.
  • Agregación - El tipo de agregación por defecto. Valores válidos: Promedio (Media), Mínimo (Mínimo), Máximo (Máximo), Total (Suma), Conteo.
  • Dimensiones - Dimensiones disponibles para la métrica.
  • Granos - del TiempoIntervalos en los que se muestrea la métrica. Por ejemplo, PT1M indica que la métrica se muestrea cada minuto, PT30M cada 30 minutos, PT1H cada hora, y así sucesivamente.
  • DS Export- Si la métrica es exportable a Azure Monitor Logs mediante la configuración de diagnóstico. Para información sobre la exportación de métricas, consulte Crear ajustes de diagnóstico en Azure Monitor.

Categoría: Azure OpenAI - Solicitudes HTTP

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Azure AvailabilityRate de OpenAI

Porcentaje de disponibilidad con el siguiente cálculo: (Total de llamadas - errores de servidor)/Total de llamadas. Los errores del servidor incluyen cualquier respuesta >HTTP =500.
AzureOpenAIAvailabilityRate No Porcentaje Mínimo, Máximo, Promedio ApiName, OperationName, Region, StreamType, ModelDeploymentName, , ModelNameModelVersion PT1M No
Azure Solicitudes OpenAI

Número de llamadas realizadas a la API de OpenAI de Azure a lo largo del tiempo. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go. Para desglosar las solicitudes de API, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName, ModelVersion, StatusCode (exitoso, clientes errores, errores del servidor), IsSpillover para información de spillover, ServiceTier, StreamType (solicitudes de streaming vs no streaming) y operación.
AzureOpenAIRequests No Contar Suma (Total) ApiName, OperationName, RegionStreamType, , ModelDeploymentName, , ModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse PT1M

Categoría: Azure OpenAI - Latencia

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Tiempo entre fichas

Para solicitudes de streaming; Tasa de generación de tokens modelo, medida en milisegundos. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go.
AzureOpenAINormalizedTBTInMS No MilliSeconds Máximo, Mínimo, Promedio Region, ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequest, ServiceTierResponse PT1M
Tiempo normalizado hasta el primer byte

Para solicitudes de streaming y no streaming; El tiempo tarda en recibir el primer byte de datos de respuesta después de que la solicitud sea realizada por el modelo, normalizada por el token. Se aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go.
AzureOpenAINormalizedTTFTInMS No MilliSeconds Máximo, Mínimo, Promedio Region, ModelDeploymentName, , ModelName, ModelVersion PT1M
Tiempo para responder

Medida recomendada de latencia (capacidad de respuesta) para solicitudes de streaming. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Se calcula como el tiempo que tarda en aparecer la primera respuesta después de que un usuario envíe un prompt, según lo medido por la pasarela API. Este número aumenta a medida que el tamaño del prompt aumenta y/o disminuye el tamaño del impacto de caché. Para desglosar la métrica de tiempo de respuesta, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName y ModelVersion.

Nota: esta métrica es una aproximación, ya que la latencia medida depende en gran medida de múltiples factores, incluyendo llamadas concurrentes y el patrón general de carga de trabajo. Además, no tiene en cuenta ninguna latencia del lado del cliente que pueda existir entre tu cliente y el endpoint de la API. Por favor, consulta tu propio registro para un seguimiento óptimo de la latencia.
AzureOpenAITimeToResponse No MilliSeconds Mínimo, Máximo, Promedio ApiName, OperationName, RegionStreamType, , ModelDeploymentName, ModelName, ModelVersion,StatusCode PT1M
Fichas por segundo

Enumera la velocidad de generación para la respuesta dada del modelo Azure OpenAI. El total de fichas generadas se divide por el tiempo que se generan en segundos. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go.
AzureOpenAITokenPerSecond No Contar Máximo, Mínimo, Promedio Region, ModelDeploymentName, , ModelName, ModelVersion PT1M
Tiempo para el último byte

Para solicitudes de streaming y no streaming; El tiempo tarda en recibir el último byte de datos de respuesta después de que el modelo realiza la solicitud. Se aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go.
AzureOpenAITTLTInMS No MilliSeconds Máximo, Mínimo, Promedio Region, ModelDeploymentName, , ModelName, ModelVersion PT1M

Categoría: Azure OpenAI - Uso

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Tokens activos

Total de tokens menos tokens almacenados en caché durante un periodo de tiempo. Se aplica a despliegues gestionados por PTU y PTU. Utiliza esta métrica para entender tu utilización basada en TPS o TPM para PTUs y compárala con tus benchmarks para TPS objetivo o TPM para tus escenarios. Para desglosar las solicitudes de API, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName y ModelVersion.
ActiveTokens No Contar Mínimo, Máximo, Promedio, Total (Suma) Region, ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequest, ServiceTierResponse PT1M
Fichas de Completación de Audio

Número de tokens de prompt de audio generados (salida) en un modelo OpenAI. Se aplica a despliegues gestionados por PTU y modelos de pago por uso.
AudioCompletionTokens No Contar Suma (Total) ModelDeploymentName, ModelName, , ModelVersion, Region PT1M
Fichas de Prompt de Audio

Número de tokens de aviso de audio procesados (entrada) en un modelo OpenAI. Se aplica a despliegues gestionados por PTU y modelos de pago por uso.
AudioPromptTokens No Contar Suma (Total) ModelDeploymentName, ModelName, , ModelVersion, Region PT1M
Tasa de coincidencia de la caché de tokens de prompt

Porcentaje de tokens de aviso que llegan a la caché. Se aplica a despliegues gestionados por PTU y PTU.
AzureOpenAIContextTokensCacheMatchRate No Porcentaje Mínimo, Máximo, Promedio Region, ModelDeploymentName, , ModelName, ModelVersion PT1M No
Utilización gestionada por provisiones (obsoleta)

La utilización % para un despliegue gestionado provisionalmente, calculado como (PTUs consumidas / PTUs desplegadas) x 100. Cuando la utilización es mayor o igual a 100%, las llamadas se limitan y se devuelve el código de error 429. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName, ModelVersion y StreamType (Solicitudes de streaming vs no streaming)
AzureOpenAIProvisionedManagedUtilization No Porcentaje Mínimo, Máximo, Promedio Region, StreamType, ModelDeploymentName, , ModelName, ModelVersion PT1M No
Utilización gestionada por provisiones V2

La utilización % para un despliegue gestionado provisionalmente, calculado como (PTUs consumidas / PTUs desplegadas) x 100. Cuando la utilización es mayor o igual a 100%, las llamadas se limitan y se devuelve el código de error 429. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName, ModelVersion y StreamType (Solicitudes de streaming vs no streaming)
AzureOpenAIProvisionedManagedUtilizationV2 No Porcentaje Mínimo, Máximo, Promedio Region, StreamType, ModelDeploymentName, , ModelName, ModelVersion PT1M No
Procesado Horas de Entrenamiento FinAjustadas

Número de horas de entrenamiento procesadas en un modelo OpenAI FineTuned
FineTunedTrainingHours No Contar Suma (Total) ApiName, ModelDeploymentName, FeatureName, , UsageChannel, Region PT1M
Tokens de Completación Generados

Número de tokens generados (salida) a partir de un modelo OpenAI. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName y ModelName.
GeneratedTokens No Contar Suma (Total) ApiName, ModelDeploymentName, FeatureName, UsageChannel, , Region, ModelVersion PT1M
Tokens de Prompt Procesados

Número de tokens de prompt procesados (entrada) en un modelo OpenAI. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName y ModelName.
ProcessedPromptTokens No Contar Suma (Total) ApiName, ModelDeploymentName, FeatureName, UsageChannel, , Region, ModelVersion PT1M
Segundos de API en tiempo real utilizados

Número de segundos usados en RealtimeAPI.
RealtimeUsageTime No Contar Suma (Total) Region, ModelDeploymentName PT1M
Tokens de Inferencia Procesados

Número de tokens de inferencia procesados en un modelo OpenAI. Calculado como tokens de prompt (entrada) más tokens generados (salida). Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName y ModelName.
TokenTransaction No Contar Suma (Total) ApiName, ModelDeploymentName, FeatureName, UsageChannel, , Region, ModelVersion PT1M

Categoría: Servicios cognitivos - Solicitudes HTTP

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Llamadas bloqueadas

Número de llamadas que superaron el límite de tasa o cuota. No usar para el servicio OpenAI de Azure.
BlockedCalls No Contar Suma (Total) ApiName, OperationName, , Region, RatelimitKey PT1M
Errores de cliente

Número de llamadas con error en el lado del cliente (código de respuesta HTTP 4xx). No usar para el servicio OpenAI de Azure.
ClientErrors No Contar Suma (Total) ApiName, OperationName, , Region, RatelimitKey PT1M
Entrada de datos

Tamaño de los datos entrantes en bytes. No usar para el servicio OpenAI de Azure.
DataIn No Bytes Suma (Total) ApiName, , OperationName, Region PT1M
Salida de datos

Tamaño de los datos salientes en bytes. No usar para el servicio OpenAI de Azure.
DataOut No Bytes Suma (Total) ApiName, , OperationName, Region PT1M
Latencia

Latencia en milisegundos. No usar para el servicio OpenAI de Azure.
Latency No MilliSeconds Average ApiName, OperationName, , Region, RatelimitKey PT1M
Ratelimit

El límite de velocidad actual de la clave límite de velocidad. No usar para el servicio OpenAI de Azure.
Ratelimit No Contar Suma (Total) Region, RatelimitKey PT1M
Errores del servidor

Número de llamadas con error interno del servicio (código de respuesta HTTP 5xx). No usar para el servicio OpenAI de Azure.
ServerErrors No Contar Suma (Total) ApiName, OperationName, , Region, RatelimitKey PT1M
Llamadas exitosas

Número de llamadas exitosas. No usar para el servicio OpenAI de Azure.
SuccessfulCalls No Contar Suma (Total) ApiName, OperationName, , Region, RatelimitKey PT1M
Total de llamadas

Número total de llamadas. No usar para el servicio OpenAI de Azure.
TotalCalls No Contar Suma (Total) ApiName, OperationName, , Region, RatelimitKey PT1M
Total de errores

Número total de llamadas con respuesta de error (código de respuesta HTTP 4xx o 5xx). No usar para el servicio OpenAI de Azure.
TotalErrors No Contar Suma (Total) ApiName, OperationName, , Region, RatelimitKey PT1M
Total de llamadas de token

Número total de llamadas a tokens.
TotalTokenCalls No Contar Suma (Total) ApiName, , OperationName, Region PT1M

Categoría: Servicios Cognitivos - SLI

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
AvailabilityRate

Porcentaje de disponibilidad con el siguiente cálculo: (Total de llamadas - errores de servidor)/Total de llamadas. Los errores del servidor incluyen cualquier respuesta >HTTP =500. No usar para el servicio OpenAI de Azure.
SuccessRate No Porcentaje Mínimo, Máximo, Promedio ApiName, OperationName, , Region, RatelimitKey PT1M No

Categoría: Comprensión de contenidos - Uso

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Transacciones faciales

Número de llamadas a la API realizadas a Face Service
FaceApiTransactions No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Minutos de audio procesados

Minutos de audio procesados
ProcessedAudioMinutes No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Páginas procesadas

Número de páginas de documento procesadas
ProcessedDocumentPages No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Imágenes procesadas

Número de imágenes procesadas
ProcessedImageCount No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Minutos de vídeo procesados

Minutos de vídeo procesados
ProcessedVideoMinutes No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Tokens

Número de tokens consumidos
Tokens No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M

Categoría: ContenidoSeguridad - Riesgos y Seguridad

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Volumen perjudicial detectado

Número de llamadas realizadas a la API de OpenAI de Azure y detectadas como dañinas (tanto en modelo de bloques como en modo de anotación) mediante el filtro de contenido aplicado durante un periodo de tiempo. Puedes añadir un filtro o aplicar la división por las siguientes dimensiones: NombreDeDespliegue, NombreModelo y TipoTexto.
RAIHarmfulRequests No Contar Suma (Total) Region, ModelDeploymentName, ModelNameModelVersion, , ApiName, TextType, Category,Severity PT1M
Volumen bloqueado

Número de llamadas realizadas a la API de OpenAI de Azure y rechazadas por el filtro de contenido aplicado durante un periodo de tiempo. Puedes añadir un filtro o aplicar la división por las siguientes dimensiones: NombreDeDespliegue, NombreModelo y TipoTexto.
RAIRejectedRequests No Contar Suma (Total) Region, ModelDeploymentName, ModelName, ModelVersion, ApiName, , TextTypeCategory PT1M
Evento del Sistema de Seguridad

Evento del sistema para riesgos y monitorización de seguridad. Puedes añadir un filtro o aplicar la división por la siguiente dimensión: EventType.
RAISystemEvent No Contar Average Region, EventType PT1M
Volumen total enviado para control de seguridad

Número de llamadas realizadas a la API de OpenAI de Azure y detectadas por un filtro de contenido aplicado durante un periodo de tiempo. Puedes añadir un filtro o aplicar la división por las siguientes dimensiones: NombreDeDespliegueModelo, NombreModelo.
RAITotalRequests No Contar Suma (Total) Region, ModelDeploymentName, ModelName, , ModelVersion, ApiName PT1M

Categoría: Contenido Seguridad - Uso

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Recuento de llamadas para moderación de imágenes

Número de llamadas a la moderación de imágenes.
ContentSafetyImageAnalyzeRequestCount No Contar Suma (Total) ApiVersion PT1M
Recuento de llamadas para moderación de mensajes de texto

Número de llamadas a la moderación de texto.
ContentSafetyTextAnalyzeRequestCount No Contar Suma (Total) ApiVersion PT1M

Categoría: Idioma - Empleos

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Duración del puesto (Vista previa)

Nota: este valor depende en gran medida del tamaño de entrada, el número de documentos y la complejidad de la tarea. Este es un valor agregado para todas las tareas del puesto.
JobDuration No MilliSeconds Mínimo, Máximo, Promedio JobStatus, JobType PT1M

Categoría: Modelos - Peticiones HTTP

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Tasa de disponibilidad de modelos

Porcentaje de disponibilidad con el siguiente cálculo: (Total de llamadas - errores de servidor)/Total de llamadas. Los errores del servidor incluyen cualquier respuesta >HTTP =500.
ModelAvailabilityRate No Porcentaje Mínimo, Máximo, Promedio Region, ModelDeploymentName, , ModelName, ModelVersion PT1M No
Solicitudes de modelo

Número de llamadas realizadas a la API del modelo a lo largo del tiempo. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go.
ModelRequests No Contar Suma (Total) ApiName, OperationName, RegionStreamType, , ModelDeploymentName, , ModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse PT1M

Categoría: Modelos - Latencia

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Tiempo entre fichas

Tasa de generación de tokens modelo, medida en milisegundos. Se aplica a despliegues gestionados por PTU y PTU. Para solicitudes no en streaming, este valor es una estimación.
NormalizedTimeBetweenTokens No MilliSeconds Máximo, Mínimo, Promedio ApiName, OperationName, Region, StreamType, ModelDeploymentName, , ModelNameModelVersion PT1M
Tiempo normalizado hasta el primer byte

El tiempo que tarda en recibir el primer byte de datos de respuesta después de que la solicitud se realiza por el modelo, normalizada por el token. Se aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para solicitudes no en streaming, este valor es una estimación.
NormalizedTimeToFirstToken No MilliSeconds Máximo, Mínimo, Promedio ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse PT1M
Tiempo para el último byte

Tiempo que tarda en recibir el último byte de datos de respuesta después de que el modelo realiza la solicitud. Se aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para solicitudes no en streaming, este valor es una estimación.
TimeToLastByte No MilliSeconds Máximo, Mínimo, Promedio ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse PT1M
Tiempo para responder

Medida recomendada de latencia (respuesta). Se aplica a despliegues gestionados por PTU y PTU. Se calcula como el tiempo que tarda en aparecer la primera respuesta después de que un usuario envíe un prompt, según lo medido por la pasarela API. Este número aumenta a medida que el tamaño del prompt aumenta y/o disminuye el tamaño del impacto de caché. Para desglosar la métrica de tiempo de respuesta, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName y ModelVersion.

Nota: esta métrica es una aproximación, ya que la latencia medida depende en gran medida de múltiples factores, incluyendo llamadas concurrentes y el patrón general de carga de trabajo. Además, no tiene en cuenta ninguna latencia del lado del cliente que pueda existir entre tu cliente y el endpoint de la API. Para solicitudes no en streaming, este valor es una estimación. Por favor, consulta tu propio registro para un seguimiento óptimo de la latencia.
TimeToResponse No MilliSeconds Mínimo, Máximo, Promedio ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, StatusCode, ServiceTierRequest, ServiceTierResponse PT1M
Fichas por segundo

Enumera la velocidad de generación para una respuesta dada del modelo. El total de fichas generadas se divide por el tiempo que se generan en segundos. Se aplica a despliegues gestionados por PTU y PTU. Para solicitudes no en streaming, este valor es una estimación.
TokensPerSecond No Contar Máximo, Mínimo, Promedio ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse PT1M

Categoría: Modelos - Uso

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Páginas anotadas

Número total de páginas procesadas con anotaciones. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go.
AnnotatedPages No Contar Suma (Total) ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion PT1M
Tokens de entrada de audio

Número de tokens de aviso de audio procesados (entrada) en un modelo OpenAI. Se aplica a despliegues de modelos gestionados por PTU.
AudioInputTokens No Contar Suma (Total) ModelDeploymentName, ModelName, , ModelVersion, Region PT1M
Fichas de salida de audio

Número de tokens de prompt de audio generados (salida) en un modelo OpenAI. Se aplica a despliegues de modelos gestionados por PTU.
AudioOutputTokens No Contar Suma (Total) ModelDeploymentName, ModelName, , ModelVersion, Region PT1M
Tokens de prompt leídos desde la caché

Número total de tokens leídos de la caché. Se aplica a despliegues de modelos Anthropic. Apareció en la sección de uso de respuesta como cache_read_input_tokens
cacheReadInputTokens No Contar Suma (Total) ApiName, Region, ModelDeploymentName, ModelName, , ModelVersion, ContextLength PT1M
Tokens de aviso escritos en caché (TTL de 1 hora)

El número de fichas de prompt usadas para crear la entrada de 1 hora. Se aplica a despliegues de modelos Anthropic. Apareció en la sección de uso de respuesta como cache_creation.ephemeral_1h_input_tokens
ephemeral1hInputTokens No Contar Suma (Total) ApiName, Region, ModelDeploymentName, ModelName, , ModelVersion, ContextLength PT1M
Tokens de aviso escritos en caché (TTL de 5 minutos)

El número de tokens de prompt usados para crear la entrada de caché de 5 minutos. Se aplica a despliegues de modelos Anthropic. Apareció en la sección de uso de respuesta como cache_creation.ephemeral_5m_input_tokens
ephemeral5mInputTokens No Contar Suma (Total) ApiName, Region, ModelDeploymentName, ModelName, , ModelVersion, ContextLength PT1M
Imágenes generadas

Número total de imágenes generadas. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go.
GeneratedImages No Contar Suma (Total) ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion PT1M
Tokens de entrada

Número de tokens de aviso procesados (entrada) en un modelo. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go.
InputTokens No Contar Suma (Total) ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion PT1M
Tokens de salida

Número de tokens generados (salida) a partir de un modelo OpenAI. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go.
OutputTokens No Contar Suma (Total) ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion PT1M
Uso aprovisionado

La utilización % para un despliegue gestionado provisionalmente, calculado como (PTUs consumidas / PTUs desplegadas) x 100. Cuando la utilización es mayor o igual a 100%, las llamadas se limitan y se devuelve el código de error 429.
ProvisionedUtilization No Porcentaje Mínimo, Máximo, Promedio Region, ModelDeploymentName, , ModelName, ModelVersion PT1M No
Total de páginas

Número total de páginas procesadas. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go.
TotalPages No Contar Suma (Total) ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion PT1M
Total Tokens

Número de tokens de inferencia procesados en un modelo. Calculado como tokens de prompt (entrada) más tokens generados (salida). Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go.
TotalTokens No Contar Suma (Total) ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion PT1M

Categoría: Servicios de Voz - Uso

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Audio Seconds Transcrito por lotes

Número de segundos por lote transcritos
AudioSecondsBatchTranscribed No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Segundos de audio transcrito por susurros por lote

Número de segundos transcritos por susurros por lote
AudioSecondsBatchWhisperTranscribed No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Segundos de audio transcritos rápidamente

Número rápido de segundos transcrito
AudioSecondsFastTranscribed No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Segundos de audio Fast Whisper transcrito

Susurro rápido de segundos transcrito
AudioSecondsFastWhisperTranscribed No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Segundos de audio transcritos

Número de segundos transcritos
AudioSecondsTranscribed No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Segundos de audio traducidos

Número de segundos traducidos
AudioSecondsTranslated No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Segundos de hosting del modelo de avatar

Número de segundos.
AvatarModelHostingSeconds No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Segundos de entrenamiento del modelo Avatar

Número de segundos.
AvatarModelTrainingSeconds No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Horario de presentación del Modelo de Oratoria

Número de horas de presentación del modelo de voz
SpeechModelHostingHours No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Caracteres sintetizados

Número de caracteres.
SynthesizedCharacters No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Videosegundos sintetizados

Número de segundos sintetizados
VideoSecondsSynthesized No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Tokens de entrada de audio en directo por voz

Número de tokens de entrada de audio, excluyendo tokens almacenados en caché.
VoiceLiveAudioInputTokens No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Tokens de salida de audio en directo de voz

Número de tokens de salida de audio.
VoiceLiveAudioOutputTokens No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Tokens de entrada de audio en caché en vivo por voz

Número de tokens de entrada de audio almacenados en caché.
VoiceLiveCachedAudioInputTokens No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Tokens de entrada de texto en caché en vivo por voz

Número de tokens de entrada de texto almacenados en caché.
VoiceLiveCachedTextInputTokens No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Tokens de entrada de texto en vivo por voz

Número de tokens de entrada de texto, excluyendo los tokens almacenados en caché.
VoiceLiveTextInputTokens No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Tokens de salida de texto en vivo por voz

Número de tokens de salida de texto.
VoiceLiveTextOutputTokens No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Horario de presentación de modelos de voz

Número de horas.
VoiceModelHostingHours No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Minutos de entrenamiento de modelos de voz

Número de minutos.
VoiceModelTrainingMinutes No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M

Categoría: Servicios de traductor - Uso

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Caracteres del documento traducidos

Número de caracteres en la solicitud de traducción del documento.
DocumentCharactersTranslated No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Caracteres personalizados del documento traducidos

Número de caracteres en la solicitud de traducción de documentos personalizados.
DocumentCustomCharactersTranslated No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Caracteres de sincronización de documentos traducidos

Número de caracteres en la solicitud de traducción de documentos (síncrona).
OneDocumentCharactersTranslated No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Sincronización de documentos Caracteres personalizados traducidos

Número de caracteres en la solicitud de traducción de documentos personalizados (síncrona).
OneDocumentCustomCharactersTranslated No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Caracteres de texto traducidos

Número de caracteres en la solicitud de traducción de texto entrante.
TextCharactersTranslated No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Caracteres personalizados de texto traducidos

Número de caracteres en la solicitud entrante de traducción de texto personalizada.
TextCustomCharactersTranslated No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Caracteres entrenados en texto

Número de caracteres entrenados usando traducción de texto.
TextTrainedCharacters No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Segundo de la aplicación Translator Pro

Número de segundos de uso de la app Translator Pro.
TranslatorProAppSeconds No Seconds Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M

Categoría: uso

Métrica Nombre en la API REST Métricas avanzadas de la plataforma Unidad Aggregation Dimensiones Granulos de tiempo Exportación de DS
Transacciones de Computer Vision

Número de transacciones de Computer Vision
ComputerVisionTransactions No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Tiempo de entrenamiento visual personalizado

Tiempo de entrenamiento de Visión Personalizada
CustomVisionTrainingTime No Seconds Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Transacciones de visión personalizadas

Número de transacciones de predicción de Visión Personalizada
CustomVisionTransactions No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Imágenes faciales entrenadas

Número de imágenes entrenadas. 1.000 imágenes entrenadas por transacción.
FaceImagesTrained No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Caras almacenadas

Número de caras almacenadas, prorrateado diariamente. El número de caras almacenadas se informa diariamente.
FacesStored No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Transacciones faciales

Número de llamadas a la API realizadas a Face Service
FaceTransactions No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Imágenes almacenadas

Número de imágenes Custom Vision almacenadas.
ImagesStored No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Eventos aprendidos

Número de Eventos Aprendidos.
LearnedEvents No Contar Suma (Total) IsMatchBaseline, , Mode, RunId PT1M
Solicitudes de Discurso LUIS

Número de solicitudes de comprensión de LUIS de voz a intención
LUISSpeechRequests No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Solicitudes de texto LUIS

Número de solicitudes de texto LUIS
LUISTextRequests No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Recompensas coincidentes

Número de recompensas igualadas.
MatchedRewards No Contar Suma (Total) Mode, RunId PT1M
Eventos No Activados

Número de eventos saltados.
NonActivatedEvents No Contar Suma (Total) Mode, RunId PT1M
Recompensas observadas

Número de recompensas observadas.
ObservedRewards No Contar Suma (Total) Mode, RunId PT1M
Caracteres procesados

Número de caracteres procesados por Immersive Reader.
ProcessedCharacters No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Registros de Texto de Salud Procesados

Número de registros de texto sanitario procesados
ProcessedHealthTextRecords No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Imágenes procesadas

Número de imágenes procesadas
ProcessedImages No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Páginas procesadas

Número de páginas procesadas
ProcessedPages No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Registros de texto procesados

Recuento de registros de texto.
ProcessedTextRecords No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
Registros de texto de QA

Número de registros de texto procesados
QuestionAnsweringTextRecords No Contar Suma (Total) ApiName, FeatureName, , UsageChannel, Region PT1M
N.º total de eventos

Número de eventos.
TotalEvents No Contar Suma (Total) Mode, RunId PT1M
Total de transacciones (obsoletas)

Número total de transacciones.
TotalTransactions No Contar Suma (Total) <ninguno> PT1M

Dimensiones métricas

Para información sobre qué son las dimensiones métricas, véase Métricas multidimensionales.

Este servicio tiene las siguientes dimensiones asociadas a sus métricas.

  • ApiName
  • FeatureName
  • ModelDeploymentName
  • NombreDelModelo
  • ModelVersion
  • NombreDeOperación
  • Region
  • Código de estado
  • StreamType
  • UsageChannel

Registros de recursos

Esta sección enumera los tipos de registros de recursos que puedes recopilar para este servicio. La sección extrae de la lista de tipos de categorías de registros todos los recursos soportados en Azure Monitor.

Registros de recursos compatibles para Microsoft. CognitiveServices/cuentas

Category Costes de exportación Tabla de registro Soporta un plan básico de registros Soporta la transformación en tiempo de ingestión Consultas de ejemplo
Auditoría No AzureDiagnostics

Registros de múltiples recursos de Azure.

No No
AzureOpenAIRequestUsage AzureDiagnostics

Registros de múltiples recursos de Azure.

No No
ManagedNetworkEvent AzureDiagnostics

Registros de múltiples recursos de Azure.

No No
RequestResponse No AzureDiagnostics

Registros de múltiples recursos de Azure.

No No
Seguimiento No AzureDiagnostics

Registros de múltiples recursos de Azure.

No No

Tablas de registros de Azure Monitor

Esta sección enumera las tablas de Azure Monitor Logs relevantes para este servicio, que están disponibles para consulta por Log Analytics usando consultas Kusto. Las tablas contienen datos de registros de recursos y posiblemente más, dependiendo de lo que se recopile y se les envíe.

Azure OpenAI microsoft.cognitiveservices/accounts

Registro de actividad

La tabla enlazada lista las operaciones que pueden registrarse en el registro de actividad de este servicio. Estas operaciones son un subconjunto de todas las posibles operaciones de proveedor de recursos en el registro de actividad.

Para más información sobre el esquema de las entradas del registro de actividad, véase Esquema del registro de actividades.