Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Este artículo contiene toda la información de referencia de monitorización para este servicio.
Para obtener más información sobre los datos que puede recopilar para Azure OpenAI en Microsoft Foundry Models y cómo usarlo, consulte Monitor Azure OpenAI.
Metrics
Esta sección enumera todas las métricas de plataforma recogidas automáticamente para este servicio. Estas métricas también forman parte de la lista global de métricas all de plataforma soportadas en Azure Monitor.
Para información sobre la retención de métricas, véase Azure Monitor Resumen de métricas.
Métricas compatibles para Microsoft. CognitiveServices/cuentas
Supervise las métricas más importantes para Azure OpenAI. Más adelante en este artículo, encontrará una lista más larga de todas las métricas disponibles para este espacio de nombres, que contiene más detalles sobre las métricas de esta lista más corta. Consulte la lista siguiente para obtener la información más up-to-date. El equipo de Azure está trabajando para actualizar las tablas en las secciones siguientes.
Importante
No confundas las métricas de esta sección con la métrica heredada Latency que aparece en Servicios Cognitivos - Solicitudes HTTP más adelante en este artículo. La métrica heredada Latency no está diseñada para cargas de trabajo Azure OpenAI y produce resultados engañosos cuando se usa para diagnosticar latencia Azure OpenAI. Para Azure monitorización de latencia de OpenAI, usa Tiempo de Respuesta (AzureOpenAITimeToResponse), Tiempo hasta el último byte (AzureOpenAITTLTInMS), Tiempo entre Tokens (AzureOpenAINormalizedTBTInMS), o Tiempo normalizado hasta el primer byte (AzureOpenAINormalizedTTFTInMS). Para orientación sobre cómo interpretar estas métricas, véase Rendimiento y latencia.
- solicitudes de OpenAI de Azure
- Tokens activos
- Tokens de Completación Generados
- Procesado Horas de Entrenamiento FinAjustadas
- Tokens de Inferencia Procesados
- Tokens de Prompt Procesados
- Utilización gestionada por provisiones V2
- Tasa de coincidencia de la caché de tokens de prompt
- Tiempo para responder
- Tiempo entre fichas
- Tiempo para el último byte
- Tiempo normalizado hasta el primer byte
- Fichas por segundo
También puede supervisar las métricas de seguridad de contenido que usan otros servicios relacionados.
- Volumen bloqueado
- Volumen perjudicial detectado
- Posible recuento de usuarios abusivos
- Evento del Sistema de Seguridad
- Volumen total enviado para revisión de seguridad
Nota:
La métrica de Utilización gestionada por provisiones ya está obsoleta y ya no se recomienda. Esta métrica se reemplaza por la métrica Uso administrado aprovisionado V2 . Los tokens por segundo, el tiempo de respuesta y el tiempo entre tokens no están disponibles actualmente para las implementaciones estándar.
Referencia rápida: métricas clave por caso de uso
Utiliza esta tabla para encontrar la métrica adecuada para un objetivo específico de monitorización. Para orientación de extremo a extremo sobre cómo interpretar estas métricas, véase Rendimiento y latencia.
| Quiero vigilar... | Utiliza esta métrica | Nombre de la API REST |
|---|---|---|
| Tiempo de respuesta total | Tiempo para el último byte | AzureOpenAITTLTInMS |
| Respuesta al primer token (streaming) | Tiempo para responder | AzureOpenAITimeToResponse |
| Velocidad de generación de tokens | Tiempo entre fichas | AzureOpenAINormalizedTBTInMS |
| Eficiencia del primer token normalizada por el tamaño del prompt | Tiempo normalizado hasta el primer byte | AzureOpenAINormalizedTTFTInMS |
| Volumen de token de salida por solicitud | Tokens de Completación Generados | GeneratedTokens |
| Volumen de token de entrada por solicitud | Tokens de Prompt Procesados | ProcessedPromptTokens |
| Utilización de la capacidad de la PTU | Utilización gestionada por provisiones V2 | AzureOpenAIProvisionedManagedUtilizationV2 |
| Volumen de solicitudes y errores | solicitudes de OpenAI de Azure | AzureOpenAIRequests |
Sugerencia
Siempre empareja una métrica de latencia con una métrica de recuento de tokens. Un aumento de latencia sin un aumento correspondiente en el token podría indicar un problema real. Un aumento de latencia con un aumento proporcional del token es un comportamiento esperado.
Advertencia
Las métricas bajo Servicios Cognitivos - HTTP Requests más adelante en este artículo son métricas heredadas de Servicios Cognitivos y no están diseñadas para cargas de trabajo Azure OpenAI. En particular, la métrica Latency en esa categoría no es la misma que la de Azure métricas de latencia de OpenAI (tiempo hasta responder, tiempo hasta el último byte, tiempo entre tokens, tiempo normalizado hasta el primer byte). Utilizar la métrica heredada Latency para Azure resolución de problemas de OpenAI produce resultados engañosos. Utiliza las métricas de Azure OpenAI que aparecen en esta sección en su lugar.
La siguiente tabla enumera las métricas disponibles para Microsoft. Servicios cognitivos/tipo de recurso.
- Puede que no todas las columnas estén presentes en todas las tablas.
- Algunas columnas pueden estar fuera del área de visualización de la página. Seleccione Expandir tabla para ver todas las columnas disponibles.
Encabezados de tabla
- Categoría - El grupo de métricas o clasificación.
- Metric - El nombre de visualización de la métrica tal como aparece en el portal Azure.
- Nombre en la API REST - El nombre de la métrica tal como se refiere en la API REST.
- Unidad - Unidad de medida.
- Agregación - El tipo de agregación por defecto. Valores válidos: Promedio (Media), Mínimo (Mínimo), Máximo (Máximo), Total (Suma), Conteo.
- Dimensiones - Dimensiones disponibles para la métrica.
-
Granos - del TiempoIntervalos en los que se muestrea la métrica. Por ejemplo,
PT1Mindica que la métrica se muestrea cada minuto,PT30Mcada 30 minutos,PT1Hcada hora, y así sucesivamente. - DS Export- Si la métrica es exportable a Azure Monitor Logs mediante la configuración de diagnóstico. Para información sobre la exportación de métricas, consulte Crear ajustes de diagnóstico en Azure Monitor.
Categoría: Azure OpenAI - Solicitudes HTTP
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Azure AvailabilityRate de OpenAI Porcentaje de disponibilidad con el siguiente cálculo: (Total de llamadas - errores de servidor)/Total de llamadas. Los errores del servidor incluyen cualquier respuesta >HTTP =500. |
AzureOpenAIAvailabilityRate |
No | Porcentaje | Mínimo, Máximo, Promedio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, , ModelNameModelVersion |
PT1M | No |
|
Azure Solicitudes OpenAI Número de llamadas realizadas a la API de OpenAI de Azure a lo largo del tiempo. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go. Para desglosar las solicitudes de API, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName, ModelVersion, StatusCode (exitoso, clientes errores, errores del servidor), IsSpillover para información de spillover, ServiceTier, StreamType (solicitudes de streaming vs no streaming) y operación. |
AzureOpenAIRequests |
No | Contar | Suma (Total) |
ApiName, OperationName, RegionStreamType, , ModelDeploymentName, , ModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse |
PT1M | Sí |
Categoría: Azure OpenAI - Latencia
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Tiempo entre fichas Para solicitudes de streaming; Tasa de generación de tokens modelo, medida en milisegundos. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. |
AzureOpenAINormalizedTBTInMS |
No | MilliSeconds | Máximo, Mínimo, Promedio |
Region, ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequest, ServiceTierResponse |
PT1M | Sí |
|
Tiempo normalizado hasta el primer byte Para solicitudes de streaming y no streaming; El tiempo tarda en recibir el primer byte de datos de respuesta después de que la solicitud sea realizada por el modelo, normalizada por el token. Se aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. |
AzureOpenAINormalizedTTFTInMS |
No | MilliSeconds | Máximo, Mínimo, Promedio |
Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | Sí |
|
Tiempo para responder Medida recomendada de latencia (capacidad de respuesta) para solicitudes de streaming. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Se calcula como el tiempo que tarda en aparecer la primera respuesta después de que un usuario envíe un prompt, según lo medido por la pasarela API. Este número aumenta a medida que el tamaño del prompt aumenta y/o disminuye el tamaño del impacto de caché. Para desglosar la métrica de tiempo de respuesta, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName y ModelVersion. Nota: esta métrica es una aproximación, ya que la latencia medida depende en gran medida de múltiples factores, incluyendo llamadas concurrentes y el patrón general de carga de trabajo. Además, no tiene en cuenta ninguna latencia del lado del cliente que pueda existir entre tu cliente y el endpoint de la API. Por favor, consulta tu propio registro para un seguimiento óptimo de la latencia. |
AzureOpenAITimeToResponse |
No | MilliSeconds | Mínimo, Máximo, Promedio |
ApiName, OperationName, RegionStreamType, , ModelDeploymentName, ModelName, ModelVersion,StatusCode |
PT1M | Sí |
|
Fichas por segundo Enumera la velocidad de generación para la respuesta dada del modelo Azure OpenAI. El total de fichas generadas se divide por el tiempo que se generan en segundos. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. |
AzureOpenAITokenPerSecond |
No | Contar | Máximo, Mínimo, Promedio |
Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | Sí |
|
Tiempo para el último byte Para solicitudes de streaming y no streaming; El tiempo tarda en recibir el último byte de datos de respuesta después de que el modelo realiza la solicitud. Se aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. |
AzureOpenAITTLTInMS |
No | MilliSeconds | Máximo, Mínimo, Promedio |
Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | Sí |
Categoría: Azure OpenAI - Uso
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Tokens activos Total de tokens menos tokens almacenados en caché durante un periodo de tiempo. Se aplica a despliegues gestionados por PTU y PTU. Utiliza esta métrica para entender tu utilización basada en TPS o TPM para PTUs y compárala con tus benchmarks para TPS objetivo o TPM para tus escenarios. Para desglosar las solicitudes de API, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName y ModelVersion. |
ActiveTokens |
No | Contar | Mínimo, Máximo, Promedio, Total (Suma) |
Region, ModelDeploymentName, ModelName, ModelVersion, , ServiceTierRequest, ServiceTierResponse |
PT1M | Sí |
|
Fichas de Completación de Audio Número de tokens de prompt de audio generados (salida) en un modelo OpenAI. Se aplica a despliegues gestionados por PTU y modelos de pago por uso. |
AudioCompletionTokens |
No | Contar | Suma (Total) |
ModelDeploymentName, ModelName, , ModelVersion, Region |
PT1M | Sí |
|
Fichas de Prompt de Audio Número de tokens de aviso de audio procesados (entrada) en un modelo OpenAI. Se aplica a despliegues gestionados por PTU y modelos de pago por uso. |
AudioPromptTokens |
No | Contar | Suma (Total) |
ModelDeploymentName, ModelName, , ModelVersion, Region |
PT1M | Sí |
|
Tasa de coincidencia de la caché de tokens de prompt Porcentaje de tokens de aviso que llegan a la caché. Se aplica a despliegues gestionados por PTU y PTU. |
AzureOpenAIContextTokensCacheMatchRate |
No | Porcentaje | Mínimo, Máximo, Promedio |
Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | No |
|
Utilización gestionada por provisiones (obsoleta) La utilización % para un despliegue gestionado provisionalmente, calculado como (PTUs consumidas / PTUs desplegadas) x 100. Cuando la utilización es mayor o igual a 100%, las llamadas se limitan y se devuelve el código de error 429. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName, ModelVersion y StreamType (Solicitudes de streaming vs no streaming) |
AzureOpenAIProvisionedManagedUtilization |
No | Porcentaje | Mínimo, Máximo, Promedio |
Region, StreamType, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | No |
|
Utilización gestionada por provisiones V2 La utilización % para un despliegue gestionado provisionalmente, calculado como (PTUs consumidas / PTUs desplegadas) x 100. Cuando la utilización es mayor o igual a 100%, las llamadas se limitan y se devuelve el código de error 429. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName, ModelVersion y StreamType (Solicitudes de streaming vs no streaming) |
AzureOpenAIProvisionedManagedUtilizationV2 |
No | Porcentaje | Mínimo, Máximo, Promedio |
Region, StreamType, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | No |
|
Procesado Horas de Entrenamiento FinAjustadas Número de horas de entrenamiento procesadas en un modelo OpenAI FineTuned |
FineTunedTrainingHours |
No | Contar | Suma (Total) |
ApiName, ModelDeploymentName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Tokens de Completación Generados Número de tokens generados (salida) a partir de un modelo OpenAI. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName y ModelName. |
GeneratedTokens |
No | Contar | Suma (Total) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, , Region, ModelVersion |
PT1M | Sí |
|
Tokens de Prompt Procesados Número de tokens de prompt procesados (entrada) en un modelo OpenAI. Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName y ModelName. |
ProcessedPromptTokens |
No | Contar | Suma (Total) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, , Region, ModelVersion |
PT1M | Sí |
|
Segundos de API en tiempo real utilizados Número de segundos usados en RealtimeAPI. |
RealtimeUsageTime |
No | Contar | Suma (Total) |
Region, ModelDeploymentName |
PT1M | Sí |
|
Tokens de Inferencia Procesados Número de tokens de inferencia procesados en un modelo OpenAI. Calculado como tokens de prompt (entrada) más tokens generados (salida). Aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para desglosar esta métrica, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName y ModelName. |
TokenTransaction |
No | Contar | Suma (Total) |
ApiName, ModelDeploymentName, FeatureName, UsageChannel, , Region, ModelVersion |
PT1M | Sí |
Categoría: Servicios cognitivos - Solicitudes HTTP
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Llamadas bloqueadas Número de llamadas que superaron el límite de tasa o cuota. No usar para el servicio OpenAI de Azure. |
BlockedCalls |
No | Contar | Suma (Total) |
ApiName, OperationName, , Region, RatelimitKey |
PT1M | Sí |
|
Errores de cliente Número de llamadas con error en el lado del cliente (código de respuesta HTTP 4xx). No usar para el servicio OpenAI de Azure. |
ClientErrors |
No | Contar | Suma (Total) |
ApiName, OperationName, , Region, RatelimitKey |
PT1M | Sí |
|
Entrada de datos Tamaño de los datos entrantes en bytes. No usar para el servicio OpenAI de Azure. |
DataIn |
No | Bytes | Suma (Total) |
ApiName, , OperationName, Region |
PT1M | Sí |
|
Salida de datos Tamaño de los datos salientes en bytes. No usar para el servicio OpenAI de Azure. |
DataOut |
No | Bytes | Suma (Total) |
ApiName, , OperationName, Region |
PT1M | Sí |
|
Latencia Latencia en milisegundos. No usar para el servicio OpenAI de Azure. |
Latency |
No | MilliSeconds | Average |
ApiName, OperationName, , Region, RatelimitKey |
PT1M | Sí |
|
Ratelimit El límite de velocidad actual de la clave límite de velocidad. No usar para el servicio OpenAI de Azure. |
Ratelimit |
No | Contar | Suma (Total) |
Region, RatelimitKey |
PT1M | Sí |
|
Errores del servidor Número de llamadas con error interno del servicio (código de respuesta HTTP 5xx). No usar para el servicio OpenAI de Azure. |
ServerErrors |
No | Contar | Suma (Total) |
ApiName, OperationName, , Region, RatelimitKey |
PT1M | Sí |
|
Llamadas exitosas Número de llamadas exitosas. No usar para el servicio OpenAI de Azure. |
SuccessfulCalls |
No | Contar | Suma (Total) |
ApiName, OperationName, , Region, RatelimitKey |
PT1M | Sí |
|
Total de llamadas Número total de llamadas. No usar para el servicio OpenAI de Azure. |
TotalCalls |
No | Contar | Suma (Total) |
ApiName, OperationName, , Region, RatelimitKey |
PT1M | Sí |
|
Total de errores Número total de llamadas con respuesta de error (código de respuesta HTTP 4xx o 5xx). No usar para el servicio OpenAI de Azure. |
TotalErrors |
No | Contar | Suma (Total) |
ApiName, OperationName, , Region, RatelimitKey |
PT1M | Sí |
|
Total de llamadas de token Número total de llamadas a tokens. |
TotalTokenCalls |
No | Contar | Suma (Total) |
ApiName, , OperationName, Region |
PT1M | Sí |
Categoría: Servicios Cognitivos - SLI
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
AvailabilityRate Porcentaje de disponibilidad con el siguiente cálculo: (Total de llamadas - errores de servidor)/Total de llamadas. Los errores del servidor incluyen cualquier respuesta >HTTP =500. No usar para el servicio OpenAI de Azure. |
SuccessRate |
No | Porcentaje | Mínimo, Máximo, Promedio |
ApiName, OperationName, , Region, RatelimitKey |
PT1M | No |
Categoría: Comprensión de contenidos - Uso
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Transacciones faciales Número de llamadas a la API realizadas a Face Service |
FaceApiTransactions |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Minutos de audio procesados Minutos de audio procesados |
ProcessedAudioMinutes |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Páginas procesadas Número de páginas de documento procesadas |
ProcessedDocumentPages |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Imágenes procesadas Número de imágenes procesadas |
ProcessedImageCount |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Minutos de vídeo procesados Minutos de vídeo procesados |
ProcessedVideoMinutes |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Tokens Número de tokens consumidos |
Tokens |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
Categoría: ContenidoSeguridad - Riesgos y Seguridad
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Volumen perjudicial detectado Número de llamadas realizadas a la API de OpenAI de Azure y detectadas como dañinas (tanto en modelo de bloques como en modo de anotación) mediante el filtro de contenido aplicado durante un periodo de tiempo. Puedes añadir un filtro o aplicar la división por las siguientes dimensiones: NombreDeDespliegue, NombreModelo y TipoTexto. |
RAIHarmfulRequests |
No | Contar | Suma (Total) |
Region, ModelDeploymentName, ModelNameModelVersion, , ApiName, TextType, Category,Severity |
PT1M | Sí |
|
Volumen bloqueado Número de llamadas realizadas a la API de OpenAI de Azure y rechazadas por el filtro de contenido aplicado durante un periodo de tiempo. Puedes añadir un filtro o aplicar la división por las siguientes dimensiones: NombreDeDespliegue, NombreModelo y TipoTexto. |
RAIRejectedRequests |
No | Contar | Suma (Total) |
Region, ModelDeploymentName, ModelName, ModelVersion, ApiName, , TextTypeCategory |
PT1M | Sí |
|
Evento del Sistema de Seguridad Evento del sistema para riesgos y monitorización de seguridad. Puedes añadir un filtro o aplicar la división por la siguiente dimensión: EventType. |
RAISystemEvent |
No | Contar | Average |
Region, EventType |
PT1M | Sí |
|
Volumen total enviado para control de seguridad Número de llamadas realizadas a la API de OpenAI de Azure y detectadas por un filtro de contenido aplicado durante un periodo de tiempo. Puedes añadir un filtro o aplicar la división por las siguientes dimensiones: NombreDeDespliegueModelo, NombreModelo. |
RAITotalRequests |
No | Contar | Suma (Total) |
Region, ModelDeploymentName, ModelName, , ModelVersion, ApiName |
PT1M | Sí |
Categoría: Contenido Seguridad - Uso
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Recuento de llamadas para moderación de imágenes Número de llamadas a la moderación de imágenes. |
ContentSafetyImageAnalyzeRequestCount |
No | Contar | Suma (Total) | ApiVersion |
PT1M | Sí |
|
Recuento de llamadas para moderación de mensajes de texto Número de llamadas a la moderación de texto. |
ContentSafetyTextAnalyzeRequestCount |
No | Contar | Suma (Total) | ApiVersion |
PT1M | Sí |
Categoría: Idioma - Empleos
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Duración del puesto (Vista previa) Nota: este valor depende en gran medida del tamaño de entrada, el número de documentos y la complejidad de la tarea. Este es un valor agregado para todas las tareas del puesto. |
JobDuration |
No | MilliSeconds | Mínimo, Máximo, Promedio |
JobStatus, JobType |
PT1M | Sí |
Categoría: Modelos - Peticiones HTTP
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Tasa de disponibilidad de modelos Porcentaje de disponibilidad con el siguiente cálculo: (Total de llamadas - errores de servidor)/Total de llamadas. Los errores del servidor incluyen cualquier respuesta >HTTP =500. |
ModelAvailabilityRate |
No | Porcentaje | Mínimo, Máximo, Promedio |
Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | No |
|
Solicitudes de modelo Número de llamadas realizadas a la API del modelo a lo largo del tiempo. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go. |
ModelRequests |
No | Contar | Suma (Total) |
ApiName, OperationName, RegionStreamType, , ModelDeploymentName, , ModelNameModelVersionStatusCodeIsSpilloverServiceTierRequestServiceTierResponse |
PT1M | Sí |
Categoría: Modelos - Latencia
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Tiempo entre fichas Tasa de generación de tokens modelo, medida en milisegundos. Se aplica a despliegues gestionados por PTU y PTU. Para solicitudes no en streaming, este valor es una estimación. |
NormalizedTimeBetweenTokens |
No | MilliSeconds | Máximo, Mínimo, Promedio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, , ModelNameModelVersion |
PT1M | Sí |
|
Tiempo normalizado hasta el primer byte El tiempo que tarda en recibir el primer byte de datos de respuesta después de que la solicitud se realiza por el modelo, normalizada por el token. Se aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para solicitudes no en streaming, este valor es una estimación. |
NormalizedTimeToFirstToken |
No | MilliSeconds | Máximo, Mínimo, Promedio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse |
PT1M | Sí |
|
Tiempo para el último byte Tiempo que tarda en recibir el último byte de datos de respuesta después de que el modelo realiza la solicitud. Se aplica a despliegues PTU, gestionados por PTU y Pay-as-you-go. Para solicitudes no en streaming, este valor es una estimación. |
TimeToLastByte |
No | MilliSeconds | Máximo, Mínimo, Promedio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse |
PT1M | Sí |
|
Tiempo para responder Medida recomendada de latencia (respuesta). Se aplica a despliegues gestionados por PTU y PTU. Se calcula como el tiempo que tarda en aparecer la primera respuesta después de que un usuario envíe un prompt, según lo medido por la pasarela API. Este número aumenta a medida que el tamaño del prompt aumenta y/o disminuye el tamaño del impacto de caché. Para desglosar la métrica de tiempo de respuesta, puedes añadir un filtro o aplicar la división por las siguientes dimensiones: ModelDeploymentName, ModelName y ModelVersion. Nota: esta métrica es una aproximación, ya que la latencia medida depende en gran medida de múltiples factores, incluyendo llamadas concurrentes y el patrón general de carga de trabajo. Además, no tiene en cuenta ninguna latencia del lado del cliente que pueda existir entre tu cliente y el endpoint de la API. Para solicitudes no en streaming, este valor es una estimación. Por favor, consulta tu propio registro para un seguimiento óptimo de la latencia. |
TimeToResponse |
No | MilliSeconds | Mínimo, Máximo, Promedio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, StatusCode, ServiceTierRequest, ServiceTierResponse |
PT1M | Sí |
|
Fichas por segundo Enumera la velocidad de generación para una respuesta dada del modelo. El total de fichas generadas se divide por el tiempo que se generan en segundos. Se aplica a despliegues gestionados por PTU y PTU. Para solicitudes no en streaming, este valor es una estimación. |
TokensPerSecond |
No | Contar | Máximo, Mínimo, Promedio |
ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse |
PT1M | Sí |
Categoría: Modelos - Uso
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Páginas anotadas Número total de páginas procesadas con anotaciones. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go. |
AnnotatedPages |
No | Contar | Suma (Total) |
ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | Sí |
|
Tokens de entrada de audio Número de tokens de aviso de audio procesados (entrada) en un modelo OpenAI. Se aplica a despliegues de modelos gestionados por PTU. |
AudioInputTokens |
No | Contar | Suma (Total) |
ModelDeploymentName, ModelName, , ModelVersion, Region |
PT1M | Sí |
|
Fichas de salida de audio Número de tokens de prompt de audio generados (salida) en un modelo OpenAI. Se aplica a despliegues de modelos gestionados por PTU. |
AudioOutputTokens |
No | Contar | Suma (Total) |
ModelDeploymentName, ModelName, , ModelVersion, Region |
PT1M | Sí |
|
Tokens de prompt leídos desde la caché Número total de tokens leídos de la caché. Se aplica a despliegues de modelos Anthropic. Apareció en la sección de uso de respuesta como cache_read_input_tokens |
cacheReadInputTokens |
No | Contar | Suma (Total) |
ApiName, Region, ModelDeploymentName, ModelName, , ModelVersion, ContextLength |
PT1M | Sí |
|
Tokens de aviso escritos en caché (TTL de 1 hora) El número de fichas de prompt usadas para crear la entrada de 1 hora. Se aplica a despliegues de modelos Anthropic. Apareció en la sección de uso de respuesta como cache_creation.ephemeral_1h_input_tokens |
ephemeral1hInputTokens |
No | Contar | Suma (Total) |
ApiName, Region, ModelDeploymentName, ModelName, , ModelVersion, ContextLength |
PT1M | Sí |
|
Tokens de aviso escritos en caché (TTL de 5 minutos) El número de tokens de prompt usados para crear la entrada de caché de 5 minutos. Se aplica a despliegues de modelos Anthropic. Apareció en la sección de uso de respuesta como cache_creation.ephemeral_5m_input_tokens |
ephemeral5mInputTokens |
No | Contar | Suma (Total) |
ApiName, Region, ModelDeploymentName, ModelName, , ModelVersion, ContextLength |
PT1M | Sí |
|
Imágenes generadas Número total de imágenes generadas. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go. |
GeneratedImages |
No | Contar | Suma (Total) |
ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | Sí |
|
Tokens de entrada Número de tokens de aviso procesados (entrada) en un modelo. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go. |
InputTokens |
No | Contar | Suma (Total) |
ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | Sí |
|
Tokens de salida Número de tokens generados (salida) a partir de un modelo OpenAI. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go. |
OutputTokens |
No | Contar | Suma (Total) |
ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | Sí |
|
Uso aprovisionado La utilización % para un despliegue gestionado provisionalmente, calculado como (PTUs consumidas / PTUs desplegadas) x 100. Cuando la utilización es mayor o igual a 100%, las llamadas se limitan y se devuelve el código de error 429. |
ProvisionedUtilization |
No | Porcentaje | Mínimo, Máximo, Promedio |
Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | No |
|
Total de páginas Número total de páginas procesadas. Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go. |
TotalPages |
No | Contar | Suma (Total) |
ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | Sí |
|
Total Tokens Número de tokens de inferencia procesados en un modelo. Calculado como tokens de prompt (entrada) más tokens generados (salida). Se aplica a despliegues PTU, PTU-Managed y Pay-as-you-go. |
TotalTokens |
No | Contar | Suma (Total) |
ApiName, Region, ModelDeploymentName, , ModelName, ModelVersion |
PT1M | Sí |
Categoría: Servicios de Voz - Uso
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Audio Seconds Transcrito por lotes Número de segundos por lote transcritos |
AudioSecondsBatchTranscribed |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Segundos de audio transcrito por susurros por lote Número de segundos transcritos por susurros por lote |
AudioSecondsBatchWhisperTranscribed |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Segundos de audio transcritos rápidamente Número rápido de segundos transcrito |
AudioSecondsFastTranscribed |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Segundos de audio Fast Whisper transcrito Susurro rápido de segundos transcrito |
AudioSecondsFastWhisperTranscribed |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Segundos de audio transcritos Número de segundos transcritos |
AudioSecondsTranscribed |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Segundos de audio traducidos Número de segundos traducidos |
AudioSecondsTranslated |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Segundos de hosting del modelo de avatar Número de segundos. |
AvatarModelHostingSeconds |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Segundos de entrenamiento del modelo Avatar Número de segundos. |
AvatarModelTrainingSeconds |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Horario de presentación del Modelo de Oratoria Número de horas de presentación del modelo de voz |
SpeechModelHostingHours |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Caracteres sintetizados Número de caracteres. |
SynthesizedCharacters |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Videosegundos sintetizados Número de segundos sintetizados |
VideoSecondsSynthesized |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Tokens de entrada de audio en directo por voz Número de tokens de entrada de audio, excluyendo tokens almacenados en caché. |
VoiceLiveAudioInputTokens |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Tokens de salida de audio en directo de voz Número de tokens de salida de audio. |
VoiceLiveAudioOutputTokens |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Tokens de entrada de audio en caché en vivo por voz Número de tokens de entrada de audio almacenados en caché. |
VoiceLiveCachedAudioInputTokens |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Tokens de entrada de texto en caché en vivo por voz Número de tokens de entrada de texto almacenados en caché. |
VoiceLiveCachedTextInputTokens |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Tokens de entrada de texto en vivo por voz Número de tokens de entrada de texto, excluyendo los tokens almacenados en caché. |
VoiceLiveTextInputTokens |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Tokens de salida de texto en vivo por voz Número de tokens de salida de texto. |
VoiceLiveTextOutputTokens |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Horario de presentación de modelos de voz Número de horas. |
VoiceModelHostingHours |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Minutos de entrenamiento de modelos de voz Número de minutos. |
VoiceModelTrainingMinutes |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
Categoría: Servicios de traductor - Uso
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Caracteres del documento traducidos Número de caracteres en la solicitud de traducción del documento. |
DocumentCharactersTranslated |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Caracteres personalizados del documento traducidos Número de caracteres en la solicitud de traducción de documentos personalizados. |
DocumentCustomCharactersTranslated |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Caracteres de sincronización de documentos traducidos Número de caracteres en la solicitud de traducción de documentos (síncrona). |
OneDocumentCharactersTranslated |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Sincronización de documentos Caracteres personalizados traducidos Número de caracteres en la solicitud de traducción de documentos personalizados (síncrona). |
OneDocumentCustomCharactersTranslated |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Caracteres de texto traducidos Número de caracteres en la solicitud de traducción de texto entrante. |
TextCharactersTranslated |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Caracteres personalizados de texto traducidos Número de caracteres en la solicitud entrante de traducción de texto personalizada. |
TextCustomCharactersTranslated |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Caracteres entrenados en texto Número de caracteres entrenados usando traducción de texto. |
TextTrainedCharacters |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Segundo de la aplicación Translator Pro Número de segundos de uso de la app Translator Pro. |
TranslatorProAppSeconds |
No | Seconds | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
Categoría: uso
| Métrica | Nombre en la API REST | Métricas avanzadas de la plataforma | Unidad | Aggregation | Dimensiones | Granulos de tiempo | Exportación de DS |
|---|---|---|---|---|---|---|---|
|
Transacciones de Computer Vision Número de transacciones de Computer Vision |
ComputerVisionTransactions |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Tiempo de entrenamiento visual personalizado Tiempo de entrenamiento de Visión Personalizada |
CustomVisionTrainingTime |
No | Seconds | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Transacciones de visión personalizadas Número de transacciones de predicción de Visión Personalizada |
CustomVisionTransactions |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Imágenes faciales entrenadas Número de imágenes entrenadas. 1.000 imágenes entrenadas por transacción. |
FaceImagesTrained |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Caras almacenadas Número de caras almacenadas, prorrateado diariamente. El número de caras almacenadas se informa diariamente. |
FacesStored |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Transacciones faciales Número de llamadas a la API realizadas a Face Service |
FaceTransactions |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Imágenes almacenadas Número de imágenes Custom Vision almacenadas. |
ImagesStored |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Eventos aprendidos Número de Eventos Aprendidos. |
LearnedEvents |
No | Contar | Suma (Total) |
IsMatchBaseline, , Mode, RunId |
PT1M | Sí |
|
Solicitudes de Discurso LUIS Número de solicitudes de comprensión de LUIS de voz a intención |
LUISSpeechRequests |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Solicitudes de texto LUIS Número de solicitudes de texto LUIS |
LUISTextRequests |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Recompensas coincidentes Número de recompensas igualadas. |
MatchedRewards |
No | Contar | Suma (Total) |
Mode, RunId |
PT1M | Sí |
|
Eventos No Activados Número de eventos saltados. |
NonActivatedEvents |
No | Contar | Suma (Total) |
Mode, RunId |
PT1M | Sí |
|
Recompensas observadas Número de recompensas observadas. |
ObservedRewards |
No | Contar | Suma (Total) |
Mode, RunId |
PT1M | Sí |
|
Caracteres procesados Número de caracteres procesados por Immersive Reader. |
ProcessedCharacters |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Registros de Texto de Salud Procesados Número de registros de texto sanitario procesados |
ProcessedHealthTextRecords |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Imágenes procesadas Número de imágenes procesadas |
ProcessedImages |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Páginas procesadas Número de páginas procesadas |
ProcessedPages |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Registros de texto procesados Recuento de registros de texto. |
ProcessedTextRecords |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
Registros de texto de QA Número de registros de texto procesados |
QuestionAnsweringTextRecords |
No | Contar | Suma (Total) |
ApiName, FeatureName, , UsageChannel, Region |
PT1M | Sí |
|
N.º total de eventos Número de eventos. |
TotalEvents |
No | Contar | Suma (Total) |
Mode, RunId |
PT1M | Sí |
|
Total de transacciones (obsoletas) Número total de transacciones. |
TotalTransactions |
No | Contar | Suma (Total) | <ninguno> | PT1M | Sí |
Dimensiones métricas
Para información sobre qué son las dimensiones métricas, véase Métricas multidimensionales.
Este servicio tiene las siguientes dimensiones asociadas a sus métricas.
- ApiName
- FeatureName
- ModelDeploymentName
- NombreDelModelo
- ModelVersion
- NombreDeOperación
- Region
- Código de estado
- StreamType
- UsageChannel
Registros de recursos
Esta sección enumera los tipos de registros de recursos que puedes recopilar para este servicio. La sección extrae de la lista de tipos de categorías de registros todos los recursos soportados en Azure Monitor.
Registros de recursos compatibles para Microsoft. CognitiveServices/cuentas
| Category | Costes de exportación | Tabla de registro | Soporta un plan básico de registros | Soporta la transformación en tiempo de ingestión | Consultas de ejemplo |
|---|---|---|---|---|---|
| Auditoría | No |
AzureDiagnostics Registros de múltiples recursos de Azure. |
No | No | |
| AzureOpenAIRequestUsage | Sí |
AzureDiagnostics Registros de múltiples recursos de Azure. |
No | No | |
| ManagedNetworkEvent | Sí |
AzureDiagnostics Registros de múltiples recursos de Azure. |
No | No | |
| RequestResponse | No |
AzureDiagnostics Registros de múltiples recursos de Azure. |
No | No | |
| Seguimiento | No |
AzureDiagnostics Registros de múltiples recursos de Azure. |
No | No |
Tablas de registros de Azure Monitor
Esta sección enumera las tablas de Azure Monitor Logs relevantes para este servicio, que están disponibles para consulta por Log Analytics usando consultas Kusto. Las tablas contienen datos de registros de recursos y posiblemente más, dependiendo de lo que se recopile y se les envíe.
Azure OpenAI microsoft.cognitiveservices/accounts
Registro de actividad
La tabla enlazada lista las operaciones que pueden registrarse en el registro de actividad de este servicio. Estas operaciones son un subconjunto de todas las posibles operaciones de proveedor de recursos en el registro de actividad.
Para más información sobre el esquema de las entradas del registro de actividad, véase Esquema del registro de actividades.
Contenido relacionado
- Para obtener una descripción de la supervisión Azure OpenAI, consulte Monitor Azure OpenAI.
- Para más información sobre la supervisión de recursos de Azure, consulte Supervisión de recursos de Azure con Azure Monitor.