Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
En esta página se describe cómo configurar los límites de velocidad para los servicios de IA de Unity AI Gateway . Los límites de velocidad permiten aplicar límites de consumo en un servicio de modelo o servicio MCP para administrar la capacidad y los costos.
Los límites de tarifa forman parte de la configuración de un servicio. Puedes configurarlos en la interfaz o programáticamente cuando crees o actualices un servicio de modelo o servicio MCP con la API REST, los SDKs de Azure Databricks, la CLI de Azure Databricks o Terraform.
Requirements
- Un área de trabajo de Azure Databricks en una región compatible con Unity AI Gateway.
Configuración de límites de frecuencia en un servicio de modelo o un servicio MCP
Puede establecer límites de velocidad en función de las solicitudes por minuto (QPM) o tokens por minuto (TPM), en función del tipo de servicio:
- Servicios de modelos: Establece los límites de solicitudes por minuto (QPM) y tokens por minuto (TPM).
- Servicios MCP: establezca los límites de solicitudes por minuto (QPM). Los límites basados en tokens no se aplican a los servicios MCP.
Para habilitar los límites de velocidad, seleccione Límites de velocidad al configurar el servicio de modelo o el servicio MCP. Puede definir límites de velocidad en los siguientes niveles:
| Campo | Descripción |
|---|---|
| Servicio | Especifique el valor máximo de QPM o TPM que puede controlar todo el servicio. Este límite se aplica a todo el tráfico, independientemente del usuario. |
| Usuario (valor predeterminado) | Especifique un límite de velocidad por usuario predeterminado que se aplique a todos los usuarios del servicio, a menos que se defina un límite de velocidad personalizado más específico. |
| Límites de velocidad personalizados | Se pueden especificar límites de velocidad personalizados para:
|
Detalles y comportamiento
- Los límites de frecuencia solo se aplican a los usuarios con permiso para consultar el servicio.
- De forma predeterminada, no hay límites de velocidad configurados para los usuarios o el servicio.
- El límite de velocidad de servicio es un máximo global. Si se supera este límite, todas las solicitudes al servicio se bloquean, independientemente de los límites de velocidad específicos del usuario o de grupos.
- Si un servicio, usuario o entidad de servicio tiene un límite de velocidad basado en solicitudes y un límite de velocidad basado en tokens especificado, se aplica el límite de frecuencia más restrictivo.
- Los límites de velocidad personalizados invalidan el límite de velocidad de usuario (valor predeterminado ).
- Si un usuario pertenece a un límite específico del usuario y a un límite específico del grupo, se aplica el límite específico del usuario.
- Si un usuario pertenece a varios grupos de usuarios con diferentes límites de QPM o TPM, el usuario está sujeto a limitación si supera todos los límites de QPM o todos los límites de TPM de sus grupos de usuarios.
Comportamiento del limitador de velocidad
Cuando se supera un límite de velocidad, el servicio devuelve una respuesta HTTP 429 (demasiadas solicitudes). Los clientes deben implementar una lógica de reintentos con retroceso exponencial.
El limitador de velocidad está diseñado para una latencia baja, lo que significa que se esperan los siguientes comportamientos:
- Las solicitudes simultáneas no se comprueban con antelación. El sistema registra el uso después de enviar una respuesta, por lo que si varias solicitudes llegan al mismo momento, todas pueden pasar antes de que se cuente el uso. Después, las solicitudes posteriores se rechazan hasta que se recupere la capacidad. En la práctica, es posible que vea ráfagas de tráfico seguidas de breves pausas en un patrón repetitivo.
- Los límites se aplican de forma independiente entre las instancias de servicio, por lo que se pueden producir ráfagas cortas ligeramente por encima del límite configurado, especialmente justo después de crear o actualizar un servicio.
En un período de tiempo más largo, la tasa de solicitudes media converge con el límite configurado.
Limitations
- Puede especificar un máximo de 20 límites de velocidad por servicio.
- Puede especificar un máximo de 5 límites de velocidad específicos de grupo por servicio.