Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Den här sidan beskriver hur du konfigurerar hastighetsbegränsningar för Unity AI Gateway AI-tjänster. Med hastighetsbegränsningar kan du tillämpa förbrukningsgränser för en modelltjänst eller MCP-tjänst för att hantera kapacitet och kostnader.
Prisbegränsningar är en del av en tjänsts konfiguration. Du kan ställa in dem i UI:t eller programmatiskt när du skapar eller uppdaterar en modelltjänst eller MCP-tjänst med REST API, Azure Databricks SDK:er, Azure Databricks CLI eller Terraform.
Requirements
- En Azure Databricks arbetsyta i en Unity AI Gateway-stödd region.
Konfigurera hastighetsbegränsningar för en modelltjänst eller MCP-tjänst
Du kan ange hastighetsgränser baserat på begäranden per minut (QPM) eller token per minut (TPM), beroende på tjänsttyp:
- Modelltjänster: Ange gränser för begäranden per minut (QPM) och token per minut (TPM).
- MCP-tjänster: Ange gränser för begäranden per minut (QPM). Tokenbaserade gränser gäller inte för MCP-tjänster.
Om du vill aktivera hastighetsbegränsningar väljer du Hastighetsbegränsningar när du konfigurerar din modelltjänst eller MCP-tjänst. Du kan definiera hastighetsgränser på följande nivåer:
| Field | Description |
|---|---|
| Tjänst | Ange den maximala QPM eller TPM som hela tjänsten kan hantera. Den här gränsen gäller för all trafik, oavsett användare. |
| Användare (standard) | Ange en standardfrekvensgräns per användare som gäller för alla användare av tjänsten, såvida inte en mer specifik anpassad hastighetsgräns har definierats. |
| Anpassade hastighetsgränser | Anpassade hastighetsgränser kan anges för:
|
Information och beteende
- Hastighetsbegränsningar gäller endast för användare med behörighet att fråga tjänsten.
- Som standard finns det inga hastighetsbegränsningar som konfigurerats för användare eller tjänsten.
- Gränsen för tjänstfrekvens är ett globalt maxvärde. Om den här gränsen överskrids blockeras alla begäranden till tjänsten, oavsett användarspecifika eller gruppspecifika hastighetsbegränsningar.
- Om en tjänst, användare eller tjänstens huvudnamn har både en begäransbaserad hastighetsgräns och tokenbaserad hastighetsgräns angiven tillämpas den mer restriktiva hastighetsgränsen.
- Anpassade hastighetsgränser åsidosätter hastighetsgränsen användare (standard ).
- Om en användare tillhör både en användarspecifik gräns och en gruppspecifik gräns tillämpas den användarspecifika gränsen.
- Om en användare tillhör flera användargrupper med olika QPM- eller TPM-hastighetsgränser är användaren begränsad om de överskrider alla QPM-hastighetsgränser eller alla TPM-hastighetsgränser för sina användargrupper.
Beteende för hastighetsbegränsare
När en hastighetsgräns överskrids returnerar tjänsten ett HTTP 429-svar (för många begäranden). Klienter bör implementera återförsökslogik med exponentiell backoff.
Hastighetsbegränsningen är utformad för låg svarstid, vilket innebär att följande beteenden förväntas:
- Samtidiga begäranden kontrolleras inte i förväg. Systemet registrerar användning när ett svar har skickats, så om flera begäranden tas emot samtidigt kan alla gå igenom innan användningen räknas. Senare begäranden avvisas sedan tills kapaciteten återställs. I praktiken kan du se trafiktoppar följt av korta pauser i ett upprepande mönster.
- Gränser tillämpas oberoende över tjänstinstanser, så korta intervall som ligger något över den konfigurerade gränsen kan inträffa, särskilt direkt efter att en tjänst har skapats eller uppdaterats.
Under en längre tidsperiod konvergerar den genomsnittliga begärandefrekvensen till den konfigurerade gränsen.
Limitations
- Du kan ange högst 20 hastighetsgränser per tjänst.
- Du kan ange högst 5 gruppspecifika hastighetsgränser per tjänst.