Prioritetsbetalning per token för Foundation Model-API:er

Den här sidan beskriver prioriterad betalning per token för Foundation Model-API:er med betalning per token, inklusive hur det fungerar och hur du skickar prioriterade begäranden.

Vad är prioriterad betalning per token?

Prioritetsbetalning per token, även kallat prioritetsläge, är en pay-per-token-funktion för svarstidskänsliga realtidsprogram. När du skickar en begäran med parametern service_tier inställd på "priority", prioriterar Azure Databricks begäran före vanlig best effort-trafik med betalning per token för samma modell. Detta håller tillgängligheten mer konsekvent under perioder med hög trafik.

Prioriterad betalning per token är ett val per förfrågan, så du kan skicka både prioriterade förfrågningar och standardförfrågningar till samma modell. Det kräver inget kapacitetsåtagande och debiteras med ett högre pris per token än vanliga förfrågningar med betalning per token.

Databricks rekommenderar prioritetsläge när:

  • Du behöver mer konsekvent prestanda och tillgänglighet än med standardmodellen med betalning per token, men är inte redo att binda dig till dedikerad kapacitet.
  • Dina produktionsprogram kräver högre tillgänglighet.

Modeller som stöds

Följande modeller för betala per token stöder prioritetsläge. Om du vill skicka en prioritetsbegäran använder du modellens slutpunktsnamn med parametern inställd på service_tier"priority".

Important

Prioritetsbetalning per token är tillgängligt för OpenAI- och Google Gemini-modeller via ADI-tjänster som tillhandahålls av Databricks. Information om hur du kommer åt dessa partnermodeller i din Azure Databricks miljö finns i ADI Services.

Modeller med öppen källkod

Provider Model Slutpunktnamn Notes
Alibaba Cloud Qwen3.5 122B A10B databricks-qwen35-122b-a10b
  • Den här modellen är tillgänglig i förhandsversionen. Kontakta dina kontoteam för aktivering.
  • Endast tillgängligt i westeurope regionen.

Så fungerar prioriterad betalning per token

Tänk på följande innan du använder prioriterad betalning per token:

  • Konsekvent prestanda och tillgänglighet. Prioriterad betalning per token är utformad för att hålla tillgängligheten stabil under belastning. Det garanterar inte något specifikt mål för tid till första token eller latens från början till slut. Prioritetsbegäranden är inriktade på en högre tillgänglighet än standardbegäranden med betalning per token. Azure Databricks definierar tillgänglighet på en nivå som antalet lyckade begäranden dividerat med det totala antalet antagna begäranden på den nivån.
  • Kapacitet för bästa förmåga. Prioritetsläget reserverar inte kapacitet och det finns inget kapacitetsåtagande.
  • Återställning till standardbetalning per token. Om prioritetskapaciteten är fulltecknad hanteras begäranden enligt standardtillgänglighet med betalning per token och faktureras enligt standardpriser för betalning per token.
  • Premium per token. Prioriterade begäranden debiteras till ett högre pris per token än vanliga begäranden med betalning per token.

Prioritetsbetalning per token jämfört med etablerad genomströmning

Prioriterad betalning per token och provisionerad genomströmning är båda avsedda för produktionsarbetsbelastningar, men de innebär olika avvägningar:

Övervägande Prioriterad betalning per token Tilldelad kapacitet
Capacity Bästa arbete, delat. Dedikerad, reserverad kapacitet.
Åtaganden None. Välj att delta på begäran. Kräver en etablerad slutpunkt.
Availability Jämnare än standardmodellen med betalning per token vid hög belastning. Förutsägbart, baserat på reserverad kapacitet.
Billing Per token, till ett högre pris än standardpriset per token. Baserat på allokerade modelenheter.

Skicka en prioritetsbegäran

Om du vill använda prioritetsläge anger du parametern service_tier till "priority" per begäran. I följande exempel används OpenAI-klienten:

from databricks_openai import DatabricksOpenAI

client = DatabricksOpenAI()

response = client.chat.completions.create(
    model="databricks-model-name",
    messages=[
      {
        "role": "user",
        "content": "What is a mixture of experts model?",
      }
    ],
    max_tokens=256,
    service_tier="priority",
)

Se REST API-referens för grundmodeller för syntax för parametrar och Använd grundmodeller för fler frågealternativ.

Kapacitetsbegränsningar

Varje kluster stöder ett maximalt totalt antal token per minut för alla klienter. Azure Databricks anger en gräns per klientorganisation under registrering så att en enskild klientorganisation inte kan använda all klusterkapacitet. Om din arbetsbelastning kräver mer kapacitet än vad gränsen per klientorganisation tillåter kan du kontakta ditt Databricks-kontoteam.

För fler begränsningar för Foundation Model API:er, se Begränsningar och kvoter för Foundation Model API:er.

Ytterligare resurser