Unidades de modelo en el rendimiento aprovisionado

Las unidades de modelo son una unidad de rendimiento que determina la cantidad de trabajo que tu punto de conexión puede administrar por minuto. Al crear un nuevo punto de conexión de rendimiento asignado, se especifica el número de unidades de modelo que se van a asignar para cada modelo que se ofrece.

La cantidad de trabajo necesaria para procesar cada solicitud al punto de conexión depende del tamaño de la entrada y la salida generada. A medida que aumenta el número de tokens de entrada y salida, también aumenta la cantidad de trabajo necesario para procesar una solicitud. La generación de tokens de salida consume más recursos que el procesamiento de tokens de entrada. El trabajo necesario para cada solicitud crece de forma no lineal a medida que aumenta el número de tokens de entrada o salida, lo que significa que, para un número determinado de unidades de modelo, tu punto de conexión puede administrar:

  • Varias solicitudes pequeñas a la vez.
  • Menos solicitudes de contexto largo a la vez antes de agotar su capacidad.

Por ejemplo, con una carga de trabajo de tamaño mediano con 3500 tokens de entrada y 300 tokens de salida, puede calcular el rendimiento de los tokens por segundo para un número determinado de unidades de modelo:

Modelo Unidades de modelo Tokens estimados por segundo
Llama 4 Maverick 50 3250

Modelos que usan unidades de modelo

Todos los modelos fundacionales compatibles con el rendimiento aprovisionado aprovisionan capacidad de inferencia mediante unidades de modelo, con la excepción de los modelos heredados enumerados a continuación.

Nota:

Los puntos de conexión de servicio de modelos que ofrecen modelos de las siguientes familias de modelos heredados asignan capacidad de inferencia en función de los rangos de tokens por segundo configurados durante la creación del punto de conexión:

  • Meta Llama 3.3
  • Meta Llama 3.2 3B
  • Meta Llama 3.2 1B
  • Meta Llama 3.1
  • GTE v1.5 (inglés)
  • BGE v1.5 (inglés)
  • DeepSeek R1 (no disponible en el catálogo de Unity)
  • Meta Llama 3
  • Meta Llama 2
  • DBRX
  • Mistral
  • Mixtral
  • MPT