Solicitudes de registro y respuestas a tablas de inferencia

En esta página se describe cómo usar tablas de inferencia para supervisar los servicios de modelo de Unity AI Gateway .

Nota:

Las tablas de inferencia son una característica de pago de Unity AI Gateway. Azure Databricks cobra por las solicitudes y respuestas que registran las tablas de inferencia. Consulta precios de Unity AI Gateway.

¿Qué son las tablas de inferencia de Unity AI Gateway?

Las tablas de inferencia de Unity AI Gateway registran las solicitudes y respuestas de los servicios de modelo a las tablas delta del catálogo de Unity. Puede usar estos datos para supervisar, depurar y optimizar los modelos.

Entre los casos de uso comunes se incluyen:

  • Depuración: Analicen las cargas de solicitud y respuesta para solucionar problemas.
  • Supervisión: realice un seguimiento del rendimiento del modelo e identifique anomalías.
  • Optimización: revise las interacciones para mejorar las indicaciones y configuraciones del modelo.
  • Cumplimiento: mantenga los registros de auditoría de todas las interacciones del modelo.

Requisitos

  • Un área de trabajo de Azure Databricks en una región compatible con Unity AI Gateway.

  • Unity Catalog habilitado para su área de trabajo. Consulte Habilitar un área de trabajo para Unity Catalog.

  • El privilegio MANAGE sobre el servicio de modelos. Tanto el creador como el modificador del servicio de modelo deben tener este privilegio.

  • El privilegio CREATE TABLE en el catálogo y el esquema especificados de Unity Catalog (el catálogo debe ser un catálogo de almacenamiento externo; véase Limitations).

  • El privilegio USE CATALOG sobre el catálogo especificado.

  • El privilegio USE SCHEMA sobre el esquema especificado.

  • El catálogo no puede ser un catálogo OpenSharing del metastore actual.

  • Databricks recomienda habilitar la optimización predictiva para mejorar el rendimiento.

Habilitación de tablas de inferencia

Las tablas de inferencia solo se pueden configurar después de crear un servicio de modelo.

Para habilitar tablas de inferencia:

  1. En la barra lateral, haga clic en Gateway de IA.
  2. Haga clic en el nombre del servicio de modelo para abrir la página del servicio de modelo.
  3. Haga clic en Configurar junto a Tablas de inferencia.
  4. Especifique el catálogo y el esquema donde desea almacenar la tabla de inferencia.
  5. Haz clic en Guardar.

El propietario de la tabla de inferencia es el usuario que creó el servicio de modelo. Todas las ACL siguen los permisos estándar del catálogo de Unity y el propietario de la tabla puede modificarlo.

Nota:

No se admite la especificación de una tabla existente. Cuando activas las tablas de inferencia, Azure Databricks crea automáticamente una nueva para ti después de que el endpoint reciba su primera petición. Las filas pueden tardar hasta una hora en aparecer en la tabla después de que el endpoint reciba su primera petición.

Advertencia

La tabla de inferencia podría detener el registro de datos o dañarse si realiza alguna de las acciones siguientes:

  • Se cambia el esquema de la tabla.
  • Cambie el nombre de la tabla.
  • Se elimina la tabla.

Deshabilitación de tablas de inferencia

Para deshabilitar las tablas de inferencia:

  1. En la barra lateral, haga clic en Gateway de IA.
  2. Haga clic en el nombre del servicio de modelo para abrir la página del servicio de modelo.
  3. Haga clic en el icono de edición situado junto a Tablas de inferencia.
  4. Haga clic en Deshabilitar tablas de inferencia.

Consulta de la tabla de inferencia

Puede ver la tabla en la interfaz de usuario o consultar la tabla desde Databricks SQL o un cuaderno.

Para ver la tabla en la interfaz de usuario, haga clic en el vínculo de la tabla de inferencia en la página de servicio del modelo para abrir la tabla en el Explorador de catálogos.

Para consultar la tabla desde Databricks SQL o un cuaderno:

SELECT * FROM <catalog>.<schema>.<payload_table>

Reemplaza <catalog>, <schema> y <payload_table> con la ubicación de la tabla.

Esquema de tabla de inferencia

Las tablas de inferencia de Unity AI Gateway tienen el esquema siguiente:

Nombre de la columna Tipo Descripción Example
request_id CADENA Identificador único de la solicitud. 7a99b43cb46c432bb0a7814217701909
invocation_id CADENA Identificador único para cada llamada de inferencia individual. Varias invocaciones pueden compartir el mismo request_id, como las comprobaciones de seguridad o las llamadas a agentes de varias vueltas. Use invocation_id para distinguirlos. c0a8012e-9f3b-4d21-8a7e-1b2c3d4e5f60
request_tags MAP Etiquetas asociadas a la solicitud. {"team": "engineering"}
event_time TIMESTAMP Marca de tiempo cuando se recibió la solicitud. 2024-05-17T13:47:13.282-07:00
status_code INT Código de estado HTTP de la respuesta. 200
sampling_fraction DOUBLE Fracción de muestreo si se usó el muestreo descendente. Un valor de 1 significa que no hay muestreo hacia abajo. 1
latency_ms LONG Latencia total en milisegundos. 300
time_to_first_byte_ms LONG El tiempo de primer byte en milisegundos. 200
request CADENA La carga útil de la solicitud JSON sin procesar. {"messages": [...], ...}
response CADENA La carga útil de la respuesta JSON sin procesar. {"choices": [...], ...}
destination_type CADENA Tipo de destino (por ejemplo, modelo externo o modelo de base). PAY_PER_TOKEN_FOUNDATION_MODEL
destination_name CADENA Nombre del modelo o proveedor de destino. system.ai.gpt-5-2
destination_model CADENA Modelo específico que se usa para la solicitud. GPT-5.2
logging_error_codes MATRIZ Códigos de error si se produjo un error en el registro (por ejemplo, MAX_REQUEST_SIZE_EXCEEDED). ["MAX_RESPONSE_SIZE_EXCEEDED"]
requester CADENA Identificador del usuario o la entidad de servicio que realizó la solicitud. databricks.engineer@databricks.com
schema_version CADENA La versión del esquema del registro de la tabla de inferencia. 0

Limitations

  • Solo catálogos de almacenamiento externo: las tablas de inferencia solo se pueden crear en catálogos de almacenamiento externos. Actualmente no se admiten catálogos de almacenamiento predeterminados.
  • Puntos de conexión privados no admitidos: las tablas de inferencia no se pueden crear en el almacenamiento protegido a través de un punto de conexión privado. Ver cuotas de ingesta de Zerobus.
  • Entrega best effort: los registros suelen estar disponibles a los pocos minutos de realizar una solicitud, pero no se garantiza su entrega.
  • Tamaño máximo de carga: las solicitudes y respuestas superiores a 10 MiB no se registran. La logging_error_codes columna indica cuándo se produce con MAX_REQUEST_SIZE_EXCEEDED o MAX_RESPONSE_SIZE_EXCEEDED.
  • Respuestas de error: es posible que los registros no se rellenen para las solicitudes que devuelven errores 401, 403, 429 o 500.

Recursos adicionales