Pedidos de registo e respostas às tabelas de inferência

Esta página descreve como usar tabelas de inferência para monitorizar os serviços do modelo Unity Gateway .

Observação

As tabelas de inferência são uma funcionalidade faturada do Unity Gateway. O Azure Databricks cobra pelos pedidos e respostas que as tabelas de inferência registam. Veja preços do Unity Gateway.

O que são as tabelas de inferência do Unity Gateway?

As tabelas de inferência do Unity Gateway registam pedidos e respostas dos seus serviços de modelos em tabelas Delta do Unity Catalog. Pode usar estes dados para monitorizar, depurar e otimizar os seus modelos.

Os casos de uso comuns incluem:

  • Depuração: Analisar as cargas úteis de pedidos e respostas para identificar e resolver problemas.
  • Monitorização: Acompanhar o desempenho do modelo e identificar anomalias.
  • Otimização: Analise as interações para melhorar os prompts e configurações do modelo.
  • Conformidade: Mantenha registos de auditoria de todas as interações com modelos.

Requirements

  • Um espaço de trabalho Azure Databricks numa região suportada pelo Unity Gateway.

  • Unity Catalog ativado para o seu espaço de trabalho. Consulte Habilitar um espaço de trabalho para o Unity Catalog.

  • O MANAGE privilégio no serviço de modelos. Tanto o criador como o modificador do serviço modelo devem ter este privilégio.

  • O CREATE TABLE privilégio no catálogo e no esquema especificados do Unity Catalog (o catálogo deve ser um catálogo de armazenamento externo; consulte Limitações).

  • O USE CATALOG privilégio no catálogo especificado.

  • O privilégio USE SCHEMA sobre o esquema especificado.

  • O catálogo não pode ser um catálogo OpenSharing do metaarmazém atual.

  • O Databricks recomenda permitir a otimização preditiva para melhorar o desempenho.

Ativar tabelas de inferência

As tabelas de inferência só podem ser configuradas depois de criar um serviço modelo.

Para permitir tabelas de inferência:

  1. Na barra lateral, clique em AI Gateway.
  2. Clique no nome do serviço do modelo para abrir a página do serviço do modelo.
  3. Clique em Configurar ao lado de Tabelas de Inferência.
  4. Especifique o catálogo e o esquema onde quer guardar a tabela de inferência.
  5. Clique em Salvar.

O proprietário da tabela de inferência é o utilizador que criou o serviço modelo. Todas as ACLs seguem as permissões padrão do Catálogo Unity e podem ser modificadas pelo proprietário da tabela.

Observação

Especificar uma tabela existente não é suportado. Quando ativa as tabelas de inferência, o Azure Databricks cria automaticamente uma nova para si após o endpoint receber o seu primeiro pedido. As linhas podem demorar até uma hora a aparecer na tabela após o endpoint receber o seu primeiro pedido.

Advertência

A tabela de inferência pode parar de registrar dados ou ficar corrompida se você fizer o seguinte:

  • Altere o esquema da tabela.
  • Altere o nome da tabela.
  • Eliminar a tabela.

Desativar tabelas de inferência

Para desativar tabelas de inferência:

  1. Na barra lateral, clique em AI Gateway.
  2. Clique no nome do serviço do modelo para abrir a página do serviço do modelo.
  3. Clique no ícone de edição ao lado das tabelas de Inferência.
  4. Clique em desativar tabelas de inferências.

Consultar a tabela de inferência

Podes ver a tabela na interface, ou consultar a tabela no Databricks SQL ou num caderno.

Para visualizar a tabela na interface, clique no link da tabela de inferências na página do serviço do modelo para abrir a tabela no Explorador de Catálogos.

Para consultar a tabela a partir do Databricks SQL ou de um caderno:

SELECT * FROM <catalog>.<schema>.<payload_table>

Substitui <catalog>, <schema>, e <payload_table> pela localização da tua mesa.

Esquema de tabela de inferência

As tabelas de inferência Unity Gateway têm o seguinte esquema:

Nome da coluna Tipo Descrição Example
request_id cadeia de caracteres Um identificador exclusivo para a solicitação. 7a99b43cb46c432bb0a7814217701909
invocation_id cadeia de caracteres Um identificador único para cada chamada de inferência individual. Múltiplas invocações podem partilhar o mesmo request_id, como verificações de proteção ou chamadas a agentes com múltiplos turnos. Use invocation_id para os distinguir. c0a8012e-9f3b-4d21-8a7e-1b2c3d4e5f60
request_tags MAP Etiquetas associadas ao pedido. {"team": "engineering"}
event_time CARIMBO DE DATA/HORA A data e hora em que o pedido foi recebido. 2024-05-17T13:47:13.282-07:00
status_code INT O código de status HTTP da resposta. 200
sampling_fraction DUPLO A fração de amostragem se foi utilizada uma amostragem reduzida. Um valor de 1 significa que não há amostragem descendente. 1
latency_ms LONGO A latência total em milissegundos. 300
time_to_first_byte_ms LONGO O tempo até ao primeiro byte em milissegundos. 200
request cadeia de caracteres A carga útil bruta do pedido JSON. {"messages": [...], ...}
response cadeia de caracteres A carga útil de resposta JSON bruta. {"choices": [...], ...}
destination_type cadeia de caracteres O tipo de destino (por exemplo, modelo externo ou modelo de fundação). PAY_PER_TOKEN_FOUNDATION_MODEL
destination_name cadeia de caracteres O nome do modelo de destino ou fornecedor. system.ai.gpt-5-2
destination_model cadeia de caracteres O modelo específico usado para o pedido. GPT-5.2
logging_error_codes MATRIZ Códigos de erro se o registo falhou (por exemplo, MAX_REQUEST_SIZE_EXCEEDED). ["MAX_RESPONSE_SIZE_EXCEEDED"]
requester cadeia de caracteres O ID do utilizador ou principal do serviço que fez o pedido. databricks.engineer@databricks.com
schema_version cadeia de caracteres A versão esquemática do registo da tabela de inferência. 0

Limitações

  • Apenas catálogos de armazenamento externo: As tabelas de inferência só podem ser criadas em catálogos de armazenamento externo. Catálogos de armazenamento padrão não são suportados atualmente.
  • Endpoints privados não suportados: Tabelas de inferência não podem ser criadas em armazenamento protegido através de um endpoint privado. Consulte quotas de ingestão do Zerobus.
  • Entrega de melhor esforço: Os registos estão normalmente disponíveis dentro de minutos após o pedido, mas a entrega não é garantida.
  • Tamanho máximo da carga útil: Pedidos e respostas superiores a 10 MiB não são registados. A logging_error_codes coluna indica quando isto ocorre com MAX_REQUEST_SIZE_EXCEEDED ou MAX_RESPONSE_SIZE_EXCEEDED.
  • Respostas a erros: Os registos podem não ser preenchidos para pedidos que devolvam erros 401, 403, 429 ou 500.

Recursos adicionais