Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Esta página descreve como usar tabelas de inferência para monitorizar os serviços do modelo Unity Gateway .
Observação
As tabelas de inferência são uma funcionalidade faturada do Unity Gateway. O Azure Databricks cobra pelos pedidos e respostas que as tabelas de inferência registam. Veja preços do Unity Gateway.
O que são as tabelas de inferência do Unity Gateway?
As tabelas de inferência do Unity Gateway registam pedidos e respostas dos seus serviços de modelos em tabelas Delta do Unity Catalog. Pode usar estes dados para monitorizar, depurar e otimizar os seus modelos.
Os casos de uso comuns incluem:
- Depuração: Analisar as cargas úteis de pedidos e respostas para identificar e resolver problemas.
- Monitorização: Acompanhar o desempenho do modelo e identificar anomalias.
- Otimização: Analise as interações para melhorar os prompts e configurações do modelo.
- Conformidade: Mantenha registos de auditoria de todas as interações com modelos.
Requirements
Um espaço de trabalho Azure Databricks numa região suportada pelo Unity Gateway.
Unity Catalog ativado para o seu espaço de trabalho. Consulte Habilitar um espaço de trabalho para o Unity Catalog.
O
MANAGEprivilégio no serviço de modelos. Tanto o criador como o modificador do serviço modelo devem ter este privilégio.O
CREATE TABLEprivilégio no catálogo e no esquema especificados do Unity Catalog (o catálogo deve ser um catálogo de armazenamento externo; consulte Limitações).O
USE CATALOGprivilégio no catálogo especificado.O privilégio
USE SCHEMAsobre o esquema especificado.O catálogo não pode ser um catálogo OpenSharing do metaarmazém atual.
O Databricks recomenda permitir a otimização preditiva para melhorar o desempenho.
Ativar tabelas de inferência
As tabelas de inferência só podem ser configuradas depois de criar um serviço modelo.
Para permitir tabelas de inferência:
- Na barra lateral, clique em AI Gateway.
- Clique no nome do serviço do modelo para abrir a página do serviço do modelo.
- Clique em Configurar ao lado de Tabelas de Inferência.
- Especifique o catálogo e o esquema onde quer guardar a tabela de inferência.
- Clique em Salvar.
O proprietário da tabela de inferência é o utilizador que criou o serviço modelo. Todas as ACLs seguem as permissões padrão do Catálogo Unity e podem ser modificadas pelo proprietário da tabela.
Observação
Especificar uma tabela existente não é suportado. Quando ativa as tabelas de inferência, o Azure Databricks cria automaticamente uma nova para si após o endpoint receber o seu primeiro pedido. As linhas podem demorar até uma hora a aparecer na tabela após o endpoint receber o seu primeiro pedido.
Advertência
A tabela de inferência pode parar de registrar dados ou ficar corrompida se você fizer o seguinte:
- Altere o esquema da tabela.
- Altere o nome da tabela.
- Eliminar a tabela.
Desativar tabelas de inferência
Para desativar tabelas de inferência:
- Na barra lateral, clique em AI Gateway.
- Clique no nome do serviço do modelo para abrir a página do serviço do modelo.
- Clique no ícone de edição ao lado das tabelas de Inferência.
- Clique em desativar tabelas de inferências.
Consultar a tabela de inferência
Podes ver a tabela na interface, ou consultar a tabela no Databricks SQL ou num caderno.
Para visualizar a tabela na interface, clique no link da tabela de inferências na página do serviço do modelo para abrir a tabela no Explorador de Catálogos.
Para consultar a tabela a partir do Databricks SQL ou de um caderno:
SELECT * FROM <catalog>.<schema>.<payload_table>
Substitui <catalog>, <schema>, e <payload_table> pela localização da tua mesa.
Esquema de tabela de inferência
As tabelas de inferência Unity Gateway têm o seguinte esquema:
| Nome da coluna | Tipo | Descrição | Example |
|---|---|---|---|
request_id |
cadeia de caracteres | Um identificador exclusivo para a solicitação. | 7a99b43cb46c432bb0a7814217701909 |
invocation_id |
cadeia de caracteres | Um identificador único para cada chamada de inferência individual. Múltiplas invocações podem partilhar o mesmo request_id, como verificações de proteção ou chamadas a agentes com múltiplos turnos. Use invocation_id para os distinguir. |
c0a8012e-9f3b-4d21-8a7e-1b2c3d4e5f60 |
request_tags |
MAP | Etiquetas associadas ao pedido. | {"team": "engineering"} |
event_time |
CARIMBO DE DATA/HORA | A data e hora em que o pedido foi recebido. | 2024-05-17T13:47:13.282-07:00 |
status_code |
INT | O código de status HTTP da resposta. | 200 |
sampling_fraction |
DUPLO | A fração de amostragem se foi utilizada uma amostragem reduzida. Um valor de 1 significa que não há amostragem descendente. | 1 |
latency_ms |
LONGO | A latência total em milissegundos. | 300 |
time_to_first_byte_ms |
LONGO | O tempo até ao primeiro byte em milissegundos. | 200 |
request |
cadeia de caracteres | A carga útil bruta do pedido JSON. | {"messages": [...], ...} |
response |
cadeia de caracteres | A carga útil de resposta JSON bruta. | {"choices": [...], ...} |
destination_type |
cadeia de caracteres | O tipo de destino (por exemplo, modelo externo ou modelo de fundação). | PAY_PER_TOKEN_FOUNDATION_MODEL |
destination_name |
cadeia de caracteres | O nome do modelo de destino ou fornecedor. | system.ai.gpt-5-2 |
destination_model |
cadeia de caracteres | O modelo específico usado para o pedido. | GPT-5.2 |
logging_error_codes |
MATRIZ | Códigos de erro se o registo falhou (por exemplo, MAX_REQUEST_SIZE_EXCEEDED). |
["MAX_RESPONSE_SIZE_EXCEEDED"] |
requester |
cadeia de caracteres | O ID do utilizador ou principal do serviço que fez o pedido. | databricks.engineer@databricks.com |
schema_version |
cadeia de caracteres | A versão esquemática do registo da tabela de inferência. | 0 |
Limitações
- Apenas catálogos de armazenamento externo: As tabelas de inferência só podem ser criadas em catálogos de armazenamento externo. Catálogos de armazenamento padrão não são suportados atualmente.
- Endpoints privados não suportados: Tabelas de inferência não podem ser criadas em armazenamento protegido através de um endpoint privado. Consulte quotas de ingestão do Zerobus.
- Entrega de melhor esforço: Os registos estão normalmente disponíveis dentro de minutos após o pedido, mas a entrega não é garantida.
-
Tamanho máximo da carga útil: Pedidos e respostas superiores a 10 MiB não são registados. A
logging_error_codescoluna indica quando isto ocorre comMAX_REQUEST_SIZE_EXCEEDEDouMAX_RESPONSE_SIZE_EXCEEDED. - Respostas a erros: Os registos podem não ser preenchidos para pedidos que devolvam erros 401, 403, 429 ou 500.