Gerenciar orçamentos para o Gateway de IA do Unity

Os orçamentos ajudam você a monitorar e controlar os gastos mensais do Gateway de IA do Unity usando filtros aplicados aos registros de cobrança. Você pode definir um orçamento especificamente para o produto Unity AI Gateway para acompanhar apenas os gastos com o Unity AI Gateway ou incluir o Unity AI Gateway em um orçamento de toda a conta.

Os administradores de conta e de espaço de trabalho podem visualizar um resumo do status do orçamento de IA e dos gastos na página de IA no Hub de Governança.

Observação

Os orçamentos do Unity AI Gateway também rastreiam o uso do produto Genie. Para definir orçamentos para o Genie especificamente, consulte Gerenciar orçamentos e controles de custo para o Genie.

Para obter detalhes sobre como criar e monitorar orçamentos, consulte Criar e monitorar orçamentos.

Requirements

  • Gateway de IA do Unity habilitado para sua conta.

Como os orçamentos funcionam com o Gateway de IA do Unity

Ao criar um orçamento, selecione o Unity AI Gateway como tipo de recurso para acompanhar apenas os gastos com o Unity AI Gateway, incluindo pay-per-token, inferência ai_query e uso opcional de modelos externos.

Configuração de orçamento

Tipos de limiar: Para orçamentos aplicados ao Unity AI Gateway, você pode configurar:

  • Limites compartilhados: um limite de gastos coletivos para todos os usuários dentro do escopo do orçamento.
  • Limites por usuário: um limite mensal que se aplica a cada usuário individual.
  • Exceções por usuário: conceda a usuários ou grupos específicos um limite de gastos maior que o limite padrão por usuário. Os usuários abrangidos por uma exceção podem gastar até o valor da exceção, em vez do limite padrão por usuário. Se um usuário pertencer a vários grupos de substituição, o limite mais alto se aplicará.

Para limites compartilhados e por usuário, você pode configurar uma ou ambas as seguintes ações quando um limite é atingido:

  • Enviar alerta: envia uma notificação por email para endereços configurados. Os usuários mantêm o acesso ao Gateway de IA do Unity.
  • Bloquear o uso: impede que o usuário faz solicitações adicionais por meio do Gateway de IA do Unity. O usuário vê uma mensagem informando que seu orçamento está esgotado. O acesso é retomado depois que o orçamento é redefinido ou um administrador aumenta o limite.

Administradores de contas podem visualizar estimativas de gastos quase em tempo real na página de detalhes do orçamento.

Gráfico de gastos acumulados em uma página de detalhes do orçamento do Unity AI Gateway

Incluir uso de modelos externos

Importante

Esse recurso está em Beta. Para usá-lo, um administrador de espaço de trabalho deve ativar o Gasto de Modelo Externo nos Orçamentos a partir da página de Prévias . Consulte Gerenciar visualizações do Azure Databricks.

Ao criar um orçamento para um Unity AI Gateway, selecione Incluir uso de modelos externos para incluir o gasto estimado de requisições roteadas para modelos externos por meio dos serviços de provedores de modelos.

Incluir a opção de uso de modelos externos no formulário Criar orçamento

Quando ativado, o gasto com modelos externos conta para os limites compartilhados e por usuário do orçamento. As ações configuradas de alerta e bloqueio de uso se aplicam quando os gastos combinados atingem um limite definido. Se você não selecionar essa opção, o orçamento exclui o gasto com modelos externos, mas continua incluindo o uso de modelos hospedados no Azure Databricks.

O Azure Databricks estima o gasto em modelos externos a partir do uso de tokens e os preços publicados pelo provedor externo. Essas estimativas podem diferir da sua fatura final de prestador. Para análise histórica do gasto em modelos externos, consulte a system.ai_gateway.external_model_spend tabela do sistema. Consulte modelos externos.

Filtros de etiquetas de orçamento se aplicam a etiquetas de serviço modelo. As tags de requisição estão disponíveis na tabela do sistema de gastos de modelos externos, mas não afetam a correspondência de orçamento.

Limitations

Importante

Os orçamentos do Unity AI Gateway fornecem uma estimativa quase em tempo real dos gastos acompanhados em relação aos limites configurados, e os custos reais podem diferir dos limites configurados. Esse recurso tem como objetivo auxiliar no controle de custos quase em tempo real. Não use esse recurso como uma forma de garantir um limite absoluto de gasto nos valores finais faturados. O Azure Databricks não se responsabiliza pelos custos incorridos que excedam os limites de orçamento configurados.

  • A inferência de throughput provisionada não é monitorada atualmente.

  • Cada orçamento dá suporte a um máximo de quatro limites compartilhados e 20 substituições por usuário.

  • Sua conta pode ter um máximo de 1.000 orçamentos.

  • Os limites de uso de blocos são aplicados de forma aproximada. A fiscalização utiliza uma estimativa quase em tempo real do custo, então o gasto real pode variar acima ou abaixo do limite configurado. Isso significa que:

    • Um usuário pode ser bloqueado antes que seu gasto real atinja o limite.
    • Um valor de despesa acima do limite pode ocorrer antes que a aplicação de lei entre em vigor. Solicitações ativas em andamento quando o limite é atingido não são interrompidas.

    system.billing.usage permanece como fonte de verdade para o uso real faturado pelo Databricks. Para discrepâncias entre o uso acompanhado em relação ao orçamento e custos reais, o Azure Databricks pode ajustar retroativamente estimativas orçamentárias para conciliá-las. Para o uso de modelos externos, a fatura do prestador externo é a fonte de verdade para as cobranças reais do prestador.

  • Os valores gastos nos e-mails de alerta de orçamento, na página de detalhes do orçamento, system.billing.usage e system.ai_gateway.external_model_spend podem variar quando comparados no mesmo momento. Isso é esperado, pois cada fonte é atualizada a uma taxa diferente:

    • E-mails de alerta de orçamento: refletem os gastos no momento em que o alerta foi disparado.
    • Página de detalhes do orçamento: atualiza com frequência, mas pode mostrar uma quantidade menor do que um email de alerta recente quando exibido pouco depois.
    • system.billing.usage: atualizações a cada poucas horas. Consultar tabelas do sistema logo após receber um alerta pode retornar um valor de gasto menor do que a página de detalhes do orçamento ou os emails de alerta.
    • system.ai_gateway.external_model_spend: Atualizado a cada hora com o gasto estimado com modelos externos. As estimativas podem diferir da fatura final do seu prestador.

    A imposição de orçamento, incluindo limites de bloqueio de uso e alerta, baseia-se no acompanhamento de gastos quase em tempo real e não é afetada pelo tempo de atualização da tabela do sistema.

Recursos adicionais