Recursos assistivos de IA do Databricks para confiança e segurança

O Databricks entende a importância de seus dados e a confiança que você coloca em nós quando usa nossos recursos assistenciais de IA do Databricks e da plataforma. O Databricks está comprometido com os mais altos padrões de proteção de dados e implementou medidas rigorosas para garantir que as informações enviadas aos recursos assistenciais de IA do Databricks estejam protegidas.

  • Seus dados permanecem confidenciais.
    • A Databricks não usa dados, prompts nem respostas enviados a esses recursos ou gerados por eles para treinar modelos fundacionais generativos que a Databricks disponibiliza para uso por terceiros.
    • Nossos parceiros de modelo não retêm os dados que você envia por meio desses recursos, mesmo para monitoramento de abuso. Nossos recursos assistenciais de IA, impulsionados por parceiros, usam endpoints que não retêm dados de nossos parceiros de modelo.
  • Proteção contra resultados prejudiciais. Ao usar o Azure OpenAI, o Databricks também usa a filtragem de conteúdo do Azure OpenAI para proteger os usuários contra conteúdo prejudicial. Ao usar modelos da Anthropic, Databricks depende dos mecanismos de segurança internos da Anthropic e da proteção adicional contra resultados prejudiciais, conforme descrito na documentação de segurança da Anthropic. Além disso, o Databricks executou uma ampla avaliação com milhares de interações simuladas do usuário para garantir que as proteções implementadas para proteger contra conteúdo nocivo, jailbreaks, geração de código inseguro e uso de conteúdo de direitos autorais de terceiros sejam eficazes.
  • O Databricks usa apenas os dados necessários para fornecer o serviço. Os dados são enviados somente quando você interage com recursos assistenciais de IA do Databricks ou conforme necessário para fornecer os recursos. O Databricks envia sua solicitação, metadados e valores de tabela relevantes, erros, bem como o código de entrada ou consultas para ajudar a retornar resultados mais relevantes.
  • Os dados são protegidos em trânsito e em repouso. Todo o tráfego entre o Databricks e os parceiros de modelo é criptografado em trânsito com a criptografia TLS padrão do setor. Todos os dados armazenados em um workspace do Azure Databricks são criptografados em AES 256 bits.
  • O Databricks oferece controles de residência de dados. Os recursos de assistência de IA do Databricks são Serviços Designados e estão em conformidade com os limites de residência de dados. Para mais detalhes, veja Databricks Geos: Residência de dados e Serviços designados do Databricks.

Para obter mais detalhes sobre como recursos específicos lidam com seus dados, consulte as perguntas frequentes sobre privacidade e segurança.

Dados enviados para os modelos

Quais serviços e modelos os recursos assistenciais de IA alimentados por parceiros usam?

Se a configuração de recursos de IA com parceiro estiver habilitada, os recursos assistenciais de IA do Databricks usarão modelos hospedados pelo serviço Azure OpenAI ou Antropic on Databricks.

Alguns recursos, como o Preenchimento Automático do Genie Code, usam um modelo hospedado pelo Databricks mesmo quando a configuração está habilitada. Se você desativar a configuração de recursos de IA potenciados por parceiros, alguns recursos assistenciais de IA poderão utilizar um modelo hospedado pelo Databricks. Para obter mais informações, consulte os recursos de IA potencializados por parceiros.

Quais dados são enviados para os modelos?

O Databricks envia apenas os dados necessários para fornecer o serviço. Em geral, isso inclui seu prompt (por exemplo, sua pergunta, código ou consulta) e metadados relevantes, como nomes e descrições de tabelas e colunas, valores de exemplo, erros e perguntas anteriores. Os dados exatos diferem por recurso:

  • Genie Code envia código e consultas na célula atual do notebook ou na guia atual do editor SQL, nomes e descrições de tabelas e colunas, perguntas anteriores e tabelas favoritas. No modo agente, o Genie Code também pode analisar saídas de células e ler amostras de dados de tabelas, semelhantes a outros agentes de codificação no setor.
  • Os Agentes do Genie usam o prompt de linguagem natural, nomes de tabela e descrições, valores relevantes, instruções gerais, exemplos de consultas SQL e funções SQL.
  • O Genie One envia sua pergunta em linguagem natural e metadados relevantes, como nomes de tabelas e colunas, descrições e valores de exemplo, quando você conversa com seus dados. O Genie One responde roteando para seus Agentes Genie e pesquisando ativos de dados que você tem permissão para acessar. Quando você conecta fontes externas, como Google Drive, Microsoft 365 ou Slack, o Genie One também pode enviar conteúdo dessas fontes para responder à sua pergunta.
  • A Ontologia Genie é a camada unificada de contexto que fornece ao Genie um mapa consciente do negócio da sua organização, reunindo contexto modelado (semântica do Catálogo Unity, como vistas métricas e domínios) e contexto inferido que o Genie constrói e mantém automaticamente a partir dos seus ativos e uso existentes. Trechos extraídos de ontologia respeitam as permissões dos ativos fonte. Para gerar o contexto inferido, o Genie extrai conhecimento de fontes, incluindo visualizações métricas, dashboards, consultas SQL e Agentes Genie.
  • Os comentários gerados por IA enviam metadados para o objeto que está sendo documentado e seus objetos pai, incluindo catálogo, esquema, tabela, função, modelo e nomes de volume, seus comentários atuais e detalhes da coluna (nome, tipo, se é uma chave primária e comentário de coluna atual).

Os dados enviados aos modelos respeitam as permissões do Unity Catalog do usuário?

Sim, todos os dados enviados para modelos de funcionalidades assistivas de IA respeitam as permissões do Catálogo do Unity, então nenhum dado ao qual os usuários não têm acesso é enviado para esses modelos.

Os provedores de modelo de parceiro armazenam meus dados?

Não. Ao usar modelos de parceiros por meio do Databricks, os provedores de modelo de parceiro não armazenam prompts ou respostas.

Armazenamento e acesso

Onde as respostas dos recursos assistenciais de IA são armazenadas?

As respostas do Genie Agent e os comentários aprovados gerados por IA são armazenados no banco de dados do plano de controle do Databricks. O banco de dados do plano de controle é criptografado em AES-256 bits.

O histórico de chat do Genie Code é armazenado no mesmo lugar que outro conteúdo do bloco de anotações.

As conversas de chat do Genie One são armazenadas no banco de dados do plano de controle Databricks, que é criptografado em AES-256 bits.

Quem pode ver meu histórico de chat com o Genie?

Você pode exibir seus próprios chats do Genie Code. Os administradores podem ver o chat se tiverem um link direto. Quando você compartilha um chat, os destinatários podem visualizá-lo. Consulte Compartilhar um chat.

Os gerentes do Genie Agent podem ver as mensagens de outros usuários, mas não os resultados da consulta. Conversas com agentes do Genie seguem as configurações de compartilhamento de conversa.

Você pode ver seus próprios chats do Genie One. Quando você compartilha um chat, os destinatários podem vê-lo como somente leitura. Você pode compartilhar um chat do Genie One com qualquer pessoa da sua conta, ou torná-lo privado novamente. Consulte Compartilhar um chat.

Execução e precisão de código

O Genie executa código?

Os Agentes do Genie foram projetados para ter acesso de somente leitura aos dados do cliente, de modo que só podem gerar e executar consultas SQL de somente leitura.

Assim como os Agentes Genie, o chat do Genie One tem acesso somente leitura aos seus dados, então gera e executa apenas consultas SQL somente leitura contra dados que você tem permissão para acessar.

Com o modo agente, o Genie Code pode executar código no notebook e no editor do SQL. No início, o Genie Code solicitará confirmação para prosseguir com a execução. Você pode escolher confirmar, sempre permitir execução no chat atual do Código Gênio, ou sempre permitir execução. Outros modos de Código do Genie não executam automaticamente o código em seu nome.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. Examine e teste o código gerado por IA antes de executá-lo.

O Databricks fez qualquer avaliação para avaliar a precisão e a adequação das respostas dos recursos assistenciais de IA?

Sim, o Databricks fez testes extensivos de todos os nossos recursos assistenciais de IA com base em seus casos de uso esperados e usando entradas de usuário simuladas para aumentar a precisão e a adequação das respostas. Dito isto, a IA é uma tecnologia emergente e os recursos assistenciais de IA podem fornecer respostas imprecisas ou inadequadas.

Residência e conformidade de dados

Como meu tráfego é gerenciado e roteado através do sistema Geos?

Os recursos assistenciais de IA do Databricks são serviços designados que usam o Databricks Geos para gerenciar a residência de dados ao processar o conteúdo do cliente. O roteamento de tráfego depende de sua região e se o processamento entre áreas geográficas está habilitado (Forçar o processamento de dados na Geografia do espaço de trabalho para Serviços Designados está desabilitado).

Posso usar recursos assistenciais de IA com tabelas que processam dados regulamentados (PHI, PCI, IRAP, FedRAMP)?

Sim. Para fazer isso, você precisa cumprir os requisitos, como habilitar o perfil de segurança de conformidade e adicionar o padrão de conformidade relevante como parte da configuração do perfil de segurança de conformidade.

Modelos hospedados pelo Databricks

Como os recursos assistenciais de IA funcionam com modelos hospedados pelo Databricks?

Quando os recursos de IA alimentados por parceiros são desabilitados, os recursos assistenciais de IA usam modelos hospedados pelo Databricks, que são totalmente selecionados pelo Databricks e gerenciados pelo Databricks. O Databricks usa modelos de software livre disponíveis para uso comercial, como os OSS de GPT do OpenAI.

O diagrama a seguir fornece uma visão geral de como um modelo hospedado pelo Databricks alimenta recursos de IA do Databricks, como Correção Rápida.

Diagrama do fluxo de trabalho do Genie Code alimentado por um modelo hospedado pelo Databricks.

  1. Um usuário executa uma célula de notebook, o que resulta em um erro.
  2. O Databricks anexa metadados a uma solicitação e os envia para um LLM (modelo de linguagem grande) hospedado pelo Databricks. Todos os dados são criptografados quando inativos. Os clientes podem usar uma CMK (chave gerenciada pelo cliente).
  3. O modelo hospedado pelo Databricks responde com as edições de código sugeridas para corrigir o erro, que é exibido para o usuário.