Modelos de base hospedados pelo Databricks disponíveis nas APIs do Foundation Model

Este artigo descreve os modelos abertos de última geração com suporte das APIs de Modelo do Databricks Foundation.

Observação

Consulte os modelos de base com suporte no Model Serving para obter a disponibilidade de região desses modelos e as áreas de recursos com suporte.

Observação

No Azure Databricks, modelos OpenAI e Google Gemini, junto com Zhipu AI GLM 5.3 Flash e GLM 5.2, Moonshot AI Kimi K3, Thinking Machine Labs Inkling e DeepSeek V4 Flash, estão disponíveis por meio dos serviços ADI, fornecidos pela Databricks. Para configuração e acesso, veja Serviços ADI.

Você pode enviar solicitações de consulta para esses modelos usando os endpoints de pagamento por token disponíveis no seu ambiente de trabalho no Databricks. Confira Usar modelos de base e tabela de modelos com suporte para pagamento por token para obter os nomes dos pontos de extremidade dos modelos a serem usados.

Além de modelos compatíveis com o modo de pagamento por token, as APIs do Modelo de Base também oferecem o modo de taxa de transferência provisionada. O Databricks recomenda a taxa de transferência provisionada para as cargas de trabalho de produção. Esse modo dá suporte a todos os modelos de uma família de arquitetura de modelo, incluindo os modelos ajustados e personalizados pré-treinados com suporte no modo pagamento por token. Confira APIs do Modelo de Base com taxa de transferência provisionada para obter uma lista de arquiteturas com suporte.

Você pode interagir com esses modelos com suporte usando o Playground de IA.

Para modelos OpenAI, Google Gemini e Anthropic, a janela de contexto e os tokens de saída máxima correspondem aos valores publicados pelo respectivo provedor de modelos.

OpenAI GPT-5.6 Sol

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-6-sol

Entradas com suporte: texto, imagem

GPT-5.6 Sol, também conhecido como GPT-5.6, é o modelo principal da OpenAI na família GPT-5.6, oferecendo desempenho de ponta em codificação agente, raciocínio de longo prazo e uso complexo de ferramentas, com suporte para um novo esforço máximo de raciocínio. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5.6 Terra

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-6-terra

Entradas com suporte: texto, imagem

GPT-5.6 Terra é o modelo balanceado da família GPT-5.6 da OpenAI para cargas de trabalho diárias de agentes e raciocínio, oferecendo desempenho competitivo com o GPT-5.5 a um custo menor. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5.6 Luna

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-6-luna

Entradas com suporte: texto, imagem

O GPT-5.6 Luna é o modelo rápido e econômico da família GPT-5.6 da OpenAI, trazendo forte raciocínio e capacidade agentiva ao menor custo da linha. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5.5 Pro

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

O GPT-5.5 Pro utiliza cache de prompts estendido. Tensores em cache são armazenados no armazenamento local da GPU por no máximo 24 horas.

Observação

Esse modelo não é suportado no AI Playground. Use a API Responses para interagir com esse modelo.

Nome do ponto de extremidade: databricks-gpt-5-5-pro

Entradas com suporte: texto, imagem

GPT-5.5 Pro é uma variante de maior precisão do GPT-5.5, voltada para os problemas mais difíceis, incluindo pesquisa profunda, matemática avançada e raciocínio de alto risco. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5.5

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

O GPT-5.5 utiliza cache de prompts estendido. Tensores em cache são armazenados no armazenamento local da GPU por no máximo 24 horas.

Observação

Esse modelo não é suportado no AI Playground. Use a API Responses para interagir com esse modelo.

Nome do ponto de extremidade: databricks-gpt-5-5

Entradas com suporte: texto, imagem

O GPT-5.5 é o modelo de fronteira mais forte da OpenAI para fluxos de trabalho de agentes empresariais, raciocínio complexo de documentos e agentes de codificação de longo prazo. O GPT-5.5 também alimenta o Codex, o agente de programação da OpenAI. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5.4

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-4

Entradas com suporte: texto, imagem

GPT-5.4 é um modelo de linguagem de grande porte de propósito geral com capacidades de raciocínio, desenvolvido pela OpenAI. Ele oferece desempenho aprimorado em tarefas complexas com maior precisão e raciocínio estruturado mais deliberado. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5.4 mini

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-4-mini

Entradas com suporte: texto, imagem

GPT-5.4 mini é um modelo de linguagem de uso geral otimizado para custos, com capacidades de raciocínio desenvolvido pela OpenAI. Construído sobre a arquitetura GPT-5.4, esse modelo oferece desempenho aprimorado em tarefas bem definidas que exigem raciocínio confiável, linguagem precisa e saída rápida. Ele suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5.4 nano

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-4-nano

Entradas com suporte: texto, imagem

GPT-5.4 nano é um modelo de linguagem de grande porte de uso geral com capacidades de raciocínio desenvolvido pela OpenAI. Construído sobre a arquitetura GPT-5.4, esse modelo se destaca em tarefas de alto rendimento, como seguir instruções simples ou classificação para processos de negócios rotineiros ou aplicações móveis. Ele suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Códice OpenAI GPT-5.3

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Observação

Esse modelo não é suportado no AI Playground. Use a API Responses para interagir com esse modelo.

Nome do ponto de extremidade: databricks-gpt-5-3-codex

Entradas com suporte: texto, imagem

O GPT-5.3 Codex é o modelo de codificação agente mais avançado da OpenAI, projetado para lidar com tarefas complexas e de longa duração que envolvem pesquisa, uso de ferramentas e execução. Ele combina desempenho de codificação de vanguarda com o raciocínio e conhecimento profissional do GPT-5.2, operando 25% mais rápido. O modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5.2

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-2

Entradas com suporte: texto, imagem

GPT-5.2 é um modelo de linguagem de grande porte de propósito geral com capacidades de raciocínio desenvolvido pela OpenAI. Esse modelo se baseia diretamente no GPT-5.1, oferecendo maior precisão, maior eficiência de tokens em tarefas de média a complexidade e raciocínio mais deliberado e estruturado. Esse modelo se destaca em extração estruturada, fluxos de trabalho em múltiplas etapas e tarefas multimodais. Ele suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5.1

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-1

Entradas com suporte: texto, imagem

GPT-5.1 é um modelo de linguagem de grande porte de propósito geral com capacidades de raciocínio desenvolvido pela OpenAI. Este modelo conta com modos Instantâneo e Pensamento para conversas rápidas ou raciocínio profundo, ajustando-se automaticamente para tarefas simples ou complexas. O modelo se destaca em criação de conteúdo, tutoria, suporte técnico e programação, com menos dependência de engenharia rigorosa de prompts do que as versões anteriores. Ele suporta entradas multimodais. Saiba mais sobre o GPT-5.1.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5

Entradas com suporte: texto, imagem

O GPT-5 é um modelo de linguagem grande de uso geral de última geração e um modelo de raciocínio criado e treinado pela OpenAI. Ele suporta entradas multimodais. O modelo é criado para codificação, chat, raciocínio e tarefas controladas por agente.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5 Mini

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-mini

Entradas com suporte: texto, imagem

O GPT-5 mini é um modelo de linguagem grande de uso geral de última geração e um modelo de raciocínio criado e treinado pela OpenAI. Ele suporta entradas multimodais. O modelo tem otimização de custo para cargas de trabalho de raciocínio e chat e se destaca em tarefas bem definidas que exigem raciocínio confiável, linguagem precisa e saída rápida para texto e imagens.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT-5 nano

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos do modelo aplicáveis.

Nome do ponto de extremidade: databricks-gpt-5-nano

Entradas com suporte: texto, imagem

GPT-5 nano é um modelo de linguagem grande de uso geral de última geração e modelo de raciocínio criado e treinado pela OpenAI. Ele suporta entradas multimodais. O modelo se destaca em tarefas de alta capacidade de processamento, como seguimento de instruções simples ou classificação para processos comerciais rotineiros ou aplicativos móveis.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Google Gemini 3.7 Flash

Importante

Veja Termos de modelo aplicáveis para Gemini 3.7 Flash.

Esse modelo é hospedado em um ponto de extremidade global e requer que o roteamento entre geografias seja habilitado.

Nome do ponto de extremidade: databricks-gemini-3-7-flash

Entradas com suporte: texto, imagem, vídeo, áudio

Gemini 3.7 Flash é um modelo multimodal de IA desenvolvido e treinado pelo Google. Ele suporta chamada de funções e raciocínio híbrido para cargas de trabalho de uso geral e multimodais. O reasoning_effort parâmetro aceita valores de "low", "medium" (padrão), ou "high". O Gemini 3.7 Flash não suporta "minimal". Saiba mais sobre o Gemini 3.7 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Google Gemini 3.6 Flash

Importante

Veja Termos de modelo aplicáveis para Gemini 3.6 Flash.

Esse modelo é hospedado em um ponto de extremidade global e requer que o roteamento entre geografias seja habilitado.

Nome do ponto de extremidade: databricks-gemini-3-6-flash

Entradas com suporte: texto, imagem, vídeo, áudio

Gemini 3.6 Flash é um modelo de IA multimodal de alta velocidade, econômico e desenvolvido e treinado pelo Google. Como sucessor do Gemini 3.5 Flash, este modelo oferece raciocínio mais forte, capacidades multimodais avançadas e melhor desempenho de preço para implantações em escala de produção. O Gemini 3.6 Flash é otimizado para cargas de trabalho de alta produtividade, como análise complexa de vídeo, extração de dados e sessões visuais. Saiba mais sobre o Gemini 3.6 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Google Gemini 3.5 Flash

Importante

Veja Termos de modelo aplicáveis para Gemini 3.5 Flash.

Nome do ponto de extremidade: databricks-gemini-3-5-flash

Entradas com suporte: texto, imagem, vídeo, áudio

Gemini 3.5 Flash é um modelo de IA multimodal de alta velocidade, econômico e econômico, desenvolvido e treinado pelo Google. Como um avanço significativo em relação ao Gemini 3 Flash, este modelo oferece raciocínio mais forte, capacidades multimodais avançadas e melhor desempenho de preço para implantações em escala de produção. O Gemini 3.5 Flash é otimizado para cargas de trabalho de alta produtividade, como análise complexa de vídeo, extração de dados e sessões visuais. Saiba mais sobre o Gemini 3.5 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Google Gemini 3.5 Flash Lite

Importante

Veja Termos de modelo aplicáveis para Gemini 3.5 Flash Lite.

Esse modelo é hospedado em um ponto de extremidade global e requer que o roteamento entre geografias seja habilitado.

Nome do ponto de extremidade: databricks-gemini-3-5-flash-lite

Entradas com suporte: texto, imagem, vídeo, áudio

O Gemini 3.5 Flash Lite é o modelo mais rápido e econômico da série Gemini 3, desenvolvido e treinado pelo Google. O modelo suporta entradas multimodais com capacidades de imagem, chamada de funções e saída estruturada. O Gemini 3.5 Flash Lite é otimizado para implantações de alta taxa e custos efetivos.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Prévia do Google Gemini 3.1 Pro

Importante

Veja Termos de modelo aplicáveis para a prévia do Gemini 3.1 Pro.

Esse modelo é hospedado em um ponto de extremidade global e requer que o roteamento entre geografias seja habilitado.

Nome do ponto de extremidade: databricks-gemini-3-1-pro

Entradas com suporte: texto, imagem, vídeo, áudio

Gemini 3.1 Pro Preview é um modelo híbrido de raciocínio de última geração desenvolvido e treinado pelo Google. Ele oferece raciocínio forte e inteligência documental, tornando-se um modelo inteligente para fluxos de trabalho e tarefas complexas. Ele se destaca em raciocínio complexo, análise profunda e compreensão multimodal em uma ampla gama de entradas e tarefas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Google Gemini 3.1 Imagem Flash

Importante

Veja Termos de modelo aplicáveis para a imagem Flash Gemini 3.1.

Esse modelo é hospedado em um ponto de extremidade global e requer que o roteamento entre geografias seja habilitado.

Esse modelo gera imagens como saída, além de texto. O Google utiliza preços de passagem para esse modelo, e os tokens de imagem de saída são faturados separadamente dos tokens de texto de saída. Veja o preço do Google Gemini 3.1 Flash Image para mais detalhes.

O Gemini 3.1 Flash Image está disponível apenas através do sistema de pagamento por token das APIs do Foundation Model. Não é suportado para throughput provisionado, inferência em lote de AI Functions, ai_queryou AI Playground.

Nome do ponto de extremidade: databricks-gemini-3-1-flash-image

Entradas com suporte: texto, imagem

Gemini 3.1 Flash Image é o modelo Gemini de geração de imagens do Google. Uma única solicitação pode devolver imagens geradas junto com o texto. Esse modelo não suporta chamada de função.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Google Gemini 3.1 Flash Lite

Importante

Consulte os termos de modelo aplicáveis para Gemini 3.1 Flash Lite.

Esse modelo é hospedado em um ponto de extremidade global e requer que o roteamento entre geografias seja habilitado.

Nome do ponto de extremidade: databricks-gemini-3-1-flash-lite

Entradas com suporte: texto, imagem, vídeo, áudio

Gemini 3.1 Flash Lite é o modelo mais rápido e econômico da série Gemini 3, desenvolvido e treinado pelo Google. Criado para inteligência em escala, o modelo dá suporte a entradas multimodal com funcionalidades de imagem, chamada de função e saída estruturada. O Gemini 3.1 Flash Lite é otimizado para implantações econômicas e de alta taxa de transferência. Saiba mais sobre o Gemini 3.1 Flash Lite.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Imagem do Gemini 3 Pro no Google

Importante

Veja Termos de modelo aplicáveis para a imagem Gemini 3 Pro.

Esse modelo é hospedado em um ponto de extremidade global e requer que o roteamento entre geografias seja habilitado.

Esse modelo gera imagens como saída, além de texto. O Google utiliza preços de passagem para esse modelo, e os tokens de imagem de saída são faturados separadamente dos tokens de texto de saída. Veja o preço do Gemini 3 Pro Image do Google para detalhes.

O Gemini 3 Pro Image está disponível apenas através das APIs do Foundation Model pay-per-token. Não é suportado para throughput provisionado, inferência em lote de AI Functions, ai_queryou AI Playground.

Nome do ponto de extremidade: databricks-gemini-3-pro-image

Entradas com suporte: texto, imagem

Gemini 3 Pro Image é o modelo Gemini de geração de imagens do Google. Uma única solicitação pode devolver imagens geradas junto com o texto. Esse modelo não suporta chamada de função.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Google Gemini 3 Flash

Importante

Veja Termos de modelo aplicáveis para o Flash Gemini 3.

Esse modelo é hospedado em um ponto de extremidade global e requer que o roteamento entre geografias seja habilitado.

Nome do ponto de extremidade: databricks-gemini-3-flash

Entradas com suporte: texto, imagem, vídeo, áudio

Gemini 3 Flash é um modelo multimodal de IA de alta velocidade e econômico desenvolvido e treinado pelo Google. Esse modelo oferece velocidade e escala sem comprometer a qualidade, apresentando capacidades multimodais avançadas para análise complexa de vídeo, extração de dados e sessões visuais de perguntas e respostas quase em tempo real. O Gemini 3 Flash oferece melhor custo-benefício e velocidades mais rápidas, permitindo implantações em escala de produção. Saiba mais sobre o Gemini 3 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Google Gemini 2.5 Pro

Importante

Veja Termos do modelo aplicável para o Gemini 2.5 Pro.

O Google Gemini 2.5 Pro será aposentado em 2 de outubro de 2026. Consulte Modelos descontinuados e aposentados para ver o modelo de substituição recomendado e orientações sobre como migrar durante a descontinuação.

Nome do ponto de extremidade: databricks-gemini-2-5-pro

Entradas com suporte: texto, imagem, vídeo, áudio

Gemini 2.5 Pro é um modelo híbrido de raciocínio desenvolvido e treinado pelo Google. O "Modo de Pensamento Profundo" do Gemini 2.5 Pro e a saída de áudio interna o diferenciam como um modelo líder para aplicativos empresariais, de pesquisa e criativos. Ele foi projetado para se destacar em raciocínio complexo, análise profunda e compreensão multimodal em uma ampla gama de entradas e tarefas. Saiba mais sobre o Gemini 2.5 Pro.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Google Gemini 2.5 Flash

Importante

Veja Termos de modelo aplicáveis para o Gemini 2.5 Flash.

O Google Gemini 2.5 Flash está descontinuado e está planejado para aposentadoria em 2 de outubro de 2026. Consulte Modelos descontinuados e aposentados para ver o modelo de substituição recomendado e orientações sobre como migrar durante a descontinuação.

Nome do ponto de extremidade: databricks-gemini-2-5-flash

Entradas com suporte: texto, imagem, vídeo, áudio

O Gemini 2.5 Flash é um modelo de IA multimodal de alta velocidade, econômico e multimodal desenvolvido e treinado pelo Google. É o primeiro modelo de raciocínio totalmente híbrido do Google, projetado para desenvolvedores e empresas que buscam soluções de IA rápidas, escalonáveis e acessíveis. O Gemini 2.5 Flash é otimizado para aplicativos em tempo real e de alto volume, como chatbots, extração de dados, tradução e análise de documentos. Saiba mais sobre o Gemini 2.5 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Alibaba Cloud Qwen3.5 122B A10B

Importante

O modelo Qwen3.5 122B A10B está em Versão Prévia Pública.

Nome do ponto de extremidade: databricks-qwen35-122b-a10b

Entradas com suporte: texto

O Qwen3.5 122B A10B é um modelo de raciocínio híbrido do MoE (Mix-of-Experts) criado e treinado pelo Alibaba Cloud, com 122 bilhões de parâmetros totais e 10 bilhões de parâmetros ativos por inferência. O modelo suporta uma janela de contexto de 256K e até 25K tokens de saída, além de oferecer forte desempenho em tarefas de raciocínio, codificação e agentes. Como um modelo somente de raciocínio, o Qwen3.5 122B A10B sempre tem motivos antes de responder e o raciocínio não pode ser desabilitado.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Alibaba Cloud Qwen3-Embedding-0.6B

Importante

O modelo Qwen3-Embedding-0.6B está em Versão Prévia Pública.

Nome do ponto de extremidade: databricks-qwen3-embedding-0-6b

Entradas com suporte: texto

Qwen3-Embedding-0.6B é um modelo de inserção de texto compacto com parâmetros ~600M, projetado para tarefas semânticas, como recuperação, pesquisa de similaridade, clustering e classificação. Ele codifica o texto em vetores densos que representam significado em vez de forma de superfície.

O modelo dá suporte a mais de 100 idiomas (incluindo código) e manipula contextos longos de até ~32 mil tokens, tornando-o adequado para a inserção de documentos longos. Ele produz inserções com uma dimensionalidade configurável até 1024 e tem reconhecimento de instruções, permitindo o desvio específico da tarefa por meio de prompts.

Construído com um codificador de transformador e otimizado especificamente para a geração de vetorização, o Qwen3-Embedding-0.6B equilibra a qualidade da vetorização com uma inferência eficiente.

Os modelos de incorporação são especialmente eficazes quando usados em conjunto com LLMs para casos de uso de geração aumentada de recuperação (RAG). Qwen3-Embedding-0.6B pode ser usado para localizar snippets de texto relevantes em grandes partes de documentos que podem ser usados no contexto de uma LLM.

Instrução do Alibaba Cloud Qwen3-Next 80B A3B

Importante

O modelo de Instrução A3B de Qwen3-Next 80B está em Versão Prévia Pública.

Nome do ponto de extremidade: databricks-qwen3-next-80b-a3b-instruct

Entradas com suporte: texto

Qwen3-Next-80B-A3B-Instruct é um modelo de linguagem grande altamente eficiente otimizado para tarefas de seguimento de instruções criado e treinado pela Alibaba Cloud. Esse modelo foi projetado para lidar com contextos extremamente longos e destaca-se em fluxos de trabalho de várias etapas, geração com recuperação aumentada e aplicações empresariais que exigem saídas determinísticas em alto desempenho.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Zhipu AI GLM 5.3 Flash

Nome do ponto de extremidade: databricks-glm-5-3-flash

Entradas com suporte: texto, imagem

O GLM-5.3-Flash é um modelo nativamente multimodal de especialistas (MoE) com 320 bilhões de parâmetros totais e 18 bilhões de parâmetros ativos desenvolvidos pela Zhipu AI. O modelo suporta um comprimento de contexto de 1.048.576 tokens e é otimizado para o uso de raciocínio, codificação e ferramentas agentes. Saiba mais sobre o GLM-5.3-Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Zhipu AI GLM 5.2

Nome do ponto de extremidade: databricks-glm-5-2

Entradas com suporte: texto

O GLM-5.2 é uma mistura de modelos de linguagem de especialistas (MoE) com 753 bilhões de parâmetros totais desenvolvidos pela Zhipu AI. O modelo suporta um comprimento de contexto de 1 milhão de tokens e é otimizado para raciocínio de longo prazo, codificação e uso de ferramentas agentes.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Moonshot AI Kimi K3

Nome do ponto de extremidade: databricks-kimi-k3

Entradas com suporte: texto, imagem

Kimi K3 é um modelo de 2,8 trilhões de parâmetros desenvolvido pela Moonshot AI com capacidades nativas de visão. O modelo suporta um comprimento de contexto de 1 milhão de tokens e é projetado para codificação de longo prazo, trabalho de conhecimento e raciocínio.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Flash DeepSeek V4 (0731)

Nome do ponto de extremidade: databricks-deepseek-v4-flash-0731

Entradas com suporte: texto

DeepSeek V4 Flash (0731) é uma mistura híbrida de modelos de linguagem de especialistas (MoE) com 284 bilhões de parâmetros totais e 13 bilhões de parâmetros ativos desenvolvidos pela DeepSeek. O modelo é otimizado para raciocínio, codificação e uso de ferramentas agentivas rápidas e econômicas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT OSS 120B

Nome do ponto de extremidade: databricks-gpt-oss-120b

Entradas com suporte: texto

GPT OSS 120B é um modelo de raciocínio de última geração, com capacidade de raciocínio em cadeia e níveis de esforço ajustáveis, desenvolvido e treinado pela OpenAI. É o principal modelo de peso aberto da OpenAI e apresenta uma janela de contexto de token de 128K. O modelo é criado para tarefas de raciocínio de alta qualidade.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

OpenAI GPT OSS 20B

Nome do ponto de extremidade: databricks-gpt-oss-20b

Entradas com suporte: texto

GPT OSS 20B é um modelo de raciocínio leve de última geração criado e treinado pela OpenAI. Esse modelo tem uma janela de contexto de token de 128K e se destaca em copilots em tempo real e tarefas de inferência em lote.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Pesquise no Google por Gemma 3 12B

Importante

Consulte os termos aplicáveis ao modelo para os termos do Gemma 3 e a Política de Uso Aceitável.

Nome do ponto de extremidade: databricks-gemma-3-12b

Entradas com suporte: texto, imagem

Gemma 3 12B é um modelo de linguagem multimodal e visual de 12 bilhões de parâmetros desenvolvido pelo Google como parte da família Gemma 3. Gemma 3 tem até um contexto de token de 128K e fornece suporte multilíngue para mais de 140 idiomas. Esse modelo foi projetado para lidar com entradas de texto e imagem e gerar saídas de texto e é otimizado para casos de uso de diálogo, geração de texto e tarefas de compreensão de imagem, incluindo resposta a perguntas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

"Meta Llama 4 Maverick"

Importante

Consulte os termos de modelo aplicáveis para a Licença da Comunidade do Llama 4 e a Política de Uso Aceitável.

Nome do ponto de extremidade: databricks-llama-4-maverick

Entradas com suporte: texto, imagem

Llama 4 Maverick é um modelo de linguagem grande de última geração criado e treinado pelo Meta. É o primeiro da família de modelos Llama a usar uma arquitetura de mistura de especialistas para eficiência computacional. O Llama 4 Maverick dá suporte a vários idiomas e é otimizado para casos precisos de uso de imagens e de compreensão de texto. Saiba mais sobre Llama 4 Maverick.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Instrução meta llama 3.3 70B

Importante

Desde 11 de dezembro de 2024, o Meta-Llama-3.3-70B-Instruct substitui o suporte para Meta-Llama-3.1-70B-Instruct nos pontos de extremidade de pagamento por token das APIs do modelo de base.

Consulte os termos de modelo aplicáveis para a Licença da Comunidade LLama 3.3 e a Política de Uso Aceitável.

Nome do ponto de extremidade: databricks-meta-llama-3-3-70b-instruct

Entradas com suporte: texto

Meta-Llama-3.3-70B-Instruct é um modelo de linguagem grande de última geração com um contexto de 128.000 tokens que foi criado e treinado pelo Meta. O modelo dá suporte a vários idiomas e é otimizado para casos de uso de diálogo. Saiba mais sobre o Meta Llama 3.3.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Instrução meta llama 3.1 8B

Importante

Consulte os termos de modelo aplicáveis para a Licença da Comunidade LLama 3.1 e a Política de Uso Aceitável.

Nome do ponto de extremidade: databricks-meta-llama-3-1-8b-instruct

Entradas com suporte: texto

Meta-Llama-3.1-8B-Instruct é um modelo de linguagem grande de última geração com um contexto de 128.000 tokens que foi criado e treinado pelo Meta. O modelo dá suporte a vários idiomas e é otimizado para casos de uso de diálogo. Saiba mais sobre o Meta Llama 3.1.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Anthropic Claude Haiku 4.5

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-haiku-4-5

Entradas com suporte: texto, imagem

Claude Haiku 4.5 é o modelo mais rápido e econômico da Antropic, fornecendo qualidade de codificação quase fronteiriça com velocidade e eficiência excepcionais. Ele se destaca em aplicativos de baixa latência em tempo real, incluindo assistentes de chat, agentes de atendimento ao cliente, programação de pares e criação rápida de protótipos. Esse modelo é ideal para implantações de produção voltadas para o custo e sistemas agentuais que exigem assistência de IA responsiva.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Anthropic Claude Soneto 5

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-sonnet-5

Entradas com suporte: texto, imagem

Observação

Claude Sonnet 5 não dá suporte aos temperatureparâmetros , top_pou top_k amostragem. As solicitações que incluem esses parâmetros retornam um erro 400.

Claude Sonnet 5 é o modelo de Sonnet mais capaz do Anthropic, projetado para codificação, fluxos de trabalho agente e trabalho profissional em escala. Ele combina inteligência de nível quase Opus com a eficiência e velocidade de custo da Sonnet, tornando-a adequada para agentes voltados para o cliente, fluxos de trabalho de codificação de produção e tarefas sofisticadas de geração de conteúdo.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Anthropic Claude Sonnet 4.6

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-sonnet-4-6

Entradas com suporte: texto, imagem

Claude Sonnet 4.6 é o modelo de raciocínio híbrido mais avançado da Anthropic. Ele oferece dois modos: respostas quase instantâneas e pensamento estendido para um raciocínio mais profundo com base na complexidade da tarefa. Claude Sonnet 4.6 é especializado em aplicativos que exigem um equilíbrio de taxa de transferência prática e pensamento avançado, como agentes voltados para o cliente, fluxos de trabalho de codificação de produção e geração de conteúdo em escala.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Antrópico Claude Sonnet 4.5

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-sonnet-4-5

Entradas com suporte: texto, imagem

Claude Sonnet 4.5 é o modelo de raciocínio híbrido mais avançado da Anthropic. Ele oferece dois modos: respostas quase instantâneas e pensamento estendido para um raciocínio mais profundo com base na complexidade da tarefa. Claude Sonnet 4.5 é especializado em aplicativos que exigem um equilíbrio de taxa de transferência prática e pensamento avançado, como agentes voltados para o cliente, fluxos de trabalho de codificação de produção e geração de conteúdo em escala.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Anthropic Claude Fábula 5

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associado comercial do Databricks.

Importante

Para Claude Fable 5, as solicitações e respostas são mantidas por 30 dias para fins de confiança e segurança. Esses dados são processados por sistemas de segurança automatizados e podem, em determinadas instâncias, ser sinalizados para revisão humana. Os dados são excluídos automaticamente após 30 dias, exceto no caso de uma investigação de segurança ou requisitos legais para manter os dados além de 30 dias. Anthropic é um subprocessador limitado para essa finalidade de retenção de segurança.

Nome do ponto de extremidade: databricks-claude-fable-5

Entradas com suporte: texto

Claude Fable 5 é um modelo da classe Mythos de Anthropic projetado para trabalho e codificação de conhecimento autônomo. Com proteções robustas internas, ele pode lidar com tarefas longas, complexas e assíncronas com menos necessidade de check-ins humanos do que os modelos anteriores, tornando-o adequado para fluxos de trabalho agente que exigem foco sustentado em contextos estendidos.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Anthropic Claude Opus 5

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-opus-5

Entradas com suporte: texto, imagem

Claude Opus 5 é o modelo de raciocínio híbrido mais capaz da Anthropic, com base na série Opus com foco em codificação agente, revisão de código e trabalho autônomo de horizonte longo. Esse modelo se destaca em tarefas complexas de software de vários arquivos, como refatorações grandes e desenvolvimento de recursos de ponta a ponta, descoberta de bugs de alta precisão, coordenação de vários agentes e tarefas de visão, como gráfico, documento e compreensão da interface do usuário. Claude Opus 5 mantém forte acompanhamento de instruções, chamada de ferramentas e raciocínio em toda a janela de contexto, e entrega qualidade quase máxima com esforço de raciocínio baixo e médio, tornando-o bem adequado para fluxos de trabalho corporativos sensíveis a custos e de contexto longo.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Anthropic Claude Opus 4.8

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-opus-4-8

Entradas com suporte: texto, imagem

Claude Opus 4.8 baseia-se na série Opus com aprimoramentos adicionais nas funcionalidades de precisão, eficiência e raciocínio. Esse modelo se destaca em tarefas complexas de extração e raciocínio agente com suporte de imagem, tornando-o ideal para aplicativos empresariais que exigem análise profunda, compreensão de documentos e fluxos de trabalho sofisticados de várias etapas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Anthropic Claude Opus 4.7

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-opus-4-7

Entradas com suporte: texto, imagem

Claude Opus 4.7 é o modelo de raciocínio híbrido mais capaz da Anthropic, avançando na série Opus com maior precisão, eficiência e funcionalidades de visão aprimoradas. Esse modelo oferece um desempenho mais forte em tarefas complexas de extração e raciocínio agente, usando menos tokens de saída do que seu antecessor. Claude Opus 4.7 oferece suporte aumentado à resolução de imagem, tornando-o ideal para aplicações empresariais que exigem análise profunda, compreensão documental e fluxos de trabalho sofisticados em múltiplas etapas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Anthropic Claude Opus 4.6

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-opus-4-6

Entradas com suporte: texto, imagem

Claude Opus 4.6 é o modelo de raciocínio híbrido mais capaz da Anthropic com funcionalidades de pensamento adaptável. Esse modelo apresenta um novo nível máximo de esforço para as tarefas mais exigentes, com alto esforço definido como o padrão para o desempenho ideal. Claude Opus 4.6 se destaca no raciocínio complexo, análise profunda, geração de código, pesquisa e fluxos de trabalho sofisticados de várias etapas. É ideal para aplicações empresariais que exigem tanto análise extensa quanto resultados abrangentes.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Antropic Claude Opus 4.5

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-opus-4-5

Entradas com suporte: texto, imagem

Claude Opus 4.5 é o modelo de raciocínio híbrido mais capaz da Anthropic, criado para as tarefas mais complexas que exigem análise profunda e pensamento estendido. Esse modelo combina capacidades poderosas de uso geral com raciocínio avançado, destacando-se na geração de código, pesquisa, criação de conteúdo e em fluxos de trabalho sofisticados de múltiplas etapas com agentes. Claude Opus 4.5 suporta entradas de texto e visão, tornando-o ideal para aplicações empresariais que exigem tanto amplitude quanto profundidade de compreensão.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Anthropic Claude Sonnet 4

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Anthropic Claude Sonnet 4 foi preterido. Consulte modelos preteridos e desativados para sua data de desativação, modelo de substituição recomendado e diretrizes de como migrar durante a substituição.

Nome do ponto de extremidade: databricks-claude-sonnet-4

Entradas com suporte: texto, imagem

Claude Sonnet 4 é um modelo de raciocínio híbrido de última geração criado e treinado pela Antropic. Esse modelo oferece dois modos: respostas quase instantâneas e pensamento estendido para um raciocínio mais profundo com base na complexidade da tarefa. O Claude Sonnet 4 é otimizado para várias tarefas, como desenvolvimento de código, análise de conteúdo em larga escala e desenvolvimento de aplicativos de agente.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Anthropic Claude Opus 4.1

Importante

Os clientes são responsáveis por garantir sua conformidade com os termos da política de uso da Antropic. Consulte também o Contrato de Serviços de Nuvem Mestres do Databricks e, quando aplicável, o Contrato de Associação Comercial do Databricks.

Nome do ponto de extremidade: databricks-claude-opus-4-1

Entradas com suporte: texto, imagem

Claude Opus 4.1 é um modelo de raciocínio híbrido de última geração criado e treinado pela Antropic. Esse modelo de linguagem de uso geral grande foi projetado para raciocínio complexo e aplicativos do mundo real em escala empresarial. Ele suporta entrada de texto e imagem. Esse modelo se destaca em tarefas como geração de código, criação de conteúdo e pesquisa e fluxos de trabalho de agentes de várias etapas sem intervenção humana constante.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

Este endpoint é hospedado pelo Databricks dentro do perímetro de segurança.

Inkling dos Laboratórios de Máquinas Pensantes

Importante

Inkling está em prévia pública.

Nome do ponto de extremidade: databricks-inkling

Entradas com suporte: texto, imagem

Inkling é uma mistura de modelos de linguagem de especialistas (MoE) com 975 bilhões de parâmetros totais e 41 bilhões de parâmetros ativos desenvolvidos pela Thinking Machine Labs. O modelo suporta um comprimento de contexto de 1 milhão de tokens e é otimizado para tarefas de codificação, raciocínio e uso de ferramentas agentes.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. O Databricks recomenda que os clientes avaliem seus modelos para garantir que eles estejam operando conforme o esperado.

GTE Grande (En)

Nome do ponto de extremidade: databricks-gte-large-en

Entradas com suporte: texto

GTE (General Text Embedding) é um modelo de incorporação de texto que pode mapear qualquer texto para um vetor de incorporação de 1024 dimensões e uma janela de incorporação de 8192 tokens. Esses vetores podem ser usados em índices vetoriais para LLMs e para tarefas como recuperação, classificação, resposta a perguntas, clustering ou pesquisa semântica. Esse ponto de extremidade atende à versão em inglês do modelo e não gera inserções normalizadas.

Os modelos de incorporação são especialmente eficazes quando usados em conjunto com LLMs para casos de uso de geração aumentada de recuperação (RAG). O GTE pode ser usado para localizar trechos de texto relevantes em grandes partes de documentos que podem ser usados no contexto de uma LLM.

BGE Grande (En)

Nome do ponto de extremidade: databricks-bge-large-en

Entradas com suporte: texto

O BGE (Inserção Geral da BAAI) é um modelo de inserção de texto que pode mapear qualquer texto para um vetor de inserção de 1024 dimensões e uma janela de inserção de 512 tokens. Esses vetores podem ser usados em índices vetoriais para LLMs e para tarefas como recuperação, classificação, resposta a perguntas, clustering ou pesquisa semântica. Esse ponto de extremidade atende à versão em inglês do modelo e gera inserções normalizadas.

Os modelos de incorporação são especialmente eficazes quando usados em conjunto com LLMs para casos de uso de geração aumentada de recuperação (RAG). O BGE pode ser usado para localizar trechos de texto relevantes em grandes partes de documentos que podem ser usados no contexto de uma LLM.

Em aplicativos RAG, você pode melhorar o desempenho do sistema de recuperação incluindo um parâmetro de instrução. Os autores do BGE recomendam tentar a instrução "Represent this sentence for searching relevant passages:" para inserções de consulta, embora seu impacto no desempenho dependa do domínio.

Recursos adicionais