Modelos de base hospedados pelo Databricks disponíveis nas APIs do Modelo de Fundação

Este artigo descreve os modelos abertos de última geração suportados pelas APIs do Databricks Foundation Model.

Observação

Consulte Modelos de fundação suportados no Model Serving para a disponibilidade regional destes modelos e as áreas de características suportadas.

Observação

No Azure Databricks, OpenAI e modelos Google Gemini, juntamente com o Zhipu AI GLM 5.3 Flash e GLM 5.2, Moonshot AI Kimi K3, Thinking Machine Labs Inkling e DeepSeek V4 Flash, estão disponíveis através dos serviços ADI, fornecidos pela Databricks. Para configuração e acesso, consulte Serviços ADI.

Você pode enviar pedidos de consulta para estes modelos usando os endpoints de pagamento por token disponíveis no seu espaço de trabalho Databricks. Consulte Usar modelos de base e tabela de modelos suportados por pagamento por token para obter os nomes dos pontos de extremidade do modelo a serem usados.

Além de oferecer suporte a modelos no modo de pagamento por token, as APIs do Foundation Model também oferecem o modo de taxa de transferência provisionada. O Databricks recomenda a taxa de transferência provisionada para cargas de trabalho de produção. Este modo suporta todos os modelos de uma família de arquitetura de modelos, incluindo os modelos ajustados e pré-treinados de forma personalizada, suportados no modo de pagamento por token. Consulte APIs do Modelo de Base de transferência provisionado para obter a lista de arquiteturas suportadas.

Você pode interagir com esses modelos suportados usando o AI Playground.

Para modelos OpenAI, Google Gemini e Anthropic, a janela de contexto e os tokens de saída máxima correspondem aos valores publicados pelo respetivo fornecedor de modelos.

OpenAI GPT-5.6 Sol

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-6-sol

Entradas suportadas: texto, imagem

O GPT-5.6 Sol, também referido como GPT-5.6, é o modelo topo de gama da OpenAI na família GPT-5.6, oferecendo desempenho de última geração em codificação agente, raciocínio a longo prazo e uso complexo de ferramentas, com suporte para um novo esforço máximo de raciocínio. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5.6 Terra

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-6-terra

Entradas suportadas: texto, imagem

O GPT-5.6 Terra é o modelo equilibrado da família GPT-5.6 da OpenAI para cargas de trabalho diárias de agentes e raciocínio, oferecendo desempenho competitivo com o GPT-5.5 a um custo inferior. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5.6 Luna

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-6-luna

Entradas suportadas: texto, imagem

O GPT-5.6 Luna é o modelo rápido e económico da família GPT-5.6 da OpenAI, trazendo forte raciocínio e capacidade agente ao menor custo da gama. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5.5 Pro

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

O GPT-5.5 Pro utiliza cache de prompts estendido. Os tensores em cache são armazenados no armazenamento local da GPU durante no máximo 24 horas.

Observação

Este modelo não é suportado no AI Playground. Use a API Responses para interagir com este modelo.

Nome do ponto final: databricks-gpt-5-5-pro

Entradas suportadas: texto, imagem

O GPT-5.5 Pro é uma variante de maior precisão do GPT-5.5, destinada aos problemas mais difíceis, incluindo investigação aprofundada, matemática avançada e raciocínio de alto risco. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5.5

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

O GPT-5.5 utiliza cache de prompts estendido. Os tensores em cache são armazenados no armazenamento local da GPU durante no máximo 24 horas.

Observação

Este modelo não é suportado no AI Playground. Use a API Responses para interagir com este modelo.

Nome do ponto final: databricks-gpt-5-5

Entradas suportadas: texto, imagem

O GPT-5.5 é o modelo de fronteira mais forte da OpenAI para fluxos de trabalho de agentes empresariais, raciocínio complexo de documentos e agentes de codificação de longo prazo. O GPT-5.5 também alimenta o Codex, o agente de programação da OpenAI. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5.4

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-4

Entradas suportadas: texto, imagem

O GPT-5.4 é um modelo de linguagem de grande porte de uso geral com capacidades de raciocínio desenvolvido pela OpenAI. Oferece melhor desempenho em tarefas complexas com maior precisão e raciocínio estruturado mais deliberado. Este modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5.4 mini

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-4-mini

Entradas suportadas: texto, imagem

O GPT-5.4 mini é um modelo de linguagem de uso geral otimizado para custos, com capacidades de raciocínio, desenvolvido pela OpenAI. Baseado na arquitetura GPT-5.4, este modelo oferece um desempenho melhorado em tarefas bem definidas que requerem raciocínio fiável, linguagem precisa e saída rápida. Suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5.4 nano

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-4-nano

Entradas suportadas: texto, imagem

O GPT-5.4 nano é um modelo de linguagem de grande porte de propósito geral com capacidades de raciocínio desenvolvido pela OpenAI. Construído sobre a arquitetura GPT-5.4, este modelo destaca-se em tarefas de alto rendimento, como seguir instruções simples ou classificação para processos de negócio rotineiros ou aplicações móveis. Suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Códice OpenAI GPT-5.3

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Observação

Este modelo não é suportado no AI Playground. Use a API Responses para interagir com este modelo.

Nome do ponto final: databricks-gpt-5-3-codex

Entradas suportadas: texto, imagem

O GPT-5.3 Codex é o modelo de codificação agente mais avançado da OpenAI, concebido para lidar com tarefas complexas e de longa duração que envolvem investigação, utilização de ferramentas e execução. Combina desempenho de codificação de vanguarda com o raciocínio e conhecimento profissional do GPT-5.2, operando 25% mais rápido. O modelo suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5.2

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-2

Entradas suportadas: texto, imagem

GPT-5.2 é um modelo de linguagem de grande porte de uso geral com capacidades de raciocínio desenvolvido pela OpenAI. Este modelo baseia-se diretamente no GPT-5.1, oferecendo maior precisão, maior eficiência dos tokens em tarefas médias a complexas e um raciocínio mais deliberado e estruturado. Este modelo destaca-se em extração estruturada, fluxos de trabalho em múltiplos passos e tarefas multimodais. Suporta entradas multimodais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5.1

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-1

Entradas suportadas: texto, imagem

GPT-5.1 é um modelo de linguagem de grande porte de propósito geral com capacidades de raciocínio desenvolvido pela OpenAI. Este modelo apresenta modos Instantâneo e Pensamento para conversas rápidas ou raciocínio profundo, ajustando-se automaticamente para tarefas simples ou complexas. O modelo destaca-se na criação de conteúdos, tutoria, suporte técnico e programação, com menos dependência de engenharia rigorosa de prompts do que as versões anteriores. Suporta entradas multimodais. Saiba mais sobre o GPT-5.1.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5

Entradas suportadas: texto, imagem

O GPT-5 é um modelo de linguagem grande e de raciocínio de uso geral de última geração, construído e treinado pela OpenAI. Suporta entradas multimodais. O modelo é construído para codificação, bate-papo, raciocínio e tarefas orientadas por agente.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5 mini

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-mini

Entradas suportadas: texto, imagem

O GPT-5 mini é um modelo de linguagem grande e de uso geral de última geração e um modelo de raciocínio construído e treinado pela OpenAI. Suporta entradas multimodais. O modelo é otimizado em termos de custos para cargas de trabalho de raciocínio e bate-papo e se destaca em tarefas bem definidas que exigem raciocínio confiável, linguagem precisa e saída rápida para texto e imagens.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT-5 nano

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos do modelo aplicáveis.

Nome do ponto final: databricks-gpt-5-nano

Entradas suportadas: texto, imagem

O GPT-5 nano é um modelo de linguagem grande e de uso geral de última geração e um modelo de raciocínio construído e treinado pela OpenAI. Suporta entradas multimodais. O modelo se destaca em tarefas de alto rendimento, como simples acompanhamento de instruções ou classificação para processos de negócios de rotina ou aplicativos móveis.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Google Gemini 3.7 Flash

Importante

Ver Termos de modelo aplicáveis para Gemini 3.7 Flash.

Este modelo é alojado num endpoint global e requer que o encaminhamento entre geografias seja ativado.

Nome do ponto final: databricks-gemini-3-7-flash

Entradas suportadas: texto, imagem, vídeo, áudio

Gemini 3.7 Flash é um modelo multimodal de IA desenvolvido e treinado pela Google. Suporta chamada de funções e raciocínio híbrido para cargas de trabalho de uso geral e multimodais. O reasoning_effort parâmetro aceita valores de "low", "medium" (por defeito), ou "high". O Gemini 3.7 Flash não suporta "minimal". Saiba mais sobre o Gemini 3.7 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Google Gemini 3.6 Flash

Importante

Ver Termos de modelo aplicáveis para Gemini 3.6 Flash.

Este modelo é alojado num endpoint global e requer que o encaminhamento entre geografias seja ativado.

Nome do ponto final: databricks-gemini-3-6-flash

Entradas suportadas: texto, imagem, vídeo, áudio

O Gemini 3.6 Flash é um modelo de IA multimodal de alta velocidade, eficiente em termos de custos, desenvolvido e treinado pela Google. Como sucessor do Gemini 3.5 Flash, este modelo oferece raciocínio mais robusto, capacidades multimodais avançadas e melhor desempenho de preços para implementações em escala de produção. O Gemini 3.6 Flash está otimizado para cargas de trabalho de alto rendimento, como análise complexa de vídeo, extração de dados e perguntas e respostas visuais. Saiba mais sobre o Gemini 3.6 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Google Gemini 3.5 Flash

Importante

Ver Termos de modelo aplicáveis para Gemini 3.5 Flash.

Nome do ponto final: databricks-gemini-3-5-flash

Entradas suportadas: texto, imagem, vídeo, áudio

O Gemini 3.5 Flash é um modelo de IA multimodal de alta velocidade, económico e treinado pela Google. Como um avanço significativo em relação ao Gemini 3 Flash, este modelo oferece raciocínio mais forte, capacidades multimodais avançadas e melhor desempenho de preços para implementações em escala de produção. O Gemini 3.5 Flash está otimizado para cargas de trabalho de alto rendimento, como análise complexa de vídeo, extração de dados e sessões visuais de perguntas e respostas. Saiba mais sobre o Gemini 3.5 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Google Gemini 3.5 Flash Lite

Importante

Ver Termos de modelo aplicáveis para o Gemini 3.5 Flash Lite.

Este modelo é alojado num endpoint global e requer que o encaminhamento entre geografias seja ativado.

Nome do ponto final: databricks-gemini-3-5-flash-lite

Entradas suportadas: texto, imagem, vídeo, áudio

O Gemini 3.5 Flash Lite é o modelo mais rápido e económico da série Gemini 3, desenvolvido e treinado pela Google. O modelo suporta entradas multimodais com capacidades de imagem, chamada de funções e saída estruturada. O Gemini 3.5 Flash Lite está otimizado para implementações de alto rendimento e económicas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Pré-visualização do Google Gemini 3.1 Pro

Importante

Consulte os termos de modelo aplicáveis para a pré-visualização do Gemini 3.1 Pro.

Este modelo é alojado num endpoint global e requer que o encaminhamento entre geografias seja ativado.

Nome do ponto final: databricks-gemini-3-1-pro

Entradas suportadas: texto, imagem, vídeo, áudio

Gemini 3.1 Pro Preview é um modelo híbrido de raciocínio de última geração desenvolvido e treinado pela Google. Oferece um raciocínio sólido e inteligência documental, tornando-se um modelo global inteligente para fluxos de trabalho e tarefas complexas. Destaca-se em raciocínio complexo, análise profunda e compreensão multimodal numa vasta gama de entradas e tarefas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Google Gemini 3.1 Imagem Flash

Importante

Ver Termos de modelo aplicáveis para a imagem flash Gemini 3.1.

Este modelo é alojado num endpoint global e requer que o encaminhamento entre geografias seja ativado.

Este modelo gera imagens como saída, além do texto. A Google utiliza preços de passagem para este modelo, e os tokens de imagem de saída são faturados separadamente dos tokens de texto de saída. Consulte os preços do Gemini 3.1 Flash Image da Google para mais detalhes.

O Gemini 3.1 Flash Image está disponível apenas através das APIs Foundation Model pay-per-token. Não é suportado para throughput provisionado, inferência em lote de AI Functions, ai_queryou AI Playground.

Nome do ponto final: databricks-gemini-3-1-flash-image

Entradas suportadas: texto, imagem

O Gemini 3.1 Flash Image é o modelo Gemini de geração de imagens da Google. Um único pedido pode devolver imagens geradas juntamente com texto. Este modelo não suporta chamadas de funções.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Google Gemini 3.1 Flash Lite

Importante

Ver Termos de modelo aplicáveis para o Gemini 3.1 Flash Lite.

Este modelo é alojado num endpoint global e requer que o encaminhamento entre geografias seja ativado.

Nome do ponto final: databricks-gemini-3-1-flash-lite

Entradas suportadas: texto, imagem, vídeo, áudio

O Gemini 3.1 Flash Lite é o modelo mais rápido e económico da série Gemini 3, desenvolvido e treinado pela Google. Concebido para inteligência em escala, o modelo suporta entradas multimodais com capacidades de imagem, chamadas de funções e saída estruturada. O Gemini 3.1 Flash Lite está otimizado para implementações de alta capacidade e custo-benefício. Saiba mais sobre o Gemini 3.1 Flash Lite.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Imagem do Google Gemini 3 Pro

Importante

Veja Termos de modelo aplicáveis para a imagem Gemini 3 Pro.

Este modelo é alojado num endpoint global e requer que o encaminhamento entre geografias seja ativado.

Este modelo gera imagens como saída, além do texto. A Google utiliza preços de passagem para este modelo, e os tokens de imagem de saída são faturados separadamente dos tokens de texto de saída. Consulte os preços do Gemini 3 Pro Image do Google para mais detalhes.

O Gemini 3 Pro Image está disponível apenas através das APIs Foundation Model pay-per-token. Não é suportado para throughput provisionado, inferência em lote de AI Functions, ai_queryou AI Playground.

Nome do ponto final: databricks-gemini-3-pro-image

Entradas suportadas: texto, imagem

Gemini 3 Pro Image é o modelo Gemini de geração de imagens da Google. Um único pedido pode devolver imagens geradas juntamente com texto. Este modelo não suporta chamadas de funções.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Google Gemini 3 Flash

Importante

Ver Termos de modelo aplicáveis para o Gemini 3 Flash.

Este modelo é alojado num endpoint global e requer que o encaminhamento entre geografias seja ativado.

Nome do ponto final: databricks-gemini-3-flash

Entradas suportadas: texto, imagem, vídeo, áudio

Gemini 3 Flash é um modelo multimodal de IA de alta velocidade e eficiente em termos de custos, desenvolvido e treinado pela Google. Este modelo oferece velocidade e escala sem comprometer a qualidade, apresentando capacidades multimodais avançadas para análise complexa de vídeo, extração de dados e sessões visuais de perguntas e respostas quase em tempo real. O Gemini 3 Flash oferece melhor custo-benefício e velocidades mais rápidas, permitindo implementações em escala de produção. Saiba mais sobre o Gemini 3 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Google Gemini 2.5 Pro

Importante

Ver Termos de modelo aplicáveis para o Gemini 2.5 Pro.

O Google Gemini 2.5 Pro será retirado a 2 de outubro de 2026. Consulte modelos obsoletos e retirados para o modelo de substituição recomendado e orientações sobre como migrar durante a depreciação.

Nome do ponto final: databricks-gemini-2-5-pro

Entradas suportadas: texto, imagem, vídeo, áudio

Gemini 2.5 Pro é um modelo híbrido de raciocínio desenvolvido e treinado pela Google. O "Deep Think Mode" do Gemini 2.5 Pro e a saída de áudio integrada o diferenciam como um modelo líder para aplicações empresariais, de pesquisa e criativas. Ele é projetado para se destacar em raciocínio complexo, análise profunda e compreensão multimodal em uma ampla gama de entradas e tarefas. Saiba mais sobre o Gemini 2.5 Pro.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Google Gemini 2.5 Flash

Importante

Ver Termos de modelo aplicáveis para o Gemini 2.5 Flash.

O Google Gemini 2.5 Flash está descontinuado e está previsto que seja reformado a 2 de outubro de 2026. Consulte modelos obsoletos e retirados para o modelo de substituição recomendado e orientações sobre como migrar durante a depreciação.

Nome do ponto final: databricks-gemini-2-5-flash

Entradas suportadas: texto, imagem, vídeo, áudio

Gemini 2.5 Flash é um modelo de IA multimodal, econômico e de alta velocidade, desenvolvido e treinado pelo Google. É o primeiro modelo de raciocínio totalmente híbrido do Google, projetado para desenvolvedores e empresas que buscam soluções de IA rápidas, escaláveis e acessíveis. O Gemini 2.5 Flash é otimizado para aplicações em tempo real e de alto volume, como chatbots, extração de dados, tradução e análise de documentos. Saiba mais sobre o Gemini 2.5 Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Alibaba Cloud Qwen3.5 122B A10B

Importante

O modelo Qwen3.5 122B A10B está em Pré-visualização Pública.

Nome do ponto final: databricks-qwen35-122b-a10b

Entradas suportadas: texto

Qwen3.5 122B A10B é um modelo híbrido de raciocínio Mix-of-Experts (MoE) construído e treinado pela Alibaba Cloud, com 122 mil milhões de parâmetros totais e 10 mil milhões de parâmetros ativos por inferência. O modelo suporta uma janela de contexto de 256K e até 25K tokens de saída, oferecendo forte desempenho em tarefas de raciocínio, codificação e agentes. Como modelo apenas de raciocínio, Qwen3.5 122B A10B raciocina sempre antes de responder, e o raciocínio não pode ser desativado.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Alibaba Cloud Qwen3-Embedding-0.6B

Importante

O modelo Qwen3-Embedding-0.6B está em Pré-visualização Pública.

Nome do ponto final: databricks-qwen3-embedding-0-6b

Entradas suportadas: texto

Qwen3-Embedding-0.6B é um modelo compacto de embedding de texto com ~600M de parâmetros, concebido para tarefas semânticas como recuperação, pesquisa de similaridade, agrupamento e classificação. Codifica o texto em vetores densos que representam significado em vez de forma superficial.

O modelo suporta 100+ linguagens (incluindo código) e lida com contextos longos até ~32K tokens, tornando-o adequado para incorporar documentos longos. Produz embeddings com uma dimensionalidade configurável até 1024 e é consciente das instruções, permitindo enviesamento específico da tarefa através de prompts.

Construído sobre um codificador transformador e afinado especificamente para a geração de incorporações, o Qwen3-Embedding-0.6B equilibra a qualidade das incorporações com uma inferência eficiente.

Os modelos de integração são especialmente eficazes quando utilizados em conjunto com LLMs para casos de uso de geração aumentada por recuperação (RAG). O Qwen3-Embedding-0.6B pode ser usado para encontrar excertos de texto relevantes em grandes blocos de documentos que podem ser usados no contexto de um LLM.

Alibaba Cloud Qwen3-Next 80B A3B Instrução

Importante

O modelo Qwen3-Next 80B A3B Instruct está em Pré-visualização Pública.

Nome do ponto final: databricks-qwen3-next-80b-a3b-instruct

Entradas suportadas: texto

O Qwen3-Next-80B-A3B-Instruct é um modelo de linguagem grande altamente eficiente otimizado para tarefas de acompanhamento de instruções criadas e treinadas pelo Alibaba Cloud. "Este modelo foi projetado para lidar com contextos ultralongos e se destaca em fluxos de trabalho de várias etapas, geração aumentada por recuperação e aplicações empresariais que exigem resultados determinísticos com alto desempenho."

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Zhipu AI GLM 5.3 Flash

Nome do ponto final: databricks-glm-5-3-flash

Entradas suportadas: texto, imagem

O GLM-5.3-Flash é um modelo nativamente multimodal de especialistas (MoE) com 320 mil milhões de parâmetros totais e 18 mil milhões de parâmetros ativos, desenvolvido pela Zhipu AI. O modelo suporta um comprimento de contexto de 1.048.576 tokens e está otimizado para o raciocínio, codificação e uso de ferramentas agentais. Saiba mais sobre o GLM-5.3-Flash.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Zhipu AI GLM 5.2

Nome do ponto final: databricks-glm-5-2

Entradas suportadas: texto

O GLM-5.2 é uma mistura de modelos de linguagem de especialistas (MoE) com 753 mil milhões de parâmetros totais desenvolvidos pela Zhipu AI. O modelo suporta um comprimento de contexto de 1 milhão de tokens e está otimizado para raciocínio a longo prazo, codificação e uso de ferramentas agentais.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Moonshot AI Kimi K3

Nome do ponto final: databricks-kimi-k3

Entradas suportadas: texto, imagem

Kimi K3 é um modelo de 2,8 biliões de parâmetros desenvolvido pela Moonshot AI com capacidades de visão nativa. O modelo suporta um comprimento de contexto de 1 milhão de tokens e foi concebido para codificação a longo prazo, trabalho de conhecimento e raciocínio.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Flash DeepSeek V4 (0731)

Nome do ponto final: databricks-deepseek-v4-flash-0731

Entradas suportadas: texto

O DeepSeek V4 Flash (0731) é uma mistura híbrida de modelos de linguagem de especialistas (MoE) com 284 mil milhões de parâmetros totais e 13 mil milhões de parâmetros ativos desenvolvidos pela DeepSeek. O modelo está otimizado para raciocínio rápido, eficiente em termos de custos, codificação e uso de ferramentas agentes.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT OSS 120B

Nome do ponto final: databricks-gpt-oss-120b

Entradas suportadas: texto

O GPT OSS 120B é um modelo de raciocínio de última geração com cadeia de pensamento e níveis de esforço de raciocínio ajustáveis construídos e treinados pela OpenAI. É o principal modelo de peso aberto da OpenAI e apresenta uma janela de contexto de token de 128K. O modelo foi construído para tarefas de raciocínio de alta qualidade.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

OpenAI GPT OSS 20B

Nome do ponto final: databricks-gpt-oss-20b

Entradas suportadas: texto

O GPT OSS 20B é um modelo de raciocínio leve e de última geração construído e treinado pela OpenAI. Este modelo tem uma janela de contexto de token de 128K e se destaca em copilots em tempo real e tarefas de inferência em lote.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Pesquise no Google Gemma 3 12B

Importante

Consulte os termos do modelo aplicável para os termos do Gemma 3 e a Política de Utilização Aceitável.

Nome do ponto final: databricks-gemma-3-12b

Entradas suportadas: texto, imagem

O Gemma 3 12B é um modelo multimodal e de linguagem de visão de 12 bilhões de parâmetros desenvolvido pelo Google como parte da família Gemma 3. O Gemma 3 tem até um contexto de token de 128K e fornece suporte multilíngue para mais de 140 idiomas. Este modelo foi projetado para lidar com entradas de texto e imagem e gerar saídas de texto, e é otimizado para casos de uso de diálogo, geração de texto e tarefas de compreensão de imagem, incluindo resposta a perguntas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Meta Llama 4 Maverick

Importante

Consulte os termos do modelo aplicável para a Licença Comunitária Llama 4 e a Política de Uso Aceitável.

Nome do ponto final: databricks-llama-4-maverick

Entradas suportadas: texto, imagem

Llama 4 Maverick é um modelo de linguagem grande de última geração construído e treinado pela Meta. É o primeiro da família de modelos Llama a usar uma mistura de arquitetura de especialistas para eficiência computacional. O Llama 4 Maverick suporta vários idiomas e é otimizado para casos de uso precisos de compreensão de imagem e texto. Saiba mais sobre Llama 4 Maverick.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Meta Llama 3.3 70B Instruir

Importante

A partir de 11 de dezembro de 2024, o Meta-Llama-3.3-70B-Instruct substitui o suporte para Meta-Llama-3.1-70B-Instruct nos endpoints paga por token das APIs do Foundation Model.

Consulte os termos do modelo aplicável para a Licença Comunitária LLama 3.3 e a Política de Uso Aceitável.

Nome do ponto final: databricks-meta-llama-3-3-70b-instruct

Entradas suportadas: texto

Meta-Llama-3.3-70B-Instruct é um modelo de linguagem grande de última geração com um contexto de 128.000 tokens que foi construído e treinado pela Meta. O modelo suporta vários idiomas e é otimizado para casos de uso de diálogo. Saiba mais sobre o Meta Llama 3.3.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Meta Llama 3.1 8B Instruir

Importante

Consulte os termos do modelo aplicável para a Licença Comunitária LLama 3.1 e a Política de Uso Aceitável.

Nome do ponto final: databricks-meta-llama-3-1-8b-instruct

Entradas suportadas: texto

Meta-Llama-3.1-8B-Instruct é um modelo de linguagem grande de última geração com um contexto de 128.000 tokens que foi construído e treinado pela Meta. O modelo suporta vários idiomas e é otimizado para casos de uso de diálogo. Saiba mais sobre o Meta Llama 3.1.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

O Antrópico Claude Haiku 4.5

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-haiku-4-5

Entradas suportadas: texto, imagem

O Claude Haiku 4.5 é o modelo mais rápido e económico da Anthropic, oferecendo qualidade de codificação quase de vanguarda com uma velocidade e eficiência excecionais. Destaca-se em aplicações em tempo real e baixa latência, incluindo assistentes de chat, agentes de atendimento ao cliente, programação em pares e prototipagem rápida. Este modelo é ideal para implementações de produção conscientes de custos e sistemas agentes que requerem assistência de IA responsiva.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Anthropic Claude Soneto 5

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-sonnet-5

Entradas suportadas: texto, imagem

Observação

O Claude Sonnet 5 não suporta os temperature, top_p, ou top_k parâmetros de amostragem. Pedidos que incluem estes parâmetros devolvem um erro 400.

Claude Sonnet 5 é o modelo Sonnet mais capaz da Anthropic, concebido para programação, fluxos de trabalho agentivos e trabalho profissional em grande escala. Combina inteligência quase ao nível do Opus com a eficiência de custos e rapidez da Sonnet, tornando-o ideal para agentes de contacto com o cliente, fluxos de trabalho de codificação em produção e tarefas sofisticadas de geração de conteúdos.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Anthropic Claude Soneto 4.6

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-sonnet-4-6

Entradas suportadas: texto, imagem

Claude Sonnet 4.6 é o modelo de raciocínio híbrido mais avançado da Anthropic. Ele oferece dois modos: respostas quase instantâneas e pensamento estendido para um raciocínio mais profundo com base na complexidade da tarefa. O Claude Sonnet 4.6 especializa-se em aplicações que requerem um equilíbrio entre rendimento prático e pensamento avançado, como agentes voltados para o cliente, fluxos de trabalho de codificação em produção e geração de conteúdos em escala.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Antrópico Claude Sonnet 4,5

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-sonnet-4-5

Entradas suportadas: texto, imagem

Claude Sonnet 4.5 é o modelo de raciocínio híbrido mais avançado da Anthropic. Ele oferece dois modos: respostas quase instantâneas e pensamento estendido para um raciocínio mais profundo com base na complexidade da tarefa. Claude Sonnet 4.5 é especializado em aplicações que exigem um equilíbrio entre rendimento prático e pensamento avançado, como agentes voltados para o cliente, fluxos de trabalho de codificação de produção e geração de conteúdo em escala.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Anthropic Claude Fable 5

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Importante

Para Claude Fable 5, os prompts e respostas são mantidos durante 30 dias por razões de confiança e segurança. Estes dados são processados por sistemas automatizados de segurança e podem, em certos casos, ser assinalados para revisão humana. Os dados são eliminados automaticamente após 30 dias, exceto em caso de investigação de segurança ou de exigências legais para reter os dados para além de 30 dias. Anthropic é um subprocessador limitado para este propósito de retenção de segurança.

Nome do ponto final: databricks-claude-fable-5

Entradas suportadas: texto

Claude Fable 5 é um modelo de classe Mythos da Anthropic, concebido para trabalho autónomo do conhecimento e programação. Com salvaguardas robustas incorporadas, consegue lidar com tarefas de longa duração, complexas e assíncronas com menos necessidade de check-ins humanos do que os modelos anteriores, tornando-o bem adequado para fluxos de trabalho agentes que requerem foco sustentado em contextos prolongados.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Anthropic Claude Opus 5

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-opus-5

Entradas suportadas: texto, imagem

Claude Opus 5 é o modelo de raciocínio híbrido mais capaz da Anthropic, baseando-se na série Opus com foco em codificação agentica, revisão de código e trabalho autónomo a longo prazo. Este modelo destaca-se em tarefas complexas de software multi-ficheiro, como grandes refatorações e desenvolvimento de funcionalidades de ponta a ponta, deteção de bugs de alta precisão, coordenação multi-agente e tarefas de visão como compreensão de gráficos, documentos e interface. O Claude Opus 5 mantém um forte seguimento de instruções, chamada de ferramentas e raciocínio em toda a janela de contexto, e oferece qualidade quase máxima com esforço de raciocínio baixo e médio, tornando-o ideal para fluxos de trabalho empresariais de longo contexto e sensíveis a custos.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Anthropic Claude Opus 4.8

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-opus-4-8

Entradas suportadas: texto, imagem

Claude Opus 4.8 baseia-se na série Opus com melhorias adicionais na precisão, eficiência e capacidades de raciocínio. Este modelo destaca-se em tarefas complexas de extração e raciocínio agential com suporte de imagem, tornando-o ideal para aplicações empresariais que requerem análise profunda, compreensão documental e fluxos de trabalho sofisticados em múltiplas etapas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Anthropic Claude Opus 4.7

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-opus-4-7

Entradas suportadas: texto, imagem

Claude Opus 4.7 é o modelo híbrido de raciocínio mais capaz da Anthropic, avançando a série Opus com maior precisão, eficiência e capacidades de visão aprimoradas. Este modelo oferece um desempenho mais forte em tarefas complexas de extração e raciocínio agente, utilizando menos tokens de saída do que o seu antecessor. O Claude Opus 4.7 oferece suporte aumentado para resolução de imagem, tornando-o ideal para aplicações empresariais que requerem análise profunda, compreensão documental e fluxos de trabalho sofisticados em múltiplas etapas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Claude Anthropic Opus 4.6

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-opus-4-6

Entradas suportadas: texto, imagem

Claude Opus 4.6 é o modelo de raciocínio híbrido mais capaz da Anthropic, com capacidades de pensamento adaptativo. Este modelo introduz um novo nível máximo de esforço para as tarefas mais exigentes, com o elevado esforço definido como padrão para o desempenho ótimo. O Claude Opus 4.6 destaca-se em raciocínio complexo, análise profunda, geração de código, investigação e fluxos de trabalho sofisticados em vários passos. É ideal para aplicações empresariais que requerem tanto análises extensas como resultados abrangentes.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Claude Anthropic Opus 4.5

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-opus-4-5

Entradas suportadas: texto, imagem

Claude Opus 4.5 é o modelo de raciocínio híbrido mais capaz da Anthropic, concebido para as tarefas mais complexas que exigem análise profunda e pensamento alargado. Este modelo combina poderosas capacidades de uso geral com raciocínio avançado, destacando-se na geração de código, investigação, criação de conteúdos e fluxos de trabalho agentiais sofisticados em vários passos. O Claude Opus 4.5 suporta entradas de texto e visão, tornando-o ideal para aplicações empresariais que exigem tanto amplitude como profundidade de compreensão.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Antrópico Claude Sonnet 4

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Anthropic Claude Sonnet 4 está descontinuado. Consulte modelos obsoletos e retirados para a data de reforma, modelo de substituição recomendado e orientações sobre como migrar durante a descontinuação.

Nome do ponto final: databricks-claude-sonnet-4

Entradas suportadas: texto, imagem

Claude Sonnet 4 é um modelo de raciocínio híbrido de última geração construído e treinado pela Anthropic. Este modelo oferece dois modos: respostas quase instantâneas e pensamento estendido para um raciocínio mais profundo baseado na complexidade da tarefa. Claude Sonnet 4 é otimizado para várias tarefas, como desenvolvimento de código, análise de conteúdo em larga escala e desenvolvimento de aplicativos de agentes.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Claude Anthropic Opus 4.1

Importante

Os clientes são responsáveis por garantir o cumprimento dos termos da política de utilização da Anthropic. Consulte também o Acordo de Serviços Mestres de Cloud da Databricks e, quando aplicável, o Acordo de Associados de Negócios da Databricks.

Nome do ponto final: databricks-claude-opus-4-1

Entradas suportadas: texto, imagem

Claude Opus 4.1 é um modelo de raciocínio híbrido de última geração construído e treinado pela Anthropic. Este modelo de linguagem grande de uso geral é projetado para raciocínio complexo e aplicações do mundo real em escala empresarial. Suporta introdução de texto e imagem. Esse modelo se destaca em tarefas como geração de código, pesquisa e criação de conteúdo e fluxos de trabalho de agentes de várias etapas sem intervenção humana constante.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

Este endpoint é alojado pelo Databricks dentro do perímetro de segurança do Databricks.

Laboratórios de Máquinas Pensantes Inkling

Importante

Inkling está em Pré-visualização Pública.

Nome do ponto final: databricks-inkling

Entradas suportadas: texto, imagem

Inkling é uma mistura de modelos de linguagem de especialistas (MoE) com 975 mil milhões de parâmetros totais e 41 mil milhões de parâmetros ativos desenvolvidos pela Thinking Machine Labs. O modelo suporta um comprimento de contexto de 1 milhão de tokens e está otimizado para tarefas de codificação, raciocínio e uso de ferramentas agentivas.

Os modelos de IA podem cometer erros, entender mal a intenção e alucinar ou dar respostas incorretas. A Databricks recomenda que os clientes avaliem os seus modelos para garantir que estão a funcionar como previsto.

GTE Grande (En)

Nome do ponto final: databricks-gte-large-en

Entradas suportadas: texto

General Text Embedding (GTE) é um modelo de incorporação de texto que pode mapear qualquer texto para um vetor de incorporação de 1024 dimensões e uma janela de incorporação de 8192 tokens. Esses vetores podem ser usados em índices vetoriais para LLMs e para tarefas como recuperação, classificação, resposta a perguntas, agrupamento ou pesquisa semântica. Este ponto de extremidade serve a versão em inglês do modelo e não gera incorporações normalizadas.

Os modelos de integração são especialmente eficazes quando utilizados em conjunto com LLMs para casos de uso de geração aumentada por recuperação (RAG). O GTE pode ser usado para encontrar trechos de texto relevantes em grandes pedaços de documentos que podem ser usados no contexto de um LLM.

BGE Grande (En)

Nome do ponto final: databricks-bge-large-en

Entradas suportadas: texto

BAAI General Embedding (BGE) é um modelo de incorporação de texto que pode mapear qualquer texto para um vetor de incorporação de 1024 dimensões e uma janela de incorporação de 512 tokens. Esses vetores podem ser usados em índices vetoriais para LLMs e para tarefas como recuperação, classificação, resposta a perguntas, agrupamento ou pesquisa semântica. Este ponto de extremidade serve a versão em inglês do modelo e gera incorporações normalizadas.

Os modelos de integração são especialmente eficazes quando utilizados em conjunto com LLMs para casos de uso de geração aumentada por recuperação (RAG). O BGE pode ser usado para encontrar trechos de texto relevantes em grandes blocos de documentos que podem ser usados no contexto de um LLM.

Em aplicativos RAG, você pode melhorar o desempenho do seu sistema de recuperação incluindo um parâmetro de instrução. Os autores do BGE recomendam tentar a instrução "Represent this sentence for searching relevant passages:" para embeddings de consulta, embora o seu impacto no desempenho dependa do domínio.

Recursos adicionais