Modèles de base hébergés par Databricks disponibles dans les API Foundation Model

Cet article décrit les modèles ouverts de pointe pris en charge par les API Databricks Foundation Model.

Remarque

Consultez les modèles de base pris en charge sur Model Service pour la disponibilité régionale de ces modèles et les zones de fonctionnalités prises en charge.

Remarque

Sur Azure Databricks, OpenAI et les modèles Google Gemini, ainsi que Zhipu AI GLM 5.3, GLM 5.3 Flash et GLM 5.2, Moonshot AI Kimi K3, Thinking Machine Labs Inkling et DeepSeek V4 Flash sont disponibles via les services ADI, fournis par Databricks. Pour la configuration et l’accès, voir les services ADI.

Vous pouvez envoyer des requêtes à ces modèles à l’aide des points de terminaison de paiement par jeton disponibles dans votre espace de travail Databricks. Consultez Utilisation modèles de base et table de modèles pris en charge par jeton de paiement par jeton pour les noms des points de terminaison de modèle à utiliser.

Outre la prise en charge des modèles en mode paiement par jeton, les API Foundation Model offrent également un mode de débit approvisionné. Databricks recommande le débit approvisionné pour les charges de travail de production. Ce mode prend en charge tous les modèles d’une famille d’architecture de modèle, y compris les modèles affinés et personnalisés préentraînés pris en charge en mode paiement par jeton. Consultez les API Provisioned throughput Foundation Model pour obtenir la liste des architectures prises en charge.

Vous pouvez interagir avec ces modèles pris en charge à l’aide de l’AI Playground.

Pour les modèles OpenAI, Google Gemini et Anthropic, la fenêtre de contexte et le maximum de jetons de sortie correspondent aux valeurs publiées par le fournisseur de modèles respectif.

OpenAI GPT-5.6 Sol

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-6-sol

Entrées prises en charge : texte, image

GPT-5.6 Sol, également appelé GPT-5.6, est le modèle phare d’OpenAI dans la famille GPT-5.6, offrant des performances de pointe en codage agentique, raisonnement à long terme et utilisation complexe d’outils, avec la prise en charge d’un nouvel effort maximal de raisonnement. Ce modèle prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.6 Terra

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-6-terra

Entrées prises en charge : texte, image

GPT-5.6 Terra est le modèle équilibré de la famille GPT-5.6 d’OpenAI pour les charges de travail quotidiennes d’agents et de raisonnement, offrant des performances compétitives avec GPT-5.5 à un coût moindre. Ce modèle prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.6 Luna

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-6-luna

Entrées prises en charge : texte, image

GPT-5.6 Luna est le modèle rapide et économique de la famille GPT-5.6 d’OpenAI, apportant un raisonnement solide et une capacité d’agent au coût le plus bas de la gamme. Ce modèle prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.5 Pro

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

GPT-5.5 Pro utilise une mise en cache étendue des invites. Les tenseurs en cache sont stockés dans le stockage local GPU pendant au maximum 24 heures.

Remarque

Ce modèle n’est pas pris en charge dans AI Playground. Utilisez l’API Responses pour interagir avec ce modèle.

Nom du point de terminaison : databricks-gpt-5-5-pro

Entrées prises en charge : texte, image

GPT-5.5 Pro est une variante de GPT-5.5 à plus grande précision, destinée aux problèmes les plus difficiles, incluant la recherche approfondie, les mathématiques avancées et le raisonnement à enjeux élevés. Ce modèle prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.5

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

GPT-5.5 utilise une mise en cache étendue par prompts. Les tenseurs en cache sont stockés dans le stockage local GPU pendant au maximum 24 heures.

Remarque

Ce modèle n’est pas pris en charge dans AI Playground. Utilisez l’API Responses pour interagir avec ce modèle.

Nom du point de terminaison : databricks-gpt-5-5

Entrées prises en charge : texte, image

GPT-5.5 est le modèle frontière le plus solide d’OpenAI pour les flux de travail d’agents d’entreprise, le raisonnement documentaire complexe et les agents de codage à long terme. GPT-5.5 alimente également Codex, l’agent de codage d’OpenAI. Ce modèle prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.4

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-4

Entrées prises en charge : texte, image

GPT-5.4 est un modèle de langage polyvalent à usage général avec des capacités de raisonnement développé par OpenAI. Il offre une meilleure performance sur des tâches complexes avec une précision accrue et un raisonnement plus réfléchi et structuré. Ce modèle prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.4 mini

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-4-mini

Entrées prises en charge : texte, image

GPT-5.4 mini est un modèle de langage généraliste optimisé en termes de coût, doté de capacités de raisonnement développé par OpenAI. Basé sur l’architecture GPT-5.4, ce modèle offre des performances améliorées sur des tâches bien définies nécessitant un raisonnement fiable, un langage précis et une sortie rapide. Il prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.4 nano

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-4-nano

Entrées prises en charge : texte, image

GPT-5.4 nano est un modèle de langage large polyvalent doté de capacités de raisonnement développé par OpenAI. Basé sur l’architecture GPT-5.4, ce modèle excelle dans les tâches à haut débit telles que le suivi simple d’instructions ou la classification pour des processus métier routiniers ou des applications mobiles. Il prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.3 Codex

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Remarque

Ce modèle n’est pas pris en charge dans AI Playground. Utilisez l’API Responses pour interagir avec ce modèle.

Nom du point de terminaison : databricks-gpt-5-3-codex

Entrées prises en charge : texte, image

GPT-5.3 Codex est le modèle de codage agent le plus avancé d’OpenAI, conçu pour gérer des tâches complexes et de longue durée impliquant recherche, utilisation d’outils et exécution. Il combine des performances de codage de pointe avec le raisonnement et la connaissance professionnelle de GPT-5.2, tout en fonctionnant 25% plus rapidement. Le modèle prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.2

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-2

Entrées prises en charge : texte, image

GPT-5.2 est un modèle de langage polyvalent à usage général avec des capacités de raisonnement développé par OpenAI. Ce modèle s’appuie directement sur GPT-5.1, offrant une plus grande précision, une meilleure efficacité des jetons sur les tâches moyennes à complexes, et un raisonnement plus délibérément et structuré. Ce modèle excelle dans l’extraction structurée, les flux de travail en plusieurs étapes et les tâches multimodales. Il prend en charge les entrées multimodales.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5.1

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-1

Entrées prises en charge : texte, image

GPT-5.1 est un modèle de langage polyvalent à usage général avec des capacités de raisonnement développé par OpenAI. Ce modèle propose à la fois les modes Instantané et Pensée pour une conversation rapide ou un raisonnement profond, s’ajustant automatiquement aux tâches simples ou complexes. Le modèle excelle dans la création de contenu, le tutorat, le support technique et le codage, avec moins de dépendance à une ingénierie stricte des prompts que les versions précédentes. Il prend en charge les entrées multimodales. En savoir plus sur GPT-5.1.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5

Entrées prises en charge : texte, image

GPT-5 est un modèle de langage de grande taille à usage général et un modèle de raisonnement conçu et formé par OpenAI. Il prend en charge les entrées multimodales. Le modèle est conçu pour le codage, la conversation, le raisonnement et les tâches pilotées par l’agent.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5 mini

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-mini

Entrées prises en charge : texte, image

GPT-5 mini est un modèle de langage de grande taille à usage général et un modèle de raisonnement conçu et entraîné par OpenAI. Il prend en charge les entrées multimodales. Le modèle est optimisé pour le raisonnement et les charges de travail de conversation et excelle dans des tâches bien définies qui nécessitent un raisonnement fiable, un langage précis et une sortie rapide pour le texte et les images.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT-5 nano

Importante

Les clients sont responsables de s’assurer de leur conformité aux termes applicables du modèle.

Nom du point de terminaison : databricks-gpt-5-nano

Entrées prises en charge : texte, image

GPT-5 nano est un modèle de langage de grande taille à usage général et un modèle de raisonnement conçu et entraîné par OpenAI. Il prend en charge les entrées multimodales. Le modèle excelle dans des tâches à volume élevé, telles que le suivi des instructions simples ou la classification, pour les processus métier de routine ou les applications mobiles.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 3.7 Flash

Importante

Voir Termes de modèle applicables pour Gemini 3.7 Flash.

Ce modèle est hébergé sur un point de terminaison global et nécessite l’activation du routage inter-zones géographiques.

Nom du point de terminaison : databricks-gemini-3-7-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.7 Flash est un modèle d’IA multimodal développé et entraîné par Google. Il prend en charge, l’appel de fonctions et le raisonnement hybride pour des charges de travail à usage général et multimodales. Le reasoning_effort paramètre accepte les valeurs de "low", "medium" (par défaut), ou "high". Gemini 3.7 Flash ne prend pas en charge "minimal". En savoir plus sur Gemini 3.7 Flash.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 3.6 Flash

Importante

Voir les termes de modèle applicables pour Gemini 3.6 Flash.

Ce modèle est hébergé sur un point de terminaison global et nécessite l’activation du routage inter-zones géographiques.

Nom du point de terminaison : databricks-gemini-3-6-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.6 Flash est un modèle d’IA multimodal à grande vitesse, économique et efficace, développé et entraîné par Google. Successeur de Gemini 3.5 Flash, ce modèle offre un raisonnement plus solide, des capacités multimodales avancées et une meilleure performance économique pour les déploiements à l’échelle de la production. Gemini 3.6 Flash est optimisé pour des charges de travail à haut débit telles que l’analyse vidéo complexe, l’extraction de données et les questions-réponses visuelles. En savoir plus sur Gemini 3.6 Flash.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 3.5 Flash

Importante

Voir Termes de modèle applicables pour Gemini 3.5 Flash.

Nom du point de terminaison : databricks-gemini-3-5-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.5 Flash est un modèle d’IA multimodal à grande vitesse, économique et développé et entraîné par Google. En tant qu’étape significative par rapport à Gemini 3 Flash, ce modèle offre un raisonnement plus solide, des capacités multimodales avancées et une meilleure performance économique pour les déploiements à l’échelle de la production. Gemini 3.5 Flash est optimisé pour des charges de travail à haut débit telles que l’analyse vidéo complexe, l’extraction de données et les Q&R visuels. En savoir plus sur Gemini 3.5 Flash.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 3.5 Flash Lite

Importante

Voir les termes de modèle applicables pour la Gemini 3.5 Flash Lite.

Ce modèle est hébergé sur un point de terminaison global et nécessite l’activation du routage inter-zones géographiques.

Nom du point de terminaison : databricks-gemini-3-5-flash-lite

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.5 Flash Lite est le modèle le plus rapide et le plus économique de la série Gemini 3, développé et entraîné par Google. Le modèle prend en charge les entrées multimodales avec capacités d’image, appels de fonctions et sortie structurée. Gemini 3.5 Flash Lite est optimisé pour des déploiements à haut débit et rentables.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Aperçu Google Gemini 3.1 Pro

Importante

Voir les termes de modèle applicables pour l’aperçu de Gemini 3.1 Pro.

Ce modèle est hébergé sur un point de terminaison global et nécessite l’activation du routage inter-zones géographiques.

Nom du point de terminaison : databricks-gemini-3-1-pro

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.1 Pro Preview est un modèle de raisonnement hybride de pointe développé et entraîné par Google. Il offre un raisonnement solide et une intelligence documentaire, ce qui en fait un modèle globalement intelligent pour les flux de travail et tâches complexes. Il excelle dans le raisonnement complexe, l’analyse approfondie et la compréhension multimodale couvrant un large éventail d’entrées et de tâches.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 3.1 Flash Image

Importante

Voir les termes de modèle applicables pour l’image flash Gemini 3.1.

Ce modèle est hébergé sur un point de terminaison global et nécessite l’activation du routage inter-zones géographiques.

Ce modèle génère des images en sortie, en plus du texte. Google utilise la tarification par transfert pour ce modèle, et les jetons image de sortie sont facturés séparément des jetons texte de sortie. Consultez les tarifs de Google pour l’image flash Gemini 3.1 pour plus de détails.

Gemini 3.1 Flash Image n’est disponible que via les API Foundation Model en paiement par jeton. Il n’est pas pris en charge pour le débit provisionné, l’inférence batch de fonctions IA, ai_queryou l’AI Playground.

Nom du point de terminaison : databricks-gemini-3-1-flash-image

Entrées prises en charge : texte, image

Gemini 3.1 Flash Image est le modèle Gemini de génération d’images de Google. Une seule requête peut retourner les images générées en même temps que le texte. Ce modèle ne supporte pas l’appel de fonction.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 3.1 Flash Lite

Importante

Consultez les termes du modèle applicable pour Gemini 3.1 Flash Lite.

Ce modèle est hébergé sur un point de terminaison global et nécessite l’activation du routage inter-zones géographiques.

Nom du point de terminaison : databricks-gemini-3-1-flash-lite

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3.1 Flash Lite est le modèle le plus rapide et le plus économique de la série Gemini 3, développé et entraîné par Google. Conçu pour l’intelligence à grande échelle, le modèle prend en charge les entrées modales avec les fonctionnalités d’image, l’appel de fonction et la sortie structurée. Gemini 3.1 Flash Lite est optimisé pour les déploiements à débit élevé et rentables. En savoir plus sur Gemini 3.1 Flash Lite.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 3 Pro Image

Importante

Voir les termes de modèle applicables pour l’image Gemini 3 Pro.

Ce modèle est hébergé sur un point de terminaison global et nécessite l’activation du routage inter-zones géographiques.

Ce modèle génère des images en sortie, en plus du texte. Google utilise la tarification par transfert pour ce modèle, et les jetons image de sortie sont facturés séparément des jetons texte de sortie. Consultez les tarifs de Google Gemini 3 Pro Image pour plus de détails.

Gemini 3 Pro Image n’est disponible que via les API Foundation Model en paiement par jeton. Il n’est pas pris en charge pour le débit provisionné, l’inférence batch de fonctions IA, ai_queryou l’AI Playground.

Nom du point de terminaison : databricks-gemini-3-pro-image

Entrées prises en charge : texte, image

Gemini 3 Pro Image est le modèle Gemini de génération d’images de Google. Une seule requête peut retourner les images générées en même temps que le texte. Ce modèle ne supporte pas l’appel de fonction.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 3 Flash

Importante

Voir les termes du modèle applicables pour Gemini 3 Flash.

Ce modèle est hébergé sur un point de terminaison global et nécessite l’activation du routage inter-zones géographiques.

Nom du point de terminaison : databricks-gemini-3-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 3 Flash est un modèle d’IA multimodal à haute vitesse et économique, développé et entraîné par Google. Ce modèle offre vitesse et échelle sans compromettre la qualité, offrant des capacités multimodales avancées pour l’analyse vidéo complexe, l’extraction de données et les questions-réponses visuelles en quasi-temps réel. Gemini 3 Flash offre une meilleure performance économique et des vitesses plus rapides, permettant des déploiements à l’échelle de la production. En savoir plus sur Gemini 3 Flash.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 2.5 Pro

Importante

Voir les termes applicables au modèle Gemini 2.5 Pro.

Google Gemini 2.5 Pro sera retiré du service le 2 octobre 2026. Consultez Les modèles déconseillés et supprimés pour le modèle de remplacement recommandé et les conseils sur la migration pendant la dépréciation.

Nom du point de terminaison : databricks-gemini-2-5-pro

Entrées prises en charge : texte, image, vidéo, audio

Gemini 2.5 Pro est un modèle de raisonnement hybride développé et entraîné par Google. Gemini 2.5 Pro « Deep Think Mode » et la sortie audio intégrée la distinguent comme un modèle de premier plan pour les applications d’entreprise, de recherche et créatives. Il est conçu pour exceller dans le raisonnement complexe, l’analyse approfondie et la compréhension modale sur un large éventail d’entrées et de tâches. En savoir plus sur Gemini 2.5 Pro.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Google Gemini 2.5 Flash

Importante

Voir les termes de modèle applicables pour le Gemini 2.5 Flash.

Google Gemini 2.5 Flash est déprécié et sa retraite est prévue pour le 2 octobre 2026. Consultez Les modèles déconseillés et supprimés pour le modèle de remplacement recommandé et les conseils sur la migration pendant la dépréciation.

Nom du point de terminaison : databricks-gemini-2-5-flash

Entrées prises en charge : texte, image, vidéo, audio

Gemini 2.5 Flash est un modèle IA multimodal à haute vitesse et économique développé et entraîné par Google. Il s’agit du premier modèle de raisonnement entièrement hybride de Google, conçu pour les développeurs et les entreprises qui recherchent des solutions IA rapides, évolutives et abordables. Gemini 2.5 Flash est optimisé pour les applications en temps réel et à volume élevé, telles que les chatbots, l’extraction de données, la traduction et l’analyse de documents. En savoir plus sur Gemini 2.5 Flash.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Alibaba Cloud Qwen3.5 122B A10B

Importante

Le modèle Qwen3.5 122B A10B est disponible en préversion publique.

Nom du point de terminaison : databricks-qwen35-122b-a10b

Entrées prises en charge : texte

Qwen3.5 122B A10B est un modèle de raisonnement hybride d’experts (MoE) conçu et formé par Alibaba Cloud, avec 122 milliards de paramètres totaux et 10 milliards de paramètres actifs par inférence. Le modèle prend en compte une fenêtre de contexte de 256K et jusqu’à 25K de jetons de sortie, et offre de solides performances sur les tâches de raisonnement, de codage et d’agent. En tant que modèle de raisonnement uniquement, Qwen3.5 122B A10B a toujours des raisons avant de répondre, et le raisonnement ne peut pas être désactivé.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Alibaba Cloud Qwen3-Embedding-0.6B

Importante

Le modèle Qwen3-Embedding-0.6B est disponible en préversion publique.

Nom du point de terminaison : databricks-qwen3-embedding-0-6b

Entrées prises en charge : texte

Qwen3-Embedding-0.6B est un modèle d’incorporation de texte compact avec des paramètres ~600M, conçus pour des tâches sémantiques telles que la récupération, la recherche de similarité, le clustering et la classification. Il encode du texte en vecteurs denses qui représentent la signification plutôt que la forme surface.

Le modèle prend en charge 100 langues (y compris le code) et gère des contextes longs jusqu’à ~32 000 jetons, ce qui le rend adapté à l’incorporation de documents longs. Il produit des représentations avec une dimensionnalité configurable jusqu'à 1024 et tient compte des instructions, permettant une adaptation spécifique à la tâche grâce à des consignes.

Basé sur un encodeur de transformateur et affiné spécifiquement pour la génération d'embeddings, Qwen3-Embedding-0.6B équilibre la qualité des embeddings avec une inférence efficace.

Les modèles d’incorporation sont particulièrement efficaces lorsqu’ils sont utilisés en tandem avec les LLM pour les cas d’usage de récupération de génération augmentée (RAG). Qwen3-Embedding-0.6B peut être utilisé pour rechercher des extraits de texte pertinents dans de grands blocs de documents qui peuvent être utilisés dans le contexte d’un LLM.

Instruction d'Alibaba Cloud Qwen3-Next 80B A3B

Importante

Le modèle Qwen3-Next 80B A3B Instruct est disponible en préversion publique.

Nom du point de terminaison : databricks-qwen3-next-80b-a3b-instruct

Entrées prises en charge : texte

Qwen3-Next-80B-A3B-Instruct est un modèle de langage très efficace, optimisé pour les tâches de suivi d'instructions, créé et entraîné par Alibaba Cloud. Ce modèle est conçu pour gérer des contextes ultra-longs et excelle dans les flux de travail en plusieurs étapes, la génération augmentée de récupération et les applications d’entreprise qui nécessitent des sorties déterministes à un débit élevé.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Zhipu AI GLM 5.3

Nom du point de terminaison : databricks-glm-5-3

Entrées prises en charge : texte

GLM-5.3 est un modèle de langage mixte uniquement texte d’experts (MoE) développé par Zhipu AI pour l’utilisation du codage et des outils agents. Il prend en charge, l’appel de fonctions, les appels parallèles d’outils, la sortie structurée, une fenêtre de contexte allant jusqu’à 1 048 576 jetons, et jusqu’à 65 536 jetons de sortie. Le raisonnement est toujours activé : reasoning_effort accepte low, high, et max; omis, minimal, medium, ou xhigh les valeurs utilisent max, et none sont rejetées. Voir Modèles de raisonnement par requête et la documentation Z.ai GLM-5.3.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Zhipu AI GLM 5.3 Flash

Nom du point de terminaison : databricks-glm-5-3-flash

Entrées prises en charge : texte, image

GLM-5.3-Flash est un modèle natif, multimodal et mixte d’experts (MoE), avec 320 milliards de paramètres totaux et 18 milliards de paramètres actifs, développé par Zhipu AI. Le modèle supporte une longueur de contexte de 1 048 576 jetons et est optimisé pour le raisonnement, le codage et l’utilisation d’outils agents. En savoir plus sur GLM-5.3-Flash.

Ce modèle raisonne toujours, et le raisonnement ne peut pas être désactivé. Voir Modèles de raisonnement par requête pour les valeurs prises en charge reasoning_effort et les valeurs par défaut.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Zhipu AI GLM 5.2

Nom du point de terminaison : databricks-glm-5-2

Entrées prises en charge : texte

GLM-5.2 est un mélange de modèles de langage experts (MoE) avec 753 milliards de paramètres au total développé par Zhipu AI. Le modèle prend en charge une longueur contextuelle de 1 million de jetons et est optimisé pour le raisonnement à long horizon, le codage et l’utilisation d’outils agents.

Ce modèle permet un effort de raisonnement ajustable. Voir Modèles de raisonnement par requête pour les valeurs prises en charge reasoning_effort et les valeurs par défaut.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Moonshot IA Kimi K3

Nom du point de terminaison : databricks-kimi-k3

Entrées prises en charge : texte, image

Kimi K3 est un modèle à 2,8 billions de paramètres développé par Moonshot AI avec des capacités de vision native. Le modèle prend en charge une longueur contextuelle d’un million de jetons et est conçu pour le codage à long terme, le travail de connaissance et le raisonnement.

Ce modèle permet un effort de raisonnement ajustable. Voir Modèles de raisonnement par requête pour les valeurs prises en charge reasoning_effort et les valeurs par défaut.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Flash DeepSeek V4 (0731)

Nom du point de terminaison : databricks-deepseek-v4-flash-0731

Entrées prises en charge : texte

DeepSeek V4 Flash (0731) est un mélange hybride de modèles de langage experts (MoE) avec 284 milliards de paramètres au total et 13 milliards de paramètres actifs développés par DeepSeek. Le modèle est optimisé pour un raisonnement rapide, économique et économique pour l’utilisation d’outils agents.

Ce modèle permet un effort de raisonnement ajustable. Voir Modèles de raisonnement par requête pour les valeurs prises en charge reasoning_effort et les valeurs par défaut.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT OSS 120B

Nom du point de terminaison : databricks-gpt-oss-120b

Entrées prises en charge : texte

GPT OSS 120B est un modèle de raisonnement de pointe avec des niveaux d’effort de raisonnement en chaîne de pensée et ajustables construits et entraînés par OpenAI. Il s’agit du modèle phare open-weight d’OpenAI et propose une fenêtre de contexte de jeton 128K. Le modèle est conçu pour des tâches de raisonnement de haute qualité.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

OpenAI GPT OSS 20B

Nom du point de terminaison : databricks-gpt-oss-20b

Entrées prises en charge : texte

GPT OSS 20B est un modèle de raisonnement léger conçu et entraîné par OpenAI. Ce modèle dispose d’une fenêtre de contexte de jeton de 128 Ko et excelle à des tâches de copilotes et d’inférence par lots en temps réel.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Cherchez Gemma 3 12B sur Google

Importante

Consultez les termes du modèle applicable pour les conditions de Gemma 3 et la stratégie d’utilisation acceptable.

Nom du point de terminaison : databricks-gemma-3-12b

Entrées prises en charge : texte, image

Gemma 3 12B est un modèle de langage modal et de vision de 12 milliards de paramètres développé par Google dans le cadre de la famille Gemma 3. Gemma 3 offre un contexte pouvant atteindre 128 000 jetons et fournit une prise en charge multilingue pour plus de 140 langues. Ce modèle est conçu pour gérer à la fois les entrées de texte et les entrées d’image et générer des sorties de texte, et est optimisé pour les cas d’usage de dialogue, la génération de texte et les tâches de compréhension des images, y compris les réponses aux questions.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Meta Llama 4 Maverick

Importante

Consultez les termes du modèle applicable pour la licence communautaire Llama 4 et la politique d’utilisation acceptable.

Nom du point de terminaison : databricks-llama-4-maverick

Entrées prises en charge : texte, image

Llama 4 Maverick est un modèle de langage de grande envergure et avancé conçu et entraîné par Meta. Il est le premier de la famille de modèles Llama à utiliser un mélange d’architecture d’experts pour l’efficacité du calcul. Llama 4 Maverick prend en charge plusieurs langues et est optimisé pour une compréhension précise des images et du texte dans divers cas d’utilisation. En savoir plus sur Llama 4 Maverick.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Meta Llama 3.3 70B Instruire

Importante

À compter du 11 décembre 2024, Meta-Llama-3.3-70B-Instruct remplace la prise en charge de Meta-Llama-3.1-70B-Instruct dans les points de terminaison de paiement par jeton des API de modèle de base.

Consultez les termes du modèle applicable pour la licence communauté LLama 3.3 et la stratégie d’utilisation acceptable.

Nom du point de terminaison : databricks-meta-llama-3-3-70b-instruct

Entrées prises en charge : texte

Meta-Llama-3.3-70B-Instruct est un modèle de langage volumineux de pointe, disposant d'un contexte de 128 000 jetons, créé et entraîné par Meta. Le modèle prend en charge plusieurs langues et est optimisé pour les cas d’usage de dialogue. En savoir plus sur le Meta Llama 3.3.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Meta Llama 3.1 8B Instruct

Importante

Consultez les termes du modèle applicable pour la licence communauté LLama 3.1 et la stratégie d’utilisation acceptable.

Nom du point de terminaison : databricks-meta-llama-3-1-8b-instruct

Entrées prises en charge : texte

Meta-Llama-3.1-8B-Instruct est un grand modèle de langue de pointe avec un contexte de 128 000 tokens qui a été créé et entraîné par Meta. Le modèle prend en charge plusieurs langues et est optimisé pour les cas d’usage de dialogue. En savoir plus sur le Meta Llama 3.1.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Anthropic Claude Haiku 4.5

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-haiku-4-5

Entrées prises en charge : texte, image

Claude Haiku 4.5 est le modèle le plus rapide et le plus économique d’Anthropic, offrant une qualité de codage proche frontière avec une vitesse et une efficacité exceptionnelles. Il excelle en temps réel, les applications à faible latence, notamment les assistants de conversation, les agents de service client, la programmation de paires et le prototypage rapide. Ce modèle est idéal pour les déploiements de production conscients des coûts et les systèmes agentiques nécessitant une assistance ia réactive.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Sonnet 5

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-sonnet-5

Entrées prises en charge : texte, image

Remarque

Claude Sonnet 5 ne prend pas en charge les temperatureparamètres , top_pou top_k d’échantillonnage. Les demandes qui incluent ces paramètres retournent une erreur 400.

Claude Sonnet 5 est Anthropic modèle Sonnet le plus capable, conçu pour le codage, les flux de travail agentiques et le travail professionnel à grande échelle. Il combine l’intelligence de niveau quasi-opus avec l’efficacité et la vitesse de Sonnet, ce qui le rend bien adapté aux agents orientés client, aux flux de travail de codage de production et aux tâches de génération de contenu sophistiquées.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Sonnet 4.6

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-sonnet-4-6

Entrées prises en charge : texte, image

Claude Sonnet 4.6 est le modèle de raisonnement hybride le plus avancé d’Anthropic. Il offre deux modes : les réponses quasi-instantanées et la pensée étendue pour un raisonnement plus approfondi en fonction de la complexité de la tâche. Claude Sonnet 4.6 se spécialise dans les applications qui nécessitent un équilibre entre le débit pratique et la pensée avancée, comme les agents orientés client, les flux de travail de codage de production et la génération de contenu à grande échelle.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Sonnet 4.5

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-sonnet-4-5

Entrées prises en charge : texte, image

Claude Sonnet 4.5 est le modèle de raisonnement hybride le plus avancé d’Anthropic. Il offre deux modes : les réponses quasi-instantanées et la pensée étendue pour un raisonnement plus approfondi en fonction de la complexité de la tâche. Claude Sonnet 4.5 se spécialise dans l’application qui nécessite un équilibre entre débit pratique et pensée avancée, comme les agents orientés client, les flux de travail de codage de production et la génération de contenu à grande échelle.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Fable 5.1

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat databricks Master Cloud Services et, le cas échéant, le Contrat Databricks Business Associate.

Importante

Pour Claude Fable 5.1, les consignes et réponses sont conservées pendant 30 jours pour des raisons de confiance et de sécurité. Ces données sont traitées par des systèmes de sécurité automatisés et peuvent, dans certains cas, être signalées pour examen humain. Les données sont supprimées automatiquement après 30 jours, sauf en cas d’examen de sécurité ou de conditions légales pour conserver les données au-delà de 30 jours. Anthropic est un sous-processus limité à cet effet de rétention de sécurité.

Nom du point de terminaison : databricks-claude-fable-5-1

Entrées prises en charge : texte, image

Claude Fable 5.1 est le modèle de raisonnement multimodal de pointe d'Anthropic pour le codage agentique de longue durée, le travail de connaissance et la découverte scientifique. Il utilise une pensée adaptative toujours active et prend en charge les contrôles d’effort par tour ainsi que les mises à jour de réflexion entre les appels d’outils pour des flux de travail durables et complexes.

Claude Fable 5.1 accepte low, medium, high, xhigh, et max les niveaux d’effort. Le raisonnement ne peut pas être désactivé. Voir Modèles de raisonnement de requêtes pour plus de détails.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Fable 5

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat databricks Master Cloud Services et, le cas échéant, le Contrat Databricks Business Associate.

Importante

Pour Claude Fable 5, les invites et les réponses sont conservées pendant 30 jours à des fins de confiance et de sécurité. Ces données sont traitées par des systèmes de sécurité automatisés et peuvent, dans certains cas, être signalées pour examen humain. Les données sont supprimées automatiquement après 30 jours, sauf en cas d’examen de sécurité ou de conditions légales pour conserver les données au-delà de 30 jours. Anthropic est un sous-processus limité à cet effet de rétention de sécurité.

Nom du point de terminaison : databricks-claude-fable-5

Entrées prises en charge : texte

Claude Fable 5 est un modèle de classe Mythos de Anthropic conçu pour le travail et le codage des connaissances autonomes. Avec des protections robustes intégrées, elle peut gérer des tâches longues, complexes et asynchrones avec moins de besoin d’archivages humains que les modèles précédents, ce qui en fait une solution adaptée aux flux de travail agentiques qui nécessitent un focus soutenu dans des contextes étendus.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Opus 5

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-opus-5

Entrées prises en charge : texte, image

Claude Opus 5 est Anthropic modèle de raisonnement hybride le plus capable, en s'appuyant sur la série Opus avec un focus sur le codage agentique, la révision du code et le travail autonome à long horizon. Ce modèle excelle dans les tâches logicielles complexes et multi-fichiers, telles que les refactorisations volumineuses et le développement de fonctionnalités de bout en bout, la recherche de bogues haute précision, la coordination multi-agent et les tâches de vision telles que le graphique, le document et la compréhension de l’interface utilisateur. Claude Opus 5 maintient un suivi d’instructions solide, l’appel d’outils et le raisonnement sur toute la fenêtre contextuelle, et offre une qualité quasi optimale à faible et moyen effort de raisonnement, ce qui le rend parfaitement adapté aux flux de travail d’entreprise sensibles aux coûts et à long contexte.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Opus 4.8

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-opus-4-8

Entrées prises en charge : texte, image

Claude Opus 4.8 s’appuie sur la série Opus avec d’autres améliorations apportées aux capacités de précision, d’efficacité et de raisonnement. Ce modèle excelle dans les tâches complexes d’extraction et de raisonnement agentique avec prise en charge de l’image, ce qui le rend idéal pour les applications d’entreprise qui nécessitent une analyse approfondie, la compréhension des documents et des workflows multi-étapes sophistiqués.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Opus 4.7

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-opus-4-7

Entrées prises en charge : texte, image

Claude Opus 4.7 est le modèle de raisonnement hybride le plus capable d’Anthropic, faisant progresser la série Opus avec une meilleure précision, une efficacité et des capacités de vision améliorées. Ce modèle offre de meilleures performances sur les tâches d’extraction complexe et de raisonnement agentique tout en utilisant moins de jetons de sortie que son prédécesseur. Claude Opus 4.7 offre un support accru de la résolution d’image, ce qui le rend idéal pour les applications d’entreprise nécessitant une analyse approfondie, une compréhension documentaire et des flux de travail sophistiqués en plusieurs étapes.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Opus 4.6

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-opus-4-6

Entrées prises en charge : texte, image

Claude Opus 4.6 est le modèle de raisonnement hybride le plus capable d’Anthropic avec des capacités de pensée adaptative. Ce modèle introduit un nouveau niveau d’effort maximal pour les tâches les plus exigeantes, avec un effort élevé défini comme valeur par défaut pour des performances optimales. Claude Opus 4.6 excelle dans le raisonnement complexe, l’analyse approfondie, la génération de code, la recherche et les workflows multi-étapes sophistiqués. Il est idéal pour les applications d’entreprise qui nécessitent à la fois une analyse approfondie et des résultats complets.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Opus 4.5

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-opus-4-5

Entrées prises en charge : texte, image

Claude Opus 4.5 est le modèle de raisonnement hybride le plus capable d’Anthropic, conçu pour les tâches les plus complexes nécessitant une analyse approfondie et une pensée étendue. Ce modèle combine de puissantes fonctionnalités à usage général avec un raisonnement avancé, excellant au niveau de la génération de code, de la recherche, de la création de contenu et des flux de travail agentiques multi-étapes sophistiqués. Claude Opus 4.5 prend en charge les entrées de texte et de vision, ce qui le rend idéal pour les applications d’entreprise qui exigent à la fois une compréhension large et approfondie.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Sonnet 4

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Anthropic Claude Sonnet 4 est déconseillé. Consultez les modèles déconseillés et supprimés pour sa date de mise hors service, le modèle de remplacement recommandé et les conseils pour la migration pendant la dépréciation.

Nom du point de terminaison : databricks-claude-sonnet-4

Entrées prises en charge : texte, image

Claude Sonnet 4 est un modèle de raisonnement hybride conçu et formé par Anthropic. Ce modèle offre deux modes : réponses quasi-instantanées et réflexion étendue pour un raisonnement plus approfondi en fonction de la complexité de la tâche. Claude Sonnet 4 est optimisé pour différentes tâches telles que le développement de code, l’analyse de contenu à grande échelle et le développement d’applications de l’agent.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Anthropic Claude Opus 4.1

Importante

Les clients sont responsables de leur conformité aux conditions de la stratégie d’utilisation d’Anthropic. Consultez également le Contrat de services cloud master Databricks et, le cas échéant, le Contrat d’association d’entreprise Databricks.

Nom du point de terminaison : databricks-claude-opus-4-1

Entrées prises en charge : texte, image

Claude Opus 4.1 est un modèle de raisonnement hybride de pointe construit et entraîné par Anthropic. Ce modèle de langage grand usage général est conçu pour le raisonnement complexe et les applications réelles à l’échelle de l’entreprise. Il prend en charge la saisie de texte et d’images. Ce modèle excelle dans les tâches telles que la génération de code, la recherche et la création de contenu, et les flux de travail des agents multi-étapes sans intervention humaine constante.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

Ce point de terminaison est hébergé par Databricks dans le périmètre de sécurité Databricks.

Inkling des Laboratoires Machines Pensantes

Importante

Inkling est en aperçu public.

Nom du point de terminaison : databricks-inkling

Entrées prises en charge : texte, image

Inkling est un mélange de modèles linguistiques d’experts (MoE) avec 975 milliards de paramètres au total et 41 milliards de paramètres actifs développés par Thinking Machine Labs. Le modèle supporte une longueur de contexte de 1 million de jetons et est optimisé pour les tâches de codage, de raisonnement et d’utilisation d’outils agentiques.

Ce modèle raisonne toujours. Voir Modèles de raisonnement par requête pour les valeurs prises en charge reasoning_effort et les valeurs par défaut.

Les modèles d’IA peuvent faire des erreurs, ne pas comprendre l’intention et halluciner ou donner des réponses incorrectes. Databricks recommande aux clients d’évaluer leurs modèles pour s’assurer qu’ils fonctionnent comme prévu.

GTE Large (en)

Nom du point de terminaison : databricks-gte-large-en

Entrées prises en charge : texte

L’incorporation de texte général (GTE) est un modèle d’incorporation de texte qui peut mapper n’importe quel texte à un vecteur d’incorporation de dimension 1024 et une fenêtre d’incorporation de 8192 jetons. Ces vecteurs peuvent être utilisés dans des index vectoriels pour les machines virtuelles et pour des tâches telles que la récupération, la classification, la réponse aux questions, le clustering ou la recherche sémantique. Ce point de terminaison sert la version anglaise du modèle et ne génère pas d’incorporations normalisées.

Les modèles d’incorporation sont particulièrement efficaces lorsqu’ils sont utilisés en tandem avec les LLM pour les cas d’usage de récupération de génération augmentée (RAG). GTE peut être utilisé pour rechercher des extraits de texte pertinents dans de grands blocs de documents qui peuvent être utilisés dans le contexte d’un LLM.

BGE Large (en)

Nom du point de terminaison : databricks-bge-large-en

Entrées prises en charge : texte

BGE (BAAI General Embedding) est un modèle d’incorporation de texte qui peut mapper n’importe quel texte à un vecteur d’incorporation de dimension 1024 et une fenêtre d’incorporation de 512 jetons. Ces vecteurs peuvent être utilisés dans des index vectoriels pour les machines virtuelles et pour des tâches telles que la récupération, la classification, la réponse aux questions, le clustering ou la recherche sémantique. Ce point de terminaison sert la version anglaise du modèle et génère des incorporations normalisées.

Les modèles d’incorporation sont particulièrement efficaces lorsqu’ils sont utilisés en tandem avec les LLM pour les cas d’usage de récupération de génération augmentée (RAG). BGE peut être utilisé pour rechercher des extraits de texte pertinents dans de grands blocs de documents qui peuvent être utilisés dans le contexte d’un LLM.

Dans les applications RAG, vous pouvez être en mesure d’améliorer les performances de votre système de récupération en incluant un paramètre d’instruction. Les auteurs BGE recommandent d’essayer l’instruction "Represent this sentence for searching relevant passages:" pour les incorporations de requêtes, bien que son impact sur les performances dépend du domaine.

Ressources additionnelles