Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Important
Cette fonctionnalité est disponible en préversion publique.
Définissez le nom de l’expérience, le calcul, la commande, l’environnement et la source de code d’un travail d’apprentissage dans la configuration YAML de la charge de travail que vous transmettez.air run --file Cette page documente chaque champ.
Note
La vérité de base pour la configuration YAML est l’aide dans l’interface CLI. Exécutez air -h config la vue de niveau supérieur et air -h config.<section> (par exemple) air -h config.environmentpour obtenir des détails par section.
Configuration minimale
experiment_name: my-training
environment:
dependencies:
- mlflow
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: echo "Hello World"
Envoyer avec :
air run --file train.yaml -p profile
Concepts de base
Champs principaux
La plupart des configurations d’apprentissage incluent cinq composants :
-
experiment_name(Obligatoire) : Crée ou ajoute à une expérience MLflow. -
environment(Optionnel) : dépendances Python et version de l’environnement de base. -
compute(Obligatoire) : ressources GPU (type et nombre). -
command(Obligatoire) : La ou les commandes de découp utilisées pour lancer l’entraînement. -
code_source(Optionnel) : Chemin vers votre code d’entraînement, disponible à distance.
Pour les valeurs prises en charge et les contraintes de champ, voir Référence.
Votre premier travail de formation
experiment_name: simple-training
environment:
dependencies:
- torch
- transformers
compute:
num_accelerators: 8
accelerator_type: GPU_8xH100
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo
command: torchrun --nproc_per_node=8 $CODE_SOURCE_PATH/train.py
Dans cette configuration :
-
experiment_namecrée une expérience MLflow nomméesimple-training(ou ajoute une nouvelle exécution s’il existe déjà). -
environmentutilise l’environnement par défaut et installetorchettransformers. -
computealloue un nœud H100 (8 GPU H100). -
code_sourcecharge le dossierreposur le nœud, disponible à l’adresse$CODE_SOURCE_PATH. -
commands’exécutetrain.pyviatorchrunles 8 GPU H100. Le fichier se trouve/home/username/repo/train.pylocalement.
Cas d’utilisation courants
Ajouter des variables d’environnement
experiment_name: training-with-env
environment:
dependencies:
- torch
- transformers
env_variables:
BATCH_SIZE: '32'
LEARNING_RATE: '0.001'
compute:
num_accelerators: 8
accelerator_type: GPU_8xH100
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo
git:
branch: main
command: torchrun --nproc_per_node=8 train.py
Utiliser des secrets (clés API, jetons)
experiment_name: training-with-secrets
environment:
dependencies:
- torch
- transformers
secrets:
HF_TOKEN: 'my_scope/hf_token'
WANDB_API_KEY: 'my_scope/wandb'
compute:
num_accelerators: 8
accelerator_type: GPU_8xH100
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo
git:
branch: main
command: torchrun --nproc_per_node=8 train.py
Les secrets utilisent le format scope/key et doivent être configurés dans Databricks Secrets. Consultez la gestion des secrets pour la configuration.
Lors du partage d’un modèle YAML, d’autres utilisateurs doivent créer leurs propres secrets ou avoir accès au secret référencé.
Environnement
Utilisez ce environment bloc pour sélectionner un environnement GPU serverless et installer des dépendances Python. Par exemple, la configuration suivante sélectionne la version 4 de l’environnement standard et installe PyTorch et Transformers :
environment:
version: '4'
dependencies:
- torch
- transformers
Version de l’environnement
environment.version est optionnel et sélectionne la version de l’environnement géré pour la charge de travail.
Voici quelques exemples :
-
"4"ou"5"d’utiliser la version correspondante de l’environnement standard. -
"databricks_ai_v5"pour utiliser l’environnement IA de Databricks version 5, qui inclut des paquets préinstallés spécifiques au ML. (Liste complète du paquet)
L’exemple suivant sélectionne l’environnement IA de Databricks version 5 :
environment:
version: 'databricks_ai_v5'
dependencies: []
Si vous spécifiez environment.version, vous devez également fournir environment.dependencies une liste en ligne. Utilisez une liste vide si vous n’avez pas besoin d’installer des paquets supplémentaires.
Pour des informations sur les environnements disponibles pour l’exécution IA, voir Configurer votre environnement.
dépendances Python
Listez les dépendances Python de votre charge de travail sous une liste en ligne sous environment.dependencies.
Format de dépendance
La liste de dépendances suit la spécification de l’environnement de base Databricks. Chaque entrée est une spécification de package de style pip (par exemple, my-library==6.1). La liste accepte également les entrées suivantes :
-
Fichiers de configuration requise : référence à une utilisation
requirements.txtexistante-r, par exemple-r '/Workspace/Shared/requirements.txt'. Les variables d’environnement telles que$HOMEcelles-ci sont développées. -
Roues : chemin absolu d’un
.whlfichier, par exemple/Workspace/Shared/path/to/simplejson-3.19.3-py3-none-any.whl. -
URL d’index : URL d’index, par exemple
--index-url https://pypi.org/simple.
environment:
version: '4'
dependencies:
- --index-url https://pypi.org/simple
- -r '/Workspace/Shared/requirements.txt'
- my-library==6.1
- /Workspace/Shared/path/to/simplejson-3.19.3-py3-none-any.whl
Indicateurs d’installation pris en charge
Les dépendances sont installées avec uv. Les indicateurs de style pip suivants sont pris en charge en tant qu’entrées de liste :
-
Appliqué à l’ensemble de l’installation :
--index-url,--extra-index-urlet--find-links(-f) définir ou étendre les index de package. -
Appliqué à la dépendance qui les suit :
--no-deps, ,--no-build-isolation--no-cache-dir, et--force-reinstall. Placez l’indicateur sur sa propre ligne (ou avant la spécification), suivi de la dépendance à laquelle il s’applique.
Par exemple, pour effectuer une installation flash-attn sur l’élément déjà installé torch (aucune isolation de build) et sans résoudre ses propres dépendances :
environment:
version: '4'
dependencies:
- torch
- --no-build-isolation
- --no-deps
- flash-attn
Note
La fonction --trusted-host n'est pas prise en charge. Étant donné que uv configure l’approbation par URL d’index, utilisez --index-url ou --extra-index-url utilisez plutôt.
Images Docker personnalisées
En guise d’alternative, environment.dependenciesvous pouvez spécifier une image conteneur Docker personnalisée à l’aide environment.docker_image.urlde .
environment.docker_image.url s’exclue mutuellement des deux environment.dependencies et environment.version vous ne pouvez pas utiliser l’une ou l’autre dans la même charge de travail.
experiment_name: my-dcs-training
environment:
docker_image:
url: myorg/myrepo:mytag
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: python /app/train.py
Avant d’utiliser une image personnalisée, inscrivez-la avec air register image. Pour plus d’informations, notamment les exigences d’image, les images de base Databricks et les modèles Dockerfile, consultez Utiliser des images Docker personnalisées.
Utiliser des sources de code
Le code_source bloc charge le code local afin que le travail d’entraînement puisse l’exécuter.
-
root_pathest le répertoire local à instantané. Par défaut,airempaquete l’arborescence de travail as-is (y compris les modifications non validées) en tant que tarball brut. - Pour instantanéner une version git épinglée à la place, ajoutez un
git:bloc avec unbranchoucommit. Il doitroot_paths’agir d’un référentiel Git et d’activer la capture instantanée prenant en charge la version (mise en cache,git archive). - Pour les dépôts volumineux,
include_pathsvous permet d’instantanér un sous-ensemble.
Exemple minimal
experiment_name: simple-training
environment:
dependencies:
- torch
- transformers
compute:
num_accelerators: 8
accelerator_type: GPU_8xH100
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo
command: python $CODE_SOURCE_PATH/train.py
Sur l’ordinateur distant, le code est placé à /databricks/code_source/<directory_name>, où <directory_name> est le composant final du chemin d’accès .root_path
$CODE_SOURCE_PATH est défini sur ce chemin absolu, donc utilisez-le dans votre commande plutôt que de coder en dur l’emplacement.
Référentiels Git : épingler par branche ou commit
Pour les référentiels Git, ajoutez un git: bloc pour épingler la version du code par branche ou par validation SHA.
branch et commit s’excluent mutuellement : spécifiez exactement un dans le bloc.
Épingler à une branche (utilise le HEAD local de cette branche) :
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo
git:
branch: main # Uses local HEAD of main (no remote fetch)
command: train.sh
Épingler à une sha de validation (reproductibilité exacte) :
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo
git:
commit: abc1234567 # Pins specific commit
command: train.sh
Champs clés :
-
root_path(Obligatoire) : chemin local à la racine de votre dépôt Git. -
git.branch(Facultatif) : Nom de la branche. Utilise HEAD local ; aucune extraction à distance. Mutuellement exclusif avecgit.commit. -
git.commit(Facultatif) : sha de validation spécifique. Mutuellement exclusif avecgit.branch. -
git.remote(Facultatif) : utilisez le head distant de la branche au lieu de celui local. Affectez la valeur àtruela détection automatique de la distance ou à un nom distant (par exempleupstream) pour extraire à partir d’un distant spécifique. Valide uniquement avecgit.branch.
Si vous omettez le bloc, git: empaquette l’arborescence air de travail en tant que tarball brut, y compris les modifications non validées. Aucun champ supplémentaire n’est requis.
Répertoires non git
Vous pouvez créer des répertoires d’instantanés qui ne sont pas des référentiels Git. Omettez le git: bloc, qui doit root_path être un dépôt Git. Sans cela, il n’y a pas de mise en cache de version ; un tarball frais est chargé pour chaque exécution.
code_source:
type: snapshot
snapshot:
root_path: /home/username/my_project
command: $CODE_SOURCE_PATH/train.py
Filtrage de dossiers avec include_paths
Pour les monorepos volumineux, les dossiers spécifiques d’instantanés sont uniquement destinés à réduire le temps de chargement et la taille du téléchargement et de l’instantané :
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo
include_paths:
- research/models
- research/common
- research/configs
command: python $CODE_SOURCE_PATH/research/models/launch_training.py
Points clés :
- Le champ est facultatif. S’il est omis, l’ensemble du référentiel est inclus par défaut.
- Les chemins d’accès doivent être relatifs à la racine du référentiel (pas de début
/). -
..n’est pas autorisé ; vous ne pouvez pas référencer les répertoires parents.
Fonctions avancées
Hyperparamètres personnalisés
Passez une configuration structurée à votre script d’apprentissage via HYPERPARAMETERS_PATH:
experiment_name: parameterized-training
environment:
dependencies:
- torch
- transformers
compute:
num_accelerators: 8
accelerator_type: GPU_8xH100
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo
git:
branch: main
command: torchrun --nproc_per_node=8 train.py
parameters:
model:
name: 'gpt2'
hidden_size: 768
training:
batch_size: 32
learning_rate: 0.0001
Lisez-les dans votre script :
import os
import yaml
with open(os.environ['HYPERPARAMETERS_PATH']) as f:
params = yaml.safe_load(f)
learning_rate = params['training']['learning_rate']
model_name = params['model']['name']
Fiabilité du travail
experiment_name: reliable-training
environment:
dependencies:
- torch
- transformers
compute:
num_accelerators: 8
accelerator_type: GPU_8xH100
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo
git:
branch: main
command: torchrun --nproc_per_node=8 train.py
max_retries: 2
timeout_minutes: 90
Si la charge de travail échoue, elle est retentée deux fois. Chaque tentative a 90 minutes pour se terminer, donc le budget total de l’horloge murale est de 90 × 3 = 270 minutes.
Attribution des coûts
Attachez une charge de travail à une stratégie budgétaire existante via usage_policy_name. Le nom est résolu en ID de la stratégie lors du lancement de la charge de travail. Pour la configuration, consultez l’utilisation des attributs avec des stratégies d’utilisation serverless.
experiment_name: my-training
environment:
dependencies:
- mlflow
compute:
num_accelerators: 1
accelerator_type: GPU_1xA10
command: echo "Hello World"
usage_policy_name: my team policy
Référence
Référence du champ de base
| Champ | Catégorie | Description | Example |
|---|---|---|---|
experiment_name |
string | Nom de l’expérience pour MLflow. | "my-training-job" |
environment.dependencies |
Liste | Liste inline des spécifications de dépendance pip. | ["torch", "transformers"] |
environment.version |
string | Version de l’environnement GPU serverless. facultatif. Utilise l’environnement par défaut si c’est omis. Voir la version Environnement. |
"4", , "5""databricks_ai_v5" |
compute.num_accelerators |
int | Nombre de GPU. Doit être un multiple des GPU par nœud pour le fichier sélectionné compute.accelerator_type. |
1, , 48 |
compute.accelerator_type |
string | Configuration de l’accélérateur, y compris le type de GPU et la forme du nœud. Voir Configurations GPU prises en charge. |
"GPU_1xA10", , "GPU_1xH100""GPU_8xH100" |
code_source |
Dictionnaire | Configuration de la source du code. | Consultez Utiliser des sources de code. |
command |
string | Commandes Bash pour lancer l’entraînement. | torchrun --nproc_per_node=8 train.py |
Configurations GPU prises en charge
accelerator_type |
GPU par nœud |
num_accelerators Exigence |
Remarques |
|---|---|---|---|
GPU_1xA10 |
1 | Tout entier positif | Un seul A10, adapté au développement et aux petites charges de travail. |
GPU_1xH100 |
1 | 1 |
H100 unique. |
GPU_8xH100 |
8 | Un multiple positif de 8 | Nœud H100 complet, typique de l’entraînement distribué. |
Pour connaître les fonctionnalités de l’accélérateur et les cas d’usage recommandés, consultez les options matérielles.
compute.num_accelerators est le nombre total de GPU pour la charge de travail. Il doit s’agir d’un multiple des GPU par nœud pour le fichier sélectionné compute.accelerator_type.
Champs facultatifs
Configuration de l’environnement
environment:
version: '4'
dependencies:
- torch
- transformers
env_variables:
BATCH_SIZE: '32'
secrets:
HF_TOKEN: 'my_scope/hf_token'
Pour les versions de l’environnement, le format de dépendance et les drapeaux d’installation pris en charge, voir Environnement.
Configuration personnalisée de l’image Docker
environment:
docker_image:
url: myorg/myrepo:mytag
Mutuellement exclusif avec environment.dependencies et environment.version. Inscrivez l’image avant air register image l’utilisation. Consultez Utiliser des images Docker personnalisées.
Configuration de la source du code
code_source:
type: snapshot
snapshot:
root_path: /home/username/repo # REQUIRED — local path to repo or directory
git: # Optional (git repos only) — pin to a branch or commit
branch: main # Branch name; uses local HEAD unless 'remote' is set
# commit: abc1234567 # Mutually exclusive with 'branch'
remote: false # Optional — true to auto-detect remote HEAD, or a remote name string
include_paths: # Optional — filter included paths
- src/
- configs/
Contraintes de champ :
-
git.branchetgit.commits’excluent mutuellement : spécifiez exactement un dans legit:bloc. -
git.remotenécessitegit.branch(il n’a aucun effet avecgit.commit). - Si vous omettez le
git:bloc, l’arborescence de travail est empaquetée en tant que tarball simple, y compris les modifications non validées.
Paramètres personnalisés
Passé à la charge de travail via HYPERPARAMETERS_PATH:
parameters:
model:
name: 'gpt2'
hidden_size: 768
training:
batch_size: 32
Nom de l’exécution MLflow
mlflow_run_name: 'experiment-001-baseline'
Résolution du chemin d’accès
Tous les chemins d’accès de la charge de travail YAML sont relatifs à la charge de travail YAML, sauf s’ils sont des chemins absolus.
Structure de dossiers :
/home/username/my-project/
├── train.yaml
└── scripts/
└── train.py
Configuration YAML :
experiment_name: my-training
environment:
dependencies:
- torch
- transformers
compute:
num_accelerators: 8
accelerator_type: GPU_8xH100
code_source:
type: snapshot
snapshot:
root_path: . # Relative to train.yaml
git:
branch: main
command: torchrun --nproc_per_node=8 $CODE_SOURCE_PATH/scripts/train.py