Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Cet article explique comment fonctionne l’intégration Git pour les définitions de tâches Spark (SJD) dans Microsoft Fabric. Découvrez comment configurer une connexion de référentiel, gérer les modifications de définition du travail Spark par le biais du contrôle de code source et les déployer dans différents espaces de travail.
Lorsque vous activez l’intégration Git pour les définitions de tâches Spark dans Azure DevOps, vous pouvez suivre les modifications via l’historique complet de Git. Si vous sélectionnez PySpark ou SparkR, le fichier principal de définition et le fichier de référence sont inclus dans le commit. L’intégration Git suit également les modifications apportées au code source dans ces fichiers.
Important
Cette fonctionnalité est en préversion.
Configurer une connexion
Avec les paramètres de votre espace de travail, vous pouvez facilement configurer une connexion à votre dépôt pour commiter et synchroniser les modifications. Pour configurer la connexion, consultez Démarrer avec l’intégration de Git. Une fois connecté, vous pouvez afficher vos éléments, tels que les définitions de travaux Spark, dans le volet Gestion de code source.
Après avoir validé la définition de la tâche Spark dans le dépôt Git, la structure de la définition des dossiers apparaît dans le dépôt.
Représentation de la définition de job Spark dans Git
L’image suivante montre un exemple de la structure de fichiers pour chaque élément de définition du travail Spark dans le dépôt :
Lorsque vous validez l’élément de définition de tâche Spark dans le dépôt, un dossier Git est créé pour chaque élément et est nommé selon ce schéma : <Nom de l’élément> + « SparkJobDefinition ». Ne renomme pas le dossier, car il sert à suivre l’élément dans l’espace de travail. Par exemple, si le nom de l’élément est « sjd1 », le nom du dossier Git est « sjd1SparkJobDefinition ».
Le dossier Git contient deux sous-dossiers : main et reference. Le dossier principal contient le fichier de définition principal, et le dossier de référence contient le fichier de référence.
En plus des fichiers main et de référence, il existe également un fichier SparkJobDefinitionV1.json. Il contient les métadonnées de l'élément de définition du travail Spark, aussi ne le modifiez pas. Le fichier .platform contient les informations de plateforme liées à la configuration de Git. Ne modifie pas ce fichier non plus.
Remarque
- Si vous choisissez Java ou Scala comme langage, les fichiers principaux et de référence ne sont pas engagés lors de leur téléchargement en fichier .jar.
- L’environnement attaché reste associé à une définition de tâche Spark après la synchronisation du référentiel vers un espace de travail Fabric. Actuellement, les environnements de référence interespaces de travail ne sont pas pris en charge. Vous devez procéder à un attachement manuel à un nouvel environnement ou utiliser les paramètres par défaut de l'espace de travail pour exécuter la définition du travail.
- La définition du travail Spark conserve l’ID lakehouse par défaut lors de la synchronisation à partir du référentiel vers un espace de travail Fabric. Si vous validez un carnet avec le lakehouse par défaut, vous devez faire manuellement référence à un élément lakehouse nouvellement créé. Pour plus d’informations, consultez Intégration Git du lakehouse.