Integración de Git para la definición de trabajos de Spark

Este artículo explica cómo funciona la integración de Git para definiciones de trabajos de Spark (SJD) en Microsoft Fabric. Obtenga información sobre cómo configurar una conexión de repositorio, administrar los cambios de definición de trabajos de Spark a través del control de código fuente e implementarlos en varias áreas de trabajo.

Cuando activas la integración con Git para definiciones de trabajos de Spark en Azure DevOps, puedes seguir los cambios a través del historial completo de Git. Si seleccionas PySpark o SparkR, el archivo principal de definición y el archivo de referencia se incluyen como parte del commit. La integración con git también rastrea los cambios en el código fuente dentro de estos archivos.

Importante

Esta característica se encuentra en versión preliminar.

Configuración de una conexión

Desde la configuración del área de trabajo, puede configurar fácilmente una conexión al repositorio para confirmar y sincronizar los cambios. Para configurar la conexión, consulte Introducción a la integración de Git. Después de conectarte, puedes ver tus elementos, como las definiciones de trabajos de Spark, en el panel de control de versiones .

Captura de pantalla del panel de control de código fuente del área de trabajo.

Después de confirmar la definición de la tarea de Spark en el repositorio de Git, la estructura de carpetas de la definición de la tarea aparece en el repositorio.

Representación de definición de trabajos de Spark en Git

La siguiente imagen muestra un ejemplo de la estructura de archivo para cada elemento de definición de trabajo de Spark en el repositorio:

Captura de pantalla de la estructura de archivos sjd del repositorio de Git.

Cuando se hace commit del elemento de definición de trabajo de Spark en el repositorio, se crea una carpeta Git para cada elemento que se nombra según este esquema: <Nombre> del elemento + "SparkJobDefinition". No renombres la carpeta, porque se usa para rastrear el elemento en el espacio de trabajo. Por ejemplo, si el nombre del elemento es "sjd1", el nombre de la carpeta Git es "sjd1SparkJobDefinition".

La carpeta Git contiene dos subcarpetas: main y reference. La carpeta principal contiene el archivo principal de definición, y la carpeta de referencia contiene el archivo de referencia.

Además de los archivos de referencia y principales, también hay un archivo SparkJobDefinitionV1.json. Contiene los metadatos del elemento de definición de trabajo de Spark, por lo que no lo debe modificar. El archivo .platform contiene la información de la plataforma relacionada con la configuración de Git. Tampoco modifiques este archivo.

Nota:

  • Si eliges Java o Scala como lenguaje, los archivos principal y de referencia no se comprometen cuando se suben como archivos .jar.
  • El entorno adjunto permanece en una definición de trabajo de Spark después de sincronizar desde el repositorio con un área de trabajo de Fabric. Actualmente, no se admiten entornos de referencia entre áreas de trabajo. Debe adjuntarse manualmente a un entorno nuevo o usar la configuración predeterminada del área de trabajo para ejecutar la definición del trabajo.
  • La definición del trabajo de Spark conserva el identificador predeterminado del lakehouse al sincronizarse desde el repositorio con un área de trabajo de Fabric. Si confirmas un notebook con el lakehouse predeterminado, debes hacer referencia manualmente a un elemento de lakehouse recién creado. Para más información, consulte Integración de Git en Lakehouse.