Tarea de cuaderno para trabajos

Use la tarea de cuaderno para implementar cuadernos de Databricks.

Requisitos

  • El cuaderno debe estar en una ubicación accesible por el usuario que configura el trabajo.

Configurar una tarea de cuaderno

Note

La interfaz de usuario de trabajos muestra opciones dinámicamente basadas en otras opciones configuradas.

Para iniciar el flujo para configurar una tarea Notebook:

  1. Vaya a la pestaña Tareas de la interfaz de usuario de trabajos.
  2. Haga clic en el icono Más.Agregar tarea.
  3. Escriba un nombre en el campo Nombre de tarea.
  4. En el menú desplegable Tipo, seleccione Notebook.

Configuración del origen

En el menú desplegable Origen , seleccione una ubicación para el cuaderno mediante una de las siguientes opciones.

Workspace

Use Área de trabajo para configurar un cuaderno almacenado en el área de trabajo, siguiendo estos pasos:

  1. Haga clic en el campo Ruta de acceso. Aparece el cuadro de diálogo Seleccionar cuaderno.
  2. Vaya al cuaderno, haga clic para resaltar el archivo y haga clic en Confirmar.

Note

Puede usar esta opción para configurar una tarea para un cuaderno almacenado en una carpeta de Git de Databricks. Databricks recomienda utilizar la opción proveedor de Git y un repositorio Git remoto para administrar las versiones de los activos programados con los trabajos.

Proveedor de GIT

Use el proveedor de Git para configurar un cuaderno en un repositorio de Git remoto.

Las opciones mostradas por la interfaz de usuario dependen de si ya ha configurado o no un proveedor de Git en otro lugar. Solo se puede usar un repositorio Git remoto para todas las tareas de un trabajo. Consulte Uso de Git con trabajos de Lakeflow.

Importante

Los cuadernos creados por trabajos de Lakeflow que se ejecutan desde repositorios de Git remotos son efímeros y no se pueden confiar en ellos para realizar un seguimiento de las ejecuciones, experimentos o modelos de MLflow. Al crear un cuaderno a partir de un trabajo, use un experimento de MLflow del área de trabajo (en lugar de un experimento de MLflow de cuaderno) y llame a mlflow.set_experiment("/path/to/experiment") en el cuaderno del área de trabajo antes de ejecutar cualquier código de seguimiento de MLflow. Para obtener más detalles, consulte Evitar la pérdida de datos en experimentos de MLflow.

El campo Ruta de acceso aparece después de haber configurado una referencia de Git.

Escriba la ruta de acceso relativa del cuaderno, como etl/bronze/ingest.py.

Importante

Al escribir la ruta de acceso relativa, no comience con / ni ./. Por ejemplo, si la ruta de acceso absoluta del cuaderno al que desea acceder es /etl/bronze/ingest.py, escriba etl/bronze/ingest.py en el campo Ruta de acceso.

Configurar bibliotecas de computación y bibliotecas dependientes

Note

Puede seleccionar un almacén SQL como recurso de proceso para una tarea de cuaderno solo si el cuaderno está escrito íntegramente en SQL y SQL está configurado como su lenguaje predeterminado. Si el cuaderno utiliza otro lenguaje predeterminado o combina varios lenguajes, selecciona en su lugar un clúster u otro recurso de proceso compatible.

  1. Use Compute para seleccionar o configurar un clúster que soporte la lógica en tu cuaderno de trabajo.
  2. Si utilizas Serverless un recurso de proceso, instala las bibliotecas directamente en el cuaderno, mediante el panel Entorno o utilizando %pip install. Consulte Configuración del entorno sin servidor.
  3. Para todas las demás configuraciones de proceso, haga clic en el icono Más.Agregue en Bibliotecas dependientes. Aparece el cuadro de diálogo Agregar biblioteca dependiente.
    • Puede seleccionar una biblioteca existente o cargar una biblioteca nueva.
    • Solo puede usar bibliotecas almacenadas en una ubicación compatible con las configuraciones de proceso. Consulte Soporte de biblioteca de Python.
    • Cada origen de biblioteca tiene un flujo diferente para seleccionar o cargar una biblioteca. Consulte Instalación de bibliotecas.

Finalizar configuración del trabajo

  1. (Opcional) Configure Parámetros como pares clave-valor a los que se puede tener acceso en el cuaderno mediante dbutils.widgets. Consulte Configure task parameters (Configuración de parámetros de tarea).
  2. (Opcional) Para configurar reintentos, umbrales de tiempo de ejecución o trabajos pendientes de streaming, o notificaciones, consulte Configuración avanzada de tareas.
  3. Haga clic en Guardar tarea.

Para editar, clonar, deshabilitar o eliminar esta tarea, consulte Configuración y edición de tareas en trabajos de Lakeflow.

Preparación de datos visuales

La preparación de datos visuales en la lista desplegable Tipo de tarea crea una tarea de cuaderno para un archivo de preparación de datos visuales. Estos archivos se compilan en un lienzo visual en lakeflow Designer, que guarda cada uno como un cuaderno denominado <name>.designer.ipynb. Para ejecutar uno como trabajo, agregue una tarea de cuaderno y seleccione su .designer.ipynb archivo como origen. Consulte Lakeflow Designer.

Limitations

La salida total de las celdas del cuaderno (la salida combinada de todas las celdas del cuaderno) está sujeta a un límite de tamaño de 30 MB. Además, la salida de celda individual está sujeta a un límite de tamaño de 8 MB. Si la salida total de la celda supera los 30 MB de tamaño, o si la salida de una celda individual es mayor que 8 MB, la ejecución se cancela y se marca como errónea.

Si necesita ayuda para encontrar las celdas que están cerca o fuera del límite, ejecute el cuaderno en un clúster de uso general y use esta técnica de autoguardado del cuaderno.

Recursos adicionales