Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Use la tarea de cuaderno para implementar cuadernos de Databricks.
Requisitos
- El cuaderno debe estar en una ubicación accesible por el usuario que configura el trabajo.
Configurar una tarea de cuaderno
Note
La interfaz de usuario de trabajos muestra opciones dinámicamente basadas en otras opciones configuradas.
Para iniciar el flujo para configurar una tarea Notebook:
- Vaya a la pestaña Tareas de la interfaz de usuario de trabajos.
- Haga clic en
Agregar tarea.
- Escriba un nombre en el campo Nombre de tarea.
- En el menú desplegable Tipo, seleccione
Notebook.
Configuración del origen
En el menú desplegable Origen , seleccione una ubicación para el cuaderno mediante una de las siguientes opciones.
Workspace
Use Área de trabajo para configurar un cuaderno almacenado en el área de trabajo, siguiendo estos pasos:
- Haga clic en el campo Ruta de acceso. Aparece el cuadro de diálogo Seleccionar cuaderno.
- Vaya al cuaderno, haga clic para resaltar el archivo y haga clic en Confirmar.
Note
Puede usar esta opción para configurar una tarea para un cuaderno almacenado en una carpeta de Git de Databricks. Databricks recomienda utilizar la opción proveedor de Git y un repositorio Git remoto para administrar las versiones de los activos programados con los trabajos.
Proveedor de GIT
Use el proveedor de Git para configurar un cuaderno en un repositorio de Git remoto.
Las opciones mostradas por la interfaz de usuario dependen de si ya ha configurado o no un proveedor de Git en otro lugar. Solo se puede usar un repositorio Git remoto para todas las tareas de un trabajo. Consulte Uso de Git con trabajos de Lakeflow.
Importante
Los cuadernos creados por trabajos de Lakeflow que se ejecutan desde repositorios de Git remotos son efímeros y no se pueden confiar en ellos para realizar un seguimiento de las ejecuciones, experimentos o modelos de MLflow. Al crear un cuaderno a partir de un trabajo, use un experimento de MLflow del área de trabajo (en lugar de un experimento de MLflow de cuaderno) y llame a mlflow.set_experiment("/path/to/experiment") en el cuaderno del área de trabajo antes de ejecutar cualquier código de seguimiento de MLflow. Para obtener más detalles, consulte Evitar la pérdida de datos en experimentos de MLflow.
El campo Ruta de acceso aparece después de haber configurado una referencia de Git.
Escriba la ruta de acceso relativa del cuaderno, como etl/bronze/ingest.py.
Importante
Al escribir la ruta de acceso relativa, no comience con / ni ./. Por ejemplo, si la ruta de acceso absoluta del cuaderno al que desea acceder es /etl/bronze/ingest.py, escriba etl/bronze/ingest.py en el campo Ruta de acceso.
Configurar bibliotecas de computación y bibliotecas dependientes
Note
Puede seleccionar un almacén SQL como recurso de proceso para una tarea de cuaderno solo si el cuaderno está escrito íntegramente en SQL y SQL está configurado como su lenguaje predeterminado. Si el cuaderno utiliza otro lenguaje predeterminado o combina varios lenguajes, selecciona en su lugar un clúster u otro recurso de proceso compatible.
- Use Compute para seleccionar o configurar un clúster que soporte la lógica en tu cuaderno de trabajo.
- Si utilizas
Serverlessun recurso de proceso, instala las bibliotecas directamente en el cuaderno, mediante el panel Entorno o utilizando%pip install. Consulte Configuración del entorno sin servidor. - Para todas las demás configuraciones de proceso, haga clic en
Agregue en Bibliotecas dependientes. Aparece el cuadro de diálogo Agregar biblioteca dependiente.
- Puede seleccionar una biblioteca existente o cargar una biblioteca nueva.
- Solo puede usar bibliotecas almacenadas en una ubicación compatible con las configuraciones de proceso. Consulte Soporte de biblioteca de Python.
- Cada origen de biblioteca tiene un flujo diferente para seleccionar o cargar una biblioteca. Consulte Instalación de bibliotecas.
Finalizar configuración del trabajo
- (Opcional) Configure Parámetros como pares clave-valor a los que se puede tener acceso en el cuaderno mediante
dbutils.widgets. Consulte Configure task parameters (Configuración de parámetros de tarea). - (Opcional) Para configurar reintentos, umbrales de tiempo de ejecución o trabajos pendientes de streaming, o notificaciones, consulte Configuración avanzada de tareas.
- Haga clic en Guardar tarea.
Para editar, clonar, deshabilitar o eliminar esta tarea, consulte Configuración y edición de tareas en trabajos de Lakeflow.
Preparación de datos visuales
La preparación de datos visuales en la lista desplegable Tipo de tarea crea una tarea de cuaderno para un archivo de preparación de datos visuales. Estos archivos se compilan en un lienzo visual en lakeflow Designer, que guarda cada uno como un cuaderno denominado <name>.designer.ipynb. Para ejecutar uno como trabajo, agregue una tarea de cuaderno y seleccione su .designer.ipynb archivo como origen. Consulte Lakeflow Designer.
Limitations
La salida total de las celdas del cuaderno (la salida combinada de todas las celdas del cuaderno) está sujeta a un límite de tamaño de 30 MB. Además, la salida de celda individual está sujeta a un límite de tamaño de 8 MB. Si la salida total de la celda supera los 30 MB de tamaño, o si la salida de una celda individual es mayor que 8 MB, la ejecución se cancela y se marca como errónea.
Si necesita ayuda para encontrar las celdas que están cerca o fuera del límite, ejecute el cuaderno en un clúster de uso general y use esta técnica de autoguardado del cuaderno.
Recursos adicionales
- Tarea de cuaderno: Define una tarea de cuaderno como código con paquetes de automatización declarativa.
- Usar Git con Lakeflow Jobs: Versiona los notebooks con un proveedor Git.
- Configurar parámetros de la tarea: Pasar parámetros al cuaderno.