Configura tu proyecto Databricks

La extensión IDE de Databricks ofrece una vista de Configuración dentro de la extensión que te permite configurar y actualizar fácilmente la configuración de tu proyecto Databricks. Estas características incluyen la configuración local de carpetas, la instalación de herramientas de IA, un selector de despliegue para el espacio de trabajo objetivo, la configuración sencilla de autenticación y cálculo, la sincronización de carpetas del espacio de trabajo y pasos sencillos para activar el entorno virtual Python necesario para la depuración.

La vista de Configuración dentro de la extensión del IDE Databricks está disponible una vez que has creado o migrado un proyecto a un proyecto Databricks. Vea Creación de un proyecto de Databricks.

Nota:

Las versiones anteriores de la extensión IDE Databricks definían la configuración en un archivo JSON del proyecto y las variables de entorno se establecían en el terminal. En la versión de lanzamiento, la configuración del proyecto y del entorno se encuentra en los archivos databricks.yml y databricks.env.

Si el proyecto es un conjunto de recursos de Databricks, la interfaz de usuario de extensión de Databricks también proporciona un Explorador de recursos de agrupación y una vista Variables de agrupación para administrar los recursos y las variables de la agrupación. Consulta Bundle y funciones del explorador.

Establecer la carpeta local

Para seleccionar una carpeta local diferente para tu proyecto Databricks, haz clic en el icono de engranaje asociado a la entrada de Carpeta Local en la vista de configuración .

Instala y utiliza herramientas de IA

Importante

Esta característica se encuentra en su versión beta.

La sección de herramientas de IA de la vista de Configuración te permite instalar herramientas de IA para que tus agentes de codificación funcionen eficazmente con Azure Databricks. La extensión verifica si las herramientas de IA están instaladas en el ámbito global o del proyecto, incluyendo las instalaciones que realizaste a través de la CLI de Azure Databricks, y actualiza el estado mostrado. Para más información sobre herramientas de IA, consulta Habilidades de agente para asistentes de codificación con IA y aitools grupo de mando.

Para instalar herramientas de IA:

  1. En la vista de configuración de la extensión, haz clic en Instalar herramientas de IA.
  2. Sigue las indicaciones para seleccionar un ámbito y las herramientas necesarias para completar la instalación.

Cuando se instalan herramientas de IA, aparece un icono verde de robot junto a las herramientas de IA. Las herramientas de IA se actualizan automáticamente a la última versión.

Herramientas de IA de la extensión de Databricks

Para desinstalar herramientas de IA, haz clic derecho en herramientas de IA y selecciona Desinstalar herramientas de IA.

Cambiar el área de trabajo de implementación de destino

Para seleccionar o cambiar el destino de implementación del proyecto de Databricks (por ejemplo, para cambiar de un destino de dev a un destino de prod):

  1. En la vista de Configuración de la extensión Databricks, haz clic en el icono de engranaje (Seleccionar un objetivo de paquete de activos Databricks) asociado a Objetivo.

    Seleccione un destino de agrupación

  2. En la Paleta de comandos, seleccione el destino de implementación deseado.

Una vez configurado un destino, se muestran el host y el modo de implementación. Para obtener información sobre los modos de implementación de paquetes de automatización declarativos, consulte Modos de implementación de paquetes de automatización declarativos.

El host del área de trabajo se puede cambiar modificando la configuración de destino workspace en el archivo de configuración de databricks.yml asociado al proyecto. Consulte destinos.

Nota:

Las siguientes características de extensión del IDE de Databricks solo están disponibles cuando el modo de despliegue objetivo es el desarrollo:

  • Utilice el clúster de desarrollo adjunto para trabajos de lotes
  • Sincronización de archivos de carpeta del área de trabajo
  • Selección de un clúster de desarrollo interactivo

Configuración del perfil de Databricks para el proyecto

Al crear un proyecto de Databricks o convertir un proyecto en un proyecto de Databricks, configuras un perfil que incluye la configuración de autenticación que se utiliza para la conexión a Databricks. Si quiere cambiar el perfil de autenticación usado, haga clic en el icono de engranaje asociado a AuthType en la vista Configuración.

Para más información sobre la autenticación de la extensión IDE de Databricks, consulte Configurar autorización para la extensión IDE de Databricks.

Seleccionar capacidad de cómputo para ejecutar código y procesos

Usando la extensión del IDE de Databricks, puedes seleccionar serverless, seleccionar un clúster de Azure Databricks existente o crear un nuevo clúster de Azure Databricks para ejecutar tu código y trabajos. Una vez que se haya conectado a la computación, se muestran el identificador del clúster, la versión de Databricks Runtime, el creador, el estado y el modo de acceso. También puede iniciar y detener un clúster y navegar directamente a los detalles de la página del clúster.

Sugerencia

Si no desea esperar a que se inicie el clúster de trabajos, compruebe Invalidar clúster de trabajos en lote justo debajo de la selección de clúster para usar el clúster seleccionado para ejecutar trabajos de agrupación en modo de desarrollo. Esto no está disponible si está utilizando computación sin servidor.

Utilizar computación sin servidor

La computación sin servidor es gestionada por Azure Databricks. Al ejecutar cargas de trabajo en proceso sin servidor, Azure Databricks asigna y administra automáticamente los recursos de proceso necesarios.

  1. En la vista de configuración , haz clic en Seleccionar calcular o en el icono de engranaje (Configurar cálculo).

    Configurar computación

  2. En la paleta de comandos, seleccione Sin servidor.

    Selección de proceso sin servidor

Uso de un clúster existente

Si tiene un clúster de Azure Databricks existente que quiere usar, haga lo siguiente:

  1. En la vista de configuración , haz clic en Seleccionar calcular o en el icono de engranaje (Configurar cálculo).

  2. En la Paleta de comandos, seleccione el clúster que quiere usar.

Creación de un clúster

Si no tiene un clúster de Azure Databricks existente, o si quiere crear uno nuevo:

  1. En la vista de configuración , haz clic en Seleccionar calcular o en el icono de engranaje (Configurar cálculo).

  2. En la paleta de comandos, haga clic en Crear nuevo clúster.

  3. Cuando se le pida que abra el sitio web externo (el área de trabajo de Azure Databricks), haga clic en Abrir.

  4. Si se le solicita, inicie sesión en el área de trabajo de Azure Databricks.

  5. Siga las instrucciones para crear un clúster.

    Nota:

    Databricks recomienda crear un clúster de proceso personal. Esto le permite empezar a ejecutar cargas de trabajo inmediatamente, lo que minimiza la sobrecarga de administración de procesos.

  6. Una vez creado el clúster y en ejecución, vuelva a Visual Studio Code.

  7. En la vista de configuración , junto al clúster, haz clic en el icono de engranaje (Configurar computación).

    Icono de configuración del clúster 3

    En la paleta de comandos, haga clic en el clúster que quiere usar.

Sincronización de la carpeta del área de trabajo con Databricks

Puedes sincronizar la carpeta remota del espacio de trabajo Databricks asociada a tu proyecto Databricks haciendo clic en el icono de sincronización (iniciar sincronización) asociado a Carpeta Remota en la vista de configuración de la extensión Databricks.

Nota:

La extensión del IDE de Databricks solo funciona con los directorios de espacios de trabajo que crea. No se puede usar un directorio del área de trabajo existente en el proyecto a menos que la extensión la cree.

Para acceder a la vista del área de trabajo en Databricks, haga clic en el icono de vínculo externo (icono Abrir vínculo externamente) asociado con Carpeta remota.

La extensión determina la carpeta del área de trabajo de Azure Databricks que se va a usar en función de la file_path configuración de agrupación asociada del proyecto.workspace Vea Área de trabajo.

Nota:

La extensión IDE de Databricks solo realiza la sincronización automática y unidireccional de los cambios de archivo desde tu proyecto local de Visual Studio Code hacia la carpeta de espacio de trabajo relacionada en tu espacio de trabajo remoto de Azure Databricks. Los archivos de este directorio del área de trabajo remota están diseñados para ser transitorios. No inicie los cambios en estos archivos desde el área de trabajo remota, ya que estos cambios no se sincronizarán con el proyecto local.

Para detalles de uso sobre la función de sincronización de directorios de espacios de trabajo para versiones anteriores de la extensión IDE Databricks, consulte Seleccionar un directorio de espacio de trabajo para la extensión IDE Databricks.

Inicia un túnel SSH

Importante

Esta característica se encuentra en su versión beta.

Puedes iniciar un túnel SSH desde la extensión IDE de Databricks para abrir una sesión de desarrollo remota en Azure Databricks compute. Esto te permite editar archivos y ejecutar código directamente sobre computación remota desde Visual Studio Code.

  1. Para iniciar un túnel SSH, haz clic en el botón Iniciar túnel SSH en la vista del túnel SSH en la extensión.

  2. A continuación, selecciona computación clásica o sin servidor para conectarte:

    • Clúster: El selector de clúster solo muestra clústeres que usan modo de acceso dedicado (de un solo usuario). Si ya tienes seleccionado un clúster de usuario único en tu sesión local de Visual Studio Code, ese clúster está preseleccionado para la conexión SSH.
    • Serverless: Si no seleccionas un clúster, el túnel se conecta por defecto a la computación serverless.

Cuando inicias un túnel, se abre una nueva instancia de Visual Studio Code en el mismo IDE que estás usando actualmente. La sesión remota abre tu carpeta de inicio (users/username@databricks.com) por defecto y muestra automáticamente el archivo específico que estabas editando activamente. La autenticación está preconfigurada, así que no necesitas iniciar sesión de nuevo para conectarte a la sesión remota.

Configuración del entorno de Python y Databricks Connect

La sección Entorno de Python de la vista de la Configuración permite configurar fácilmente el entorno de desarrollo virtual de Python y la instalación de Databricks Connect para ejecutar y depurar código y celdas de cuaderno. Los entornos virtuales de Python garantizan que tu proyecto utilice versiones compatibles de Python y de los paquetes de Python.

La extensión utiliza la versión de Databricks Runtime de un clúster o la versión de un entorno sin servidor para crear localmente un .venv cuya versión de Python y conjunto de paquetes coinciden con los del runtime. Esto evita el problema común de que el código funciona localmente pero falla en Azure Databricks debido a diferencias en Python o en las versiones de los paquetes.

La configuración automatizada requiere UV para crear y gestionar el entorno virtual. Cuando inicias la configuración, la extensión instala UV automáticamente si no está ya disponible. Si no se puede instalar UV automáticamente, la configuración se detiene y te pide instalar UV manualmente, y luego lo intentas de nuevo.

Para configurar automáticamente el entorno virtual de Python para tu proyecto, en la vista de Configuración de la extensión:

  1. Haz clic en el botón rojo Configurar entorno Python.
  2. En la Paleta de Comandos, selecciona el cálculo que quieres que empareje.

Para un proyecto existente, la configuración fusiona sus cambios en tu pyproject.toml y escribe una pyproject.toml.bak copia de seguridad, para que puedas revisar o revertir los cambios. Si más adelante cambias de cálculo, la extensión detecta la deriva y ofrece volver a ejecutar la configuración para que coincida con el nuevo tiempo de ejecución.

Alternativamente, puedes usar el comando CLI databricks environments setup-local de Databricks para configurar un entorno local. Esto requiere uv en el PATH.

databricks environments setup-local --serverless-version 5

Para los proyectos que ya usan pip, Poetry o conda, la extensión muestra una guía paso a paso de entorno de Python en lugar de la configuración automatizada de uv. También puedes apuntar la extensión a un intérprete de Python existente cambiando el entorno activo.

Para cambiar los entornos, haga clic en el icono de engranaje (Cambiar entorno virtual) asociado al Entorno activo.

Para información sobre cómo ejecutar y depurar código y cuadernos con Databricks Connect, consulte Depurar código usando Databricks Connect para la extensión del IDE Databricks.