Configuración de grupos dinámicos personalizados en Microsoft Fabric

Se aplica a:✅ Ingeniería de datos de tejido y ciencia de datos

Los pools en vivo personalizados son clústeres Spark prehidratados que permiten iniciar sesiones casi instantáneamente para notebooks en Fabric. En este artículo se muestra cómo crear, configurar y administrar grupos dinámicos personalizados para obtener un rendimiento óptimo.

Prerrequisitos

Antes de configurar grupos activos personalizados, asegúrese de que tiene:

  • Acceso a un espacio de trabajo Fabric con un SKU de Fabric de pago (no se admiten capacidades de prueba de Fabric).
  • Rol de administrador o miembro en el espacio de trabajo.
  • Una capacidad activa de Fabric asignada a tu espacio de trabajo.
  • Un entorno de Fabric publicado que se usará para la configuración de la biblioteca.
  • Una piscina Spark personalizada existente. Solo los administradores de espacios de trabajo pueden crear pools personalizados de Spark.

Si tienes el rol Member, un administrador del espacio de trabajo debe activar la opción existente Customize compute configuration for items en la configuración del espacio de trabajo.

Importante

Los grupos de inicio no se admiten para grupos activos personalizados. Si el área de trabajo usa un grupo de inicio, debe crear un grupo de Spark personalizado antes de configurar un grupo activo personalizado.

Utiliza la configuración de personalización de cómputo existente

Los grupos activos personalizados usan la configuración existente del espacio de trabajo Personalizar la configuración de proceso para los elementos. No tienen una configuración de delegación independiente. Antes de que un miembro del espacio de trabajo pueda crear o actualizar una configuración personalizada de pool en vivo, un administrador del espacio debe activar la configuración existente:

  1. Vaya al área de trabajo de Fabric.

  2. Seleccione Ajustes del espacio de trabajo desde la cinta de inicio del espacio de trabajo.

  3. Expanda Ingeniería de datos/Ciencia y seleccione Configuración de Spark.

  4. Seleccione la pestaña Pool.

  5. Activa Configuración de proceso personalizada de los elementos.

    Captura de pantalla que muestra el interruptor para personalizar la configuración de cálculo de los objetos.

  6. Haga clic en Guardar.

Cuando esta configuración está activada, los miembros pueden usar un entorno de Fabric para seleccionar un pool de Spark personalizado existente, ajustar los núcleos del controlador de la sesión, la memoria del controlador, los núcleos del ejecutor y la memoria del ejecutor, y crear o actualizar la configuración del pool activo. Los miembros pueden entonces guardar y publicar el entorno.

Esta configuración no permite a los miembros crear o gestionar pools personalizados de Spark en los espacios de trabajo. Un administrador de espacio de trabajo debe crear el pool de Spark personalizado subyacente.

Cuando Personalizar la configuración de cómputo para los elementos está desactivado, los entornos usan el grupo predeterminado del espacio de trabajo y su configuración de cómputo. Los miembros no podrán crear ni actualizar una configuración personalizada de un grupo en directo hasta que un administrador del espacio de trabajo active este ajuste.

Para más información sobre este control de espacio de trabajo, consulte Configuración de administración de espacios de trabajo de Ingeniería de Datos.

Crea un pool personalizado para el pool en vivo (solo para administradores)

Esta tarea requiere el rol de Administrador de Workspace. Si ya existe un pool personalizado de Spark, los miembros de workspace pueden saltarse esta tarea y configurar el cómputo en vivo del pool en el pool existente.

  1. Vaya al área de trabajo de Fabric.
  2. Seleccione Ajustes del espacio de trabajo desde la cinta de inicio del espacio de trabajo.
  3. Expanda Ingeniería de datos/Ciencia y seleccione Configuración de Spark.
  4. Seleccione la pestaña Pool.
  5. En la lista desplegable Grupo predeterminado para el área de trabajo , seleccione Nuevo grupo.
  6. Escriba un nombre para la piscina. Este nombre es un identificador único para el grupo, como dev-team-pool o prod-daily-analytics.
  7. Seleccione una familia de nodos y un tamaño de nodo para la carga de trabajo.
  8. Active la casilla Escalado automático para habilitar el escalado automático para el grupo.

Configura un grupo en vivo

Los administradores y miembros del espacio de trabajo pueden crear o actualizar una configuración de pool en vivo a través de la configuración del entorno . Para los miembros, un administrador del espacio de trabajo debe activar primero Personalizar la configuración de cómputo para los elementos. Los miembros deben seleccionar un pool personalizado de Spark existente creado por un administrador de espacio de trabajo.

  1. En tu área de trabajo de Fabric, abre el entorno que deseas adjuntar a un pool activo personalizado.

  2. En el panel izquierdo, seleccione Proceso.

  3. Seleccione el grupo que creó en el paso anterior en la lista desplegable.

  4. En Grupo en directo, seleccione el botón de radio para activar el proceso del grupo en directo para este entorno.

    Captura de pantalla que muestra el botón de radio Live pool habilitado en la configuración de cómputo del entorno.

  5. En Programación del grupo en directo, seleccione el botón de radio para encenderlo. Todos los pools personalizados deben tener un horario. Los clústeres solo se mantienen hidratados durante la ventana programada.

  6. Especifique la configuración de programación:

    • Si la programación es periódica
    • Hora y día de inicio y finalización
    • Zona horaria
    • Cuándo desactivar y reactivar el grupo
    • Otras opciones de configuración según corresponda

    Importante

    Fabric usa el aprovisionamiento estándar de Spark para la actividad fuera de la ventana programada, que tiene tiempos de inicio más lentos. Los clústeres no se mantienen calientes fuera de la ventana programada.

    Para obtener sugerencias para la programación, consulte mejores prácticas para programación.

  7. Guarde la configuración de cómputo.

  8. Seleccione el botón Publicar de la cinta de opciones superior.

Después de publicar, el grupo está activo y Fabric comienza a hidratar los clústeres antes del siguiente período de programación.

Nota:

La publicación puede tardar varios minutos.

Los cambios en el entorno requieren volver a publicar el entorno y restablecer clústeres hidratados.

Entiende la ventana de calendario

El calendario define la ventana en la que Fabric mantiene los clústeres hidratados y puede rehidratar los clústeres que ha desactivado. No mantiene la piscina viva caliente fuera de la ventana configurada.

Por ejemplo, consideremos un horario recurrente que va todos los días de 8:00 a 17:00:

  • A las 8:00 AM, comienza la ventana de horario diario y Fabric comienza o continúa con la hidratación.
  • Durante la ventana de programación, un clúster inactivo puede desactivarse tras el tiempo de espera de inactividad configurado. Fabric puede rehidratar un reemplazo según el intervalo de reactivación configurado.
  • A las 17:00 termina la ventana de horarios. Fabric deja de rehidratar clústeres desde las 17:00 hasta las 8:00 del día siguiente.
  • Un cuaderno enviado fuera de la ventana del calendario utiliza provisión estándar de Spark y no recibe el beneficio de inicio caliente en la piscina en vivo.
  • El mismo comportamiento diario se repite hasta la fecha de finalización del horario configurado.

La hora de inicio programada no garantiza que un clúster ya esté disponible en esa hora exacta. La hidratación lleva tiempo, especialmente tras una actualización del entorno o cuando Fabric debe provisionar un nuevo cluster. Si un cuaderno programado debe empezar a las 8:00 AM, inicia el horario de la piscina en directo 60-90 minutos antes. Antes de ejecutar el portátil, utiliza el centro de monitorización para confirmar que los clústeres disponibles son mayores que cero. Un cuaderno entrante recibe una sesión caliente solo cuando hay un clúster hidratado compatible disponible.

Supervisión del estado del grupo

Para comprobar el estado de tu grupo de transmisión en vivo personalizado:

  1. En el portal de Fabric, abra el centro de supervisión.

  2. Busque el entorno que publicó y seleccione los puntos suspensivos (...) para abrir el menú contextual.

  3. Seleccione Ver detalles.

    Captura de pantalla que muestra el estado del grupo en vivo en el centro de supervisión.

  4. En el panel derecho, expanda Estado en vivo del grupo para ver el estado actual del grupo.

El estado del grupo activo incluye detalles como:

  • Estado del grupo: por ejemplo, Activo, Hidratación, Inactivo o Detenido
  • Clústeres disponibles: número de clústeres listos para sesiones de notebooks
  • Clústeres ocupados: número de clústeres que ejecutan actualmente sesiones
  • Próximo horario: Ventana de actividad futura

procedimientos recomendados

Para sacar el máximo partido a los grupos activos personalizados, tenga en cuenta los siguientes procedimientos recomendados para la configuración y administración:

Optimización del costo y el rendimiento

  • Alinear el recuento con la demanda: establezca el número máximo de clústeres en función de las sesiones simultáneas esperadas. El aprovisionamiento excesivo aumenta los costos.
  • Supervisión del uso: revise periódicamente las métricas del grupo y ajuste el recuento de clústeres si es necesario.
  • Escale las programaciones de manera eficiente: evite superponer programaciones en varios grupos a menos que sea necesario.
  • Aprovechar el tiempo de espera de inactividad: establezca los tiempos de espera de inactividad adecuados para mantener un equilibrio entre la disponibilidad de los recursos y evitar los reinicios frecuentes del clúster.

Dimensionamiento de clúster

Al configurar el grupo, tenga en cuenta las siguientes opciones y recomendaciones:

  • Tamaño del clúster: el número de instancias del ejecutor para las sesiones de cuaderno (intervalo: 1-16).
  • Número máximo de clústeres: el número máximo de clústeres que se van a mantener hidratados. Se establece en función de las sesiones simultáneas esperadas.
  • Tiempo de espera de inactividad: cuánto tiempo un clúster sin usar se mantiene asignado antes de que Fabric lo elimine.
Tipo de carga de trabajo Tamaño recomendado Descripción
Análisis exploratorio 2-4 núcleos Cargas de trabajo ligeras, exploración rápida de datos
Computación media 8-12 núcleos Informes diarios, conjuntos de datos de tamaño medio
Cómputo intensivo 14-16 núcleos Conjuntos de datos grandes, transformaciones complejas

Administración de dependencias de biblioteca

  • Usar la agrupación de entornos: instale previamente bibliotecas comunes en el entorno en lugar de la instalación sobre la marcha.
  • Control de versiones del entorno: actualizar un entorno adjunto requiere volver a publicar y actualizar los clústeres hidratados.
  • Actualizar clústeres hidratados: después de que cambie el entorno, actualice el pool o espere a que el siguiente ciclo programado aplique los cambios.

Adaptarse a los patrones de carga de trabajo

  • Supervisar el comportamiento externo: Ajustar los tiempos de espera de inactividad en función de los patrones de uso reales.
  • Compartir entre sesiones: considere la posibilidad de compartir el mismo entorno entre varios grupos si tiene patrones de carga de trabajo coherentes para mejorar el uso de recursos.

Programar procedimientos recomendados

  • Alinearse con los patrones de carga de trabajo: establezca horarios activos cuando el equipo ejecute cuadernos interactivos o programados.
  • Tiempo de margen: Inicia la programación entre 60 y 90 minutos antes de la primera ejecución prevista del notebook para que la hidratación se complete.
  • Verificar disponibilidad: Antes de una ejecución programada sensible a la latencia, confirma que el pool en vivo tiene al menos un clúster disponible en el hub de Monitorización.
  • Considere las zonas horarias: si el equipo abarca varias zonas horarias, amplíe la programación para cubrir los intervalos de tiempo necesarios.

Solución de problemas

La solución de problemas de grupos dinámicos personalizados implica comprobar el estado del grupo, el estado del entorno y la configuración de programación, tal como se describe en los escenarios siguientes:

La piscina sigue sin estar disponible

Si el pool no se activa o muestra el estado "No disponible":

  • Compruebe que la capacidad de Fabric está activa y asignada actualmente al área de trabajo
  • Compruebe que el entorno adjunto está en estado "Listo".
  • Asegúrese de que el entorno adjunto está publicado y no tiene errores.

La hidratación tarda más de lo esperado

Si la hidratación es más lenta de lo esperado:

  • Compruebe las dependencias del entorno y el estado de compilación.
  • Compruebe que el entorno está en estado "Listo".
  • Consulta los detalles del grupo para obtener más información.

Las sesiones y/o cuadernos no se pueden iniciar

Si las sesiones de cuaderno no se inician incluso con un grupo activo:

  • Compruebe que la sesión usa el entorno correcto.
  • Compruebe que el pool de recursos está en estado "Disponible" y completamente preparado.

No hay opciones disponibles para la piscina en vivo

Si no puedes crear o actualizar la configuración del pool en vivo:

  • Verifica que tengas el rol de Administrador o Miembro de espacio de trabajo.
  • Si tienes el rol Miembro, pide a un administrador del espacio de trabajo que active Personalizar la configuración de proceso de los elementos.
  • Verifica que un administrador del espacio de trabajo haya creado un pool personalizado de Spark que puedas seleccionar en el entorno.