Usa Genie Code con AI Runtime

Importante

Esta característica está en versión preliminar pública.

Genie Code te ayuda a desarrollar y solucionar cargas de trabajo de aprendizaje profundo en portátiles conectados a AI Runtime. Puede generar código de entrenamiento distribuido, resolver problemas de entorno y dependencias, e investigar fallos en la carga de trabajo de la GPU.

Genie Code crea y ejecuta una carga de trabajo de entrenamiento CNN distribuida a través de ocho GPUs H100 en un portátil de IA Runtime.

Requirements

Para usar Genie Code con tiempo de ejecución de IA:

Get started

  1. Abre un notebook de Azure Databricks.

  2. Conecta el portátil a AI Runtime. Consulte Conectarse al entorno de ejecución de IA.

  3. Abre el panel del Código Genio.

  4. Describe la carga de trabajo que quieres desarrollar o el problema que quieres resolver.

  5. Revisa el plan propuesto, los cambios en el código y las acciones antes de aprobarlos.

    Importante

    El Código Genio puede cometer errores. Revisa el código generado, los cambios en el entorno y otras acciones propuestas antes de ejecutarlos. Algunos diagnósticos requieren registros adicionales o contexto de carga de trabajo.

¿Con qué puede ayudar Genie Code?

Desarrollar cargas de trabajo de entrenamiento distribuidas

Genie Code puede generar o actualizar código de entrenamiento para el tiempo de ejecución de IA. Puede ayudarte a seleccionar una estrategia distribuida adecuada para PyTorch, usar la @distributed API del serverless_gpu paquete y aplicar patrones de IA Runtime para carga de datos, checkpointing y seguimiento de MLflow. Para detalles y ejemplos de API, véase Entrenamiento distribuido en cuadernos.

Resolver problemas de entorno y dependencias

Genie Code puede inspeccionar el entorno actual, distinguir fallos de compatibilidad de paquetes de cambios en código o API, y recomendar correcciones específicas. También puede ayudarte a elegir entre los entornos de IA de Databricks y Standard según las dependencias de tu carga de trabajo. Para información sobre los entornos disponibles, consulta Configurar tu entorno.

Depurar cargas de trabajo de GPU y cargas de trabajo distribuidas

Genie Code puede utilizar la salida del portátil y los registros disponibles para investigar fallos en el entrenamiento distribuido, errores de comunicación, bloqueos de entrenamiento y problemas de memoria de la GPU. Puede ayudar a identificar la falla original y distinguirla de errores posteriores en otros rangos. Para información sobre cómo ver registros de entrenamiento distribuidos, consulte Seguimiento y observabilidad de experimentos.

Ejemplos de indicaciones

Desarrollar cargas de trabajo de entrenamiento distribuidas

  • Actualiza este cuaderno para ejecutar entrenamiento distribuido en las ocho GPU H100 en AI Runtime.
  • Revisa este cuaderno de entrenamiento distribuido y corrige el uso de serverless_gpu y MLflow.
  • "Adapta esta carga de entrenamiento para el tiempo de ejecución de IA y explica los cambios importantes."

Resolver problemas de entorno y dependencias

  • "Este cuaderno dejó de funcionar después de instalar un nuevo paquete. Inspecciona el entorno y determina si el problema es una cuestión de dependencia o un cambio en la API de código."
  • "¿Debería esta carga de trabajo usar la IA de Databricks o el entorno Estándar? Revisa sus dependencias y recomienda un entorno antes de cambiar nada."
  • "Diagnostica este error de compatibilidad del paquete y recomienda el cambio más pequeño y apropiado."

Depurar cargas de trabajo de GPU y distribuidas

  • "Analiza esta ejecución fallida de entrenamiento distribuido usando la salida disponible de cada rango e identifica la causa raíz."
  • "¿Por qué está colgada esta carga de trabajo distribuida? Usa la salida del cuaderno para recomendar el siguiente paso de depuración."
  • "Investiga este fallo de memoria de la GPU y recomienda un siguiente paso basado en la evidencia."

Recursos adicionales