Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Important
Dieses Feature befindet sich in der Public Preview.
Genie Code hilft Ihnen, Deep-Learning-Workloads in Notebooks zu entwickeln und zu beheben, die mit AI Runtime verbunden sind. Es kann verteilten Trainingscode generieren, Umwelt- und Abhängigkeitsprobleme lösen und GPU-Workload-Ausfälle untersuchen.
Requirements
Um Genie Code mit KI-Laufzeit zu verwenden:
- Erfüllen Sie die Anforderungen an agentische Fähigkeiten des Genie-Codes.
- Haben Sie Zugang zu AI Runtime in einer Region, die beide Produkte unterstützt. Siehe KI-Laufzeitanforderungen und Genie Code Geo-Verfügbarkeit.
- Verbinden Sie ein Notebook mit der KI-Laufzeit über serverlose GPU-Compute. Siehe Connect to AI Runtime.
Erste Schritte
Öffnen Sie ein Azure Databricks-Notebook.
Verbinden Sie das Notizbuch mit AI Runtime. Siehe Connect to AI Runtime.
Öffne den Genie-Code-Fenster.
Beschreiben Sie die Arbeitsbelastung, die Sie entwickeln möchten, oder das Problem, das Sie lösen möchten.
Überprüfen Sie den vorgeschlagenen Plan, die Änderungen des Kodex und die Maßnahmen, bevor Sie sie genehmigen.
Important
Der Genie-Code kann Fehler machen. Überprüfen Sie generierten Code, Umgebungsänderungen und andere vorgeschlagene Aktionen, bevor Sie sie ausführen. Für einige Diagnosen sind zusätzliche Logs oder Kontext zur Arbeitsauslastung erforderlich.
Wozu kann Genie Code beitragen?
Entwicklung verteilter Trainingsworkloads
Genie Code kann Trainingscode für AI Runtime generieren oder aktualisieren. Es kann Ihnen helfen, eine geeignete PyTorch-verteilte Strategie auszuwählen, die @distributed API aus dem serverless_gpu Paket zu nutzen und KI-Laufzeitmuster für Datenlade, Checkpoints und MLflow-Tracking anzuwenden. API-Details und Beispiele finden Sie unter Verteiltes Training in Notebooks.
Umwelt- und Abhängigkeitsprobleme lösen
Genie Code kann die aktuelle Umgebung inspizieren, Paketkompatibilitätsfehler von Code- oder API-Änderungen unterscheiden und gezielte Korrekturen empfehlen. Es kann Ihnen auch helfen, zwischen der Databricks-KI- und Standardumgebung basierend auf den Abhängigkeiten Ihrer Arbeitslast zu wählen. Informationen zu den verfügbaren Umgebungen finden Sie unter Einrichten Ihrer Umgebung.
GPU und verteilte Workloads debuggen
Genie Code kann Notebook-Ausgabe und verfügbare Logs nutzen, um verteilte Trainingsfehler, Kommunikationsfehler, hängengebliebene Trainingsprozesse und GPU-Speicherprobleme zu untersuchen. Es kann helfen, den ursprünglichen Fehler zu identifizieren und ihn von nachgelagerten Fehlern bei anderen Rängen zu unterscheiden. Informationen zum Betrachten verteilter Trainingsprotokolle finden Sie unter Experiment-Tracking und Observabilität.
Beispiel-Prompts
Entwicklung verteilter Trainingsworkloads
- "Aktualisieren Sie dieses Notebook, um verteiltes Training auf allen acht H100-GPUs in AI Runtime auszuführen."
- Überprüfe dieses Notebook für verteiltes Training und korrigiere die Verwendung von
serverless_gpuund MLflow. - "Passe diese Trainingsarbeit für AI Runtime an und erkläre die wichtigen Änderungen."
Umwelt- und Abhängigkeitsprobleme lösen
- "Dieses Notizbuch funktioniert nicht mehr, nachdem ich ein neues Paket installiert habe. Inspizieren Sie die Umgebung und stellen Sie fest, ob das Problem ein Abhängigkeitsproblem oder eine Änderung der Code-API ist."
- "Sollte diese Arbeitslast die Databricks-KI oder die Standardumgebung verwenden? Überprüfe seine Abhängigkeiten und empfehle eine Umgebung, bevor du etwas änderst."
- "Diagnostizieren Sie diesen Paketkompatibilitätsfehler und empfehlen Sie die kleinste geeignete Änderung."
GPU und verteilte Workloads debuggen
- Analysiere diesen fehlgeschlagenen verteilten Trainingslauf anhand der verfügbaren Ausgaben aller Ränge und identifiziere die Grundursache.
- "Warum hängt diese verteilte Arbeitslast? Nutze die Ausgabe des Notizbuchs, um den nächsten Debugging-Schritt zu empfehlen."
- "Untersuche diesen GPU-Speicherausfall und empfehle einen evidenzbasierten nächsten Schritt."