Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Viktigt!
Databricks CLI-kommandon för AI Runtime finns i Public Preview. En workspace-administratör måste aktivera AI Runtime-förhandsvisningen innan du kan skicka in arbetsbelastningar. Se Krav.
CLI:n databricks air kör GPU-arbetsbelastningar med både en nod och flera noder på AI Runtime, den serverlösa GPU-beräkningsplattformen på begäran. Definiera en arbetsbelastnings beräkningsresurser, miljö och kommando i YAML, och skicka sedan in det med databricks air run.
AI Runtime hanterar GPU-provisionering och miljöuppsättning samt tillhandahåller körstatus, loggar, systemmetrik och MLflow-spårning. YAML- och CLI-arbetsflödet fungerar naturligt med kodagenter, som kan definiera, skicka in och övervaka arbetsbelastningar.
Använd CLI för att:
- Utveckla och iterera på Python-applikationer från din lokala miljö.
- Definiera upprepbara arbetsbelastningar med en nod eller flera noder i YAML-filer som du kan versionsstyra.
- Skicka och hantera arbetslaster från en terminal eller från ett automatiserat utvecklingsarbetsflöde.
Typiska arbetsbelastningar inkluderar LLM-finjustering och efterträning, distribuerad träning, batchinferens, ray-applikationer och hyperparametersökning.
Följ snabbstart för att skicka in en workload.
Databricks CLI-kommandon för AI Runtime uppfyller samma efterlevnadsstandarder som AI Runtime-arbetsbelastningar. De standarder och undantag som stöds finns i säkerhetsprofilen för efterlevnad.
Note
Kommandon databricks air och arbetslastkonfigurationen skiljer sig från den äldre Python-baserade air CLI:n i paketet databricks-air. Se Python CLI-migrering.
Hur en arbetslast körs
Du tillhandahåller en YAML-fil för arbetsbelastningen, applikationskod vid behov och kommandot som startar din applikation. När du skickar in en arbetslast:
- Arbetsbelastningsdefinitionen valideras mot det stödda schemat och konfigurationsbegränsningarna.
- Om
code_sourceär konfigurerat paketeras den valda koden som en snapshot och laddas upp. - Den begärda GPU-beräkningsresursen och miljön förbereds på varje nod.
- Kommandot som tillhandahålls i arbetsbelastningen YAML körs på varje nod.
Inskickningen returnerar ett Job Run-ID som identifierar arbetsbelastningen. Använd den för att kontrollera status, granska loggar och konfiguration, eller avbryta arbetsbelastningen. Du kan också se sidan för jobbkörning och MLflow-experimentet för exekveringsdetaljer, systemmetrik, loggar och artefakter.
Detta arbetsflöde erbjuder hanterad GPU-provisionering, reproducerbar miljöuppsättning och inbyggd observabilitet utan att du behöver konfigurera eller underhålla GPU-infrastrukturen.
Konfiguration av arbetsbelastning
En workload-YAML-fil beskriver följande komponenter:
- Experiment: MLflow-experimentet och körningen som spårar arbetsbelastningen.
- Miljö: Den hanterade miljön, beroenden eller anpassad Docker-image att använda.
- Compute: Acceleratortypen och antalet acceleratorer som ska provisioneras.
- Kodkälla: En valfri ögonblicksbild av applikationskoden som görs tillgänglig för workloaden.
- Kommando: Shellkommandot som startar din applikation.
- Körningsinställningar: Alternativ som försök igen, tidsgränser, miljövariabler, hemligheter och behörigheter.
För konfigurationsfält och exempel, se Workload YAML-referensen.
Ladda upp applikationskod
Använd code_source för att ladda upp applikationsfiler för en arbetsbelastning. AI Runtime gör den uppladdade katalogen tillgänglig på varje nod och anger $CODE_SOURCE_PATH till dess plats. Till exempel kör följande kommando train.py från den uppladdade katalogen:
command: python "$CODE_SOURCE_PATH/train.py"
Du kan ladda upp det aktuella arbetsträdet eller välja en Git-gren eller commit. För ett komplett exempel, se quickstart.
Utveckla och hantera arbetslaster
Utveckling följer vanligtvis denna process:
- Utveckla applikationskoden och workload-YAML lokalt.
- Validera YAML lokalt med
databricks air run --file <file> --dry-run. - Skicka arbetsbelastningen med
databricks air run --file <file>. Lägg till--watchi strömloggarna tills körningen är klar. - Använd
databricks air get,databricks air list, ochdatabricks air logsför att inspektera arbetsbelastningar och loggar. - Du kan också stoppa en workload som körs med
databricks air cancel.
För alla kommandon och flaggor, se air kommandogruppen.
För schemalagda körningar, multitask-arbetsflöden eller flyttning mellan miljöer kan du använda databricks air convert-to-dabs som utgångspunkt för en bundle. Se Schemalägg GPU-arbetsbelastningar och skapa uppgifter.
Spåra arbetsflöden med MLflow
Varje inskickad arbetsbelastning representeras av en körning av ett Databricks-jobb och spåras genom ett MLflow-experiment:
- Databricks jobbkörning: Visar arbetsbelastningsstatus, exekveringsförsök och utdata på sidan för jobbkörning.
- MLflow-experimentet: Innehåller MLflow-körningar med automatiskt infångade systemmetrik, arbetsbelastningskonfiguration och loggar. Din applikation kan också använda MLflow-API:erna för att logga anpassade parametrar, mätvärden och artefakter.
Använd Job Run-ID:t med kommandon som databricks air get, databricks air logs, och databricks air cancel. För mer information om spårning och observerbarhet, se Spåra körningar med MLflow och sidan Jobbkörning.
Kör arbetsbelastningar på en nod och distribuerade arbetsbelastningar
AI Runtime kör det konfigurerade kommandot en gång på varje provisionerad nod. För en distribuerad arbetsbelastning tillhandahåller den koordinationsvariabler såsom NUM_NODES, , NODE_RANK, LOCAL_WORLD_SIZE, MASTER_ADDRoch MASTER_PORT.
Denna exekveringsmodell är ramverksoberoende. Ditt kommando måste starta och konfigurera det distribuerade ramverket, till exempel genom att anropa torchrun, ett Ray-bootstrap-skript eller en annan ramverkslauncher. För exempel, se Databricks CLI-exempel för AI Runtime.
Använd en AI-agent
databricks-ai-runtime agentfärdigheten ger instruktioner som hjälper AI-agenter, såsom Claude Code, Cursor och Codex, att arbeta med AI Runtime via Databricks CLI. Använd den för att skapa arbetsbelastnings-YAML, skicka in GPU-träningsjobb, kontrollera körstatus, strömma loggar och avbryta körningar. Den innehåller också vägledning för anpassade Docker-bilder.
Efter att ha installerat Databricks CLI och konfigurerat autentisering, kör följande kommando:
databricks aitools install --skills-only --skills databricks-ai-runtime --experimental
Följ instruktionerna för att välja din AI-agent och installationsomfång. För installationsalternativ, se aitools kommandogruppen.