Ambiente de Execução de IA

Importante

Este recurso está no Public Preview.

AI Runtime é uma oferta serverless de computação com GPU da Databricks, destinada a cargas de trabalho de aprendizagem profunda. Pode usar o AI Runtime para treinar e afinar modelos personalizados usando os seus frameworks favoritos e obter eficiência, desempenho e qualidade de última geração.

Introdução

Faça a sua primeira carga de trabalho em minutos usando os nossos guias de início rápido.

Introdução Description
🚀 Databricks CLI quickstart Vens de um cluster Slurm ou Kubernetes? Treina o tempo de execução da IA a partir do teu terminal em minutos.
📓 Início rápido do notebook Liga o teu portátil a uma GPU em segundos e desenvolve de forma interativa.
⚡ Ray Vem de um cluster de raios? Executa o Ray no AI Runtime com suporte a dashboards.
🧭 Visão geral Aprenda os pontos-chave sobre o tempo de execução da IA em dois minutos: GPUs disponíveis, como funciona e limitações.

Funcionalidades

AI Runtime é uma plataforma GPU full-stack, com várias formas de se ligar a GPUs, ferramentas integradas de observabilidade e depuração, e ambientes pré-construídos.

Liga-te às GPUs serverless: Acede às GPUs serverless a partir de onde quer que trabalhes.

Feature Description
Notebooks Anexa um notebook a recursos de computação GPU sem servidor e desenvolve interativamente, sem necessidade de configurar um cluster.
IDE através de SSH Liga-te do teu IDE ou terminal através de um túnel SSH para trabalhar diretamente num nó da GPU.
Databricks CLI Submeta e gere trabalhos de treino de GPU distribuídos a partir do teu portátil usando configurações de trabalhos YAML.
Agentes de IA Utilize a databricks-ai-runtime competência do agente para submeter, monitorizar e gerir trabalhos de treino de GPU a partir do seu agente de IA.
Ray Execute Ray Core, Ray Data, Ray Train e Ray Tune em computação sem servidor com GPU.

Controlo de Dependências: Controle as bibliotecas de Python e do sistema que a sua carga de trabalho utiliza.

Feature Description
Ambientes pré-construídos Comece a partir de um ambiente Standard mínimo ou de um ambiente de IA Databricks pré-carregado com frameworks de ML.

Carregar dados nas GPUs: Alimente os dados de treino para as suas GPUs de forma eficiente.

Feature Description
Carregadores de dados eficientes Transmita dados em fluxo a partir de volumes do Unity Catalog com mecanismos de carregamento tolerantes a falhas concebidos para uma elevada utilização da GPU.

Depuração e Observabilidade: Acompanhar experiências, inspecionar resultados e diagnosticar falhas.

Feature Description
MLflow para aprendizagem profunda Acompanha experiências, métricas e execuções com MLflow.
Visualizador de registos Veja a saída do treino e monitorize a utilização dos recursos da GPU enquanto o código é executado.
Depuração com agentes Usa o Genie Code para gerar código de treino, resolver problemas de ambiente e depurar falhas da GPU.

Agendamento e serviço em tempo real: Passe do desenvolvimento interativo para trabalhos e endpoints agendados.

Feature Description
Programar cargas de trabalho da GPU Implementar código de treino com Pacotes de Automação Declarativa, agendar execuções e construir fluxos de trabalho multitarefa para GPU e CPU.
Sirva os seus modelos Implemente os seus modelos treinados atrás de um endpoint escalável com Model Serving.

Examples

Clone exemplos de ponta a ponta e execute-os no AI Runtime em minutos, a partir da CLI ou em notebooks.

Example Description
Aprendizagem automática clássica XGBoost acelerado por GPU, previsão zero-shot em dados tabulares e previsão de séries temporais.
Sistemas de recomendação Treine modelos de recomendação de aprendizagem profunda, como arquiteturas de duas torres.
Visão computacional Cargas de trabalho de deteção de objetos e classificação de imagem em GPUs.
Modelos OSS pós-treino (LLMs) Efetua o ajuste fino e o pós-treino de LLMs de código aberto com LoRA, ajuste fino completo e bibliotecas como TRL, Unsloth e Axolotl.
Inferência em lote Execute inferência em lote em grande escala com Ray Data e vLLM entre várias GPUs.
Formação distribuída com múltiplas GPUs Dimensione o treino em múltiplas GPUs e nós com DDP, FSDP e DeepSpeed.

Guides

Guias focados em tarefas para migrar cargas de trabalho para AI Runtime e tirar o máximo partido das suas GPUs.

Guide Description
Migrar de Slurm Adapte os seus scripts batch do Slurm, lançadores distribuídos e armazenamento partilhado à CLI do Databricks.
Migrar cargas de trabalho clássicas da GPU Mover uma carga de trabalho de deep learning existente de um cluster clássico Databricks para o AI Runtime.
Desempenho e resiliência Melhorar o fluxo de formação e tornar os trabalhos de longa duração mais resilientes a falhas.

Recursos adicionais

Encontre conteúdos úteis: as últimas atualizações de produtos e como o AI Runtime funciona por trás.

Resource Description
Atualizações de produto Veja as últimas atualizações e anúncios de produtos AI Runtime.
Como funciona o AI Runtime por baixo do capot Leia como o Databricks mantém as GPUs fiáveis ao longo do tempo de execução da IA.