Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
AI Runtime é uma solução de computação da Databricks destinada a cargas de trabalho de aprendizagem profunda e oferece suporte para GPU no Databricks Serverless. Pode usar o AI Runtime para treinar e afinar modelos personalizados usando os seus frameworks favoritos e obter eficiência, desempenho e qualidade de última geração. Para uma visão geral de como a computação serverless se integra na arquitetura Databricks, veja Arquitetura de workspace serverless.
Principais características
O AI Runtime combina a infraestrutura de GPU gerida com um runtime construído para deep learning:
- Infraestrutura de GPU totalmente gerida: Serverless, acesso flexível às GPUs e sem configuração de cluster, seleção de drivers ou políticas de autoscaling para gerir.
- Um tempo de execução dedicado à aprendizagem profunda: Escolha um ambiente Standard mínimo para máxima flexibilidade em relação às dependências ou um ambiente de IA completo pré-equipado com frameworks populares de ML.
- Integrado nativamente entre notebooks, jobs, Unity Catalog e MLflow para desenvolvimento fluido, acesso a dados e rastreio de experiências.
Opções de hardware
Todos os aceleradores de tempo de execução de IA fornecem um único nó. O número de GPUs nesse nó depende do tipo de acelerador:
| Acelerador | GPUs por nó | Memória GPU | Melhor para | Formação distribuída |
|---|---|---|---|---|
| 1xA10 | 1 | 24 GB | Tarefas pequenas a médias de ML e aprendizagem profunda, como modelos clássicos de ML ou ajuste fino de modelos de linguagem mais pequenos | Não suportado (GPU única) |
| 1xH100 | 1 | 80 GB | Cargas de trabalho que necessitam de mais memória de GPU do que a fornecida por 1xA10, mas que não requerem treino distribuído em várias GPUs, como o ajuste fino de modelos de linguagem de tamanho médio | Não suportado (GPU única) |
| 8xH100 | 8 | 80 GB por GPU | Cargas de trabalho em IA em grande escala, incluindo treino ou ajuste fino de modelos massivos ou execução de tarefas avançadas de aprendizagem profunda | Suportado através do uso do decorador @distributed com gpus=8 |
Gorjeta
Apenas 8xH100 suporta treino distribuído com múltiplas GPUs. Para cargas de trabalho com GPU única, escolha 1xA10 ou 1xH100 consoante a memória GPU que o seu modelo precisa.
Casos de uso recomendados
A Databricks recomenda AI Runtime para quaisquer casos de uso de treino de modelos personalizados que envolvam deep learning, cargas de trabalho clássicas de grande escala ou GPUs.
Por exemplo:
- Ajuste fino de LLM (LoRA, QLoRA, ajuste fino completo)
- Visão computacional (deteção de objetos, classificação de imagem)
- Sistemas de recomendação baseados em aprendizagem profunda
- Aprendizagem por reforço
- Previsão de séries cronológicas baseada em aprendizagem profunda
Requerimentos
Antes de começar, confirme que o seu espaço de trabalho cumpre estes requisitos:
- Verifique a disponibilidade do AI Runtime por Geo para Geos suportados e requisitos de processamento entre Geos. A disponibilidade da GPU varia consoante o espaço de trabalho.
- Um administrador de espaço de trabalho deve ativar a pré-visualização do AI Runtime nas definições do espaço de trabalho. Consulte Gerir pré-visualizações do Databricks.
Limitations
Tenha em mente as seguintes limitações ao planear uma carga de trabalho em tempo de execução de IA:
- O AI Runtime só suporta aceleradores A10 e H100.
- O AI Runtime não suporta o perfil de segurança de conformidade para as normas FedRAMP High ou DoD IL5.
- Adicionar dependências usando o Environments não é suportado para trabalhos agendados no AI Runtime. Instala as dependências programaticamente usando
%pip installno teu notebook em vez disso. - Para trabalhos agendados no AI Runtime, o comportamento de recuperação automática para versões de pacotes incompatíveis associadas ao seu portátil não é suportado.
- As tentativas de ligação ao AI Runtime expiram após 15 minutos para notebooks interativos e após 24 horas para jobs de notebook ou da CLI. As sessões de notebook e os trabalhos de notebook com ligação podem ser executados durante até dois dias, e os trabalhos de CLI podem ser executados durante até 14 dias. Para tarefas de treino de modelos de longa duração, implemente a criação de pontos de controlo e reinicie a tarefa quando o tempo máximo de execução for atingido.
- O AI Runtime fornece acesso sob demanda aos recursos da GPU. Embora isto conduza a um acesso fácil e flexível às GPUs, pode haver períodos em que a capacidade é limitada ou indisponível na sua região.
- O AI Runtime aproveita GPUs multi-região em certos casos durante momentos de alta procura. Podem existir custos de saída associados a tal utilização, e a conectividade de rede entre regiões pode ser limitada em determinados momentos.
Conectar ao Ambiente de Execução de IA
Pode ligar-se ao AI Runtime interativamente a partir de notebooks, um terminal IDE usando um túnel SSH, trabalhos agendados, a API Jobs e Declarative Automation Bundles. Para obter instruções passo a passo, consulte Ligar-se ao runtime de IA a partir de um notebook.
Configurar ambiente
O AI Runtime oferece dois ambientes Python geridos: um ambiente Standard mínimo e um ambiente de IA Databricks completo, pré-carregado com frameworks populares de ML como PyTorch e Transformers. Para detalhes sobre a escolha de um ambiente, comportamento de cache, importação de módulos personalizados e limitações conhecidas, veja Configurar o seu ambiente.
Gorjeta
Escolha o ambiente Standard para controlo total sobre a sua pilha de dependências, ou o ambiente Databricks AI para não ter de instalar frameworks comuns como PyTorch e Transformers.
Carregar dados no ambiente de execução da IA
Compreender como funciona o acesso a dados no AI Runtime é essencial para uma experiência fluida. Para detalhes, consulte Carregar dados no Runtime de IA.
Formação distribuída
O AI Runtime suporta treino distribuído entre múltiplas GPUs no único nó a que o seu portátil está ligado. Utilizando o decorador @distributed da API Python serverless_gpu, pode executar cargas de trabalho com várias GPUs com PyTorch DDP, FSDP ou DeepSpeed com uma configuração mínima. Para mais detalhes, consulte Formação distribuída em cadernos.
Gorjeta
Valida a tua carga de trabalho numa única GPU antes de escalar para 8xH100 com o decorador @distributed.
Ray em ambiente de execução de IA
O AI Runtime suporta o Ray para cargas de trabalho distribuídas da GPU, incluindo Ray Core, Ray Data, Ray Train e Ray Tune. Pode executar tarefas Ray de nó único e multinó em computação serverless com GPU, sem necessidade de configurar um cluster. Para detalhes e exemplos, veja Ray on AI Runtime.
Rastreio e observabilidade de experimentos
Para integração com MLflow, visualização de registos e monitorização da GPU, consulte Rastreio de experiências e observabilidade. Para checkpointing de modelos, veja Melhorar o desempenho do treino e a resiliência no AI Runtime.
Colocar as cargas de trabalho de treino em produção
Implemente uma carga de trabalho em tempo de execução de IA com Pacotes de Automação Declarativa para executar o seu próprio código de treino, crie trabalhos multitarefa que combinem tarefas de GPU e CPU, agende pipelines e promova do desenvolvimento para a produção. Consulte Agendar cargas de trabalho da GPU e compor tarefas.
Código Genie para aprendizagem profunda
O Genie Code pode ajudar a desenvolver e resolver problemas com cargas de trabalho de aprendizagem profunda em AI Runtime. Pode gerar código de treino distribuído, resolver problemas de ambiente e dependências, e investigar falhas de GPU e cargas de trabalho distribuídas. Consulte Utilizar código Genie com ambiente de execução de IA.
Guides
Para migração de cargas de trabalho clássicas, notebooks de exemplo e resolução de problemas, consulte os guias de utilizador para IA Runtime. Para migrar uma carga de trabalho de treino existente no Slurm para o AI Runtime, consulte Migrar do Slurm.