Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
Esse recurso está em Beta.
Esses notebooks permitem escalar o treinamento de modelos em várias GPUs e nós no AI Runtime. Elas abrangem as três principais técnicas de paralelismo, DDP, FSDP e DeepSpeed ZeRO, usando a API serverless_gpu Python em GPUs H100.
Observação
Há suporte para treinamento distribuído de várias GPUs em GPUs H100.
Escolha sua técnica de paralelismo
Escolha uma técnica de paralelismo baseada no tamanho do seu modelo, memória disponível da GPU e requisitos de desempenho. A tabela a seguir compara as opções.
| Técnica | Quando usar |
|---|---|
| DDP (Dados Distribuídos Paralelos) | O modelo completo se encaixa na memória de GPU única; precisa dimensionar a taxa de transferência de dados |
| FSDP (Fully Sharded Data Parallel) | Modelos muito grandes que não se encaixam na memória de GPU única |
| DeepSpeed ZeRO | Modelos grandes com necessidades avançadas de otimização de memória |
Para obter informações detalhadas sobre cada técnica, consulte DDP, FSDP e DeepSpeed.
Para conselhos e padrões que tornem seu pipeline de treinamento mais eficiente e resiliente, consulte o guia de desempenho e resiliência.
Exemplo de notebooks por técnica e estrutura
A tabela a seguir organiza blocos de anotações de exemplo pela estrutura/biblioteca que você está usando e a técnica de paralelismo aplicada. Vários blocos de anotações podem aparecer em uma única célula.
| Estrutura/Biblioteca | Exemplos de DDP | Exemplos de FSDP | Exemplos de DeepSpeed |
|---|---|---|---|
| PyTorch (nativo) |
Rede neural MLP simples Detecção de imagens RetinaNet |
Transformador de parâmetro de 10M | — |
| Huggingface TRL | Aperfeiçoar o GPT OSS 20B | Ajuste fino do GPT OSS 120B | Ajuste fino do Llama 3.2 1B |
| Unsloth | Ajuste fino do Llama 3.2 3B | — | — |
| Axolotl | Ajuste fino do Olmo3 7B | — | — |
| Relâmpago | Sistema de recomendação de duas torres | — | — |
Introdução
Use os tutoriais a seguir para começar a usar a biblioteca Python de GPU sem servidor para treinamento distribuído:
| Tutorial | Descrição |
|---|---|
| Runtime de IA com GPUs H100 | Saiba como usar o Databricks AI Runtime com aceleradores H100 para executar cargas de trabalho de GPU distribuídas usando a biblioteca serverless_gpu Python. |