Modelos linguísticos de grande dimensão (LLM)

Importante

Este recurso está no Public Preview.

Estes cadernos afinam e treinam modelos de linguagem grandes (LLMs) em tempo de execução de IA. Abrangem métodos eficientes ao nível dos parâmetros, como Low-Rank Adaptation (LoRA), e afinação supervisionada completa, abrangendo bibliotecas como TRL, Unsloth, Axolotl e LLM Foundry. Para exemplos de inferência em lote, veja Inferência em lote.

Tutorial Descrição
Aprendizagem por reforço de Gemma4-2B Faça o pós-treino do Gemma4-2B com Otimização Relativa de Política em Grupo (GRPO) e Adaptação de Baixa Classificação (LoRA) numa única GPU H100 usando o Unsloth.
Afinação fina supervisionada (completa) de Qwen3-4B Ajuste fino de todos os pesos do Qwen3-4B numa única GPU H100 com TRL, usando precisão mista BF16 e checkpointing de gradiente.
Ajuste fino supervisionado (LoRA) do Llama-3.2-3B LoRA ajusta finamente o Llama-3.2-3B numa única GPU com a biblioteca Unsloth.
Ajuste Fino Supervisionado (LoRA) de GPT-OSS 20B LoRA ajustou GPT-OSS 20B em 8 GPUs H100 com TRL e paralelismo de dados distribuídos.
Ajuste Fino Supervisionado (Completo) do Llama-3.2-1B Afinação completa do Llama-3.2-1B em 8 GPUs H100 com TRL e DeepSpeed ZeRO Stage 3.
Ajuste fino supervisionado (LoRA) do Olmo3 7B LoRA afina o Olmo3 7B em várias GPUs com a biblioteca Axolotl.
Afinação fina supervisionada (Completa) e disponibilização de Qwen3.5-0.8B Ajusta finamente o Qwen3.5-0.8B numa única GPU H100 com TRL e, em seguida, disponibiliza-o através de um endpoint de Model Serving do vLLM.
Afinação supervisionada do Llama-3.2-3B em múltiplas GPUs LoRA afina o Llama-3.2-3B em várias GPUs com a biblioteca Unsloth.
Ajuste fino supervisionado (LoRA) do GPT-OSS 120B O LoRA ajusta GPT-OSS 120B em 8 GPUs H100 com TRL, usando DDP e FSDP.
Treinar transformadores em várias GPUs Treine modelos Transformer usando o Fully Sharded Data Parallel (FSDP) do PyTorch para fragmentar os parâmetros do modelo por várias GPUs.

Demonstração em vídeo

Este vídeo percorre em detalhe o Ajuste Fino Supervisionado (LoRA) do caderno de exemplo Llama-3.2-3B (12 minutos).