Modelos de linguagem de grande escala (LLMs)

Importante

Esse recurso está em Visualização Pública.

Esses notebooks fazem o ajuste fino e o pós-treinamento de grandes modelos de linguagem (LLMs) no AI Runtime. Eles abrangem métodos com uso eficiente de parâmetros, como Adaptação de Baixa Classificação (LoRA) e ajuste fino supervisionado completo em bibliotecas como TRL, Unsloth, Axolotl e LLM Foundry. Para exemplos de inferência em lote, veja Inferência em lote.

Tutorial Descrição
Aprendizado por reforço de Gemma4-2B Pós-treinamento do Gemma4-2B com Otimização de Política Relativa a Grupos (GRPO) e Adaptação de Baixa Classificação (LoRA) em uma única GPU H100 usando Unsloth.
Ajuste fino supervisionado (completo) de Qwen3-4B Ajuste fino completo de pesos do Qwen3-4B em uma única GPU H100 com TRL, usando precisão mista BF16 e checkpoint de gradiente.
Ajuste fino supervisionado (LoRA) do Llama-3.2-3B LoRA ajuste finamente o Llama-3.2-3B em uma única GPU com a biblioteca Unsloth.
Ajuste Fino Supervisionado (LoRA) de GPT-OSS 20B LoRA ajuste fino GPT-OSS 20B em 8 GPUs H100 com TRL e paralelismo distribuído de dados.
Ajuste Fino Supervisionado (Completo) do Llama-3.2-1B Ajuste fino completo do modelo Llama-3.2-1B usando 8 GPUs H100 com TRL e DeepSpeed ZeRO Stage 3.
Ajuste fino supervisionado (LoRA) do Olmo3 7B LoRA ajusta finamente o Olmo3 7B em várias GPUs com a biblioteca Axolotl.
Ajuste fino supervisionado (completo) e implantação do Qwen3.5-0.8B Faça o ajuste fino do Qwen3.5-0.8B em uma única GPU H100 com TRL e depois disponibilize-o por trás de um endpoint de Model Serving do vLLM.
Ajuste fino supervisionado do Llama-3.2-3B em múltiplas GPUs LoRA ajuste finamente o Llama-3.2-3B em múltiplas GPUs com a biblioteca Unsloth.
Ajuste fino supervisionado (LoRA) de GPT-OSS 120B LoRA ajuste fino GPT-OSS 120B em 8 GPUs H100 com TRL, usando DDP e FSDP.
Treinando transformers em múltiplas GPUs Treine modelos Transformer usando PyTorch Fully Sharded Data Parallel (FSDP) para dividir os parâmetros do modelo em várias GPUs.

Demonstração de vídeo

Este vídeo explica em detalhes o Ajuste Fino Supervisionado (LoRA) do caderno de exemplo Llama-3.2-3B (12 minutos).