這很重要
這項功能目前處於 公開預覽版。
這些筆記本能在 AI 執行環境上微調並後期訓練大型語言模型(LLM)。 內容涵蓋參數高效方法,如低秩適應(LoRA),以及在 TRL、Unsloth、Axolotl 與 LLM Foundry 等函式庫中的完整監督式微調。 關於批次推論的範例,請參見 批次推論。
| Tutorial | 說明 |
|---|---|
| Gemma4-2B 的強化學習 | 使用 Unsloth 在單張 H100 GPU 上,以群組相對策略最佳化(Group Relative Policy Optimization,GRPO)和低秩適應(LoRA)對 Gemma4-2B 進行後續訓練。 |
| Qwen3-4B 的完整監督式微調 | 在單一 H100 GPU 上使用 TRL 對 Qwen3-4B 進行全參數微調,並採用 BF16 混合精度與梯度檢查點機制。 |
| Llama-3.2-3B 的監督式微調(LoRA) | LoRA 在單一 GPU 上以 Unsloth 函式庫微調 Llama-3.2-3B。 |
| GPT-OSS 20B 的監督式微調(LoRA) | LoRA 在 8 顆 H100 GPU 上對 20B 進行微 GPT-OSS 調,採用 TRL 與分散式資料平行。 |
| Llama-3.2-1B 的完整監督式微調 | 使用 TRL 與 DeepSpeed ZeRO 第 3 階段,在 8 張 H100 GPU 上對 Llama-3.2-1B 進行全參數微調。 |
| Olmo3 7B 的監督式微調(LoRA) | LoRA 利用 Axolotl 函式庫在多台 GPU 上微調 Olmo3 7B。 |
| Qwen3.5-0.8B 的監督式微調(完整)與提供服務 | 在單一 H100 GPU 上使用 TRL 微調 Qwen3.5-0.8B,然後將其部署在 vLLM Model Serving 端點後方提供服務。 |
| 在多個 GPU 上對 Llama-3.2-3B 進行監督式微調 | LoRA 透過 Unsloth 函式庫在多顆 GPU 上微調 Llama-3.2-3B。 |
| GPT-OSS 120B 的監督式微調(LoRA) | 在 8 張 H100 GPU 上,搭配 TRL,並使用 DDP 與 FSDP,對 GPT-OSS 120B 進行 LoRA 微調。 |
| 多GPU上的轉換器訓練 | 使用 PyTorch 全分片資料平行(FSDP)模式訓練 Transformer 模型,將模型參數分散到多個 GPU 上。 |
影片示範
這支影片會詳細示範 Llama-3.2-3B 的監督式微調(LoRA) 範例筆記本(12 分鐘)。