大型語言模型 (LLM)

這很重要

這項功能目前處於 公開預覽版。

這些筆記本能在 AI 執行環境上微調並後期訓練大型語言模型(LLM)。 內容涵蓋參數高效方法,如低秩適應(LoRA),以及在 TRL、Unsloth、Axolotl 與 LLM Foundry 等函式庫中的完整監督式微調。 關於批次推論的範例,請參見 批次推論。

Tutorial 說明
Gemma4-2B 的強化學習 使用 Unsloth 在單張 H100 GPU 上,以群組相對策略最佳化(Group Relative Policy Optimization,GRPO)和低秩適應(LoRA)對 Gemma4-2B 進行後續訓練。
Qwen3-4B 的完整監督式微調 在單一 H100 GPU 上使用 TRL 對 Qwen3-4B 進行全參數微調,並採用 BF16 混合精度與梯度檢查點機制。
Llama-3.2-3B 的監督式微調(LoRA) LoRA 在單一 GPU 上以 Unsloth 函式庫微調 Llama-3.2-3B。
GPT-OSS 20B 的監督式微調(LoRA) LoRA 在 8 顆 H100 GPU 上對 20B 進行微 GPT-OSS 調,採用 TRL 與分散式資料平行。
Llama-3.2-1B 的完整監督式微調 使用 TRL 與 DeepSpeed ZeRO 第 3 階段,在 8 張 H100 GPU 上對 Llama-3.2-1B 進行全參數微調。
Olmo3 7B 的監督式微調(LoRA) LoRA 利用 Axolotl 函式庫在多台 GPU 上微調 Olmo3 7B。
Qwen3.5-0.8B 的監督式微調(完整)與提供服務 在單一 H100 GPU 上使用 TRL 微調 Qwen3.5-0.8B,然後將其部署在 vLLM Model Serving 端點後方提供服務。
在多個 GPU 上對 Llama-3.2-3B 進行監督式微調 LoRA 透過 Unsloth 函式庫在多顆 GPU 上微調 Llama-3.2-3B。
GPT-OSS 120B 的監督式微調(LoRA) 在 8 張 H100 GPU 上,搭配 TRL,並使用 DDP 與 FSDP,對 GPT-OSS 120B 進行 LoRA 微調。
多GPU上的轉換器訓練 使用 PyTorch 全分片資料平行(FSDP)模式訓練 Transformer 模型,將模型參數分散到多個 GPU 上。

影片示範

這支影片會詳細示範 Llama-3.2-3B 的監督式微調(LoRA) 範例筆記本(12 分鐘)。