Important
這項功能目前處於 公開預覽版。
這些筆記型電腦在 AI 執行時無伺服器 GPU 上執行大規模批次推論。 它們涵蓋多種類型,例如 LLM 文字生成和語音轉文本,並使用如 Ray Data、vLLM 和 Transformers 等框架。
| Tutorial | Description |
|---|---|
| 使用 Ray Data 和 vLLM 進行 Qwen2.5-32B 批次推論 | 在 8 顆 H100 GPU 上執行多語言批次推論,並以八個持續存在的 Qwen2.5-32B-Instruct vLLM 副本執行,並將結果儲存到 Unity 目錄。 |
| 使用 Whisper 進行批次語音轉文字 | 使用 OpenAI Whisper large-v3-turbo 在無伺服器 GPU 上批量轉錄音訊,並使用預載於 AI Runtime 中的函式庫。 |