批次推論

Important

這項功能目前處於 公開預覽版。

這些筆記型電腦在 AI 執行時無伺服器 GPU 上執行大規模批次推論。 它們涵蓋多種類型,例如 LLM 文字生成和語音轉文本,並使用如 Ray Data、vLLM 和 Transformers 等框架。

Tutorial Description
使用 Ray Data 和 vLLM 進行 Qwen2.5-32B 批次推論 在 8 顆 H100 GPU 上執行多語言批次推論,並以八個持續存在的 Qwen2.5-32B-Instruct vLLM 副本執行,並將結果儲存到 Unity 目錄。
使用 Whisper 進行批次語音轉文字 使用 OpenAI Whisper large-v3-turbo 在無伺服器 GPU 上批量轉錄音訊,並使用預載於 AI Runtime 中的函式庫。