Inferência em lote

Importante

Este recurso está no Public Preview.

Estes notebooks executam inferência em lote à grande escala em GPUs serverless do AI Runtime. Abrangem uma variedade de modalidades, como geração de texto LLM e speech-to-text, utilizando frameworks como Ray Data, vLLM e Transformers.

Tutorial Description
Inferência em lote com Qwen2.5-32B, Ray Data e vLLM Execute inferência em lote multilíngue com oito réplicas vLLM persistentes do Qwen2.5-32B-Instruct em 8 GPUs H100 e guarde os resultados no Unity Catalog.
Conversão de fala em texto em lote com Whisper Transcreve áudio em lotes com o OpenAI Whisper large-v3-turbo em GPUs sem servidor, usando bibliotecas pré-instaladas no AI Runtime.