Inferência em lote

Importante

Esse recurso está em Visualização Pública.

Esses notebooks executam inferência em lote em larga escala nas GPUs serverless do AI Runtime. Eles abrangem uma variedade de modalidades, como geração de texto em LLM e fala para texto, utilizando frameworks como Ray Data, vLLM e Transformers.

Tutorial Description
Inferência em lote Qwen2.5-32B com Ray Data e vLLM Execute inferência em lote multilíngue com oito réplicas vLLM persistentes do Qwen2.5-32B-Instruct em 8 GPUs H100 e salve os resultados no Unity Catalog.
Conversão de fala em texto em lote com Whisper Transcreva áudio em lotes com o OpenAI Whisper large-v3-turbo em GPUs serverless, usando bibliotecas pré-instaladas no AI Runtime.