Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
Esse recurso está em Visualização Pública.
Note
Esta página cobre Ray no AI Runtime. Se você estiver usando o Ray na computação clássica do Databricks com o Databricks Runtime ML, consulte Ray no Databricks.
Ray é um framework código aberto para escalar cargas de trabalho em Python. Você pode criar clusters Ray e rodar aplicações Ray em tempo de execução de IA, usando computação de GPU serverless que gerencia automaticamente o provisionamento da infraestrutura.
A CLI do AI Runtime oferece suporte ao Ray em configurações de nó único e de vários nós. Inclua um script de inicialização no command da carga de trabalho, que inicia o cluster Ray e coordena os nós principais e de trabalho quando a carga de trabalho é iniciado. Os exemplos do Hello World do Ray passam por esse padrão.
O AI Runtime suporta as bibliotecas principais do Ray, incluindo Ray Core, Ray Data, Ray Train e Ray Tune. Instale a biblioteca ray ou o Ray extra relevante (ray[data], ray[train], ray[tune]) como uma dependência para sua carga de trabalho no ambiente Databricks padrão. Se você usa o ambiente de IA da Databricks, ray vem pré-instalado, mas os extras devem ser instalados separadamente.
Examples
| Example | Description |
|---|---|
| Exemplos de Hello World (CLI) do Ray | Exemplos mínimos de nó único e vários nós para Ray Core, Ray Train, Ray Data e Ray Tune, incluindo o padrão de Bootstrap do cluster. |
| Treinamento distribuído com Ray Train (CLI) | Ajuste um grande modelo de linguagem em múltiplos nós usando Ray Train e PyTorch. |
| Inferência em lote com Ray Data e vLLM (CLI) | Execute inferência em lote em grande escala usando Ray Data para carregamento distribuído de dados e vLLM para servir modelos de forma eficiente. |
| Busca por hiperparâmetros com Ray Tune (CLI) | Busque hiperparâmetros de ajuste fino do LoRA para o Qwen2.5 com o Ray Tune, executando um experimento por GPU e interrompendo antecipadamente os experimentos com baixo desempenho usando o agendador ASHA. |