Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
AI Runtime é uma oferta serverless de computação com GPU da Databricks, destinada a cargas de trabalho de aprendizagem profunda. Pode usar o AI Runtime para treinar e afinar modelos personalizados usando os seus frameworks favoritos e obter eficiência, desempenho e qualidade de última geração.
Introdução
Faça a sua primeira carga de trabalho em minutos usando os nossos guias de início rápido.
| Introdução | Description |
|---|---|
| 🚀 Databricks CLI quickstart | Vens de um cluster Slurm ou Kubernetes? Treina o tempo de execução da IA a partir do teu terminal em minutos. |
| 📓 Início rápido do notebook | Liga o teu portátil a uma GPU em segundos e desenvolve de forma interativa. |
| ⚡ Ray | Vem de um cluster de raios? Executa o Ray no AI Runtime com suporte a dashboards. |
| 🧭 Visão geral | Aprenda os pontos-chave sobre o tempo de execução da IA em dois minutos: GPUs disponíveis, como funciona e limitações. |
Funcionalidades
AI Runtime é uma plataforma GPU full-stack, com várias formas de se ligar a GPUs, ferramentas integradas de observabilidade e depuração, e ambientes pré-construídos.
Liga-te às GPUs serverless: Acede às GPUs serverless a partir de onde quer que trabalhes.
| Feature | Description |
|---|---|
| Notebooks | Anexa um notebook a recursos de computação GPU sem servidor e desenvolve interativamente, sem necessidade de configurar um cluster. |
| IDE através de SSH | Liga-te do teu IDE ou terminal através de um túnel SSH para trabalhar diretamente num nó da GPU. |
| Databricks CLI | Submeta e gere trabalhos de treino de GPU distribuídos a partir do teu portátil usando configurações de trabalhos YAML. |
| Agentes de IA | Utilize a databricks-ai-runtime competência do agente para submeter, monitorizar e gerir trabalhos de treino de GPU a partir do seu agente de IA. |
| Ray | Execute Ray Core, Ray Data, Ray Train e Ray Tune em computação sem servidor com GPU. |
Controlo de Dependências: Controle as bibliotecas de Python e do sistema que a sua carga de trabalho utiliza.
| Feature | Description |
|---|---|
| Ambientes pré-construídos | Comece a partir de um ambiente Standard mínimo ou de um ambiente de IA Databricks pré-carregado com frameworks de ML. |
Carregar dados nas GPUs: Alimente os dados de treino para as suas GPUs de forma eficiente.
| Feature | Description |
|---|---|
| Carregadores de dados eficientes | Transmita dados em fluxo a partir de volumes do Unity Catalog com mecanismos de carregamento tolerantes a falhas concebidos para uma elevada utilização da GPU. |
Depuração e Observabilidade: Acompanhar experiências, inspecionar resultados e diagnosticar falhas.
| Feature | Description |
|---|---|
| MLflow para aprendizagem profunda | Acompanha experiências, métricas e execuções com MLflow. |
| Visualizador de registos | Veja a saída do treino e monitorize a utilização dos recursos da GPU enquanto o código é executado. |
| Depuração com agentes | Usa o Genie Code para gerar código de treino, resolver problemas de ambiente e depurar falhas da GPU. |
Agendamento e serviço em tempo real: Passe do desenvolvimento interativo para trabalhos e endpoints agendados.
| Feature | Description |
|---|---|
| Programar cargas de trabalho da GPU | Implementar código de treino com Pacotes de Automação Declarativa, agendar execuções e construir fluxos de trabalho multitarefa para GPU e CPU. |
| Sirva os seus modelos | Implemente os seus modelos treinados atrás de um endpoint escalável com Model Serving. |
Examples
Clone exemplos de ponta a ponta e execute-os no AI Runtime em minutos, a partir da CLI ou em notebooks.
| Example | Description |
|---|---|
| Aprendizagem automática clássica | XGBoost acelerado por GPU, previsão zero-shot em dados tabulares e previsão de séries temporais. |
| Sistemas de recomendação | Treine modelos de recomendação de aprendizagem profunda, como arquiteturas de duas torres. |
| Visão computacional | Cargas de trabalho de deteção de objetos e classificação de imagem em GPUs. |
| Modelos OSS pós-treino (LLMs) | Efetua o ajuste fino e o pós-treino de LLMs de código aberto com LoRA, ajuste fino completo e bibliotecas como TRL, Unsloth e Axolotl. |
| Inferência em lote | Execute inferência em lote em grande escala com Ray Data e vLLM entre várias GPUs. |
| Formação distribuída com múltiplas GPUs | Dimensione o treino em múltiplas GPUs e nós com DDP, FSDP e DeepSpeed. |
Guides
Guias focados em tarefas para migrar cargas de trabalho para AI Runtime e tirar o máximo partido das suas GPUs.
| Guide | Description |
|---|---|
| Migrar de Slurm | Adapte os seus scripts batch do Slurm, lançadores distribuídos e armazenamento partilhado à CLI do Databricks. |
| Migrar cargas de trabalho clássicas da GPU | Mover uma carga de trabalho de deep learning existente de um cluster clássico Databricks para o AI Runtime. |
| Desempenho e resiliência | Melhorar o fluxo de formação e tornar os trabalhos de longa duração mais resilientes a falhas. |
Recursos adicionais
Encontre conteúdos úteis: as últimas atualizações de produtos e como o AI Runtime funciona por trás.
| Resource | Description |
|---|---|
| Atualizações de produto | Veja as últimas atualizações e anúncios de produtos AI Runtime. |
| Como funciona o AI Runtime por baixo do capot | Leia como o Databricks mantém as GPUs fiáveis ao longo do tempo de execução da IA. |