Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Microsoft Foundry Models es el centro para detectar e implementar una amplia gama de modelos de inteligencia artificial para aplicaciones de IA generativas. Para que un modelo esté disponible para las solicitudes de inferencia, debes implementarlo. Foundry ofrece dos opciones de implementación en función del tipo de modelo y sus necesidades de infraestructura.
Sugerencia
No siempre es necesario crear un despliegue. Con el acceso instantáneo (versión preliminar), llame a los modelos admitidos por su nombre y empiece a ejecutar la inferencia inmediatamente, sin necesidad de implementación.
Opciones de implementación
Foundry proporciona dos opciones de implementación:
- API sin servidor — Para Modelos de Foundry, incluidos Modelos de Foundry vendidos por Azure y algunos Modelos de socios y de la comunidad. Esta opción es la ruta de implementación preferida y más capaz. Incluye los tipos de implementación estándar, de rendimiento aprovisionado, por lotes y para desarrolladores.
- Proceso administrada (versión preliminar) — Para modelos de código abierto, de socios y personalizados que se ejecutan en capacidad de GPU dedicada que Foundry administra por ti.
Foundry selecciona la opción de implementación adecuada en función del modelo que elija.
Si solo necesita probar un modelo compatible, puede omitir la implementación por completo y usar el acceso instantáneo (versión preliminar), que llama a los modelos por nombre sin crear una API sin servidor o una implementación de proceso administrada.
Para obtener una comparación completa de funcionalidades, consulte Comparación de opciones de implementación.
API sin servidor
La API sin servidor es la opción de implementación preferida en Foundry. Admite la gama más amplia de funcionalidades y tipos de implementación.
¿Qué modelos usan implementaciones de API sin servidor?
Todos los modelos de Foundry, incluidos los modelos de Foundry vendidos por Azure y una selección de modelos de partners y de la comunidad, usan implementaciones de API sin servidor. Los modelos de Foundry comercializados por Azure incluyen todos los modelos de Azure OpenAI y determinados modelos de los principales proveedores, que se facturan a través de su suscripción de Azure, están cubiertos por los acuerdos de nivel de servicio de Azure y cuentan con el respaldo de Microsoft. Los modelos de asociados y comunidad que usan implementaciones de API sin servidor incluyen modelos Anthropic y modelos específicos de asociados como Mistral, Cohere y Meta.
Funcionalidades de API sin servidor
Las implementaciones de API sin servidor admiten:
- Varios tipos de implementación (o SKU de implementación): estándar global, estándar de zona de datos, estándar (región única), aprovisionado, por lotes, etc. Cada tipo controla dónde se procesan los datos y cómo se paga. Para obtener más información, consulte Tipos de implementación para modelos de Microsoft Foundry.
- Flexibilidad de procesamiento de datos : elija regional, zona de datos (EE. UU., UE o APAC) o procesamiento global en función de sus requisitos de cumplimiento.
- Filtrado de contenido : filtros integrados de seguridad de contenido de Azure AI con configuraciones personalizables.
- Autenticación sin claves : Id. de Microsoft Entra (recomendado) y autenticación basada en claves.
- Redes privadas : integración de red virtual para el acceso seguro.
- Rendimiento aprovisionado : reserve la capacidad con unidades de rendimiento aprovisionadas (PTU) para un rendimiento predecible y de baja latencia. Para obtener detalles, consulte Rendimiento aprovisionado.
Requisitos de recursos
Las implementaciones de API sin servidor están disponibles en:
- Recursos de Foundry — El tipo de recurso principal para los nuevos proyectos de Foundry. No se requiere ningún centro de INTELIGENCIA ARTIFICIAL.
- Recursos de Azure OpenAI : si usa recursos de Azure OpenAI, el catálogo de modelos muestra solo los modelos de Azure OpenAI para la implementación. Actualice a un recurso de Foundry para acceder al conjunto completo de Modelos de Foundry.
Para empezar a trabajar con la implementación de API sin servidor, consulte Implementación de modelos de Microsoft Foundry en el portal de Foundry o Implementación de modelos mediante CLI de Azure y Bicep.
Implementación de cómputo administrado (versión preliminar)
Note
La capacidad de proceso administrada de Foundry se encuentra actualmente en versión preliminar pública. Esta versión preliminar se ofrece sin acuerdo de nivel de servicio y no se recomienda para las cargas de trabajo de producción. Es posible que algunas características no se admitan o que tengan funcionalidades restringidas. Para más información, consulte Términos de uso complementarios para las versiones preliminares de Microsoft Azure.
El proceso administrado en Foundry (versión preliminar) es una plataforma como servicio (PaaS) de GPU administrada que hospeda modelos de código abierto y con ponderaciones personalizadas sobre capacidad dedicada de GPU. Puede acceder a las implementaciones de computación administradas a través del mismo endpoint del proyecto de Foundry que el de otros tipos de implementación, sin máquinas virtuales, clústeres ni entornos de ejecución de servicio que gestionar. Foundry dimensiona el despliegue, aprovisiona los aceleradores y mantiene el entorno de ejecución actualizado con los parches.
Importante
El cómputo administrado admite modelos de código abierto, de socios, del sector y personalizados. Las implementaciones administradas de cómputo se ofrecen a través del punto de conexión unificado del proyecto Foundry, con la misma autenticación, red e interfaz del SDK.
¿Qué modelos utilizan recursos computacionales gestionados?
Puedes implementar modelos de la colección de Hugging Face utilizando la proceso administrada. Algunos ejemplos son:
- Modelos de Qwen
- Modelos de NVIDIA Nemotron
- Modelos meta seleccionados
- Modelos mistrales seleccionados
El catálogo de Microsoft Foundry incluye una amplia y cada vez mayor selección de modelos de código abierto y de socios. Para el catálogo actual, consulte el catálogo de modelos.
Capacidades de cómputo gestionadas
El proceso administrado (versión preliminar) admite:
-
Punto de conexión y autenticación de Unified Foundry: use el mismo punto de conexión del proyecto, claves de API, Microsoft Entra ID y redes privadas que en las implementaciones de pago por token y con rendimiento aprovisionado. Las rutas de inferencia usan
<endpoint>/managed-deployments/<deployment-name>/. Los entornos de ejecución compatibles con finalizaciones de chat también funcionan en la ruta estándar/openai/v1/con el SDK de OpenAI. - Dimensionamiento de instancias de modelo — Las implementaciones se dimensionan según criterios centrados en el modelo. No es necesario elegir SKU de máquina virtual, ya que Foundry elige GPU por instancia en función del tamaño del modelo, la arquitectura, la longitud del contexto y si la carga de trabajo está optimizada para latencia o rendimiento.
- Entornos de ejecución de inferencia optimizados: contenedores vLLM, SGLang y NVIDIA NIM mantenidos Microsoft con procesamiento por lotes continuos y paralelismo tensor.
- Familias de aceleradores : A100 (80 GB), H100 (80 GB) y MI300X (192 GB).
- Escalado automático y escala a cero: ajuste la escala automáticamente según el tráfico en tiempo real o escale manualmente. Configure un tiempo de espera por inactividad para que el despliegue se reduzca a cero cuando no haya tráfico, de modo que la facturación se detenga de inmediato.
- Entornos de ejecución administrados por Microsoft — Microsoft se encarga de los entornos de ejecución de servicio, las imágenes de contenedor base y los parches de seguridad. Las actualizaciones se aplican automáticamente a las implementaciones activas.
- Métricas de observabilidad : cada implementación emite el recuento de llamadas API por código de estado y percentiles de tiempo de respuesta. Los modelos de finalización de chat también emiten recuentos de tokens de entrada y salida, percentiles de tiempo a primer token (TTFT) y percentiles totales de tiempo de respuesta, agrupados por tiempo.
Facturación y cuota
La facturación de la computación administrada se realiza por hora para cada SKU de acelerador, tomando el rendimiento por GPU como unidad de facturación subyacente. El escalado automático y el escalado a cero ajustan el coste al tráfico real, de modo que la facturación se detiene inmediatamente cuando las instancias se reducen.
La cuota se concede por cada SKU de acelerador y por región mediante el proceso de cuota de Foundry y es independiente de la cuota de máquinas virtuales de Azure. Las Azure Virtual Machines son una oferta de infraestructura como servicio (IaaS) con SKU regionales; el proceso administrado es una oferta PaaS que se basa principalmente en el procesamiento global y de zona de datos. La cuota de máquina virtual Azure existente no se puede aplicar a una implementación de proceso administrada.
La capacidad de cómputo administrada está actualmente disponible para su implementación global. Para obtener estimaciones de tarifas, consulte la calculadora de precios Azure.
Comenzar
Para empezar con la implementación con proceso administrado, consulte Implementar modelos de código abierto con proceso administrado.
Comparación de opciones de implementación
Use la API sin servidor siempre que sea posible. En la tabla siguiente se comparan las funcionalidades entre las dos opciones de implementación:
Note
El acceso instantáneo (versión preliminar) no es una opción de implementación en esta comparación. Llama a los modelos admitidos por su nombre sin crear una API sin servidor ni una implementación de proceso administrada.
| Capacidad | API sin servidor | Cómputo administrado |
|---|---|---|
| ¿Qué modelos se pueden implementar? | Todos los modelos de Foundry, incluidos los modelos de Foundry vendidos por Azure y determinados modelos de socios y de la comunidad | Modelos de código abierto y asociados del catálogo de modelos, NVIDIA NIM y modelos del sector |
| Recurso de implementación | Recurso de Foundry | Proyecto de fundición |
| Requiere AI Hub | No | No |
| Opciones de procesamiento de datos | Regional, zona de datos, global | Global |
| Redes privadas | Sí | Sí |
| Filtrado de contenido | Integrado y personalizable | No disponible en versión preliminar pública |
| Autenticación sin claves | Sí (Microsoft Entra ID y basado en claves) | Sí (Microsoft Entra ID y basado en claves) |
| Facturación | Uso de tokens o unidades de rendimiento aprovisionadas | SKU por hora y acelerador |
Sugerencia
Para obtener información detallada sobre los precios, consulte Plan y administrar los costos de Microsoft Foundry.
Contenido relacionado
- Tipos de implementación para modelos de Microsoft Foundry
- Implementación de modelos de Microsoft Foundry en el portal de Foundry
- Implementación de modelos mediante la CLI de Azure y Bicep
- Modelos de Foundry comercializados por Azure
- Foundry Models de partners y comunidad
- Introducción a los modelos de Microsoft Foundry
- Cómputo administrado en Microsoft Foundry