Resumen de los niveles de AI Gateway (vista previa)

APLICABLE A: Nivel AI Gateway (versión preliminar)

Importante

El nivel AI Gateway se encuentra actualmente en versión preliminar pública. Durante la vista previa pública, el nivel de IA Gateway está disponible en las siguientes regiones:

  • Estados Unidos - Este de EE. UU. 2
  • Europa - Suecia Central

El nivel de AI Gateway (versión preliminar) de Azure API Management es una pasarela totalmente gestionada para cargas de trabajo de IA. Ofrece a los equipos un lugar para publicar, proteger, gobernar y observar el acceso a modelos de IA y herramientas del Protocolo de Contexto de Modelo (MCP).

El nivel de AI Gateway está en versión preliminar pública. Las funciones de vista previa, regiones, límites de servicio y APIs pueden cambiar antes de la disponibilidad general. Los precios y el modelo de negocio se anunciarán más adelante en la vista previa.

¿Qué es el nivel AI Gateway?

El nivel AI Gateway es una puerta de enlace gestionada para aplicaciones que invocan modelos y herramientas. Las aplicaciones invocan un endpoint de la puerta de enlace en lugar de llamar directamente al backend de cada proveedor o herramienta. Para cada solicitud, la pasarela:

  1. Autentica la clave de acceso del entorno de ejecución en el encabezado api-key.
  2. Evalúa las políticas que se aplican al modelo o herramienta objetivo.
  3. Enruta la solicitud al backend seleccionado —por el model campo de los modelos, o por el nombre de la herramienta para las herramientas— usando las credenciales del backend que configuraste.
  4. Devuelve la respuesta y emite telemetría — registros y métricas de OpenTelemetry como el número de tokens y la latencia.

Por qué usarla

El nivel AI Gateway ofrece a los equipos de plataforma un límite de ejecución gobernado para aplicaciones, modelos y herramientas. Úselo para:

  • Coloca un endpoint de puerta de enlace frente a los proveedores de IA compatibles.
  • Mantén ocultas las credenciales de los proveedores para las solicitudes.
  • Gestionar modelos, servidores MCP, claves de acceso en tiempo de ejecución, políticas y monitorización.
  • Aplica controles de gobernanza como límites de tasa de token, límites de tasa de solicitud, seguridad de contenido y filtros IP.
  • Publicar herramientas MCP aprobadas para agentes de IA.
  • Descubre y utiliza los modelos y herramientas disponibles a través de un catálogo de autoservicio.
  • Inicia sesión para gestionar la pasarela con Microsoft Entra ID.

Elección de la ruta de acceso

Inicio rápido

¿Es la primera vez que usas el nivel AI Gateway? Crea una pasarela, añade un modelo y haz tu primera llamada en unos 20–30 minutos.

Gestionar modelos y herramientas

Añade Foundry y modelos personalizados, y publica servidores de herramientas MCP detrás de un único punto final gobernado.

Gobierna, asegura y opera

Aplica políticas, identidad, redes y monitorización para que se ejecuten en producción.

Conceptos clave

Gateway

Una pasarela es el límite de ejecución y gestión del tráfico de IA. Es un recurso dedicado a Azure que puedes provisionar en aproximadamente un minuto, sin unidades de escala que planificar. Las aplicaciones llaman a un punto final de pasarela con una clave de acceso en tiempo de ejecución en lugar de llamar directamente a cada proveedor o herramienta en el back-end. Gestionas los modelos, herramientas, políticas, claves e identidad en un solo lugar.

Diagrama de aplicaciones, agentes y agentes de código que acceden a la capa de AI Gateway, la cual autentica la clave del entorno de ejecución, aplica directivas y emite telemetría antes de encaminar las solicitudes a proveedores de modelos y backends de herramientas de MCP.

Models

Un modelo es el modelo de un proveedor que publicas a través de la pasarela. Las aplicaciones lo seleccionan por nombre en el campo de model la solicitud. Todos los proveedores compatibles con OpenAI (Microsoft Foundry, Azure OpenAI, AWS Bedrock, Google Vertex y OpenAI) comparten un punto final, .../models/openai/v1. La pasarela dirige el tráfico mediante una coincidencia exacta en model, así que asigna a cada modelo un nombre único. Anthropic utiliza un proveedor personalizado con acceso directo a la API de Messages en .../models/anthropic/v1/messages. La pasarela contiene las credenciales de backend, por lo que las aplicaciones nunca gestionan las claves del proveedor.

Servidores y herramientas MCP

Un servidor MCP es un punto final gobernado (.../toolservers/<server-name>/mcp) al que los agentes llaman para acceder a las herramientas. Federa uno o más backends de tres fuentes: un servidor MCP remoto (por URL), una especificación OpenAPI o un conector integrado (más de 1.000 aplicaciones SaaS, sin servidor que alojar). Las operaciones de cada backend se convierten en herramientas. Tú eliges cómo se autentica el gateway a cada backend: ninguno, clave API, OAuth 2.0 o identidad gestionada.

Policies

Una política es una barrera de seguridad en tiempo de ejecución que configuras como una tarjeta en el portal, sin XML.

Policy Qué controla
Seguridad del contenido Comprobaciones de seguridad de las instrucciones y las respuestas.
Filtro IP Llamadas en tiempo de ejecución desde rangos de red de clientes aprobados.
Límite de velocidad de tokens Rendimiento de tokens en un intervalo móvil de un minuto.
Límite de tasa de solicitud Volumen de solicitudes en un intervalo móvil de un minuto.

Claves de identidad y acceso

Los administradores inician sesión para gestionar la pasarela usando Microsoft Entra ID. Las aplicaciones se autentican con claves de acceso en tiempo de ejecución : crea estas claves en la página de Claves del portal (Crear clave API) y envíalas en la api-key cabecera. Una clave tiene ámbito de pasarela: da acceso a todos los modelos y herramientas. Para los backends, el gateway utiliza identidad gestionada cuando está disponible (para que no se almacenen secretos) o una clave de proveedor que tú proporciones. Emitir una clave por aplicación y entorno, y conceder a cada identidad el menor privilegio.

Catálogo de autoservicio

Los desarrolladores descubren modelos y herramientas en un catálogo de autoservicio, cada uno con detalles de conexión y muestras, fijan favoritos y saltan a cualquier parte con la paleta de comandos Ctrl+K (⌘K en macOS).

Disponibilidad regional

Durante la vista previa pública, el nivel IA Gateway está disponible en las siguientes regiones de Azure.

Geografía Región
Estados Unidos Este de EE. UU. 2
Europe Sweden Central

La disponibilidad por región puede variar según la suscripción, la nube, la capacidad, la marca de característica y el registro en la versión preliminar. Si tu región objetivo no está disponible en el portal o en las herramientas de despliegue, selecciona otra región de vista previa compatible o contacta con tu representante de Microsoft.

Elige la región que mejor se adapte a tus usuarios, aplicaciones, backends de IA y dependencias de red. Si la pasarela dirige el tráfico a Azure OpenAI, Microsoft Foundry, puntos de conexión del modelo, API o servidores MCP, tenga en cuenta también esas ubicaciones. La residencia de datos depende de la ruta completa de la solicitud, no solo de la región de pasarela. Revisa dónde se despliega cada componente, incluyendo la pasarela, los backends de IA, herramientas, destinos de registro, identidades gestionadas y aplicaciones cliente.

Preguntas más frecuentes

¿Cuándo debería usar AI Gateway tier en lugar de llamar directamente a los proveedores?

Utiliza el nivel de AI Gateway cuando quieras un endpoint gobernado delante de muchos modelos y herramientas: claves centrales de tiempo de ejecución en lugar de credenciales de proveedor en cada aplicación, políticas compartidas (límites de tokens y solicitudes, seguridad de contenido, filtros IP), telemetría unificada y un catálogo de autoservicio. Si llamas a un único modelo desde una sola aplicación y no necesitas gobernanza ni credenciales centrales, llamar directamente al proveedor puede ser más sencillo.

¿Debería importarlo desde Foundry o añadir un modelo personalizado?

Importa desde Foundry cuando tu modelo se ejecute en un recurso de Microsoft Foundry o Azure OpenAI (Azure AI Services); el asistente descubre los despliegues del recurso por ti. Añade un modelo personalizado para AWS Bedrock, Google Vertex, OpenAI, Anthropic o cualquier otro endpoint compatible con OpenAI, donde introduzcas tú mismo los nombres del endpoint y del modelo. Consulta Gestionar modelos y herramientas.

¿Está listo para producción el nivel de AI Gateway?

El nivel AI Gateway se encuentra en versión preliminar pública: la disponibilidad se ofrece según las posibilidades, sin acuerdo de nivel de servicio (SLA), y las API, los flujos de trabajo del portal, la telemetría, los límites, las regiones y los precios pueden cambiar. Las cuotas de vista previa pueden limitar el número de modelos, herramientas y claves de acceso en tiempo de ejecución, así como el rendimiento de tus solicitudes y tokens; Los límites específicos se publicarán antes de la disponibilidad general. Empieza con cargas de trabajo no críticas, pilotos controlados y planes de retroceso claros.

¿Cómo se gestiona el precio durante la vista previa?

Los precios y el modelo de negocio para el nivel AI Gateway se anunciarán más adelante en la vista previa. También podrías pagar por recursos relacionados que utilices con la pasarela, como proveedores de modelos, Application Insights, redes y plataformas de observabilidad.

¿Qué regiones están disponibles?

El nivel AI Gateway está disponible en East US 2 y Sweden Central. Consulte Disponibilidad regional.

¿Cómo se tratan mis datos?

Tú eliges dónde va la telemetría. Con Application Insights, permanece en tu suscripción a Azure. Otros destinos de OpenTelemetry (OTLP) siguen tu configuración y los términos del proveedor. La telemetría utiliza las convenciones semánticas de OpenTelemetry GenAI (el gen_ai.* prefijo). La residencia de datos depende de la ruta completa de la solicitud, así que coloca la pasarela, los backends y los destinos de telemetría en regiones aprobadas e involucra a tus equipos de seguridad y privacidad.

¿El nivel de AI Gateway soporta redes privadas?

Yes. La integración de Private Link entrante y red virtual saliente forma parte de la versión preliminar pública. Consulta Configurar red privada para configuración, DNS y limitaciones.

¿Qué versión de la API debería usar para automatizar?

Utiliza la versión 2026-05-01-previewde la API de gestión de previsualización. Valida la automatización antes de una implementación generalizada porque la API está en versión preliminar.