Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
El procesamiento de documentos no estructurados (como contratos y declaraciones de trabajo) o documentos estructurados (como facturas y formularios de seguros) es fundamental para los flujos de trabajo inteligentes de procesamiento de documentos (IDP) y escenarios de generación aumentada de recuperación (RAG). La extracción de datos de forma confiable a escala requiere más que la extracción de texto.
Para la automatización de alta calidad, a menudo es necesario saber qué se extrajo, de dónde proviene, si coincide con la intención y cuál es la fiabilidad de la extracción.
La mayoría de las empresas se enfrentan a los siguientes desafíos al controlar varios documentos a escala:
- Es necesario automatizar los flujos de trabajo, pero solo cuando la extracción cumple un umbral de precisión necesario para la aplicación empresarial. Debe saber la confianza y precisión que tiene el analizador en sus resultados.
- Es necesario validar los orígenes de los datos extraídos para obtener una referencia verdadera. Al ver puntuaciones de confianza inferiores a las esperadas, valide los resultados rápidamente revisando la ubicación específica del documento.
- Lo ideal es requerir formas de mejorar la calidad de los resultados del analizador (proporcionando algunos ejemplos etiquetados) cuando se produce un error o encuentra un nuevo formato con puntuaciones de confianza inferiores a las esperadas.
Azure Content Understanding en Foundry Tools proporciona características críticas para el posterior procesamiento de la salida extraída.
| Característica | Propósito | Importancia |
|---|---|---|
| Puntuación de confianza | Cuantifica la certeza del analizador en cada predicción mediante puntuaciones de confianza. | Habilita STP (Straight Through Processing) |
| Tierra | Proporciona referencias o citas para cada resultado extraído del contenido del documento original | Garantiza la rastreabilidad, el cumplimiento y la confianza del usuario |
| Ejemplos etiquetados | Proporciona documentos de ejemplo corregidos que muestran los valores pertinentes del analizador, los diseños, la terminología y las convenciones de dominio. El entrenamiento etiquetado está disponible en las API de disponibilidad general y versión preliminar; el entrenamiento optimizado y no hay datos etiquetados en tiempo de ejecución son funcionalidades de vista previa. | Se adapta rápidamente a nuevos formatos o casos perimetrales |
Nota:
En la DISPONIBILIDAD general y 2026-06-01-preview las API, las 2025-11-01 puntuaciones de confianza y la base están disponibles para todos los tipos de campo de documento (extract, classifyy generate métodos).
Obtenga más información sobre estas características a continuación.
Puntuación de confianza: automatización con control
Cada campo puede incluir una puntuación de confianza entre 0 y 1 que indica cuán seguro está el analizador sobre el resultado. Use este valor para automatizar los resultados de alta confianza y enrutar los resultados de confianza baja para la revisión humana.
Habilite las puntuaciones de confianza para todos los campos (o campos específicos) mediante la estimateFieldSourceAndConfidence propiedad . Obtenga más información sobre cómo configurar puntuaciones de confianza para analizadores.
¿Por qué importan las puntuaciones de confianza?
Las puntuaciones de confianza permiten diseñar flujos de trabajo como:
- Aprobación automática de extracciones cuando la confianza supera un umbral definido para la automatización inteligente de las tareas de procesamiento de documentos.
- Optimización de la asignación de recursos mediante la reducción de los costos operativos y el uso de la revisión humana en bucle para aspectos críticos.
- Rechazar o marcar extracciones por debajo de un umbral determinado para la intervención manual, mejorando la precisión de la toma de decisiones.
Example
Está procesando facturas de servicios públicos escaneadas para extraer la dirección de facturación y el importe a pagar. Para un documento:
- Dirección de facturación: "1234 Market St., San Francisco, CA" → Confianza: 0.96
- Importe a pagar: "$128.74" → Confianza: 0,52
En este caso, las canalizaciones de la automatización pueden enviar la dirección de facturación directamente a su aplicación de bajada, al tiempo que remiten el importe adeudado a una persona para su verificación. Al usar puntuaciones de confianza, se reduce el esfuerzo manual y se mantiene la precisión.
Contextualización: seguimiento de cada resultado hasta su origen
La fundamentación garantiza que cada campo, respuesta o clasificación incluya una referencia a su ubicación original en el documento. Esto incluye información de origen (número de página y coordenadas espaciales) y intervalos (desplazamiento y longitud).
¿Por qué importa la contextualización?
En los flujos de trabajo empresariales, la precisión no es suficiente; también necesita rastreabilidad. Cuando un modelo extrae un nombre de cliente o una cláusula de terminación, debe poder validar de dónde procede esa información. La contextualización es fundamental para:
- Mantener una rastreabilidad y localización claras para cláusulas extraídas, números financieros, tablas e identificadores de seguro.
- Garantizar la transparencia con comprobaciones internas de cumplimiento.
- Admite la validación humana eficaz en el bucle mediante la identificación de la página, la sección y el contenido que proporcionó el valor del campo.
Example
Desea extraer la cláusula de rescisión de un contrato. El modelo devuelve:
- Texto extraído: "Cualquiera de las partes podrá rescindir este acuerdo con un preaviso de 60 días".
"spans": [
{
"offset": 343,
"length": 102
}
]
-
Origen: Página 3, coordenadas
({x1},{y1},{x2},{y2},{x3},{y3},{x4},{y4})
Los intervalos indican la posición lógica del elemento usando desplazamiento de caracteres y longitud. El origen proporciona su posición visual con el número de página y las coordenadas del recuadro delimitador.
Con estos datos de contextualización, el equipo legal puede comprobar la extracción saltando directamente al párrafo de origen en el PDF. Esto elimina las conjeturas y genera confianza en los resultados de la aplicación.
Mejora del entrenamiento del analizador con ejemplos etiquetados
Tanto la 2025-11-01 API de disponibilidad general como la 2026-06-01-preview API admiten el entrenamiento de analizadores de documentos personalizados con documentos de ejemplo etiquetados. Ambas versiones usan el mismo flujo de trabajo de etiquetado en Content Understanding Studio.
Importante
El entrenamiento solo admite analizadores de documentos y actualmente no admite campos que usan el generate método .
Si el contexto de todos los campos está claramente presente en el documento de prueba, es posible que una llamada de extracción de coste cero sea suficiente. Empiece por seguir los procedimientos recomendados para las definiciones de esquema. Si sigue viendo valores de campo incorrectos o puntuaciones de confianza por debajo del umbral de procesamiento directo, use ejemplos etiquetados para mejorar el analizador.
Los documentos de ejemplo etiquetados proporcionan el contexto de dominio. Al corregir los valores de campo en documentos representativos, se muestran los diseños pertinentes, la terminología, los patrones de valor y las convenciones para su escenario.
Los ejemplos etiquetados funcionan para mejorar la calidad de extracción:
- En el caso de los conjuntos de datos con variaciones de plantilla mínimas, agregue un solo ejemplo etiquetado.
- Para variaciones más complejas, agregue un ejemplo representativo para cada plantilla o formato.
- Para documentos que generan puntuaciones de confianza bajas, extracción incompleta o valores incorrectos.
- Evalúe la calidad de extracción antes y después del entrenamiento para confirmar que las muestras mejoran los resultados.
Para agregar un ejemplo etiquetado, vaya a una página de resultados de extracción de documentos en el portal de Foundry y seleccione la pestaña Datos de etiqueta. Cargue un ejemplo y, a continuación, seleccione Etiqueta automática. El etiquetado automático ejecuta el analizador existente y llena previamente los resultados que puede editar.
Edite los valores de campo incorrectos o que falten. Después de guardar el ejemplo, los campos corregidos muestran la etiqueta corregida .
Nota:
Agregue ejemplos etiquetados en Content Understanding Studio. Después de agregar ejemplos, reconstruya el analizador para que este pueda usar los ejemplos.
Por ejemplo, si las facturas de un nuevo proveedor generan una puntuación de confianza baja o un valor de importe debido incorrecto, agregue una factura representativa y corrija sus valores etiquetados. El propio documento proporciona el contexto sobre el diseño y las convenciones de factura del proveedor.
A continuación, el analizador generaliza el patrón para extraer el valor de plantillas de documento similares.
Mejoras en la API en versión preliminar
Importante
La versión 2026-06-01-preview de api está en versión preliminar pública. Las versiones preliminares se proporcionan sin un contrato de nivel de servicio y no se recomiendan para cargas de trabajo de producción. Para obtener más información, consulte los Términos Suplementarios de uso para las versiones preliminares de Microsoft Azure y el Anexo de Protección de Datos de Productos y Servicios de Microsoft ("DPA").
La 2026-06-01-preview API usa el mismo flujo de trabajo de ejemplo etiquetado, pero mejora la forma en que el entrenamiento usa los documentos. Al recompilar el analizador, el entrenamiento destila los patrones pertinentes y el contexto de dominio de las muestras etiquetadas en el analizador integrado.
El enfoque de entrenamiento en versión preliminar:
- Reduce el consumo de tokens cuando el analizador se ejecuta en comparación con el enfoque de entrenamiento de disponibilidad general.
- No incluye ni conserva los documentos de ejemplo etiquetados en el analizador compilado.
- No requiere que el analizador compilado acceda a los documentos de ejemplo etiquetados en tiempo de análisis.
Los documentos de ejemplo etiquetados permanecen en la cuenta de almacenamiento asociada al proyecto de Content Understanding Studio solo con fines de diseño. Para obtener más información, consulte Datos, privacidad y seguridad para Content Understanding.
Limitaciones
Los ejemplos etiquetados no corrigen problemas de reconocimiento de texto. Por ejemplo, si la letra l se reconoce como el dígito 1, etiquetando el valor como la letra l no mejora la calidad de la extracción.
Un flujo de trabajo completo
Al crear una canalización inteligente de automatización de documentos, estas funcionalidades le ayudan a extraer datos de forma confiable a escala. Por ejemplo, si procesa contratos de adquisición, puede extraer:
- Nombre del proveedor
- Fechas de inicio y fin
- Cláusula de cancelación
Para garantizar la calidad y confianza para la comprensión de documentos a escala empresarial:
- La contextualización proporciona a su equipo una rastreabilidad completa a todos los campos.
- Las puntuaciones de confianza le ayudan a automatizar, ya que la revisión humana solo es necesaria cuando la confianza es baja.
- Los ejemplos etiquetados proporcionan ejemplos que ayudan al analizador a adaptarse al contexto de dominio, a las nuevas plantillas de contrato o a los casos perimetrales.