Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
PII basado en documentos en la detección de información de identificación personal (PII) de Lenguaje de Azure AI le ayuda a detectar y redactar datos confidenciales directamente en archivos de documento nativos, incluidos los archivos de Microsoft Word y PDF, sin tener que crear su propia canalización de extracción y reconstrucción de texto.
Esta característica usa un flujo de trabajo de API asincrónica y devuelve una salida redactada que conserva la estructura y el formato del documento. Puede usarlo cuando la integridad del documento es importante para la revisión de conformidad, compartir, análisis y procesos posteriores de inteligencia artificial.
Demostración de vídeo
En este vídeo, presentamos el servicio de detección de PII y le mostramos cómo detecta y redacta datos confidenciales directamente desde documentos nativos, a la vez que se conserva la estructura y el formato de los archivos. También tratamos casos de uso comunes, formatos admitidos y cómo empezar a trabajar con PII basado en documentos en Lenguaje de Azure AI:
Los subtítulos ocultos están disponibles en este vídeo.
De un vistazo
La PII basada en documentos proporciona las siguientes funcionalidades:
- Censura nativa de documentos para archivos .pdf, .docx y .txt.
- Diseño conservado en los documentos de salida, incluida la fuente, el espaciado y el color.
- Un único flujo de trabajo de API asincrónica para la extracción, detección y redacción.
- Salidas preparadas para la empresa: un documento redactado y un resultado JSON estructurado.
- Directivas de enmascaramiento configurables para escenarios de enmascaramiento de caracteres, etiquetado de entidades y reemplazo sintético.
Adiciones de características GA (2026-05-01)
La versión de disponibilidad general presenta las siguientes funcionalidades y mejoras operativas. Estas adiciones amplían las estrategias de redacción de la plataforma, mejoran la flexibilidad de configuración y mejoran la compatibilidad con escenarios especializados de procesamiento de documentos:
- Se ha mejorado la calidad de salida de las acciones de redacción al tiempo que se conserva el formato de fuente, color y documento.
- Compatibilidad con la ocultación mediante desenfoque para escenarios de documentos basados en imágenes.
- Opciones ampliadas de política de enmascaramiento, incluido el enmascaramiento de etiquetas de entidad y el reemplazo sintético.
- Controles del umbral de confianza para determinar qué entidades detectadas se censuran.
- Controles opcionales para deshabilitar la validación estricta de entidades para flujos de trabajo sensibles a la latencia.
- Compatibilidad con sinónimos para entidades para asociar vocabulario específico del cliente con tipos estándar de entidades PII.
- Soporte de directivas de exclusión de valores para términos que deben permanecer sin redactar en flujos de trabajo seleccionados.
Comparación entre funciones de disponibilidad general y funciones en versión preliminar
En la tabla siguiente se proporciona una matriz de funcionalidad detallada que compara los conjuntos de características de la versión de disponibilidad general (2026-05-01) y la versión preliminar de la API (2026-05-15-preview). Use esta comparación para comprender qué características están disponibles en cada versión y para tomar decisiones fundamentadas sobre la selección de la versión de la API en función de los requisitos de características específicos:
| Feature | GA (2026-05-01) | Versión preliminar (2026-05-15-preview) |
|---|---|---|
| Calidad de salida actualizada: conservación de fuente, color y formato | ✅ | ✅ |
| Redacción de imágenes con desenfoque | ✅ | ✅ |
| Compatibilidad con PDF (incluida la compatibilidad con PDF digital) | ✅ | ✅ |
| compatibilidad con Microsoft Word .docx | ✅ | ✅ |
| Censura con marcador negro | ➖ | ✅ |
| Política de enmascaramiento mediante anonimización/sustitución sintética | ➖ | ✅ |
| Directiva de enmascaramiento de etiquetas de entidad (por ejemplo, [Dirección]) | ➖ | ✅ |
| Umbral de puntuación de confianza | ➖ | ✅ |
| Deshabilitación de la validación de entidades | ➖ | ✅ |
| Sinónimos de entidad (vocabulario de contexto) | ➖ | ✅ |
| Política de exclusión por valor | ➖ | ✅ |
¿Por qué usar PII basado en documentos?
Muchas canalizaciones personalizadas requieren varios pasos para extraer texto, ejecutar detección y reconstruir la salida del documento. PiI basado en documentos simplifica este flujo con un único patrón de API asincrónico y artefactos de salida diseñados para sistemas de procesamiento de documentos.
La PII basada en documentos es especialmente útil cuando es necesario:
- Redacte PII en archivos .pdf, .docx y .txt.
- Conserve el diseño del documento para los procesos empresariales de nivel inferior.
- Genere una salida JSON estructurada para la auditoría y la integración.
La PII basada en documentos usa las mismas categorías de PII predefinidas que piI de texto, incluidas entidades como direcciones, números de teléfono y números de tarjeta de crédito.
Qué devuelve la PII basada en documentos
Cuando un trabajo se realiza correctamente, recibirá lo siguiente:
- Documento redactado en el contenedor de almacenamiento de destino.
- Un archivo de resultados JSON con entidades detectadas, categorías, puntuaciones de confianza y metadatos de procesamiento.
- Resultados de redacción que permiten preservar la fidelidad visual del documento para procesos de revisión y auditoría posteriores.
Cómo funciona la PII basada en documentos
PiI basado en documentos usa un flujo de trabajo asincrónico:
- Envíe un trabajo con ubicaciones de almacenamiento de origen y de destino.
- Sondee el estado del trabajo mediante la ubicación de la operación.
- Recupere los artefactos de salida de la ubicación de almacenamiento de destino.
Para obtener detalles de implementación y ejemplos de solicitudes, consulte Detección y redacción de información de identificación personal en documentos nativos.
En qué se diferencia la PII basada en documentos de otros tipos de funciones de PII
Todos los tipos de características de PII usan categorías de entidad predefinidas, pero optimizan para diferentes tipos de entrada:
- PII basada en documentos está optimizado para flujos de trabajo de redacción de archivos nativos y fidelidad en la salida de archivos.
- Text PII está optimizado para la entrada directa basada en cadenas y la integración con aplicaciones.
- PII de conversación está optimizado para flujos de trabajo de redacción de archivos nativos y fidelidad en la salida de archivos.
Casos de uso comunes
La PII basada en documentos está diseñada para flujos de trabajo empresariales y regulados en los que los equipos necesitan anonimizar archivos antes del almacenamiento, el análisis, el uso compartido externo o el procesamiento de inteligencia artificial de bajada.
Entre los ejemplos típicos se incluyen:
- Registros judiciales y documentación legal.
- Formularios gubernamentales y registros internos.
- Documentos financieros.
- Flujos de trabajo de documentación empresarial internos.
Formatos y límites admitidos
PiI basado en documentos acepta formatos de archivo nativos directamente, sin necesidad de preprocesamiento de texto. En la tabla siguiente se enumeran los formatos admitidos:
| Tipo de archivo | Extensión de archivo | Descripción |
|---|---|---|
| Texto | .txt | Un documento de texto sin formato. |
| PDF de Adobe | Un documento portátil con formato de archivo de documento. | |
| Microsoft Word | .docx | Un archivo de documento Microsoft Word. |
Se aplican las restricciones de entrada siguientes:
| Atributo | Límite |
|---|---|
| Total de documentos por solicitud | <= 40 |
| Tamaño total de contenido por solicitud | <= 10 MB |
Consulte compatibilidad con idiomas y cuotas y límites para conocer los detalles actuales de cobertura de idioma y límite de servicios.
Precios
La ocultación de DCP basada en documentos se rige por los precios de Lenguaje de Azure AI. Para obtener información sobre los precios actuales, consulte los precios de Lenguaje de Azure AI.
Pruébelo en el portal de Microsoft Foundry
La detección de información de identificación personal (PII) basada en documentos ahora incluye una experiencia inicial de entorno de pruebas en el portal de Microsoft Foundry. El área de juegos carga un documento de ejemplo preparado de forma predeterminada, por lo que puede evaluar la característica inmediatamente sin proporcionar su propio archivo.
Al seleccionar Detectar, el entorno de pruebas envía el documento a través de la canalización existente y asincrónica de PII basada en documentos de archivos nativos, el mismo flujo de trabajo descrito en Cómo funciona la PII basada en documentos. Una vez completado el trabajo, el entorno de pruebas muestra el resultado censurado junto al documento de origen y presenta las categorías de entidades, las puntuaciones de confianza y los resultados de fidelidad del archivo, para que puedas evaluar tanto la precisión de la censura como en qué medida el resultado conserva el formato del documento original.
Para obtener instrucciones paso a paso, consulta Usar el entorno de pruebas de PII de documentos en Microsoft Foundry.
Pasos siguientes
Use las siguientes referencias para continuar la implementación: