Panoramica delle informazioni personali basate su documenti

Il rilevamento delle PII basate su documenti nel rilevamento delle informazioni di identificazione personale (PII) di Lingua di Azure AI consente di individuare e oscurare i dati sensibili direttamente nei file di documenti nativi, inclusi i file Microsoft Word e PDF, senza dover creare una pipeline personalizzata per l'estrazione e la ricostruzione del testo.

Questa funzionalità usa un flusso di lavoro API asincrono e restituisce un output redatto che mantiene la struttura e la formattazione dei documenti. È possibile usarlo quando la fedeltà dei documenti è importante per la revisione della conformità, la condivisione, l'analisi e i flussi di lavoro di intelligenza artificiale downstream.

Screenshot del flusso di lavoro tecnico per il rilevamento delle informazioni personali basate su documenti in Lingua di Azure AI.

Dimostrazione video

In questo video viene presentato il servizio di rilevamento delle informazioni personali e viene illustrato come vengono rilevati e corretti i dati sensibili direttamente dai documenti nativi mantenendo al tempo stesso la struttura e la formattazione dei file. Vengono inoltre illustrati i casi d'uso comuni, i formati supportati e come iniziare a usare le informazioni personali basate su documenti in Lingua di Azure AI:

I sottotitoli nascosti sono disponibili per questo video.

A colpo d'occhio

Le informazioni personali basate su documenti offrono le funzionalità seguenti:

  • Oscuramento di documenti nativi per file .pdf, .docx e .txt.
  • Layout mantenuto nei documenti di output, tra cui carattere, spaziatura e colore.
  • Un singolo flusso di lavoro API asincrono per redazione, rilevamento ed estrazione.
  • Output pronti per l'organizzazione: un documento redatto e un risultato JSON strutturato.
  • Criteri di mascheramento configurabili per il mascheramento dei caratteri, l'etichettatura delle entità e la sostituzione sintetica.

Aggiunte di funzionalità GA (2026-05-01)

La versione di disponibilità generale introduce le funzionalità e i miglioramenti operativi seguenti. Queste aggiunte espandono le strategie di redaction della piattaforma, migliorano la flessibilità di configurazione e migliorano il supporto per scenari di elaborazione documenti specializzati:

  • Miglioramento della qualità dell'output di redazione e oscuramento mantenendo la formattazione del tipo di carattere, del colore e del documento.
  • Supporto per l'oscuramento tramite sfocatura per scenari con documenti basati su immagini.
  • Opzioni estese per i criteri di mascheramento, tra cui il mascheramento delle etichette delle entità e la sostituzione sintetica.
  • Controlli della soglia di confidenza per determinare quali entità rilevate vengono oscurate.
  • Controlli facoltativi per disabilitare la convalida rigorosa delle entità per i flussi di lavoro sensibili alla latenza.
  • Supporto per i sinonimi delle entità per associare il vocabolario specifico del cliente ai tipi di entità PII standard.
  • Supporto dei criteri di esclusione dei valori per i termini che devono rimanere integri nei flussi di lavoro selezionati.

Confronto tra funzionalità GA e di anteprima

La tabella seguente fornisce una matrice di funzionalità dettagliata che confronta i set di funzionalità della versione di disponibilità generale (2026-05-01) e la versione dell'API di anteprima (2026-05-15-preview). Usare questo confronto per comprendere quali funzionalità sono disponibili in ogni versione e per prendere decisioni informate sulla selezione della versione dell'API in base ai requisiti di funzionalità specifici:

Feature GA (2026-05-01) Anteprima (2026-05-15-preview)
Qualità dell'output aggiornata: conservazione dei tipi di carattere, del colore e del formato
Oscuramento dell'immagine con sfocatura
Supporto pdf (incluso il supporto pdf digitale)
supporto per Microsoft Word .docx
Oscuramento con pennarello nero
Criterio di mascheramento con anonimizzazione/sostituzione sintetica
Criterio di mascheramento per le etichette di entità (ad esempio, [Indirizzo])
Soglia del punteggio di attendibilità
Disabilitare la convalida delle entità
Sinonimi di entità (vocabolario di contesto)
Criteri di esclusione dei valori

Perché usare informazioni personali basate su documenti?

Molte pipeline personalizzate richiedono più passaggi per estrarre testo, eseguire il rilevamento e ricostruire l'output del documento. Le informazioni personali basate su documenti semplificano questo flusso con un unico modello API asincrono e artefatti di output progettati per i sistemi di elaborazione dei documenti.

Le informazioni personali basate su documenti sono particolarmente utili quando è necessario:

  • Oscura le informazioni personali identificabili nei file .pdf, .docx e .txt.
  • Mantenere il layout del documento per i processi aziendali downstream.
  • Generare un output JSON strutturato per il controllo e l'integrazione.

Le informazioni personali basate su documenti usano le stesse categorie di informazioni personali predefinite come informazioni personali di testo, incluse entità come indirizzi, numeri di telefono e numeri di carta di credito.

Cosa restituisce la PII basata su documenti

Quando un processo ha esito positivo, si riceve quanto segue:

  • Documento redatto nel contenitore di archiviazione di destinazione.
  • Un file di risultati JSON con entità, categorie, punteggi di attendibilità ed elaborazione dei metadati rilevati.
  • Risultati di redazione che possono mantenere la fedeltà visiva dei documenti per i processi di revisione e controllo downstream.

Come funzionano le informazioni di identificazione personale basate su documenti

PII (Informazioni personali identificabili) basate su documenti usano un flusso di lavoro asincrono:

  1. Inviare un processo con percorsi di archiviazione di origine e di destinazione.
  2. Eseguire il polling sullo stato del processo usando la posizione dell'operazione.
  3. Recuperare gli artefatti di output dalla posizione di archiviazione di destinazione.

Diagramma che mostra la chiamata API asincrona per il rilevamento delle informazioni personali basate su documenti.

Per informazioni dettagliate sull'implementazione e degli esempi di richieste, vedere Rilevare e oscurare Informazioni personalmente identificabili in documenti nativi.

Come le PII basate su documenti si differenziano da altri tipi di funzionalità PII

Tutti i tipi di funzionalità PII usano categorie di entità predefinite, ma ottimizzano per tipi di input diversi:

  • Le PII basate su documenti sono ottimizzate per i flussi di lavoro di redazione dei file nativi e per la fedeltà dell'output dei file.
  • I testi con informazioni personali sono ottimizzati per l'integrazione diretta di input basato su stringhe e app.
  • Le conversazioni personali sono ottimizzate per un input conversazionale basato su turni e orientato alla trascrizione.

Casi d'uso comuni

Le informazioni personali basate su documenti sono progettate per i flussi di lavoro aziendali e regolamentati del settore, in cui i team devono rendere anonimi i file prima dell'archiviazione, dell'analisi, della condivisione esterna o dell'elaborazione downstream dell'IA.

Gli esempi tipici includono:

  • Archivi giudiziari e documenti legali.
  • Moduli governativi e record interni.
  • Documenti finanziari.
  • Flussi di lavoro interni della documentazione aziendale.

Formati e limiti supportati

Le informazioni personali identificabili basate su documenti accettano direttamente i formati di file nativi, senza richiedere la pre-elaborazione del testo. Nella tabella seguente sono elencati i formati supportati:

Tipo di file Estensione del file Descrizione
Testo .txt Documento di testo non formattato.
Adobe PDF PDF Documento formattato come portable document file.
Microsoft Word .docx File di documento Microsoft Word.

Si applicano i vincoli di input seguenti:

Attributo Limite
Totale documenti per richiesta <= 40
Dimensioni totali del contenuto per richiesta <= 10 MB

Per informazioni dettagliate sulla copertura linguistica corrente e sui limiti di servizio, vedere supporto linguistico e quote e limiti.

Tariffe

La redazione dei dati personali su base documentale utilizza le tariffe di Lingua di Azure AI. Per vedere le informazioni sui prezzi correnti, consultare Lingua di Azure AI pricing.

Provarlo nel portale di Microsoft Foundry

Il rilevamento delle informazioni di identificazione personale basato su documenti comprende ora anche una prima esperienza nell'area di test nel portale Microsoft Foundry. Il playground carica un documento di esempio preparato per impostazione predefinita, in modo da poter valutare immediatamente la funzionalità senza fornire il proprio file.

Quando si seleziona Rileva, il playground invia il documento tramite la pipeline PII esistente, asincrona e basata su documenti da file nativi, ovvero lo stesso flusso di lavoro descritto in Come funziona il rilevamento PII basato su documenti. Al termine del processo, il playground mostra l'output oscurato affiancato al documento di origine e visualizza le categorie di entità, i punteggi di attendibilità e i risultati di fedeltà del file, in modo da consentirti di valutare sia l'accuratezza dell'oscuramento sia quanto bene l'output preservi la formattazione originale del documento.

Per istruzioni dettagliate, vedere Usare il documento PiI playground in Microsoft Foundry.

Passaggi successivi

Usare i riferimenti seguenti per continuare l'implementazione: