Confermare la qualità dell'analizzatore documenti con attendibilità, grounding e campioni etichettati

L'elaborazione di documenti non strutturati (ad esempio contratti e dichiarazioni di lavoro) o documenti strutturati (ad esempio fatture e moduli assicurativi) è fondamentale per i flussi di lavoro di elaborazione intelligente dei documenti (IDP) e gli scenari di generazione avanzata (RAG). L'estrazione affidabile dei dati su larga scala richiede più dell'estrazione del testo.

Per l'automazione di alta qualità, spesso è necessario sapere da cosa è stato estratto, da dove proviene, dal fatto che corrisponda alla finalità e dall'affidabilità dell'estrazione.

La maggior parte delle aziende affronta le sfide seguenti quando si gestiscono diversi documenti su larga scala:

  • È necessario automatizzare i flussi di lavoro, ma solo quando l'estrazione soddisfa una soglia di accuratezza necessaria per l'applicazione aziendale. È necessario sapere quanto l'analizzatore sia sicuro/accurato nei risultati.
  • È necessario convalidare le origini dei dati estratti per un riferimento vero. Quando viene visualizzato un punteggio di attendibilità inferiore al previsto, convalidare rapidamente i risultati esaminando la posizione specifica nel documento.
  • Idealmente, richiedere modi per migliorare la qualità dei risultati dell'analizzatore (fornendo alcuni esempi etichettati) quando si verifica un errore o rileva un nuovo formato con punteggi di attendibilità inferiori al previsto.

Azure Content Understanding in Foundry Tools offre funzionalità critiche per la post-elaborazione dell'output estratto.

Caratteristica / Funzionalità Scopo Value
Punteggio di attendibilità Quantizza la certezza dell'analizzatore in ogni stima tramite i punteggi di attendibilità. Abilita STP (elaborazione diretta)
Grounding Fornisce riferimenti/citazioni per ogni output estratto nel contenuto del documento originale Garantisce la tracciabilità, la conformità e l'attendibilità degli utenti
Esempi etichettati Fornisce documenti di esempio corretti che mostrano i valori, i layout, la terminologia e le convenzioni di dominio pertinenti dell'analizzatore. Il training con etichetta è disponibile nelle API di disponibilità generale e anteprima; il training ottimizzato e nessun dato etichettato in fase di esecuzione sono funzionalità di anteprima. Si adatta rapidamente a nuovi formati o casi limite

Annotazioni

2025-11-01 Nelle API e 2026-06-01-preview ga sono disponibili punteggi di attendibilità e base per tutti i tipi di campo del documento (extract, classifye generate metodi).

Altre informazioni su queste funzionalità sono disponibili di seguito.

Punteggio di attendibilità: automatizzare con il controllo

Ogni campo può includere un punteggio di attendibilità compreso tra 0 e 1 che indica la certezza dell'analizzatore riguardo al risultato. Usare questo valore per automatizzare i risultati con attendibilità elevata e instradare i risultati con bassa attendibilità per la revisione umana.

Abilitare i punteggi di attendibilità per tutti i campi (o campi specifici) usando la estimateFieldSourceAndConfidence proprietà . Altre informazioni sulla configurazione dei punteggi di attendibilità per gli analizzatori.

Perché i punteggi di attendibilità sono importanti

I punteggi di attendibilità consentono di progettare flussi di lavoro come:

  • L'approvazione automatica delle estrazioni quando l'attendibilità supera una soglia definita per automatizzare in modo intelligente le attività di elaborazione dei documenti.
  • Ottimizzazione dell'allocazione delle risorse riducendo i costi operativi e integrando la revisione umana per gli aspetti critici.
  • Rifiutare o contrassegnare le estrazioni al di sotto di una determinata soglia per l'intervento manuale, migliorando l'accuratezza del processo decisionale.

Example

Si elaborano le fatture di utenze scansionate per estrarre l'indirizzo di fatturazione e l'importo dovuto. Per un documento:

  • Indirizzo di fatturazione: "1234 Market St., San Francisco, CA" → Confidence: 0,96
  • Importo dovuto: "$128,74" → Confidenza: 0,52

In questo caso, la pipeline di automazione può inviare l'indirizzo di fatturazione direttamente all'applicazione downstream mentre inoltra l'importo dovuto a un operatore umano per la verifica. Usando i punteggi di attendibilità, si riduce lo sforzo manuale mantenendo l'accuratezza.

Grounding: far risalire ogni risultato alla sua origine

Il grounding garantisce che ogni campo, risposta o classificazione includa un riferimento alla posizione originale nel documento. Sono incluse le informazioni di origine (numero di pagina e coordinate spaziali) e intervalli (offset e lunghezza).

Perché le basi sono importanti

Nei flussi di lavoro aziendali, la precisione non è sufficiente; è necessaria anche la tracciabilità. Quando un modello estrae un nome cliente o una clausola di terminazione, è necessario essere in grado di convalidare la provenienza di tali informazioni. Il grounding è fondamentale per:

  • Mantenimento di una chiara tracciabilità e localizzazione per clausole estratte, numeri finanziari, tabelle e ID assicurativi.
  • Garantire la trasparenza con i controlli di conformità interni.
  • Supporto di una convalida efficiente del ciclo umano identificando la pagina, la sezione e il contenuto che ha fornito il valore del campo.

Example

Si vuole estrarre la clausola di terminazione da un contratto. Il modello restituisce:

  • Testo estratto: "Entrambe le parti possono terminare il contratto con preavviso di 60 giorni".
"spans": [
  {
    "offset": 343,
    "length": 102
  }
]
  • Origine: Pagina 3, coordinate ({x1},{y1},{x2},{y2},{x3},{y3},{x4},{y4})

Gli intervalli indicano la posizione logica dell'elemento usando l'offset e la lunghezza dei caratteri. L'origine fornisce una posizione visiva con il numero di pagina e le coordinate del riquadro delimitatore del testo.

Con questi dati di base, il team legale può verificare l'estrazione passando direttamente al paragrafo di origine nel PDF. In questo modo si elimina l'ipotesi e si crea l'attendibilità nell'output dell'applicazione.

Migliorare il training dell'analizzatore con esempi etichettati

Sia l'API 2025-11-01 ga che l'API supportano il 2026-06-01-preview training di analizzatori di documenti personalizzati con documenti di esempio etichettati. Entrambe le versioni usano lo stesso flusso di lavoro di etichettatura in Content Understanding Studio.

Importante

Il training supporta solo gli analizzatori di documenti e attualmente non supporta i campi che usano il generate metodo .

Se il contesto per tutti i campi è chiaramente presente nel documento di test, potrebbe essere sufficiente una chiamata di estrazione zero-shot. Per iniziare, seguire le procedure consigliate per le definizioni di schema. Se vengono ancora visualizzati valori di campo non corretti o punteggi di attendibilità al di sotto della soglia di elaborazione diretta, usare campioni etichettati per migliorare l'analizzatore.

I documenti di esempio etichettati forniscono il contesto del dominio. Correggendo i valori dei campi nei documenti rappresentativi, l'analizzatore mostra i layout, la terminologia, i modelli di valore e le convenzioni pertinenti per lo scenario.

I campioni etichettati funzionano per migliorare la qualità di estrazione:

  • Per i set di dati con varianti di modello minime, aggiungere un singolo esempio etichettato.
  • Per varianti più complesse, aggiungere un campione rappresentativo per ogni modello o formato.
  • Per i documenti che generano punteggi di attendibilità bassi, estrazione incompleta o valori non corretti.
  • Valutare la qualità di estrazione prima e dopo il training per verificare che gli esempi migliorino i risultati.

Per aggiungere un esempio etichettato, passare a una pagina dei risultati di estrazione di documenti nel portale foundry e selezionare la scheda Dati etichetta . Caricare un esempio e quindi selezionare Etichetta automatica. L'etichetta automatica esegue l'analizzatore esistente e popola i risultati che è possibile modificare.

Screenshot dell'etichettatura automatica di un esempio di fattura.

Modificare eventuali valori di campo non corretti o mancanti. Dopo aver salvato l'esempio, i campi corretti visualizzano il tag corretto .

Screenshot delle etichette corrette.

Annotazioni

Gli esempi etichettati vengono aggiunti in Content Understanding Studio. Dopo aver aggiunto campioni, ricompilare l'analizzatore in modo che l'analizzatore possa usare gli esempi.

Ad esempio, se le fatture di un nuovo fornitore producono un punteggio di attendibilità basso o un valore di importo non corretto, aggiungere una fattura rappresentativa e correggerne i valori etichettati. Il documento stesso fornisce il contesto sulle convenzioni di layout e fattura del fornitore.

L'analizzatore generalizza quindi il modello per estrarre il valore da modelli di documento simili.

Miglioramenti dell'API di anteprima

Importante

La versione 2026-06-01-preview dell'API è disponibile in anteprima pubblica. Le anteprime vengono fornite senza un contratto di servizio e non sono consigliate per i carichi di lavoro di produzione. Per ulteriori informazioni, vedere Condizioni Supplementari per l'utilizzo delle versioni di anteprima di Microsoft Azure e l’Addendum sulla protezione dei dati di Microsoft Products and Services ("DPA").

L'API 2026-06-01-preview usa lo stesso flusso di lavoro di esempio etichettato, ma migliora il modo in cui il training usa i documenti. Quando si ricompila l'analizzatore, il training distillirà i modelli e il contesto di dominio pertinenti dagli esempi etichettati nell'analizzatore compilato.

L'approccio di training di anteprima:

  • Riduce il consumo di token quando l'analizzatore viene eseguito rispetto all'approccio di training ga.
  • Non include o mantiene i documenti di esempio etichettati nell'analizzatore compilato.
  • Non richiede che l'analizzatore compilato acceda ai documenti di esempio etichettati in fase di analisi.

I documenti di esempio etichettati rimangono nell'account di archiviazione associato al progetto content Understanding Studio solo a scopo di progettazione. Per altre informazioni, vedere Dati, privacy e sicurezza per Informazioni sui contenuti.

Limitazioni

Gli esempi etichettati non correggeno i problemi di riconoscimento del testo. Ad esempio, se la lettera l viene riconosciuta come cifra 1, l'etichettatura del valore come lettera l non migliora la qualità di estrazione.

Flusso di lavoro completo

Quando si crea una pipeline di automazione dei documenti intelligente, queste funzionalità consentono di estrarre i dati in modo affidabile su larga scala. Ad esempio, se si elaborano contratti di approvvigionamento, è possibile estrarre:

  • Nome fornitore
  • Date di inizio e fine
  • Clausola di annullamento

Per garantire la qualità e l'attendibilità per la comprensione dei documenti su scala aziendale:

  • Il grounding offre al team la tracciabilità completa per ogni campo.
  • I punteggi di attendibilità consentono di automatizzare, perché la revisione umana è necessaria solo quando la probabilità è bassa.
  • Gli esempi etichettati forniscono esempi che consentono all'analizzatore di adattarsi al contesto di dominio, ai nuovi modelli di contratto o ai case perimetrali.

Passaggi successivi