Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Die Verarbeitung unstrukturierter Dokumente (z. B. Verträge und Arbeitsabschlüsse) oder strukturierte Dokumente (z. B. Rechnungen und Versicherungsformulare) ist für intelligente Dokumentverarbeitungsworkflows (IDP)-Workflows und RAG-Szenarien (Retrieval-Augmented Generation) von entscheidender Bedeutung. Das zuverlässige Extrahieren von Daten in großem Umfang erfordert mehr als nur die Textextraktion.
Für eine qualitativ hochwertige Automatisierung müssen Sie häufig wissen, was extrahiert wurde, woher sie stammt, ob sie Ihren Absichten entspricht und wie zuverlässig die Extraktion ist.
Die meisten Unternehmen stellen sich beim Umgang mit verschiedenen Dokumenten im großen Maßstab vor die folgenden Herausforderungen:
- Sie müssen Workflows automatisieren, aber nur, wenn die Extraktion einen Genauigkeitsschwellenwert erfüllt, der für die Geschäftsanwendung erforderlich ist. Sie müssen wissen, wie sicher/genau der Analysator in seinen Ergebnissen ist.
- Sie müssen die Quellen extrahierter Daten für eine zuverlässige Referenz validieren. Wenn die Konfidenzwerte niedriger als erwartet ausfallen, sollten Sie die Ergebnisse schnell validieren, indem Sie den spezifischen Ort im Dokument überprüfen.
- Im Idealfall sollten Sie Möglichkeiten haben, die Qualität der Analyseergebnisse zu verbessern (indem Sie einige beschriftete Beispiele bereitstellen), wenn ein Fehler auftritt oder ein neues Format mit niedrigeren als erwarteten Konfidenzwerten auftritt.
Azure Content Understanding in Foundry Tools bietet wichtige Features für die Nachbearbeitung Ihrer extrahierten Ausgabe.
| Merkmal | Zweck | Wert |
|---|---|---|
| Konfidenzbewertung | Quantifiziert die Sicherheit des Analyzers bei jeder Vorhersage durch Konfidenzbewertungen. | Aktiviert STP (Straight Through Processing) |
| Fundament | Stellt Verweise/Zitate für jeden extrahierten Output auf den ursprünglichen Inhalt des Dokuments bereit. | Gewährleistet Rückverfolgbarkeit, Compliance und Benutzervertrauensstellung |
| Beschriftete Beispiele | Stellt korrigierte Beispieldokumente bereit, die die relevanten Werte, Layouts, Terminologie und Domänenkonventionen der Analyse zeigen. Bezeichnete Schulungen sind in den GA- und Vorschau-APIs verfügbar; Optimierte Schulungen und keine Mit Bezeichnungen versehenen Laufzeitdaten sind Vorschaufunktionen. | Passt sich schnell an neue Formate oder Sonderfälle an |
Hinweis
In den 2025-11-01 GA- und 2026-06-01-preview APIs sind Konfidenzergebnisse und -bodenung für alle Dokumentfeldtypen (extract, classifyund generate Methoden) verfügbar.
Weitere Informationen zu diesen Features finden Sie unten.
Konfidenzbewertung: Automatisieren mit Kontrolle
Jedes Feld kann eine Konfidenzbewertung zwischen 0 und 1 enthalten, die angibt, wie sicher der Analyser über das Ergebnis ist. Verwenden Sie diesen Wert, um ergebnisse mit hoher Vertrauenswürdigkeit zu automatisieren und Ergebnisse mit niedriger Zuverlässigkeit für die menschliche Überprüfung weiterzuleiten.
Aktivieren Sie Konfidenzbewertungen für alle Felder (oder bestimmte Felder) mithilfe der estimateFieldSourceAndConfidence Eigenschaft. Erfahren Sie mehr über das Konfigurieren von Konfidenzbewertungen für Analysegeräte.
Warum Konfidenzbewertungen wichtig sind
Konfidenzbewertungen ermöglichen Ihnen das Entwerfen von Workflows wie:
- Automatische Genehmigung von Extraktionen, wenn die Vertrauenswürdigkeit über einem definierten Schwellenwert liegt, um Dokumentverarbeitungsaufgaben intelligent zu automatisieren.
- Optimierung der Ressourcenzuordnung durch Reduzierung der Betriebskosten und Verwendung von Human-in-the-Loop-Überprüfungen für kritische Aspekte.
- Das Ablehnen oder Kennzeichnen von Extraktionen unter einem bestimmten Schwellenwert für manuelle Eingriffe, wodurch die Entscheidungsfindungsgenauigkeit verbessert wird.
Example
Sie verarbeiten gescannte Versorgungsrechnungen, um die Rechnungsadresse und den fälligen Betrag zu extrahieren. Für ein Dokument:
- Rechnungsadresse: "1234 Market St., San Francisco, CA" → Konfidenz: 0.96
- Fälliger Betrag: "$128,74" → Konfidenz: 0,52
In diesem Fall kann Ihre Automatisierungspipeline die Rechnungsadresse direkt an Ihre nachgelagerte Anwendung senden, während der zu zahlende Betrag zur Überprüfung an einen Menschen weitergeleitet wird. Durch die Verwendung von Konfidenzergebnissen reduzieren Sie den manuellen Aufwand und behalten gleichzeitig die Genauigkeit bei.
Grounding: Verfolgen Sie jedes Ergebnis bis zu seiner Quelle
Die Verankerung gewährleistet, dass jedes Feld, jede Antwort oder Klassifizierung einen Verweis auf die ursprüngliche Position im Dokument enthält. Dazu gehören Quellinformationen (Seitenzahl und räumliche Koordinaten) und Spannweiten (Offset und Länge).
Warum Erdung wichtig ist
In Unternehmensworkflows reicht die Genauigkeit nicht aus; Sie benötigen auch Rückverfolgbarkeit. Wenn ein Modell einen Kundennamen oder eine Kündigungsklausel extrahiert, müssen Sie überprüfen können, wo diese Informationen stammen. Die Erdung ist entscheidend für:
- Aufrechterhaltung einer klaren Rückverfolgbarkeit und Lokalisierung für extrahierte Klauseln, Finanznummern, Tabellen und Versicherungs-IDs.
- Sicherstellung der Transparenz mit internen Compliance-Prüfungen.
- Unterstützung einer effizienten Schleifenüberprüfung durch Identifizieren der Seite, des Abschnitts und des Inhalts, die den Feldwert bereitgestellt haben.
Example
Sie möchten die Kündigungsklausel aus einem Vertrag extrahieren. Das Modell gibt Folgendes zurück:
- Extrahierter Text: "Beide Parteien können diese Vereinbarung mit 60 Tagen Kündigungsfrist kündigen."
"spans": [
{
"offset": 343,
"length": 102
}
]
-
Quelle: Seite 3, Koordinaten
({x1},{y1},{x2},{y2},{x3},{y3},{x4},{y4})
Spans geben die logische Position des Elements mithilfe des Zeichenoffsets und der Länge an. Die Quelle gibt ihre visuelle Position mit Seitenzahl und Koordinaten des Begrenzungsrahmens an.
Mit diesen Grundlagendaten kann Ihr Rechtsteam die Extraktion überprüfen, indem es direkt zum Quellabsatz in der PDF-Datei springen kann. Dadurch werden Schätzarbeiten beseitigt und Vertrauen in die Anwendungsausgabe entsteht.
Verbessern der Analyseschulung mit beschrifteten Beispielen
Sowohl die 2025-11-01 GA-API als auch die 2026-06-01-preview API unterstützen benutzerdefinierte Dokumentanalysatoren mit beschrifteten Beispieldokumenten. Beide Versionen verwenden denselben Bezeichnungsworkflow in Content Understanding Studio.
Important
Die Schulung unterstützt nur Dokumentanalysatoren und unterstützt derzeit keine Felder, die die generate Methode verwenden.
Wenn der Kontext für alle Felder im Testdokument eindeutig vorhanden ist, reicht möglicherweise ein Zero-Shot-Extraktionsaufruf aus. Folgen Sie zunächst den bewährten Methoden für Schemadefinitionen. Wenn immer noch falsche Feldwerte oder Konfidenzwerte unterhalb des Gerade-Through-Verarbeitungsschwellenwerts angezeigt werden, verwenden Sie beschriftete Beispiele, um die Analyse zu verbessern.
Die beschrifteten Beispieldokumente stellen den Domänenkontext bereit. Indem Sie Feldwerte in repräsentativen Dokumenten korrigieren, zeigen Sie der Analyse die relevanten Layouts, Terminologie, Wertmuster und Konventionen für Ihr Szenario an.
Beschriftete Proben arbeiten, um die Extraktionsqualität zu verbessern:
- Fügen Sie für Datasets mit minimalen Vorlagenvariationen ein einzelnes beschriftetes Beispiel hinzu.
- Fügen Sie für komplexere Variationen ein repräsentatives Beispiel für jede Vorlage oder jedes Format hinzu.
- Bei Dokumenten, die Ergebnisse mit niedriger Konfidenz, unvollständiger Extraktion oder falscher Werte generieren.
- Bewerten Sie die Extraktionsqualität vor und nach dem Training, um zu bestätigen, dass die Proben die Ergebnisse verbessern.
Um ein beschriftetes Beispiel hinzuzufügen, wechseln Sie im Foundry-Portal zu einer Dokumentextraktionsergebnisseite, und wählen Sie die Registerkarte " Etikettendaten " aus. Laden Sie ein Beispiel hoch, und wählen Sie dann "Automatische Bezeichnung" aus. „Automatisch bezeichnen“ führt die vorhandene Analyse aus und füllt Ergebnisse vor, die Sie bearbeiten können.
Bearbeiten Sie alle falschen oder fehlenden Feldwerte. Nach dem Speichern des Beispiels zeigen korrigierte Felder das korrigierte Tag an.
Hinweis
Sie fügen beschriftete Beispiele in Content Understanding Studio hinzu. Nachdem Sie Beispiele hinzugefügt haben, erstellen Sie den Analyzer neu, damit der Analyzer die Beispiele verwenden kann.
Wenn beispielsweise Rechnungen eines neuen Anbieters eine niedrige Konfidenzbewertung oder einen falschen Fälligkeitswert von Betrag erzeugen, fügen Sie eine repräsentative Rechnung hinzu und korrigieren sie die beschrifteten Werte. Das Dokument selbst stellt den Kontext zu den Layout- und Rechnungskonventionen dieses Anbieters bereit.
Der Analyzer generalisiert dann das Muster, um den Wert aus ähnlichen Dokumentvorlagen zu extrahieren.
Verbesserungen der Vorschau-API
Important
DIE API-Version 2026-06-01-preview befindet sich in der öffentlichen Vorschau. Vorschauen werden ohne Vereinbarung auf Serviceebene bereitgestellt und werden für Produktionsworkloads nicht empfohlen. Weitere Informationen finden Sie unter Supplementale Nutzungsbedingungen für Microsoft Azure Previews und das Microsoft Produkt- und Dienstdatenschutz-Zusatz ("DPA").
Die 2026-06-01-preview API verwendet denselben beschrifteten Beispielworkflow, verbessert jedoch die Verwendung der Dokumente. Wenn Sie den Analyzer neu erstellen, werden die relevanten Muster und der Domänenkontext aus den bezeichneten Beispielen in den integrierten Analyzer destilliert.
Der Vorschauschulungsansatz:
- Reduziert den Tokenverbrauch, wenn der Analyzer im Vergleich zum GA-Schulungsansatz ausgeführt wird.
- Enthält oder behält die bezeichneten Beispieldokumente nicht in der integrierten Analyse bei.
- Erfordert nicht, dass die integrierte Analyse zur Analysezeit auf die bezeichneten Beispieldokumente zugreifen kann.
Die beschrifteten Beispieldokumente verbleiben im Speicherkonto, das Ihrem Content Understanding Studio-Projekt zugeordnet ist, nur für Entwurfszwecke. Weitere Informationen finden Sie unter "Daten", "Datenschutz" und "Sicherheit für Inhaltsverständnis".
Einschränkungen
Beschriftete Beispiele beheben keine Probleme bei der Texterkennung. Wenn z. B. der Buchstabe l als Ziffer 1 erkannt wird, verbessert die Bezeichnung des Wertes als Buchstabe l die Extraktionsqualität nicht.
Ein vollständiger Workflow
Wenn Sie eine intelligente Dokumentautomatisierungspipeline erstellen, helfen Ihnen diese Funktionen, Daten zuverlässig zu extrahieren. Wenn Sie z. B. Beschaffungsverträge verarbeiten, können Sie Folgendes extrahieren:
- Lieferantenname
- Anfangs- und Enddaten
- Abbruchklausel
So stellen Sie die Qualität und Vertrauen für das Verständnis von Dokumenten auf Unternehmensmaßstab sicher:
- Grounding bietet Ihrem Team vollständige Rückverfolgbarkeit zu jedem Feld.
- Konfidenzbewertungen helfen Ihnen bei der Automatisierung, da eine menschliche Überprüfung nur erforderlich ist, wenn das Vertrauen niedrig ist.
- Beschriftete Beispiele enthalten Beispiele, die der Analyse helfen, sich an den Domänenkontext, neue Vertragsvorlagen oder Edgefälle anzupassen.