Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Content Understanding bietet anspruchsvolle Dokumentanalysefunktionen. Organisationen können diese Funktionen verwenden, um unstrukturierte Inhalte in umsetzbare und organisierte Daten zu konvertieren. Content Understanding kann anpassbare Analysetools verwenden, um wichtige Informationen, Felder und Beziehungen aus einer Vielzahl von Dokumenten und Formularen zu extrahieren.
Note
- Im Rahmen Azure Inhaltsverständnisfunktionen bietet Azure Document Intelligence eine präzise und zuverlässige deterministische Extraktion aus strukturierten Dokumenten.
- Content Understanding bietet auch LLM-gestützte Analyzer für komplexe, unstrukturierte und multimodale Inhalte.
- Gemeinsam erleichtern sie die Vorbereitung von Daten für intelligente Agents und Anwendungen, die Inhalte in der praxisnahen Welt mit Präzision und Geschwindigkeit lesen, analysieren und darauf reagieren können.
- Wenn Sie beide Dienste vergleichen und ermitteln möchten, welches Szenario am besten geeignet ist, lesen Sie Wählen Sie das richtige Azure KI-Tool für die Dokumentverarbeitung aus.
Anwendungsfälle für Unternehmen
Dokumentanalysatoren können komplexe Dokumente in verschiedenen Formaten und Vorlagen verarbeiten:
- Verwaltung des Vertragslebenszyklus: Extrahieren Sie Schlüsselfelder, Klauseln und Verpflichtungen aus verschiedenen Vertragstypen.
- Kredit- und Hypothekenanwendungen: Automatisieren Sie die Verarbeitung, um eine schnellere Abwicklung durch Banken, Kreditgeber und staatliche Einrichtungen zu ermöglichen.
- Finanzdienstleistungen: Analysieren Sie komplexe Dokumente wie Finanzberichte und Vermögensverwaltungsberichte.
- Spesenverwaltung: Analysieren Sie Quittungen und Rechnungen von verschiedenen Einzelhändlern, um Ausgaben in verschiedenen Formaten und Vorlagen zu überprüfen.
- Versicherungspolizanalyse: Analysieren Sie die Details der Versicherungsrichtlinie, und erstellen Sie ein vollständiges Verständnis der Versicherungsabdeckung und Lücken mithilfe von mehrstufigen Gründen, Berechnungen und Validierungen.
Hauptvorteile
Content Understanding bietet leistungsstarke Dokumentanalysefunktionen, die darauf konzipiert sind, kritische Unternehmens- und Geschäftsszenarien wie Retrieval-augmented Generation (RAG) und die Roboterprozessautomatisierung zu adressieren. Zu den wichtigsten Vorteilen gehören:
- Intelligente Suchaktivierung: Transformieren Sie unstrukturierte Dokumente in strukturierte, durchsuchbare Datenressourcen, um die Auffindbarkeit und Barrierefreiheit von Informationen in Ihrer Organisation zu verbessern.
- Fundierte Datenextraktion: Sorgen Sie für eine klare Rückverfolgbarkeit und Lokalisierung der extrahierten Daten, um effiziente Überprüfungsprozesse mit menschlicher Beteiligung zu ermöglichen und Transparenz und Compliance zu gewährleisten.
- Konfidenzgesteuerte Automatisierung: Nutzen Sie die integrierte Konfidenzbewertung, um Dokumentverarbeitungsaufgaben intelligent zu automatisieren und so die Ressourcenzuweisung zu optimieren, Betriebskosten zu senken und die Genauigkeit Ihrer Entscheidungen zu verbessern.
- Flexible Anpassung: Passen Sie Dokumentanalysetools ganz einfach an bestimmte Geschäftsprozesse und Workflows an. Anpassungen ermöglichen eine präzise Extraktion und Klassifizierung, die auf die spezifischen Anforderungen Ihrer Organisation zugeschnitten ist.
- Verbesserte Genauigkeit und Zuverlässigkeit: Erzielen Sie präzise Extraktion und Klassifizierung kritischer Geschäftsdaten, um Fehler zu reduzieren und die betriebliche Effizienz in automatisierten Workflows zu verbessern.
-
Bereit für die Nutzung von Agenten: Verarbeiten Sie Ihre unterschiedlichen Eingaben und liefern Sie die Ergebnisse in einem Standardformat, das für den Workflow eines Agenten geeignet ist. Ausgabeergebnisse können Ihrer Anwendung ein Verständnis der Benutzerabsicht vermitteln, mit Daten, die von einem
strongly-typedSchema unterstützt werden, was das schnelle Abrufen von Daten in einem formatgerechten Zustand für Ihren Code erleichtert.
Dokumentanalysefunktionen
Inhaltsextraktion
Die Inhaltsextraktion bildet die Grundlage der Dokumentanalysefunktionen für Content Understanding. Dieser Prozess wandelt unstrukturierte Dokumente in strukturierte, maschinenlesbare Daten um. Die Inhaltsextraktion erfasst gedruckten und handgeschriebenen Text präzise und bewahrt gleichzeitig die Struktur des Dokuments durch eine fortschrittliche Layoutanalyse:
- Inhaltsanalyse
- Text: Verarbeitet mehrsprachige Inhalte, einschließlich maschinengedruckter und handschriftlicher Text aus Hunderten von Sprachen.
- Auswahlmarken: Identifiziert und extrahiert Auswahlindikatoren wie Kontrollkästchen, Schaltflächen und ähnliche Markierungen.
- Barcodeerkennung: Überprüft und decodiert Informationen aus über einem Dutzend Arten von linearen und zweidimensionalen Barcodes.
- Mathematische Formeln: Erfasst und behält komplexe mathematische Ausdrücke im LaTeX-Format bei.
- Bildelemente: Sucht und extrahiert Bilder, Abbildungen, Diagramme und Schaubilder zusammen mit ihren zugehörigen Beschriftungen und Anmerkungen.
- Hyperlinkelemente: Erkennt Links, die in das Dokument eingebettet sind.
- Anmerkungselemente: Verknüpft Inhalte mit ihren Anmerkungen wie Durchstreichen, Unterstreichen und Hervorheben.
- Abbildungselemente: Erkennt und extrahiert Abbildungselemente zu einer strukturierten Ausgabe.
- Signaturerkennung: Erkennt Signaturen und gibt ihren Speicherort zusammen mit jedem Text zurück, der innerhalb des Signaturbereichs erkannt wurde.
- Dokumentmetadaten: Extrahiert eingebettete Metadaten, z. B. Autor, Erstellungsdatum und Titel, aus unterstützten Dateitypen.
- Strukturanalyse
- Absätze: Erkennt und kategorisiert Textsegmente basierend auf ihrem Dokumentkontext und ihrer Rolle.
- Tabellarische Daten: Erkennt und extrahiert Tabellenstrukturen, einschließlich komplexer Formate mit übergreifenden Zellen und mehrseitigen Layouts.
- Hierarchische Abschnitte: Strukturiert die Inhalte mit Abschnittsüberschriften und untergeordneten Inhaltsbeziehungen.
- Retrieval-Augmented Generation (RAG)
- RAG-Lösungen: Die Inhaltsextraktion bildet die Grundlage für effektive RAG-Systeme, indem sie unbearbeitete multimodale Daten in strukturierte, durchsuchbare Formate umwandelt, die für die Abfrage optimiert sind. Weitere Informationen zum Erstellen von RAG-Lösungen finden Sie unter Retrieval-Augmented Generation.
Extraktionsmodus
Verwenden Sie extractionMode, um auszuwählen, wie Dokumentinhalte analysiert werden. Verwenden Sie die layoutbasierte Extraktion für strukturierte Dokumente, bei denen Tabellen, Abschnitte und Lesereihenfolgen wichtig sind. Verwenden Sie eine schnellere reine Textextraktion, um sauberes Markdown für RAG- und Dokumentintegrationsszenarien zu erzeugen.
Feldextraktion
Mit der Feldextraktion können Sie strukturierte Daten aus verschiedenen Dokumenten und Formularen extrahieren, klassifizieren und generieren, die an Ihre Anforderungen angepasst sind. Der Prozess der Transformation unstrukturierter Inhalte in organisierte, umsetzbare Informationen vereinfacht die Datenverwaltung, verbessert die Suchbarkeit und unterstützt automatisierte Workflows.
Sie können z. B. Kundendetails, Rechnungsadressen und artikelisierte Gebühren aus Rechnungen extrahieren. Sie können auch Vertragsparteien, Verlängerungsdaten und Zahlungsbedingungen in rechtlichen Vereinbarungen identifizieren.
Um die Effizienz zu maximieren, verwenden Sie vorgefertigte Analysevorlagen, z. B. Vorlagen, die auf Rechnungen zugeschnitten sind. Sie können auch benutzerdefinierte Analysegeräte von Grund auf neu entwerfen, um die Genauigkeit durch Beschriftung weiterer Beispieldokumente zu verbessern.
Die Konfidenz- und Grounding-API ist eine Opt-in-Funktion, die für alle Dokumentfeldtypen verfügbar ist, unabhängig davon, ob sie die extract, classify oder generate-Methode verwenden. Um Vertrauen und Grounding für die Feldextraktion zu schaffen, legen Sie estimateFieldSourceAndConfidence = true in der Analyserkonfiguration fest oder verwenden Sie estimateSourceAndConfidence = true für ein bestimmtes Feld.
Unterstützte typisierte Feldwerte, z. B. Datumsangaben und Zahlen, werden automatisch in ein kanonisches Format normalisiert. Die Normalisierung kann nicht konfiguriert werden. Der zurückgegebene Wert des Felds ist der normalisierte Wert.
Verwenden Sie Konfidenzwerte und Quellverankerung, um Extraktionen mit niedriger Konfidenz oder unzureichender Quellverankerung zur menschlichen Überprüfung weiterzuleiten. Sichern Sie auch in nachgelagerten automatisierten Workflows hochzuverlässige, fundierte Ergebnisse.
Feldextraktionsmethoden
Content Understanding bietet vielseitige Methoden zur Feldextraktion, die eine präzise und maßgeschneiderte Verarbeitung von Dokumentinhalten ermöglichen:
- Extrakt: Extrahieren Sie bestimmte Daten, z. B. Transaktionsdaten aus Quittungen oder Positionen aus Rechnungen, für die genaue und fokussierte Informationserfassung.
- Klassifizieren: Kategorisieren Sie Dokumentinhalte in vordefinierte Kategorien, z. B. die Klassifizierung von Stimmungen in Transkripten von Kundengesprächen oder die Klassifizierung von Posten auf Hotelrechnungen.
- Generieren: Erstellen Sie neue Erkenntnisse oder Zusammenfassungen aus Ihren Dokumenten, einschließlich Dokumentenzusammenfassungen und Kapitelübersichten, um die Barrierefreiheit und Verständlichkeit der Inhalte zu verbessern.
Agentenmodus (Vorschau)
Verwenden Sie für Szenarien, in denen die Antwort nicht direkt in einem Feld vorhanden ist und aus Nachweisen in einem Dokument erstellt werden muss, den agentischen Modus. Der agentenbasierte Modus verarbeitet ein Dokument, um mehrstufige Berechnungen, Validierungen anhand einer Reihe von Bedingungen und Analysen komplexer Tabellen oder Abbildungen zu unterstützen. Sie ist mit API-Version 2026-06-01-previewverfügbar, und die anfängliche Vorschau unterstützt eine Eingabedatei pro Analyseanforderung.
Eingabeanforderungen
Weitere Informationen zu unterstützten Eingabedokumentformaten finden Sie unter Dienstkontingente und Grenzwerte.
Unterstützte Sprachen und Regionen
Eine Liste der unterstützten Sprachen und Regionen finden Sie unter Sprach- und Regionsunterstützung.
Daten, Datenschutz und Sicherheit
Wenn Sie Inhaltsverständnis verwenden, lesen Sie die Microsoft-Richtlinien für Kundendaten. Weitere Informationen finden Sie unter "Daten", "Datenschutz" und "Sicherheit".
Verwandte Inhalte
- Versuchen Sie, Ihre Dokumentinhalte mithilfe von Content Understanding Studio zu verarbeiten.
- Sehen Sie sich die Schnellstartanleitung von Content Understanding Studio an.
- Erfahren Sie, wie Sie Dokumentinhalte mithilfe von Analysevorlagen analysieren.
- Sehen Sie sich Codebeispiels mit visueller Dokumentsuche an.