Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
In diesem Artikel wird eine Lösung zum Extrahieren von Text aus Bildern vorgestellt, sodass er in Microsoft 365 indiziert und abgerufen werden kann. Mithilfe von AI Builder und Azure Document Intelligence in Foundry Tools können Sie einen Power Automate-Workflow konfigurieren, der ein trainiertes Modell verwendet, um Text aus Bildern zu extrahieren. Nachdem Sie den Workflow konfiguriert haben, können Sie dokumente schnell nach aussagekräftigem Text durchsuchen, der in Formen und Objekten eingebettet ist. Sie können z. B. technische Schematik für die Teilenummer innerhalb einer bestimmten Komponente durchsuchen oder jedes Ventil finden, das in einer Reihe von Anlagendiagrammen beschriftet ist, ohne jede Datei manuell zu öffnen und zu scannen.
Aufbau
Laden Sie eine Visio-Datei dieser Architektur herunter.
Arbeitsablauf
Die folgenden Workflowschritte entsprechen den Zahlen im vorherigen Diagramm:
- Ein Hersteller trainiert ein Objekterkennungsmodell in AI Builder, um bestimmte Objekte zu erkennen.
- Ein Benutzer lädt ein Dokument, das Text in Objekten enthält, in eine SharePoint oder OneDrive Dokumentbibliothek hoch, entweder direkt oder über Microsoft Teams.
- Das Upload-Ereignis löst einen Power-Automate-Flow aus.
- Der Flow wendet das AI Builder-Modell auf das hochgeladene Dokument an, um Objekte zu erkennen. AI Builder gibt eine JSON-Datei zurück, die die Pixelkoordinaten aller erkannten Objekte enthält.
- Power Automate sendet das Dokument auch an Azure Document Intelligence in Foundry Tools für einen vollständigen OCR-Scan (Optische Zeichenerkennung). Document Intelligence gibt eine JSON-Datei zurück, die den extrahierten Text und seine Pixelkoordinaten enthält.
- Der Fluss ruft eine Funktion in Azure Functions auf, die die Pixelkoordinaten aus den Ausgaben AI Builder und Dokumentintelligenz vergleicht. Wenn erkannte Objekte sich mit extrahiertem Text überschneiden, gibt die Funktion den zugehörigen Text und die Objektinformationen als JSON-Payload zurück.
- Der Fluss schreibt den übereinstimmenden Text und die Metadaten in das ursprüngliche Dokument in Microsoft 365.
- Microsoft Search die neuen Metadaten des Dokuments indiziert, sodass es über Microsoft 365 auffindbar ist.
- Benutzer können mithilfe von PnP Modern Search-Webparts nach den Metadaten in SharePoint suchen.
Komponenten
Diese Lösung verwendet die folgenden Komponenten aus Microsoft Power Platform, Azure und Microsoft 365.
Microsoft Power Platform
- AI Builder ist eine Microsoft Power Platform Funktion, mit der Entwickler KI zu Apps und Flüssen hinzufügen können. In diesem Szenario werden AI Builder verwendet, um ein benutzerdefiniertes Objekterkennungsmodell zu trainieren und auszuführen, das Objekte identifiziert, die für Bilder von Interesse sind.
- Power Automate ist ein Workflowdienst mit geringem Code, der Aktionen über Apps und Dienste hinweg automatisiert. In diesem Szenario orchestriert Power Automate den Ablauf vom Auslöser für das Hochladen von Dokumenten bis hin zum Zurückschreiben der extrahierten Metadaten in SharePoint-Bibliotheken.
Azure
- Document Intelligence ist ein cloudbasierter Foundry Tools-Dienst, der maschinelles Lernen verwendet, um OCR und intelligente Dokumentverarbeitung zu erledigen. In diesem Szenario wird bei jedem hochgeladenen Dokument eine OCR-Überprüfung auf ganzseitiger Seite durchgeführt und extrahierter Text mit Pixelkoordinaten zurückgegeben.
- Azure Functions ist ein ereignisgesteuerter serverloser Computedienst. In diesem Szenario wird eine HTTP-ausgelöste Funktion zum Hosten der Geometrielogik verwendet, die die von AI Builder und Dokumentintelligenz zurückgegebenen Pixelkoordinaten vergleicht und den überschneidenden Text zurückgibt. Power Automate ruft die Funktion über HTTP auf und verwendet die Antwort, sodass ein HTTP-Trigger geeignet ist.
Microsoft 365
- SharePoint, OneDrive und Teams in Microsoft 365 sind die Uploadquellen, die den Power Automate Fluss auslösen, und sind auch die Speicherziele, an denen der Fluss die extrahierten Metadaten schreibt.
- Microsoft Search die extrahierten Textmetadaten indiziert, sodass sie über Microsoft 365 auffindbar werden.
- Die moderne PnP-Suche ist eine Reihe von Open Source-SharePoint Webparts, die Sie verwenden können, um flexible, personalisierte Suchfunktionen mithilfe des Microsoft Search Index zu erstellen.
Alternativen
- Verwenden Sie Azure Inhaltsverständnis für unstrukturierte oder multimodale Eingaben. Document Intelligence ist Teil von Azure Content Understanding in Foundry Tools, das LLM-gestützte Analysetools für unstrukturierte und multimodale Inhalte bereitstellt. Wenn Ihre Eingaben unstrukturierte Inhalte wie Freihandformbilder, Audio oder Video zusätzlich zu strukturierten Dokumenten enthalten, oder Sie müssen über den Inhalt nachdenken, anstatt ihn einfach zu transkribieren, erwägen Sie die Verwendung von Inhaltsverständnistools. Beispielsweise müssen Sie die Überarbeitungsnotizen einer technischen Zeichnung zusammenfassen, ein Diagramm nach Gerätetyp klassifizieren oder Fragen beantworten, die das Interpretieren des Inhalts erfordern, nicht nur das Lesen des Texts. Weitere Informationen finden Sie unter Auswählen der richtigen Foundry Tools für die Dokumentverarbeitung.
- Verwenden Sie Document Intelligence allein. Wenn Sie OCR-Ergebnisse nicht auf bestimmte Objekte in einem Bild beschränken müssen, können Sie AI Builder und die App für die Geometrievergleichsfunktion überspringen und Azure Document Intelligence verwenden, um OCR im gesamten Dokument auszuführen. Lassen Sie dann Power Automate den resultierenden Text als Metadaten in Microsoft 365 speichern.
- Verwenden Sie integrierte SharePoint OCR. SharePoint in Microsoft 365 können OCR für Bilder und PDF-Dateien ausführen und den extrahierten Text zum Suchindex hinzufügen. Diese Option erfordert keinen benutzerdefinierten Fluss, macht aber auch nicht das strukturierte Objekt und die Koordinatenzuordnung verfügbar, die die aktuelle Lösung bereitstellt.
- Verwenden Sie Azure Logic Apps für die Verarbeitung großer Volumina. Wenn Sie Dokumente mit hoher Rate verarbeiten oder Power Automate Drosselung pro Fluss vermeiden möchten, ersetzen Sie Power Automate durch Logik-Apps, die dedizierte Workflowebenen und höhere Aktionsgrenzwerte bieten. Weitere Informationen finden Sie unter Logic Apps limits and configuration.
Szenario-Details
Schematische und industrielle Diagramme enthalten häufig Objekte, die Text enthalten. Beispielsweise kann ein Gebäudeplan einzelne Räume, Elektrische Schaltkreise und HVAC-Geräte bezeichnen oder ein technisches Schema eine Teilenummer innerhalb der einzelnen Komponenten anzeigen. Das manuelle Scannen dieser Dokumente auf relevanten Text ist mühsam und zeitaufwändig. Diese Lösung kombiniert ein benutzerdefiniertes Objekterkennungsmodell mit OCR, sodass Sie nach eingebettetem Text nach dem darin angezeigten Objekt suchen können, nicht nur durch das Dokument, in dem es sich befindet.
Mögliche Anwendungsfälle
- Technische Schematik. Komplexe Schematika enthalten viele Objekttypen, z. B. Komponenten, Legenden und Revisionsblöcke. Verwenden Sie diese Lösung, um bestimmte Komponenten in einem Schaltplan schnell zu finden. Durchsuchbarer eingebetteter Text ist nützlich, um Untersuchungen durchzuführen, Teileengpässe zu identifizieren und Rückruf- und Fehlerhinweise zu finden.
- Industrielle Diagramme. Diagramme, die eine Fertigungsassembly beschreiben, bezeichnen häufig Pumpen, Ventile, automatisierte Schalter und andere Komponenten. Die Indizierung des Texts innerhalb dieser Objekte unterstützt präventive Wartung, Isolierung gefährlicher Komponenten und Sichtbarkeit des Risikomanagements.
- Architektur- und Facility-Zeichnungen. Grundrisse, Elektropläne und Heizungs-, Lüftungs- und Klimapläne kennzeichnen Räume, Stromkreise und Geräte. Das Indizieren dieser Bezeichnungen erleichtert das Auffinden bestimmter Objekte in einem großen Zeichnungssatz.
Considerations
Diese Überlegungen bilden die Säulen des Azure Well-Architected Framework, einer Reihe von Leitprinzipien, die Sie zur Verbesserung der Qualität eines Workloads verwenden können. Weitere Informationen finden Sie unter Well-Architected Framework.
Reliability
Zuverlässigkeit trägt dazu bei, dass Ihre Anwendung die Verpflichtungen erfüllen kann, die Sie für Ihre Kunden vornehmen. Weitere Informationen finden Sie unter Prüfliste zur Entwurfsüberprüfung für Zuverlässigkeit.
- Planen Sie für vorübergehende Ausfälle. Dokumentintelligenz gibt HTTP 429-Fehler zurück, wenn gleichzeitige Anforderungsgrenzwerte überschritten werden. Ein Power Automate-Flow ruft Document Intelligence direkt auf. Konfigurieren Sie daher für diese Aktion im Flow Wiederholungen mit exponentiellem Backoff.
- Machen Sie den Fluss idempotent. SharePoint und OneDrive Trigger können Ereignisse wiedergeben. Entwerfen Sie den Power-Automate-Flow und die nachgelagerten Metadatenschreibvorgänge so, dass sie auch dann sicher funktionieren, wenn ein Dokument mehr als einmal verarbeitet wird. Beispiel: Upsert-Metadaten, die auf die Dokument-ID festgelegt sind.
- Verarbeiten Sie lang andauernde OCR-Scans. OCR von großen, mehrseitigen Dokumenten kann lange dauern, und Document Intelligence verarbeitet die Vorgänge als asynchron. Entwerfen Sie den Power Automate-Fluss, der die Dokumentintelligenz aufruft, um das Dokument zu übermitteln und das Ergebnis abzufragen, anstatt eine sofortige Antwort zu erwarten. Implementieren Sie eine Zeitüberschreitungsbehandlung, damit ein langsamer Scan nicht dazu führt, dass ein Durchlauf fehlschlägt.
- Informieren Sie sich über die Dienstebenenvereinbarung (SLA) für jeden Dienst. Überprüfen Sie die SLAs und Wiederherstellungsmerkmale für Document Intelligence, Funktionen und Power Automate, um sicherzustellen, dass Ihre Zuverlässigkeitsziele erreichbar sind.
Sicherheit
Sicherheit bietet Schutz vor vorsätzlichen Angriffen und dem Missbrauch Ihrer wertvollen Daten und Systeme. Weitere Informationen finden Sie unter Entwurfsprüfliste für die Sicherheit.
- Verwenden Sie verwaltete Identität, keine Schlüssel. Konfigurieren Sie die Azure-Funktion für die Authentifizierung bei AI Builder und Dokumentintelligenz mithilfe von Microsoft Entra ID mit einer vom System zugewiesenen oder vom Benutzer zugewiesenen verwalteten Identität. Dieser Ansatz entfernt die Notwendigkeit, Dienstschlüssel zu speichern.
- Speichern Sie alle verbleibenden geheimen Schlüssel in Azure Key Vault. Wenn Sie z. B. Schlüssel in einem Power Automate Connector verwenden müssen, speichern Sie die Schlüssel in Key Vault, und rufen Sie sie zur Laufzeit mithilfe des Azure Key Vault-Connectors ab. Zum Einrichten des Connectors muss eine Verbindung mit einem unterstützten Microsoft Entra Authentifizierungstyp erstellt werden. Informationen zu den Verbindungsoptionen finden Sie in der Azure Key Vault Connectorreferenz und in der get secret-Aktion. Die get-secret-Ausgabe könnte im Ausführungsverlauf des Flows erscheinen. Stellen Sie daher sicher, dass der Zugriff auf den Ausführungsverlauf geschützt ist.
- Dokumentberechtigungen respektieren. Wenn Sie extrahierten Text als SharePoint Metadaten zurückschreiben, stellen Sie sicher, dass die indizierten Metadaten die Berechtigungen des Quelldokuments erben, damit suchergebnisse ordnungsgemäß gekürzt werden.
- Plan für sensible Inhalte. OCR-Ausgabe kann personenbezogene Daten, geheime Daten oder andere vertrauliche Inhalte enthalten. Wenden Sie Microsoft Purview Vertraulichkeitsbezeichnungen und Richtlinien zur Verhinderung von Datenverlust bei Bedarf auf Dokumente und deren Metadaten an.
- Isolieren Sie das Netzwerk. Für regulierte Workloads, die eine Netzwerkisolation erfordern, integrieren Sie die Funktionen-App in Ihr virtuelles Netzwerk und verwenden private Endpunkte für AI Builder und Dokumentintelligenz.
- Wenden Sie auf Connectors das Prinzip der geringsten Rechte an. Gewähren Sie Verbindungen in Power Automate nur den geringstmöglichen erforderlichen Umfang, z. B. Zugriff auf eine einzelne SharePoint-Website statt auf den gesamten Mandanten.
Kostenoptimierung
Die Kostenoptimierung konzentriert sich auf Möglichkeiten, unnötige Ausgaben zu reduzieren und die betriebliche Effizienz zu verbessern. Weitere Informationen finden Sie unter Design Review-Checkliste für die Kostenoptimierung.
- Wählen Sie die richtige Dokumentintelligenzebene aus. Document Intelligence wird pro Seite abgerechnet und bietet einen kostenlosen (F0)- und einen Standardtarif (S0). Schätzen Sie das Seitenvolumen mithilfe des Azure Preisrechners, und wählen Sie die entsprechende Stufe aus, bevor Sie zur Produktion wechseln.
- Filtern Sie vor dem Anruf. Verwenden Sie eine Power Automate Bedingung, um nicht unterstützte Dateien zu überspringen, sodass Sie keine Kapazität für irrelevante Uploads verbrauchen. Wenn Sie PDF-Dateien akzeptieren, rendern Sie jede Seite in einem unterstützten Bildformat, und senden Sie dasselbe Seitenbild an AI Builder und Dokumentintelligenz, sodass beide Ausgaben denselben Pixelkoordinatenbereich verwenden. Bewahren Sie die PDF-Seitenzahl mit jedem Bild auf, bevor Sie die Ergebnisse abgleichen.
- Planen Sie den Verbrauch von AI Builder-Credits. AI Builder wird durch Gutschriften lizenziert, die sie pro Modellausführung verbraucht. Überprüfen Sie die Lizenzierung und AI Builder Credits, und fügen Sie kapazität hinzu, wenn Sie sie benötigen.
- Wählen Sie die richtige Power Automate Lizenz aus. Wählen Sie einen Power Automate Premium-Benutzer oder Power Automate Prozesslizenz aus, je nachdem, ob Sie einzelne Benutzer oder den Fluss selbst lizenzieren müssen.
- Schätzen sie Azure Kosten. Verwenden Sie die vorkonfigurierte Schätzung im Azure Preisrechner für die ungefähren Azure Servicekosten für dieses Szenario. Passen Sie die Werte an das erwartete Dokumentvolumen an. Diese Schätzung deckt nur die Azure Dienste in diesem Szenario ab, einschließlich Azure Document Intelligence S0-Ebene für die OCR-Verarbeitung und Azure Functions Verbrauchsplan für die Pixelkoordinatenabgleichslogik. Power Platform AI Builder und Power Automate Komponenten und Microsoft 365 SharePoint, OneDrive und Teams werden separat lizenziert und sind in dieser Schätzung nicht enthalten.
Betriebliche Effizienz
Operational Excellence deckt die Betriebsprozesse ab, mit denen eine Anwendung bereitgestellt und in der Produktion ausgeführt wird. Weitere Informationen finden Sie in der Prüfliste für das Design Review von Operational Excellence.
- Verwenden Sie Power Platform-Lösungen für die Anwendungslebenszyklusverwaltung (APPLICATION Lifecycle Management, ALM). Paketieren Sie den Flow, benutzerdefinierte Konnektoren und das AI Builder-Modell in einer Power Platform-Lösung, damit Sie sie zwischen Entwicklungs-, Test- und Produktionsumgebungen verschieben können.
- Verwenden Sie die Quellcodeverwaltung für die Azure-Funktion. Speichern Sie die Funktion in GitHub oder Azure DevOps, und stellen Sie sie über eine fortlaufende Integrations- und Kontinuierliche Übermittlungspipeline (CI/CD) bereit. Weitere Informationen finden Sie unter Continuous deployment for Azure Functions.
- Überwachen Sie alle Ebenen. Instrumentieren Sie die Azure-Funktion mit Application Insights, überwachen Sie Flowausführungen im Power Platform Admin Center und die Nutzung und Drosselung von Document Intelligence in Azure Monitor.
- Trainieren Sie Modelle planmäßig neu. Objekterkennungsmodelle driften ab, wenn sich Quelldokumente weiterentwickeln. Richten Sie einen Umschulungsrhythmen für das AI Builder-Modell ein und verfolgen Sie ihre Genauigkeit im Laufe der Zeit.
- Verwenden Sie die Versionsverwaltung für das Metadatenschema. Behandeln Sie die SharePoint Metadatenspalten als Vertrag. Planen Sie, wie Sie sie aktualisieren, ohne die Aufnahme und vorhandene Suchfunktionen zu unterbrechen.
Leistungseffizienz
Leistungseffizienz bezieht sich auf die Fähigkeit Ihrer Arbeitslast, effizient auf die Anforderungen der Benutzer zu skalieren. Weitere Informationen finden Sie in der Checkliste zur Entwurfsüberprüfung für die Leistungseffizienz.
- Verstehen Sie Dienstgrenzwerte. Überprüfen Sie die Document Intelligence-Dienstkontingente und -grenzwerte sowie die AI Builder Grenzwerte, bevor Sie den Durchsatz planen. Beantragen Sie Kontingenterhöhungen frühzeitig, wenn Sie ein hohes Anfragevolumen erwarten.
- Verarbeiten Sie Dokumente parallel. Power Automate startet standardmäßig separate, durch Upload ausgelöste Flowausführungen parallel. Wenn Sie den Ablauf zur Verarbeitung von Dokumentstapeln neu gestalten, aktivieren Sie die Parallelverarbeitung und begrenzen Sie den Parallelitätsgrad, um innerhalb der Grenzwerte von AI Builder und Document Intelligence zu bleiben.
- Vorverarbeitung von Bildern zur Genauigkeit. Die Eingabe mit höherer Qualität reduziert die Wiederholungen. Erwägen Sie, zu große Bilder zu verkleinern, die Ausrichtung zu vereinheitlichen und unnötige weiße Ränder zuzuschneiden, bevor Sie Bilder an AI Builder und Document Intelligence senden.
- Kaltstarts verringern. Falls Latenz wichtig ist, verwenden Sie immer bereite Instanzen mit dem Flex Consumption-Plan und fügen Sie vorgewärmte Instanzen mit dem Premium-Plan hinzu, um Cold-Start-Verzögerungen zu reduzieren.
- Berücksichtigen Sie Logik-Apps für hohe Lautstärke. Für Szenarien mit hohem Durchsatz bietet logic Apps Standard höhere Aktionsgrenzwerte und eine dedizierte Laufzeit, die besser skaliert werden kann als Power Automate.
Beitragende
Microsoft verwaltet diesen Artikel. Die folgenden Mitwirkenden haben diesen Artikel geschrieben.
Hauptautor:
- Steve Pucelik | Sr. Product Manager
Andere Mitwirkende:
- Lohith G N | Senior CSA, Cloud & AI Platform
Um nicht öffentliche LinkedIn-Profile zu sehen, melden Sie sich bei LinkedIn an.
Nächste Schritte
- Was ist die Azure-Dokumentenintelligenz in den Foundry-Tools?
- Benutzerdefinierte Dokumentintelligenzmodelle
- Übersicht über AI Builder in Power Automate
- Extrahieren von Text aus Objekten (Power Platform-Communityblogbeitrag)