Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
W tym artykule przedstawiono rozwiązanie do wyodrębniania tekstu z obrazów, dzięki czemu można je indeksować i pobierać w Microsoft 365. Korzystając z AI Builder i Azure Document Intelligence w usłudze Foundry Tools, można skonfigurować przepływ pracy Power Automate wykorzystujący wytrenowany model do wyodrębniania tekstu z obrazów. Po skonfigurowaniu przepływu pracy można szybko wyszukiwać dokumenty pod kątem znaczącego tekstu osadzonego w kształtach i obiektach. Można na przykład wyszukać schematy inżynieryjne dla numeru części wewnątrz określonego składnika lub znaleźć każdy zawór oznaczony w zestawie diagramów roślin bez otwierania i skanowania każdego pliku ręcznie.
Architektura
Pobierz plik programu Visio z tą architekturą.
Workflow
Następujące kroki przepływu pracy odpowiadają liczbom na powyższym diagramie:
- Twórca trenuje model wykrywania obiektów w AI Builder w celu rozpoznawania określonych obiektów.
- Użytkownik przekazuje dokument zawierający tekst w obiektach do biblioteki dokumentów SharePoint lub OneDrive, bezpośrednio lub za pośrednictwem Microsoft Teams.
- Zdarzenie przesyłania uruchamia przepływ Power Automate.
- Przepływ uruchamia model AI Builder na podstawie przesłanego dokumentu, aby wykryć obiekty. AI Builder zwraca plik JSON zawierający współrzędne pikseli wszystkich wykrytych obiektów.
- Power Automate wysyła również dokument do Azure Document Intelligence in Foundry Tools w celu przeprowadzenia pełnego skanowania optycznego rozpoznawania znaków (OCR). Analiza dokumentów zwraca plik JSON zawierający wyodrębniony tekst i współrzędne pikseli.
- Przepływ wywołuje funkcję w Azure Functions, która porównuje współrzędne pikseli w danych wyjściowych AI Builder i Document Intelligence. Gdy wykryte obiekty nakładają się na wyodrębniony tekst, funkcja zwraca dopasowany tekst oraz informacje o obiekcie w postaci ładunku JSON.
- Przepływ zapisuje dopasowany tekst i metadane do oryginalnego dokumentu w Microsoft 365.
- Microsoft Search indeksuje nowe metadane dokumentu, dzięki czemu można je odnaleźć w Microsoft 365.
- Użytkownicy mogą wyszukiwać metadane w SharePoint za pomocą składników Web Part PnP Modern Search.
Składniki
To rozwiązanie korzysta z następujących składników z Microsoft Power Platform, Azure i Microsoft 365.
Microsoft Power Platform
- AI Builder to funkcja Microsoft Power Platform, która umożliwia twórcom dodawanie sztucznej inteligencji do aplikacji i przepływów. W tym scenariuszu użyto AI Builder do trenowania i uruchamiania niestandardowego modelu wykrywania obiektów, który identyfikuje interesujące obiekty obrazów.
- Power Automate to usługa przepływu pracy o niskim kodzie, która automatyzuje akcje w aplikacjach i usługach. W tym scenariuszu Power Automate orkiestruje przepływ rozpoczynający się od wyzwalacza przekazywania dokumentu za pomocą zapisywania wyodrębnionych metadanych z powrotem do bibliotek SharePoint.
Azure
- Analiza dokumentów to oparta na chmurze usługa narzędzi Foundry, która używa uczenia maszynowego do przetwarzania OCR i inteligentnego przetwarzania dokumentów. W tym scenariuszu wykonuje pełne skanowanie OCR dla każdego przekazanego dokumentu i zwraca wyodrębniony tekst ze współrzędnymi pikseli.
- Azure Functions to bezserwerowa usługa obliczeniowa oparta na zdarzeniach. W tym scenariuszu użyto funkcji wyzwalanej przez protokół HTTP do obsługi logiki geometrycznej, która porównuje współrzędne pikseli zwracane przez AI Builder i Document Intelligence oraz zwraca nakładający się tekst. Power Automate wywołuje funkcję za pośrednictwem protokołu HTTP i używa odpowiedzi, więc wyzwalacz HTTP jest odpowiedni.
Microsoft 365
- SharePoint, OneDrive i Teams w Microsoft 365 to źródła przekazywania plików, które wyzwalają przepływ Power Automate, a także docelowe lokalizacje magazynowania, w których przepływ zapisuje wyodrębnione metadane.
- Microsoft Search indeksuje wyodrębnione metadane tekstowe, dzięki czemu staje się możliwe do odnalezienia w Microsoft 365.
- PnP Modern Search to zestaw składników Web Part dla platformy SharePoint o otwartym kodzie źródłowym, których można używać do tworzenia elastycznych, spersonalizowanych funkcji wyszukiwania z wykorzystaniem indeksu Microsoft Search.
Alternatywy
- Użyj usługi Azure Content Understanding dla nieustrukturyzowanych lub wielomodalnych danych wejściowych. Analiza dokumentów jest częścią Azure Content Understanding w narzędziach Foundry Tools, która dodaje analizatory oparte na języku LLM dla zawartości nieustrukturyzowanej i wielomodalnej. Jeśli dane wejściowe obejmują nieustrukturyzowane treści, takie jak obrazy o dowolnej formie, dźwięk lub wideo, oprócz dokumentów ustrukturyzowanych, albo musisz analizować treść i wyciągać wnioski na jej podstawie, a nie tylko ją transkrybować, rozważ użycie narzędzi Content Understanding. Na przykład może być konieczne podsumowanie notatek o poprawkach na rysunku inżynieryjnym, sklasyfikowanie diagramu według typu sprzętu lub udzielenie odpowiedzi na pytania wymagające interpretacji zawartości, a nie tylko odczytanie tekstu. Aby uzyskać więcej informacji, zobacz Jak wybrać odpowiednie narzędzia Foundry do przetwarzania dokumentów.
- Korzystaj tylko z usługi Document Intelligence. Jeśli nie musisz ograniczać zakresu wyników OCR do określonych obiektów na obrazie, możesz pominąć AI Builder i aplikację funkcji porównania geometrii i użyć Azure Document Intelligence do uruchomienia OCR w całym dokumencie. Następnie poleć usłudze Power Automate zapisać uzyskany tekst jako metadane w Microsoft 365.
- Użyj wbudowanego SharePoint OCR. SharePoint w usłudze Microsoft 365 może przeprowadzać OCR na obrazach i w plikach PDF oraz dodawać wyodrębniony tekst do indeksu wyszukiwania. Ta opcja nie wymaga niestandardowego przepływu, ale nie udostępnia też strukturyzowanego obiektu ani mapowania współrzędnych, które zapewnia obecne rozwiązanie.
- Użyj Azure Logic Apps do przetwarzania dużego woluminu. Jeśli chcesz przetwarzać dokumenty z dużą przepustowością lub uniknąć ograniczania przepustowości poszczególnych przepływów w usłudze Power Automate, zastąp Power Automate usługą Logic Apps, która oferuje dedykowane warstwy przepływów pracy i wyższe limity akcji. Aby uzyskać więcej informacji, zobacz Logic Apps limits and configuration (Limity i konfiguracja usługi Logic Apps).
Szczegóły scenariusza
Schematowe i przemysłowe diagramy często zawierają obiekty zawierające tekst. Na przykład plan budynku może oznaczać poszczególne pomieszczenia, obwody elektryczne i sprzęt HVAC lub schemat inżynieryjny może zawierać numer części wewnątrz każdego składnika. Ręczne skanowanie tych dokumentów pod kątem odpowiedniego tekstu jest pracochłonne i czasochłonne. To rozwiązanie łączy niestandardowy model wykrywania obiektów z funkcją OCR, dzięki czemu można wyszukiwać osadzony tekst przez wyświetlany obiekt, a nie tylko przez dokument, w którym się znajduje.
Potencjalne przypadki użycia
- Schematy inżynieryjne. Złożone schematy zawierają wiele typów obiektów, takich jak komponenty, odnośniki i tabliczki zmian. Użyj tego rozwiązania, aby szybko znaleźć określone składniki w schemacie. Tekst osadzony z możliwością wyszukiwania jest przydatny do przeprowadzania badań, identyfikowania niedoborów części oraz znajdowania powiadomień o odwołaniu i niepowodzeniu.
- Diagramy przemysłowe. Diagramy przedstawiające układ montażowy często zawierają oznaczenia pomp, zaworów, automatycznych przełączników i innych elementów. Indeksowanie tekstu wewnątrz tych obiektów obsługuje konserwację zapobiegawczą, izolację niebezpiecznych składników oraz widoczność zarządzania ryzykiem.
- Rysunki architektoniczne i obiektowe. Rzuty kondygnacji, schematy elektryczne i rysunki HVAC oznaczają pomieszczenia, obwody i urządzenia. Indeksowanie tych etykiet ułatwia lokalizowanie określonych zasobów w dużym zestawie rysunków.
Zagadnienia do rozważenia
Te zagadnienia obejmują implementację filarów platformy Azure Well-Architected Framework, która jest zestawem wytycznych, których można użyć do poprawy jakości obciążenia. Aby uzyskać więcej informacji, zobacz Well-Architected Framework.
Reliability
Niezawodność pomaga zapewnić, że aplikacja może spełnić zobowiązania podjęte przez klientów. Aby uzyskać więcej informacji, zobacz Lista kontrolna przeglądu projektu dotycząca niezawodności.
- Planuj z myślą o przejściowych awariach. Analiza dokumentów zwraca błędy HTTP 429 w przypadku przekroczenia limitów żądań współbieżnych. Przepływ Power Automate wywołuje bezpośrednio usługę Document Intelligence, dlatego skonfiguruj dla tej akcji ponawianie prób z wykładniczo wydłużanym odstępem.
- Skonfiguruj przepływ tak, aby był idempotentny. wyzwalacze SharePoint i OneDrive mogą odtwarzać zdarzenia. Zaprojektuj przepływ Power Automate i zapisy metadanych podrzędnych, aby były bezpieczne, gdy dokument jest przetwarzany więcej niż raz. Na przykład wstawić lub zaktualizować metadane powiązane z identyfikatorem dokumentu.
- Obsługa długotrwałych skanów OCR. Funkcja OCR dużych, wielostronicowych dokumentów może zająć dużo czasu, a analiza dokumentów przetwarza operacje jako asynchroniczne. Zaprojektuj przepływ Power Automate, który wywołuje analizę dokumentów w celu przesłania dokumentu i sondowania wyniku, zamiast oczekiwać natychmiastowej odpowiedzi. Dodaj obsługę limitu czasu, aby powolne skanowanie nie powodowało niepowodzenia uruchomienia.
- Zapoznaj się z umową dotyczącą poziomu usług (SLA) dla każdej usługi. Przejrzyj umowy SLA i charakterystyki odzyskiwania dla usług Document Intelligence, Functions i Power Automate, aby upewnić się, że Twoje cele niezawodności są możliwe do osiągnięcia.
Zabezpieczenia
Zabezpieczenia zapewniają ochronę przed celowymi atakami i nadużyciami cennych danych i systemów. Aby uzyskać więcej informacji, zobacz Lista kontrolna przeglądu projektu dotycząca zabezpieczeń.
- Użyj tożsamości zarządzanej, a nie kluczy. Skonfiguruj funkcję Azure w celu uwierzytelniania w usłudze AI Builder i analizy dokumentów przy użyciu Microsoft Entra ID z tożsamością zarządzaną przypisaną przez system lub przypisaną przez użytkownika. Takie podejście eliminuje konieczność przechowywania kluczy usługi.
- Przechowuj wszystkie pozostałe wpisy tajne w Azure Key Vault. Jeśli musisz użyć kluczy, na przykład w łączniku Power Automate, zapisz klucze w Key Vault i pobierz je w czasie wykonywania przy użyciu łącznika Azure Key Vault. Skonfigurowanie łącznika wymaga utworzenia połączenia z obsługiwanym typem uwierzytelniania Microsoft Entra. Informacje o opcjach połączenia można znaleźć w dokumentacji referencyjnej łącznika Azure Key Vault oraz w akcji pobierania wpisu tajnego. Dane wyjściowe polecenia get-secret mogą pojawić się w historii uruchomienia przepływu, dlatego zadbaj o odpowiednie zabezpieczenie dostępu do tej historii.
- Przestrzegaj uprawnień dostępu do dokumentu. Podczas zapisywania wyodrębnionego tekstu jako metadanych w usłudze SharePoint upewnij się, że indeksowane metadane dziedziczą uprawnienia dokumentu źródłowego, aby wyniki wyszukiwania były prawidłowo filtrowane pod kątem uprawnień.
- Planowanie zawartości poufnej. Dane wyjściowe OCR mogą zawierać dane osobowe, wpisy tajne lub inną poufne treści. Zastosuj Microsoft Purview etykiety poufności i zasady ochrony przed utratą danych do dokumentów i ich metadanych zgodnie z potrzebami.
- Izoluj sieć. W przypadku obciążeń regulowanych wymagających izolacji sieciowej należy zintegrować aplikację usługi Functions z siecią wirtualną i używać prywatnych punktów końcowych na potrzeby AI Builder i analizy dokumentów.
- Zastosuj najmniejsze uprawnienia do łączników. W Power Automate nadaj połączeniom minimalny wymagany zakres, na przykład do pojedynczej witryny SharePoint, a nie do całej dzierżawy.
Optymalizacja kosztów
Optymalizacja kosztów koncentruje się na sposobach zmniejszenia niepotrzebnych wydatków i poprawy wydajności operacyjnej. Aby uzyskać więcej informacji, zobacz Lista kontrolna przeglądu projektu dotycząca optymalizacji kosztów.
- Wybierz odpowiednią warstwę analizy dokumentów. Usługa Document Intelligence jest rozliczana za stronę i oferuje bezpłatną warstwę cenową (F0) oraz standardową warstwę cenową (S0). Szacuj wolumin strony przy użyciu kalkulatora cen Azure i wybierz odpowiednią warstwę przed przejściem do środowiska produkcyjnego.
- Filtruj przed wykonaniem wywołania. Użyj warunku w Power Automate, aby pomijać nieobsługiwane pliki, dzięki czemu nie będziesz zużywać zasobów na nieistotne przesyłane pliki. Jeśli akceptujesz pliki PDF, przekonwertuj każdą stronę do obsługiwanego formatu obrazu i wyślij obraz tej samej strony zarówno do AI Builder, jak i do Document Intelligence, tak aby wyniki obu usług korzystały z tej samej przestrzeni współrzędnych pikseli. Zachowaj numer strony PDF z każdym obrazem przed dopasowaniem wyników.
- Planuj zużycie kredytów AI Builder. Licencjonowanie usługi AI Builder odbywa się za pomocą jednostek zużywanych przy każdym uruchomieniu modelu. Przejrzyj Licencjonowanie i kredyty AI Builder i dodaj pojemność, jeśli jej potrzebujesz.
- Wybierz odpowiednią licencję Power Automate. Wybierz licencję użytkownika Power Automate Premium lub Power Automate Process na podstawie tego, czy chcesz licencjonować poszczególnych użytkowników, czy sam przepływ.
- Szacowanie kosztów Azure. Użyj wstępnie skonfigurowanego oszacowania w kalkulatorze cen Azure, aby uzyskać przybliżone koszty usługi Azure dla tego scenariusza. Dostosuj wartości, aby odpowiadały oczekiwanym woluminom dokumentów. To oszacowanie obejmuje wyłącznie usługi Azure w tym scenariuszu, w tym warstwę S0 usługi Azure Document Intelligence do przetwarzania OCR oraz plan Azure Functions Consumption dla logiki dopasowywania współrzędnych pikseli. Platforma Power Platform AI Builder i składniki Power Automate oraz Microsoft 365 SharePoint, OneDrive i Teams są licencjonowane oddzielnie i nie są uwzględniane w tym oszacowaniu.
Doskonałość operacyjna
Doskonałość operacyjna obejmuje procesy operacyjne, które wdrażają aplikację i zapewniają jej działanie w środowisku produkcyjnym. Aby uzyskać więcej informacji, zobacz Lista kontrolna przeglądu projektu dotycząca doskonałości operacyjnej.
- Korzystanie z rozwiązań platformy Power Platform do zarządzania cyklem życia aplikacji (ALM). Spakuj przepływ, łączniki niestandardowe i model AI Builder w rozwiązaniu platformy Power Platform, aby umożliwić ich promowanie między środowiskami deweloperskimi, testowymi i produkcyjnymi.
- Użyj kontroli źródła w funkcji Azure. Zapisz funkcję w GitHub lub Azure DevOps i wdróż ją za pośrednictwem potoku ciągłej integracji i ciągłego dostarczania (CI/CD). Aby uzyskać więcej informacji, zobacz Ciągłe wdrażanie dla usługi Azure Functions.
- Monitoruj każdą warstwę. Skonfiguruj funkcję platformy Azure za pomocą usługi Application Insights, obserwuj uruchomienia przepływów w centrum administracyjnym usługi Power Platform oraz monitoruj użycie i ograniczanie przepustowości usługi Document Intelligence w Azure Monitor.
- Ponowne trenowanie modeli zgodnie z harmonogramem. Modele wykrywania obiektów dryfują w miarę rozwoju dokumentów źródłowych. Ustanów cykl ponownego trenowania modelu AI Builder i śledź jego dokładność w czasie.
- Użyj przechowywania wersji dla schematu metadanych. Traktuj kolumny metadanych SharePoint jako kontrakt. Zaplanuj, jak je zaktualizować, tak aby nie zakłócić procesu pozyskiwania danych ani istniejących funkcji wyszukiwania.
Wydajność operacyjna
Wydajność odnosi się do możliwości skalowania obciążenia w celu efektywnego zaspokojenia wymagań użytkowników. Aby uzyskać więcej informacji, zobacz listę kontrolną przeglądu projektu pod kątem wydajności.
- Omówienie limitów usług. Przed zaplanowaniem przepustowości zapoznaj się z przydziałami i limitami usługi Document Intelligence oraz z limitami usługi AI Builder. Poproś z wyprzedzeniem o zwiększenie limitu liczby żądań, jeśli spodziewasz się dużego ruchu.
- Równoległe przetwarzanie dokumentów. Power Automate domyślnie uruchamia współbieżnie oddzielne uruchomienia przepływu wyzwalanego przez przekazanie. Jeśli przeprojektujesz przepływ w celu przetwarzania wsadów dokumentów, włącz współbieżność i ogranicz stopień równoległości, aby nie przekroczyć limitów AI Builder i Document Intelligence.
- Wstępne przetwarzanie obrazów pod kątem dokładności. Dane wejściowe o wyższej jakości zmniejszają liczbę ponownych uruchomień. Przed wysłaniem obrazów do AI Builder i Document Intelligence rozważ zmniejszenie rozdzielczości zbyt dużych obrazów, normalizację orientacji oraz przycięcie zbędnych białych marginesów.
- Ogranicz skutki zimnego startu. Jeśli opóźnienia mają znaczenie, użyj instancji always-ready w rozwiązaniu Flex Consumption i dodaj instancje wstępnie rozgrzane w planie Premium, aby zmniejszyć opóźnienia związane z zimnym startem.
- Rozważ użycie usługi Logic Apps dla dużego woluminu. W przypadku scenariuszy o wysokiej przepływności warstwa Standardowa usługi Logic Apps oferuje wyższe limity akcji i dedykowane środowisko uruchomieniowe, które może być skalowane lepiej niż Power Automate.
Współautorzy
Microsoft utrzymuje ten artykuł. Następujący współautorzy napisali ten artykuł.
Główny autor:
- Steve Pucelik | Starszy menedżer produktu
Inny współautor:
- Lohith G N | Sr. CSA, Cloud & AI Platform
Aby wyświetlić niepubliczne profile serwisu LinkedIn, zaloguj się do serwisu LinkedIn.
Następne kroki
- Czym jest Azure Document Intelligence w narzędziach Foundry Tools?
- Niestandardowe modele analizy dokumentów
- Omówienie AI Builder w usłudze Power Automate
- Wyodrębnianie tekstu z obiektów (wpis w blogu społeczności platformy Power Platform)