Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Ta zawartość ma zastosowanie do:🟩Wersja 4.0 (ogólna dostępność) | Poprzednie wersje:🟦Wersja 3.1 (ogólna dostępność)🟥Wersja 3.0 (wycofanie)🟥Wersja 2.1 (wycofanie)
Ta zawartość ma zastosowanie do:🟩Wersja 3.1 (ogólna dostępność) | Najnowsza wersja:🟪Wersja 4.0 (ogólna dostępność) | Poprzednie wersje:🟦Wersja 3.0🟦Wersja 2.1
Ta zawartość ma zastosowanie do:🟥Wersja 3.0 (wycofanie) | Najnowsze wersje:🟪Wersja 4.0 (ogólna dostępność)🟪Wersja 3.1 (ogólna dostępność) | Poprzednia wersja:🟥Wersja 2.1 (wycofanie)
Ta zawartość ma zastosowanie do:🟥Wersja 2.1 | Najnowsza wersja:🟪Wersja 4.0 (ogólna dostępność)
Analiza dokumentów używa zaawansowanej technologii uczenia maszynowego do identyfikowania dokumentów, wykrywania i wyodrębniania informacji z formularzy i dokumentów oraz zwracania wyodrębnionych danych w danych wyjściowych ze strukturą JSON. Za pomocą analizy dokumentów można używać modeli analizy dokumentów, wstępnie utworzonych/wstępnie wytrenowanych lub wytrenowanych autonomicznych modeli niestandardowych.
Modele niestandardowe obejmują teraz niestandardowe modele klasyfikacji dla scenariuszy, w których należy zidentyfikować typ dokumentu przed wywołaniem modelu wyodrębniania. Modele klasyfikatora są dostępne od API 2023-07-31 (GA). Model klasyfikacji może być sparowany z niestandardowym modelem wyodrębniania w celu analizowania i wyodrębniania pól z formularzy i dokumentów specyficznych dla Twojej firmy. Autonomiczne niestandardowe modele wyodrębniania można łączyć w celu utworzenia modeli złożonych.
Niestandardowe typy modeli dokumentów
Niestandardowe modele dokumentów mogą być jednym z dwóch typów: szablonem niestandardowym lub niestandardowym formularzem, a także niestandardowymi modelami neuronowymi lub modelami dokumentów niestandardowych. Proces etykietowania i trenowania obu modeli jest identyczny, ale modele różnią się w następujący sposób:
Niestandardowe modele wyodrębniania
Aby utworzyć niestandardowy model wyodrębniania, oznacz zestaw danych dokumentów wartościami, które chcesz wyodrębnić i wytrenować model w oznaczonym zestawie danych. Do rozpoczęcia pracy potrzebujesz tylko pięciu przykładów tego samego formularza lub typu dokumentu.
Niestandardowy model neuronowy
Ważne
Interfejs API inteligencji dokumentów
Niestandardowy model neuronowy do przetwarzania dokumentów wykorzystuje modele uczenia głębokiego oraz model bazowy, który został wytrenowany na dużej kolekcji dokumentów. Ten model jest następnie dostrojony lub dostosowany do danych podczas trenowania modelu za pomocą oznaczonego zestawu danych. Niestandardowe modele neuronowe obsługują wyodrębnianie kluczowych pól danych z ustrukturyzowanych, półustrukturyzowanych i nieustrukturyzowanych dokumentów. Po wybraniu między dwoma typami modeli zacznij od modelu neuronowego, aby określić, czy spełnia ona twoje potrzeby funkcjonalne. W wersji 4.0 niestandardowy model neuronowy obsługuje wykrywanie podpisów, pewność tabeli i nakładające się pola. Zobacz modele neuronowe , aby dowiedzieć się więcej o niestandardowych modelach dokumentów.
Niestandardowy model szablonu
Szablon niestandardowy lub model formularza korzysta ze spójnego szablonu wizualnego w celu wyodrębnienia oznaczonych danych. Wariancja w strukturze wizualnej dokumentów wpływa na dokładność modelu. Formularze ustrukturyzowane, takie jak kwestionariusze lub aplikacje, to przykłady spójnych szablonów wizualnych.
Zestaw szkoleniowy składa się z dokumentów strukturalnych, w których formatowanie i układ są statyczne i spójne w każdym przypadku. Niestandardowe modele szablonów obsługują pary klucz-wartość, znaczniki wyboru, tabele, pola podpisu i regiony. Modele szablonów i można je wytrenować na dokumentach w dowolnym z obsługiwanych języków. Aby uzyskać więcej informacji, zobaczniestandardowe modele szablonów.
Jeśli język dokumentów i scenariuszy wyodrębniania obsługuje niestandardowe modele neuronowe, zalecamy użycie niestandardowych modeli neuronowych w modelach szablonów w celu zwiększenia dokładności.
Wskazówka
Aby potwierdzić, że dokumenty szkoleniowe przedstawiają spójny szablon wizualizacji, usuń wszystkie dane wprowadzone przez użytkownika z każdego formularza w zestawie. Jeśli puste formularze są identyczne w wyglądzie, reprezentują spójny szablon wizualizacji.
Aby uzyskać więcej informacji, zobaczInterpretowanie i zwiększanie dokładności i pewności dla modeli niestandardowych.
Wymagania dotyczące danych wejściowych
Aby uzyskać najlepsze wyniki, podaj jedno jasne zdjęcie lub wysokiej jakości skanowanie na dokument.
Obsługiwane formaty plików:
Model PDF Obraz: jpeg/jpg, ,pngbmp, ,tiffheifMicrosoft Office:
Word (docx), Excel (xlsx), PowerPoint (pptx)Odczytu ✔ ✔ ✔ Układ ✔ ✔ ✔ Dokument ogólny ✔ ✔ Wstępnie zbudowany ✔ ✔ Wyodrębnianie niestandardowe ✔ ✔ Klasyfikacja niestandardowa ✔ ✔ ✔ ✱ pliki Microsoft Office nie są obecnie obsługiwane w przypadku innych modeli lub wersji.
W przypadku plików PDF i TIFF można przetworzyć maksymalnie 2000 stron (w przypadku subskrypcji warstwy Bezpłatna przetwarzane są tylko pierwsze dwie strony).
Rozmiar pliku do analizowania dokumentów dotyczy
500 MBwarstwy płatnej (S0) i4 MBbezpłatnej warstwy (F0).Wymiary obrazu muszą mieć od 50 x 50 pikseli do 10 000 pikseli x 10 000 pikseli.
Jeśli pliki PDF są zablokowane hasłem, należy usunąć blokadę przed przesłaniem.
Minimalna wysokość tekstu do wyodrębnienia to 12 pikseli dla obrazu o rozmiarze 1024 x 768 pikseli. Ten wymiar odpowiada około
8-punktowemu tekstowi przy150kropkach na cal.W przypadku trenowania modelu niestandardowego maksymalna liczba stron dla danych szkoleniowych wynosi 500 dla niestandardowego modelu szablonu i 50 000 dla niestandardowego modelu neuronowego.
Dla trenowania niestandardowego modelu wyodrębniania całkowity rozmiar danych treningowych wynosi
50 MBdla modelu szablonu i1 GBdla modelu neuronowego.W przypadku trenowania niestandardowego modelu klasyfikacji całkowity rozmiar danych treningowych wynosi
1 GBmaksymalnie 10 000 stron.
Optymalne dane treningowe
Trenowanie danych wejściowych jest podstawą dowolnego modelu uczenia maszynowego. Określa jakość, dokładność i wydajność modelu. W związku z tym kluczowe jest utworzenie najlepszych danych wejściowych szkoleniowych możliwych dla projektu analizy dokumentów. W przypadku korzystania z niestandardowego modelu analizy dokumentów należy podać własne dane szkoleniowe. Oto kilka wskazówek, które pomogą w efektywnym trenowaniu modeli:
Używaj plików PDF opartych na tekście zamiast plików PDF opartych na obrazach, jeśli jest to możliwe. Jednym ze sposobów identyfikacji obrazu*opartego na pliku PDF jest próba wybrania określonego tekstu w dokumencie. Jeśli możesz wybrać tylko cały obraz tekstu, dokument jest oparty na obrazie, a nie na podstawie tekstu.
Organizuj dokumenty szkoleniowe przy użyciu podfolderu dla każdego formatu (JPEG/JPG, PNG, BMP, PDF lub TIFF).
Użyj formularzy, które mają wypełnione wszystkie dostępne pola.
Użyj formularzy z różnymi wartościami w każdym polu.
Użyj większego zestawu danych (więcej niż pięciu dokumentów szkoleniowych), jeśli obrazy są niskiej jakości.
Ustal, czy chcesz użyć jednego modelu lub wielu modeli złożonych w jeden model.
Rozważ segmentowanie zestawu danych w folderach, w których każdy folder jest unikatowym szablonem. Wytrenuj jeden model na folder i utwórz wynikowe modele w jednym punkcie końcowym. Dokładność modelu może się zmniejszyć, gdy masz różne formaty analizowane za pomocą jednego modelu.
Rozważ podzielenie zestawu danych na segmenty, aby wytrenować wiele modeli, jeśli formularz ma odmiany z formatami i podziałami stron. Formularze niestandardowe opierają się na spójnym szablonie wizualizacji.
Upewnij się, że masz zrównoważony zestaw danych, uwzględniając formaty, typy dokumentów i strukturę.
Tryb kompilacji
Operacja build custom model dodaje obsługę szablonu i modeli niestandardowych neuronowych . Poprzednie wersje interfejsu API REST i bibliotek klienckich obsługiwały tylko jeden tryb kompilacji, który jest teraz znany jako tryb szablonu .
Modele szablonów akceptują tylko dokumenty, które mają tę samą podstawową strukturę strony — jednolity wygląd wizualny — lub takie samo względne pozycjonowanie elementów w dokumencie.
Modele neuronowe obsługują dokumenty, które mają te same informacje, ale różne struktury stron. Przykłady tych dokumentów obejmują formularze Stany Zjednoczone W2, które współdzielą te same informacje, ale różnią się wyglądem w różnych firmach.
Ta tabela zawiera linki do odwołań do SDK języka programowania w trybie kompilacji oraz przykładów kodu na GitHub.
| Język programowania | Dokumentacja zestawu SDK | Przykładowy kod |
|---|---|---|
| C#/.NET | Struktura DocumentBuildMode | Sample_BuildCustomModelAsync |
| Java | Klasa DocumentBuildMode | BuildDocumentModel |
| JavaScript | Typ DocumentBuildMode | buildModel.js |
| Python | wyliczenie DocumentBuildMode |
Porównanie funkcji modelu
Poniższa tabela porównuje szablon niestandardowy i niestandardowe funkcje neuronowe.
| Funkcja | Szablon niestandardowy (formularz) | Własny model neuronowy (dokument) |
|---|---|---|
| Struktura dokumentu | Szablon, formularz i struktura | Ustrukturyzowane, częściowo ustrukturyzowane i nieustrukturyzowane |
| Czas trenowania | Od 1 do 5 minut | Od 30 minut do 12 godzin* |
| Wyodrębnianie danych | Pary klucz-wartość, tabele, znaczniki wyboru, współrzędne i podpisy | Pary klucz-wartość, znaczniki wyboru i tabele |
| Nakładające się pola | Niewspierany | Wspierane |
| Odmiany dokumentu | Wymaga modelu dla każdej odmiany | Używa pojedynczego modelu dla wszystkich odmian |
| Obsługa języków | Szablon niestandardowy obsługi języka | Obsługa języka dla niestandardowych sieci neuronowych |
*-Domyślny czas trenowania wynosi 30 minut, włącz płatne szkolenie w celu trenowania modelu dłuższego niż 30 minut. Sprawdź więcej szczegółów dotyczących wsparcia trenowania niestandardowych sieci neuronowych
Niestandardowy model klasyfikacji
Klasyfikacja dokumentów to nowy scenariusz obsługiwany przez Document Intelligence z interfejsem 2023-07-31 API (v3.1 GA). Interfejs API klasyfikatora dokumentów obsługuje scenariusze klasyfikacji i dzielenia. Trenowanie modelu klasyfikacji w celu zidentyfikowania różnych typów dokumentów, które obsługuje aplikacja. Plik wejściowy modelu klasyfikacji może zawierać wiele dokumentów i klasyfikuje każdy dokument w skojarzonym zakresie stron. Aby dowiedzieć się więcej, zobaczniestandardowe modele klasyfikacji .
Uwaga
v4.0 2024-11-30 (GA) Model klasyfikacji dokumentów obsługuje typy dokumentów pakietu Office do klasyfikacji. Ta wersja interfejsu API wprowadza również trenowanie przyrostowe dla modelu klasyfikacji.
Niestandardowe narzędzia modelu
Modele analizy dokumentów w wersji 3.1 lub nowszej obsługują następujące narzędzia, aplikacje, programy i biblioteki:
| Funkcja | Zasoby | Identyfikator modelu |
|---|---|---|
| Model niestandardowy | • Document Intelligence Studio • interfejs API REST • SDK języka C# • SDK języka Python |
custom-model-id |
Niestandardowy cykl życia modelu
Cykl życia modelu niestandardowego zależy od wersji interfejsu API używanej do trenowania. Jeśli wersja interfejsu API jest ogólnie dostępna, model niestandardowy ma ten sam cykl życia co ta wersja. Model spersonalizowany nie jest dostępny dla wnioskowania, gdy wersja interfejsu API jest przestarzała. Jeśli wersja interfejsu API jest wersją zapoznawcza, model niestandardowy ma ten sam cykl życia co wersja zapoznawcza interfejsu API.
Narzędzie Document Intelligence w wersji 2.1 obsługuje następujące narzędzia, aplikacje i biblioteki:
Uwaga
Niestandardowe typy modeli niestandardowy model neuronowy i niestandardowy szablon są dostępne w interfejsach API Inteligencja Dokumentów w wersji 3.1 i 3.0.
| Funkcja | Zasoby |
|---|---|
| Model niestandardowy | • Narzędzie do etykietowania analizy dokumentów • REST API • Biblioteka klienta SDK • Kontener Docker analizy dokumentów |
Tworzenie modelu niestandardowego
Wyodrębnianie danych z określonych lub unikatowych dokumentów przy użyciu modeli niestandardowych. Potrzebne są następujące zasoby:
Subskrypcja Azure. Możesz utworzyć go bezpłatnie.
Instancja Document Intelligence w portalu Azure. Aby wypróbować usługę, możesz użyć bezpłatnej warstwy cenowej (
F0). Po wdrożeniu zasobu wybierz pozycję Przejdź do zasobu , aby uzyskać klucz i punkt końcowy.
Przykładowe narzędzie do etykietowania
Wskazówka
- Aby uzyskać ulepszone środowisko i zaawansowaną jakość modelu, wypróbuj narzędzie Document Intelligence w wersji 3.0 Studio.
- Program Studio w wersji 3.0 obsługuje dowolny model trenowany z danymi oznaczonymi etykietami w wersji 2.1.
- Szczegółowe informacje na temat migracji z wersji 2.1 do wersji 3.0 można znaleźć w przewodniku migracji interfejsu API.
- ZobaczREST API lub C#, Java, JavaScript lub Python SDK ../quickstarts aby rozpocząć pracę z wersją 3.0.
Narzędzie do etykietowania próbek Document Intelligence to narzędzie open-source, które umożliwia testowanie najnowszych funkcji analizy dokumentów i funkcji optycznego rozpoznawania znaków (OCR).
Wypróbuj Narzędzie 'Szybki start' do etykietowania próbek, aby rozpocząć tworzenie i używanie modelu niestandardowego.
Document Intelligence Studio
Uwaga
Program Document Intelligence Studio jest dostępny z interfejsami API w wersji 3.1 i 3.0.
Na stronie głównej Document Intelligence Studio wybierz pozycję Niestandardowe modele wyodrębniania.
W obszarze Moje projekty wybierz pozycję Utwórz projekt.
Wypełnij pola szczegółów projektu.
Skonfiguruj zasób usługi, dodając konto magazynowe i kontener blobów aby połączyć się ze źródłem danych szkoleniowych.
Przejrzyj i utwórz projekt.
Dodaj przykładowe dokumenty do etykietowania, budowania i testowania modelu niestandardowego.
Aby zapoznać się ze szczegółowym przewodnikiem tworzenia pierwszego niestandardowego modelu wyodrębniania, zobaczHow to create a custom extraction model (Jak utworzyć niestandardowy model wyodrębniania).
Podsumowanie procesu wyodrębniania modelu dostosowanego
W tej tabeli porównaliśmy obsługiwane obszary wyodrębniania danych:
| Model | Pola formularza | Znaczniki zaznaczenia | Pola ustrukturyzowane (tabele) | Podpis | Etykietowanie regionów | Nakładające się pola |
|---|---|---|---|---|---|---|
| Szablon niestandardowy | ✔ | ✔ | ✔ | ✔ | ✔ | N/a |
| Niestandardowa sieć neuronowa | ✔ | ✔ | ✔ | ✔ | * | ✔ |
Symbole tabeli:
✔ — Obsługiwane
**n/a — obecnie niedostępne;
*-Zachowuje się inaczej w zależności od modelu. W przypadku modeli szablonów syntetyczne dane są generowane w czasie trenowania. W przypadku modeli neuronowych zaznaczony jest istniejący tekst rozpoznany w regionie.
Wskazówka
Aby wybrać między dwoma typami modeli, zacznij od niestandardowego modelu neuronowego, jeśli spełnia twoje potrzeby funkcjonalne. Zobacz niestandardowe modele neuronowe, aby dowiedzieć się więcej o niestandardowych modelach neuronowych.
Opcje tworzenia niestandardowych modeli
W poniższej tabeli opisano funkcje dostępne w skojarzonych narzędziach i bibliotekach klienckich. Najlepszym rozwiązaniem jest upewnienie się, że używasz zgodnych narzędzi wymienionych tutaj.
| Typ dokumentu | interfejs API REST | SDK | Etykietowanie i testowanie modeli |
|---|---|---|---|
| Szablon niestandardowy w wersji 4.0 w wersji 3.1 w wersji 3.0 | Analiza dokumentów 3.1 | Zestaw SDK analizy dokumentów | Document Intelligence Studio |
| Dostosowane modele neuronowe v4.0 v3.1 v3.0 | Analiza dokumentów 3.1 | Zestaw SDK analizy dokumentów | Document Intelligence Studio |
| Formularz niestandardowy w wersji 2.1 | Document Intelligence API 2.1 GA | Zestaw SDK analizy dokumentów | Przykładowe narzędzie do etykietowania |
Uwaga
Niestandardowe modele szablonów trenowane z użyciem interfejsu API w wersji 3.0 mają kilka ulepszeń w porównaniu do API 2.1 dzięki ulepszeniom aparatu OCR. Zestawy danych używane do trenowania niestandardowego modelu szablonu przy użyciu interfejsu API 2.1 mogą być nadal używane do trenowania nowego modelu przy użyciu interfejsu API 3.0.
Aby uzyskać najlepsze wyniki, należy podać jedno jasne zdjęcie lub skanowanie wysokiej jakości dla każdego dokumentu.
Obsługiwane formaty plików to JPEG/JPG, PNG, BMP, TIFF i PDF (tekst osadzony lub skanowany). Pliki PDF zawierające tekst najlepiej eliminują możliwość błędu podczas wyodrębniania znaków i ich ustawienia.
Pliki PDF i TIFF, maksymalnie 2000 stron, można przetworzyć. W przypadku subskrypcji w warstwie Bezpłatna przetwarzane są tylko dwie pierwsze strony.
Rozmiar pliku musi być mniejszy niż 500 MB dla warstwy płatnej (S0) i 4 MB za bezpłatną (F0).
Wymiary obrazu muszą mieć od 50 x 50 pikseli do 10 000 x 10 000 pikseli.
Wymiary formatu PDF są do 17 x 17 cali, co odpowiada rozmiarowi papieru Legal lub A3 lub mniejszemu.
Łączny rozmiar danych treningowych wynosi 500 stron lub mniej.
Pliki PDF, które są zablokowane hasłem, muszą zostać usunięte blokady haseł przed przesłaniem.
Wskazówka
Dane szkoleniowe:
- Jeśli to możliwe, użyj dokumentów PDF opartych na tekście zamiast dokumentów opartych na obrazach. Zeskanowane pliki PDF są obsługiwane jako obrazy.
- Podaj tylko jedno wystąpienie formularza na dokument.
- W przypadku formularzy wypełnionych użyj przykładów z wypełnionymi polami.
- Użyj formularzy z różnymi wartościami w każdym polu.
- Jeśli obrazy formularzy są niższej jakości, użyj większego zestawu danych. Na przykład użyj 10 do 15 obrazów.
Obsługiwane języki i ustawienia regionalne
Zobacz naszą stronę Obsługa języków — modele niestandardowe , aby uzyskać pełną listę obsługiwanych języków.
Następne kroki
Spróbuj przetwarzać własne formularze i dokumenty za pomocą narzędzia etykietowania próbek Dokument Intelligence.
Ukończ przewodnik szybkiego startu dotyczący analizy dokumentów i zacznij tworzyć aplikację do przetwarzania dokumentów w wybranym języku programowania.
Spróbuj przetwarzać własne formularze i dokumenty za pomocą programu Document Intelligence Studio.
Ukończ przewodnik szybkiego startu dotyczący analizy dokumentów i zacznij tworzyć aplikację do przetwarzania dokumentów w wybranym języku programowania.