Model paragonu analizy dokumentów

Ta zawartość ma zastosowanie do:🟩Wersja 4.0 (ogólna dostępność) | Poprzednie wersje:🟦Wersja 3.1 (ogólna dostępność)🟥Wersja 3.0 (wycofanie)🟥Wersja 2.1 (wycofanie)

Ta zawartość ma zastosowanie do:🟩Wersja 3.1 (ogólna dostępność) | Najnowsza wersja:🟪Wersja 4.0 (ogólna dostępność) | Poprzednie wersje:🟦Wersja 3.0🟦Wersja 2.1

Ta zawartość ma zastosowanie do:🟥Wersja 3.0 (wycofanie) | Najnowsze wersje:🟪Wersja 4.0 (ogólna dostępność)🟪Wersja 3.1 (ogólna dostępność) | Poprzednia wersja:🟥Wersja 2.1 (wycofanie)

Ta zawartość ma zastosowanie do:🟥Wersja 2.1 | Najnowsza wersja:🟪Wersja 4.0 (ogólna dostępność)

Model paragonu analizy dokumentów łączy zaawansowane funkcje optycznego rozpoznawania znaków (OCR) z modelami uczenia głębokiego w celu analizowania i wyodrębniania kluczowych informacji z paragonów sprzedaży. Paragony mogą mieć różne formaty i jakość, w tym paragony drukowane i odręczne. Interfejs API wyodrębnia kluczowe informacje, takie jak nazwa sprzedawcy, numer telefonu sprzedawcy, data transakcji, podatek i suma transakcji oraz zwraca ustrukturyzowane dane JSON. Model paragonów w wersji 4.0 (GA) obsługuje inne pola, w tym ReceiptType, TaxDetails.NetAmount, TaxDetails.DescriptionTaxDetails.Rate i CountryRegion wraz z wyodrębnianiem tabel VAT na ogólnych paragonach hotelowych.

Wyodrębnianie danych z paragonu

Cyfryzacja paragonów obejmuje transformację różnych rodzajów paragonów, w tym zeskanowanych, sfotografowanych i drukowanych kopii w formacie cyfrowym w celu usprawnionego przetwarzania podrzędnego. Przykłady obejmują zarządzanie wydatkami, analizę zachowań konsumentów, automatyzację podatków itp. Korzystanie z analizy dokumentów z technologią optycznego rozpoznawania znaków (optycznego rozpoznawania znaków) umożliwia wyodrębnianie i interpretowanie danych z tych zróżnicowanych formatów paragonów. Przetwarzanie analizy dokumentów upraszcza proces konwersji, ale także znacznie skraca czas i nakład pracy, co ułatwia efektywne zarządzanie danymi i pobieranie.

Przykładowe potwierdzenie przetworzone za pomocą programu Document Intelligence Studio:

Zrzut ekranu przedstawiający przykładowe potwierdzenie przetworzone w programie Document Intelligence Studio.

Przykładowy paragon przetworzono przy użyciu narzędzia Document Intelligence Sample Labeling:

Zrzut ekranu przedstawiający przykładowe potwierdzenie przetworzone za pomocą narzędzia do etykietowania przykładowego formularza.

Opcje programowania

Analiza dokumentów w wersji 4.0: 2024-11-30 (GA) obsługuje następujące narzędzia, aplikacje i biblioteki:

Funkcja Zasoby Identyfikator modelu
Model paragonu Document Intelligence Studio
REST API
C# SDK
Python SDK
Java SDK
JavaScript SDK
wstępnie utworzone potwierdzenie

Narzędzie Document Intelligence w wersji 3.1 obsługuje następujące narzędzia, aplikacje i biblioteki:

Funkcja Zasoby Identyfikator modelu
Model paragonu Document Intelligence Studio
REST API
C# SDK
Python SDK
Java SDK
JavaScript SDK
wstępnie utworzone potwierdzenie

Narzędzie Document Intelligence w wersji 3.0 obsługuje następujące narzędzia, aplikacje i biblioteki:

Funkcja Zasoby Identyfikator modelu
Model paragonu Document Intelligence Studio
REST API
C# SDK
Python SDK
Java SDK
JavaScript SDK
wstępnie utworzone potwierdzenie

Narzędzie Document Intelligence w wersji 2.1 obsługuje następujące narzędzia, aplikacje i biblioteki:

Funkcja Zasoby
Model paragonu • Narzędzie


Wymagania dotyczące danych wejściowych

Obsługiwane są następujące formaty plików.

Model PDF Obraz:
JPEG/JPG, PNG, BMP, TIFF, HEIF
Office:
Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML
Odczytu
Układ
Dokument ogólny
Wstępnie zbudowany
Wyodrębnianie niestandardowe
Klasyfikacja niestandardowa
  • Zdjęcia i skanowania: Aby uzyskać najlepsze wyniki, podaj jedno jasne zdjęcie lub wysokiej jakości skanowanie na dokument.
  • Pliki PDF i pliki TIFF: w przypadku plików PDF i plików TIFF można przetworzyć maksymalnie 2000 stron. (W przypadku subskrypcji w warstwie Bezpłatna przetwarzane są tylko dwie pierwsze strony).
  • Rozmiar pliku: rozmiar pliku do analizowania dokumentów wynosi 500 MB dla warstwy płatnej (S0) i 4 MB dla warstwy bezpłatnej (F0).
  • Wymiary obrazu: Wymiary muszą mieć od 50 pikseli x 50 pikseli do 10 000 pikseli x 10 000 pikseli.
  • Blokady haseł: jeśli pliki PDF są zablokowane hasłem, należy usunąć blokadę przed przesłaniem.
  • Wysokość tekstu: minimalna wysokość tekstu do wyodrębnienia wynosi 12 pikseli dla obrazu 1024 x 768 pikseli. Ten wymiar odpowiada około 8-punktowemu tekstowi na 150 kropek na cal.
  • Trenowanie modelu niestandardowego: maksymalna liczba stron dla danych szkoleniowych to 500 dla niestandardowego modelu szablonu i 50 000 dla niestandardowego modelu neuronowego.
  • Trenowanie niestandardowego modelu wyodrębniania: całkowity rozmiar danych treningowych wynosi 50 MB dla modelu szablonowego i 1 GB dla modelu neuronowego.
  • Trenowanie niestandardowego modelu klasyfikacyjnego: całkowity rozmiar danych treningowych wynosi 1 GB z maksymalnie 10 000 stron. W przypadku wersji 2024-11-30 (GA) całkowity rozmiar danych treningowych wynosi 2 GB z maksymalnie 10 000 stron.
  • Typy plików pakietu Office (DOCX, XLSX, PPTX): Maksymalny limit długości ciągu wynosi 8 milionów znaków.
  • Obsługiwane formaty plików: JPEG, PNG, PDF i TIFF.
  • Obsługiwany limit stron dla plików PDF i TIFF: Inteligencja Dokumentów może przetwarzać maksymalnie 2000 stron dla subskrybentów warstwy standardowej lub tylko dwie pierwsze strony dla subskrybentów warstwy bezpłatnej.
  • Obsługiwany rozmiar pliku: mniejszy niż 50 MB; minimalna liczba pikseli 50 x 50 pikseli; maksymalna liczba pikseli: 10 000 x 10 000 pikseli.

Wyodrębnianie danych z modelu paragonów

Zobacz, w jaki sposób analiza dokumentów wyodrębnia dane, w tym godzinę i datę transakcji, informacje o kupcu i sumy kwot od wpływów. Potrzebne są następujące zasoby:

  • Subskrypcja Azure — możesz utworzyć ją bezpłatnie.

  • Instancja Document Intelligence w portalu Azure. Aby wypróbować usługę, możesz użyć bezpłatnej warstwy cenowej (F0). Po wdrożeniu zasobu wybierz pozycję Przejdź do zasobu , aby uzyskać klucz i punkt końcowy.

 Zrzut ekranu przedstawiający klucze i lokalizację punktu końcowego w Azure portal.

Uwaga

Program Document Intelligence Studio jest dostępny z interfejsami API w wersji 3.1 i 3.0 oraz nowszymi wersjami.

  1. Na stronie głównej Document Intelligence Studio wybierz pozycję Paragony.

  2. Możesz przeanalizować przykładowe potwierdzenie lub przekazać własne pliki.

  3. Wybierz przycisk Run analysis (Uruchom analizę ), a w razie potrzeby skonfiguruj opcje Analizuj:

    Zrzut ekranu przedstawiający przyciski Run analysis and Analyze (Uruchamianie analizy i analizowanie) w narzędziu Document Intelligence Studio.

Narzędzie do etykietowania przykładów z analizą dokumentów

  1. Przejdź do Narzędzia Przykładowego Inteligencji Dokumentów.

  2. Na stronie głównej przykładowego narzędzia wybierz kafelek Użyj wstępnie utworzonego modelu w celu pobrania danych.

    Zrzut ekranu z procesu analizowania wyników modelu układu.

  3. Wybierz typ formularza do przeanalizowania z menu rozwijanego.

  4. Wybierz adres URL pliku, który chcesz przeanalizować z poniższych opcji:

  5. W polu Źródło wybierz pozycję Adres URL z menu rozwijanego, wklej wybrany adres URL i wybierz przycisk Pobierz .

    Zrzut ekranu przedstawiający menu rozwijane lokalizacji źródłowej.

  6. W polu Punkt końcowy usługi Analizy dokumentów wklej punkt końcowy uzyskany w ramach subskrypcji analizy dokumentów.

  7. W polu klucza wklej klucz uzyskany z zasobu analizy dokumentów.

    Zrzut ekranu przedstawiający menu rozwijane select-form-type.

  8. Wybierz pozycję Uruchom analizę. Narzędzie do etykietowania próbek dokumentów w systemie inteligentnej analizy wywołuje API analizy wstępnie zbudowanych i analizuje dokument.

  9. Wyświetl wyniki — zobacz wyodrębnione pary klucz-wartość, elementy wiersza, wyróżniony tekst wyodrębniony i wykryte tabele.

    Zrzut ekranu przedstawiający operację analizowania wyników w modelu układu.

Uwaga

Przykładowe narzędzie etykietowania nie obsługuje formatu pliku BMP. Jest to ograniczenie narzędzia, a nie usługi analizy dokumentów.

Obsługiwane języki i ustawienia regionalne

Aby uzyskać pełną listę obsługiwanych języków, zobacz naszą wstępnie utworzoną stronę obsługi języka modeli .

Wyodrębnianie pól

Dla obsługiwanych pól wyodrębniania dokumentów odnieś się do strony ze schematem modelu receipt w naszym przykładowym repozytorium GitHub.

Nazwa Typ Opis Standardowe dane wyjściowe
Typ paragonu Ciąg Typ paragonu sprzedaży Wyszczególnione
Nazwa sprzedawcy Ciąg Imię i nazwisko sprzedawcy wystawiającego paragon
Numer telefonu sprzedawcy numerTelefonu Wymieniony numer telefonu sprzedawcy +1 xxx xxx xxxx
AdresSprzedawcy Ciąg Wymieniony adres sprzedawcy
DataTransakcji Data Data wystawienia paragonu yyyy-mm-dd
CzasTransakcji Czas Czas wystawienia paragonu hh-mm-ss (24 godziny)
Łącznych Liczba (USD) Całkowita liczba transakcji odbioru Liczba zmiennoprzecinkowa z dwoma miejscami po przecinku
Suma częściowa Liczba (USD) Suma częściowa paragonu, często przed doliczeniem podatków. Liczba zmiennoprzecinkowa z dwoma miejscami po przecinku
Podatku Liczba (USD) Całkowity podatek od paragonu (często podatek od sprzedaży lub odpowiednik). Zmieniono nazwę na "TotalTax" w wersji 2022-06-30. Liczba zmiennoprzecinkowa z dwoma miejscami po przecinku
Wskazówka Liczba (USD) Porada dołączona przez kupującego Liczba zmiennoprzecinkowa z dwoma miejscami po przecinku
Elementy Tablica obiektów Wyodrębnione elementy wiersza z nazwą, ilością, ceną jednostkową i łączną ceną wyodrębnionej
Nazwa Ciąg Opis elementu. Zmieniono nazwę na "Opis" w wersji 2022-06-30.
Ilość Liczba Ilość każdego elementu Liczba zmiennoprzecinkowa z dwoma miejscami po przecinku
Cena Liczba Pojedyncza cena każdej jednostki przedmiotów Liczba zmiennoprzecinkowa z dwoma miejscami po przecinku
Cena całkowita Liczba Łączna cena pozycji w tabeli Liczba zmiennoprzecinkowa z dwoma miejscami po przecinku

Przewodnik migracji i interfejs API REST w wersji 3.1

Następne kroki