Model Document Intelligence do wyciągów bankowych

Ta zawartość dotyczy: 🟩 wersja 4.0 (ogólna dostępność)

Model oświadczenia bankowego analizy dokumentów łączy zaawansowane funkcje optycznego rozpoznawania znaków (OCR) z modelami uczenia głębokiego w celu analizowania i wyodrębniania danych z amerykańskich oświadczeń bankowych. Interfejs API analizuje drukowane wyciągi bankowe; wyodrębnia kluczowe informacje, takie jak numer konta, szczegóły banku, szczegóły zestawienia, szczegóły transakcji i opłaty; funkcja zwraca ustrukturyzowaną reprezentację danych JSON. W wersji 4.0 GA można teraz wyodrębniać tabele czeków z amerykańskich wyciągów bankowych.

Funkcja wersja Identyfikator modelu
Model zestawienia bankowego v4.0: 2024-11-30 (GA) prebuilt-bankStatement.us

Wyodrębnianie danych z zestawienia bankowego

Wyciąg bankowy pomaga przejrzeć działania konta w określonym przedziale czasu. Jest to oficjalne oświadczenie, które pomaga wykrywać oszustwa, śledzić wydatki, błędy księgowe i rejestrować działania okresu. Zobacz, jak dane są wyodrębniane przy użyciu prebuilt-bankStatement.us modelu. Potrzebne są następujące zasoby:

Document Intelligence Studio

  1. Na stronie głównej Document Intelligence Studio wybierz pozycję wyciągi bankowe.

  2. Możesz przeanalizować przykładowy wyciąg bankowy lub przesłać własne pliki.

  3. Wybierz przycisk Uruchom analizę i w razie potrzeby skonfiguruj Opcje analizy:

    Zrzut ekranu przycisków Run analysis i Analyze options w narzędziu Document Intelligence Studio.

Wymagania dotyczące danych wejściowych

Obsługiwane są następujące formaty plików.

Model PDF Obraz:
JPEG/JPG, PNG, BMP, TIFF, HEIF
Office:
Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML
Przeczytaj
Układ
Dokument ogólny
Wstępnie zbudowana
Niestandardowa ekstrakcja
Klasyfikacja niestandardowa
  • Zdjęcia i skanowania: Aby uzyskać najlepsze wyniki, podaj jedno jasne zdjęcie lub wysokiej jakości skanowanie na dokument.
  • Pliki PDF i pliki TIFF: w przypadku plików PDF i plików TIFF można przetworzyć maksymalnie 2000 stron. (W przypadku subskrypcji w warstwie Bezpłatna przetwarzane są tylko dwie pierwsze strony).
  • Rozmiar pliku: rozmiar pliku do analizowania dokumentów wynosi 500 MB dla warstwy płatnej (S0) i 4 MB dla warstwy bezpłatnej (F0).
  • Wymiary obrazu: Wymiary muszą mieć od 50 pikseli x 50 pikseli do 10 000 pikseli x 10 000 pikseli.
  • Blokady haseł: jeśli pliki PDF są zablokowane hasłem, należy usunąć blokadę przed przesłaniem.
  • Wysokość tekstu: minimalna wysokość tekstu do wyodrębnienia wynosi 12 pikseli dla obrazu 1024 x 768 pikseli. Ten wymiar odpowiada mniej więcej tekstowi o wielkości 8 punktów przy rozdzielczości 150 punktów na cal.
  • Trenowanie modelu niestandardowego: maksymalna liczba stron dla danych szkoleniowych to 500 dla niestandardowego modelu szablonu i 50 000 dla niestandardowego modelu neuronowego.
  • Trenowanie niestandardowego modelu wyodrębniania: całkowity rozmiar danych treningowych wynosi 50 MB dla modelu szablonowego i 1 GB dla modelu neuronowego.
  • Trenowanie niestandardowego modelu klasyfikacji: łączny rozmiar danych treningowych wynosi 1 GB, przy maksymalnie 10 000 stronach. W przypadku wersji 2024-11-30 (GA) całkowity rozmiar danych treningowych wynosi 2 GB z maksymalnie 10 000 stron.
  • Typy plików pakietu Office (DOCX, XLSX, PPTX): Maksymalny limit długości ciągu wynosi 8 milionów znaków.

Obsługiwane języki i ustawienia regionalne

Aby uzyskać pełną listę obsługiwanych języków, zobacz naszą wstępnie utworzoną stronę obsługi języka modelu.

Ekstrakcje pól

Obsługiwane pola wyodrębniania dokumentów znajdziesz na stronieschematu modelu wyciągu bankowego w naszym przykładowym repozytorium GitHub.

Obsługiwane ustawienia regionalne

prebuilt-bankStatement.us w wersji 2027-11-30 obsługuje lokalizację en-us.

Następne kroki