Inteligentne przetwarzanie dokumentów

Inteligentne przetwarzanie dokumentów (IDP) konwertuje nieustrukturyzowaną zawartość — taką jak pliki PDF, pliki DOCX, obrazy i prezentacje — na ustrukturyzowane, wzbogacone dane, które zasilają agentów podrzędnych, aplikacje i analizy.

Azure Databricks daje dwa sposoby uruchamiania IDP, oba oparte na tych samych opracowanych przez badania Funkcjach AI:

  • Agent Bricks UI: Doświadczenie wizualne bez kodu do analizy, wyodrębniania i klasyfikowania dokumentów. Używaj go do testowania przykładowych dokumentów, dopracowywania schematu lub etykiet oraz wizualnej weryfikacji wyników przed skalowaniem.
  • Funkcje SQL AI: Uruchamiaj inteligentne funkcje przetwarzania dokumentów bezpośrednio na Lakehouse. Używaj ich do przetwarzania dokumentów na dużą skalę, łączenia etapów oraz budowania nadzorowanych potoków klasy produkcyjnej w Lakeflow Pipelines.

Inteligentne możliwości przetwarzania dokumentów

Zdolność Interfejs Agent Bricks Funkcja SQL
Konwertowanie plików PDF, DOCX, obrazów i ppT na tekst ustrukturyzowany, tabele i opisy rysunków. Parsowanie dokumentów ai_parse_document
Ściąganie pól strukturalnych z dokumentów lub zwykłego tekstu przy użyciu zdefiniowanego schematu. Wyodrębnianie informacji ai_extract
Przypisz wstępnie zdefiniowane kategorie do dokumentów lub tekstu, obsługując maksymalnie 500 etykiet. Klasyfikacja ai_classify
Przekształcaj przeanalizowane dokumenty w semantyczne fragmenty gotowe do generowania wspomaganego wyszukiwaniem (RAG) oraz indeksowania na potrzeby wyszukiwania AI. ai_prep_search (Wersja beta)

Typowe przypadki użycia

Platforma identyfikacji i przetwarzania danych (IDP) w usłudze Azure Databricks zasila szeroką gamę aplikacji końcowych.

  • Generowanie z rozszerzonym pobieraniem (RAG): analiza i strukturyzacja dokumentów w celu poprawy segmentacji, jakości pobierania i umocowania dla aplikacji LLM.
  • Wyodrębnianie i analiza wiedzy: wyodrębnianie kluczowych pól i metadanych w celu umożliwienia wyszukiwania, raportowania i analizy biznesowej danych dokumentów.
  • Przepływy pracy oparte na agencie: kierowanie, klasyfikowanie i wzbogacanie dokumentów w celu obsługi zautomatyzowanego podejmowania decyzji i wykonywania zadań.
  • Opis i klasyfikacja dokumentów: organizowanie dużych corpora dokumentów według typu, tematu lub zawartości na potrzeby przetwarzania podrzędnego.

Jak to działa

Usługa Azure Databricks umożliwia inteligentne przetwarzanie dokumentów jako ujednolicony, kompleksowy przepływ pracy na platformie Lakehouse. Pozyskiwanie, analizowanie, wzbogacanie i analiza podrzędna są tworzone na jednej platformie, dzięki czemu każdy etap działa bezproblemowo bez konieczności złożonej integracji lub przenoszenia danych.

  1. Przyjmowanie i orkiestracja

    Używaj potoków Lakeflow do pozyskiwania nieprzetworzonych dokumentów (takich jak pliki PDF, obrazy i pliki DOCX) oraz do orkiestracji potoków. Ponieważ pozyskiwanie i orkiestracja są zintegrowane bezpośrednio z usługą Lakehouse, dokumenty przepływają bezpośrednio do przetwarzania kolejnego etapu bez dodatkowej infrastruktury.

  2. Parsowanie dokumentów (brązowa warstwa)

    Zastosuj ai_parse_document , aby przekonwertować nieprzetworzone pliki na reprezentacje ustrukturyzowane. Tworzy ustandaryzowaną warstwę z brązu, która przechwytuje tekst, tabele/opisy obrazów i strukturę dokumentów, tworząc spójną podstawę dla wszystkich podrzędnych przypadków użycia.

  3. Wyodrębnianie i klasyfikowanie

    Użyj ai_extract i ai_classify, aby wzbogacić przeanalizowane dokumenty przy pomocy pól strukturalnych i metadanych. Te funkcje działają bezpośrednio na analizowanych danych wyjściowych, umożliwiając wyodrębnianie kluczowych informacji, klasyfikowanie dokumentów i kierowanie ich przez przepływy pracy bez dodatkowych kroków przekształcania.

  4. Przygotowanie do pobierania (RAG)

    Zastosuj ai_prep_search (beta), aby przekształcić przeanalizowane dokumenty w fragmenty semantyczne wzbogacone kontekstem na poziomie dokumentu, takimi jak tytuły, nagłówki sekcji i odwołania do stron. Dane wyjściowe są sformatowane pod kątem indeksowania w AI Search, co zapewnia spójną podstawę dla obciążeń związanych z RAG i wyszukiwaniem.

  5. Analizowanie i operacjonalizacja

    Wykorzystaj dodatkowe funkcje AI lub inne narzędzia (pulpity AI/BI, aplikacje, wyszukiwanie AI) do analiz na dalszych etapach, pozyskiwania informacji (RAG) i przepływów pracy sterowanych przez agentów. Ponieważ wszystkie dane pozostają w usłudze Lakehouse, ustrukturyzowane dane dokumentów mogą być natychmiast używane do wyszukiwania, pulpitów nawigacyjnych i aplikacji.