Analizowanie dokumentów

Analizowanie dokumentów wykorzystuje najnowocześniejsze techniki badawcze do wyodrębniania i wizualizowania danych strukturalnych z szerokiego zakresu typów dokumentów, w tym plików PDF, obrazów, dokumentów Word (DOC/DOCX) i plików PowerPoint (PPT/PPTX). Jest ona przeznaczona do obsługi złożonych układów, takich jak tabele, wykresy i mieszana zawartość obrazu tekstowego.

Parsowanie dokumentów jest dostępne przez interfejs Agent Bricks, w SQL oraz z API REST.

Utworzenie agenta parsującego dokumenty w interfejsie UI

Requirements

Użyj analizy dokumentów, aby przetwarzać swoje dokumenty i wizualizować ich strukturę.

  1. Przejdź do ikony Agenci.Agenci w okienku nawigacji po lewej stronie obszaru roboczego.
  2. Kliknij Utwórz agenta>Analizowanie dokumentów.
  3. Wybierz dokument źródłowy. Możesz przekazać plik lub wybrać go z istniejącego katalogu Unity Catalog. Obsługiwane formaty to: PDF, images, DOC/DOCX i PPT/PPTX.
  4. Kliknij pozycję Przeanalizuj dokument.

Analizowanie dokumentu może potrwać kilka minut. Po zakończeniu analizowanie dokumentów pokazuje dokument źródłowy po lewej stronie i przeanalizowany dokument po prawej stronie. Możesz wyświetlić przeanalizowany dokument jako sformatowany tekst lub nieprzetworzony kod JSON.

Interfejs użytkownika analizowania dokumentów przedstawiający dokument źródłowy i analizowany obok siebie

Przetwarzanie i wyniki zapytań

Aby wyświetlić ai_parse_document zapytanie i uruchomić je w kolejnych dokumentach, kliknij Użyj agenta i wybierz, czy chcesz uruchomić zapytanie w edytorze SQL, czy w notesie. Możesz edytować zapytanie, aby wskazywało wolumin lub tabelę dokumentów, w których są przechowywane.

Aby przygotować wynik parsowania na potrzeby wyszukiwania (RAG), użyj dalej ai_prep_search (Beta).

Parsuj dokumenty w SQL

Wezwij ai_parse_document SQL, aby analizować dokumenty na dużą skalę:

SELECT
  ai_parse_document(
    content,
    map('version', '2.0')
  ) AS parsed
FROM READ_FILES('/Volumes/my_catalog/my_schema/my_documents', format => 'binaryFile');

Zobacz referencję ai_parse_document SQL.

Parsuj dokumenty za pomocą API REST

Użyj interfejsu API REST do analizowania dokumentów w aplikacjach, usługach i zautomatyzowanych przepływach pracy. Zobacz dokumentację API REST dla odniesienia.

ai_parse_document Żądania API REST są ograniczone do 100 stron w dokumencie.

ai_parse_document odczytuje dane wejściowe z woluminu Unity Catalog. Poniższy przykład przesyła lokalny plik PDF do woluminu za pomocą API Files, a następnie go analizuje.

Najpierw prześlij dokument do woluminu:

curl -X PUT "$DATABRICKS_HOST/api/2.0/fs/files/Volumes/my_catalog/my_schema/my_volume/invoice.pdf?overwrite=true" \
     -H "Authorization: Bearer $DATABRICKS_TOKEN" \
     -H "Content-Type: application/octet-stream" \
     --data-binary @invoice.pdf

Następnie przeanalizuj przesłany dokument, przekazując jako content ścieżkę woluminu:

curl -X POST "$DATABRICKS_HOST/api/2.0/ai-functions/ai-parse-document" \
     -H "Authorization: Bearer $DATABRICKS_TOKEN" \
     -H "Content-Type: application/json" \
     -d '{
  "content": "/Volumes/my_catalog/my_schema/my_volume/invoice.pdf"
}'

Limitations

Zobacz ai_parse_document ograniczenia.