文件解析

文件解析運用最先進的研究技術,從多種文件類型中萃取並視覺化結構化資料,包括但不限於 PDF、圖片、Word 文件(DOC/DOCX)及 PowerPoint 檔案(PPT/PPTX)。 它設計用來處理複雜的版面,如表格、圖表,以及文字與圖片混合的內容。

文件解析可透過 Agent Bricks 介面、 SQL 及 REST API 進行。

在介面中建立一個文件解析代理程式

Requirements

使用文件解析來解析你的文件並視覺化其結構。

  1. 轉到代理圖標。在您的工作區左側導覽面板中選擇代理程式。
  2. 點擊 建立代理>文件解析。
  3. 選擇你的來源文件。 你可以選擇上傳檔案,或從現有的 Unity 目錄中選擇一個檔案。 支援格式包括:PDF、圖片、DOC/DOCX 及 PPT/PPTX。
  4. 點擊 解析文件。

解析你的文件可能需要幾分鐘。 完成後,文件解析會顯示左側的原始文件,右側顯示解析後的文件。 你可以選擇以 格式化 文字或 原始 JSON 來查看解析後的文件。

文件解析介面,顯示原始文件與解析後的文件並排呈現

流程與查詢結果

若要查看 ai_parse_document 查詢並在更多文件上執行,請點擊 「使用代理」 ,並選擇從 SQL 編輯器或筆記本執行查詢。 你可以編輯查詢,以指向存放文件的磁碟區或資料表。

要準備解析輸出以供檢索(RAG),請使用 ai_prep_search 下游版本(Beta)。

在 SQL 中解析文件

在 SQL 中呼叫 ai_parse_document 以大規模剖析文件:

SELECT
  ai_parse_document(
    content,
    map('version', '2.0')
  ) AS parsed
FROM READ_FILES('/Volumes/my_catalog/my_schema/my_documents', format => 'binaryFile');

請參考 SQL 參考資料 ai_parse_document 。

使用 REST API 解析文件

使用 REST API 來解析應用程式、服務和自動化工作流程的文件。 參考 REST API 文件 。

ai_parse_document REST API 請求每份文件限制為 100 頁。

ai_parse_document 會從 Unity Catalog 磁碟區讀取輸入資料。 以下範例是將本地 PDF 上傳到帶有 Files API 的磁碟區,然後解析它。

首先,將文件上傳到一個磁碟區:

curl -X PUT "$DATABRICKS_HOST/api/2.0/fs/files/Volumes/my_catalog/my_schema/my_volume/invoice.pdf?overwrite=true" \
     -H "Authorization: Bearer $DATABRICKS_TOKEN" \
     -H "Content-Type: application/octet-stream" \
     --data-binary @invoice.pdf

然後將已上傳文件的磁碟區路徑作為 content 傳遞,以剖析該文件:

curl -X POST "$DATABRICKS_HOST/api/2.0/ai-functions/ai-parse-document" \
     -H "Authorization: Bearer $DATABRICKS_TOKEN" \
     -H "Content-Type: application/json" \
     -d '{
  "content": "/Volumes/my_catalog/my_schema/my_volume/invoice.pdf"
}'

Limitations

詳見ai_parse_document限制。