文件解析運用最先進的研究技術,從多種文件類型中萃取並視覺化結構化資料,包括但不限於 PDF、圖片、Word 文件(DOC/DOCX)及 PowerPoint 檔案(PPT/PPTX)。 它設計用來處理複雜的版面,如表格、圖表,以及文字與圖片混合的內容。
文件解析可透過 Agent Bricks 介面、 SQL 及 REST API 進行。
在介面中建立一個文件解析代理程式
Requirements
- 包含下列各項的工作區:
- 已啟用無伺服器計算。 請參閱 無伺服器運算需求。
- 已啟用 Unity 目錄。 請參閱 為 Unity Catalog 啟用工作區。
- 可取得非零預算的 無伺服器使用政策 。
- 此功能僅在部分地區提供,詳見 AI 功能可用性。
- 此功能
ai_parse_document也適用於安裝 強化安全與合規附加元件的工作空間。
- 此功能
使用文件解析來解析你的文件並視覺化其結構。
- 轉到
在您的工作區左側導覽面板中選擇代理程式。
- 點擊 建立代理>文件解析。
- 選擇你的來源文件。 你可以選擇上傳檔案,或從現有的 Unity 目錄中選擇一個檔案。 支援格式包括:PDF、圖片、DOC/DOCX 及 PPT/PPTX。
- 點擊 解析文件。
解析你的文件可能需要幾分鐘。 完成後,文件解析會顯示左側的原始文件,右側顯示解析後的文件。 你可以選擇以 格式化 文字或 原始 JSON 來查看解析後的文件。
流程與查詢結果
若要查看 ai_parse_document 查詢並在更多文件上執行,請點擊 「使用代理」 ,並選擇從 SQL 編輯器或筆記本執行查詢。 你可以編輯查詢,以指向存放文件的磁碟區或資料表。
要準備解析輸出以供檢索(RAG),請使用 ai_prep_search 下游版本(Beta)。
在 SQL 中解析文件
在 SQL 中呼叫 ai_parse_document 以大規模剖析文件:
SELECT
ai_parse_document(
content,
map('version', '2.0')
) AS parsed
FROM READ_FILES('/Volumes/my_catalog/my_schema/my_documents', format => 'binaryFile');
請參考 SQL 參考資料 ai_parse_document 。
使用 REST API 解析文件
使用 REST API 來解析應用程式、服務和自動化工作流程的文件。 參考 REST API 文件 。
ai_parse_document REST API 請求每份文件限制為 100 頁。
ai_parse_document 會從 Unity Catalog 磁碟區讀取輸入資料。 以下範例是將本地 PDF 上傳到帶有 Files API 的磁碟區,然後解析它。
首先,將文件上傳到一個磁碟區:
curl -X PUT "$DATABRICKS_HOST/api/2.0/fs/files/Volumes/my_catalog/my_schema/my_volume/invoice.pdf?overwrite=true" \
-H "Authorization: Bearer $DATABRICKS_TOKEN" \
-H "Content-Type: application/octet-stream" \
--data-binary @invoice.pdf
然後將已上傳文件的磁碟區路徑作為 content 傳遞,以剖析該文件:
curl -X POST "$DATABRICKS_HOST/api/2.0/ai-functions/ai-parse-document" \
-H "Authorization: Bearer $DATABRICKS_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"content": "/Volumes/my_catalog/my_schema/my_volume/invoice.pdf"
}'