本內容適用於:🟥v2.1 | 版本最新版本:🟪v4.0(通用版)
重要
v4.0 2024-11-30 (正式發行) 的 model compose 作業會新增明確訓練的分類器,以取代用於分析的隱含分類器。 關於先前的組合模型版本, 請參見 組合自訂模型 v3.1。 如果你目前使用的是組合模型,建議升級到最新版本。
什麼是組合模型?
在組合模型中,你可以將多個自訂模型分組成一個組合模型,並以單一模型 ID 命名。 例如,您的撰寫式模型可能包含已訓練用來分析供應、設備與家具採購單的自訂模型。 你不必手動選擇合適的模型,而是使用組合模型來決定每個分析和萃取的合適客製化模型。
有些情境需要先分類文件,然後再用最適合從模型中提取欄位的模型來分析文件。 這類情境可能包括使用者上傳文件但文件類型未明確知道的情況。 另一種情況是將多個文件掃描成一個檔案,並提交處理。 接著你的應用程式需要識別組成文件,並為每份文件選擇最佳模型。
在先前版本中,該 model compose 操作會進行隱含分類,以決定哪個自訂模型最適合代表提交的文件。
2024-11-30(GA)的實作model compose將早期版本的隱式分類取代為明確分類步驟,並新增條件路由。
新模型組合運算的優點
新 model compose 操作需要訓練明確的分類器,並提供多項好處。
持續的漸進式改進。 你可以透過增加更多樣本並 逐步提升分類品質,持續提升分類器的品質。 這種微調確保你的文件總是導向正確的模型進行擷取。
完全掌控路由。 透過加入信心導向路由,你為文件類型和分類回應提供了信心門檻。
操作過程中忽略特定類型的文件。 早期的
model compose操作實作會依照信心分數來挑選最佳分析模型進行提取,即使信心分數的最高值相對較低。 透過提供信心門檻或明確不將已知文件類型從分類映射到擷取模型,你可以忽略特定文件類型。分析多個相同文件類型的實例。 當搭配
splitMode分類器選項時,該model compose操作可以偵測同一文件的多個實例,並將檔案拆分以獨立處理每個文件。 使用splitMode後,能在單一請求中處理多個文件實例。支援附加功能。 附加功能如查詢欄位或條碼也可作為分析模型參數的一部分指定。
自訂型號上限擴展至500。 此操作的新實作
model compose允許你將最多 500 個訓練出的自訂模型指派給單一組合模型。
如何使用 model compose
先收集所有所需文件的範例,包含含有應擷取或應忽略資訊的範例。
透過將文件組織到資料夾中來訓練分類器,資料夾名稱就是你打算在組合模型定義中使用的文件類型。
最後,為你打算使用的每種文件類型訓練一個擷取模型。
當你的分類與擷取模型訓練完成後,可以使用 Document Intelligence Studio、用戶端函式庫或 REST API 將分類與擷取模型組合成組合模型。
使用參數 splitMode 來控制檔案分割行為:
- 沒有。 整個檔案被視為一份文件。
- 每頁。 檔案中的每一頁都被視為獨立文件。
- 自動。檔案會自動拆分成文件。
計費與定價
組合模型的收費與個別客製化模型相同。 定價是根據下游分析模型分析的頁面數量而定。 計費以路由到擷取模型之頁面的擷取價格為準。 加入明確分類後,會針對輸入檔案中的所有頁面分類產生費用。 欲了解更多資訊,請參閱 文件智慧定價頁面。
使用模型組合操作
首先,建立一份你想組合成單一模型的所有模型 ID 清單。
使用 Studio、REST API 或用戶端函式庫,將模型組合成單一模型 ID。
使用組合模型 ID 來分析文件。
計費
組合模型的收費與個別客製化模型相同。 定價是根據分析的頁面數量來決定的。 計費以路由到擷取模型之頁面的擷取價格為準。 欲了解更多資訊,請參閱 文件智慧定價頁面。
- 使用個人自訂模型或組合自訂模型分析文件的價格不會改變。
組合模型特性
Custom template和custom neural模型可以共同組成跨多個 API 版本的組合模型。回應包含
docType一個屬性,用以指示分析文件所使用的組合模型中哪一個。對於
custom template模型,組合後的模型可透過自訂範本的變體或不同表單類型來建立。 當輸入表單屬於多個範本之一時,此操作非常有用。對於模型,
custom neural最佳做法是將單一文件類型的各種變化加入同一個訓練資料集,並用自訂神經模型進行訓練。 此model compose操作最適合處理不同類型文件需分析的情境。
組合模型限制
透過這個
model compose操作,你可以將最多 500 個模型分配到單一模型 ID。 如果我想組合的模型數量超過組合模型的上限,你可以使用以下其中一種替代方案:在呼叫自訂模型前,先分類文件。 你可以使用 Read 模型 ,並根據從文件中擷取的文字和特定片語,透過程式碼、正則表達式或搜尋等來源來建立分類。
如果你想從各種結構化、半結構化和非結構化文件中提取相同的欄位,可以考慮使用深度學習 的自訂神經模型。 了解更多關於 自訂模板模型與自訂神經模型的差異。
使用組合模型分析文件與使用單一模型分析文件是相同的。 結果
Analyze Document返回一個docType屬性,指示你選擇了哪個組件模型來分析文件。目前此
model compose操作僅適用於以標籤訓練的自訂模型。
組合模型相容性
| 客製化模型類型 | 以 v2.1 和 v2.0 訓練的模型 | 自訂範本與神經模型 v3.1 與 v3.0 | 自訂模板與神經模型 v4.0 2024-11-30 (GA) |
|---|---|---|---|
| 使用 2.1 與 v2.0 版訓練的模型 | 不支援 | 不支援 | 不支援 |
| 自訂範本與神經模型 v3.0 與 v3.1 | 不支援 | 支援 | 支援 |
| 自訂範本與神經模型 v4.0 | 不支援 | 支援 | 支援 |
若要組合使用先前版本 API(v2.1 或更早版本)訓練的模型,請使用相同標記資料集使用 v3.0 API 訓練模型。 此新增功能確保 v2.1 模型能與其他模型組合。
使用 API 版本 2.1 編寫的模型仍持續支援,無需更新。
開發選項
文件智慧 v4.0:2024-11-30(通用版) 支援以下工具、應用程式與函式庫:
| 特色 | 資源 |
|---|---|
| 客製化模型 | • 文件智慧工作室 • REST API • C# SDK • Java SDK • JavaScript SDK • Python SDK |
| 組合模型 | • 文件智慧工作室 • REST API • C# SDK • Java SDK • JavaScript SDK • Python SDK |
文件智慧 v3.1:2023-07-31 (GA) 支援以下工具、應用程式與函式庫:
| 特色 | 資源 |
|---|---|
| 客製化模型 | • 文件智慧工作室 • REST API • C# SDK • Java SDK • JavaScript SDK • Python SDK |
| 組合模型 | • 文件智慧工作室 • REST API • C# SDK • Java SDK • JavaScript SDK • Python SDK |
文件智慧 v3.0:2022-08-31 (GA) 支援以下工具、應用程式與函式庫:
| 特色 | 資源 |
|---|---|
| 客製化模型 | • 文件智慧工作室 • REST API • C# SDK • Java SDK • JavaScript SDK • Python SDK |
| 組合模型 | • 文件智慧工作室 • REST API • C# SDK • Java SDK • JavaScript SDK • Python SDK |
文件智慧 v2.1 支援以下資源:
| 特色 | 資源 |
|---|---|
| 客製化模型 | • 文件智慧標註工具 • REST API • 用戶端函式庫 SDK • 文件智慧 Docker 容器 |
| 組合模型 | • 文件智慧標註工具 • REST API • C# SDK • Java SDK • JavaScript SDK • Python SDK |
下一步
學習創建與組合自訂模型: