文件智慧自訂範本模型

本內容適用於:🟩v4.0(通用版) | 先前版本:🟦v3.1(通用版)🟥v3.0(退役)🟥V2.1(退役)

本內容適用於:🟩v3.1 (GA) | 最新版本:🟪v4.0 (GA) | 先前版本:🟦v3.0🟦v2.1

本內容適用於:🟥v3.0(退役) | 最新版本:🟪v4.0(通用版)🟪v3.1(通用版) | 先前版本:🟥V2.1(退役)

本內容適用於:🟥v2.1 | 版本最新版本:🟪v4.0(通用版)

自訂範本(前稱自訂表單)是一種易於訓練的文件模型,能準確從文件中擷取標記的鍵值對、選取標記、表格、區域及簽章。 範本模型利用版面提示從文件中提取數值,並適合從具有定義視覺範本的高度結構化文件中擷取欄位。

自訂範本模型與自訂神經模型共享相同的標註格式與策略,並支援更多欄位類型與語言。

模型功能

自訂範本模型支援鍵值對、選取標記、表格、簽名欄位及選定區域。

表單欄位 選拔分數 表格式欄位 (資料表) 簽名 部分地區 重疊領域
支援 支援 支援 支援 支援 不支援

表格欄位

隨著 API 版本 v3.0 及更新版本的釋出,自訂範本模型新增了跨 頁 表格欄位(表格)的支援:

  • 若要標記跨多頁的資料表,請在單一資料表中標記不同頁面上的每個資料表列。
  • 作為最佳實務,請確保你的資料集包含幾個預期變異的樣本。 例如,如果您預期在文件中看到這些變化,請包含整個資料表位於單一頁面,以及資料表跨兩頁或更多頁面的範例。

表格欄位在擷取文件中重複資訊時也很有用,因為這些資訊未被識別為表格。 例如,履歷中重複出現的工作經驗段落可以標註並以表格形式提取。

處理變異

範本模型依賴定義的視覺範本,對範本的修改會導致準確度降低。 在這些情況下,將訓練資料集拆分,至少包含每個範本的五個樣本,並為每個變體訓練一個模型。 接著你可以將模型 組合 成單一端點。 對於細微差異,如數位 PDF 文件和圖片,最好在同一訓練資料集中至少包含每種類型的五個範例。

輸入需求

  • 為獲得最佳效果,請每份文件提供一張清晰照片或高品質掃描圖。

  • 支援的檔案格式:

    模型 PDF 圖片:
    JPEG/JPG, PNG, BMP, TIFF, HEIF
    Microsoft Office:
    Word(DOCX)、Excel(XLSX)、PowerPoint(PPTX)與 HTML
    閱讀 ✔ ✔ ✔
    版面配置 ✔ ✔ ✔
    一般文件 ✔ ✔
    預先建置 ✔ ✔
    習俗 ✔ ✔

    ✱ Microsoft Office 檔案目前不支援其他型號或版本。

  • 對於 PDF 和 TIFF,最多可處理 2,000 頁(免費訂閱時僅處理前兩頁)。

  • 用於分析文件的檔案大小為付費(S0)等級 500 MB,免費(F0)等級為 4 MB。

  • 影像尺寸必須介於 50 x 50 像素到 10,000 像素 x 10,000 像素之間。

  • 如果您的 PDF 有密碼鎖定,提交前必須解除鎖定。

  • 對於 1024 x 768 像素的影像,要擷取的文字最小高度為 12 像素。 此尺寸對應到每英吋 150 點 (8) 下約 DPI 點的文字。

  • 自訂模型訓練中,自訂範本模型的最大訓練頁數為 500 頁,自訂神經模型為 50,000 頁。

  • 自訂擷取模型訓練時,模板模型的訓練資料總大小為 50 MB,神經模型則為 1G-MB。

  • 自訂分類模型訓練時,訓練資料總量最大 1GB 為 10,000 頁。

訓練模型

自訂範本模型通常從 2.0 版 API 及更新版本開始提供。 如果你是從新專案開始或已有已標註的資料集,請使用 v3.1 或 v3.0 API 搭配 Document Intelligence Studio 來訓練自訂範本模型。

模型 REST API SDK 標籤與測試模型
自訂範本 v3.1 API 文件智慧 SDK 文件智慧工作室

在 v3.0 及以後的 API 中,訓練模型的建置操作支援一個新 buildMode 屬性,若要訓練自訂範本模型,請將 設 buildMode 為 template。

https://{endpoint}/documentintelligence/documentModels:build?api-version=2024-11-30


{
  "modelId": "string",
  "description": "string",
  "buildMode": "template",
  "azureBlobSource":
  {
    "containerUrl": "string",
    "prefix": "string"
  }
}

自訂範本模型通常可隨 v3.1 API 提供。 如果你是從新專案開始或已有已標註的資料集,請使用 v3.1 或 v3.0 API 搭配 Document Intelligence Studio 來訓練自訂範本模型。

模型 REST API SDK 標籤與測試模型
自訂範本 v3.1 API 文件智慧 SDK 文件智慧工作室

在 v3.0 及以後的 API 中,訓練模型的建置操作支援一個新 buildMode 屬性,若要訓練自訂範本模型,請將 設 buildMode 為 template。

https://{endpoint}/formrecognizer/documentModels:build?api-version=2023-07-31

{
  "modelId": "string",
  "description": "string",
  "buildMode": "template",
  "azureBlobSource":
  {
    "containerUrl": "string",
    "prefix": "string"
  }
}

支援語言與地點

請參閱 我們的 語言支援—自訂模型 頁面,了解完整的支援語言清單。

自訂(範本)模型通常可隨 v2.1 API 提供。

模型 REST API SDK 標籤與測試模型
自訂模型(範本) 文件智慧 2.1 文件智慧 SDK 文件智慧範例標註工具

下一步

學習創建與組合自訂模型: