Foundry 工具中的 Azure 內容瞭解視訊解決方案

重要

API 版本 2026-06-01-preview 目前為公開預覽版。 預覽版在沒有服務等級協議的情況下提供,且不建議用於生產工作負載。 欲了解更多資訊,請參閱Microsoft Azure預覽補充使用條款及Microsoft產品與服務資料保護附錄(「DPA」)。

Azure Content Understanding 允許你產生標準的影片元資料,並利用生成模型為特定使用情境建立自訂欄位。 內容理解幫助你管理、分類、檢索及建立影片資產的工作流程。 它強化你的媒體資產庫,支援如高亮生成等功能,分類內容,並促進像檢索增強生成(RAG)等應用。

內容瞭解影片處理流程的圖解。

預先建立的影片分析器 (prebuilt-videoAnalysis) 會輸出可用於 RAG 的輸出。 在 Markdown 中,它輸出如下:

  • 逐字稿: 標準 WEBVTT 格式的內嵌逐字稿
  • 關鍵畫面: 有序關鍵幀縮圖,促進更深入的分析

而 JSON 架構則包含了更多來自視覺分析的細節。

  • 說明: 自然語言片段描述,結合視覺與語音語境
  • 分段: 自動場景分割,根據你定義的類別將影片拆解成邏輯區塊

此格式可直接插入向量庫,啟用代理或 RAG 工作流程——無需後製處理。

接著你可以自訂分析儀,對輸出有更細緻的控制。 你可以定義自訂欄位和區段。 自訂化讓你能充分利用生成模型的力量,從影片的視覺與音訊細節中萃取深刻的洞見。

例如,自訂功能允許你:

  • 定義自訂欄位: 用來辨識影片中出現或提及的產品和品牌。
  • 產生自訂片段: 根據討論的主題或新聞故事,將新聞播報分成章節。

為什麼要用 Content Understanding 來處理影片?

影片內容理解具有廣泛的潛在用途。 例如,你可以自訂元資料,為培訓影片中的特定場景標註,讓員工更容易找到並重訪重要段落。 你也可以利用元數據自訂來識別宣傳影片中的產品置入,這能幫助行銷團隊分析品牌曝光度。 其他使用情境包括:

  • 廣播媒體與娛樂: 透過為每個資產產生詳細的元資料,管理大量節目、電影和片段庫。
  • 教育與電子學習: 索引並檢索教育影片或講座中的特定時刻。
  • 企業培訓: 依照關鍵主題、場景或重要時刻組織訓練影片。
  • 行銷與廣告: 分析宣傳影片,擷取產品置入、品牌形象及關鍵訊息。

預建視訊分析儀範例

使用預建的影片分析器(prebuilt-videoSearch),你可以上傳影片,立即取得可用的知識資產。 該服務會將內容打包成格式豐富的 Markdown 和 JSON。 這個流程讓你的搜尋索引或聊天代理能在不使用自訂黏合程式碼的情況下擷取內容。

  1. 例如,呼叫專為影片 prebuilt-videoSearch 擷取擴增生成而設計的分析器。 詳情請參考 REST API 快速入門 。

  2. 分析一支30秒的廣告影片會產生以下結果:

      # Video: 00:00.000 => 00:06.000
      A lively room filled with people is shown, where a group of friends is gathered around a television. They are watching a sports event, possibly a football match, as indicated by the decorations and the atmosphere.
    
      Transcript
    
      WEBVTT
    
      00:03.600 --> 00:06.000
      <Speaker 1>Get new years ready.
    
      Key Frames
      - 00:00.600 ![](keyFrame.600.jpg)
      - 00:01.200 ![](keyFrame.1200.jpg)
    
      ## Video: 00:06.000 => 00:10.080
      The scene transitions to a more vibrant and energetic setting, where the group of friends is now celebrating. The room is decorated with football-themed items, and everyone is cheering and enjoying the moment.
    
      Transcript
    
      WEBVTT
    
      00:03.600 --> 00:06.000
      <Speaker 1>Go team!
    
      Key Frames
      - 00:06.200 ![](keyFrame.6200.jpg)
      - 00:07.080 ![](keyFrame.7080.jpg)
    
         *…additional data omitted for brevity…*
    

操作指南

請參閱以下關於使用「內容瞭解」對影片進行 RAG 的逐步解說:

使用 Azure 內容理解對影片執行 RAG

能力

兩個階段將原始影片轉化為結構化的洞見。 下圖展示了內容萃取如何導入欄位萃取。

影片分析器流程圖截圖。

該服務分為兩個階段運作。 第一階段內容擷取,涉及擷取基礎的元資料,如逐字稿和鏡頭。 第二階段,欄位擷取,利用生成模型產生自訂欄位並執行分割。

內容擷取功能

第一輪處理主要是擷取第一組節—包括說話者身分及剪輯位置。 它建立一個穩固的元資料基礎,供後續步驟進行推理。

  • 逐字稿: 將對話音頻轉換為可搜尋及分析的 WebVTT 格式文字文字稿。 若 "returnDetails": true 設定為 ,則可使用句子層級的時間戳記。 內容瞭解支援 Foundry Tools 中 Azure 語音的全部語音轉換文字語言。 視訊語言支援的細節與音訊相同, 詳見音訊語言處理 。 以下的轉錄細節值得注意:

    • 說話者辨識: 在輸出中區分對話中的講者,並將轉錄稿部分歸因於特定講者。

    • 多語言轉錄: 產生多語言文字記錄。 逐字稿中,每個片語會套用相應的語言和地區設定。 片語輸出在設定 "returnDetails": true 時。 偏離語言偵測,當未指定語言/地點或語言設定為 auto時,此功能會啟用。

      註

      當使用多語言轉錄時,任何包含不支援地點的檔案會產生基於最近支援地點的結果,這很可能是錯誤的。 此結果為已知的行為。 未使用支援多語系謄寫的地區設定時,請務必設定地區設定,以免發生謄寫品質問題。

    • 關鍵影格擷取: 從影片中擷取關鍵影格,完整呈現每個鏡頭,確保每個鏡頭有足夠的關鍵影格,使現場萃取能有效運作。

    • 鏡頭偵測:盡可能找出符合鏡頭邊界的影片分割片段,以便於精確編輯和重新封裝內容,並使內容分段與現有編輯切點完全吻合。 輸出為 的時間戳列表,單位為毫秒。cameraShotTimesMs 只有在 "returnDetails": true 設定 時,輸出才會回傳。

欄位擷取與分割

接著,生成模型會疊加意義——標註場景、摘要行動,並依照你的要求將影像切片成段落。 這個動作就是提示轉化為結構化資料的地方。

自訂欄位

調整輸出結果以符合你的商業用語。 使用 fieldSchema 一個物件,每個項目定義欄位的名稱、類型和描述。 執行時,生成模型會為每個區段填滿這些欄位。

  • 媒體資產管理:

    • 影片類別: 協助編輯與製作人組織內容,將其分類為新聞、體育、訪談、紀錄片或廣告。 對於元資料標記以及更快速的內容過濾和檢索非常有用。
    • 配色方案: 傳達情緒與氛圍,對敘事一致性與觀眾投入至關重要。 辨識色彩主題有助於找到匹配的片段以加速影片剪輯。
  • 廣告:

    • 品牌: 識別品牌存在感,對分析廣告影響力、品牌能見度及與產品關聯至關重要。 此功能讓廣告主能評估品牌知名度並確保遵守品牌規範。
    • 廣告類別: 依產業、產品類型或受眾細分分類廣告類型,支援精準廣告策略、分類及績效分析。

範例:

"fieldSchema": {
  "description": "Extract brand presence and sentiment per scene",
  "fields": {
    "brandLogo": {
      "type": "string",
      "method": "generate",
      "description": "Brand being promoted in the video. Include the product name if available."
    },
    "Sentiment": {
      "type": "string",
      "method": "classify",
      "description": "Ad categories",
      "enum": [
        "Consumer Packaged Goods",
        "Groceries",
        "Technology"
      ]
    }
  }
}

分割模式

註

設定分割將使用生成模型,即使未定義欄位,也會消耗代幣。

內容瞭解提供兩種影片分段方式,讓您能取得所需的完整影片或短片輸出。 你可以透過自訂分析器設定屬性 enableSegment 來使用這些選項。

  • 全影像 – enableSegment : false 服務將整個影片檔案視為單一片段,並擷取貫穿全程的元資料。

    使用案例:

    • 合規檢查會針對廣告中任何特定品牌安全問題進行檢查
    • 完整描述性摘要
  • 自訂分割 —— enableSegment : true 你用自然語言描述邏輯,模型會建立相應的片段。 用一串描述你希望影片如何分段的字串來設定 contentCategories 。 自訂則允許長度從幾秒到幾分鐘不等的段落,視提示而定。 在此版本中,影片僅支援一個 contentCategories 物件。

    範例: 將新聞播報拆解成故事。

    {
      "config": {
        "enableSegment": true,
        "contentCategories": {
          "news-story": { 
          "description": "Segment the video based on each distinct news segment. Use the timestamp of each image to identify the start and end time of each segment, no overlap segments. Ignore non-news segments like ads or promotion.",
          "analyzerId": "NewsAnalyzer"
          }         
        }
      }
    }
    

主要優點

與其他影片分析解決方案相比,內容理解提供了幾項關鍵優勢:

  • 基於區段的多幀分析: 透過分析每個影片片段的多個畫面,而非單一畫面,來識別行動、事件、主題與主題。
  • 客製化: 根據你的具體使用情境,修改結構結構,自訂你產生的欄位與分段方式。
  • 生成式模型: 用自然語言描述你想擷取的內容,內容理解則使用生成模型來提取這些元資料。
  • 優化後處理: 執行多項內容擷取的預處理步驟,如轉錄與場景偵測,優化以提供豐富的 AI 生成模型脈絡。

技術限制與侷限

需要注意的影片處理具體限制:

  • 影格取樣(~ 1 FPS):分析儀每秒分析約一個影格。 快速動作或單幀事件可能會被忽略。
  • 影格解析度(512 × 512 px):取樣後的影格會調整為 512 像素的正方形。 小文字或遠處物件可能會遺失。
  • 語音:僅轉錄口語。 音樂、音效和環境噪音都被忽略了。

輸入需求

關於支援的格式,請參見 服務配額與限制。

支援語言與地區

請參見 語言與地區支援。

資料隱私與安全

如同所有 Foundry 工具,請檢視 Microsoft 的 Data、保護與隱私文件。