選擇 Azure AI 影像和影片處理和產生技術

Foundry Tools 協助開發者與組織打造基於 AI 的先進且可上環境的應用程式,並透過現成、預建且可自訂的 API 與模型,與負責任的 AI 實踐相符。

本文介紹 Foundry 中的影片與影像處理能力,例如視覺分析與影像生成、物件偵測、影像分類及臉部辨識。 該套房包含以下服務:

  • Azure OpenAI 在 Foundry 模型 中提供以下 OpenAI 語言模型的存取權限:

    • 最新一代具備視覺與聽覺功能的 GPT 模型

    • DALL-E 用於影像生成

    • 用於即時語音對話、音訊生成、語音轉文字(STT)轉錄、翻譯及文字轉語音(TTS)的音訊模型

    使用 Azure OpenAI 來產生自然語言影像、廣泛且非特定性的影像分析,或是不需要專用語音服務的音訊場景。

  • Foundry 工具中的 Azure Vision 提供先進的演算法,能處理影像並根據視覺特徵回傳資訊。 它包含光學字元辨識(OCR)、影像分析及臉部偵測功能。

  • Azure Machine Learning AutoML for 電腦視覺 自動化模型訓練與超參數調整,用於影像分類、物件偵測及實例分割。 你可以下載所得模型,或註冊並部署模型到 Azure Machine Learning。

  • Azure 內容理解在 Foundry 工具中利用 生成式 AI 從影像與影片中擷取結構化欄位。 當您需要按架構定義的提取、場景分段或為檢索增強生成(RAG)準備的視訊輸出時,可以使用 Azure Content Understanding。

  • Microsoft Azure AI 影片索引器 是一款 AI 解決方案,組織可利用它從影片與音訊內容中提取深度洞察。 它透過先進的機器學習與生成式 AI 模型,支援即時及上傳的原始資料。

Azure OpenAI

Azure OpenAI 提供 OpenAI 強大的語言模型,包括具備影像、影片與音訊功能的最新一代 GPT 模型。 DALL-E 與 GPT 影像生成模型,以及用於即時語音對話、音訊生成與轉錄、STT、語音翻譯與語音轉譯(TTS)的 音訊模型 也可用。

這些任務使用 Azure OpenAI 來完成 這些任務不要用 Azure OpenAI 來完成
利用 DALL-E 或 GPT 影像模型,從自然語言描述生成影像。 執行特定的影像處理任務,例如表單擷取或領域專用偵測。 使用 Azure 文件智能 來處理這些任務。
利用像GPT-4o這類具視覺能力的模型,對影像進行廣泛且非特定的分析。 使用你定義的結構模式,從影像中擷取結構化欄位。 若要進行結構驅動的擷取,請使用 Azure Content Understanding。
使用 Whisper 或 GPT-4o 轉錄模型,轉錄 STT 或翻譯語音。 偵測、辨識或分析人類臉部。 臉部相關任務請使用 Azure Vision。
透過使用 GPT-4o 即時音訊模型,實現低延遲的即時語音對話。 做需要進階客製化、話者分辨或自訂詞彙的大規模語音轉錄。 針對這些情況,請使用 Foundry Tools 中的 Azure Speech。
為圖片產生無障礙描述。 使用開源影像生成模型。 對於開源模型,請使用 Azure Machine Learning。

音頻模型

Azure OpenAI 透過以下 API 提供音訊模型:

  • 低延遲、即時語音對話的Realtime API

  • 聊天完成 API,提供音訊,方便在單一模型通話中靈活生成與轉錄音訊

  • 音訊 API 透過 /audio 端點,提供 Whisper 和 GPT-4o 模型中的檔案式語音轉文字(STT)轉錄、語音翻譯及文字轉語音(TTS)服務

Azure Vision

Azure Vision 是 Tools 中的一項服務。 它提供先進的演算法,根據你指定的視覺特徵處理影像並回傳資訊。 Azure Vision 包含 OCR、影像分析及臉部偵測功能。

這些任務請使用 Azure Vision 來完成 這些任務不要用 Azure Vision 來做
利用 OCR 從影像和文件中擷取印刷及手寫文字。 進行進階影片分析,如轉錄、翻譯或內容摘要。 針對這些任務,請使用 Video Indexer。
分析影像以提取物體、臉部及自動生成的描述等視覺特徵。 內容適度以保障安全。 內容管理請使用 Foundry Control Plane中的Content Safety。
偵測、辨識並分析影像中的人臉。 執行那些大型多模態基礎模型(如 GPT-4o)已經支持的分析工作。

Azure Vision 可用功能

下表列出 Azure Vision 可用的功能。

Feature 描述
光學字元識別 從圖片中擷取文字。 您可以使用讀取 API,從相片和文件中擷取印刷和手寫的文字。 它採用深度學習模型,處理各種表面與背景上的文字,包括商業文件、發票、收據、海報、名片、信件及白板。
影像分析 從影像中擷取許多視覺特徵,如物件、臉部、成人內容及自動生成的文字描述。 你可以利用基於 Florence 基金會模型的 Image Analysis 4.0 建立自訂影像識別碼模型。
臉部偵測與分析 識別影像中包含人臉的區域,通常透過回傳圍繞臉部形成矩形的包圍框座標。
尋找相似的臉部 將目標臉與一組候選臉配對,並識別出較小的一組與目標臉相似的人臉。 此功能對於以影像進行臉部搜尋非常有用。
群組面孔 根據相似度將一組未知面孔分成數個較小的群組。
臉部識別 將影像中的一張臉與安全儲存庫中的一組臉進行一對多匹配。 會根據其臉部資料與查詢臉部的相符程度來傳回匹配的候選者。
臉部驗證 進行一對一配對以確認使用者是否就是他們所聲稱的身份。
活體偵測 一個反欺騙功能,能檢查使用者是否實體出現在鏡頭前。 防止利用列印照片、錄影影片或使用者臉部 3D 遮罩進行偽造攻擊。

Azure Vision 的使用案例

下表列出了 Azure Vision 可能的使用情境。

使用案例 描述
產生圖片替代文字 使用影像分析標題模型自動產生圖片的替代文字描述。 替代文字提升盲人或低視力使用者的無障礙性,協助符合法律合規要求,並透過改進 SEO 讓您的網站更易被發現。 Microsoft 產品如 PowerPoint、Word 和 Edge 都採用此功能。
身份驗證 使用 Azure Face 來確認使用者是否真實身份。 驗證是將探測映像與已註冊的範本(如政府核發的身分證)進行比較,以進行存取控制情境。 此方法相較於知識型方法,有助於提升使用者體驗與安全性。
臉部遮蔽 對影片中錄製的偵測到的臉部進行編輯或模糊處理,以保護他們的隱私。
無接觸式存取控制 使用選擇加入的臉部識別功能以強化存取控制,同時降低因實體媒體共享、遺失或被竊而帶來的維護與安全風險。 臉部辨識可協助在機場、運動場、主題公園、大樓、辦公室的接待櫃檯、醫院、健身房、俱樂部或學校的簽入過程,並有人工監督提供協助。

Azure Machine Learning AutoML

Azure Machine Learning AutoML for 電腦視覺 提供影像辨識功能,讓你能自動建立、部署並改進影像模型。 影像識別碼會根據影像的視覺特徵為其貼標籤。 每個標籤都代表一個分類或物件。 使用 Azure Machine Learning AutoML 指定自己的標籤,並訓練自訂模型來偵測它們。

這些任務請使用 Azure Machine Learning AutoML 這些任務不要用 Azure Machine Learning AutoML 來完成
辨識標準影像分析無法偵測的特殊物件與製造缺陷。 做基本的物體偵測或臉部偵測。 改用 Azure Vision 。
針對特定業務需求提供詳細的客製化分類。 做基本的視覺分析。 建議使用Azure OpenAI 中的具視覺能力模型,或是機器學習中的開源模型。
用你自己的標註影像訓練模型,針對專門的情境。

Azure Machine Learning AutoML 利用機器學習演算法分析影像中的自訂特徵。 標註影像資料以註解形式提供。 註解結構依任務而定:用於分類的影像層級標籤、用於物件偵測的邊界框,以及用於實例分割的多邊形。 你可以利用內建的 Azure 機器學習資料標籤功能來做此類註解。 AutoML 演算法接著使用這些標註和影像來訓練模型,並透過在保留測試影像集上測試模型來計算模型準確度。 AutoML 訓練出最佳模型後,你可以測試、重新訓練,最終在影像辨識應用程式中使用該模型來分類影像或偵測物體。 您也可以匯出模型以供離線使用。

Azure Machine Learning AutoML 可用功能

下表列出可用的功能。

Feature 描述
(多標籤)影像分類 根據一組稱為特徵的輸入來預測類別。 計算每個可能類別的機率得分,並傳回一個標籤,指示該物件最可能屬於的類別。 要使用此模型,您需要由特徵及其標籤組成的資料
物件偵測 取得影像中物件的座標。 要使用此模型,您需要由特徵及其標籤組成的資料
實例分割 在像素層級識別物件,並用多邊形勾勒每個物件的輪廓。

Azure Machine Learning AutoML for 電腦視覺 的使用案例

下表列出 Azure Machine Learning AutoML 可能的使用案例。

使用案例 描述
分類影像與物件 藉由訓練自定義模型來分析相片並掃描特定標誌。

Azure Content Understanding

Azure Content Understanding 是 Tools 中的一項服務。 它利用生成式 AI 從影像和影片中提取結構化場。 你定義一個結構來指定要擷取的內容,Azure Content Understanding 會運用生成模型產生結構化的 JSON 或 RAG 格式 Markdown 輸出。 它同時為每個擷取值提供信心分數與基礎,支援自動化工作流程與針對性的人工審查。

為這些任務使用 Azure Content Understanding 這些任務不要用 Azure Content Understanding。
利用您定義的結構模式(例如產品、品牌或缺陷偵測)從影像中擷取自訂結構欄位。 請進行標準影像分析,例如物件偵測或光學辨識(OCR)。 這些任務可以用 Azure Vision 來完成。
從影片產生符合 RAG 格式的輸出,包括場景描述、逐字稿及關鍵影格,用於搜尋索引或聊天代理。 擷取深入的影片洞察,例如名人識別、講者點名或長篇內容的情感分析。 這些任務使用 影片索引器 。
將影片分割成場景,並為每個片段擷取自訂元資料,例如品牌存在感或廣告類別。
在影像或影片中產生臉部描述,例如臉部表情或名人識別。 這些功能存取有限。

Azure 可用的內容理解功能

下表列出 Azure 內容理解中可用的影像與影片功能。

Feature 描述
影像場擷取 根據你定義的架構,從圖片中擷取自訂的結構化欄位。 你可以直接擷取欄位、從一組類別中分類,或使用生成模型來產生欄位。 此功能對零售貨架分析、製造品質管控及基於圖表的商業智慧(BI)非常有用。
關鍵影格擷取 從影片中每個鏡頭擷取代表性的關鍵影格。 確保每個區段有足夠的視覺上下文,方便下游場域擷取。
鏡頭偵測 根據視覺線索辨識影片拍攝邊界。產生時間戳記清單,方便精確編輯、重新包裝與分割。
場景分割 將影片分割成以自然語言描述的邏輯場景。 你定義分段邏輯,例如依新聞主題拆分新聞,生成模型會建立匹配的分段。
影像場擷取 利用生成模型,根據架構(如品牌標誌、廣告類別或場景情感)為每個影片片段產生自訂結構欄位。
臉部描述 生成影像或影片中臉部的文字描述,包括鬍鬚、表情及名人識別。 臉部描述是有限存取功能,需要你在分析器設定中關閉臉部模糊。

Azure 內容理解的使用案例

下表列出了 Azure 內容理解應用於影像與影片的可能應用案例。

使用案例 描述
RAG 影像 從影片檔案產生符合 RAG 格式的 Markdown,包括內嵌逐字稿、關鍵影格縮圖及自然語言段落描述。 將輸出直接放入向量儲存庫,讓代理人或搜尋工作流程無需後製處理。
媒體資產管理 用場景層級的元資料標註影片資產,如內容分類、品牌存在感和關鍵時刻。 這種方法幫助剪輯師、製作人和行銷團隊組織並檢索大型影片資料庫的內容。
製造品質管控 將產品影像與自訂架構分析,以偵測生產線中的缺陷、異常或錯位。
零售貨架分析 從貨架影像中擷取結構化資料,以清點產品、偵測錯置並監控庫存水平。
廣告與品牌分析 識別宣傳影片片段中的品牌標誌和廣告類別,以評估品牌曝光度及是否符合品牌指引。

Video Indexer

Video Indexer 是一款 AI 解決方案,組織可利用它從即時及上傳的影片與音訊內容中提取深度洞察。 它運用先進的機器學習與生成式 AI 模型,並支援多種功能,包括轉錄、翻譯、物件偵測及影片摘要。 Video Indexer 很有彈性。 你可以在雲端使用它,或透過 Azure Arc 部署到邊緣地點。

使用影片索引器來完成這些任務 這些任務不要用 Video Indexer 來做
從上傳影片中提取洞見,包括轉錄、翻譯及內容分析。 做一些基本的影片分析任務,比如人數計算和動作偵測。 Azure Vision 是這些任務中更具成本效益的工具。
即時分析直播影片串流,以應對零售、製造或安全情境。 從靜態圖片中擷取文字。 圖片的 OCR 可以用 Azure Vision。
使用 Azure Arc 對具備嚴格資料駐留或低延遲需求的邊緣裝置進行視訊分析。

部署選項

Video Indexer 提供以下部署選項。

Option 描述
雲端影片索引器 一個基於工具打造的雲端應用程式,包括 Azure Face、Foundry Tools 中的 Azure 翻譯工具、Azure Vision 以及 Azure Speech。 它透過運行超過 30 個 AI 模型來分析影片與音訊內容,產生詳細的洞見。
Video Indexer 由 Azure Arc 啟用 一款 Azure Arc 擴充套件,可在邊緣裝置上執行視訊與音訊分析及生成式 AI。 它支援上傳與直播影片串流,允許直接在資料來源進行即時分析。 它適合對資料駐留要求嚴格或低延遲作業需求的產業。

影片模型

下表列出了 Video Indexer 中可用的影片分析功能。

Feature 描述
臉部偵測 偵測並分組影片中出現的臉孔。
帳戶型臉部識別 訓練特定帳號的模型,並根據訓練好的模型辨識影片中的臉孔。
人員偵測觀察 使用邊界框偵測影片中觀察到的人,並提供確切的時間戳記、位置資訊及信心水平。 包含匹配的人物、偵測到的服裝及特色服裝分析。
物件偵測 偵測並追蹤獨特物件,使其在返回畫面時能辨識。
光學字元識別 從圖片、街道標誌和媒體檔案中的產品等影像擷取文字,以建立見解。
標籤識別 辨識視覺物件與顯示動作。
場景分割 根據視覺提示判斷影片中場景何時改變。一個場景描繪由一系列連續鏡頭組成的單一事件。
鏡頭偵測 根據視覺線索判斷影片中鏡頭何時改變。鏡頭是同一台電影攝影機拍攝的一系列畫面。
關鍵影格擷取 檢測影片中穩定的關鍵影格。
板岩偵測 識別電影後製洞見,包括鐘板偵測、數位圖案偵測及無文字板偵測。

音頻模型

下表列出了 Video Indexer 中可用的音訊分析功能。

Feature 描述
音訊轉錄 能將 STT 轉換成超過 50 種語言,並支援擴充功能。
自動語言偵測 識別主要口說語言。
多語言語音識別 識別不同音頻片段中的口語語言,傳送每個片段進行轉錄,並將它們合併成一個統一的轉錄。
隱藏字幕 以網頁影片文字軌(WebVTT)、定時文字標記語言(TTML)及 SRT 格式製作字幕。
雙通道處理 自動偵測獨立的逐字稿並合併成單一時間軸。
降噪 能清除電話音訊或基於 Skype 濾波器的雜訊錄音。
講者名單 能辨識並理解哪位說話者說了什麼詞、何時說。 它能偵測單一音訊檔案中的16個喇叭。
翻譯 製作多種語言的音頻文字翻譯。
音訊效果偵測 偵測非語音片段中的音訊效果,包括警報或警笛聲、狗吠聲、群眾反應、強烈撞擊聲、笑聲、玻璃破碎聲及寂靜。

結合音訊和視頻的模型

以下功能分析音訊與影像內容。

Feature 描述
關鍵字擷取 從語音與視覺文字中擷取關鍵字
命名實體擷取 透過自然語言處理(NLP)從語音與視覺文本中提取品牌、地點與人物
主題推論 利用國際新聞電信理事會(IPTC)、維基百科及影片索引器的階層主題本體論,根據各種關鍵字萃取主題
情感分析 辨識語音與視覺文本中的正面、負面與中性情感

欲了解更多資訊,請參閱 影片索引器概覽。

雲端影片索引器的應用案例

下表列出了雲端影片索引器的可能使用情境。

使用案例 描述
深度搜尋 利用 Video Indexer 擷取的洞察,提升整個影片資料庫的搜尋體驗。 例如,當你索引口語單字和臉孔時,使用者可以在影片中找到某人說出特定詞彙或兩人一起出現的時刻。 這些使用情境適用於任何擁有影片資料庫且使用者需要搜尋的產業,包括新聞機構、教育機構、廣播業者、娛樂內容擁有者以及企業業務線(LOB)應用程式。
內容創作 根據 Video Indexer 從你內容中擷取的洞察,製作預告片、精選短片、社群媒體內容或新聞片段。 關鍵影格、場景標記、以及標籤和人物出現的時間戳記,簡化了創作過程。
無障礙功能 利用Video Indexer提供的轉錄與翻譯功能,讓您的內容提供給身心障礙者,或將內容分發到使用不同語言的地區。
創造營收 提升影片的價值。 依賴廣告收入的產業,如新聞媒體和社群媒體,能利用擷取的洞察作為額外訊號,向廣告伺服器投放相關廣告。
內容審查 透過文字與視覺內容審核模式,保護用戶免受不當內容侵害,並確認你發布的內容符合組織價值觀。
建議 透過強調與用戶相關的影片時刻,提升用戶互動。 透過為每支影片加上額外的元資料標註,你可以推薦最相關的影片,並突顯符合使用者需求的部分。

Azure Arc 啟用的影片索引器的使用案例

下表列出了 Azure Arc 啟用的視訊索引器的可能使用情境。

使用案例 描述
零售 優化店面佈局,提升顧客體驗與安全。 即時監控結帳排隊的顧客數量,以優化人力配置並縮短等待時間。
製造業 透過影片分析確保品質控管與工人安全。 透過即時偵測關鍵事件,偵測未穿戴防護裝備的員工。
現代安全 在安全問題造成風險之前,偵測並識別其。
數據控管 將 AI 帶入內容。 當您因法規、架構決策或龐大資料庫無法將已索引內容從本地端遷移到雲端時,請使用 Arc 支援的 Video Indexer。
預索引 在上傳到雲端之前,先索引內容。 先預先分類你的本地影片或音訊檔案庫,然後只上傳用於標準或進階的雲端索引。