評估機器學習模型中的錯誤

目前模型偵錯實務的其中一個最大挑戰,是使用彙總計量對基準測試資料集的模型進行評分。 模型精確度可能無法在資料子群組之間統一,而且可能有些輸入世代的模型更頻繁地失敗。 這些失敗導致可靠性與安全性的下降、公平性問題的出現,以及對機器學習的信任度完全喪失。

圖表顯示基準測試和機器學習模型的準確率以及失敗情況的例子。

錯誤分析不再以彙總的精確度指標為重點。 以透明方式向開發人員公開錯誤分佈,並讓他們有效率地識別和診斷錯誤。

負責任 AI 儀表板的錯誤分析元件可讓機器學習從業人員更深入了解模型失敗分佈,並協助他們快速識別錯誤的資料世代。 此組件識別錯誤率高於整體基準錯誤率的資料世代。 它可透過下列方式,協助模型生命週期工作流程中的識別階段:

  • 決策樹,其中顯示具有高錯誤率的群組。
  • 熱度圖,可視覺化呈現輸入特徵如何影響跨世代的錯誤率。

當系統對特定人口統計群體,或訓練資料中不常見的輸入群組表現不佳時,可能會出現錯誤差異。

此元件的功能來自錯誤分析套件,其會產生模型錯誤設定檔。

當您需要進行下列作業時,請使用錯誤分析:

  • 深入了解模型失敗在某個資料集、數個輸入和特徵維度間的分佈情況。
  • 拆解整體績效指標,自動發現錯誤的隊列,以便採取針對性的緩解措施。

錯誤樹

錯誤模式通常很複雜,且涉及多於一兩個特徵。 你可能會遇到困難,無法探索所有可能的特性組合,從而發現含有關鍵故障的隱藏資料區。

為了減輕負擔,二進位樹狀結構視覺效果會自動將基準測試資料分割成含有過高或過低預期錯誤率且可解譯的子群組。 換句話說,樹狀結構會使用輸入特徵,最大程度將模型錯誤與成功分開。 對於每個定義資料子群組的節點,你可以調查以下資訊:

  • 錯誤率:節點中模型錯誤的實例部分。 視覺化透過紅色的強度來顯示此數值。
  • 錯誤涵蓋範圍:所有落入該節點的錯誤所占比例。 視覺化透過節點的填充率顯示此值。
  • 資料表示:錯誤樹狀結構中每個節點的實例數量。 視覺化透過節點入邊的厚度及節點內的總實例數來顯示此值。

錯誤分析樹的螢幕擷取畫面,顯示具有較高或較低錯誤率及覆蓋範圍的群組。

錯誤熱度圖

此視圖根據輸入特徵的一維或二維格格來切片資料。 你可以選擇感興趣的輸入特徵進行分析。

熱力圖透過使用較深的紅色來視覺化高誤差的細胞,吸引你注意這些區域。 此功能尤其有助於當各分割區中的錯誤主題不相同時,而這種情況在實際應用中經常發生。 在此錯誤識別視角中,你的知識或假設引導分析,並幫助你了解哪些特徵對理解失敗最為重要。

螢幕擷取畫面:錯誤分析熱度圖,其中顯示依一或兩個特徵分割的模型錯誤。

下一步