公平性正逐漸成為生物特徵評估中日益重要的一環。對於開發、採購或部署人臉識別系統的組織而言,僅了解系統整體的準確性已不再足夠。他們還需要確信,不同人口統計群體之間的性能差異已透過有意義的方式進行了評估。
這聽起來似乎很簡單,直到評估開始為止。目前並沒有一個被普遍接受的公平性評分標準。不同的指標會衡量不同形式的差異,而同一個系統根據所選指標的不同,可能會得出不同的公平性結論。對於測試實驗室、技術供應商以及正為合規或認證活動做準備的組織而言,這帶來了一個實際問題:如果指標的選擇會改變結論,那麼公平性結果又該如何令人信服呢?
Fime 近期與卡昂諾曼第大學(Université Caen Normandie)、ENSICAEN、法國國家科學研究中心(CNRS)以及 GREYC 實驗室共同進行的一項研究,直接探討了這個問題。 該研究在四個公開的人臉資料集上比較了 19 種公平性指標,並探討了三種偏見來源:演算法選擇、資料與影像品質的變異,以及運作決策閾值的變化。其核心訊息十分明確:公平性無法僅歸結為單一的通用指標。該指標必須符合偏見在系統中呈現的方式。
為何偏誤評估對認證與符合性評估而言是一項挑戰?
認證與合規性評估取決於可重複的證據。測試結果應具有可理解性、可重現性,並與產品實際使用環境相關。公平性評估則增添了另一層複雜性,因為在生物辨識系統的多個環節中,都可能出現人口統計學上的差異。
這可能源自演算法本身;也可能受評估數據組成所影響;還可能在影像品質下降時出現;此外,當為達成安全或使用者體驗目標而調整決策閾值時,情況亦可能隨之改變。因此,在某種條件下看似平衡的系統,在另一種條件下可能會表現出不同的行為。
這對任何需要證明某項生物辨識系統已獲負責任評估的人而言都至關重要。如果某項公平性指標對實際存在的差異類型不敏感,其結果雖然看似令人安心,卻可能未能反映相關風險。反之,若某項指標對某種現象反應過度,則可能導致另一種現象被高估。困難之處不在於單純計算公平性指標,而在於判斷該指標是否適合用來解答當前所探討的問題。
科學如何能讓公平性評估更為可靠?
這項研究首先改變了公平性指標的比較方式。研究人員並未孤立地評估每個指標,而是將 19 項指標置於相同的實驗框架下,並讓它們暴露於受控的變異來源中。
針對資料相關及操作上的偏誤,干擾程度會逐步增加。影像品質會分階段受控地下降,子群體的代表性會按已知比例降低,而決策閾值則會根據以使用者為導向及以安全為導向的操作模式加以收緊。由於嚴重程度的順序已知,因此可將各項公平性指標的反應與參考標準進行比對。
接著會採用兩項準則來評估該反應。第一項是單調性:隨著偏見程度的增加,該指標是否呈現一致的變化趨勢?第二項是穩定性:該指標在不同人口統計群體及交叉群體中,能否得出足夠一致的結論?當某項指標同時滿足這兩項條件時,才被視為在受控條件下具有實用價值。
這對實務評估而言是一項重要的轉變。該框架並非探討某項指標在一般情況下是否具有數學上的有效性,而是提出了一個更具操作性的問題:在哪些條件下,這項指標才能提供可靠的訊號?
接著便出現了下一個問題:既然有這麼多公平性指標,該選用哪一個呢?
這正是問題變得非常具體之處。生物辨識領域目前已發展出基於絕對誤差差異、比率、不等式指標、分數分離度、緊緻度以及完整分數分佈等指標。這些指標無法互換,因為它們所觀察的對象並不相同。
一種關注「誤判率」與「誤非匹配率」差異的指標,著重於決策層面的後果。一種研究分數分佈的指標,則能在決策閾值尚未套用之前,便能偵測到變化。另一種指標則可能特別敏感於表現最佳與表現最差群體之間的相對差異。
這項研究顯示,這種多樣性本身並非弱點。問題在於,當選定某項指標時,若未考量偏見的來源,便會產生問題。在這種情況下,組織可能會誤將該指標視為目標,而它本應是為解答特定評估問題所選用的工具。
如果這些指標相互矛盾該怎麼辦?
他們倆可能都在說實話,但所指的卻是該體系的不同層面。
實驗結果顯示,沒有任何單一的公平性指標能在所有情況下提供最可靠的評估結果。某些方法較擅長反映不同人口統計群體之間的錯誤率差異,而其他方法則對底層生物特徵分數分佈的變化更為敏感。當真實分數與冒名者分數之間的區隔發生變化,或系統的運作閾值遭到調整時,其他指標便會變得更具參考價值。
影像品質亦是如此。動態模糊、感光元件雜訊、曝光不足及 JPEG 壓縮對生物特徵比對的影響程度各不相同。某些品質劣化主要會改變分數間的差距,而其他則會重塑分數分佈,或導致群組間的錯誤率出現更大的差異。這意味著,評估公平性的最合適方式,可能會因所考量之品質劣化類型而有所不同。
因此,公平性結果之間的差異並不意味著其中一個結果必然是錯誤的。這可能僅僅表示所測量的只是同一系統的不同面向。
就認證與測試而言,這項區別至關重要。目標不應是讓每項公平性衡量指標都得出相同的結論,而應是證明所選用的方法適合該類偏見、所評估的風險,以及生物特徵識別系統的實際運作環境。
這該如何成為一種實用的指標篩選方法呢?
本研究提出了一項「結構感知」的選擇原則:首先從預期會出現的偏誤表現出發,然後選擇專為偵測該偏誤而設計的指標族。
若關注的是抽樣變異性,具有上限的絕對誤差指標能提供穩定的評估視角,而分佈指標則可補充關於底層分數分佈變化的資訊。若影像劣化導致真實分數與偽造分數之間的區隔發生變化,則基於區隔的指標便顯得重要。若主要風險源自運作閾值,則能反映相對不平等性或同時追蹤誤差率變化的指標,可能更具參考價值。
該研究亦支持在單一數值無法完整描述問題時,應採用輔助指標。將決策層級指標與分數分佈指標結合,能讓評估者從兩個不同但有用的角度來審視同一系統。關鍵在於,這種結合應基於預期的偏誤機制而進行,而非機械式地套用。
組織在信任某項公平性結果之前,應該先提出哪些問題?
這改變了討論的焦點。組織不應僅詢問:「這個系統是否經過公平性測試?」,而應進一步探討:公平性是如何定義的、考量了哪些人口統計群體、系統是在何種運作條件下進行評估的、選用了哪項指標,以及該指標為何與已識別的風險相關。
當生物特徵模型的存取受到限制時,此方法同樣具有實用價值。該研究指出,在「閉盒」評估中,仍可結合基於錯誤率的公平性指標,使用群組層級的「錯誤匹配率」與「錯誤非匹配率」數值。當具備完整的分數分佈資料時,評估者可進一步研究分類的區分度、緊緻度以及分佈變化。
其影響亦延伸至標準範疇。ISO/IEC 19795-10 定義了數項彙總誤差指標,但研究顯示,在相同的受控條件下,這些變體的表現可能有所不同。這表明未來的指引不應僅定義公平性指標的計算方式,還應協助實驗室判斷何時適用各指標。
從研究到具實質意義的生物識別保障
對 Fime 而言,這項工作的價值在於將一個複雜的科學問題轉化為能夠支援實際評估決策的依據。公平性並非僅因報告中包含一個分數而具有意義;唯有當該測量結果與系統、數據、運作點以及預期使用情境的風險相連結時,才真正具有意義。
透過參與公平性指標行為的研究,Fime 正協助建立必要的實證基礎,以發展更穩健的測試方法,並為未來提供更明確的指引。這對實驗室、技術供應商以及需要從對「負責任的生物辨識技術」的廣泛承諾,轉向採用能夠被解釋且經得起檢證的評估方法的組織而言,至關重要。
問題已不再只是「這個人臉識別系統是否公平?」更關鍵的問題是:「我們是否在關鍵條件下,採用了正確的衡量標準,來評估正確形式的不平等?」
K. N. Sanon、J. D. Manno、C. Charrier 及 C. Rosenberger,〈當公平性指標出現分歧時:對人臉識別系統的運作影響〉,載於《IEEE 生物辨識、行為與身分科學彙刊》,doi: 10.1109/TBIOM.2026.3720756。
下載這篇科學論文 以探討如何選用合適的公平性指標,進行穩健且可靠的生物特徵評估。