公平性正日益成为生物特征评估中越来越重要的一环。对于开发、采购或部署人脸识别系统的组织而言,仅仅了解系统整体是否准确已远远不够。它们还需要确信,不同人口统计群体之间的性能差异已通过有意义的方式进行了评估。
这听起来很简单,直到评估开始时才发现并非如此。目前尚无单一的、被普遍认可的公平性评分标准。不同的指标衡量的是不同形式的偏差,而且同一个系统根据所选指标的不同,可能会得出不同的公平性结论。对于检测实验室、技术提供商以及正在准备合规或认证活动的组织而言,这带来了一个实际问题:如果指标的选择会改变结论,那么公平性结果又如何能令人信服呢?
Fime 近期与卡昂诺曼底大学、ENSICAEN、法国国家科学研究中心(CNRS)以及 GREYC 实验室合作开展的一项研究,直接探讨了这一问题。 该研究在四个公开的面部数据集上对比了19种公平性指标,并探讨了三种偏见来源:算法选择、数据与图像质量的差异,以及运行决策阈值的变化。其核心结论非常明确:公平性不能仅归结为一个通用的指标。该指标必须与系统中偏见的表现形式相契合。
为什么偏差评估对认证和符合性评估而言是一项挑战?
认证和符合性评估依赖于可重复的证据。结果应易于理解、可重复,并与产品实际使用条件相关。公平性评估则增加了另一层复杂性,因为在生物识别系统的多个环节都可能出现人口统计学上的差异。
这可能源于算法本身。也可能受到评估数据构成影响。当图像质量下降时,这种情况可能会出现。此外,当为满足安全或用户体验目标而调整决策阈值时,情况也会发生变化。因此,在某种条件下看似平衡的系统,在另一种条件下可能会表现出不同的行为。
对于任何需要证明某生物识别系统已得到负责任评估的人来说,这一点都至关重要。如果公平性指标对实际存在的差异类型不敏感,那么结果虽然看似令人放心,却可能未能反映出相关风险。反之,如果某个指标对某种现象反应过于强烈,则可能导致对另一种现象的评估被高估。难点并不在于单纯计算一个公平性指标,而在于判断该指标是否适合所探讨的问题。
科学如何能使公平性评估更加可靠?
该研究首先改变了公平性指标的比较方式。研究人员没有孤立地评估每个指标,而是将19项指标置于相同的实验框架下,并使其受到受控变量的影响。
对于数据相关和操作相关的偏差,会逐步提高干扰程度。图像质量在可控阶段内逐渐下降,子群体的代表性按已知比例降低,且决策阈值会根据以用户为中心和以安全为导向的操作模式进行收紧。由于严重程度的排序是已知的,因此可以参照基准来检查各项公平性指标的响应情况。
随后,将采用两项标准来评估该响应。第一项是单调性:随着偏见程度的增加,该指标是否呈现出一致的变化趋势?第二项是稳定性:该指标在不同人口统计群体和交叉群体中能否得出足够一致的结论?当一项指标同时满足这两项条件时,才被视为在受控条件下具有实用价值。
这对实践评估而言是一个重要的转变。该框架不再探讨某项指标在一般情况下是否在数学上成立,而是提出了一个更具操作性的问题:在什么条件下,该指标能提供可靠的信号?
接下来又出现了一个问题:既然有这么多公平性指标,应该选用哪一个呢?
正是在这一点上,问题变得非常具体。生物识别领域目前拥有一系列基于绝对误差差值、比率、不等式度量、得分分离度、紧凑性以及完整得分分布的评估指标。这些指标无法互换,因为它们所衡量的并非同一事物。
关注“误判率”与“误非匹配率”差异的指标侧重于决策层面的后果。研究评分分布的指标甚至可以在应用决策阈值之前就检测到变化。还有一种指标可能对表现最佳组与表现最差组之间的相对差异特别敏感。
该研究表明,这种多样性本身并非弱点。问题在于,如果在选择指标时未考虑偏见的来源,就会出现问题。在这种情况下,组织可能会将指标视为目标本身,而实际上它本应是用来回答特定评估问题的工具。
如果这些指标不一致怎么办?
他们两人可能都在说实话,但所指的却是该体系的不同方面。
实验表明,没有任何一种公平性衡量指标能在所有情况下都提供最可靠的评估结果。有些方法更擅长反映不同人口统计群体之间的错误率差异,而另一些方法则对底层生物特征评分分布的变化更为敏感。当真实评分与冒名者评分之间的区分度发生变化,或者系统的工作阈值被调整时,其他衡量指标就会变得更为重要。
图像质量也是如此。运动模糊、传感器噪点、曝光不足和JPEG压缩对生物特征比对的影响各不相同。有些质量劣化主要改变分数间隔,而另一些则会重塑分数分布,或导致不同组别之间的错误率差异增大。这意味着,评估公平性的最恰当方法可能会因所考虑的质量劣化类型而有所不同。
因此,公平性结果之间的分歧并不意味着其中一个结果必然是错误的。这可能仅仅意味着所衡量的只是同一系统的不同方面。
对于认证和测试而言,这一区分至关重要。目标不应是让每项公平性衡量指标得出相同的结论,而应是证明所选方法适用于特定类型的偏见、所评估的风险以及生物识别系统将运行的实际环境。
这如何才能成为一种切实可行的指标选择方法呢?
该研究提出了一种结构感知的选择原则:首先确定偏见的预期表现形式,然后选择专门用于检测该偏见的度量族。
如果关注的是采样变异性,有界绝对误差指标可以提供稳定的视角,而分布指标则能补充有关底层分数分布变化的信息。如果图像退化改变了真实分数与伪造分数之间的区分度,基于区分度的指标就变得重要起来。如果主要风险来自操作阈值,那么能够反映相对不等式或联合追踪误差率变化的指标可能更具参考价值。
该研究还支持在单一数值无法全面描述问题时采用补充性指标。将决策层级指标与得分分布指标相结合,可以为评估者提供关于同一系统的两种不同但有用的视角。关键在于,这种结合应基于预期的偏差机制来确定,而非机械地应用。
组织在采信公平性评估结果之前,应该提出哪些问题?
这改变了讨论的重点。组织不应仅询问“该系统是否经过了公平性测试?”,而应进一步询问:公平性是如何定义的、考虑了哪些人口统计群体、在何种运行条件下对系统进行了评估、选用了哪些指标,以及这些指标为何与已识别的风险相关。
当对生物特征模型的访问受限时,这种方法同样有用。该研究指出,在封闭箱评估中,仍可利用组级别的“误匹配率”和“误非匹配率”值,结合基于误差的公平性指标进行评估。当拥有完整的分数分布数据时,评估者可以进一步研究分类区分度、紧凑性以及分布变化。
其影响还延伸至标准领域。ISO/IEC 19795-10 定义了若干综合误差指标,但研究表明,在相同的受控条件下,这些指标的表现可能存在差异。这表明,未来的指导文件不仅应定义公平性指标的计算方法,还应帮助实验室确定在何种情况下适用各指标。
从研究到具有实际意义的生物识别保障
对 Fime 而言,这项工作的价值在于将一个复杂的科学问题转化为能够为实际评估决策提供支持的内容。公平性并非仅仅因为报告中包含一个评分就具有意义。只有当该衡量标准与系统、数据、工作点以及预期用例的风险相联系时,它才具有实际意义。
通过为公平性指标行为研究做出贡献,Fime 正在帮助建立必要的证据基础,以制定更可靠的测试方法并提供更明确的未来指导。这对实验室、技术提供商以及需要从对负责任生物识别技术的笼统承诺,转向采用能够得到合理解释和充分论证的评估方法的组织而言,至关重要。
问题已不再仅仅是“这个人脸识别系统是否公平?”,更恰当的问题应该是:“我们是否在关键条件下,使用正确的衡量标准,对正确形式的差异进行了评估?”
K. N. Sanon、J. D. Manno、C. Charrier 和 C. Rosenberger,《当公平性指标存在分歧时:对人脸识别系统的运营影响》,载于《IEEE 生物识别、行为与身份科学汇刊》,doi: 10.1109/TBIOM.2026.3720756。
下载这篇科学论文 ,以探讨如何选择合适的公平性指标,从而进行稳健且可靠的生物识别评估。