블로그

얼굴 인식의 공정성 검증: 평가 지표 간에 차이가 있을 때는 어떻게 될까?

생체 인식 평가에서 공정성은 점점 더 중요한 요소로 부상하고 있습니다. 얼굴 인식 시스템을 개발, 구매 또는 도입하는 기관의 경우, 시스템이 전반적으로 정확한지 여부를 아는 것만으로는 더 이상 충분하지 않습니다.

네일리 사논,

테스트 분석가

2026년 9월 18일

공유하기

공정성은 생체 인식 평가에서 점점 더 중요한 요소로 부상하고 있습니다. 얼굴 인식 시스템을 개발, 구매 또는 도입하는 기관의 경우, 시스템이 전반적으로 정확한지 여부를 파악하는 것만으로는 더 이상 충분하지 않습니다. 또한 인구통계학적 집단 간 성능 차이가 의미 있는 방식으로 평가되었음을 확신할 수 있어야 합니다.

평가가 시작되기 전까지는 이 과정이 간단해 보입니다. 그러나 널리 인정받는 단일한 공정성 점수는 존재하지 않습니다. 지표마다 측정하는 불균형의 형태가 다르며, 동일한 시스템이라도 선택한 지표에 따라 공정성에 대한 결론이 달라질 수 있습니다. 이는 시험소, 기술 제공업체, 그리고 규정 준수나 인증 절차를 준비 중인 기관들에게 실질적인 문제를 야기합니다. 즉, 지표 선택에 따라 결론이 달라질 수 있다면, 어떻게 공정성 결과를 신뢰할 수 있겠습니까?

Fime가 캉 노르망디 대학교(Université Caen Normandie), ENSICAEN, CNRS 및 GREYC 연구소와 공동으로 수행한 최근 연구는 이 질문을 직접적으로 다루고 있습니다. 이 연구는 4개의 공개 얼굴 데이터셋을 대상으로 19가지 공정성 지표를 비교하고, 알고리즘 선택, 데이터 및 이미지 품질의 변동, 운영상의 결정 기준치 변화라는 세 가지 편향 원인을 분석합니다. 연구의 핵심 메시지는 분명합니다. 공정성은 하나의 보편적인 지표로 환원될 수 없습니다. 지표는 시스템 내에서 편향이 나타나는 방식에 부합해야 합니다.

왜 편향성 평가가 인증 및 적합성 평가에 있어 어려운 과제인가?

인증 및 적합성 평가는 재현 가능한 증거에 기반을 둡니다. 결과는 이해 가능하고 재현 가능해야 하며, 제품이 사용될 환경과 관련성이 있어야 합니다. 생체 인식 시스템의 여러 단계에서 인구통계학적 불균형이 나타날 수 있기 때문에, 공정성 평가는 평가 과정에 또 다른 복잡성을 더합니다.

이는 알고리즘 자체에서 비롯될 수도 있습니다. 평가 데이터의 구성에 영향을 받을 수도 있습니다. 화질이 저하될 때 나타날 수도 있습니다. 또한 보안이나 사용자 경험 목표를 달성하기 위해 결정 기준값이 조정될 때 변화할 수도 있습니다. 따라서 한 조건에서는 균형 잡힌 것처럼 보이는 시스템도 다른 조건에서는 다르게 작동할 수 있습니다.

이는 생체 인식 시스템이 책임감 있게 평가되었음을 입증해야 하는 모든 사람에게 중요한 문제입니다. 공정성 지표가 실제로 존재하는 불평등의 유형에 민감하지 않다면, 관련 위험을 제대로 포착하지 못한 채 결과는 안심할 수 있을 것처럼 보일 수 있습니다. 반대로, 특정 현상에 민감하게 반응하는 지표는 다른 현상을 과대평가할 수도 있습니다. 문제는 단순히 공정성 지표를 계산하는 데 있는 것이 아닙니다. 문제는 그 지표가 제기된 질문에 적합한 지표인지 파악하는 데 있습니다.

과학은 공정성 평가를 어떻게 더 신뢰할 수 있게 만들 수 있을까?

이 연구는 공정성 지표의 비교 방식을 바꾸는 것부터 시작합니다. 연구진은 각 지표를 개별적으로 평가하는 대신, 19가지 지표를 동일한 실험 프레임워크 아래에 두고 통제된 변동 요인에 노출시켰습니다.

데이터 관련 및 운영상의 편향에 대해서는 교란 수준이 점진적으로 증가합니다. 이미지 품질은 통제된 단계에 따라 저하되고, 하위 그룹의 대표성은 알려진 비율로 감소하며, 의사결정 기준치는 사용자 중심 및 보안 중심의 운영 체제에 따라 더 엄격해집니다. 심각도 순서가 알려져 있으므로, 각 공정성 지표의 반응을 기준치와 대조하여 확인할 수 있습니다.

그런 다음 두 가지 기준을 적용하여 해당 반응을 평가합니다. 첫 번째는 단조성입니다. 즉, 편향 수준이 증가함에 따라 측정 지표가 일관되게 변화하는가 하는 점입니다. 두 번째는 안정성입니다. 즉, 인구통계학적 집단 및 교차적 집단 전반에 걸쳐 충분히 일관된 결론을 도출하는가 하는 점입니다. 측정 지표가 이 두 가지 기준을 모두 충족할 때, 통제된 조건에서 유용한 것으로 간주됩니다.

이는 실용적 평가에 있어 중요한 전환점입니다. 이 프레임워크는 특정 지표가 일반적으로 수학적으로 타당한지 묻기보다는, 보다 실무적인 질문을 던집니다. 즉, 어떤 조건에서 이 지표가 신뢰할 수 있는 신호를 제공하는가 하는 것입니다.

그러면 다음 문제가 제기됩니다. 공정성 지표가 이렇게 많은데, 그중 어떤 것을 사용해야 할까요?

바로 이 지점에서 문제가 매우 구체적으로 드러납니다. 생체 인식 연구계는 현재 절대 오차 차이, 비율, 불평등 척도, 점수 분리도, 콤팩트성 및 전체 점수 분포를 기반으로 한 다양한 평가 지표를 보유하고 있습니다. 이러한 지표들은 서로 다른 현상을 측정하기 때문에 상호 교환 가능하지 않습니다.

오탐지율(False Match Rate)과 오비일치율(False Non Match Rate)의 차이를 분석하는 지표는 의사결정 단계에서 발생하는 결과에 중점을 둡니다. 점수 분포를 분석하는 지표는 의사결정 기준치가 적용되기 전부터 변화를 감지할 수 있습니다. 또 다른 지표는 성과가 가장 우수한 그룹과 가장 저조한 그룹 간의 상대적 차이에 특히 민감할 수 있습니다.

이 연구에 따르면, 이러한 다양성 자체가 약점은 아니다. 문제는 편향의 원인을 고려하지 않고 지표를 선정할 때 발생한다. 이러한 상황에서 조직은 특정 평가 질문에 답하기 위해 선택된 도구여야 할 지표를, 오히려 목표 그 자체로 취급할 위험에 처하게 된다.

만약 그 지표들이 서로 일치하지 않는다면 어떻게 될까요?

두 사람 모두 진실을 말하고 있을지는 몰라도, 시스템의 서로 다른 측면에 대해 말하고 있는 것일 수 있다.

실험 결과에 따르면, 어떤 단일 공정성 측정 기준도 모든 상황에서 가장 신뢰할 수 있는 결과를 제공하지는 않는 것으로 나타났다. 일부 접근 방식은 인구통계학적 집단 간의 오류율 차이를 포착하는 데 더 뛰어난 반면, 다른 접근 방식은 기초가 되는 생체 인식 점수 분포의 변화에 더 민감하게 반응한다. 또한, 정당한 점수와 위조 점수 간의 구분이 달라지거나 시스템의 작동 임계값이 조정될 때, 다른 측정 기준들이 더 중요한 의미를 갖게 된다.

이미지 품질의 경우도 마찬가지입니다. 모션 블러, 센서 노이즈, 저노출, JPEG 압축은 생체 인식 비교에 모두 동일한 방식으로 영향을 미치지는 않습니다. 일부 화질 저하는 주로 점수 간 격차를 변화시키는 반면, 다른 요인들은 점수 분포를 재구성하거나 그룹 간 오류율의 차이를 더 크게 만들기도 합니다. 즉, 공정성을 평가하는 가장 적절한 방법은 고려되는 화질 저하의 유형에 따라 달라질 수 있습니다.

따라서 공정성 평가 결과 간에 차이가 있다고 해서 그 중 하나가 반드시 틀렸다는 뜻은 아닙니다. 이는 단순히 동일한 시스템의 서로 다른 측면이 측정되고 있을 뿐일 수도 있습니다.

인증 및 테스트의 관점에서 볼 때, 이러한 구분은 필수적입니다. 목표는 모든 공정성 평가 지표가 동일한 결론을 도출하도록 하는 것이 아니라, 선택된 접근 방식이 해당 편향의 유형, 평가 대상인 위험, 그리고 생체 인식 시스템이 사용될 운영 환경에 적합한 것임을 입증하는 데 있어야 합니다.

이것이 어떻게 지표 선정을 위한 실용적인 방법이 될 수 있을까요?

이 연구는 구조를 고려한 선택 원칙을 제안한다. 즉, 편향의 예상되는 양상을 먼저 파악한 다음, 이를 탐지하도록 설계된 측정 기준 집합을 선택하는 것이다.

표본 변동성이 우려되는 경우, 상한이 정해진 절대 오차 지표는 안정적인 관점을 제공할 수 있는 반면, 분포 지표는 기초 점수 분포의 변화에 대한 정보를 추가로 제공할 수 있습니다. 이미지 품질 저하로 인해 실제 점수와 위조 점수 간의 구분이 달라지는 경우, 구분 기반 지표가 중요해집니다. 주요 위험이 작동 임계값에서 비롯되는 경우, 상대적 불평등을 포착하거나 오류율의 변화를 종합적으로 추적하는 지표가 더 유용한 정보를 제공할 수 있습니다.

또한 이 연구는 하나의 수치만으로는 문제 전체를 설명할 수 없을 때 보완적인 지표를 활용해야 한다는 점을 뒷받침한다. 의사결정 수준 지표와 점수 분포 지표를 결합하면 평가자들이 동일한 시스템에 대해 서로 다르지만 유용한 두 가지 관점을 얻을 수 있다. 중요한 점은 이러한 결합이 예상되는 편향 메커니즘에 근거하여 이루어져야 하며, 기계적으로 적용되어서는 안 된다는 것이다.

조직은 공정성 평가 결과를 신뢰하기 전에 무엇을 물어봐야 할까요?

이는 논의의 방향을 바꿉니다. 조직은 단순히 “이 시스템의 공정성에 대한 테스트가 이루어졌는가?”라고 묻는 대신, 공정성이 어떻게 정의되었는지, 어떤 인구통계학적 집단이 고려되었는지, 어떤 운영 조건 하에서 시스템이 평가되었는지, 어떤 지표가 선정되었는지, 그리고 그 지표가 식별된 위험과 어떤 관련이 있는지 등을 물어야 합니다.

이 접근 방식은 생체 인식 모델에 대한 접근이 제한적인 경우에도 유용합니다. 이 연구에 따르면, 폐쇄형 평가에서도 오류 기반 공정성 지표와 함께 그룹 수준의 오일치율(False Match Rate) 및 오비일치율(False Non Match Rate) 값을 여전히 활용할 수 있습니다. 전체 점수 분포를 확보할 수 있는 경우, 평가자들은 한 걸음 더 나아가 분리도, 밀집도 및 분포 변화를 분석할 수 있습니다.

이러한 시사점은 표준 분야로도 확대됩니다. ISO/IEC 19795-10 표준은 여러 가지 집계 오차 측정 지표를 정의하고 있지만, 본 연구에 따르면 이러한 변형 지표들은 동일한 통제된 조건 하에서도 서로 다른 특성을 보일 수 있는 것으로 나타났습니다. 이는 향후 지침이 공정성 지표의 계산 방법만을 정의하는 데 그쳐서는 안 됨을 시사합니다. 또한 실험실이 각 지표가 언제 적절한지 판단할 수 있도록 도와야 합니다.

연구에서 의미 있는 생체 인식 보증까지

Fime에게 있어 이 작업의 가치는 복잡한 과학적 질문을 실제 평가 결정을 뒷받침할 수 있는 요소로 전환하는 데 있습니다. 보고서에 점수가 포함되어 있다고 해서 공정성이 의미 있는 것은 아닙니다. 측정 결과가 시스템, 데이터, 작동 조건 및 의도된 사용 사례의 위험 요소와 연계될 때 비로소 의미가 생깁니다.

Fime은 공정성 지표의 작동 방식에 대한 연구에 기여함으로써, 보다 견고한 테스트 방법과 향후 명확한 지침을 마련하는 데 필요한 근거를 구축하는 데 힘을 보태고 있습니다. 이는 책임 있는 생체 인식 기술에 대한 포괄적인 약속에서 벗어나, 그 타당성을 설명하고 입증할 수 있는 평가 방법으로 전환해야 하는 연구소, 기술 제공업체 및 기관들에게 중요한 의미를 지닙니다.

이제 문제는 더 이상 단순히 “이 얼굴 인식 시스템이 공정한가?”가 아닙니다. 더 적절한 질문은 “중요한 조건 하에서 올바른 측정 기준을 사용하여 올바른 형태의 불균형을 측정했는가?”입니다.

K. N. Sanon, J. D. Manno, C. Charrier 및 C. Rosenberger, “공정성 지표 간 차이가 있을 때: 얼굴 인식 시스템에 대한 운영적 시사점,” 『IEEE Transactions on Biometrics, Behavior, and Identity Science』, doi: 10.1109/TBIOM.2026.3720756.

과학 논문을 다운로드하여 강력하고 신뢰할 수 있는 생체 인식 평가를 위해 적절한 공정성 지표를 선정하는 방법을 알아보세요.

공유하기

여러분의 어려움을 공유해 주세요

귀사의 혁신을 실현하고 최고 수준의 고객 경험을 제공하는 결제 솔루션을 구축할 수 있도록 전문 지식과 지원을 받아보세요.

문의하기
채용 중