دو مسئله متفاوت، دو خانواده معیار
در یک فرایند احراز هویت چهره معمولاً دو تصمیم مستقل وجود دارد: نخست اینکه ورودی متعلق به یک انسان واقعی است یا حمله بازنمایی؛ دوم اینکه چهره ورودی با هویت مرجع تطبیق دارد یا خیر. APCER و BPCER برای ارزیابی تشخیص حمله یا Liveness به کار میروند، در حالی که FAR و FRR رفتار سامانه تطبیق هویت را اندازه میگیرند.

APCER چیست؟
APCER مخفف Attack Presentation Classification Error Rate است. این معیار نشان میدهد چه نسبتی از حملات بازنمایی به اشتباه بهعنوان نمونه واقعی پذیرفته شدهاند.
APCER = تعداد حملات پذیرفتهشده بهعنوان واقعی ÷ کل حملات آزمونشده
اگر از هر ۱۰٬۰۰۰ تلاش حمله، ۲۰ مورد به اشتباه Live تشخیص داده شود، APCER برابر ۰٫۲ درصد است. کاهش APCER برای جلوگیری از عبور عکس چاپی، نمایشگر یا بازپخش ویدئو اهمیت دارد.
در ارزیابی دقیق، APCER باید برای هر نوع ابزار حمله یا PAI جداگانه گزارش شود. میانگین کلی ممکن است ضعف مدل در برابر یک حمله خاص را پنهان کند.
BPCER چیست؟
BPCER مخفف Bona Fide Presentation Classification Error Rate است. این معیار نسبت کاربران واقعی را نشان میدهد که سامانه به اشتباه حمله تشخیص داده و رد کرده است.
BPCER = تعداد نمونههای واقعی ردشده ÷ کل نمونههای واقعی آزمونشده
BPCER بالا مستقیماً تجربه کاربری را آسیب میزند. کاربر واقعی مجبور به تکرار تصویربرداری یا مراجعه حضوری میشود و نرخ تکمیل فرایند کاهش پیدا میکند.
رابطه APCER و BPCER
تغییر Threshold معمولاً این دو خطا را در جهت مخالف حرکت میدهد. سختگیری بیشتر میتواند APCER را کاهش دهد، اما احتمال رد کاربران واقعی و BPCER را افزایش میدهد. بنابراین اعلام یکی از این دو نرخ بدون ذکر دیگری و بدون مشخصکردن نقطه عملکرد، تصویر کاملی از مدل ارائه نمیکند.
ACER گاهی بهصورت میانگین APCER و BPCER گزارش میشود، اما استفاده از یک میانگین ساده ممکن است هزینه متفاوت دو نوع خطا را پنهان کند. در محیط حساس بهتر است هر معیار مستقل و به تفکیک سناریو ارائه شود.
FAR چیست؟
FAR یا False Accept Rate نسبت تلاشهای افراد متفاوت است که سامانه تشخیص چهره به اشتباه آنها را متعلق به یک هویت دانسته و پذیرفته است.
FAR(t) = پذیرش اشتباه در Threshold برابر t ÷ کل تلاشهای Impostor
برای اندازهگیری FAR پایین به تعداد بسیار زیادی زوج Impostor نیاز است. برای نمونه، ادعای نرخهای بسیار کوچک با چند هزار مقایسه از نظر آماری قابل اتکا نیست؛ چون ممکن است در مجموعه آزمایش حتی یک خطا مشاهده نشود، اما این به معنی صفر بودن ریسک واقعی نیست.
FRR چیست؟
FRR یا False Reject Rate نسبت تلاشهای واقعی یک فرد است که سامانه به اشتباه آنها را رد میکند.
FRR(t) = رد اشتباه در Threshold برابر t ÷ کل تلاشهای Genuine
FRR به تغییر سن، نور، زاویه، کیفیت دوربین، پوشش صورت و فاصله زمانی میان ثبت مرجع و نمونه جدید حساس است. برای همین مجموعه Genuine باید تنوع واقعی استفاده را بازنمایی کند.
Threshold چگونه انتخاب میشود؟
مدل تشخیص چهره برای هر زوج تصویر SimilarityScore تولید میکند. با حرکت Threshold، تعداد پذیرشها و ردها تغییر میکند:
- Threshold پایینتر، پذیرش را آسانتر میکند؛ FAR بیشتر و FRR کمتر میشود.
- Threshold بالاتر، پذیرش را سختتر میکند؛ FAR کمتر و FRR بیشتر میشود.
انتخاب نقطه عملکرد باید از سیاست ریسک سازمان آغاز شود. احراز هویت برای مشاهده یک خدمت عمومی و تأیید انتقال مالی پرمبلغ الزام امنیتی یکسانی ندارند. پس از تعیین FAR هدف، Threshold روی داده ارزیابی مستقل انتخاب و FRR متناظر گزارش میشود.
EER و منحنی DET
EER نقطهای است که FAR و FRR تقریباً برابرند. این عدد برای مقایسه فشرده مدلها مفید است، اما الزاماً نقطه عملیاتی مناسب سازمان نیست. سازمان ممکن است به FAR بسیار پایین نیاز داشته باشد و افزایش FRR را تا حد مشخصی بپذیرد.
منحنی DET یا ROC رفتار مدل را در مجموعهای از Thresholdها نمایش میدهد. مشاهده کل منحنی بهتر از یک عدد منفرد نشان میدهد مدل در ناحیه ریسک مورد نظر چگونه عمل میکند.

در نمودار توزیع امتیازها، نمونههای Genuine و Impostor معمولاً دو توزیع همپوشان میسازند. Threshold مرز تصمیم است و ناحیه همپوشانی منبع دو خطای FAR و FRR محسوب میشود. هرچه جدایی دو توزیع بیشتر باشد، امکان دستیابی همزمان به امنیت و تجربه کاربری بهتر افزایش مییابد.
نمونه محاسبه
فرض کنید مجموعه آزمون تشخیص چهره شامل ۲۰۰٬۰۰۰ تلاش Genuine و ۴۰۰٬۰۰۰ تلاش Impostor باشد. در Threshold انتخابشده، ۶٬۰۰۰ تلاش Genuine رد و ۸ تلاش Impostor پذیرفته شدهاند:
FRR = ۶٬۰۰۰ ÷ ۲۰۰٬۰۰۰ = ۳٪FAR = ۸ ÷ ۴۰۰٬۰۰۰ = ۰٫۰۰۲٪
برای Liveness نیز اگر ۵۰٬۰۰۰ نمونه واقعی و ۲۰٬۰۰۰ حمله داشته باشیم و ۱٬۰۰۰ نمونه واقعی رد و ۱۰۰ حمله پذیرفته شوند:
BPCER = ۱٬۰۰۰ ÷ ۵۰٬۰۰۰ = ۲٪APCER = ۱۰۰ ÷ ۲۰٬۰۰۰ = ۰٫۵٪
این چهار عدد درباره دو جزء متفاوت سامانه صحبت میکنند و نباید با هم ادغام شوند.
قواعد گزارشدهی قابل اعتماد
گزارش فنی باید نسخه مدل و پیشپردازش، Threshold، اندازه و ترکیب داده، انواع حمله، دستگاهها، بازه اطمینان و شرایط تصویربرداری را مشخص کند. همچنین نتایج باید برای گروههای مهم جمعیتی و کانالهای عملیاتی جداگانه بررسی شوند.
در Production نیز تغییر دوربین، فشردهسازی، SDK موبایل یا مدل میتواند کالیبراسیون را تغییر دهد. هر تغییر مهم باید با آزمون Regression و بازبینی Threshold همراه باشد.
جمعبندی
APCER و BPCER کیفیت تشخیص زندهبودن را توضیح میدهند؛ FAR و FRR کیفیت تطبیق هویت را. هیچکدام بهتنهایی کافی نیستند. تصمیم درست زمانی گرفته میشود که خطاهای امنیتی و تجربه کاربری در نقطه عملکرد واقعی و روی داده نماینده جامعه هدف، همزمان اندازهگیری شوند.
این منحنیها مفهومیاند. نقطه عملیاتی واقعی فقط با داده ارزیابی نماینده جامعه هدف تعیین میشود.
accepted attacks / all attacksBPCERrejected bona fide / all bona fideFARfalse accepts / impostor attemptsFRRfalse rejects / genuine attempts