← 返回 PaperDaily 视觉与图像

香港大学新方法Protego:保护后照片互不匹配,效果翻倍

还在担心你的照片被 PimEyes、Clearview AI 这类“人脸搜索引擎”人肉吗?港大团队提出的 Protego 通过一个独特的 3D 隐私纹理,让你的面部在搜索引擎中彻底“隐身”——即使查询图像也是被保护过的,仍然无法匹配。实验显示召回率暴降 3.5 倍,而且能流畅保护视频,效果自然得像是没加过工。

原论文信息如下:
论文标题:
Protego: User-Centric Pose-Invariant Privacy Protection Against Face Recognition-Induced Digital Footprint Exposure
发表日期:
2025年08月
发表单位:
The University of Hong Kong
原文链接:
https://arxiv.org/pdf/2508.02034.pdf
开源代码链接:
https://github.com/HKU-TASR/Protego
想象一下,你在社交媒体上随手发了一张自拍,结果第二天,某个“人脸搜索引擎”就能顺着这张照片,把你过去十年在网上的所有痕迹——从初中毕业照到豆瓣影评,从知乎回答到淘宝买家秀——全部扒出来,打包展示给任何一个付费用户。这不是科幻片,这是正在发生的事情。Clearview AI 从互联网上抓取了超过 390 亿张人脸图片,PimEyes 更是允许任何人上传一张照片就搜出这个人遍布全网的数字足迹。😱 面对这种“反向人肉”,普通用户几乎毫无招架之力。
图1:(a) 隐私入侵者可以抓取在线平台构建数据库,并使用面部图像作为查询来检索个人的数字足迹。(b) Protego 通过在上传前有效混淆图像和视频来保护用户。无论查询图像是否被保护,都无法在入侵者的数据库中产生正确的匹配。
图1:(a) 隐私入侵者可以抓取在线平台构建数据库,并使用面部图像作为查询来检索个人的数字足迹。(b) Protego 通过在上传前有效混淆图像和视频来保护用户。无论查询图像是否被保护,都无法在入侵者的数据库中产生正确的匹配。
香港大学(The University of Hong Kong)的研究团队带来了一款名为 Protego 的工具,旨在从根源上解决这个问题。它不是为了“对抗人脸识别”,而是为了让你在“被检索”这件事上彻底隐形。更厉害的是,它不仅能保护照片,还能保护视频,效果自然得像是没加过工。
下面我们就来聊聊,Protego 到底是怎么做到的,以及它凭什么能被称为“防人脸搜索”的终极形态。

现有防人脸识别技术为何“防不住自己人”?

在说 Protego 之前,我们得先看看现有的“防脸”技术是什么,以及它们为什么“漏风”。目前主流的防人脸识别方法(如 Fawkes、LowKey、Chameleon、OPOM 等)基本都是往图片上加一些肉眼几乎看不见的“噪声”或“扰动”。对于攻击者来说,如果他用一张 原始未保护的照片 去搜,数据库里即使有别人上传的 加了保护的照片,因为特征不同,系统是搜不出来的。
但是,这里面存在两个致命的漏洞,Protego 的论文直接点出了这些“房间里的大象”。

漏洞一:所有保护过的照片,在人工智能眼里长得都一样

现有方法在做优化时,目标仅仅是让“保护后的图片”和“保护前的图片”在特征空间里离得远一点。这个目标导致了一个连锁反应:这个人的所有保护后的照片,在特征空间里会抱成一团,形成一个极其紧密的“特征簇”。
一旦入侵者用一张 同样被保护过的照片 作为查询图去搜,他依然能在这个“簇”里精准地找到其他所有的保护后照片,因为这些“簇”内的图片特征距离很近。换句话说,你保护了图A,入侵者用加过保护剂的图B去搜,照样能把你的人肉出来。这就像一个保护咒语,虽然让外人看不见你,但却把所有中了咒语的人聚集在了一起,敌人一旦进入这个区域,一抓一个准。
Chameleon保护效果演示GIF
图:Chameleon保护下的Bradley Cooper视频,由于无法适应姿态变化,面具出现“鬼脸”现象。

漏洞二:遇到歪脸、侧脸、视频就彻底歇菜

现有的可复用掩码方法(如Chameleon, OPOM)在设计时就假设人脸是正对的。一旦人脸转动或者有夸张的表情,这些“面具”就完全错位了。结果就是保护后的脸看起来像贴了一层“鬼影”,在视频里更是闪烁不定,毫无视觉连贯性可言。这不仅起不到保护作用,反而破坏了原始图片的美感,完全不可用。

核心创新:超敏损失让保护后的图像互不相同

针对第一个漏洞,Protego 提出了一个非常有意思的损失函数。它的目标不再是让保护后的图片“离原来的自己远一点”,而是让保护后的图片 互相之间也离得远远的
这就是说,即使你是一个人在不同的场景下拍了10张照片,经过Protego优化后,它们在人脸识别模型眼中的特征都各不相同,互不相关。入侵者用一张保护过的照片去搜,根本“认不出”它的其他保护照片,因为它们在特征空间里完全散开了。

“超敏损失”是如何工作的?

这背后是 Protego 提出的 超敏损失 (Hypersensitivity Loss) 中的一部分。我们先看下面这张图,它直观地展示了 Protego 和 Chameleon 在特征空间中的区别:
Protego保护效果演示GIF
图:Protego保护下的Bradley Cooper视频,面具与姿态同步,自然流畅。
OPOM保护效果演示GIF
图:OPOM保护下的Bradley Cooper视频,面具错位明显。
在这个硬场景(保护查询+保护数据库)下,Protego(a)查询的Bradley Cooper未能匹配到任何属于他的数据库条目,而是匹配到了Day-Lewise、J. Meyers等其他人的数据;而Chameleon(b)和OPOM(c)查询的所有检索结果都依然属于Bradley Cooper本人,说明它们完全失效了。
这里的核心思想是对抗性地“欺骗”人脸识别模型,让模型对被保护的图像变得 极度敏感。Protego 的防御损失函数(Protection Loss)由两部分组成:
第一部分通过最大化被保护图像的 Gram 矩阵的行列式 来工作。Gram矩阵的每对元素(i, j)代表了第i张保护图像和第j张保护图像的特征向量的内积。该矩阵的行列式反映了特征向量所张成的体积。最大化这个体积,实际上就是强迫所有保护图像的特征向量尽量互相正交、不相关,从而在特征空间中均匀分散开来,这样就不会形成那个“特征簇”,入侵者拿一张保护图也就无法再匹配到其他保护图了。
第二部分惩罚保护图像与原始图像特征之间的相似度。这保证了即使查询图像是未受保护的原始照片,也无法匹配到数据库中的保护照片。
这个设计非常巧妙,它直接解决了所有现有方法共同的软肋——保护图像的特征同质化问题。

姿态不变3D面具:让视频中的保护也自然

针对第二个漏洞,Protego 引入了 3D 语义建模 的概念。它不是学习一个平面的“贴图”,而是学习一个 3D 人脸表面的 隐私保护纹理(Privacy Protection Texture, PPT)
这个PPT可以理解为一个“万能面具”。它在一个叫作 UV图 的标准化2D坐标系中被定义。这个UV图非常智能,它把人的脸拆解成不同的语义区域:左眼、右眼、鼻尖、下巴等,每个区域都是一个固定的坐标点。无论人脸如何旋转,对于同一个人的左眼区域,它在UV图中的位置是不变的。
Protego保护效果演示GIF
所以,当一张歪着头的照片或一帧视频图像进来时,Protego 会先用一个预训练的UV映射网络(论文中使用的是 SMIRK)来估计这张图像对应的UV图,然后根据这个UV图,从我们之前学好的“万能PPT”中,采用网格采样(Grid Sampling)去“读取”对应区域的信息。这样一来,无论人脸怎么转,生成的3D面具都能完美贴合,戴上后就像是天然的一样,在视频里也不会出现闪烁或错位。
这个设计不仅解决了视觉自然度的问题,还有一个额外的好处:因为网格采样操作是可微的,所以在离线训练PPT时,梯度可以正常反向传播到UV空间,从而高效地构建出这个“万能”的、姿态不变的PPT。

实验结果:召回率下降3.5倍,图像质量不打折

口说无凭,我们来看看实验数据。论文在 FaceScrub 和 LFW 这两个标准测试集上做了大量实验。
Protego保护效果演示GIF
在最硬核的场景——保护查询图像 vs 保护数据库条目(Hard Scenario) 中,Protego 的效果令人印象深刻:
Protego保护效果演示GIF
在FaceScrub数据集上,Protego 将入侵者的召回率(Recall)从71.68%成功降至18.09%;在LFW上,从70.09%降至20.00%。相比之下,现有的Chameleon和OPOM方法在该场景下的召回率依然维持在50%以上,几乎形同虚设。这证明了Protego的保护效果比现有方法至少好 2倍到3.5倍
在图像质量方面,Protego 的SSIM、PSNR等指标都领先于现有方法,这意味着它在实现极强保护的同时,没有以牺牲画质为代价。而且在看不见的FR模型上的泛化能力也很强,用少量模型训练出来的PPT,就能有效防御其他未知的FR模型。
消融实验很能说明问题:如果去掉“超敏损失”,召回率会直接飙升到78.52%,甚至比不保护(71.68%)还高!这说明之前的方法不仅没用,甚至可能有反效果——它们把一个人的照片聚拢在一起,反而让入侵者更容易一网打尽。这从反面印证了Protego核心创新的必要性。

总结与展望:Protego如何反击大规模监视

Protego 的发表,让对抗“人脸搜索引擎”的这场战争中,终于有了更实用的武器。它不再只是一个“实验室概念”,而是一个考虑了真实攻击场景和用户实际体验的完整方案。
它的核心贡献在于: 1. 首个能够应对“保护后图像作为查询”场景且效果显著的方法。
2. 利用3D纹理将“防身”技术从照片升级到了视频,并且效果非常自然。
3. 保护一张图片只需93毫秒,几乎可以实时完成,用户体验优秀。
当然,这项技术也并非万能。如果入侵者通过微调FR模型来适应保护方案,可能会削弱效果,但这需要大量人工标注,在搜索引擎的大规模应用场景下成本过高。此外,它的普适性在一定程度上依赖于预训练的UV映射网络(SMIRK),如果遇到极端姿态或无约束的遮挡,效果可能会打折扣。
未来,我们可以期待这种“个性化3D隐私纹理”的理念被进一步推广。比如,一些社交平台可以直接集成这种功能,用户在点击“发布”按钮的一瞬间,系统就自动为用户的面部加上了一层看不见的“金刚罩”,让所有的大规模人脸搜索都变成瞎子。
这可能是我们对抗技术滥用,重新夺回个人数字主权的重要一步。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问:Protego和我们在手机上看到的“大眼瘦脸”美颜滤镜有什么区别?美颜滤镜的目的是美化,而Protego的目的是阻断人脸识别模型的匹配。美颜只是改变视觉观感,但人脸识别模型依然能认出来;Protego虽然肉眼看不出变化,但在特征空间里已经“面目全非”。归根到底,一个针对人眼,一个针对AI。

问:Protego的“超敏损失”具体是如何实现的?它通过最大化Gram矩阵的行列式,强迫使用A人脸识别模型提取到的来自同一个人但不同姿态的保护后照片的特征向量之间互相正交,从而在特征空间中尽可能分散。简单说,就是让所有保护后的图片在AI眼里都互相不认识,也就无法形成可供入侵者检索的“簇”。

问:一个用户如何开始使用Protego来保护自己的照片?根据论文,用户需要先提供少量(约20张)自己的面部照片进行一个“离线学习”阶段,来生成属于自己的PPT。之后,任何未来的照片或视频,都可以通过一个轻量级的实时保护流程(约93毫秒/图)来应用保护。作者已经开源了代码和模型,并提供了详细的使用说明

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★★

该论文的“超敏损失”设计是核心创举,精准命中了现有方案“保护后图像特征一致”的致命伤。将3D人脸建模引入隐私保护领域,解决了姿态鲁棒性和视频连贯性的痛点,创新性很高。

实验合理度:★★★★☆

实验设计非常系统和严谨,区分了三个难度级别的攻击场景,并且在跨模型泛化、自适应攻击鲁棒性、消融实验等方面都做得非常充分。基准线评估和量化分析都很清晰。唯一小缺憾是,未考虑受保护图像被同一FR模型微调后可能带来的影响,不过作者也解释了其在大规模应用下的不可行性。

学术研究价值:★★★★☆

论文清晰地指出了现有抗FR方法的局限,并开辟了“特征多样化”这一全新的研究子方向。对隐私保护领域来说,这是从“防君子”到“防小人”的范式迁移,具有很强的理论指导意义。

稳定性:★★★☆☆

针对常见的图像处理攻击(滤波、压缩、缩放)鲁棒性很高。如果攻击者专门针对PPT和UV网络进行白盒对抗性微调,保护效果可能会被削弱,但在实际应用中对手很难掌握这种信息。

适应性以及泛化能力:★★★★★

论文充分证明了对各种未知FR模型的强泛化能力,能以极小的模型团队(3个FR模型)训练出能防御多个SOTA模型的PPT,效果非常惊艳。

硬件需求及成本:★★★★☆

离线训练需要GPU(推荐8GB显存),但在线保护阶段一张图只要93毫秒(RTX 4090),已经可以用于实时视频流处理了。如果用在移动端上,估计还需要一些模型轻量化的功夫。

复现难度:★★★☆☆

论文作者非常良心,已经把代码和权重全部开源。但代码依赖PyTorch3D和SMIRK等组件,涉及一些3D图形学库的安装,非专业人士(比如普通程序员)可能需要花点时间才能跑通。

产品化成熟度:★★★☆☆

仍然需要一个“离线学习”采集少量照片用于生成PPT的阶段,对于所有用户来说门槛略高。如果能做成“零样本”或“一次学习”的通用保护,产品化才更接近完美。不过目前已经是一个非常可用的工具了。

可能的问题:虽然攻击者很难通过微调FR模型来破解,但理论上,如果攻击者同步训练了一个针对PPT的“去扰”网络,可能会降低保护效果。此外,模型的保护效果在极端遮挡或极端非正面视角下是否有足够稳定性,论文的评估还可以更细致。


主要参考文献

[1] Wang, Z., Yang, S., Lu, J., & Chow, K. H. (2025). Protego: User-Centric Pose-Invariant Privacy Protection Against Face Recognition-Induced Digital Footprint Exposure. arXiv preprint arXiv:2508.02034.
[2] Chow, K.-H., Hu, S., Huang, T., & Liu, L. (2024b). Personalized privacy protection mask against unauthorized facial recognition. ECCV.
[3] Zhong, Y., & Deng, W. (2022). OPOM: Customized invisible cloak towards face privacy protection. TPAMI.
[4] 项目开源地址:https://github.com/HKU-TASR/Protego

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
想要在 Clearview AI 和 PimEyes 面前彻底隐身?扫码加入龙哥读论文粉丝群,一起探讨 Protego 和更多隐私黑科技!添加龙哥助手微信号:kangjinlonghelper,备注格式:隐私+城市+学校/公司+昵称,即可快速入群。
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。