← 返回 PaperDaily
大模型与智能体
Moscow Institute方案:百万文档实测的隐私搜索折中术
语义搜索最怕什么?不是搜不准,而是搜得准了也把隐私一起送走。这篇论文不装“万能防弹衣”,而是老老实实把文档侧、查询侧、访问模式三件事拆开,给出一个能跑、能测、还能说清边界的混合方案。
龙哥读论文
发布于 2026-08-14 09:10:46
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 语义搜索最怕什么?不是搜不准,而是搜得准了也把隐私一起送走。这篇论文不装“万能防弹衣”,而是老老实实把文档侧、查询侧、访问模式三件事拆开,给出一个能跑、能测、还能说清边界的混合方案。
原论文信息如下:
隐私是个大问题:你的向量数据库可能正在裸奔
语义搜索这几年火得不行,大家都在把文本塞进向量数据库里,指望它“记性好、反应快、还会懂人话”。但问题也很现实:向量不是抽象的安全泡泡 ,它很可能只是把原文换了个马甲。只要数据库一泄露,攻击者就不一定需要原始文本,光看 embedding 也能把内容往回抠,甚至把姓名、地址、医疗信息这类敏感字段翻出来。
这篇论文盯上的,正是这个看起来“很现代、其实很脆”的场景:语义搜索要保留效果,又不能把查询和文档都摊在服务器面前 。作者没有上来就喊“全加密”,而是把问题拆成两半:文档集是静态的,查询是动态的;文档侧可以做几何压缩和混淆,查询侧则用密码学护住。这个思路有点像:仓库先上锁,快递单再打码,别让服务器既看货又看单。
现有防御的“左右为难”:要么太慢,要么太废
先说最直观的两条路。第一条是全同态加密 ,也就是把所有计算都塞进密文里做,安全性看起来很美,代价也很美——美到速度直接劝退。对百万级文档做 top-k 搜索,服务器如果连每一步都在“隔着加密玻璃摸索”,延迟会高得像在等旧电脑开机。
第二条是加噪声 ,也就是给向量塞点扰动,试图让攻击者看不清。问题在于,语义搜索最怕的不是“完全看不懂”,而是“连排序也被一起打散”。噪声一旦加重,隐私可能还没到位,检索质量先跪了,用户体验当场表演一个“搜索结果失忆”。
所以这篇论文的出发点很务实:既然静态文档和动态查询不是同一种东西,为什么非要用同一把刀一起砍?文档侧更适合做几何层面的折叠与隐藏 ,查询侧更适合做密码学层面的保密 。这就是它的“折中派”气质:不追求看上去最硬核,而是追求能跑、能测、还能说清楚边界。
这里顺手解释两个缩写。SVD 是 Singular Value Decomposition,中文叫奇异值分解 ;它本质上是在高维空间里找“最重要的方向”。CKKS 是 Cheon-Kim-Kim-Song 同态加密方案,中文通常叫近似数同态加密 ,适合做浮点近似计算。前者负责“压缩并换个方向”,后者负责“密文里算一算”。
“折中派”的三板斧:SVD截断、秘密旋转和CKKS加密
这套方法的核心,不是某一个单点神技,而是三件事连起来打配合。第一步,先把文档 embedding 投影到更低维的子空间里;第二步,在这个子空间上再乘一个只有数据拥有者知道的正交旋转矩阵;第三步,查询向量用 CKKS 加密后再去做重排序。听起来像“先缩骨、再换脸、最后戴头套”,但每一步都各有作用。
先看文档侧。作者把原始向量中心化后做 SVD,取前 k 个主方向,记成 Vk。这一步相当于告诉模型:别把所有细枝末节都背下来,先把最有信息量的骨架留下。然后再乘一个秘密正交矩阵 R,把这个骨架整体转个方向。这样服务器即使拿到了文档向量,也只看到一个被截断、被旋转过的版本,不容易直接对回原始文本。
然后是查询侧。客户端把查询向量也投到同一个子空间,再乘上同一个秘密旋转矩阵,最后用 CKKS 加密。服务器拿到的只有密文,能做的是在密文和明文文档向量之间算内积重排序,但看不到查询值,也看不到分数本身。这里有个很关键的设计:服务器只做ciphertext-plaintext ,也就是密文-明文运算,避免了更慢的密文-密文乘法和重线性化。省下来的不是一点半点,而是能不能把延迟压进可用区间的差别。
更妙的是,这套方案还有一个“本地粗筛 + 服务器精排”的两阶段结构。客户端先利用公开的 PQ 码本做一次粗排,挑出 Kcands 个候选,再把加密查询发给服务器做精排。这样既避免把整个查询过程都交给服务器,也避免 CKKS 在百万文档上直接硬算到天荒地老。说白了,先让便宜活干掉 99% 的杂音,再让贵的加密计算只看少数候选,经济学味儿很浓。
论文里还有一个很实用的小细节:CKKS 参数不是拍脑袋定的,而是通过离线微基准测试选出来的。作者在离散参数网格上枚举,剔除不满足安全或正确性约束的配置,再挑延迟最低、同时精度还能接受的方案。最后选出的配置在同等安全边界下,比 TenSEAL 的默认设置还快了一截。这个做法没什么“玄学天赋”,但非常工程化:参数不是越大越好,适合工作负载才重要。
边界勘探:这把刀到底有多锋利,又会在哪里折断?
真正值得看的,不只是“它能不能跑”,而是“它在什么条件下好用,什么条件下一下子就露馅”。这篇论文在这一点上很老实,甚至有点像自己先把短板写在脸上:文档保护不是密码学保证 ,而是一个几何压缩 + 秘密旋转的经验性混淆层。只要攻击者拿到足够多的明文-向量对,旋转矩阵就可能被 Procrustes 对齐恢复出来。
这就引出一个很关键的判断:它防的是“弱攻击者”和“非自适应攻击者” ,不是万能的“拿来就能顶住一切”的防线。论文自己也说得很直白:如果对手会重新训练解码器、会利用更多先验、甚至能做自适应对抗,那这层旋转不应被当作最终答案。这个态度其实很对,安全论文最怕的不是不强,而是把不强说成“绝对安全”。
不过,论文也不是只会泼冷水。作者还证明了一个很朴素但有用的事实:如果解码器的输出被限制在保留子空间里,那么它最多只能恢复投影里留下的那部分信息,丢掉的正交分量不可能凭空长回来。换句话说,SVD 截断至少在几何上“真丢信息”,不是把数据换个壳子而已。
实验上,作者还观察到一个挺有意思的现象:在强一些的编码器上,SVD 截断不一定只是“损伤”,有时还会像线性去噪器一样,把检索质量轻轻抬一下 。这点很像把一团噪音里最乱的边角料先削掉,剩下的主方向反而更利于相似度判断。当然,这不是对所有编码器都成立,更不是免费午餐,只能算是“偶尔还顺手赚一点”。
还有一个不能忽视的点:公共 PQ 码本和代码本身也不是隐身斗篷 。论文专门测了它们泄露了多少邻域结构,结论是:会泄露,而且还不算少。所以这套方案不是“把所有东西都藏起来”,而是把泄露面缩小、把风险说清、把边界画明。这个诚实程度,比很多只会写“安全增强”四个字的工作强得多。
总结:谨慎乐观,实用主义的混合方案
这篇论文最有价值的地方,不是它宣称“隐私问题被彻底解决了”,而是它把问题拆开:查询隐私可以交给 CKKS,文档侧风险则用 SVD 截断 + 秘密旋转去压制 。这让方案在百万文档规模上仍然有机会保持可用延迟,而不是把系统做成一个昂贵但只能观赏的加密样机。
但也要保持清醒:它不是万能盾牌。对已知明文、可对齐的攻击者,秘密旋转会失效;对访问模式泄露,它根本没管;对更强的自适应解码器,作者也没有假装“已胜利”。所以这套方案更像是一个在明确威胁模型下可用的实用折中 ,适合对查询保密和文档泄露都比较敏感、但又不能接受全同态搜索成本的场景。
如果把这篇工作放到更大的语境里看,它其实在提醒一个很现实的事实:向量检索时代,安全设计不该只问“能不能防”,还要问“防到哪一步、代价多大、谁还在门外”。这篇论文的答案不完美,但很清楚,也很诚实。对工程实践来说,这种“边界说清楚”的方案,往往比“口号很响”的方案更有生命力。
龙迷三问
这篇论文到底解决什么问题? 它主要解决的是“语义搜索里,查询怎么保密、文档怎么别太容易被反推”这个问题。做法不是把所有东西都加密,而是把文档侧做几何保护,把查询侧做 CKKS 加密,再用两阶段检索把性能拉回来。
SVD 截断和秘密旋转分别在干什么? SVD 截断负责把文档向量压到更低维的主子空间里,减少可被恢复的信息;秘密旋转则是在这个子空间里再换个方向,让攻击者不容易直接对齐回原空间。前者是“少留点”,后者是“别让人看懂朝向”。
这套方法能不能当成绝对安全方案? 不能。论文自己已经把边界说得很清楚:CKKS 保护的是查询,文档侧保护只是经验性混淆;如果攻击者掌握足够多明文配对,或者使用更强的自适应解码器,秘密旋转就可能被破解。所以它适合受限威胁模型,不适合被当成“万金油”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆ 不是从零发明新密码学,而是把 SVD 截断、秘密旋转和 CKKS 组合成一个边界清楚的混合方案,创新点更偏“系统化整合”而不是“概念炸裂”。
实验合理度: ★★★★☆ 有大规模语料、多个编码器、攻击实验和延迟实验,且明确区分了已证明和未证明的部分,整体比较讲理。
学术研究价值: ★★★★☆ 对向量检索隐私的威胁拆解很有价值,尤其是把查询隐私、文档隐私和访问模式分开讨论,适合后续继续研究。
稳定性: ★★★☆☆ 查询侧加密比较稳,但文档侧依赖威胁模型,碰上已知明文或自适应攻击就会明显变脆。
适应性以及泛化能力: ★★★☆☆ 对多编码器和百万文档规模有一定泛化,但参数、阈值和候选集大小都需要按场景重调。
硬件需求及成本: ★★★☆☆ 比全同态搜索友好得多,但 CKKS 仍然比普通向量检索重,服务器侧计算和带宽都不算轻。
复现难度: ★★★★☆ 代码开源、参数也给得比较细,复现门槛中等;难点主要在同态加密环境和基准对齐。
产品化成熟度: ★★★☆☆ 适合受限威胁模型下的原型或特定场景试点,离通用生产级隐私搜索还有距离。
可能的问题: 文档保护不是密码学保证,已知明文对齐和自适应攻击仍是明显短板;访问模式泄露也没有解决。
主要参考文献
Sergey M. Kurilenko. Hybrid privacy-aware semantic search: SVD-truncated document geometry and CKKS-encrypted query reranking under a restricted threat model. arXiv, 2026.
项目地址:https://github.com/sergkurilenko/research/tree/article1
原文链接:https://arxiv.org/pdf/2606.26373v1.pdf
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群