3DGS版权保护的“阿喀琉斯之踵”:局部侵权难题
NGS-Marker核心机制:从局部高斯原语直接嵌入与解码水印
第一步:联合训练先从源场景里随机采样一组k个最近邻的高斯原语作为局部区域,用PointTransformer生成扰动特征。同时,把要嵌入的版权消息(一串二进制位,比如1101...)转成文本提示(1对应True,0对应False),再用CLIP文本编码器变成条件特征。这个条件特征和局部区域的token一起送进扰动解码器,为每个高斯原语预测一个微小的扰动偏移量。把这些偏移量加到原始原语上,就得到了带水印的版本。提取器则负责从带水印的原语里反向解码出消息。整个注入器和提取器是端到端联合训练的,损失函数包含两项:一是渲染图像的均方误差损失,保证视觉上无感知;二是消息解码的交叉熵损失,保证水印信息准确。
渐进式优化策略:如何实现全场景均匀水印覆盖
要理解NGS-Marker为什么能解决这个问题,得先搞清楚3DGS为啥这么容易"被拆"。3DGS的每个高斯原语都携带位置(μ)、不透明度(α)、缩放(s)、颜色(c)和旋转(r)等独立参数,渲染时通过基于块的栅格化把原语投射到屏幕。这意味着每个原语之间相对独立,整个场景本质上就是一堆模块化"积木"的集合。
更要命的是,随着3DGS分割技术越来越成熟——现在甚至可以用一句话就把场景里某个物体"抠"出来——攻击者从受保护场景中提取一部分原语,拼接进自己的场景,已经成了低成本、低门槛的操作。这种"拆件盗用"在数字内容创作中越来越常见,而现有保护手段却几乎集体失灵。
论文用三种主流的3DGS水印方法做了一个非常扎心的实验:先把水印嵌入场景A,再从A中抠出一部分高斯原语拼接到场景B,形成混合场景BA,然后从BA的渲染图像中提取水印。结果如何?3D-GSW、GaussianMarker、GuardSplat在8位、16位、24位、32位水印消息下,提取准确率全部在49%~51%之间徘徊——这跟抛硬币猜正反没有任何区别。
为什么会出现这种"集体失灵"?因为这些方法都属于间接保护:水印信号是编码在渲染图像的像素分布里的,解码时也必须依赖渲染图像。当攻击者把一部分原语搬进一个完全不同场景时,渲染图像的分布发生了剧烈偏移,解码器面对的是从未见过的输入分布——水印信号早就被"冲散"了。
打个比方:间接保护方法就像给一幅画表面贴了一层防伪标签。如果攻击者把画裁下一角,再拼接到另一幅画上,防伪标签虽然还在,但验伪设备看到的是"被拼接后的画面",自然找不到原来的标签。想要真正防住这种"拆件盗用",必须把水印直接织进画布纤维里——也就是3DGS的高斯原语本体。
这个思路听起来直接,但有个关键问题:高斯原语不像图像有规整的网格结构,能不能像图像水印那样做端到端训练?论文做了一个很有意思的预实验:把经典图像水印网络HiDDeN的输入端从图像换成纯随机噪声,结果网络依然学会了嵌入和提取水印,且比特精度达到了96.7%。既然连一团无结构的随机噪声都能藏水印,空间分布有迹可循的高斯原语当然更没问题。
NGS-Marker核心机制:从局部高斯原语直接嵌入与解码水印
NGS-Marker的核心思想可以概括为一句话:把版权信息直接写进局部高斯原语的参数里,让任意一个局部区域都能被独立验证。整个框架由两个协同工作的组件构成——水印注入器和消息提取器,两者先联合训练,再用于场景嵌入。
先说训练阶段。由于不同3DGS场景的高斯原语数量差异很大,从几万到几百万都有,NGS-Marker没有采用"整场景输入"的全局策略,而是把处理单位固定为一个局部块:从源场景中随机采样k个最近邻高斯原语。这种局部到局部的训练方式,天然为后面的"任意区域验证"打下了基础。
局部块采样完成后,接下来要做两件事:一是让网络"理解"要嵌入的水印消息,二是为每个高斯原语预测一个微小扰动。论文用一个tokenizer(FPS+KNN策略)把局部块转换成点云token,作为扰动特征生成器Pg的query输入。同时,水印消息M被转换成语义提示——比特1对应"True",0对应"False"——再用CLIP文本编码器编码为条件特征,作为Pg的key和value。
扰动特征fd是一个"全局规划",它包含了整个局部块应该如何被修改的整体信息。接下来需要把它落实到每个原语上。这一步由扰动解码器Pd完成。Pd的核心是交叉注意力层:每个高斯原语以自身为query,以fd为key和value,独立地预测属于自己的那部分扰动偏移。由于每个原语的处理相互独立,所有原语的扰动预测可以完全并行。
有了带水印的局部块,还需要一个"读"水印的提取器E来反向还原消息。提取器的架构与Pg镜像对称:以带水印的局部块作为唯一输入,经过堆叠的PointTransformer层,最后通过MLP输出一个与原始消息同维度的预测向量。预测向量经过Sigmoid等激活函数后,就能与原始比特一一对应。
注入器和提取器是端到端联合优化的,损失函数由两部分构成:第一项是渲染图像的均方误差,要求带水印的局部块渲染出来的画面与原始画面尽量一致,这是"不可见性"的保障;第二项是消息解码的二进制交叉熵,要求提取器能准确还原嵌入的信息,这是"可解码性"的保障。
这里有个值得展开的理论支撑:为什么高斯参数能承载水印?论文从一阶近似的角度给出了解释。每个高斯原语的参数维度很高,但渲染时只影响有限的像素。在可微渲染的一阶近似下,雅可比矩阵存在一个相当大的"近似零空间"。通俗地说,存在很多参数扰动方向,能让渲染图像几乎不变、但高斯参数本身显著改变——水印容量就藏在零空间里。
图8展示了NGS-Marker每个模块的详细结构,可以看到Pg、Pd和E的具体网络层配置。
渐进式优化策略:如何实现全场景均匀水印覆盖
训练好的注入器和提取器已经具备了"局部嵌入"和"局部读取"的能力,但真正给一个目标场景嵌入水印时,还面临一个"最后一公里"问题:如何让整个场景的所有区域都均匀覆盖水印信号?
最朴素的做法是把场景划分成互不重叠的块,用注入器逐块嵌入。但这样会出现明显的边界不一致问题——块与块交界处的原语可能只被部分修改,水印信号在空间上不连续,解码时容易出错。更聪明的做法是反复随机采样局部块,逐块迭代注入直到全覆盖。但注入器是"一次性"设计,同一个原语如果被反复修改多次,不同轮次产生的扰动会互相冲突,最终累积成可见的渲染失真。
NGS-Marker绕开了注入器,直接使用提取器作为"裁判",对整个目标场景做梯度优化。具体来说,每一轮迭代从目标场景随机采样一个包含δ个相邻高斯原语的局部块。为了增强鲁棒性,采样时还会故意施加一些失真操作——密化、加噪、旋转、裁剪、平移——让水印信号能抵御真实世界中可能遭遇的"物理攻击"。
这个带失真的局部块被送入冻结的提取器,得到预测消息。优化目标也很直白:让预测消息尽可能接近预设的身份ID,同时保证整个场景的渲染图像与原始场景在视觉上足够相似。两个目标加权相加,通过梯度下降迭代更新场景中所有高斯原语的参数,直到任何随机采样的局部块都能准确解码出身份ID。
这种渐进式优化方案带来一个很实用的特性:水印嵌入时间与场景复杂度自适应。简单场景迭代少、收敛快,复杂场景增加迭代轮数即可。Table 4给出了不同场景的水印嵌入耗时统计,可以看到整个过程在单个A100 GPU上即可完成,具备实际部署的可行性。
所有权验证阶段同样简洁:用户选定可疑区域,直接输入提取器,得到水印信息后与自己的私有ID比对,超过预设相似度阈值就判定为侵权。为了让验证结果更直观,论文还设计了一个可视化方案:对多个原语组做采样投票,把判定为来自同一来源的原语在球谐系数上赋予特定颜色,从而在场景中高亮显示出"被挪用"的区域。这种"取证着色"的方式比单纯报一个数字更有说服力。
实验验证:局部侵权防御、渲染质量与鲁棒性全面领先
实验配置方面,论文使用24个公开3D场景做训练、4个场景单独留作测试,得益于局部化的水印注入策略,少量场景即可产生充足的训练数据。注入器和提取器在2张A100 GPU上训练150个epoch,局部块大小k=8192。对比基线包括三个现有3DGS保护方法(3D-GSW、GaussianMarker、GuardSplat)和两个基于本方注入器的消融变体(WI-Naive:场景分块独立注入;WI-Iterative:随机采样迭代注入)。
Table 2展示了局部侵权场景下的核心对比结果。NGS-Marker在8位、16位、24位消息下的比特精度分别达到99.14%、97.94%、94.68%,而3D精度(原语级别的资产归属分类准确率)稳定在95.2%以上。作为对比,所有现有间接保护方法的比特精度全部卡在50%出头。两个基于注入器的变体虽然能恢复部分信息,但与NGS-Marker仍有明显差距。
值得留意的一个细节是:NGS-Marker的3D精度并没有随消息变长而下降,反而在16位和24位时略有提升(95.20%→96.60%→96.50%)。论文给出的解释是:消息越长,随机碰撞导致误报的概率越低——更长的消息虽然让比特精度承受一定压力,但整体的验证可靠性反而提升了。
渲染质量方面,NGS-Marker以16位消息为例PSNR达到40.17dB,SSIM 0.995,LPIPS 0.007,全面优于所有基线。更关键的是,间接保护方法为了把水印信号藏进渲染图像,必然会对渲染结果造成可见修改;而NGS-Marker的水印完全藏在高斯参数里,渲染图像在原理上几乎不受影响。图5的视觉对比也印证了这一点:差值图放大5倍后,NGS-Marker的渲染差异依然微乎其微。
鲁棒性考察的是水印在真实世界中遭遇各种"意外操作"后还能不能被提取出来。论文模拟了高斯噪声、旋转、缩放、密化、裁剪、平移六种攻击,甚至把所有攻击叠加在一起(Combined)。从Table 3可以看到,即使经历了组合攻击,NGS-Marker依然保持着较高的比特精度。这得益于渐进式嵌入阶段每轮采样时故意加入的失真增强——模型在水印嵌入时就已经"预演"过这些攻击了。
从这些实验结果能看到一条清晰的主线:NGS-Marker和间接保护方法守护的是不同层面的资产。间接保护守的是"渲染结果",而NGS-Marker守的是"3D资产本体"。这也解释了为什么它在局部侵权场景下表现优异——水印与原语强绑定,原语被搬到哪里,水印就跟到哪里。
扩展应用:混合保护与图像级水印的灵活适配
NGS-Marker并不想取代现有的间接保护方法,反而选择了"合作共赢"的路线。既然间接方法擅长保护渲染图像、NGS-Marker擅长保护高斯原语,那把两者的优化目标放进同一个式子里同时优化,就能实现"双层保险"。
Table 5的混合保护实验验证了这种"1+1>2"的可行性:混合模式下,原生水印的比特精度保持在97.71%,间接水印的比特精度也维持在98.16%,两者几乎不互相干扰。这意味着团队可以选择同时给3D资产加两层保护,针对不同侵权形态都有对应的验证手段。
更灵活的是,NGS-Marker并不只支持二进制比特消息。论文将水印扩展到了图像模态:把CLIP文本编码器替换为图像编码器,把提取器输出端的MLP替换为图像解码器,然后用目标模态对应的损失函数做微调和嵌入。公式6给出了多模态扩展的损失定义。
论文用二维码做了实验验证:把一张二维码图片作为水印嵌入3D场景,渲染图像与原图几乎没有差别,而从任意局部高斯原语中提取出来的二维码依然可以被扫描识别。这种"扫码验真"的方式把版权验证从"对暗号"升级成了更直观的视觉验证。
总结来看,NGS-Marker选择了与间接保护方法完全不同的技术路线:不依赖渲染图像做中间载体,而是直接在3DGS的高斯原语上完成水印的嵌入与提取。这个"原生"视角的转换,精准命中了局部侵权这个真实痛点,也补上了现有3D资产版权保护体系中缺失的一块拼图。
龙迷三问
下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?针对3DGS资产被“拆件拼装”式盗用这一盲区,浙江大学提出NGS-Marker,首个直接嵌入并解码本地高斯原语的原生水印框架,任意局部区域即可验证版权,局部侵权场景Bit-Acc高达99.14%,渲染质量几乎无损。
这篇工作最值得看的点是什么?在局部侵权场景下,NGS-Marker的Bit-Acc达到94.68%-99.14%,3D-Acc达到95.20%-96.60%,远超现有方法(约50%随机猜测水平);渲染质量PSNR达39.61-41.77,优于所有对比方法;在多种失真下保持96%以上的解码准确率。
这篇工作的边界或风险在哪里?优点:(1)首次实现3DGS原生局部水印保护,有效防御局部侵权;(2)渐进式优化策略避免累积失真,保持高渲染质量;(3)支持与间接保护方法协同,支持多模态水印。缺点:(1)依赖3D编码/解码技术,成熟度不如2D领域;(2)大规模场景的划分和遍历策略可进一步优化;(3)水印嵌入时间随场景复杂度增加。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
首次提出针对3DGS局部侵权的原生水印框架,跳出了"渲染图像中间人"的传统思路,直接对高斯原语做水印嵌入和解码,定位精准、角度新颖。
实验合理度:★★★★☆
基线选择全面,既包含三个现有主流方法,也设计了两个消融变体来验证注入器和渐进式优化的贡献。实验场景覆盖局部侵权、各类攻击、混合保护和图像水印,验证链条完整。
学术研究价值:★★★★☆
给3DGS版权保护开辟了一个全新方向——原生水印。这套"直接操作3D表示本身"的范式,对点云、网格等其他显式3D表示的版权保护研究也有参考意义。
稳定性:★★★★☆
在六种典型攻击及其组合下比特精度保持稳定,说明水印具备较强的抗扰动能力。不过对于恶意攻击者通过对抗训练主动擦除水印的极端场景,论文尚未给出防御方案。
适应性以及泛化能力:★★★★☆
局部水印策略天然适配任意规模的场景,混合保护和图像级水印展示了良好的可扩展性。目前对动态场景和超复杂大场景的实验覆盖还有提升空间。
硬件需求及成本:★★★★☆
训练阶段需要2张A100,部署阶段水印嵌入在单张A100上分钟级完成,推理阶段提取器轻量高效。对3D资产业务的实际使用而言,这个成本处于可接受范围。
复现难度:★★★★☆
论文提供了匿名开源代码,训练和评估流程描述清晰,需要自己准备3DGS场景数据并完成预训练,有一定工作量但整体可控。
产品化成熟度:★★★☆☆
水印嵌入、验证、可视化取证流程完整,已经具备产品雏形。但距离大规模商用还差几步:嵌入耗时优化、与3D资产分发平台集成、以及更完善的可信验证机制。
可能的问题:对超大规模场景的嵌入效率有待优化;针对恶意对抗攻击者主动擦除水印的"攻击-防御"博弈尚未充分讨论;另外3D-Acc的计算依赖阈值τ(论文默认75%),阈值选择对结果的影响虽有消融但实际部署中需要针对场景调参。
主要参考文献
[1] Kerbl B, et al. 3D Gaussian Splatting for Real-Time Radiance Field Rendering. ACM TOG, 2023.
[2] Zhu J, et al. HiDDeN: Hiding Data With Deep Networks. ECCV, 2018.
[3] Qin H, Sun Y, Chen L, et al. NGS-Marker: Robust Native Watermarking for 3D Gaussian Splatting. arXiv:2608.17447, 2026.
[4] NGS-Marker 开源代码: https://anonymous.4open.science/r/NGS-Marker/
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
3D资产防剽窃,就像给每个高斯原语都盖了个看不见的章。想聊聊水印、版权保护或者3DGS的新玩法?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。群里已经有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个方向的伙伴等你来聊~
论文创新性分数:★★★★☆
首次提出针对3DGS局部侵权的原生水印框架,跳出了"渲染图像中间人"的传统思路,直接对高斯原语做水印嵌入和解码,定位精准、角度新颖。实验合理度:★★★★☆
基线选择全面,既包含三个现有主流方法,也设计了两个消融变体来验证注入器和渐进式优化的贡献。实验场景覆盖局部侵权、各类攻击、混合保护和图像水印,验证链条完整。学术研究价值:★★★★☆
给3DGS版权保护开辟了一个全新方向——原生水印。这套"直接操作3D表示本身"的范式,对点云、网格等其他显式3D表示的版权保护研究也有参考意义。稳定性:★★★★☆
在六种典型攻击及其组合下比特精度保持稳定,说明水印具备较强的抗扰动能力。不过对于恶意攻击者通过对抗训练主动擦除水印的极端场景,论文尚未给出防御方案。适应性以及泛化能力:★★★★☆
局部水印策略天然适配任意规模的场景,混合保护和图像级水印展示了良好的可扩展性。目前对动态场景和超复杂大场景的实验覆盖还有提升空间。硬件需求及成本:★★★★☆
训练阶段需要2张A100,部署阶段水印嵌入在单张A100上分钟级完成,推理阶段提取器轻量高效。对3D资产业务的实际使用而言,这个成本处于可接受范围。复现难度:★★★★☆
论文提供了匿名开源代码,训练和评估流程描述清晰,需要自己准备3DGS场景数据并完成预训练,有一定工作量但整体可控。产品化成熟度:★★★☆☆
水印嵌入、验证、可视化取证流程完整,已经具备产品雏形。但距离大规模商用还差几步:嵌入耗时优化、与3D资产分发平台集成、以及更完善的可信验证机制。可能的问题:对超大规模场景的嵌入效率有待优化;针对恶意对抗攻击者主动擦除水印的"攻击-防御"博弈尚未充分讨论;另外3D-Acc的计算依赖阈值τ(论文默认75%),阈值选择对结果的影响虽有消融但实际部署中需要针对场景调参。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!