← 返回 PaperDaily
视觉与图像
USTC新方法:视频遗忘不改模型也能做
这篇论文最有意思的地方,不是“删掉了什么”,而是“删掉之后还能不能把视频保住”。SIRUS把遗忘、保真、质量、鲁棒性和效率拆开测,终于不再让概念擦除只靠一张嘴说服人。
龙哥读论文
发布于 2026-08-14 09:11:16
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇论文最有意思的地方,不是“删掉了什么”,而是“删掉之后还能不能把视频保住”。SIRUS把遗忘、保真、质量、鲁棒性和效率拆开测,终于不再让概念擦除只靠一张嘴说服人。
原论文信息如下:
生成视频时,如何精准抹去“不想要”的概念?(基于文本的子空间定位)
文本生成视频这件事,最难的往往不是“生成”,而是“该删的删干净,不该动的别乱碰”。因为视频里的目标概念,常常不是一个孤零零的词,而是会藏在同义词、别名、描述性短语,甚至风格词里。比如“裸体”“垃圾车”“梵高风格”这种概念,既可能直接出现在提示词里,也可能被换个说法悄悄冒出来。SIRUS 做的事情,就是先把“目标概念在哪里”找出来,再决定“该怎么抹掉”,而不是上来就把整个模型一顿乱改。
先说人话版:如果把文本编码后的词向量想成一堆点,那么“裸体”这个概念不会只落在某一个点上,而是会在一小片区域里反复出现。SIRUS把这片区域近似成一个概念子空间 ,英文是 concept subspace 。它不是拿真实图片去学,而是只用文本别名和上下文模板,从文本编码器里把目标概念“长什么样”统计出来。
这一步很聪明。因为视频生成模型里,真正麻烦的不是“有没有这个词”,而是“这个词有没有被模型理解成同一类视觉语义”。比如“梵高风格”可能不止体现在“Van Gogh”这几个字上,还会体现在“印象派笔触”“厚涂纹理”“蓝黄强对比”这些绕着说的表达里。直接关键词拦截,像拿纸板挡台风,基本挡不住。
概念子空间 的做法也不复杂:先把别名塞进一组上下文模板,比如“a video of [alias] in a scene”“a clip featuring [alias]”,再把这些文本喂给冻结的文本编码器,收集别名对应的 token 向量,最后做中心化、奇异值分解和正交化,得到一个基底。论文里还给了一个投影算子 PB(e) ,意思就是把某个词向量 e 在这个概念子空间上的分量“掏出来”。后面不管是做触发判断,还是做概念抑制,都靠它。
这里的核心不是数学花活,而是工程思路:先把“目标概念的语义范围”圈出来 ,再决定后续要不要动手。这样比粗暴地删词、禁词、屏蔽输出要细腻得多,也更适合视频这种“一个词会影响整段时间轴”的任务。
训练0成本!揭秘SIRUS如何在不修改模型的情况下实现概念遗忘
这篇工作最有意思的地方,是它几乎不碰模型参数。没有重训,没有微调,没有把文本编码器和去噪网络重新折腾一遍。SIRUS走的是推理时干预 路线,英文叫 inference-time intervention 。说白了,就是模型本体先别动,先在采样过程中“临场指挥”。
这对视频模型特别重要。因为视频生成本来就贵,训练一次成本高、时间长、显存大;如果每换一个目标概念都要重新编辑模型,那部署方基本等于在给安全策略打工。SIRUS把“遗忘”变成了一个可插拔的推理模块,换句话说,模型不用退休,现场加个安检员就行 。
它的流程大致分成四步。第一步是用别名构建概念子空间;第二步是做层级触发,判断当前提示词里有没有目标概念的证据;第三步是在触发到的 token 上做局部投影,把目标语义削弱;第四步是在扩散采样时减去一个“正向概念参考分支”带来的残差,防止模型偷偷把目标概念又补回来。这个设计很像“先堵入口,再盯回流”,而不是只在输出端做最后一刀。
这里还有个很关键的细节:SIRUS不是一刀切地全局抹除,而是先看提示词里哪些 token 真正和目标概念相关。论文里用了一个层级触发规则 ,英文是 hierarchical trigger 。第一层是精确别名匹配,第二层是子空间相似度检测,后面还有更保守的回退策略。这个顺序很讲究:先保证精度,再补召回,最后才放宽条件。
为什么要这么麻烦?因为视频生成里,误伤比图像更贵。图像里删错一个词,可能只坏一张图;视频里删错一个词,可能整段动作、构图、时序全跟着歪。SIRUS通过只对被触发的 token 做局部投影,避免把“背景”“动作”“主体身份”一起卷进去。说白了,就是不让安全策略变成“宁可错杀一千”的版本。
采样阶段的“正向概念参考分支”也很有意思。它不是拿来生成最终结果的,而是用来估计“如果不压制,模型会往哪个方向把目标概念补回来”。这相当于给模型加了一个反向参照物,然后在扩散过程中把这股回流给抵消掉。再配合时间调度和动量平滑,抑制强度不是从头猛踩到尾,而是按步骤逐渐收手,减少对纹理和运动连续性的破坏。
精确制导:如何只删除“目标”不破坏“场景”?
如果只看“删没删掉目标”,那很多方法都能吹一嘴;真正难的是删掉之后,视频还能不能像个正常视频。SIRUS的思路是把“遗忘”和“保真”拆开看:一边看目标概念还在不在,一边看非目标内容有没有被误伤。这个思路很朴素,但比很多只盯单一指标的工作靠谱得多。
论文把评估拆成了五个维度:遗忘 、保留 、视频质量 、越狱鲁棒性 和效率 。这里的“越狱”不是黑客电影里的那种越狱,而是指用改写、绕写、角色扮演等提示词绕过安全限制。也就是说,方法不能只会防直球,还得扛得住花式提问。
为了把这些东西讲清楚,论文还专门提出了一个视频向评估框架,英文叫 VUEF ,全称是 Video Unlearning Evaluation Framework ,中文可以理解为“视频遗忘评估框架”。它的价值不在于名字多酷,而在于它把视频级失败、帧级残留、保真度、质量下降和部署开销分开统计,避免“某个指标很好看,整体却翻车”的老套路。
从结果看,SIRUS并不是把所有东西都压到最低,而是尽量把目标概念的存在感 压下去,同时让非目标内容别跟着陪葬。这种“有选择地失忆”比“整段删档”更符合真实部署需求。毕竟产品方要的不是一个什么都不敢生成的模型,而是一个能守规矩、还能正常干活的模型。
从消融实验也能看出,三块拼图缺一不可。去掉概念参考分支后,遗忘成功率从 80.0% 掉到 42.0%,说明采样阶段的“反向拉扯”是真有用;去掉层级触发或者子空间投影,目标抑制都会变弱,说明“先定位再抑制”不是装饰品,而是方法骨架。
效果如何?多维度评估下的遗忘与质量“双赢”
如果只看一个总分,很多方法都能把故事讲圆;但一旦把指标拆开,谁在“真遗忘”,谁在“假装遗忘”,就很难继续糊弄。SIRUS在五类概念上做了比较完整的测试:安全类、物体类、风格类都覆盖了。结果显示,它不是某一个点特别强,而是整体 trade-off 更稳。
在遗忘上,SIRUS的平均视频级成功率是 70.4%,帧级命中率是 25.7%。这意味着它不只是让某一帧“看起来没事”,而是更接近把整段视频里的目标概念压下去。对视频任务来说,这比单帧擦除更重要,因为目标概念只要在少数帧里漏出来,整体就会显得“没删干净”。
在保留上,SIRUS的 LPIPS 和 CSDR 没有明显失控,CLIP 保留比也接近 1。这里的意思很朴素:删掉目标后,视频和原始提示词的语义关系没有被冲散。尤其是对“裸体”这种场景,论文还单独看了人是否还在。因为有些方法为了把“裸体”删掉,顺手把人也删了,这种操作虽然省事,但也挺离谱。SIRUS至少没有走这条偷懒路线。
不过也别把它吹成万能钥匙。论文自己也承认,像 parachute 这种目标大、持续时间长、视觉上特别显眼的概念,还是比较难处理。原因很现实:越是贯穿整段视频的实体,越容易在采样过程中反复“回魂”。这类情况说明,当前方法对某些强时序持久目标仍然不够彻底。
告别泛化难题:SIRUS还能轻松迁移到不同视频模型?
迁移能力是这类方法能不能落地的分水岭。要是只能在一个骨干上好用,那更像“定制特效”;要是换个视频模型还能跑,才算真的有点工具属性。SIRUS在 Wan2.2 上做了扩展实验,结果说明它并不是只会在 CogVideoX 上表演。
这件事为什么能成立?原因还是在于它大部分逻辑都压在文本侧定位 和采样侧残差抑制 上,而不是依赖某个骨干模型内部被训练过的特殊参数。只要文本编码接口和扩散采样接口大体一致,这套方法就有机会迁过去。
不过迁移也不是白送的。不同模型的文本对齐方式、视频长度、采样调度、语义偏好都不一样,参数直接照搬未必最优。论文现在证明的是“能迁移、且效果不错”,还不是“到哪都自动满分”。这中间还隔着一层工程调参的现实距离。
如果把这篇工作放到更大的背景里看,它其实在回答一个很实际的问题:未来的视频生成系统,不能只会“生成得像”,还得会“按政策改口”。SIRUS提供的不是一个大而全的终极方案,而是一个比较干净的工程范式:不改底座、只改推理、分开定位和抑制、再用视频级指标验收 。这套思路值得后续很多安全控制工作借鉴。
龙迷三问
这篇论文到底解决了什么问题? 它解决的是文本生成视频里“指定概念怎么删、删完还别把别的内容搞坏”的问题。SIRUS不是简单拒绝生成,而是尽量在生成过程中把目标概念压下去,同时保住主体、场景和时序结构。
文中的“概念子空间”是什么意思? 可以把它理解成目标概念在文本向量空间里的一片“活动区域”。论文用别名和上下文模板把这片区域统计出来,再用投影把提示词里和目标相关的部分削弱掉。
为什么它比直接屏蔽关键词更靠谱? 因为视频里的目标概念常常不只靠一个词表达,还会通过别名、描述、风格词、上下文暗示出现。SIRUS先定位语义证据,再在采样时做抑制,所以对绕写、改写和时序残留更有针对性。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“概念遗忘”从参数编辑搬到推理时做,并且专门针对视频的时序残留设计了子空间定位和残差抑制,这个组合是有新意的,不是换皮。
实验合理度: ★★★★☆
评估维度拆得比较细,遗忘、保留、质量、鲁棒性、效率都看了,且有消融和跨骨干实验,整体说服力不错。
学术研究价值: ★★★★☆
它把视频概念遗忘这个方向的评估标准和方法框架都往前推了一步,后续做安全视频生成的人大概率绕不开这类思路。
稳定性: ★★★☆☆
在 CogVideoX 和 Wan2.2 上都能工作,说明基本稳定;但对强时序持久目标仍有残留,离“稳如老狗”还有距离。
适应性以及泛化能力: ★★★☆☆
跨骨干迁移是加分项,但它仍依赖文本别名和提示词触发质量,换场景后参数和触发策略可能要重新调。
硬件需求及成本: ★★★★☆
不需要重训,推理时加模块即可,训练成本几乎为零;代价是生成时多了额外分支计算,但比重新编辑模型便宜太多。
复现难度: ★★★☆☆
思路不算离谱,但要把触发、投影、参考分支和调度都调顺,还是有一定工程门槛;好在论文给了完整评估框架。
产品化成熟度: ★★★☆☆
适合做视频生成安全控制的插件型方案,尤其适合“按概念屏蔽”的场景;但对复杂提示词和强持久目标,还需要进一步验证。
可能的问题: 方法依赖别名和触发质量,对长时序、强显著目标仍不够彻底;另外,多分支推理会增加部署复杂度,离“零负担”还有差距。
主要参考文献
[1] Wenxuan Chen, Wenjie Feng. Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models. arXiv:2607.14194v1, 2026.
[2] 论文原文链接:https://arxiv.org/pdf/2607.14194v1.pdf
视频模型也开始讲“删得干净,还得留得住”了。想看更多这类前沿论文拆解、开源代码和实战判断,欢迎加入龙哥读论文粉丝群,一起把AI安全、视频生成和大模型的门道掰开揉碎。
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群