← 返回 PaperDaily 视觉与图像

USTC新方法:视频遗忘不改模型也能做

这篇论文最有意思的地方,不是“删掉了什么”,而是“删掉之后还能不能把视频保住”。SIRUS把遗忘、保真、质量、鲁棒性和效率拆开测,终于不再让概念擦除只靠一张嘴说服人。

USTC新方法:视频遗忘不改模型也能做
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚!
👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文最有意思的地方,不是“删掉了什么”,而是“删掉之后还能不能把视频保住”。SIRUS把遗忘、保真、质量、鲁棒性和效率拆开测,终于不再让概念擦除只靠一张嘴说服人。


原论文信息如下:
论文标题:
Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models
发表日期:
2026年07月
发表单位:
University of Science and Technology of China
原文链接:
https://arxiv.org/pdf/2607.14194v1.pdf

生成视频时,如何精准抹去“不想要”的概念?(基于文本的子空间定位)

文本生成视频这件事,最难的往往不是“生成”,而是“该删的删干净,不该动的别乱碰”。因为视频里的目标概念,常常不是一个孤零零的词,而是会藏在同义词、别名、描述性短语,甚至风格词里。比如“裸体”“垃圾车”“梵高风格”这种概念,既可能直接出现在提示词里,也可能被换个说法悄悄冒出来。SIRUS做的事情,就是先把“目标概念在哪里”找出来,再决定“该怎么抹掉”,而不是上来就把整个模型一顿乱改。
图2:SIRUS总体流程图
图2:SIRUS总体流程图。方法先从目标概念的文本别名出发,构建概念子空间,再在提示词中定位目标证据,接着在采样阶段减去一个受控的概念残差。最关键的点在于:文本侧负责定位,采样侧负责抑制,两件事分开干,逻辑就清楚多了。
先说人话版:如果把文本编码后的词向量想成一堆点,那么“裸体”这个概念不会只落在某一个点上,而是会在一小片区域里反复出现。SIRUS把这片区域近似成一个概念子空间,英文是 concept subspace。它不是拿真实图片去学,而是只用文本别名和上下文模板,从文本编码器里把目标概念“长什么样”统计出来。
这一步很聪明。因为视频生成模型里,真正麻烦的不是“有没有这个词”,而是“这个词有没有被模型理解成同一类视觉语义”。比如“梵高风格”可能不止体现在“Van Gogh”这几个字上,还会体现在“印象派笔触”“厚涂纹理”“蓝黄强对比”这些绕着说的表达里。直接关键词拦截,像拿纸板挡台风,基本挡不住。
概念子空间的做法也不复杂:先把别名塞进一组上下文模板,比如“a video of [alias] in a scene”“a clip featuring [alias]”,再把这些文本喂给冻结的文本编码器,收集别名对应的 token 向量,最后做中心化、奇异值分解和正交化,得到一个基底。论文里还给了一个投影算子 PB(e),意思就是把某个词向量 e 在这个概念子空间上的分量“掏出来”。后面不管是做触发判断,还是做概念抑制,都靠它。
这里的核心不是数学花活,而是工程思路:先把“目标概念的语义范围”圈出来,再决定后续要不要动手。这样比粗暴地删词、禁词、屏蔽输出要细腻得多,也更适合视频这种“一个词会影响整段时间轴”的任务。

训练0成本!揭秘SIRUS如何在不修改模型的情况下实现概念遗忘

这篇工作最有意思的地方,是它几乎不碰模型参数。没有重训,没有微调,没有把文本编码器和去噪网络重新折腾一遍。SIRUS走的是推理时干预路线,英文叫 inference-time intervention。说白了,就是模型本体先别动,先在采样过程中“临场指挥”。
这对视频模型特别重要。因为视频生成本来就贵,训练一次成本高、时间长、显存大;如果每换一个目标概念都要重新编辑模型,那部署方基本等于在给安全策略打工。SIRUS把“遗忘”变成了一个可插拔的推理模块,换句话说,模型不用退休,现场加个安检员就行
它的流程大致分成四步。第一步是用别名构建概念子空间;第二步是做层级触发,判断当前提示词里有没有目标概念的证据;第三步是在触发到的 token 上做局部投影,把目标语义削弱;第四步是在扩散采样时减去一个“正向概念参考分支”带来的残差,防止模型偷偷把目标概念又补回来。这个设计很像“先堵入口,再盯回流”,而不是只在输出端做最后一刀。
图3:四类代表性概念上的定性结果
图3:四类代表性概念上的定性结果。基线模型会把目标概念生成出来,而 SIRUS 会尽量把它抹掉,同时保住主体和场景。尤其在裸体案例里,它不是简单把人也删了,而是尽量只去掉不想要的部分,这一点比某些“删得太狠”的方法要体面得多。😏
这里还有个很关键的细节:SIRUS不是一刀切地全局抹除,而是先看提示词里哪些 token 真正和目标概念相关。论文里用了一个层级触发规则,英文是 hierarchical trigger。第一层是精确别名匹配,第二层是子空间相似度检测,后面还有更保守的回退策略。这个顺序很讲究:先保证精度,再补召回,最后才放宽条件。
为什么要这么麻烦?因为视频生成里,误伤比图像更贵。图像里删错一个词,可能只坏一张图;视频里删错一个词,可能整段动作、构图、时序全跟着歪。SIRUS通过只对被触发的 token 做局部投影,避免把“背景”“动作”“主体身份”一起卷进去。说白了,就是不让安全策略变成“宁可错杀一千”的版本。
采样阶段的“正向概念参考分支”也很有意思。它不是拿来生成最终结果的,而是用来估计“如果不压制,模型会往哪个方向把目标概念补回来”。这相当于给模型加了一个反向参照物,然后在扩散过程中把这股回流给抵消掉。再配合时间调度和动量平滑,抑制强度不是从头猛踩到尾,而是按步骤逐渐收手,减少对纹理和运动连续性的破坏。

精确制导:如何只删除“目标”不破坏“场景”?

如果只看“删没删掉目标”,那很多方法都能吹一嘴;真正难的是删掉之后,视频还能不能像个正常视频。SIRUS的思路是把“遗忘”和“保真”拆开看:一边看目标概念还在不在,一边看非目标内容有没有被误伤。这个思路很朴素,但比很多只盯单一指标的工作靠谱得多。
论文把评估拆成了五个维度:遗忘保留视频质量越狱鲁棒性效率。这里的“越狱”不是黑客电影里的那种越狱,而是指用改写、绕写、角色扮演等提示词绕过安全限制。也就是说,方法不能只会防直球,还得扛得住花式提问。
为了把这些东西讲清楚,论文还专门提出了一个视频向评估框架,英文叫 VUEF,全称是 Video Unlearning Evaluation Framework,中文可以理解为“视频遗忘评估框架”。它的价值不在于名字多酷,而在于它把视频级失败、帧级残留、保真度、质量下降和部署开销分开统计,避免“某个指标很好看,整体却翻车”的老套路。
从结果看,SIRUS并不是把所有东西都压到最低,而是尽量把目标概念的存在感压下去,同时让非目标内容别跟着陪葬。这种“有选择地失忆”比“整段删档”更符合真实部署需求。毕竟产品方要的不是一个什么都不敢生成的模型,而是一个能守规矩、还能正常干活的模型。
表1:不同目标概念上的遗忘表现
表1:不同目标概念上的遗忘表现。每个格子给出视频级遗忘成功率 / 帧级目标命中率。可以看到,SIRUS在五个概念上整体更均衡,平均成功率达到 70.4%,平均帧命中率降到 25.7%,比 VideoEraser 的 44.4% / 47.2% 更像是在“认真做减法”,而不是随手抹两笔。
表2:五个目标概念上的保留指标
表2:五个目标概念上的保留指标。这里重点看 LPIPS、CSDR 和 CLIP 保留比。SIRUS的 CLIP 保留比接近 1,说明删目标时没有把整体语义带偏太远;这很重要,因为有些方法看起来“删得很干净”,实际只是把视频质量一起删没了。
表3:视频质量评估结果
表3:视频质量评估结果。SIRUS相对 CogVideoX 基线的平均质量下降只有 -0.016,而 VideoEraser 是 -0.043。这个差距不算夸张到离谱,但足够说明:更强的遗忘不一定意味着更大的画质崩塌,关键在于干预位置和力度是否控制得住。
从消融实验也能看出,三块拼图缺一不可。去掉概念参考分支后,遗忘成功率从 80.0% 掉到 42.0%,说明采样阶段的“反向拉扯”是真有用;去掉层级触发或者子空间投影,目标抑制都会变弱,说明“先定位再抑制”不是装饰品,而是方法骨架。
表4:裸体场景上的消融实验
表4:裸体场景上的消融实验。这个设置最能同时考验“删目标”和“保主体”的平衡。结果很直白:少了任何一块,效果都会往下掉;少了参考分支,掉得最狠。

效果如何?多维度评估下的遗忘与质量“双赢”

如果只看一个总分,很多方法都能把故事讲圆;但一旦把指标拆开,谁在“真遗忘”,谁在“假装遗忘”,就很难继续糊弄。SIRUS在五类概念上做了比较完整的测试:安全类、物体类、风格类都覆盖了。结果显示,它不是某一个点特别强,而是整体 trade-off 更稳。
在遗忘上,SIRUS的平均视频级成功率是 70.4%,帧级命中率是 25.7%。这意味着它不只是让某一帧“看起来没事”,而是更接近把整段视频里的目标概念压下去。对视频任务来说,这比单帧擦除更重要,因为目标概念只要在少数帧里漏出来,整体就会显得“没删干净”。
在保留上,SIRUS的 LPIPS 和 CSDR 没有明显失控,CLIP 保留比也接近 1。这里的意思很朴素:删掉目标后,视频和原始提示词的语义关系没有被冲散。尤其是对“裸体”这种场景,论文还单独看了人是否还在。因为有些方法为了把“裸体”删掉,顺手把人也删了,这种操作虽然省事,但也挺离谱。SIRUS至少没有走这条偷懒路线。
表5:Wan2.2上的迁移结果
表5:Wan2.2上的迁移结果。SIRUS在新视频骨干上依然能保持不错的遗忘表现,平均成功率 73.6%,帧命中率 21.9%。这说明它不是只对某一个模型“特别会哄”,而是有一定跨骨干泛化能力。
不过也别把它吹成万能钥匙。论文自己也承认,像 parachute 这种目标大、持续时间长、视觉上特别显眼的概念,还是比较难处理。原因很现实:越是贯穿整段视频的实体,越容易在采样过程中反复“回魂”。这类情况说明,当前方法对某些强时序持久目标仍然不够彻底。
图3:补充可视化中的困难案例
图3里最值得注意的不是成功案例,而是 parachute 这个失败边界。它提醒得很清楚:视频概念遗忘不是把一个词“抹掉”就完事,而是要和时序持续性、空间覆盖范围、提示词歧义一起斗智斗勇。

告别泛化难题:SIRUS还能轻松迁移到不同视频模型?

迁移能力是这类方法能不能落地的分水岭。要是只能在一个骨干上好用,那更像“定制特效”;要是换个视频模型还能跑,才算真的有点工具属性。SIRUS在 Wan2.2 上做了扩展实验,结果说明它并不是只会在 CogVideoX 上表演。
这件事为什么能成立?原因还是在于它大部分逻辑都压在文本侧定位采样侧残差抑制上,而不是依赖某个骨干模型内部被训练过的特殊参数。只要文本编码接口和扩散采样接口大体一致,这套方法就有机会迁过去。
不过迁移也不是白送的。不同模型的文本对齐方式、视频长度、采样调度、语义偏好都不一样,参数直接照搬未必最优。论文现在证明的是“能迁移、且效果不错”,还不是“到哪都自动满分”。这中间还隔着一层工程调参的现实距离。
如果把这篇工作放到更大的背景里看,它其实在回答一个很实际的问题:未来的视频生成系统,不能只会“生成得像”,还得会“按政策改口”。SIRUS提供的不是一个大而全的终极方案,而是一个比较干净的工程范式:不改底座、只改推理、分开定位和抑制、再用视频级指标验收。这套思路值得后续很多安全控制工作借鉴。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是文本生成视频里“指定概念怎么删、删完还别把别的内容搞坏”的问题。SIRUS不是简单拒绝生成,而是尽量在生成过程中把目标概念压下去,同时保住主体、场景和时序结构。

文中的“概念子空间”是什么意思?可以把它理解成目标概念在文本向量空间里的一片“活动区域”。论文用别名和上下文模板把这片区域统计出来,再用投影把提示词里和目标相关的部分削弱掉。

为什么它比直接屏蔽关键词更靠谱?因为视频里的目标概念常常不只靠一个词表达,还会通过别名、描述、风格词、上下文暗示出现。SIRUS先定位语义证据,再在采样时做抑制,所以对绕写、改写和时序残留更有针对性。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

把“概念遗忘”从参数编辑搬到推理时做,并且专门针对视频的时序残留设计了子空间定位和残差抑制,这个组合是有新意的,不是换皮。

实验合理度:★★★★☆

评估维度拆得比较细,遗忘、保留、质量、鲁棒性、效率都看了,且有消融和跨骨干实验,整体说服力不错。

学术研究价值:★★★★☆

它把视频概念遗忘这个方向的评估标准和方法框架都往前推了一步,后续做安全视频生成的人大概率绕不开这类思路。

稳定性:★★★☆☆

在 CogVideoX 和 Wan2.2 上都能工作,说明基本稳定;但对强时序持久目标仍有残留,离“稳如老狗”还有距离。

适应性以及泛化能力:★★★☆☆

跨骨干迁移是加分项,但它仍依赖文本别名和提示词触发质量,换场景后参数和触发策略可能要重新调。

硬件需求及成本:★★★★☆

不需要重训,推理时加模块即可,训练成本几乎为零;代价是生成时多了额外分支计算,但比重新编辑模型便宜太多。

复现难度:★★★☆☆

思路不算离谱,但要把触发、投影、参考分支和调度都调顺,还是有一定工程门槛;好在论文给了完整评估框架。

产品化成熟度:★★★☆☆

适合做视频生成安全控制的插件型方案,尤其适合“按概念屏蔽”的场景;但对复杂提示词和强持久目标,还需要进一步验证。

可能的问题:方法依赖别名和触发质量,对长时序、强显著目标仍不够彻底;另外,多分支推理会增加部署复杂度,离“零负担”还有差距。


主要参考文献

[1] Wenxuan Chen, Wenjie Feng. Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models. arXiv:2607.14194v1, 2026.
[2] 论文原文链接:https://arxiv.org/pdf/2607.14194v1.pdf

视频模型也开始讲“删得干净,还得留得住”了。想看更多这类前沿论文拆解、开源代码和实战判断,欢迎加入龙哥读论文粉丝群,一起把AI安全、视频生成和大模型的门道掰开揉碎。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。