← 返回 PaperDaily 视觉与图像

字节跳动新作!给视频配音就像改字幕,声效可控性暴增40.7%

说到给视频配音效,很多人会想:不就是根据画面内容生成声音吗,猫叫就是喵喵,打雷就是轰隆,有什么难的?但如果你脑洞再大一点——比如,你想让视频里原本只是“喵喵”叫的猫,在00:07秒的那一声突然变成“狮子吼”;或者你希望整个视频的音频听起来就像是从一部80年代复古游戏机里传出来的;再或者在火柴划过的一瞬间,不仅要有摩擦声,还要叠加一声魔幻的“呼——嗖”……你会

字节跳动新作!给视频配音就像改字幕,声效可控性暴增40.7%

从视频到创意音效:事件级层次控制新范式

说到给视频配音效,很多人会想:不就是根据画面内容生成声音吗,猫叫就是喵喵,打雷就是轰隆,有什么难的?但如果你脑洞再大一点——比如,你想让视频里原本只是“喵喵”叫的猫,在00:07秒的那一声突然变成“狮子吼”;或者你希望整个视频的音频听起来就像是从一部80年代复古游戏机里传出来的;再或者在火柴划过的一瞬间,不仅要有摩擦声,还要叠加一声魔幻的“呼——嗖”……你会发现,现有的AI音效生成工具,基本上都“麻爪”了。
现有的视频转音频(VT2A)技术,说白了就是把视频往模型里一扔,告诉它“这是个猫,给我配个猫叫”。模型确实能干活,但它分不清视频里到底有几只猫在叫,更别说让你指定“只把第二声喵喵改成狮子吼”这种精确操作了。它会非常“听话”地把所有猫叫都改掉,或者说干脆无视你的指令,完全凭视觉内容“自由发挥”。用行话讲,这就是视觉主导(Visual Dominance)——模型被画面牵着鼻子走,用户写的文本指令,基本就当个“吉祥物”供着。
为了解决这个问题,来自字节跳动智能创作团队、UIUC、UC Merced 和 UCLA 的研究者们联合搞了个大事情。他们提出了一套全新的框架——EchoFoley。这个名字翻译过来大概就是“回声配音员”,但它可不是个只会做简单口技的实习生,而是一套定义了“事件级层次控制”新范式的体系。
先来看个总体效果演示,感受下它的能力边界:
Your browser does not support the video tag.
看到没?这可不是简单的“对图配音”,而是真正做到了“指哪儿打哪儿”的精细控制。
就像开头说的,你不需要再为“只能生成一种声音”或者“指令被无视”而烦恼。这套方法从根本上重新定义了“给视频配音”这件事:它不再把一段视频当作一个整体来处理,而是先把视频拆解成一个个独立的发声事件(Sounding Event),然后允许你对每一个事件进行独立的、精细的控制。
比如下面这个例子,视频本身没有声音,EchoFoley 能理解指令,把火柴划着这一瞬间,精确地插入一个“火柴摩擦声”,并且是在正确的时间点(00:05秒)。其他的基线模型完全做不到这种精细度,要么生成的声音时间不对,要么声音类型完全牛头不对马嘴。
Your browser does not support the video tag.

这背后,是研究者们提出的一个关于“创意音效生成”的全新思考。

符号化发声事件:EchoFoley任务与EchoFoley-6k数据集详解

故事开始之前,研究者们需要先回答一个根本问题:给视频配音效,到底什么是“可控”?
在传统的视频转音频(VT2A)任务中,控制信号往往是视频层面的“粗糙指令”,比如对着一整段视频说“生成一个猫叫”。但问题在于,如果视频里有3次猫叫,AI 到底改哪一次?或者说,你想让第一次叫得凶,第二次叫得温柔,第三次叫得绵长,模型该听谁的?
为了解决这个问题,EchoFoley 提出了一种名为符号化发声事件(Symbolic Sounding Event Representation)的表示方法。可以把它想象成是给每一个声音事件都编了一个“身份证”,上面清楚地写明了它的时空位置、语义描述和具体的声学属性。
这个“身份证”其实是一个结构化的元组:
e = ( t, d, p )

其中:
t = (t_start, t_end):表示这个发声事件在视频时间轴上的精确起止时间。
d:事件的语义描述,比如(主体-动作-对象),例如“猫-叫-了一声”。
p:可控的音频属性,比如音色、音高、音量、空间感等。
有了这个精确的“指代词”,EchoFoley 任务就变成了:给定一个视频和一条用户指令,AI 需要生成一个音频轨道,使得它能同时满足两个条件——与视频内容对齐,并且完美遵循指令中关于一系列发声事件的层次化约束。
这里的“层次化”是理解本工作的关键。EchoFoley 将控制分为三个层级:

实例级控制(Instance Level):这是最细粒度的控制。你可以精确地修改、插入或删除一个特定的发声事件。比如,“把视频里第二声猫叫,改成狮子吼”。

分组级控制(Group Level):控制一组相关的发声事件。比如,“把视频里所有的猫叫声,都改成老虎的低吼”。或者,“让所有出现在00:05秒后的鼓点都变得更重”。

视频级控制(Video Level):从宏观上塑造整个视频的音效风格。比如,“给整个视频渲染一层未来科幻的金属音色”,或者“让氛围听起来像下雨天的咖啡馆”。

更厉害的是,这三级控制还能和三种控制类型(时间控制、音色控制、音量控制)自由组合。比如,你可以发出这样的指令:“把那个在00:07秒出现的猫叫声(实例级),把它的音色修改成狮子吼(音色控制),并且让它的声音比前面的所有声音都大一倍(音量控制)”。这就像给你了一把音频世界的“瑞士军刀”,什么东西都能拆开来精细打磨。
为了支持这项新任务,研究者们还搞了一个超级大工程——EchoFoley-6k数据集。这个数据集的构建流程相当“硬核”,如下所示:
数据整理管道
图2:EchoFoley-6k 的数据整理管道。
从 VGGSound 和 PE Video Dataset 中筛选出运动明显的视频后,他们先使用 LVLM 自动生成画面描述和故事草稿,并由 AI 提出初始的发声事件。但这还不够,最后一步也是最关键的一步:人类标注员亲自上阵,把这些粗糙的 AI 提议,转化为精确的、细粒度的指令和事件标注。
最终产出的数据集规模,看这表格就知道了:
数据集统计
表1:EchoFoley-6k 数据集统计及图3:视频主题分布。
906段视频,14个主题,总共6,018条指令和5,622个精细化标注的发声事件!这意味着平均每段视频就有约6个发声事件和12条相关指令。毫不夸张地说,这是目前市面上最精细、最专业的可控音效生成基准数据集。

无需训练的智能体框架:EchoVidia的慢-快思考策略

数据集建好了,任务也定义清楚了,那怎么才能让现有的模型做到呢?直接拿 EchoFoley-6k 去微调现有的 VT2A 模型,不就行了?
研究者们试了一下,结果发现:不太行。现有模型在面对这种细粒度指令时,表现堪称“灾难”。问题根子在于——模型对视频里有哪些发声事件,它们又发生在什么时候,完全没有概念。
所以,研究者们换了个思路:既然大模型(LLM/VLMs)已经具备了强大的理解和推理能力,为什么不让它们来“指挥”音效生成呢?于是,一个不用训练的智能体框架——EchoVidia——诞生了。
EchoVidia 的灵感来源于人类认知中的双系统理论(Dual-Process Theory):系统1负责快速、直觉性的思考(快思考),系统2负责慢速、逻辑、分析性的思考(慢思考)。
它具体怎么做的呢?核心是这套慢-快思考策略(Slow-Fast Thinking Strategy)

快思考路径(Fast Pathway):AI 先以1帧/秒的速度,快速扫一遍整个视频,抓住全局的、高层次的画面结构和粗略的听觉风格。比如,它知道这是一个“猫和老鼠对峙”的场景,气氛很紧张。

慢思考路径(Slow Pathway):然后,AI 会把视频以16倍速慢放(即原来1秒的片段被拉长到16秒),并以1帧/秒的速率分析。这样,原本一闪而过的细节动作就能被精确捕捉。比如,AI 现在能清晰地识别出猫在00:03秒叫了一声,在00:07秒又叫了一声,并确定这两次叫声的精确时间戳。

这套策略被证明非常有效。论文中通过实验发现,即使是当前最强的 VideoLLM(如 Gemini-2.5 Pro),在检测和时间定位发声事件时,其准确率也只有66%和49%的F1分数(如表3所示)。而一旦采用了慢-快思考策略,准确率直接飙升到了83%,F1分数达到了74%,分别提升了17%和15%!
EchoVidia 的整体推理流程如下所示:
推理流程
图7:EchoVidia 推理流程。
在推理时,EchoVidia 就像一位专业的音频导演。它首先通过慢-快思考,观看并理解视频,识别出所有潜在的发声事件。然后,它会根据用户的自然语言指令,构建一个符号化事件计划(Symbolic Event Plan),这个计划由一系列精准的操作组成,比如“在00:05-00:06插入一个火柴摩擦声,并将音色设为清脆”。接着,这个计划被交给一个强大的音效生成器(比如 MMAudio),最终合成出音频。
这种架构有一个特别棒的特性:它不需要训练任何东西!完全依赖于现有的大模型和音频生成器。这就意味着,只要底层模型升级了,EchoVidia 的能力也能跟着水涨船高,具备很强的可扩展性。它把“理解指令”和“生成声音”这两个任务完全解耦开来,让专业的模型去做专业的事。

可控性与感知质量全面超越:实验结果深度解读

是骡子是马,拉出来遛遛。研究团队把 EchoVidia 和当前最先进的7个 VT2A 模型(包括 MMAudio, ThinkSound, AudioGenie, HunyuanVideo-Foley 等)在 EchoFoley-6k 数据集上做了一番比较。结果?用一句话总结就是:降维式打击。
自动评估和人类评估的详细数据,都汇总在下面这张表里了:
主要实验结果
表2:主要评估结果。包含可控性(TempCtl, TimbCtl, VolCtl)、音频质量(PQ, PC, CE, CU)以及人类评估(指令遵循,音画一致性,感知质量)。
自动评估指标上,EchoVidia 在三个可控性指标上全面碾压所有基线模型:时间可控性(TempCtl)达到了0.72,显著高于最强基线 HunyuanVideo-Foley-xxl 的0.43(高出67%);音色可控性(TimbCtl)更是高达0.78,比HunyuanVideo-Foley-xxl的0.48高出62%。甚至在音量可控性(VolCtl)这个相对“容易”的任务上,也取得了0.75的成绩,领先了9个点。
这些数字说明什么?说明其他模型对于“什么时候响”、“响什么内容”、“响多大”基本控制不住,而 EchoVidia 做到了。这个“40.7%的提升”在 CV/AI 领域是相当炸裂的,通常几个点的提升就够发顶会了。
人类评估的结果同样精彩。在“指令遵循”这项上,EchoVidia 获得了3.80分,而最强的基线HunyuanVideo-Foley-xl才2.60分。这说明,当人类听众评价时,他们明显感觉到 EchoVidia 生成的音频更“听话”,完美地执行了用户的指令。
下图更直观地揭示了之前所有模型的“通病”和 EchoVidia 的卓越之处:
视觉主导偏差
图4:各模型在指令遵循(x轴)与音画一致性(y轴)上的关系,揭示了视觉主导偏差。
可以看到,所有基线模型都集中在左上角区域:它们的音画一致性(A-V)很高(表明它们能很好地跟着画面走,该响就响),但指令遵循(Instr.)很低(说明它们根本不听人的话)。这就是前文所说的视觉主导(Visual Dominance)偏差。而 EchoVidia 则跳出了这个困境,稳稳地落在右上角,同时做到了高音画一致性和高指令遵循,完美解决了两者的矛盾。
再来看看组级控制的例子。指令是“让猫先喵喵叫,然后嘶嘶叫,再在击打时嘶嘶叫,展示情绪升级”。这种涉及到多事件、多轮次、且带情感变化的控制,对基线模型来说无异于天方夜谭。但 EchoFoley 做到了,它生成的音频完美呈现了猫的情绪变化过程。

更别提下面这个视频级的控制示例了:

指令是“为整个视频渲染未来科幻风格”。基线模型生成的音频要么和画面不搭,要么根本听不出“科幻”在哪。而 EchoVidia 生成的音频,从音色到节奏,都充满了浓浓的赛博朋克味道,完美诠释了创意控制。

未来展望:为多模态生成智能铺路

EchoFoley 和 EchoVidia 的出现,为 AI 在音视频生成领域打开了一扇新的大门。它证明了,未来的 AI 不应该只是一个“黑盒”——你输入一段视频,它给你一段声音,你猜它做了什么。未来的 AI 应该是可解释、可编辑、可交互的。
想象一下,这样的技术一旦成熟,会对视频创作者、游戏开发者、甚至是电影工业带来多大的冲击?
  • 短视频创作者:再也不用花几个小时在海量音效库中翻找素材了。直接输入指令,AI 就能根据视频画面和你故事板上的描述,秒速生成符合剧情、情绪和节奏的完美音轨。
  • 游戏开发者:可以设计出动态的声音环境。玩家在游戏中的每一个操作(比如点燃火把、推开石门),都会“唤醒”一个独特的发声事件,游戏音频不再是循环播放的音效,而是随玩家行动实时生成的。
  • 无障碍传播:自动为无声电影或有视障人士参与的在线课程生成内容丰富、与情节高度同步的“口述影像”音轨。
当然,EchoFoley 也并非已经完美无缺。目前最明显的挑战在于,它的能力上限高度依赖于底层 VideoLLM 和音频生成模型的能力。如果 VideoLLM 在特定场景下的推理错误(比如把赛车的引擎声误判为雨水声),那最终生成的音频也会跟着出错。而且,当前的 EchoFoley-6k 数据集虽然质量很高,但覆盖的场景和声音类型仍然有限,比如对极端天气、或者极其微妙的氛围音的处理,可能还有待提升。
但瑕不掩瑜,EchoFoley 的方向完全正确。它告诉我们,通往通用人工智能的路上,不仅需要模型“看到”世界,更需要它们能“听到”世界,并且按照人类的意愿去“创造”声音。这或许就是未来多模态生成智能发展的基石。
资源链接:
论文地址:https://arxiv.org/pdf/2512.24731.pdf
项目主页:https://echofoley.github.io/

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

问题1:EchoFoley 和 EchoVidia 这两个名字分别指什么?他们之间是什么关系?
EchoFoley 是一个任务和基准(Benchmark)的名称。它定义了“事件级层次控制”这个新范式,并提供了 EchoFoley-6k 数据集和评估指标来支撑研究。而 EchoVidia 是一种具体的、无需训练的方法(Method),专门设计用来解决 EchoFoley 任务。所以简单来说,EchoFoley 是“考纲和题库”,EchoVidia 是“解题高手”。

问题2:文中所说的“无需训练(training-free)”是什么意思?意味着这个方法可以零成本部署吗?
“无需训练”意味着 EchoVidia 在应用时不需要重新微调或训练任何神经网络权重。它直接调用已有的、预训练好的大模型(如 Gemini 2.5 Pro 作为“大脑”进行推理)和现成的音频生成器(如 MMAudio 作为“手”进行合成)。但这不等于零成本,因为它需要调用外部API或运行大型模型,仍然会产生推理(计算)成本,而且在设计和编排流程(Prompt Engineering)上也需要一些前期的适应性开发工作。

问题3:未来这个方向可能面临的最大瓶颈是什么?
最大的瓶颈可能不在于“音效生成”本身,而在于“事件理解和规划”。EchoVidia 当前的成功很大程度上依赖于 VideoLLM 能精确地检测和定位时空中的发声事件。如果 VideoLLM 在处理非常复杂、混乱或长视频场景时出错(比如它无法分辨密集的雨滴声和远处的枪声),那后续的生成计划必然也会出错。其次,音频生成器的能力和多样性也是限制因素,你无法让一个只能生成16kHz音质音频的模型去生成高保真的环绕立体声。所以,这个方向的发展需要大语言模型、音频生成模型和交互式系统设计三方面协同进步。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性:★★★★★

这项工作的核心创新在于“任务定义”本身。首次将视频音效生成从粗糙的视频级控制推进到层级化、事件级的精细控制,并创造性地通过符号化表示和智能体架构来解决该问题,这直接开创了一个新的研究方向。

实验合理度:★★★★☆

实验设计非常严谨,涵盖了自动指标、人类评估、消融实验以及对现有模型的系统性诊断。对比的基线模型都是当前最强的,且定性分析了其“失败模式”,说服力强。唯一的小扣分点是,如果能针对EchoVidia 的不同组件(如不同的 VideoLLM)再做更细致的模块级对比,说服力会更上一层楼。

学术研究价值:★★★★★

极高。不仅仅提供了一个高水平的基准和数据集,更重要的是提出了一个新的学术问题定义,这往往比一个算法创新更值得尊敬。它为“可控内容生成”这个子领域注入了新的活力,极有可能激发大量后续工作。

稳定性:★★★☆☆

EchoVidia 的稳定性高度依赖于底层推理模型的稳定性,以及高层规划与底层生成模型之间的配合。如果底层API出现故障或回复格式不符合预期,整个管线可能中断。在非受控环境下,可能会出现偶发性的逻辑错误或执行偏差。

适应性以及泛化能力:★★★★☆

“无需训练”的架构设计使其具有很强的适应性。只要更换底层的推理模型和音频生成器,理论上就能适配不同的任务或音效类型。数据集涵盖了14个主题,具有较好的泛化基础。但对极其罕见的场景(如反物质湮灭的声音)或者非视觉驱动的音效控制,泛化能力还有待验证。

硬件需求及成本:★★★☆☆

尽管是训练-free,但推理成本依然较高。它需要同时运行一个大型多模态模型(如 Gemini 2.5 Pro)和一个端到端音频扩散模型,对于个人开发者或小团队来说,基于云API的调用成本不菲。要想在普通消费级显卡上本地部署,几乎不可能。

复现难度:★★☆☆☆

复现难度很高。首先,它依赖的底层模型(如 Gemini)可能是闭源的商业API,需要通过API调用。其次,它需要强大的专家标注团队来构建类似的高质量数据集(EchoFoley-6k的构建流程极其复杂)。对普通研究者来说,直接复现所有实验结果是非常困难的。

产品化成熟度:★★★☆☆

有潜力,但还未成熟到能直接嵌入到产品中。最大的障碍是稳定性和成本。同时,对于生成音频的上下文理解、情感引导和音画对齐,偶尔还会出现偏差。作为一种“AI辅助工具”或在专业创作者的工作流中作为中间环节非常有价值,但离消费者一键生成高质量完美音效的“傻瓜式”产品还有距离。

可能的问题: 虽然结果很亮眼,但EchoVidia本质上是一个将多个复杂模块(Plan + Execute)串联的系统。这种系统天然存在错误累积(Error Accumulation)的问题。另外,论文对于“复杂性控制”的讨论还不够充分,如何应对用户编写复杂、带有矛盾限制条件的指令,目前还没有给出很好的答案。


主要参考文献

[1] EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation, arXiv 2025.
[2] MMAudio: Multi-modal generation for creating fluent and coherent audio from text and video.
[3] HunyuanVideo-Foley: A large-scale, high-performance audio generation model from Tencent.
[4] VGGSound: A large-scale audio-visual dataset from YouTube videos.
[5] ThinkSound: Grounded audio generation with event-centric reasoning.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
看完EchoFoley,是不是也想让自家视频有自己的'导演级'音效?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。