← 返回 PaperDaily
大模型与智能体
IWSLT 2026实战:30秒切分稳住长语音
这篇是 IWSLT 2026 指令跟随赛道的实战型提交,重点不在“花活”,而在“怎么把长语音稳稳切开、别让模型开始胡说八道”。固定 30 秒切分拿到最优 HIFS,幻觉还主要是重复插入,结论很接地气。
龙哥读论文
发布于 2026-08-15 00:20:09
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇是 IWSLT 2026 指令跟随赛道的实战型提交,重点不在“花活”,而在“怎么把长语音稳稳切开、别让模型开始胡说八道”。固定 30 秒切分拿到最优 HIFS,幻觉还主要是重复插入,结论很接地气。
原论文信息如下:
IWSLT 2026挑战:语音指令跟随的“长短”难题
语音大模型这几年很热,但真正把它拉到“听懂指令再干活”的赛道上,难度立刻就上来了。原因很简单:文本指令跟随 已经够折腾了,换成语音输入后,还得先把声音变成模型能吃的表示,再让大模型老老实实按要求输出。短语音还好,长语音一来,模型就容易开始“走神”:上下文太长、显存压力变大、切分方式稍不合适,输出里还可能冒出重复、插话、瞎编等经典幻觉症状。
这篇论文对应的是 IWSLT 2026 的 Instruction Following 共享任务,分成短句和长句两条线。短句赛道看的是 ASR、ST、SQA 等基础能力;长句赛道则更狠,不但任务更多,还要求系统能处理更长的音频,并对 SSUM 和 ACHAP 这类生成任务保持稳定。这里的 ASR 是 Automatic Speech Recognition,中文是自动语音识别;ST 是 Speech Translation,语音翻译;SQA 是 Spoken Question Answering,语音问答;SSUM 是 Speech Summarization,语音总结;ACHAP 是 Audio Chaptering,音频章节切分。名字看着像一串字母汤,实际都是在考验模型:听懂、翻译、回答、总结、分段,一个都不能少。
长语音最烦人的地方,不是“长”,而是“长了以后还得稳定”。一旦模型开始胡乱重复,分数会像坐滑梯一样往下掉。
FBK的SpeechLLM解决方案:融合两大基石模型
这篇工作走的是很典型、也很务实的一条路:语音编码器 + 模态适配器 + 大语言模型解码器 。其中语音侧用的是 SEAMLESSM4T-V2-LARGE ,文本侧用的是 QWEN3-4B-INSTRUCT 。前者擅长把音频压成高质量语音表示,后者擅长按指令生成答案。合起来,就像一个耳朵特别灵、一个嘴特别会说,中间再安排一个“翻译官”把两边接起来。
语音编码器部分先把 16kHz 波形转成 80 维 log-Mel 频谱,再通过步幅下采样把时间分辨率降到 50Hz,随后进入 Conformer 编码器。Conformer 的好处很朴素:既能看全局依赖,又能照顾局部声学结构,属于“既要又要还要”的代表选手。这里的 Conformer 可以理解为卷积和 transformer 的混血儿,前者管局部,后者管长程,搭配起来比较适合语音这种又连续又有节奏的信号。
真正的“桥梁”是模态适配器。它先做时间压缩,把 50Hz 的语音表示通过带卷积和门控单元的结构压到大约 6.25Hz,再用线性层投影到语言模型的输入维度 2560。这个设计的本质很直接:把一长串语音 token 缩短成大模型更能消化的长度 ,不然长语音一进来,解码器上下文窗口先被撑爆,后面的推理就容易开始“喘”。
训练上,论文没有搞什么花里胡哨的全参大改,而是采用参数高效微调。总参数约 4.73B,但真正训练的是 1.122 亿参数,LoRA 被挂在 query、key、output 投影上。LoRA 的全称是 Low-Rank Adaptation ,中文叫低秩适配,意思是不用把整座大楼重装修,只在关键位置加几个“外挂模块”就能把模型拧到任务上。对于比赛提交来说,这种方式很实在:成本更低,调参也更可控。
长语音处理的“分而治之”策略:三大分割方法对决
长语音不是简单把短语音拉长就完事了。模型训练时大多见的是短样本,推理时突然来一段几分钟甚至更长的音频,等于让一个习惯背单词的学生去现场写作文。于是论文重点比较了三种切分方式:固定窗口、基于 CRDNN 的语音活动检测,以及混合切分。
固定窗口最朴素,就是按 15、30、45、60 秒切成连续不重叠片段。它的优点是稳定、可控、好复现;缺点也明显,太短会丢上下文,太长又会增加截断和生成不稳的风险。CRDNN 切分则更像“按呼吸停顿切”,利用语音活动检测去找说话片段边界。CRDNN 的全称是 Convolutional Recurrent Deep Neural Network ,中文可译为卷积循环深度神经网络。它的思路是:哪里像在说话,哪里像停顿,就在那里切一刀。不过现实往往比理想粗糙,语音活动检测参数一旦不合适,就容易把一段连续语义切得七零八落。
混合策略则是把固定窗口和基于停顿的切分揉在一起,思路有点像“先按大框架切,再在超长片段里找最自然的断点”。论文里还给出了一个 divide-and-conquer 版本:如果当前片段超过最大长度,就在其中找最长停顿,递归切开。这个方法听上去很像数学题里的“分而治之”,但放到语音上其实很合理——长片段里总有几个停顿点,抓住它们,往往比硬切更自然。
结果很直白:30 秒固定窗口 是最稳的。它的优势不是某一项分数特别离谱,而是整体平衡得最好。15 秒窗口虽然更短、更保守,但上下文不够;45 秒和 60 秒窗口又容易让模型承担过长片段,生成开始不稳定。30 秒刚好卡在“既保留足够上下文,又不至于把模型压到喘不过气”的中间地带,属于很典型的工程最优解。说白了,模型不是越喂越多越好,喂太撑了也会出事。🤨
警惕“幻觉”陷阱:HIFS评估指标与实验结果深度解读
长语音任务里,最麻烦的不是“答错一点”,而是“开始乱说”。论文专门引入了 HIFS ,也就是 Hallucination-Penalized Instruction-Following Score,中文可译为“幻觉惩罚指令跟随分数”。它的核心思想很朴素:如果模型输出里有明显幻觉,就别装作没看见,得扣分。
从表2可以看出,幻觉最主要的破坏方式不是“整句胡编”,而是重复插入 。也就是说,模型不是完全失忆,而是开始反复复读同一句,像卡带一样。对于 ASR 来说,这会让 WER 飙升;对于 SSUM 来说,重复内容会把摘要变成“车轱辘话”;ST 和 SQA 也会受影响,只是程度没有那么夸张。论文里还做了带幻觉和不带幻觉的对比,结果很清楚:一旦把这些重复输出算进去,分数会明显掉一截,尤其是 CRDNN 切分下更明显。
这个发现其实挺重要。很多人一提幻觉,脑子里想到的是模型一本正经地胡说八道;但在这篇工作里,最常见的反而是“重复性插入”。这对后处理很关键,因为它意味着可以用比较简单的规则清理一部分坏输出,而不一定非要上特别复杂的纠错模型。论文也提到借鉴前人做法,使用基于正则表达式的后编辑去删掉这些重复片段,至少让评测结果更可信。
短句能力的“守”与“长句能力的“攻”
这篇论文最有意思的地方之一,是它没有只盯着长句赛道“打怪升级”,还回头看了短句能力有没有被拖累。结果显示,长句系统在短句任务上依然保持了相当的竞争力,但相比专门训练的短句系统,还是有一点下降。原因也不难理解:长句训练为了覆盖更长音频,训练数据换成了更偏长格式的组合,短句的细粒度监督自然少了一些。
从提交策略看,短句主系统和长句对照系统是分开的:短句侧追求综合最优,长句侧则用相同骨架继续扩展到更长音频。论文的结论很克制:长句扩展可以保住大部分短句能力 ,但并不意味着“一套模型走天下”已经完全解决。尤其在长语音场景里,切分方式、幻觉控制和训练数据覆盖度,还是决定成败的三根支柱。
如果把这篇工作当成一次比赛复盘,它的思路其实挺清楚:先用强基座模型搭起可用系统,再用适度微调把短句能力打稳,最后针对长句最容易翻车的地方——切分和幻觉——做针对性处理。没有试图发明一个全新宇宙,但把“能跑、稳跑、少翻车”这三件事做得比较扎实。对于 shared task 来说,这种风格往往比花里胡哨更有用。👍
总结与未来展望:迈向更鲁棒的语音指令跟随
这篇论文的价值,不在于“单项分数炸裂”,而在于它把长语音指令跟随里最现实的几个坑都摆到了台面上:长输入怎么切、幻觉怎么判、短句能力怎么保 。在 constrained setting 下,这样的系统设计已经很有代表性:基座模型成熟、训练策略务实、评估指标也开始考虑幻觉惩罚,整体路线比较完整。
不过它的局限也很明显。长句训练只完成了一个 epoch,时间和算力都比较紧;长语音任务对切分策略很敏感,说明当前方法对输入形式仍然有依赖;而幻觉处理目前更多还是后编辑和评测层面的修补,离“从根上不胡说”还有距离。未来如果能把分割、生成和幻觉抑制做成更统一的训练目标,长语音系统的稳定性会更上一层楼。
从工程角度看,这篇工作也给后续系统留了几个很实用的启发:第一,固定 30 秒切分 这种朴素方案有时比复杂自适应切分更稳;第二,长语音评测里最好把幻觉单独拎出来,不然分数会被“重复废话”污染;第三,参数高效微调在共享任务里依然非常香,尤其适合在大模型基座上快速做任务适配。说到底,比赛不是比谁想法最玄,而是比谁能把系统调到最少翻车。
龙迷三问
这篇论文主要解决什么问题? 它解决的是语音指令跟随在短句和长句场景下如何同时做得稳的问题。短句侧看基础能力,长句侧看切分、幻觉和长上下文鲁棒性,核心就是别让模型一听长了就开始胡来。
HIFS 和 SIFS 分别是什么意思? SIFS 是短句指令跟随总分,把 ASR、ST、SQA 等任务的成绩加总;HIFS 则是在此基础上加入幻觉惩罚,特别适合长语音,因为长音频最怕输出里冒出重复插入这类“废话型幻觉”。
为什么 30 秒固定切分反而最好? 因为它在上下文保留和生成稳定之间找到了比较好的平衡。太短,信息不够;太长,模型压力太大。30 秒不算玄学,更像是把模型“喂到八分饱”的工程最优点。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★☆☆
创新点主要在长短语音统一建模、切分策略比较和幻觉惩罚评测上,方法本身偏工程整合,但针对 shared task 很实用。
实验合理度: ★★★★☆
对固定窗口、CRDNN、混合策略做了系统比较,还单独分析了幻觉影响,实验设计比较贴近长语音实际问题。
学术研究价值: ★★★☆☆
对长语音 SpeechLLM 的评估和切分问题有参考意义,尤其是把幻觉纳入指标后,更适合后续研究沿着这个方向继续做。
稳定性: ★★★☆☆
短句表现较稳,长句在固定切分下也能跑出不错结果,但对分割策略和训练时长仍然敏感,离“随便丢长音频都稳”还有距离。
适应性以及泛化能力: ★★★☆☆
对多任务、多语言有一定适应性,但长语音泛化仍依赖切分和数据构造,换场景后未必还能保持同样表现。
硬件需求及成本: ★★☆☆☆
4 张 A100 64GB 跑两到三天,成本不低。好在只训练部分参数,不然预算会更肉疼。
复现难度: ★★★☆☆
基座模型、数据处理和切分策略都比较明确,但完整复现仍需要较强算力和任务数据准备能力,不算轻松。
产品化成熟度: ★★★☆☆
短句场景更接近可用,长句场景还需要更稳的幻觉抑制和切分策略,适合先做受控场景落地。
可能的问题: 长句训练不够充分,幻觉处理偏后置,且切分策略对结果影响较大,说明系统鲁棒性还有提升空间。
主要参考文献
Zhihang Xie, Marco Gaido, Sara Papi, Matteo Negri, Luisa Bentivogli. FBK’s Long-form SpeechLLMs for IWSLT 2026 Instruction Following. arXiv:2606.26819v1, 2026.
Barrault et al. SEAMLESSM4T-V2-LARGE. 2023.
Hu et al. LoRA: Low-Rank Adaptation of Large Language Models. 2021.
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群