← 返回 PaperDaily 视觉与图像

ACM MM 2026:让AI"听声作画"不再是玄学!中科大联合电信AI构建32.3万高质量数据集

音频生成图像终于有了像样的"教材"!中科大联合电信AI研究院打造的A2I-Set数据集,32.3万组高质量三元组,配合FAT-Fusion的AudioCanvas模型,让"听声作画"不再是鸡同鸭讲。数据开源的诚意之作,值得细品。

ACM MM 2026:让AI"听声作画"不再是玄学!中科大联合电信AI构建32.3万高质量数据集
原论文信息如下:
论文标题:
Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework
发表日期:
2026年08月
发表单位:
中国科学技术大学、中国电信人工智能研究院(TeleAI)、西北工业大学
原文链接:
https://arxiv.org/pdf/2608.09529v1.pdf
开源代码链接:
https://github.com/gdx012/A2I-Generation

想象一下:你随手录下一段音频——清晨的鸟鸣或街头艺人的吉他,AI就能根据这段声音创作出匹配的画面。这不是科幻,而是音频到图像生成(A2I)任务。近年来,文本到图像(T2I)生成已卷出天际,但一旦输入换成音频,画风突变——生成质量断崖式下跌,常常是"听了个寂寞,画了个鬼畜"。
为什么?龙哥觉得,核心症结在于数据。传统音频-图像数据集,要么只有粗粒度类别标签,要么是从视频随手抽帧,画质和匹配度一言难尽。这就好比让画家听着含糊描述作画,画出来的东西当然不敢恭维。更扎心的是,即便拿最先进的开源T2I模型微调,低质量数据也能把模型带沟里去。这届A2I研究,属实被数据卡住了脖子。

音频到图像生成:为何一直"听"不懂"画"?

要理解这篇论文的价值,得先弄明白A2I领域卡在哪儿。当前主流做法有两种:一种是把音频特征映射成文本token,再喂给T2I模型,代表是AudioToken和GlueGen;另一种是端到端路线,用IP-Adapter这类模块把音频嵌入直接注入扩散模型,比如MACS。
但这两条路都有硬伤。前者的音频-文本对齐是"二手"的,音频里的细微情绪和声场信息在转换中大量丢失,生成图片常跟音频"各说各话"。后者虽然端到端,可训练数据质量拉胯——从AudioSet和VGGSound直接抽帧,视频分辨率参差不齐,抽出的帧还不一定跟音频对得上。更别提这些数据集动辄上百万条,混杂大量噪声标注,模型越训越"糊涂"。
之前也有研究尝试用声音定位模型提取视频中发声物体的帧,但这类模型在跨域数据上泛化能力几乎为零。说到底,A2I的本质瓶颈不是模型不够强,而是缺少"音频-图像"高质量配对数据。就像学画画,老师给不了好素材,学生再努力也白搭。
正是看到这个痛点,来自中国科学技术大学和电信AI研究院的研究团队在ACM MM 2026发表论文,端出两大杀器:大规模高质量三模态数据集A2I-Set,以及基于该数据集训练的高效A2I生成模型AudioCanvas。论文标题《Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework》听着学术,内核非常实在——先解决数据问题,再解决模型问题。
图1:A2I-Set的一些示例。A2I-Set包含详细的音频描述以及配对的视觉生成指令。得益于严格的过滤策略和强大的T2I模型,图像在视觉效果和音画对齐方面都很出色。
A2I-Set的一些示例。得益于严格的过滤策略和强大的T2I模型,图像在视觉效果和音画对齐方面都很出色。

三大痛点:数据稀缺、对齐困难、质量低下

在正式介绍A2I-Set之前,先聊聊现在A2I领域绕不开的三个坑,这也是论文里花了大量篇幅剖析的问题。
痛点一:数据稀缺。现有的公开数据集,要么是纯图像数据集根本不含音频,要么是像AudioSet和VGGSound这样以音频为主、视频只是"附带品"的数据库。后者虽然数据量大,但视频质量不在筛选标准之内,抽出来的帧分辨率感人,画面抖动更是家常便饭。这导致A2I训练长期处于"营养不良"状态。
痛点二:对齐困难。从视频中抽帧是个技术活。视频里发声物体出现的时刻和音频中的声音并不总是同步,随机抽帧基本靠运气。就算用上声音定位模型,这类模型在特定域内表现不错,一旦面对野外各种嘈杂数据就麻爪。结果是音频与图像之间的"貌合神离"成了常态。
痛点三:质量低下。数据质量直接决定了微调效果的上限。把低分辨率、模糊、带噪的图像喂给SD这类强大的T2I模型做微调,模型的美学先验会被迅速污染,生成出来的图像质量断崖式下跌。这也是为什么很多研究者发现,直接用音频替换文本输入到T2I模型里,效果总是不尽如人意。
这三个痛点环环相扣,互为因果,不打破这个死循环,A2I就只能永远在"玩具级"水平打转。

A2I-Set:323K高质量三模态数据集是如何炼成的?

既然市面上的数据不给力,那就自己动手丰衣足食。A2I-Set的构建思路很清晰:从源头把控数据质量,并利用AI模型进行多级过滤。整个流程分为视觉增强音频描述、真实图像提取、合成图像生成和音频-图像对齐过滤四个阶段。
图2:A2I-Set数据集合成流程概述,其中使用了多种可靠的模型进行标注、过滤、生成和评估。人工专家参与确保数据质量。
图2:A2I-Set数据集合成流程概述,其中使用了多种可靠的模型进行标注、过滤、生成和评估。人工专家参与确保数据质量。
第一阶段:视觉增强音频描述。研究团队从AudioSet和VGGSound中收集了约110万条有效音频。先对音频做时长、静音比例和信噪比的三重过滤,然后分别用Qwen2-Audio-7B和PLLaVA为音频和视频生成描述。关键一步来了:用GPT-4o-mini把视频描述和音频描述融合成"带有视觉线索的音频描述"——这能显著缓解纯音频描述模型的幻觉问题。接着用CLAP模型计算音频与文本描述的相似度,过滤掉约40%的低匹配度数据。这个步骤很像给每个音频"配眼镜"——把视觉信息补进来,让音频描述看得更清。
第二阶段:真实图像提取。仅依赖音频描述还不够,图像质量必须单独把关。原始视频先经过分辨率过滤(不低于540×360)和帧率过滤(不低于12fps),再通过光流法检测抖动以剔除画面不稳的视频,然后用TransNet V2做镜头分割并提取每个场景的中间帧,最后用图像质量评估模型ARNIQA打分,低于0.4的直接淘汰。
第三阶段:合成图像生成。从视频里提取真实帧的产量太低,近百万合格候选帧最终只留下约10万张。为了扩充数据量,研究团队想到用FLUX.1-Krea-dev这个强大的开源T2I模型来"造"图。但直接拿音频描述生成的效果不佳,为此先用GPT-4o-mini把音频描述转化成专业的绘图指令,加入主体识别、视觉描述、氛围感知、色彩和构图等要素。生成的图像还得过质检关——由Qwen2.5-VL-72B和GLM-4.5V两个视觉大模型双重审核,只有两者都判定为"真实照片风格"才能通过,通过率仅10%~20%。这个阶段的烧钱程度,估计让研究团队的GPU都忍不住颤抖。最终收获了约19.4万张1024×1024的高质量合成图。
第四阶段:音频-图像对齐过滤。有了图还得验证图跟音频是不是真的对得上。研究团队祭出了Sam Audio做音频的物体级分离,用RMS能量检测确认物体确实在发声,然后用Qwen3-VL-Flash和Ground DINO分别做视觉定位,确保物体在画面中也存在。经过这层"安检",最终得到32.3万组高质量三元组。
图4:A2I-Set中音频声音来源数量的比例。A2I-Set的声音来源比例较均匀。图5:A2I-Set与其他几个音视频相关数据集的对比。
图4:A2I-Set中音频声音来源数量的比例。图5:A2I-Set与其他几个音视频相关数据集的对比。
最终的数据集覆盖了241个音频类别,包含音乐、语音、自然声等多个大类,远超Landscape、Greatest Hits这些单一领域的小数据集。从图5可以看到,A2I-Set在数据规模和类别数量上具有显著优势,而且训练集中不同声源数量的分布相当均匀,兼顾了单一声源和混合声源的训练需求——这一点比一味追求"干净"单声源数据的思路要务实得多,也更贴近真实世界的音频构成。
图3:A2I-Set训练集中不同类别音频的比例。
图3:A2I-Set训练集中不同类别音频的比例。

AudioCanvas:FAT-Fusion让音频"画"出心声

数据这块硬骨头啃下来了,接下来是在高质量数据上训练一个靠谱的A2I模型。论文提出的AudioCanvas,设计思路很务实:不重新发明轮子,而是把成熟T2I模型(Stable Diffusion 1.4)变成"画师",自己只训练两个关键模块——预对齐音频投影器和FAT-Fusion模块。
图6:AudioCanvas音频到图像生成架构总览
图6:音频到图像生成架构AudioCanvas总览。音频特征通过FAT-Fusion注入扩散模型,训练和推理时文本输入保持为空,只有少量模块参与训练,骨干网络完全冻结。
预对齐音频投影器要解决的问题是:怎么把音频特征翻译成扩散模型能理解的语言?论文的思路是借力CLIP。CLIP已经建立了文本-图像联合空间,如果能让音频特征也"住进"这个空间,扩散模型就能像处理文本一样处理音频了。具体做法是:用CLAP提取多层音频特征,过MLP统一维度后拼接,送入一个带可学习查询的投影器,输出一个聚合音频表示。训练时用同一物体类别对应的文本特征作为监督信号。
A2I任务定义公式
训练目标由两部分组成:MSE损失让音频特征直接逼近对应文本特征,InfoNCE损失再把同类别音频作为正样本、不同类别作为负样本拉近。总损失是MSE + 0.2 × InfoNCE。这样训练出来的音频投影器,输出的特征在CLIP空间里能跟文本"对得上话"。
接下来是论文的核心创新:FAT-Fusion(FiLM加权的音频-文本融合)。它借鉴了IP-Adapter的解耦交叉注意力设计,在UNet的每个交叉注意力层旁边新增一条音频注意力分支。音频特征和文本特征各自与图像潜变量做注意力计算,得到Z_a和Z_t。但拿到这两个特征之后,论文没有简单相加,而是引入了FiLM机制:先让每个分支各自预测一组通道维度的缩放系数γ和偏移系数β,再对Z_a和Z_t做调制,最后按权重α融合得到新的潜变量Z_new。推理时α取0.5,让文本和音频各占一半"话语权"。
InfoNCE损失公式 MSE损失公式 总损失公式
这里的调制过程可以理解为:每个通道都学了一个"音量旋钮",文本分支和音频分支各自调节自己信息的强弱,而不是一刀切地平均。这种通道级动态调制,比直接相加更灵活,让模型能在不同频段、不同语义细节上决定听谁的。
还有一个很反常识的设计:训练时文本输入始终为空。为什么?因为推理时只有音频,没有文本。如果训练时给文本条件,模型就会学会"偷懒"——依赖那个更丰富、更容易理解的文本信息,而不是费劲去理解音频。把文本置空,等于逼着UNet把音频当作唯一的信息来源。同时,训练时以10%的概率随机丢弃音频条件,这样推理时就能使用无分类器引导,让生成结果在风格稳定性和音频对齐度之间取得平衡。
音频交叉注意力公式 FiLM调制系数公式 加权融合公式
AudioCanvas的训练目标与原始Stable Diffusion一致,都是预测噪声的L2损失。训练分两阶段:先在A2I-Set的合成图像部分训练25轮,让模型学到高质量美学先验;再在全量数据集上训练45轮。整个训练在8张H100上完成。

实验结果:全面超越,但仍有局限

数据集和模型都齐了,接下来是效果检验。论文在自建A2I-eval(混合声源,3280对专家标注)和Landscape(单一声源外部数据集,9类1000段视频)两个测试集上做了全面对比。评价指标覆盖三方面:生成图像视觉质量(FID、IS)、多模态对齐质量(CLAP Score)、以及人类偏好分数HPSv3。
表1:A2I-eval(混合声源)上的性能对比
表1:A2I-eval(混合声源)上的性能对比。最优结果加粗,次优加下划线。
表2:Landscape(单一声源)上的性能对比
表2:Landscape(单一声源)上的性能对比。最优结果加粗,次优加下划线。
从论文报告的结果看,AudioCanvas在两个测试集的大多数指标上都优于现有的A2I方法,尤其在FID和HPSv3上优势明显。这说明高质量数据+针对性注入模块的组合拳确实有效。不过也要提醒一句:不同方法使用的额外训练数据规模差异很大,有的方法甚至用了近百万量级的外部数据,所以指标绝对值只能作为参考,不能简单拉平排名。
图13:不同模型在A2I-eval和Landscape上的生成结果对比
图13:不同模型在A2I-eval和Landscape上的生成结果对比。AudioCanvas生成的图像在主体还原和场景合理性上更胜一筹。
消融实验也验证了每个组件都不可少:去掉预对齐音频投影器,音频特征和扩散模型之间"语言不通",FID明显变差;去掉FAT-Fusion的FiLM调制,简单地把文本和音频注意力输出相加,生成图像的对齐度也有所下降。
表3:AudioCanvas不同设置或模型组件的消融对比
表3:AudioCanvas在A2I-eval上不同设置或模型组件的消融对比。
图14:AudioCanvas生成的更多结果
图14:AudioCanvas生成的更多结果,可以看到对声源主体、环境氛围的还原都比较到位。
当然,论文也不回避失败案例。在复杂多声源场景、罕见物体或抽象声音上,AudioCanvas偶尔会"翻车":肢体数量画错、图像质量退化、主体遗漏等。
图15:一些失败的生成案例
图15:一些失败的生成案例,包括肢体数量错误和图像质量退化等问题。
此外,附录还在SD2和SD-XL上做了验证实验,用A2I-balanced子集微调后,两个更强底模同样能生成质量不错的音频条件图像,说明数据集和FAT-Fusion的迁移能力经得起检验。
图16:在A2I-balanced上微调SD2的测试结果
图16:在A2I-balanced上微调SD2的测试结果。

未来展望:从"听得懂"到"画得美"

A2I-Set目前主要覆盖真实照片风格的图像,这更多是出于数据质量和计算资源的权衡。未来如果把数据集的风格维度扩展开来,比如加入插画、油画、动漫等风格,A2I模型就有可能真正进入创意设计领域。论文附录里SD2和SD-XL的初步实验已经表明,数据集的迁移能力是有的,换个底模照样能跑。
落到真实场景里,这项技术的想象空间不小:音乐可视化工具可以把一段旋律变成一幅画,辅助音乐人寻找灵感;有声小说或播客平台可以用音频自动生成封面插图;影视前期的分镜师可以用一段环境音快速画出场景草图;甚至可以帮助听觉障碍人士"看到"声音里的画面。当然,每个新方向都有坑——数据版权问题、生成内容与真实场景的伦理风险、以及模型对训练集场景的过度依赖,都需要后续工作一步步解决。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?音频生成图像一直受制于低质量数据集。中科大与电信AI研究院提出A2I-Set,包含32.3万组音频-图像-文本三元组,并推出AudioCanvas模型,用FAT-Fusion实现高表现力与跨模态对齐的"听声作画"。
这篇工作最值得看的点是什么?在A2I-eval上,AudioCanvas在IS、Aes、HPSv3、AIS、TIS指标上均取得最优或次优结果,FID排名第二;在Landscape上,Aes和HPSv3取得最优,TIS排名第二。整体表现优于使用更大规模训练数据的CoDi模型。
这篇工作的边界或风险在哪里?优点:(1) 构建了大规模高质量的三模态数据集,填补了音频-图像配对数据缺乏的空白;(2) 提出了完整的数据合成pipeline,包括多阶段过滤和人工审核;(3) FAT-Fusion模块设计合理,通过FiLM机制实现音频和文本特征的灵活融合;(4) 实验验证了数据集质量和方法的有效性。缺点:(1) 依赖多个大型模型(GPT-4o-mini、FLUX.1等),数据构建成本高;(2) 合成图像占比过高(约60%),可能存在风格偏差;(3) 仅使用SD 1.4作为骨干,未充分探索更强骨干的效果;(4) 在Landscape数据集上FID和IS表现不佳,泛化能力有待提升。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

构建大规模高质量音频-图像-文本三模态数据集A2I-Set,并基于该数据集微调Stable Diffusion模型,提出FiLM-weighted Audio-Text Fusion (FAT-Fusion)模块实现音频条件注入,实现高表现。

实验合理度:★★★★☆

FID、IS、Aesthetic score (Aes)、HPSv3、Audio-Image Similarity (AIS)、Text-Image Similarity (TIS)。

学术研究价值:★★★★☆

构建大规模高质量音频-图像-文本三模态数据集A2I-Set,并基于该数据集微调Stable Diffusion模型,提出FiLM-weighted Audio-Text Fusion (FAT-Fus。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

训练在8张H100 GPU上进行,共70个epoch(25个epoch在合成数据上+45个epoch在全量数据上),推理时使用30步去噪。

复现难度:★★★☆☆

https://github.com/gdx012/A2I-Generation

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:(1) 依赖多个大型模型(GPT-4o-mini、FLUX.

主要参考文献

[1] Ge D, Liu S, Gong C, et al. Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework. ACM MM 2026.
[2] A2I-Set数据集与代码: https://github.com/gdx012/A2I-Generation
[3] Gemmeke J F, Ellis D P W, Freedman D, et al. Audio Set: An ontology and human-labeled dataset for audio events. ICASSP 2017.
[4] Chen H, Xie W, Vedaldi A, et al. VGGSound: A large-scale audio-visual dataset. ICASSP 2020.
[5] Wu Y, Chen K, Zhang T, et al. Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation. ICASSP 2023 (CLAP).
[6] Ye H, Zhang J, Liu S, et al. IP-Adapter: Text compatible image prompt adapter for text-to-image diffusion models. 2023.
[7] Sun P, et al. MACS: Multi-source audio-to-image generation with two-stage decoupling and IP-Adapter. 2025.

融会贯通

结合PaperDaily已收录论文可以观察到,当前A2I生成领域的竞争点正从"能画出东西"转向"画得准、画得真实",而A2I-Set把训练数据的规模和质量都拉高了一个台阶,这会让后续研究少走很多弯路。需要说明的是,受限于PaperDaily中可检索到的同基准结果有限,且各方法在训练数据构成、评估协议上存在明显差异,这里只能作为相对参考,不宜据此直接得出"全面超越"的绝对结论。
从方法论层面看,"高质量数据集+差异化注入模块"这套组合拳值得借鉴。A2I最大的成本不在模型训练,而在数据构建;谁先把数据问题解决好,谁就掌握了主动权。未来如果能把A2I-Set的构建模式移植到更多音频领域,比如音效设计、音乐可视化、影视前期预演,价值还会进一步放大。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
听声作画靠数据,想进群聊就扫码去!🎨 龙哥读论文粉丝群持续纳新,添加龙哥助手微信号:kangjinlonghelper,备注研究方向+地点+学校/公司+昵称,比如"音频生成+上海+中科大+龙哥",更快被通过哦!群里已有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5大阵地,等你来撩~
wechat_helper dianzan

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。