ACM MM 2026:让AI"听声作画"不再是玄学!中科大联合电信AI构建32.3万高质量数据集
音频生成图像终于有了像样的"教材"!中科大联合电信AI研究院打造的A2I-Set数据集,32.3万组高质量三元组,配合FAT-Fusion的AudioCanvas模型,让"听声作画"不再是鸡同鸭讲。数据开源的诚意之作,值得细品。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
音频生成图像终于有了像样的"教材"!中科大联合电信AI研究院打造的A2I-Set数据集,32.3万组高质量三元组,配合FAT-Fusion的AudioCanvas模型,让"听声作画"不再是鸡同鸭讲。数据开源的诚意之作,值得细品。
看长视频最怕"看多少、看哪里"的选择困难。商汤这篇EVA直接用强化学习把"先规划再看片"的训练出来,多个长视频基准提升6-12%,视觉token还省得惊人。让AI学会"聪明地看",这个方向值得重点关注。
同样一个因果语言模型,不加回归头、不加策略头,只靠输出token就把三步收益预测和五ETF动态配置全干了;池化净夏普从1.394提到1.494,2025年多模态优势最猛。想看看语言模型怎么绕过"换任务就换头"的套路直接当金融决策接口?这篇值得一读。
城市道路的自动驾驶已经卷成红海,矿区这种“路不成路、灰比雾厚”的硬骨头却少有人啃。中科院团队让规划器学会区分“看得见的安全”与“看不见的风险”,碰撞率直降七成多,这波操作值得研究!
游戏行业离不开RGBA动画,但“先生成RGB再抠图”的老路子,一到半透明边缘就翻车。字节联合北大清华带来一个反直觉方案:既然alpha本身就是可见性信号,那干脆用它来跳过计算——用2.4K个游戏资产视频训练RGBA生成器,1.2倍提速,FVD 174.4,质量几乎无损。
这篇论文把图形感知领域的老底给掀了——四十年跑实验攒下来的编码排名,被一个彩虹色图的反转案例直接打脸。作者主张别再做无穷无尽的受试者实验,而是把可视化当作图像,用视觉计算模型来评估。用散点图相关性判断做验证,模型居然复现了人类感知曲线。想搞明白人到底怎么看图,这篇值得细读。
算法展开(Algorithm Unrolling)一直是可解释深度学习的招牌做法,把迭代优化变成可学习的网络。这篇论文却给这个招牌泼了一盆冷水:图拉普拉斯去噪器的展开网络,无论怎么学,都只是多项式图滤波器,而且可达集还是测度零的严格子集——值得所有做可解释深度学习的人看一眼。
医学影像里,插值和分割各干各的,就像分手后非要各自忙活,结果边界糊了、病灶漏了。这篇论文让两个任务在一套网络里双向打配合,四个数据集上插值PSNR最高涨1.67dB、分割Dice最高涨2.9个百分点,推理还省了一半时间,临床落地够实在。
分类任务的学霸,放到推荐系统里可能就成了学渣,这事儿你敢信?澳洲高校团队把六种主流音频编码器拉到KNN、SASRec和TIGER三种推荐范式下正面对决,还顺带拆解了语义ID的量化玄机。音频推荐选型,看这篇就够了。
AI生成的假图肉眼越来越难辨,可检测器却还停留在“加权平均”的老路子。本文提出的PE-Mamba,把Transformer层间特征当有序序列,用双向Mamba扫描来聚合取证线索,只训练1.3%参数就把主流假图检测基准刷到新SOTA,思路清奇又实用。
天文仪器不只是反射镜和CCD,光纤定位同样硬核。这篇论文将DESI久经考验的旋转机构与压电弯曲驱动结合,以极简结构实现140V下6mm偏转、闭环2μm精度,为下一代高密度光谱巡天提供了一个相当务实的新选项。
水下照片又绿又灰还带雾?武汉大学等机构的最新PROTEUS让你一键还原!它把“退化信息”从累赘变成向导,既用它引导特征调制,又用它控制跳跃连接复用。仅2.61M参数,U90的PSNR刷到25.50dB,LPIPS更是把第二名从0.086打到0.081,轻量又能打,值得一读。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球