ICCV 2023新范式被挑战:视频扩散模型为何输给自回归?
视频扩散模型看着很会“画”,但一遇到连续依赖事件就容易露馅。本文用最干净的硬球碰撞任务,把这个短板拆得明明白白。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
视频扩散模型看着很会“画”,但一遇到连续依赖事件就容易露馅。本文用最干净的硬球碰撞任务,把这个短板拆得明明白白。
Apple Research这篇不是在比谁更会“聊天”,而是在逼智能体面对真实手机交互的硬骨头:用户会不会接受、何时插手、能不能跨应用干活。PARE把这件事做成了可评测、可复现的框架,结果也挺扎心:最强模型成功率也只有四成多。
自动驾驶最怕的不是“不会开”,而是“开错了还直接上路”。这篇 DriveVer 很有意思:不重训大模型,偏偏把活放到测试时做二次验证和修正,34M 参数、80ms 推理,工程味很足。
Apple Research这篇论文不玩“更大的索引”,而是直接让模型学会“怎么搜”。SupportNet学支持函数,KeyNet直接回归最优键,思路很狠,工程上也很实用。
这篇论文最有意思的地方,不是“AI又发明了新材料模型”,而是通用编码智能体把一堆老方法重新拼起来,居然在带隙预测上打赢了17个专家模型。它也很诚实地告诉大家:自动科研能提效,但未必会自己想出新东西。
Transformer 一直把“记忆”和“预测”塞进同一条链路里,像让一个人一边背台词一边写剧本。康奈尔这篇论文直接把两件事拆开,结果是更低损失、更好泛化,而且推理几乎不涨成本,思路很硬。
这篇论文最有意思的地方,不是又堆了一个更大的网络,而是把“阵列无关”往前推了一步:先用理想 Ambisonics 训练,再用通道 dropout 模拟编码误差,最后靠 ASM 把任意麦克风阵列接进来。未知阵列、真实 Aria 眼镜、麦克风缺失,三关都过了,工程味很足。
长程智能体最烦的不是“想不起来”,而是“想起来了却不知道该把功劳算给谁”。ECHO把记忆选择和信用分配绑在一起,思路很工程,也很实用,尤其适合做搜索、工具调用和深度研究的Agent训练。
这篇论文最有意思的地方,不是又堆了一个“混合框架”,而是它把光场超分里最容易翻车的两件事——几何错位和扫描错位——分别拎出来治。一个负责让空间和角度别各唱各的,一个负责让Mamba别顺着方格子乱跑。
医学影像里最烦的事之一,就是图像又糊又吵,分割还得硬上。DiSIINet干脆把增强和分割绑成一对“互相打辅助”的双分支扩散模型,思路顺,结果也扎实。
这篇论文最有意思的地方,不是“又做了一个剪枝”,而是把ViT到底在看什么这件事,往因果层面往前拽了一步。它不靠重训,直接定位并切掉那些专门走背景捷径的注意力头,思路很狠,实验也够硬。
视频理解和视频生成长期像两拨人:一边要“看懂”,一边要“画准”。Vega直接把两件事塞进同一个框架里,还用3B参数在多个基准上打出了很能打的成绩,值得细看。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球