北大阿里最新:两步视频生成新范式DUET,质量追平DMD、多样性翻倍!
两步视频生成一直面临“要质量还是要多样性”的取舍难题。北大、阿里与清华联手提出的DUET,干脆让sCM和DMD两位专家按噪声级分工,高噪声步管结构多样性,低噪声步管细节质量,实验显示多样性比DMD翻倍、质量还追平了DMD。思路简单到让人拍大腿,效果却相当能打。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
两步视频生成一直面临“要质量还是要多样性”的取舍难题。北大、阿里与清华联手提出的DUET,干脆让sCM和DMD两位专家按噪声级分工,高噪声步管结构多样性,低噪声步管细节质量,实验显示多样性比DMD翻倍、质量还追平了DMD。思路简单到让人拍大腿,效果却相当能打。
编码理论里有个著名的Etzion–Silberstein猜想,断言一种“容量上界”总能被精确顶到。结果这篇论文用计算机穷举加精确约化,把一个12维的上界硬生生压到11维——差距只有1,但猜想已经凉透。更难得的是作者把验证包全部开源,任何人可复核,这种做事方式龙哥很欣赏。
先来一个灵魂拷问:数学家们折腾了上百年,黎曼zeta函数在临界线上的最大值到底有多大?这个问题听起来简单,却像一座冰山,露出水面的只有一行公式,水面下藏着随机矩阵、高斯乘法混沌、对数相关场这些大家伙。
这可能是第一篇系统研究“AI代理自我投毒”的论文:攻击者不注入任何恶意外部输入,只靠模型自己在正常任务里“写”出带毒的技能文件,就能让隐私泄露、提权、越权写入在后续任务中自动触发,在OpenClaw、Codex、Claude Code上平均攻击成功率超93%。对做AI Agent安全和部署的同学来说,这篇值得细读。
网络会不会“吵到天荒地老”?这篇论文只用一个三次非线性,就把动态极化的产生、稳定与消除讲得明明白白;最反直觉的是,只需锚定一个智能体的观点,全网振荡分歧就能收敛回共识。推导极其优雅,值得控制系统方向的同学反复品味。
一说到DXA(双能X射线吸收测定法),大多数人脑海中浮现的画面大概是体检中心排队时,躺在一台白色仪器上,几分钟后拿到一张写着骨密度T值的报告单。这玩意儿在临床上主要就干一件事:判断你有没有骨质疏松。
Google DeepMind把动态4D重建做成了"点单式"服务:一段视频编码一次,任何时间、任何空间位置的3D坐标随查随到。200+FPS位姿估计、18-300倍跟踪提速,CVPR 2026最佳论文的含金量,龙哥带大家一探究竟。
水下机器人在港口干活,洋流、缆绳、尾波全是不讲道理的随机扰动。这篇论文把随机物理信息神经网络搬上李群,用欧拉-庞加莱动力学做骨架,让模型既懂物理又懂几何,仿真到实测一步到位,把MPPI导航成功率从65%拉到90%,是随机动力学建模难得的完整落地案例。
运动生成界的“解耦大师”来了!MoCoDiff把文本、风格、历史信息拆成独立控制通道,在冻结扩散骨干上即插即用,长序列不漂移、风格不串味,效率还直接冲到136.89 FPS——动画师看了想点赞,研究者看了想复现。
JPEG一压狠了,画面就糊成一团。传统方法要么回归均值磨平纹理,要么生成式模型脑补纹理骗过人眼却坑了下游模型。FDIR用两阶段解耦把这笔“三角债”理清了,只用3.5K张图就拿下7/10下游任务领先,值得做压缩恢复的同学都看一眼。
给AI代理发工具权限就像借车给实习生——怕他乱开。Niyam-AI直接上密码学“行车记录仪+电子围栏”:每次工具调用都得先过轻量Judge模型,再生成零知识证明,F1 88.5%、误报率仅1.1%,关键是任何第三方都能在53毫秒内验证“安全检查真的发生了”。同类工作里把ZK证明用到agent工具调用验证上的,这是头一遭。
手机里存了三年的糊脸照片,AI一顿猛修,结果亲妈都不认得了?扩散模型人脸修复最怕"五官漂移",南邮等四校带来WaveFreqAnchor:零训练、零微调,只用波结构锚定+频率校正,把身份相似度一路抬到0.988,修完还像本人!
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球