← 返回 PaperDaily
视觉与图像
北大等提出HDR:多步视觉推理从34%冲到60%
视频模型最尴尬的地方,不是不会画,而是会画却不会“想”。HDR把这个矛盾掰开了:先粗后细地推理,再保持流式低延迟输出,六个多步任务上把成功率从34.22拉到60.29,确实有点东西。
龙哥读论文
发布于 2026-08-14 09:11:16
阅读 3
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 视频模型最尴尬的地方,不是不会画,而是会画却不会“想”。HDR把这个矛盾掰开了:先粗后细地推理,再保持流式低延迟输出,六个多步任务上把成功率从34.22拉到60.29,确实有点东西。
原论文信息如下:
从34%到60%:HDR如何让视频模型学会“放长线钓大鱼”?
视频模型最容易犯的错,不是不会动,而是太早下结论 。走迷宫时,一步走歪,后面就只能一路将错就错;做汉诺塔时,前面盘子放错,后面再聪明也救不回来。HDR(Hierarchical Denoising for Visual Reasoning,层次化去噪视觉推理)要解决的,就是这个“短视病”。它不再让模型一边生成一边拍脑袋,而是先在粗粒度层面保留多个可能答案 ,再逐层收紧,最后才输出流式视频。
这篇论文最有意思的地方在于,它没有把“推理”和“流式生成”当成二选一。传统流式自回归扩散模型快,但容易“先开枪后瞄准”;双向扩散能全局修正,但每一步都要全序列密集去噪,成本高得像拿高铁去送外卖。HDR的思路更像先开个小型作战会议:先想大方向,再逐步细化,最后再把结果一帧帧吐出来。结果也很直接:六项多步视觉推理任务上,整体成功率从34.22提升到60.29 ,平均进度从76.00提升到89.56,同时流式延迟保持在0.70秒/潜变量。
如果把这件事翻译成人话,就是:以前的视频模型像“边走边写作文”,写到一半发现题目跑偏也来不及改;HDR更像“先打草稿,再誊写”,而且草稿不是一张,而是一棵树。树的上层负责大局判断,下层负责细节填充。这个顺序一变,模型的思考方式就不再是单线条的“从左到右硬冲”,而是先把可能的路线都留着,等信息更充分了再收敛。
流式自回归的“短视病”:为什么简单路径规划在长序列中频频翻车?
要理解HDR为什么有用,得先看旧方法为什么总翻车。流式自回归扩散的核心优点是快:每一步只看过去,不用反复重算整段视频,KV cache还能复用,部署起来很香。但问题也很明显——它的视野像只看前方三米的司机,路一旦拐错,后面全是“将错就错”的连锁反应。对于普通的视频合成,这种短视也许还能糊弄过去;但对于迷宫、汉诺塔、推箱子这种必须跨多步保持逻辑一致 的任务,早期错误会像滚雪球一样放大。
双向扩散恰好相反,它允许全局信息在每一步都互相“串门”,所以更擅长保留不确定性、反复修正假设。可惜它的代价也很硬:每次去噪都要处理整段序列,密集注意力和固定长度序列把计算量拉得很高,流式输出也就别想太轻松。论文把这个矛盾总结得很准:要么快但短视,要么会想但太贵 。HDR要做的,就是把这道二选一改成“既要又要”。
论文还专门构造了一个分层难度的多步推理基准,并加入了分布外样本。这个设计很关键,因为很多模型在“熟题”上看起来还行,一换题型就露馅。这里的任务不是让模型生成一段好看的视频,而是让它在视频里按规则做事 。这才是视觉推理该面对的真实难题。
HDR的“三阶段战略”:从粗到细的层次化推理是如何一步步解决短视问题的?
HDR的核心不是单个小技巧,而是一整套“先松后紧”的生成流程。第一步是把视频潜变量组织成一棵树,粗层表示全局结构,细层表示局部细节。第二步是在训练时对每一层做层次化去噪,让模型学会不同抽象层级该怎么恢复信息。第三步是在推理时按“粗到细”的顺序生成:先让上层保留高层假设,再用下层把这些假设具体化。这样一来,模型在真正提交最终轨迹前,已经完成了多轮“内部讨论”。
这里有个很聪明的地方:HDR不是把每层都去噪到“完全干净”,而是给不同层分配不同的去噪预算。粗层保留更高噪声,也就是保留更多不确定性;细层去噪更充分,负责把模糊假设变成具体画面。这个设计背后的直觉很朴素:大方向不该太早锁死,小细节才值得认真抠 。如果粗层也被洗得过于干净,模型就又回到了“太早定死路线”的老毛病。
训练目标采用的是流匹配(flow matching)思路。简单说,就是模型不直接学“最终答案长什么样”,而是学在某个噪声状态下应该往哪个方向走,像给每个层级都配了一个导航仪。论文里还给出了层级对应的采样预算设计:粗层步数少、细层步数多,这个安排和层级的不确定性是匹配的。表面上看是“少做一点”,实际上是把算力花在更值得的地方。
SHAP注意力:如何用“局部+父级”的稀疏模式实现全局规划?
HDR里最像工程师味道的设计,是SHAP(Sparse Hierarchical Attention Pattern,稀疏层次化注意力模式)。名字听起来挺唬人,干活其实很朴素:每个token不再看全序列,而是只看同层前一个token、父级token、相邻父级边界信息,以及首帧条件 。这就像做决策时不必和全公司开会,只找直属上级、前一个项目负责人和关键背景材料,效率一下就上来了。
更妙的是,SHAP并不是单纯“省算力”,它还让层级之间的知识复用变得自然。生成出来的token会写入共享KV cache,后面的token可以直接拿来用。这样,上层形成的全局计划不会被浪费,下层在细化时也能继承这些信息。论文给出的复杂度对比也很直白:双向扩散是全对全注意力,流式自回归是前缀全看,HDR则是固定大小上下文配合线性层级。换句话说,HDR不是把注意力撒成一锅粥,而是把信息流切成了“该看谁就看谁” 的精细管线。
这套设计的价值在于,它把“全局规划”拆成了多个局部可控动作。很多人一听全局推理就想到必须密集注意力、必须全序列交互,HDR偏不。它证明了一个很现实的结论:全局一致性不一定非得靠全量计算堆出来 ,只要层次结构设计得好,稀疏注意力也能把逻辑链条串起来。
不只是模拟:HDR如何迁移学习能力,让真实机器人也学会推理?
论文最加分的地方,是没有把结果停留在“玩具视频”里。除了六项合成推理任务,作者还把HDR拿去做了真实机器人迷宫实验:只用50段真实机器人视频微调,再配合逆动力学模型把生成视频转成可执行动作。这个设定很苛刻,因为现实世界里有遮挡、光照变化、定位误差、边界不规则,和干净的仿真环境完全不是一回事。
这里的意义不是“机器人突然变聪明了”,而是HDR学到的不是某个固定轨迹,而是跨步骤的规则结构 。这类结构一旦学到,就比死记硬背某条路径更容易迁移。论文后面还把HDR扩展到RoboDojo仿真基准上的World Action Model(WAM,世界动作模型),结果在没有机器人领域额外预训练的情况下,整体分数和成功率都优于同类基线,尤其在长时程任务上更稳。这说明层次化推理不只是“会画视频”,还可能成为一种更通用的物理世界建模方式。
不过,现实迁移这件事也别看得太满。论文里自己的失败案例已经说明,HDR虽然能把大方向做对,但偶尔还是会在末尾出现物理不一致,比如墙体消失、液体颜色混合异常之类的问题。也就是说,它更像是把“走错路”的概率压低了,而不是彻底消灭生成模型的幻觉。
HDR的结果之所以有说服力,关键在于它不是只在一个指标上“刷分”,而是同时改善了最终成功率 和中间进度 。这说明它不是靠偶然碰运气完成任务,而是推理轨迹本身更稳定。更难得的是,HDR在推理速度上几乎没有牺牲流式优势,说明“层次化”不是拿慢换准,而是通过结构设计把计算花在刀刃上。
从消融实验看,层数越多,性能越好,这说明HDR的收益不是某个单点小修小补带来的,而是层次结构本身在起作用。去噪步数减少时,HDR也比基线更稳,证明粗层保留不确定性的设计确实有用;数据量缩到2%时,HDR还能保住大部分性能,说明它学到的更像是可迁移规则,而不是纯记忆。对工程落地来说,这一点挺重要:数据不够、算力有限、场景还在变的时候,结构先天偏置往往比堆训练数据更值钱。
龙迷三问
Q1:HDR到底解决了什么问题? 它解决的是视频模型在多步推理里“太早做决定”的问题。传统流式自回归模型快但短视,双向扩散会想但太贵,HDR通过层次化潜变量和粗到细去噪,把“能改、能想、能流式输出”尽量放到了一起。
Q2:SHAP里的“局部+父级”是什么意思? 就是每个token不用看全世界,只看同层前一个token、父层对应token、相邻父级边界和首帧条件。这样既保留了必要的全局规划信息,又避免了全序列密集注意力的高成本。
Q3:这里的流匹配和普通扩散有什么区别? 流匹配更像是学“往哪儿走”的速度场,而不是只学最终结果。HDR在每个层级上都预测去噪方向,再按层级分配不同的采样预算,所以粗层保留不确定性,细层负责把结果收紧。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把层次化潜变量、粗到细去噪和流式自回归揉到一起,思路不算“从天而降”,但组合得很完整,且确实击中了多步视觉推理的痛点。
实验合理度: ★★★★☆
任务覆盖迷宫、汉诺塔、推箱子等多类多步推理,既看成功率也看进度,还补了速度、数据量和真实机器人实验,整体比较扎实。
学术研究价值: ★★★★☆
它不只是做了一个更强的视频模型,更是在回答“生成式视频能否承担推理与规划”的问题,这对世界模型和具身智能都挺有启发。
稳定性: ★★★☆☆
在基准和机器人迷宫里表现不错,但仍有末尾物理不一致、幻觉式失真等问题,说明离“可靠可控”还有距离。
适应性以及泛化能力: ★★★☆☆
分布外迷宫和小数据实验都支持它有一定泛化能力,但目前仍主要围绕结构化任务,离开放世界还有一段路。
硬件需求及成本: ★★★☆☆
比双向扩散友好,但毕竟还是视频生成模型,训练和部署都不算轻量;好在流式延迟控制得不错,工程上比密集全局去噪更现实。
复现难度: ★★★☆☆
方法结构清楚,但涉及层次化token、注意力掩码、流匹配训练和机器人迁移,复现门槛不低;如果代码和数据开放,价值会更高。
产品化成熟度: ★★★☆☆
适合结构化推理、机器人闭环和可控生成场景,但要进入通用产品,还需要更强的稳定性、错误恢复和实时性验证。
可能的问题: 层次化设计确实聪明,但复杂度也上来了;任务集偏结构化,真实世界长尾情况、失败恢复和安全约束还没完全说明白。
主要参考文献
[1] Qian, Z., Chi, X., Mak, C.-W., Zhou, T., Yuan, R., Rui, Y., Sun, H., Wu, Z., Li, Y., Qian, S., Han, S., Zhang, S. Hierarchical Denoising For Multi-Step Visual Reasoning. arXiv:2607.15278v1, 2026.
[2] 项目主页:https://hierarchical-diffusion-reasoning.github.io/
[3] 演示页面与公开视频素材:见项目主页对应展示内容。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!
欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群