← 返回 PaperDaily 视觉与图像

西安交大新方法DQ-CTM:稀疏思考也能做密集重建

超分辨率论文很多,但大多还是“算一次就交卷”。这篇 ThinkSR 的有意思之处在于,它把连续思考机器搬进了像素重建里,让模型可以一边想、一边补细节,而且四个思考步内就能看到稳定变清晰的轨迹。更关键的是,它不是只讲概念,确实把稀疏思考和密集输出之间的矛盾拆开了。

西安交大新方法DQ-CTM:稀疏思考也能做密集重建
原论文信息如下:
论文标题:
Think Sparse, Predict Dense: Continuous Thought Machines for Image Super-Resolution
发表日期:
2026年07月
发表单位:
Xi’an Jiaotong University
原文链接:
https://arxiv.org/pdf/2607.18856v1.pdf

稀疏思想如何预测密集像素?ThinkSR用DQ-CTM给出新答案

超分辨率这件事,表面上像“把图放大”,本质上却是在像素海里做侦探:哪里是边缘,哪里是纹理,哪里该补细节,哪里不能乱编。很多模型的做法是一次前向传播直接交卷,快是快了,但也有点像闭眼做题——算完就算完,过程不可见,修复轨迹也没法观察。
这篇论文的切入点很有意思:把 Continuous Thought Machine,连续思考机器 搬进图像超分里,再专门处理一个看似很小、其实很要命的矛盾——稀疏思想,密集输出。前者讲的是模型内部的思考状态尽量紧凑;后者要求输出端每个位置都得给答案。一个像“脑袋里只装一颗小球”,一个像“整张图每个像素都要发言”,这俩要是硬凑,通常就会翻车。
图1:从紧凑CTM表示到窗口对齐的密集查询
图1把这个矛盾讲得很直白。原始 CTM 更擅长把信息压成一个紧凑抽象 token;但如果直接拿去做超分,每个局部窗口最后还是只剩一个总结 token,窗口内部的空间身份会被压扁。论文提出的 DQ-CTM(Dense-Query Continuous Thought Machine,密集查询连续思考机器) 则反过来做:先保留窗口里的所有位置,再把紧凑思考状态转换成和窗口位置一一对齐的查询,让“想”的过程继续紧凑,让“答”的过程保持密集。
这招的关键,不是把 CTM 简单套在图像上,而是把它拆成两层角色:一层负责持续思考,另一层负责保留空间证据。前者像脑子,后者像地图。脑子可以慢慢想,地图不能丢;脑子可以压缩,地图必须完整。超分任务里最怕的不是“想得少”,而是“想的时候把细节想没了”。

紧凑to密集:如何用“脑洞”指导超分?

先把基础概念捋顺。超分辨率的输入是低分辨率图像 ILR,目标是恢复对应的高分辨率图像 IHR。传统做法通常是把整张低清图丢进网络,最后一次性输出高清图。ThinkSR 的思路则是:先用编码器提取一张密集特征图,再把它切成局部窗口,在每个窗口内做共享的连续思考,最后再还原回原始空间布局并解码成高分图。
图2:ThinkSR与DQ-CTM的整体架构
图2就是整套流程。可以把它理解成“先铺开,再思考,再收回”。编码器先把图像变成一张空间特征场;窗口划分器把它切成不重叠的局部块;共享的 DQ-CTM 在每个思考 tick 里反复更新这些块;窗口再被还原回原来的位置,交给解码器生成最终图像。这个设计很像给模型装了一个“可观察的脑内草稿本”——每思考一步,草稿都能看见一点变化。
这里最值得解释的是“密集查询”到底在干什么。CTM 的内部状态并不是直接拿来做像素预测,而是先形成一个紧凑的思考摘要,再通过一个结构化的低秩映射,把这个摘要变成窗口内每个位置都能使用的查询向量。英文全称里“dense query”并不只是“查询很多”,而是每个空间位置都有自己的查询,但这些查询共享同一个思考来源。这样既保留了位置差异,又避免给每个位置单独堆参数,工程上更省。
论文里还强调了一个很朴素但很重要的原则:不要池化掉 token。很多视觉模型为了省计算,会把局部信息揉成一个更短的表示;但超分任务偏偏讨厌这种“省事”。因为一旦局部边缘、纹理、细线条被压没了,后面再强的解码器也只能靠猜。ThinkSR 的 persistent dense visual carrier(持续的密集视觉载体)就是为了把这些位置证据留住,不让它们在思考过程中消失。
如果把这个方法翻译成人话,那就是:模型不是先把图像压成一个“脑内摘要”再硬补细节,而是让摘要去指挥每个位置该怎么看、怎么看得更细。这就比“先压扁再展开”更靠谱,因为展开的时候还知道原来每个位置是谁。

渐进式重建:从模糊到清晰的“思考”过程

图3:不同思考步下的重建质量变化
图3展示的是最直观的结果:模型不是一步到位,而是随着 thought tick 增加,重建质量逐步上升。论文把这个过程做成了可量化的轨迹。对 100 张验证图像的评估里,从 T=1 到 T=4,所有图像都变好了,这点很关键,因为它说明“继续思考”不是摆设,而是真的在补细节。
更有意思的是,收益并不是线性暴涨,而是前面快、后面慢。论文里给出的 PSNR-Y 变化显示,早期 tick 提升更明显,后期逐渐收敛。这很符合修图直觉:第一遍把大错改掉,第二遍补边缘,第三遍磨纹理,最后再抠一点点细节。模型的“思考”并不是玄学,而是一个逐步收敛的修复过程。
图4:典型、提升明显和困难样本的渐进式重建轨迹
图4把“从模糊到清晰”的过程摆得很明白。典型样本会随着 tick 增加越来越稳,强提升样本能看到纹理和边缘被一点点拉回来,困难样本则说明模型并不是万能补丁,复杂结构依然会有残留误差。这个图的价值在于,它不是只看最终分数,而是把中间过程摊开给人看。对连续思考类方法来说,这种“过程可视化”比单一结果更有说服力。
图5:对应重建轨迹的绝对误差图
图5进一步把误差摊开。颜色越亮,说明局部偏差越大;随着思考步数增加,错误区域在收缩。这个结果和前面的轨迹图是互相印证的:不是“看上去更清楚了”,而是确实在减少像素级误差。对做图像恢复的人来说,这比花哨的注意力热力图靠谱多了,因为最后拼的是误差,不是气氛。
图S1:不同思考步中的相对注意力变化
补充材料里的图S1展示了相对注意力随 tick 的变化。它更像是一个辅助诊断工具:能看出模型在不同步数里关注哪里,但不能直接当作因果解释。这个提醒很重要,因为视觉化很容易“看起来很懂”,但真正能不能解释模型行为,还得回到定量结果和结构设计。
训练上,这篇论文也比较克制:它只在固定的四步思考范围内训练,并且监督的是最终一步的重建结果,没有搞“每一步都强行打分”的花活。这样做的好处是训练目标简单,和推理时的轨迹变化能对应起来;坏处也明显,就是超过四步以后能不能继续变好,论文目前不敢拍胸脯。这份克制反而让结果更可信一点。

性能几何?ThinkSR V1与主流轻量级方法的对比

先看论文最诚实的一面:它没有把自己包装成“轻量级超分新王者”。相反,作者很坦白地把 V1 放在一堆成熟轻量方法旁边比,结果是能打,但还没到碾压级别。这种结果其实比“自称 SOTA”更有价值,因为它告诉读者:这个方向是可行的,但还没到可以闭眼部署的程度。
表1:轻量级超分方法的定量比较
表1给出了 ×4 超分的轻量级对比。ThinkSR V1 在参数量约 1.13M 的情况下,和 CARN、IMDN、RFDN 这些经典轻量方法处在同一量级,说明它没有靠“堆大模型”混分;但和更强的轻量 Transformer 或状态空间模型相比,平均指标还有差距,尤其在 Urban100、Manga109 这类结构复杂的数据集上更明显。换句话说,它证明了方法方向,不证明已经赢了比赛
这个结果其实挺合理。因为当前版本的重点不是把超分做到极致,而是验证“连续思考能不能和密集像素重建共存”。如果一个新范式刚提出就直接冲榜,往往要么是实验设计不公平,要么是工程细节没讲清。ThinkSR 现在更像是一块原型板:功能通了,性能还在磨。
表2:不同思考步下的重建性能
表2是这篇论文最像“过程证明”的部分。随着 T 从 0 增加到 4,L1 误差持续下降,PSNR 和 SSIM 持续上升,说明连续思考确实在起作用,而不是单纯多跑几步蒙出了更高分。尤其值得注意的是,收益在后期逐渐变小,说明模型在四步范围内已经接近收敛,这也侧面支持了“固定思考预算”这个设计。
这种结果给工程侧的启发很直接:如果未来真要部署连续思考式超分,最重要的不是无限延长思考时间,而是找到“收益递减点”。因为真实业务里,算力不是白送的,四步能解决的问题,没必要硬拖到十步;而四步还不够的地方,就得改结构,而不是只加时间。

未来已来?ThinkSR的局限与展望

这篇工作最值得肯定的地方,不是“超分又涨了几分”,而是它把一个新范式的接口问题讲明白了。连续思考不是只能做分类和决策,也可以去碰密集预测;但前提是,必须给它一个不会丢空间证据的载体。ThinkSR 的答案是:紧凑的思考状态 + 持续的密集特征场。这套组合有点像“脑子负责统筹,手脚负责落地”。
但局限也很清楚。第一,当前证据只来自固定四步的原型实验,还谈不上完整的 SOTA 竞争。第二,窗口化处理保住了局部 token,但并没有在每一步里完整表达二维拓扑,复杂纹理和长程结构仍可能吃亏。第三,自适应停止还没做,意味着不同难度图像目前拿到的是同一份思考预算,工程上不够聪明。说白了,模型已经会“想”,但还不会“看菜下饭”。
如果继续往前走,比较自然的方向有两个:一个是把窗口级连续思考做得更像真正的二维视觉过程,另一个是把“思考多久”变成可学习的决策,而不是固定死的超参数。前者解决表达能力,后者解决计算成本。等这两件事都打通,连续思考才可能从“论文里能看”变成“产品里能跑”。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它解决的是“连续思考机器怎么做密集预测”的接口问题。以前 CTM 更像做分类或决策,现在 ThinkSR 证明它也能服务超分,但前提是不能把空间信息压没,得保留一个持续存在的密集视觉载体。

DQ-CTM 里的“密集查询”是什么意思?意思是先把 CTM 的紧凑思考状态变成窗口内每个位置都能用的查询,而不是只输出一个窗口摘要。这样既保留位置差异,又让所有位置共享同一套思考逻辑。

四步思考是不是就够用了?对这篇 V1 来说,只能说四步内已经观察到稳定提升,但不能据此推出“越想越好”。论文自己也没有这么吹。真正能不能自适应更多步数,还得看后续版本怎么做。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆。把连续思考机器引到密集视觉重建里,这个方向本身挺新,尤其是“稀疏思想—密集输出”的问题定义比较清楚。

实验合理度:★★★☆☆。过程可视化和逐 tick 指标很加分,但当前还是原型级验证,离更完整的对照和大规模结论还有距离。

学术研究价值:★★★★☆。它不只是在做一个超分模型,而是在给连续思考架构找新的任务接口,这对后续研究很有启发。

稳定性:★★★☆☆。四步内轨迹稳定,但超过训练范围后的行为没有保证,稳定性还谈不上成熟。

适应性以及泛化能力:★★★☆☆。理论上可扩展到分割、深度、光流等任务,但目前都还只是设想,没被验证。

硬件需求及成本:★★★★☆。参数量不大,窗口级共享思考也比较省,但多 tick 推理仍然比一次前向更贵。

复现难度:★★★☆☆。思路不复杂,但连续思考模块、窗口对齐和训练细节都需要实现到位,门槛不算低。

产品化成熟度:★★★☆☆。适合原型验证和研究探索,离稳定上线还差自适应推理、完整 benchmark 和更强泛化。

可能的问题:当前结果证明了可行性,但没有证明全面领先;四步 horizon、窗口建模和评测范围都限制了结论力度。


主要参考文献

[1] Zekai Shi. Think Sparse, Predict Dense: Continuous Thought Machines for Image Super-Resolution. arXiv:2607.18856v1, 2026.
[2] Luke Darlow, Ciaran Regan, Sebastian Risi, Jeffrey Seely, and Llion Jones. Continuous Thought Machines. arXiv:2505.05522, 2025.
[3] Jingyun Liang et al. SwinIR: Image Restoration Using Swin Transformer. ICCV Workshops, 2021.

图像超分也能“边想边修”了。想继续追连续思考、图像恢复和大模型交叉的新玩法,欢迎加入龙哥读论文粉丝群,一起拆论文、看代码、聊落地。🙂

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。图像恢复、超分、视觉大模型、机器人和医疗方向的小伙伴都在群里,适合一起拆论文、找灵感、少走弯路。
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。