← 返回 PaperDaily
视觉与图像
西安交大新方法DQ-CTM:稀疏思考也能做密集重建
超分辨率论文很多,但大多还是“算一次就交卷”。这篇 ThinkSR 的有意思之处在于,它把连续思考机器搬进了像素重建里,让模型可以一边想、一边补细节,而且四个思考步内就能看到稳定变清晰的轨迹。更关键的是,它不是只讲概念,确实把稀疏思考和密集输出之间的矛盾拆开了。
龙哥读论文
阅读 5
查看原文
原论文信息如下:
稀疏思想如何预测密集像素?ThinkSR用DQ-CTM给出新答案
超分辨率这件事,表面上像“把图放大”,本质上却是在像素海里做侦探:哪里是边缘,哪里是纹理,哪里该补细节,哪里不能乱编。很多模型的做法是一次前向传播直接交卷,快是快了,但也有点像闭眼做题——算完就算完,过程不可见,修复轨迹也没法观察。
这篇论文的切入点很有意思:把 Continuous Thought Machine,连续思考机器 搬进图像超分里,再专门处理一个看似很小、其实很要命的矛盾——稀疏思想,密集输出。前者讲的是模型内部的思考状态尽量紧凑;后者要求输出端每个位置都得给答案。一个像“脑袋里只装一颗小球”,一个像“整张图每个像素都要发言”,这俩要是硬凑,通常就会翻车。
这招的关键,不是把 CTM 简单套在图像上,而是把它拆成两层角色:一层负责持续思考,另一层负责保留空间证据。前者像脑子,后者像地图。脑子可以慢慢想,地图不能丢;脑子可以压缩,地图必须完整。超分任务里最怕的不是“想得少”,而是“想的时候把细节想没了”。
紧凑to密集:如何用“脑洞”指导超分?
先把基础概念捋顺。超分辨率的输入是低分辨率图像 ILR,目标是恢复对应的高分辨率图像 IHR。传统做法通常是把整张低清图丢进网络,最后一次性输出高清图。ThinkSR 的思路则是:先用编码器提取一张密集特征图,再把它切成局部窗口,在每个窗口内做共享的连续思考,最后再还原回原始空间布局并解码成高分图。
这里最值得解释的是“密集查询”到底在干什么。CTM 的内部状态并不是直接拿来做像素预测,而是先形成一个紧凑的思考摘要,再通过一个结构化的低秩映射,把这个摘要变成窗口内每个位置都能使用的查询向量。英文全称里“dense query”并不只是“查询很多”,而是每个空间位置都有自己的查询,但这些查询共享同一个思考来源。这样既保留了位置差异,又避免给每个位置单独堆参数,工程上更省。
论文里还强调了一个很朴素但很重要的原则:不要池化掉 token。很多视觉模型为了省计算,会把局部信息揉成一个更短的表示;但超分任务偏偏讨厌这种“省事”。因为一旦局部边缘、纹理、细线条被压没了,后面再强的解码器也只能靠猜。ThinkSR 的 persistent dense visual carrier(持续的密集视觉载体)就是为了把这些位置证据留住,不让它们在思考过程中消失。
如果把这个方法翻译成人话,那就是:模型不是先把图像压成一个“脑内摘要”再硬补细节,而是让摘要去指挥每个位置该怎么看、怎么看得更细。这就比“先压扁再展开”更靠谱,因为展开的时候还知道原来每个位置是谁。
渐进式重建:从模糊到清晰的“思考”过程
更有意思的是,收益并不是线性暴涨,而是前面快、后面慢。论文里给出的 PSNR-Y 变化显示,早期 tick 提升更明显,后期逐渐收敛。这很符合修图直觉:第一遍把大错改掉,第二遍补边缘,第三遍磨纹理,最后再抠一点点细节。模型的“思考”并不是玄学,而是一个逐步收敛的修复过程。
训练上,这篇论文也比较克制:它只在固定的四步思考范围内训练,并且监督的是最终一步的重建结果,没有搞“每一步都强行打分”的花活。这样做的好处是训练目标简单,和推理时的轨迹变化能对应起来;坏处也明显,就是超过四步以后能不能继续变好,论文目前不敢拍胸脯。这份克制反而让结果更可信一点。
性能几何?ThinkSR V1与主流轻量级方法的对比
先看论文最诚实的一面:它没有把自己包装成“轻量级超分新王者”。相反,作者很坦白地把 V1 放在一堆成熟轻量方法旁边比,结果是能打,但还没到碾压级别。这种结果其实比“自称 SOTA”更有价值,因为它告诉读者:这个方向是可行的,但还没到可以闭眼部署的程度。
这个结果其实挺合理。因为当前版本的重点不是把超分做到极致,而是验证“连续思考能不能和密集像素重建共存”。如果一个新范式刚提出就直接冲榜,往往要么是实验设计不公平,要么是工程细节没讲清。ThinkSR 现在更像是一块原型板:功能通了,性能还在磨。
这种结果给工程侧的启发很直接:如果未来真要部署连续思考式超分,最重要的不是无限延长思考时间,而是找到“收益递减点”。因为真实业务里,算力不是白送的,四步能解决的问题,没必要硬拖到十步;而四步还不够的地方,就得改结构,而不是只加时间。
未来已来?ThinkSR的局限与展望
这篇工作最值得肯定的地方,不是“超分又涨了几分”,而是它把一个新范式的接口问题讲明白了。连续思考不是只能做分类和决策,也可以去碰密集预测;但前提是,必须给它一个不会丢空间证据的载体。ThinkSR 的答案是:紧凑的思考状态 + 持续的密集特征场。这套组合有点像“脑子负责统筹,手脚负责落地”。
但局限也很清楚。第一,当前证据只来自固定四步的原型实验,还谈不上完整的 SOTA 竞争。第二,窗口化处理保住了局部 token,但并没有在每一步里完整表达二维拓扑,复杂纹理和长程结构仍可能吃亏。第三,自适应停止还没做,意味着不同难度图像目前拿到的是同一份思考预算,工程上不够聪明。说白了,模型已经会“想”,但还不会“看菜下饭”。
如果继续往前走,比较自然的方向有两个:一个是把窗口级连续思考做得更像真正的二维视觉过程,另一个是把“思考多久”变成可学习的决策,而不是固定死的超参数。前者解决表达能力,后者解决计算成本。等这两件事都打通,连续思考才可能从“论文里能看”变成“产品里能跑”。
龙迷三问
这篇论文到底解决了什么问题?它解决的是“连续思考机器怎么做密集预测”的接口问题。以前 CTM 更像做分类或决策,现在 ThinkSR 证明它也能服务超分,但前提是不能把空间信息压没,得保留一个持续存在的密集视觉载体。
DQ-CTM 里的“密集查询”是什么意思?意思是先把 CTM 的紧凑思考状态变成窗口内每个位置都能用的查询,而不是只输出一个窗口摘要。这样既保留位置差异,又让所有位置共享同一套思考逻辑。
四步思考是不是就够用了?对这篇 V1 来说,只能说四步内已经观察到稳定提升,但不能据此推出“越想越好”。论文自己也没有这么吹。真正能不能自适应更多步数,还得看后续版本怎么做。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆。把连续思考机器引到密集视觉重建里,这个方向本身挺新,尤其是“稀疏思想—密集输出”的问题定义比较清楚。
实验合理度:★★★☆☆。过程可视化和逐 tick 指标很加分,但当前还是原型级验证,离更完整的对照和大规模结论还有距离。
学术研究价值:★★★★☆。它不只是在做一个超分模型,而是在给连续思考架构找新的任务接口,这对后续研究很有启发。
稳定性:★★★☆☆。四步内轨迹稳定,但超过训练范围后的行为没有保证,稳定性还谈不上成熟。
适应性以及泛化能力:★★★☆☆。理论上可扩展到分割、深度、光流等任务,但目前都还只是设想,没被验证。
硬件需求及成本:★★★★☆。参数量不大,窗口级共享思考也比较省,但多 tick 推理仍然比一次前向更贵。
复现难度:★★★☆☆。思路不复杂,但连续思考模块、窗口对齐和训练细节都需要实现到位,门槛不算低。
产品化成熟度:★★★☆☆。适合原型验证和研究探索,离稳定上线还差自适应推理、完整 benchmark 和更强泛化。
可能的问题:当前结果证明了可行性,但没有证明全面领先;四步 horizon、窗口建模和评测范围都限制了结论力度。
主要参考文献
[1] Zekai Shi. Think Sparse, Predict Dense: Continuous Thought Machines for Image Super-Resolution. arXiv:2607.18856v1, 2026.
[2] Luke Darlow, Ciaran Regan, Sebastian Risi, Jeffrey Seely, and Llion Jones. Continuous Thought Machines. arXiv:2505.05522, 2025.
[3] Jingyun Liang et al. SwinIR: Image Restoration Using Swin Transformer. ICCV Workshops, 2021.
图像超分也能“边想边修”了。想继续追连续思考、图像恢复和大模型交叉的新玩法,欢迎加入龙哥读论文粉丝群,一起拆论文、看代码、聊落地。🙂

欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
图像恢复、超分、视觉大模型、机器人和医疗方向的小伙伴都在群里,适合一起拆论文、找灵感、少走弯路。
