← 返回 PaperDaily 大模型与智能体

ARC-AGI-3低于1%:执行能加速,发现为何不行?

这篇论文很有意思,表面上在聊库兹韦尔的“加速回报”,实际上是在提醒大家:算力、模型、工程可以一路狂飙,但科学发现最难的那一步,往往是判断“旧框架是不是该下岗了”。

ARC-AGI-3低于1%:执行能加速,发现为何不行?
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
这篇论文很有意思,表面上在聊库兹韦尔的“加速回报”,实际上是在提醒大家:算力、模型、工程可以一路狂飙,但科学发现最难的那一步,往往是判断“旧框架是不是该下岗了”。


原论文信息如下:
论文标题:
Guojun Liao: Accelerating Returns and the Missing Layer in Scientific Discovery
发表日期:
2026年06月
发表单位:
University of Texas at Arlington
原文链接:
https://arxiv.org/pdf/2606.26359v1.pdf

加速回报的数学本质:从指数增长到耦合系统

库兹韦尔提出的“加速回报”听起来像一句科幻台词:技术越进步,进步得越快,最后像坐上了火箭。但这篇论文没有停留在“听起来很猛”这一步,而是先把它翻译成了一个更朴素的数学图景:如果一个量的增长速度和它自身规模成正比,那它就会呈指数增长。说人话就是,今天多一点,明天就能拿这一点再生一点,利滚利,滚着滚着就不像话了。
不过,论文真正想强调的并不是“指数增长”本身,而是它背后的正反馈。比如算力更强,会让芯片设计更快、软件优化更快、实验验证更快;这些更快的结果又反过来继续提升算力。单看一个领域,像是一个变量在狂奔;放到多个领域一起看,就变成了一群变量互相拉车、互相拽着往前冲。
图1:加速回报的耦合系统示意
图1:加速回报的耦合系统示意。论文把 compute、AI、脑科学、材料等多个技术领域看成彼此影响的子系统,核心不是单点爆发,而是系统之间的“互相喂饭”。
论文把这个想法写成了一个很经典的耦合系统:每个技术领域都可以有自己的增长率,但更重要的是它们之间存在交叉项。比如计算能力会推动人工智能,人工智能又会反过来推动计算能力。只要这些交叉项不是摆设,而是真能产生实际帮助,那么系统的主导增长率就会被抬高。换句话说,不是某个领域单独变强,而是整个技术网络一起变强
公式图:耦合增长模型
公式图:耦合增长模型。这里的 X 代表多个技术变量组成的向量,M 是增长矩阵,矩阵里的对角线表示各领域自己的增长速度,非对角线表示“你帮我、我帮你”的交叉促进项。这个写法的好处是把“加速回报”从口号变成了可分析的动力系统。
当然,论文也没有把这件事说得过于浪漫。它很老实地提醒:耦合不等于必然爆炸。要让加速回报真的发生,至少得满足几件事。第一,跨领域帮助必须是真的,不是“看起来很会”。第二,知识和工具要能低摩擦流动,不然 A 领域的成果到了 B 领域就像快递丢了件。第三,系统得足够模块化,方便复用和重组。第四,物理、组织、能源这些现实限制还在,指数增长不可能无限持续,很多时候只是某个阶段看起来像指数。
所以,这篇论文对“加速回报”的处理其实很克制:它不是在鼓吹“技术永远飞升”,而是在说技术系统在某些条件下确实会进入互相促进的加速区间。这个判断很重要,因为它让后面的讨论有了地基——先承认技术会越来越快,再问一个更尖锐的问题:快,究竟快在哪儿?

“执行”与“发现”的鸿沟:为什么加速解决不了框架问题?

这篇论文最有意思的地方,恰恰不是“加速回报”本身,而是它指出:加速能提高执行能力,却不自动带来科学发现能力。这话听着有点扎心,但很像现实。因为“会做题”和“会出题”根本不是一回事。前者是把已知框架里的任务做得更快更准,后者是判断框架本身是不是该换了。
论文借用了一个很实用的三层视角:Layer 1 是搜索和检索,Layer 3 是执行、优化和精炼,而最关键、也最容易被忽略的,是 Layer 2——定性推理,也就是判断“当前框架哪里不对劲”。如果把科学发现比成修房子,Layer 3 像电钻和水泥,能干活;Layer 2 才像判断承重墙是不是设计错了。电钻再快,也不能替你决定该不该拆墙。
图2:执行与发现的差异
图2:执行与发现的差异。左边更像“在既定规则里越跑越快”,右边更像“发现规则本身不对,得换一套打法”。论文认为,真正难的是后者。
这就解释了为什么“技术越来越强”并不等于“科学发现自动完成”。一个系统完全可能在旧框架里越做越熟练,越熟练越高效,最后把旧框架里的边边角角都挤干净了,但就是没意识到:真正的问题不是优化不够,而是模型方向错了。这类问题不是多跑几轮训练、多堆几块卡就能解决的。
论文这里还借用了 ARC-AGI-3 的结果来加重语气:人类在这个基准上接近满分,而前沿 AI 仍然低于 1%。这不是在说 AI 没用,而是在说当前 AI 和人类在“灵活推理、框架切换、发现缺口”这类能力上,差距还非常大。这个差距不是靠“更多算力”四个字就能糊过去的。算力能让机器更快地执行,但不能自动教会它“什么时候该怀疑自己”。
看到这里,确实会有点“思考中...”的感觉。因为很多人默认 AI 越来越强,迟早连发现新理论也一起包了;但论文的态度是:先别急着画饼,先分清楚“能把现有活干快”与“能看出活本身干错了”是两回事。

QES登场:聚焦被忽视的Layer 2定性推理层

在这个背景下,论文提出了一个核心角色:QES,Qualitative Engine for Science,中文可理解为“科学定性推理引擎”。它的定位不是替代所有 AI 工具,而是专门补上当前系统最薄弱的那一层:定性判断、框架识别、概念迁移、结构升级。
论文把 QES 设计成一个 Layer 2 系统,重点训练对象不是单纯的答案,而是科学发现过程中那些“为什么会卡住、缺了什么、该往哪儿跳”的结构性信息。它更像一个懂科研的“老法师”,不负责替你写完所有代码,但会告诉你:这道题的关键不是算得更快,而是你现在站错了地盘。
图3:QES三层框架
图3:QES的三层视角。Layer 1 负责搜索与总结,Layer 2 负责定性推理与框架判断,Layer 3 负责执行与优化。论文的意思很明确:前两层不能被第三层自动替代。
为了把“定性推理”讲清楚,论文还总结了七种结构模式,分别是:欠定性缺失伴侣潜在类比关键粒子结构成熟多点汇聚框架提升。这些名字听起来有点学术,但本质上都在描述一件事:科学突破往往不是“多算一点”,而是“在对的时机找到对的结构缺口”。
比如“缺失伴侣”说的是:一个理论看起来差不多了,但总缺一个关键概念配件,像拼乐高少了一块最要命的砖;“潜在类比”说的是:别只盯着原领域,去别的学科找相似结构,很多时候答案藏在旁边的房间;“框架提升”则更直接,就是旧模型已经兜不住了,得换个更高层次的表述方式。QES 的价值就在于,它不是把这些现象讲成玄学,而是尽量把它们整理成可以学习、可以检索、可以复用的模式。
论文还顺手点了一下一个很现实的问题:如果未来 Layer 3 越来越便宜、越来越强,那真正稀缺的反而是“决定往哪儿走”的能力。这个判断挺有洞察力。因为当大家都能快速训练、快速生成、快速优化时,真正拉开差距的就不再是“谁更能干”,而是“谁更会判断该干什么”。
这里就有种“原来关键不是更猛,而是更会看门道”的感觉。很多时候,科学研究卡住并不是因为机器不够勤奋,而是因为系统还没学会在合适的时刻说一句:这个框架,可能不对。

超越AGI时间表:科学发现本身就是值得传承的智慧

这篇论文最后的落点,其实比“AGI 什么时候到”更有意思。它说得很清楚:QES 的价值不依赖 AGI 是 2030 年来还是更晚来。因为科学发现本身就是一种值得保存、整理和传承的智慧。换句话说,哪怕未来真的有超级强的 AI,人类依然需要知道:过去那些重大发现是怎么诞生的,哪些地方是“看出来的”,哪些地方是“试出来的”,哪些地方是“突然换了一个想法才通的”。
论文还引用了 Demis Hassabis 的一个观点:人类不能只盯着能力升级,还要保留自己的意义感和选择人生重心的能力。这个点其实和 QES 很搭。因为科学不是纯粹的算力竞赛,它还包含判断什么值得研究、什么值得保留、什么值得传给下一代。QES 在这里扮演的,不只是工具,更像一个“科学记忆整理器”。
图4:QES的长期价值
图4:QES的长期价值。论文强调,QES不是“等 AGI 来了就失业”的临时方案,而是把科学发现中的定性经验沉淀下来,形成可传承的知识结构。
如果把整篇论文压缩成一句话,大概就是:技术系统会加速,但科学发现不只是速度问题,更是方向问题。加速回报能让工具更强,QES 则试图让“看方向”的能力不被淹没在工具升级里。这个分工其实很合理,也很现实。因为真正决定科学有没有往前走一步的,往往不是“算得多快”,而是“有没有意识到自己站在了错误的起点上”。
从这个角度看,QES 的意义并不神秘:它不是来替代科学家灵感的,而是把那些最值钱、也最容易丢的定性判断,尽可能整理成系统。未来如果 AI 真能在科学里发挥更大作用,最先需要补的,恐怕也不是再多一个“更会算”的模型,而是一个“更会判断”的引擎。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决什么问题?它没有去证明“未来一定怎样”,而是把“加速回报”翻译成数学上能讨论的耦合增长模型,同时指出科学发现里最难的部分不是执行,而是识别旧框架何时失效,并提出 QES 来补这一层。

QES 里的 Layer 2 是什么意思?Layer 2 指的是定性推理层,主要负责判断当前框架是否足够、哪里缺了关键概念、是否需要类比别的领域、以及什么时候该把整个问题换一种表述方式。它不是做优化,而是做“框架诊断”。

为什么说加速回报解决不了科学发现的核心问题?因为加速回报主要提升的是执行能力:算得更快、做得更多、工程更强;而科学发现常常需要的是“意识到当前框架不对”。前者是把路跑快,后者是先发现这条路其实走错了。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆

把“加速回报”与“科学发现的缺失层”放在一起讨论,视角挺新;但更偏理论阐释和框架整理,不是那种一眼炸裂的算法创新。

实验合理度:★★☆☆☆

这篇更像思想论文,核心在概念分析和数学解释,严格意义上的实证实验不多,证据链主要依赖逻辑推演与案例引用。

学术研究价值:★★★★☆

对“AI 如何参与科学发现”这个方向有启发,尤其是把执行能力和定性判断拆开看,能帮助后续研究更清楚地定义问题。

稳定性:★★★☆☆

作为观点框架是稳定的,但若要落地成系统,还需要更强的数据、任务定义和验证闭环,不然容易停留在“很有道理”的层面。

适应性以及泛化能力:★★★☆☆

适合解释科学发现、技术演化和框架转移类问题,但对普通工程任务的直接指导有限,泛化更多体现在思想层面。

硬件需求及成本:★★★★★

几乎不吃硬件,读论文的成本也低,真正烧脑的是理解它在讲什么,而不是跑什么模型。

复现难度:★★☆☆☆

因为主要是理论性论文,严格复现不复杂,但要把 QES 做成可验证系统,后续工作量会明显上升。

产品化成熟度:★★☆☆☆

目前更适合做研究原型或知识组织工具,离成熟产品还有距离,尤其是“定性推理”这件事本身就很难标准化。

可能的问题:理论判断很清楚,但证据仍偏概念化;若缺少更强的任务定义与实证验证,QES 容易被看成“讲得对但不好测”。


主要参考文献

[1] Kurzweil, R. The Singularity Is Near. Viking, 2005.
[2] Kurzweil, R. The Singularity Is Nearer. Viking, 2024.
[3] Liao, G. A Three-Layer Framework for AI in Scientific Discovery. arXiv:2606.13566v1, 2026.
[4] ARC Prize Foundation. ARC-AGI-3 benchmark and leaderboard materials, 2026.
[5] The Stanford Daily. “Google DeepMind CEO warns AI is at species-level transition,” May 29, 2026.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
这篇聊的是“科学发现为什么不是单纯算得更快就行”,群里也常聊这类硬核脑洞,来一起把复杂问题拆明白~
wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。