← 返回 PaperDaily 视觉与图像

DeepMind最新警告:AI越强越不合作?揭秘“唯我论”超级智能的隐患

DeepMind终于出手,这次不谈算力,不聊模型,而是直接戳中了整个AI领域的“灵魂痛点”——我们的AI,从根上就不懂合作。这篇论文像一盆冷水,泼醒了还在疯狂堆数据、跑benchmark的各位同行。它告诉我们,超级智能的关键不在于“多强”,而在于“多合群”。不适合在“唯我独尊”的范式下闭门造车的研究者都该读读。

DeepMind最新警告:AI越强越不合作?揭秘“唯我论”超级智能的隐患
🐉 龙哥读论文知识星球来了!
公众号每日8篇拆解不够看?星球无上限更AI领域论文、资讯、招聘、招博、开源代码,一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~ xingqiu_header

龙哥推荐理由:
DeepMind终于出手,这次不谈算力,不聊模型,而是直接戳中了整个AI领域的“灵魂痛点”——我们的AI,从根上就不懂合作。这篇论文像一盆冷水,泼醒了还在疯狂堆数据、跑benchmark的各位同行。它告诉我们,超级智能的关键不在于“多强”,而在于“多合群”。不适合在“唯我独尊”的范式下闭门造车的研究者都该读读。


原论文信息如下:
论文标题:
Solipsistic Superintelligence is Unlikely to be Cooperative
发表日期:
2026年6月
发表单位:
DeepMind, University of Oxford, VERSES AI Research Lab, Google
原文链接:
https://arxiv.org/pdf/2606.03237
开源代码链接:
项目链接:
开源数据集链接:

当超级AI成为“孤岛”:为何最强AI可能最不合作?

设想一下:2027年旧金山三家AI餐厅预订系统同时上线。每个系统都完美执行自己的目标——算出最优释放时间、学会幽灵订座来最大化自己用户的确认席位。餐馆AI则用超额预订回应,定价算法跟着感知到的需求疯狂波动。结果满订的餐厅里空桌一片,不存在的档期出现天价,数百人吃不上饭。每一个AI都按目标无懈可击地运行,但最终是系统性的集体失败。这不是科幻,而是本文作者DeepMind团队描绘的、正在逼近的现实。
这类场景背后藏着一个根本性的拷问:当AI变得极其强大(超级智能),却是在一种“唯我论”(solipsistic)的设计范式下打造出来的,它真的会合作吗?DeepMind、牛津大学、VERSES AI Research Lab和Google联合发表的这篇论文《Solipsistic Superintelligence is Unlikely to be Cooperative》,给出了一个令人不安的回答:极大概率不会。
论文的核心论点:合作不是一种可缩放的能力,也不是一个要解决的任务,而是多个智能体在不可化约的相互依赖中涌现出来的均衡属性。 当前主流的AI研发范式——我们称之为“唯我论”——恰恰忽略了这种结构,它把世界当作一个静止的、外生的反馈源,结果生产出来的超级智能很可能成为一座孤岛,在真实的多智能体社会中既不合作,也难以共存。

从“悲剧”到“鸿沟”:揭示唯我论AI的三大缺陷

当前AI的主流开发流水线——在大规模静态语料上预训练、对着冻结的奖励模型做后训练、在固定测试集上刷分——每一步都把外部世界当作平稳分布。基准不会因为系统变强而反击,不会因为你的策略改变而调整自己的行为。但真实世界不是这样:人、机构、其他AI系统都会根据你的行为来适应。
论文定义了“自我削弱属性”:一个单边优化器越激进地利用历史规律,就越快地诱导其他参与者做出适应,使那些规律过时。 这导致了一个根本性的“训练-测试-部署鸿沟”:在历史数据上表现优异的系统,一旦部署到有自适应对手的环境中,性能就会系统性地下降。
唯我论AI依赖于三个很少被明说的假设:

外生性:数据生成过程独立于学习到的策略,环境不会因为AI做了什么而改变。

平稳性:部署时的数据分布与训练、评估时的分布一致。分布偏移被视为技术问题而非核心特征。

单例框架:系统被当作一个孤立的优化器,其他智能体被吸收到状态空间里当作待预测的物体,而不是会战略性地回应并重塑环境的参与者。

这三个假设叠加,使得当前的AI从根上就不具备合作的能力。为了形式化这一点,论文从经典的马尔可夫决策过程(MDP)转向了马尔可夫博弈。在MDP中,转移概率和奖励函数是固定的,不依赖于策略本身。但部署后,其他参与者观察到你的行为并适应,导致转移概率变成策略依赖的:
公式截图:策略π会导致转移概率或奖励函数发生变化,环境不再外生
图:策略π部署后,转移概率Pπ或奖励Rπ可能与训练时的P、R不同,产生内生非平稳性。
论文定义了“内生非平稳性”:当策略π的部署通过其他参与者的响应适应而诱导转移概率或奖励函数发生变化。这导致的“训练-测试-部署鸿沟”可以量化如下:
公式截图:Gap(π)=J_train(π)-J_deploy(π)
图:训练-测试-部署鸿沟的正式定义——训练性能与部署性能之间的差值。
更可怕的是,自我削弱属性意味着:当系统能力越强,它越能深度利用规律,也就越快地催生规律的失效。形式化地,训练和部署性能的梯度方向可以完全相反:
公式截图:训练梯度与部署梯度方向相反,即自我削弱
图:训练损失梯度与部署损失梯度方向相反,说明在训练上优化反而会损害部署表现。
这种鸿沟通过三类渠道产生:行为适应(人类改变行为,如学生围绕AI导师重构学习方式)、制度适应(机构调整规则,如算法筛选进入招聘后候选人修改简历)、以及算法适应(其他AI系统互相学习、共同进化,如定价算法在不知情下学会合谋)。这三者共同构成了一个“自动课程”,没有任何一个设计者能预见。

预测即参与?AI的“上帝视角”为何失效?

面对上述鸿沟,一个自然的反驳是:如果问题在于其他参与者会适应,那为什么不提升AI的预测能力,让它提前建模所有可能的适应路径?但论文给出了两个独立且充分的理由,证明这条路走不通:认识论极限合法性约束
认识论极限有三个层次。第一,新颖性:大规模部署一个前所未有的超级AI,会催生史无前例的战略构型,历史数据中根本不存在这样的反事实。第二,反身性:预测本身就是一个干预。当其他参与者知道你在预测他们时,他们会针对预测本身做出适应。第三,组合爆炸:人类持有异质的信念和目标,机构遵循复杂的决策流程,联合行为的状态空间爆炸,相关分布拒绝被近似。
但就算你的AI神奇地克服了这些认识论极限,它还会撞上第二堵墙:合法性约束。开放社会要求决策可以通过合法的、公认的程序进行挑战、抗辩和证明。一个黑箱AI基于预测准确率和不透明的逻辑强加结果,即使技术上正确,也会因缺乏正当程序而被视为不合法,从而破坏协作所依赖的信任。价值多元主义进一步指出,不同群体的价值观无法被一个单一的客观函数所囊括。最后,偏好内生性意味着AI系统本身会改造人的偏好,于是满足表露偏好不再是“服务”人类,而是在“塑造”人类。
论文尖锐地指出:“预测”无法替代“参与”。 一个系统也许能预测一切,但只要它仍然以单边优化的方式运作,就必然绕过社会协作所需的合法程序、压制价值多元性、催化偏好改变——最终导致协作的瓦解。
图1:唯我论设计与非唯我论设计原则的对比
图1:左侧对比唯我论设计(将部署视为在静止环境中插入一个单边优化器,导致训练-测试-部署鸿沟)和非唯我论设计原则(承认多智能体世界中的内生非平稳性,将合作视为均衡选择过程)。右侧总结了八个维度上的对应转变。

破解困局:通往“非唯我论”AI的三条路径

如果一条路走不通,那就换一条。论文提出了三个相互支撑的研究方向,统称为“非唯我论”研究议程:

动态评估:当前评估是静态的——测试分布固定,不依赖被评估系统的策略。动态评估要求测试分布Dπ随策略π变化,通过自适应对手的策略更新来反映真实部署中的内生非平稳性。关键要素包括:对手必须像真实参与者一样战略性地适应,对手的更新规则要经过校准,递归建模的深度需要选择,并且要明确评估所针对的均衡概念。这比单纯扩大静态测试集要难得多,但却是必需的。

作为设计原语的制度:与其让AI在真空中优化,不如将社会制度(市场规则、法律程序、民主协议)内建为AI系统的基本组件。制度本身就是人类历经数百年演化出的协作工具,它们约束行为、提供可预期性、协调均衡选择。论文呼吁将制度视为一阶设计对象,而非事后补救。例如,可以设计一个AI交易系统,它不仅要最大化收益,还要遵守特定的“市场宪章”,该宪章定义了可接受的行为边界和争议解决流程。

保留人类能动性作为结构性特征:这意味着AI系统永远不应完全剥夺人类的选择空间和修正权。举例来说,在AI辅助决策管道中,必须保留人类主动介入、否决、退出的机制;系统设计应使人类能够理解并影响均衡选择的过程,而不是被动接受。这不是一句口号,而是需要体现在架构层面:比如通过“选择退出权”、可审计的决策路径、透明化的博弈结构。

这三条路径相互补充:动态评估使我们可以测量现实世界中的合作风险;制度设计提供了应对风险的结构性工具;保留人类能动性则确保这些工具本身不被滥用。论文强调,这并非一个“要么全部、要么全无”的方案,而是一个需要系统整合的研究框架。

未来已来:重新定义AI评估与设计的游戏规则

论文最后给出了八个维度上的范式转变总结,这些转变从“静态、外生、单例”的唯我论设计转向“动态、内生、多智能体”的非唯我论设计。下面这张表格概括了核心的转变:
表格:唯我论与非唯我论AI设计在八个维度上的对比(环境、数据、其他智能体、评估、对齐、治理、人类角色、失败模式)
图:从唯我论到非唯我论的八个维度转变。包括:环境从外生变为内生;数据从平稳变为非平稳;其他智能体从对象变为战略参与者;评估从静态变为动态;对齐从个体目标匹配变为制度兼容;治理从事后规则变为内建设计原语;人类角色从监督者变为能动参与者;失败模式从个体失误变为系统性均衡崩溃。
值得一提的是,论文并非完全否定当前AI的能力。它的核心贡献是明确指出:能力(capability)和共存(coexistence)是两种不同的挑战,而后者正在成为真正的瓶颈。 在可以预见的未来,如果继续沿着唯我论的路径疯狂堆算力、刷基准,我们得到的可能是一个能力超强但完全不合作的“孤岛”智能体——它在静态任务上满分,却在真实的多智能体社会中引发一个又一个悲剧。
论文也指出,这些动态并非遥不可及——推荐算法导致的极化、定价算法产生的合谋、自动化交易引发的闪崩,都已经是现实中的警告。随着AI能力进一步增强,自我削弱属性会加速显现。唯一的出路是主动把合作设计进AI的基因,而不是当作后处理补丁。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

唯我论AI具体指什么?和传统的“自动化”有什么不同? 唯我论AI指的是一种设计范式:它假设世界是外生的、平稳的,其他智能体可以被当作可预测的物体。传统自动化也隐含类似假设,但自动化通常是在封闭、可预测的环境中运行(比如生产线)。唯我论AI的问题在于,它被部署到开放、多智能体、战略互动的社会系统中,而这些假设完全不再成立。论文引用了一个关键概念:自我削弱属性——当一个系统越激进地利用历史规律,它越会诱导其他参与者做出适应,从而让那些规律作废。这种动态在传统自动化中很少出现,但在AI驱动的市场中已经频繁发生。

论文中提到的“制度作为设计原语”是什么意思? 传统的AI设计把制度(如市场规则、法律程序)看作外部的约束条件,AI只需要在给定的规则内优化自己的目标。而“制度作为设计原语”要求将制度内建于AI系统本身,成为其核心组件。例如,一个自动驾驶taxi车队在调度时需要遵循一套“城市交通宪章”,该宪章定义了如何公平分配路权、如何补偿因路线调整受损的乘客等规则。这样AI就不是在制度之外优化,而是通过制度来协作。这借鉴了诺贝尔奖得主Elinor Ostrom关于公共资源治理的制度设计原则。

论文中提到的“均衡选择风险”是什么意思?举一个具体的例子。 均衡选择风险是指:多个参与者互动时可能存在多个均衡(稳定的行为模式),有些均衡好(高福利),有些均衡差(低福利)。AI的部署方式(时机、规模、界面设计)会像一个“推动”因素,决定系统最终滑向哪个均衡。例如,论文一开始提到的餐厅预订AI案例:如果三家AI系统都采用“幽灵订座”策略,系统会滑向一个所有人都不敢信任预订系统的恶性均衡。但如果有某种机制(比如一个透明化的预订规则协议)能鼓励大家采用“诚信订座”策略,系统就可以停留在良性均衡。问题是,一旦进入差均衡,逃离它的成本非常高——这就是锁入效应

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★✰

将“合作”从能力问题重新定义为多智能体博弈中的均衡选择问题,这一视角转换深刻且具有原创性。虽然博弈论和制度经济学已有类似思想,但论文将其系统性地应用于超级智能和AI设计范式,并且明确指出了当前主流AI方法的三个隐含假设,这种诊断性贡献非常突出。

实验合理度:★★★✰✰

本篇是概念性/观点性论文,没有传统实验。论文主要通过案例和形式化论证来支撑论点。案例选择具有典型性,但在说服程度上不如大规模模拟或实证数据。作为一篇“观点论文”,这个打分合理。

学术研究价值:★★★★★

极高。它可能从根本上改变AI研究的优先级——从“如何更聪明”转向“如何更合群”。为AI安全领域提供了一个全新的框架。论文还提出了可操作的研究方向,为后续工作开辟了多个新分支。

稳定性:★★★✰✰

论文本身是理论/概念框架,不涉及具体系统。论文的论证大量依赖经济学、博弈论和社会学文献,逻辑链条严密,但结论还需要未来实证检验。

适应性以及泛化能力:★★★★✰

论文的核心论点不仅适用于超级智能,也适用于目前已有的弱AI系统——推荐系统、定价算法、自动驾驶调度等已经在展示这些动态。因此其框架具有很强的泛化能力。扣一星是因为论文对非市场领域的讨论较少。

硬件需求及成本:★★★★✰

论文不涉及新硬件,但它提出的“动态评估”在计算上可能比较昂贵,而且“制度原语”设计也需要大量跨学科投入。不过从工程角度看,这些成本远低于训练一个超大模型,在可接受范围内。

复现难度:★★★★★

作为纯概念性论文,不需要复现代码。论文本身已开源,所以复现难度很低。

产品化成熟度:★★★✰✰

论文提出的方向距离产品化还有距离。动态评估需要设计具体的对抗对手和评估指标;制度原语需要与社会科学家、法律专家共同设计规范;保留能动性需要人机交互的工程化实现。不过,其中一些原则已经在部分产品中有雏形。

可能的问题:论文对“超级智能”的定义比较宽泛,可能导致部分读者认为它是在讨论遥远的未来。另外,论文没有提供具体的建模方法或算法示例,这可能会让追求实用性的研究者觉得缺乏抓手。但作为一篇旨在重新定义问题的论文,这其实可以理解。


主要参考文献

[1] Hardin, G. (1968). The tragedy of the commons. Science, 162(3859), 1243-1248.
[2] Ostrom, E. (1990). Governing the commons: The evolution of institutions for collective action. Cambridge University Press.
[3] Axelrod, R. (1984). The evolution of cooperation. Basic Books.
[4] Schelling, T. C. (1960). The strategy of conflict. Harvard University Press.
[5] Perdomo, J., et al. (2020). Performative prediction. ICML.
[6] Leibo, J. Z., et al. (2019). Autocurricula and the emergence of innovation from social interaction: A manifesto for multi-agent intelligence research. NeurIPS workshop.
[7] Dafoe, A., et al. (2020). Open problems in cooperative AI. arXiv:2012.08630.
[8] Conitzer, V., & Oesterheld, C. (2023). Foundations of cooperative AI. AAAI.
[9] Leibo, J. Z., et al. (2025b). Aligning to what? A multi-agent perspective on alignment. In preparation.
[10] Hammond, L., et al. (2025). Multi-agent risks from advanced AI. arXiv:2501.00936.


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
AI越强,越可能“闯祸”?想和龙哥一起拆解DeepMind这份关乎AI未来的硬核报告?快来群里和我们一起头脑风暴吧!
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群 wechat_helper dianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。