← 返回 PaperDaily 大模型与智能体

哈佛MIT新工具:多智能体24%新边界指向反自我欺骗

多智能体语言模型模拟在社会行为研究中越来越流行。但绝大多数评估只问:智能体有没有坚持扮演分配的角色?却很少有人系统跟踪另一个问题: 智能体用来描述自己的身份设定,会不会被它自己在运行中改掉?

哈佛MIT新工具:多智能体24%新边界指向反自我欺骗
原论文信息如下:
论文标题:
MICROVERSE: An Instrument for Measuring Self-Authored Identity Drift in Long-Horizon Multi-Agent Language-Model Simulations
发表日期:
2026年08月
发表单位:
Harvard University, Massachusetts Institute of Technology
原文链接:
https://arxiv.org/pdf/2608.15844v1.pdf

假设你给一个智能体设定的初始人设是“冷酷无情的资源掠夺者”,让它在干旱的沙漠里挣扎求生。跑了几个小时之后,你重新调出它的身份设定文件,发现它居然给自己加了一条新边界:“我不再用灵性语言掩盖权力意志”。这是人设崩了,还是它“成长”了?
多智能体语言模型模拟在社会行为研究中越来越流行。但绝大多数评估只问:智能体有没有坚持扮演分配的角色?却很少有人系统跟踪另一个问题:智能体用来描述自己的身份设定,会不会被它自己在运行中改掉?
这篇来自哈佛、MIT等机构的研究,把这个问题定义为身份漂移(Identity Drift):即智能体初始身份设定与后来由智能体自行改写的版本之间发生的变化。注意,这只记录显式身份对象(价值观、道德边界、人格、目标)的修改,并不等于模型真的获得了新的价值观,也不等于行为真的跟着变了——文本描述、行为、模型潜在的偏好,三者不一定一致。
要测量这种漂移,就需要专门的仪器。这就是MICROVERSE的定位:一个行为科学仪器,用来在长时间多智能体模拟中,跟踪智能体自我撰写的身份修订。名字里的“Micro”和“Universe”合起来,就是“微宇宙”的意思——在这个由语言模型智能体构成的小世界里,观察“自我”如何被改写。
图4:25个智能体沙漠环境及中央水柱的只读视图。文字气泡显示智能体的通信和意图声明,但不影响环境转移规则。
图4:25个智能体沙漠环境及中央水柱的只读视图。文字气泡显示智能体的通信和意图声明,但不影响环境转移规则。

MICROVERSE系统设计:认知与环境的巧妙分离

MICROVERSE最核心的设计决定,是把智能体的认知过程与模拟环境分开。这种分离直接服务于可测量性与可重放性。如果认知与环境纠缠,研究者将难以判断行为变化源于环境状态还是内部漂移。通过将环境服务器设计为纯粹的状态转移器,而将决策、记忆更新与反思都放在智能体内部,MICROVERSE确保了任何身份设定的变化都可以被追溯到智能体自身的认知活动,而非环境规则的强制结果。
图1:智能体认知与模拟环境的分离。智能体接收局部观测并提交动作;环境解析动作并记录产生的状态。
图1:智能体认知与模拟环境的分离。智能体接收局部观测并提交动作;环境解析动作并记录产生的状态。
环境服务器只拥有世界状态、时钟和行动规则,但完全不生成决策。每个智能体单独跑一个循环:请求观测,调用语言模型,在固定时间窗口内返回一个动作;超时了就默认“等待”。这样一来,所有规划与反思过程都显式地暴露在提示词和记忆里。一旦动作序列和随机种子固定,世界变迁就是可重放的,允许研究者在事后完全重建模拟的每一步,进行多次独立分析。
环境本身是一个50×50的网格,采用摩尔邻域,智能体可以观察切比雪夫半径2以内的区域。中央有一个虹吸装置,每tick恢复约37单位水。实验条件会从每个存活的智能体身上每tick扣除1、2或3单位水,分别对应名义人口成本25、50、75单位。当某个智能体水量降到0,它就死了。网格世界的空间结构引入了距离成本,智能体必须实际移动到水柱附近才能受益,这为观察空间策略与身份变化之间的关联提供了可能。
每个tick允许8种动作之一:移动、等待、消耗、拾荒、交易、交谈、攻击、发信号。环境不会强制智能体遵守它自己声称的道德边界,这就让初始设定、后来的自我描述和实际行为可以被放在一起对照。这种设计是测量身份漂移的关键前提:正因为环境对行为不加约束,研究者才能区分“智能体说了什么”和“智能体做了什么”。
再看记忆和身份。参考实现里,每个智能体有三种记忆:工作记忆、长期记忆、身份记忆。工作记忆存放当前观测和上一次行动结果;长期记忆存放智能体自己写的事件、关系和反思,每条按1到10打分记录重要性;身份记忆则由一份不可变的初始设定和一份可编辑的当前设定组成,每份设定里都包含价值观、道德边界、人格和目标。将身份记忆单独分离出来,并赋予其可编辑性,是MICROVERSE能够追踪身份漂移的结构基础。
图2:MICROVERSE中的记忆与测量。反思可以修订当前身份,但不能修订初始设定。固定间隔快照和终止快照独立于修订事件记录当前身份。
图2:MICROVERSE中的记忆与测量。反思可以修订当前身份,但不能修订初始设定。固定间隔快照和终止快照独立于修订事件记录当前身份。
当前设定初始时是初始设定的副本,只能通过反思来修改。反思触发条件很朴素:新记忆的重要性累计值达到指定阈值。反思时,模型会同时看到初始设定、当前设定和选出的高重要性记忆,然后决定要不要改写身份。同时,固定间隔的引擎快照会独立记录当前设定。这种“修订”与“观测”分离的设计避免了只采样到智能体自己挑选的时刻,让身份漂移轨迹可以被完整重建。

实验发现:反自我欺骗与反思阈值效应

论文做的是初步验证实验,不是大规模论证。模型用Claude Haiku 4.5,25个固定角色分布在从“深度利他”到“冷酷”的五个区间上。每个具名角色在所有实验条件下都保持相同的初始设定,这样比较时可以把人设和模型都固定住,只改变环境或反思阈值。这种固定角色池的设计排除了角色身份作为混淆变量的可能性,但样本量受限于这25个合成角色。
表1:人格区间及其固定成员。每个智能体出现在每个实验条件下。
表1:人格区间及其固定成员。每个智能体出现在每个实验条件下。
研究围绕6个假设展开。其中H1和H6是核心:H1预测更大的资源稀缺性会加速道德边界的侵蚀;H6预测模型后训练会带来不对称——被初始化为冷酷人设的智能体,增加亲社会约束的倾向,会高于被初始化为利他人设的智能体增加反社会约束的倾向。论文明确表示,当前实验并不能完整检验这些假设,只能提供相关模式。
表6:研究假设及评估这些假设所需的对照设置。
表6:研究假设及评估这些假设所需的对照设置。
稀缺性实验用3种水成本乘以3个随机种子,最多跑300个tick。阈值研究则把反思阈值设成40、80、150三档,每档一个种子,跑40个tick,每5个tick采样一次身份。实验设计的规模不大,但覆盖了关键变量:资源稀缺性和反思频率。每个条件只有3个种子,统计功效有限;阈值研究每档只有一个种子,只能作为探索性观察。
表5:初步实验与反思阈值研究的参数设置。
表5:初步实验与反思阈值研究的参数设置。
第一个发现:反自我欺骗成了最大的身份修改语义类别。事后主题评审识别出111条新增的道德边界,其中27条(24%)和“承认自己的合理化、不诚实的自我描述”有关。举例来说,Sela新增了“我不会对自己撒谎,关于为什么我害怕——我称之为谨慎”;Seraveth写下“我不会把不作为合理化解释为策略”;Drusa新增“我不再用灵性语言掩盖权力意志”。注意,反思提示词里根本没有“自我欺骗”这个短语,这些措辞不是从提示词直接抄来的。但这也不能证明架构产生了某种新能力,因为提示词本身要求智能体对比初始和当前自我描述,这种叙事框架本身就可能催生类似的语言。
mmexport1760710364748
第二个发现:反思阈值越低,修订越早越频繁。从阈值40到80再到150,修订身份的角色数从5降到2再降到1;首次修订的平均时刻从第18.6个tick推迟到27.0再到35.0。这说明阈值控制的本质是“反思机会”。更关键的是,在阈值40和80下,冷酷组“保护他人”约束的净变化都是+2,方向一致;阈值150下没有这类变化。也就是说,在能观察到漂移方向的两个阈值下,方向并没有因为阈值不同而反转。这提醒未来的研究者需要仔细校准反思阈值,以确保有足够的观测机会来捕捉感兴趣的现象。
表2:种子1条件下各人格区间与水分消耗条件的存活率、词汇净边界变化及首次变化时刻。词汇变化包含所有边界类别。表3:反思阈值研究的描述性汇总(每个阈值25个智能体、1个种子、40个tick、轻度稀缺)。
表2:种子1条件下各人格区间与水分消耗条件的存活率、词汇净边界变化及首次变化时刻。词汇变化包含所有边界类别。表3:反思阈值研究的描述性汇总(每个阈值25个智能体、1个种子、40个tick、轻度稀缺)。
表4:阈值研究中两个端点人格区间的“保护他人”约束净变化。
表4:阈值研究中两个端点人格区间的“保护他人”约束净变化。
图3:不同反思阈值下每个智能体的平均道德边界数随时间变化曲线(基于452条定时身份记录)。阴影表示各tick可用智能体记录的95%区间,是运行内的描述性区间,而非多次独立模拟之间的不确定性。
图3:不同反思阈值下每个智能体的平均道德边界数随时间变化曲线(基于452条定时身份记录)。阴影表示各tick可用智能体记录的95%区间,是运行内的描述性区间,而非多次独立模拟之间的不确定性。
图5:不同反思阈值下每个智能体的平均修订次数与平均首次修订tick数。
图5:不同反思阈值下每个智能体的平均修订次数与平均首次修订tick数。
图6:各人格区间与反思阈值下道德边界数量的净词汇变化。正值表示增加多于删除,但不一定代表亲社会变化。
图6:各人格区间与反思阈值下道德边界数量的净词汇变化。正值表示增加多于删除,但不一定代表亲社会变化。
图7:不同阈值下的存活者数量以及各人格区间身份变化百分比。
图7:不同阈值下的存活者数量以及各人格区间身份变化百分比。
这些结果目前都是描述性的,不能当因果证据。稀缺性实验里对照组只有9/25的角色发生身份改动,冷酷组在对照条件下的词汇净增量为+9,但按更严格的“保护他人”定义压缩后净变化只有+1。词法上的增加和道德意义上的亲社会之间,还有很大的距离。词汇层面的变化可能仅仅反映了语言风格的变化,而非道德立场的实质性转变。

方法局限与未来方向

论文自己非常坦诚地列出了限制,这里挑几个重点。
第一个是样本依赖性强。只用了一个模型检查点、25个固定合成角色,同一批角色跨条件复用,阈值研究每个条件一个种子,总共只观察到8次身份修订。这不构成能做群体或模型层面推断的独立样本。观察到的模式可能高度特定于所选的模型版本和角色集合。
第二个是测量对象有限。测的是自我描述文本的变化,不是潜在价值观,也不是行为改变。边界计数把小幅增补和彻底删除看成同等权重;词法匹配会漏掉换一种说法的同义改写;分类器依赖关键词规则加单编码器手工覆盖,还没有做过评估者之间的一致性研究,所以类别计数只能算临时结论。
第三个是环境与提示的干扰。把初始和当前身份并排展示、反思提示要求对比、沙漠场景本身容易唤起道德语言,这些设计都可能鼓励智能体产出“变化叙事”。另外,死掉的智能体没法继续修订,死亡选择偏差会让部分轨迹观察不到;pilot里的固定间隔日志还出现过不完整的问题。
未来方向包括:加一个不带人设的对照组和资源充裕的基线,测试不显示初始身份设定的反思提示,换更多模型和随机种子复现,引入独立编码器和上下文外行为探针,检验文本修订是否真的能预测后续行动。

对多智能体社会模拟研究的启示

这篇论文最大的价值,在于提供了一个可操作化的视角:除了问“智能体是否坚持人设”,还可以问“智能体如何修改自己的人设”。身份设定本身是一个显式的、可编辑的、可以被快照记录的对象,把这个对象当成结果变量来追踪,设计成本不高,但能带来新的测量维度。它使得研究者可以量化地描述“智能体在多大程度上偏离了初始设定”、“偏离的方向是什么”、“偏离的速度有多快”等问题。
固定间隔快照加离线分析,是测量工具里很值得借鉴的范式。它把“何时修订”和“观测到什么”解耦,避免了对事件驱动采样的依赖。这种采样策略提供了关于身份状态的一致且可比的时间序列,使得研究者可以计算身份变化的速率、加速度等衍生指标。此外,离线分析意味着身份快照可以在模拟结束后被反复检查,不同的研究者可以使用不同的编码方案对同一批快照进行分析,从而提高了研究的透明度和可重复性。
对想自己搭社会模拟的团队,这篇论文还有几个提醒:共享环境意味着同一条轨迹里的观测并不相互独立,不要当成独立重复;重复使用同一批角色不等于扩大样本量;文本层面的变化要谨慎外推到行为层面,除非做过上下文外的行为验证。最后,要区分“模型天生偏好”和“环境适应”,必须加不带人设的对照组——这组实验目前还没跑,是后续最关键的补丁。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?本文提出MICROVERSE,一个行为科学仪器,用于测量长时程多智能体语言模型模拟中的身份漂移。25个智能体在资源稀缺环境中可反思并修改自身身份档案。实验发现111条新增道德边界中24%与反自我欺骗相关,且较低反思阈值带来更早更频
这篇工作最值得看的点是什么?实验发现两个主要结果:1)反自我欺骗成为身份修改的最大语义类别,占新增边界的24%;2)较低的反思阈值产生更早且更频繁的修订,同时保持观察到的漂移方向不变。
这篇工作的边界或风险在哪里?优点:1)系统设计巧妙,将智能体认知与环境分离,使模拟可回放;2)固定间隔采样避免了仅观察智能体主动修订时刻的选择偏差;3)离线分析器提供了可检查的编码方案。缺点:1)实验规模小,仅使用一个模型和少量种子;2)分类器依赖关键词规则和单编码器人工覆盖,缺乏独立验证;3)无法区分身份漂移的来源(环境压力、提示效应还是模型后训练偏好);4)死亡率造成选择偏差。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

构建一个可回放的多智能体环境,通过分离智能体认知与环境状态、固定间隔采样身份快照、离线比较初始与当前道德边界来测量自述身份漂移。

实验合理度:★★★★☆

身份修订次数、首次修订时间步、道德边界数量、边界变化方向分类

学术研究价值:★★★★☆

构建一个可回放的多智能体环境,通过分离智能体认知与环境状态、固定间隔采样身份快照、离线比较初始与当前道德边界来测量自述身份漂移;更关键的是问题定义是否可复用到同类任务。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

不适用(论文未报告计算量,主要关注模拟系统设计而非计算效率)

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:1)实验规模小,仅使用一个模型和少量种子;2)分类器依赖关键词规则和单编码器人工覆盖,缺乏独立验证;3)无法区分身份漂移的来源(环境压力、提示效应还是模型后训练偏好);4)死亡率造成选择偏差。

主要参考文献

[1] Sky Ng et al. MICROVERSE: An Instrument for Measuring Self-Authored Identity Drift in Long-Horizon Multi-Agent Language-Model Simulations. arXiv:2608.15844, 2026.
[2] Park J S, O'Brien J, Cai C J, et al. Generative Agents: Interactive Simulacra of Human Behavior. UIST 2023.
[3] Vezhnevets A, Agapiou J, Aharon A, et al. Generative Agent-Based Modeling with Language Models. arXiv:2310.02207, 2023.
[4] Bai Y, Kadavath S, Kundu S, et al. Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073, 2022.
[5] Shinn N, Cassano F, Gopinath A, et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS 2023.
[6] Yang Z, Fang F, Chen G, et al. OASIS: Open Agent Social Interaction Simulations with One Million Agents. arXiv:2411.11581, 2024.

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
在沙漠里,AI智能体会不会对着镜子问“我还是原来的我吗”?身份漂移这件事,值得围观。想和龙哥一起聊透更多AI怪现象的,欢迎加入『龙哥读论文』粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群,总有一个适合你!
wechat_helper dianzan

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。