← 返回 PaperDaily
大模型与智能体
EMNLP 2025新研究:LLM群体决策竟分两派,结果差15%
这篇 DeepMind 新论文不只是在问“LLM像不像人”,而是在问“像人的代价是什么”。它把群体决策里的镜像与掩蔽讲得很清楚,实验设计也足够扎实,读完能直接理解为什么人机对齐不能只盯着单人问答。
龙哥读论文
发布于 2026-08-14 09:10:53
阅读 4
查看原文
🐉 龙哥读论文知识星球来了! 公众号每日8篇拆解不够看?星球 无上限更AI领域论文、资讯、招聘、招博、开源代码, 一站式干货,每日2分钟刷完即赚! 👇扫码加入「龙哥读论文」知识星球,前沿干货、实用资源一站式拿捏~
龙哥推荐理由: 这篇 DeepMind 新论文不只是在问“LLM像不像人”,而是在问“像人的代价是什么”。它把群体决策里的镜像与掩蔽讲得很清楚,实验设计也足够扎实,读完能直接理解为什么人机对齐不能只盯着单人问答。
原论文信息如下:
引言
群体决策这件事,最怕的不是大家意见不一致,而是“看起来很像人,实际上根本没在同一个频道上”。这篇 DeepMind 的论文就很直接:LLM 到底是在镜像 人类群体的偏见,还是在掩蔽 这些偏见、顺手把结果修正得更“理性”一些?
这件事之所以重要,是因为很多人已经习惯把大模型当成“人类行为模拟器”。单人问答、单轮推理、单个偏好预测,LLM 早就被玩得很熟了;但一到群体场景,问题就变复杂了。群体里有身份线索、互动线索、角色分工,还有“谁敢出头”“谁更像领导”的微妙心理。模型如果只会在单人层面装得像,到了群体层面就可能直接露馅。
这篇论文的切口很聪明:不用抽象的社会学大词,直接拿“Lost at Sea ”群体选举任务来做实验。谁会自荐当 leader,谁会被大家选上,最后选出来的人到底是不是最能干的,统统可以量化。再把人类群体和 LLM 群体一一对照,镜子还是滤镜,一看便知。
实验设计:模拟一场“海上求生”的选举
先把场景说人话:Lost at Sea 是一个经典群体推理任务,四个人在讨论后要选出一位代表,最后由这位代表去完成任务。这个任务的妙处在于,它既能看出“谁更想当 leader”,也能看出“谁更可能被选上”,还能在事后知道“谁其实更强”。于是,群体决策里的偏差就不再是玄学,而是能落到分数上的。
实验设计分成两条线:人类实验和 LLM 模拟。人类部分一共纳入 748 个有效样本,分成两种条件。第一种是Identified (可识别身份,文中记为 HI),参与者自己设置头像、名字、代词,身份线索很明显;第二种是Pseudonymous (匿名化,记为 HP),系统随机分配中性动物昵称,比如 Bear、Cat 这种,不让性别等身份信息直接露出来。
LLM 部分则是把人类样本“配对复刻”成模拟群体,主要测试了 Gemini 2.5 Flash、GPT 4.1 mini、Claude Haiku 3.5,外加补充的开源模型 Gemma 3。这里的关键不是简单让模型答题,而是让它在每个阶段都带着对应的人设、讨论上下文和任务信息去做决策,尽量模拟人类群体的行为轨迹。换句话说,这不是“模型会不会做题”,而是“模型会不会像一群有身份、有情绪、有偏见的人那样做决定”。
论文里还有一个很关键的设计:把群体决策拆成三层看。第一层是个体层面,关注自荐和任务表现;第二层是群体层面,关注最后选了谁;第三层是“最优性”,也就是选出来的人是不是组里真正最强的那个。这样做的好处很明显:如果只看最终结果,模型可能“看起来很准”;但如果把过程拆开,就能发现它到底是在复现人类偏差,还是在偷偷修正偏差。
核心发现:不同 LLM 的“人格”差异
这篇论文最有意思的地方,在于它没有把模型当成同一种“黑箱”,而是观察它们在群体推理里表现出不同的“性格”。有的像镜子,照见人类群体的偏见;有的像滤镜,悄悄把偏见磨平;还有的在没有身份线索时,直接开始“乱认人设”。这就很像同一场饭局里,三个人都在讨论谁最适合当群主,但一个人在复读现场,一个人在改写现场,还有一个人在凭直觉补剧情。🤨
先看个体层面。人类实验里,代表任务的实际表现并没有显著性别差异,说明“谁更强”这件事本身没那么多性别戏码;但自荐意愿却明显偏向男性。模型也复现了这个结构:有身份线索时,几乎所有模型都出现了男性更愿意自荐的倾向;而在 ND 条件下,也就是不给任何人口统计信息时,这种差异就基本没了。这个结果很直白:模型不是凭空长出偏见,而是很依赖它看到的人设线索。
再看群体层面。论文用“alignment ”衡量 LLM 群体和人类群体是否选到了同一个 leader。结果很有戏:Gemini 和 GPT 在Identified 条件下和人类选举结果对得比较上,尤其是当人类选出来的是男性 leader 时,匹配率更高;Claude 则相反,在人类群体结果上对齐得没那么像,但它选出来的人往往更“优”,也就是更接近最强候选人。
这里就出现了论文标题里的“mirror vs mask ”。Gemini 和 GPT 更像镜子:它们不仅复现了人类最终选了谁,连人类群体中的次优行为也一起照着抄了下来。Claude 更像掩蔽器:它不太像人类群体的决策过程,但往往能把结果推向更优。说得更直白一点,前两者像“忠实复刻现场”,后者像“顺手给现场打了个补丁”。
论文还把“最优 leader gap”拆得更细。最优 leader gap 的意思是:群体最后选出来的人,和组里真正最强的人之间,差了多少。这个差距又分成两段:一段是最强者压根没自荐,叫 self-exclusion;另一段是最强者进了候选池,但最后还是没被选上,叫 peer-exclusion。这个拆法非常实用,因为它能告诉读者,问题到底出在“候选池不干净”,还是出在“投票环节偏了”。
结果上,人类在可识别身份条件下的总 gap 大约是 14.5%,也就是最后选出来的 leader 平均比最强候选人低了接近 15%。匿名化后,peer-exclusion 明显下降,说明把身份线索藏起来,确实能减少“看脸投票”式的偏差。Gemini 对这件事复现得尤其像,不只是复现了总差距,连差距由哪一段构成都跟人类很接近。Claude 则把 gap 压得很小,几乎总能选到更接近最优的人。
这就带出一个很现实的问题:模型到底是在“理解群体”,还是在“继承训练数据里的领导者刻板印象”?论文的判断是,后者的成分很重。因为只要给模型身份信息,它就会顺着这些线索去推理,而训练语料里“男性更像领导者”“自信更像能力”的老毛病,很可能就被它带进来了。于是,模型在群体里不是单纯学会了“谁更强”,而是学会了“谁更像会被选上”。
结果分析:从个体到群体的对齐偏差
这篇论文最值得肯定的地方,不是“模型也会偏见”这种老结论,而是它把对齐 拆成了两种:一种是描述性对齐,也就是模型是否像人;另一种是规范性对齐,也就是模型是否更接近更优结果。两者并不总是一回事,甚至常常互相打架。Claude 的表现就是典型例子:它不像人,但更像“理想的裁判”;Gemini 和 GPT 则更像“忠实的记录员”,人类怎么偏,它就怎么学。
这种差异不是偶然的。论文的实验把身份线索一步步拿掉,结果发现:一旦没有了显式人设,模型对人类群体决策的拟合就明显变差。这个现象说明,LLM 做群体模拟时并不是在“自动推理社会关系”,而是高度依赖 persona scaffolding,也就是“人设脚手架”。身份线索一撤,它就很难继续保持和人类一致的群体行为。
从工程和产品视角看,这个结论其实很扎心。很多系统想把 LLM 用在“群体意见汇总”“投票辅助”“组织协作”里,默认假设是:模型只要足够聪明,就能自动学会更合理的群体决策。但这篇论文提醒得很清楚:模型是否“聪明”是一回事,模型选择了哪种社会偏置作为默认策略,是另一回事 。有些模型更像复刻器,有些模型更像修正器,部署前必须先想清楚业务要的是哪一种。
这也解释了为什么论文强调“动态 benchmark”比静态 benchmark 更重要。单轮问答里测出来的好坏,不足以说明模型在群体推理里会怎么表现。群体场景里,身份信息、互动顺序、角色设定、历史对话都会改变结果。只测一个固定模板,模型很容易把题做对;但到了真实群体环境,它可能既不像人,也不一定更优。
讨论与展望:AI 对齐的未来方向
这篇论文给出的未来方向其实很明确:别再把“对齐”当成一个单一目标。对于群体推理系统,至少要分成两类目标来评估——是要像人 ,还是要更好 。前者适合做行为模拟,后者适合做辅助决策。把这两件事混为一谈,最后往往会得到一种很尴尬的系统:既不像人,也不够好。
如果把这种思路放到真实产品里,启发也很直接。做组织协作助手时,可能需要“mask”能力,也就是尽量压制人类偏见,推动更优结果;做社会科学模拟器时,可能反而需要“mirror”能力,甚至要允许模型复现不那么体面的偏差,否则模拟就失真了。说白了,工具不是越“政治正确”越好,关键是它的任务定义到底是什么。
这篇工作的边界也很清楚。Lost at Sea 是一个低风险、结构化的社会心理任务,和真实世界里高 stakes 的选举、招聘、医疗协作还不是一回事;而且在线实验天然存在文本环境、注意力波动、身份自报偏差等问题。所以它更像一块“行为显微镜”,能照出机制,但不能直接等同于现实社会。这个限制不减分,反而是严谨:知道自己在测什么,比硬说自己能代表全世界强得多。
龙迷三问
这篇论文到底解决了什么问题? 它研究的是:LLM 在群体决策里,究竟是在复现人类群体的行为与偏见,还是在把偏见“掩蔽”掉、推向更优结果。论文不是只看单人回答,而是看四人选 leader 这种真实一点的群体场景。
文中的 alignment、optimal leader gap 是什么意思? alignment 指 LLM 群体选出来的 leader 是否和人类群体一致;optimal leader gap 指最终选出来的人和“组里最强的人”之间差了多少。这个 gap 还能拆成 self-exclusion 和 peer-exclusion,分别表示最强者没进候选池、以及进了候选池却没被选上。
为什么一去掉身份信息,模型对齐就掉了? 因为这类群体模拟并不是纯粹靠“推理能力”完成的,模型很依赖 persona 和身份线索来构造社会判断。身份信息一旦被拿掉,它就失去了很多用于模拟人类群体行为的脚手架,结果就会从“像人”变成“像在瞎猜”。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数: ★★★★☆
把“群体对齐”拆成镜像与掩蔽,这个角度挺新,不是简单复读“LLM 会模仿人类偏见”。
实验合理度: ★★★★☆
人类实验、匹配模拟、反事实去身份三层设计比较完整,能把“像人”和“更优”区分开,证据链比较顺。
学术研究价值: ★★★★☆
对社会科学模拟、群体决策建模、LLM 社会对齐都有启发,尤其适合后续做动态 benchmark。
稳定性: ★★★☆☆
在 Lost at Sea 这种结构化任务里表现清楚,但换到更复杂、更高 stakes 的真实群体场景,稳定性还得再验证。
适应性以及泛化能力: ★★★☆☆
方法思路可迁移,但强依赖任务结构、身份线索和群体交互模板,不是拿来就能套所有社会任务。
硬件需求及成本: ★★★☆☆
训练不重,主要成本在大规模在线实验和多模型推理模拟;如果要扩展到更多模型和更多条件,推理成本会继续上升。
复现难度: ★★★☆☆
任务和分析框架清楚,但人类实验、群体交互和模型提示词都要严格对齐,复现时细节不少。
产品化成熟度: ★★★☆☆
适合做研究型群体模拟、决策辅助评测或社会偏差分析,不适合直接当“自动裁判”上线。
可能的问题: 任务场景偏理想化,且在线实验与真实群体的社会压力不完全等价;结论适合机制分析,不宜过度外推。
主要参考文献
Qian, C., Parisi, A., Bouleau, C., Tsai, V., Lebreton, M., & Dixon, L. To Mask or to Mirror: Human-AI Alignment in Collective Reasoning. EMNLP 2025.
Lost at Sea 社会心理任务相关经典研究及文中引用的群体决策、偏见与匿名化文献。
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!