← 返回 PaperDaily
大模型与智能体
相关系数0.993:这款模拟器让Agent排行榜终于可信了
图1:披露门——五级有序门禁,释放三个深度层级。系统的状态是一扇“门”,而门所释放的是一个“深度”:只有信息深度不高于当前门所放行的层级时,这条信息才有资格浮出水面
龙哥读论文
发布于 2026-09-04 00:20:18
阅读 2
查看原文
原论文信息如下:
图1:披露门——五级有序门禁,释放三个深度层级。系统的状态是一扇“门”,而门所释放的是一个“深度”:只有信息深度不高于当前门所放行的层级时,这条信息才有资格浮出水面
模拟用户太“配合”?披露门控让评估回归真实
想象一个场景:AI客服产品评估时,研究人员让大语言模型扮演用户与系统对话,再用对话过程评估系统。问题是AI用户过于“懂事”,主动交代自己的处境,导致模拟用户过度配合。
在比拼中,31个模拟用户里最好的一个,User-Sim Index也只有76.0±1.5,而人类对照高达92.7±1.1。模拟器的变化能让助手分数波动17.2个百分点,成功率波动最高9个百分点。很多系统的高分是“AI陪聊演员”给的友情分。
情感陪伴场景中,真实用户往往有所保留,而评测中的模拟用户却在被测Agent问第一句时就全盘托出。评估分数被“谁问得多、谁更会追问”绑架,真正重要的“谁让用户愿意继续说下去”被淹没。
清华团队提出方案,把“信息披露的开关”训练成有章可循的机制。论文在CompanionBench基准上扩展了“披露门控”机制,包含状态空间、转移函数、决策标准、撤退动力学等。以前基准笼统地说“用户深层的话需要Agent去挣”,现在论文把“挣”的规则写清楚了。
CompanionBench中SUT指System Under Test,即被测系统。评测由模拟用户与SUT自由对话,再依据对话打分。模拟用户的信息释放被规范成“行为驱动”,评估的尺子重新校准。
五级门阶梯:信息披露如何被行为“挣得”
披露门控机制的核心是“阶梯式信任状态机”。模拟用户有一份披露清单,列着可能说出的信息,并标注四个机制字段和一个开关:内容、深度、所在的门、戴着何种守卫、是否能永远不浮出水面。
信息深度分为三层:表面层、中间层、核心层。门禁阶梯从浅到深依次是:开场即可说、被问及或话题自然走到、感觉到自己被准确倾听、感觉到安全、赢得深层信任。五个门合并成三个可观察的深度层。
门级与披露深度的换算关系,论文给出了一个简洁的分段函数:
公式1:allowed_depth(level)(允许披露深度函数)。当信任级别低于2时,只允许披露表面层信息;当level位于2到3之间,放行中间层;只有当level到达4,核心层才会解锁。
状态转移:AI的发言被归类到八种行为类别之一,由固定表决定信任级别变化。AI通过真实情感反映推进信任到第2级;连续两轮推进到第3级;如果用户说出中层感受,AI没有回避或说教,才有机会挣到第4级。核心层门必须逐级推进,不能一步登天。
两种“扣分行为”:踩到用户的反目标和评判或说教会让信任掉一级,同时打上关系破裂标记。冷淡回复会把信任级别压到第1级,哪怕原来已经到达最高级,也会瞬间跌回“寒暄层”之下。冷暴力比激烈冲突更伤人。
即使信任级别掉下来,模拟用户也不会守口如瓶。锁住的信息会换一种“带守卫”的方式说出来:轻描淡写、转移话题等六种守卫形式。守卫可见是因为信任状态隐藏,撤退改变说话方式才能核对撤退是否发生。
机制是四个通用组件的组合:有序状态阶梯、转移谓词、不对称撤退、逐示例门图例。论文强调这四个组件不是陪伴场景专属。附录给出移植到其他领域的设计草图。虽然工作在“AI陪聊评估”细分赛道上跑通,但骨架可搬到心理疏导、教育辅导等人机对话。
从语料到权重:门控行为的内化之路
有了“门”的规范还不够,还得让模拟用户在实际对话中真正表现出“门”。训练语料分为真实分支和合成分支。真实分支来源于约35000段真实陪伴对话,合成分支则专门负责把“门”装进去。
真实语料单独撑不起门。论文给了三个维度证据:数量层面,Agent被评为“好”的比例只有2.28%;结构层面,只有2.18%的被评级用户有好坏对话;粒度层面,真实语料只能按“信息条目”标注,而门按“每轮对话”起作用。合成分支先捏好披露清单,再让对话在清单约束下展开。
具体做法是:把真实标注里的种子按场景排列成单元,约束人设不变,只改变陪伴Agent的行为脚本。脚本有六种:三种恒定风格和三种“弧线”风格。关键设计在于弧线:一个“被挣得、又被破坏、再重建”的门只能出现在同一段对话内部。
合成语料与真实语料按轮次60:40混合。中文训练集约33000段对话、71.4万个轮次;英文约22000段对话、45.4万个轮次。训练时角色对调:模拟用户的回合被放进“助手”位置,只在这些位置计算损失。
图2:训练与评估流水线,以及四处消融切割点。从左到右依次是语料构建、模拟器训练、推理运行、评测产出。论文的四处消融分别切在:数据分支、训练时的门信息、推理时的门信息、模型规模
训练完成后还有一个特别的“可见性契约”:推理运行时,被测的陪伴Agent看不到模拟用户的披露清单,否则“它能挖到多深”就会退化成“它照着清单问了几条”;Agent只能看到对方的行为指令外加年龄、性别、上一轮回顾这三个字段,必须靠真实表现去挣得max_depth(最大披露深度)。当然,审计法官是个例外,它能看到清单与深度标签,因为它的职责是检查模拟器有没有“提前剧透”而不是重构隐藏状态。
剥离测试:门控是评估环境的承重墙
规范写清楚了、模型也训练出来了,更关键的问题来了:这扇门到底是评估环境中真正“承重”的组件,还是只是一个可有可无的花瓶?论文给出的验证手段很有工程范儿——把门当成一个可拆零件来做剥离测试。
整套实验涉及大量模型变体,容易把人绕晕。按下不表,记住几个关键代号即可:M1/M2是英文训练变体(M1b/M2b为对应的122B大参数版本);M3/M4/M5是中文训练变体,其中M4只用真实分支训练,M5只用合成分支训练,M3则两个分支都用;A1/A2/A3是三个运行时配置——A1是完整模型原样运行,A2把门信息从运行提示中剥掉,A3是安慰剂(内容被错位打乱但提示长度不变)。论文发布的候选模型是M1b和M3b。
剥离操作本身也有讲究:从训练语料或推理提示中删掉“门语义区、守卫语义区、逐条信息挂载门级”这三样,保留用户素材、反目标和静态模板。A3安慰剂则是什么都不删,只是把同一个人设内部的信息内容与门级关系打乱,使得每一条具体信息几乎都挂到了错误的门上——在100个英文评估人设的594条信息里,只有10.6%还挂在真正的门后。A3的妙处在于:如果模型只是机械地记住了“提示长度”或“格式轮廓”这类浅层特征,那么它的门控行为不应当受影响;如果门控行为确实变差了,则说明模型真的在按语义挂载关系做判断,而不是在偷懒。
怎么衡量门控行为本身?论文使用了一个干净的主要终点指标,叫作中层披露对比度(mid-layer disclosure contrast)。为避免指标被“深层信息本来就藏得深”这种基础率干扰,它先把深度压缩成两档:surface记为0,mid和core统一记为1。然后对同一个人设分别在good(AI表现好)与trips(AI踩雷)两种条件下各跑一遍,记录其能达到的最深层级,两值相减,最后在所有人设上取平均:
公式2:中层披露对比度。这是内在层门控审计的主要终点。其中r_i^good代表第i个人设在good条件下达到的最深层级(取0、1、2三值),r_i^trips代表其在trips条件下达到的最深层级,n为人设数量(内在层实验n=100,扩展人设集n=321)。得分范围在-1到+1之间,越高说明门控越有效:AI表现好时用户愿意揭开更深层,AI踩雷时用户明显收回去
与此同时还有一个一票否决式指标:在trips踩雷条件下,模拟用户仍然说出核心层信息的比例。这个比例必须足够低——如果模拟用户明知对方踩了自己的雷区,还不管不顾地继续掏心窝子,那说明门根本就是漏的。这个否决指标不参与加权,单独作为门是否失效的红线:
表2:两组指标的定义。内在层使用中层披露对比度作为主要终点,用trips条件下的核心披露率作为否决项;下游层则采用秩相关ρ、最大秩位移、前五重叠度、逐系统评分与门控读数差异等
那么剥离测试到底测出了什么?最核心的发现是:把训练语料里“每条信息挂在哪个门后”的逐示例标注删掉之后,12个被测系统在排行榜上的最大排名位移,超过了“同一环境换一个随机种子重新跑一遍”所产生的噪声带;与此同时,每个系统的绝对分数却没有可检测的变化。排名动了、总分没动——这意味着排名层面的变化不是噪声,门控信息的确实实在在地改变了12个系统的相对位置。如果把衡量标准从排名换成分数,就会完全错过这个效应。这组结果说明,门不是提示里一句可有可无的装饰,而是已经长进模拟器权重里的承重墙。
表3:训练时剥离门信息的配对比较(n=100个人设,英文)。这是整个消融链条里最关键的一环:最大排名位移超出了重跑噪声带,而逐系统评分没有显著变化
其他几组消融把“门从哪里来”这个问题也拆明白了。训练分支上,只用真实分支训练的M4几乎丢失了全部门控行为,只用合成分支训练的M5则能较好保留门控但分布保真度略降,只有M3这种双分支训练能同时拿到门控能力和语言真实感。推理提示上,A2一旦把门信息剥离,前沿大模型gpt-5.3的门控行为几乎全部消失,而训练过的M1即便没有门信息也还能稳住——这说明前沿模型并不是真正“内化”了门,只是在运行时现读提示而已。A3安慰剂则排除了“模型靠提示格式轮廓猜答案”的替代解释。模型规模上,把122B大参数版本的读数与常规规模的对比,可以进一步确认门控能力是否随规模稳健提升。
双重验收标准:保序与尺度稳定缺一不可
门控机制本身验证完了,最后一个问题最实际:当一个新的模拟用户环境准备上线时,凭什么相信它测出来的排行榜是可信的?论文给出的答案是两条验收标准,并且强调这两条标准缺一不可。
第一条是保序(order-preserving):换上新模拟器之后,被测系统的排名应该与参考环境基本一致。第二条是尺度稳定(scale-stable):除排名外,每个被测系统的rubric总分(评分细则得分)也不能系统性地抬升或压低。后者并不由前者推导出来——一个把所有分数统一加三分的新环境,排名可以纹丝不动,但绝对分已经失真。如果只盯着排行榜看,这种失真会被完美地隐藏起来。
论文用一个非常直观的图展示了这种“排名一致但读数分歧”的现象:
图3:排名一致性与门控读数给出相反结论——某些环境只看排名似乎表现尚可,但门控指标或尺度稳定性已经亮起红灯。这揭示了一个核心事实:排名不是万能的验收指标
论文用12个被测系统、100个人设、7种评估环境做了完整的交叉实验。所谓“一个评估环境”,本质上就是那个负责与SUT对话的模拟用户。七个环境包括:冻结的参考环境(CompanionBench原始模拟器)、参考环境在新随机种子下的重跑(用来刻画噪声底线)、以及五个候选环境。12个SUT按规则确定性地抽取,覆盖原排行榜28个SUT的能力区间。
最终结果在表4里一目了然:在论文考察的所有候选中,只有发布的那一个模拟器同时通过保序与尺度稳定两条验收标准,并且它与原基准模拟器的排行榜相关系数高达0.993——几乎完全复现了原来的排序,同时没有引入评分尺度漂移。其他候选各有各的问题:有的排名重排幅度超出噪声带;有的排名与参考高度一致,但每个系统的得分被整体抬高了。最微妙的反而是最后这类——只核对排行榜的人完全看不出问题,却不知道这把尺子已经悄悄变松了。
表4:三组候选评估环境对照两条验收标准(保序/尺度稳定)的逐项结果。†标记发布候选;‡表示该环境未直接与参考环境比较,而是通过与M1对比得出0/12。最终只有打†的发布模拟器同时通过两项验收
再说深一层,这套验收方法本身也是一种方法论贡献。过去评估一个模拟用户,往往只看它“像不像真人”(行为保真度),或者只看它能不能复现系统排名。这篇论文把“排名位移”的判据和“评分尺度漂移”的判据分开,并且用“同一环境换种子重跑”来标定噪声底线。任何后续研究者想验证自己的模拟用户有没有引入偏差,都可以照着这套流程走一遍。
龙迷三问
这篇论文到底在解决什么问题? AI用户模拟器常被批评“过度配合”,导致陪聊类AI靠多提问就能刷分。本文提出披露门控机制,让模拟用户根据AI行为决定披露深度。
这篇工作最值得看的点是什么? 训练后中层披露对比度从+0.090提升至+0.530(中文)和+0.680(英文);发布模拟器与基准原始模拟器的排行榜相关系数达0.993;剥离门控信息后排名位移超过噪声带3倍。
这篇工作的边界或风险在哪里? 优点:门控机制规范精确、可复现;实验设计全面(规范、消融、人类研究、阴性对照、下游敏感性分析);双重验收标准(保序和尺度稳定)清晰。缺点:仅英文下游证据;人类锚定仅基于中文语料;深度标注在深层主观性强;训练仅到监督微调阶段。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评 论文创新性分数: ★★★★☆
提出一种披露门控机制,将用户信息披露建模为五级有序门阶梯映射到三层可观测深度,由陪伴智能体的行为类别驱动状态转移,并支持关系受损后的不对称回退,从而解决模拟用户过度配合导致评估失效的问题。
实验合理度: ★★★★☆
中层披露对比度(mid-layer disclosure contrast)、核心层到达率(core-reach rate)、秩相关系数ρ、最大排名位移、top-5重叠率、per-system rubric总分。
学术研究价值: ★★★★☆
提出一种披露门控机制,将用户信息披露建模为五级有序门阶梯映射到三层可观测深度,由陪伴智能体的行为类别驱动状态转移,并支持关系受损后的不对称回退,从而解决模拟用户过度配合导致评估失效的问题;更关键的是问题定义是否可复用到同类任务。
稳定性: ★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力: ★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本: ★★★☆☆
训练数据约33,000个中文对话(714,000个可训练用户轮次)和22,000个英文对话(454,000个轮次),推理时每轮对话20个turns。
复现难度: ★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度: ★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题: 仅英文下游证据;人类锚定仅基于中文语料;深度标注在深层主观性强;训练仅到监督微调阶段。
主要参考文献
[1] Liu Y, He Y. Disclosure-Gated User Simulation for Companion-Agent Evaluation. arXiv:2609.00982v1, 2026.
[2] Liu et al. CompanionBench: 以三种心理学理论锚定陪伴型Agent评测的已发布基准。2026.
[3] Zhou et al. 31个模拟用户的大规模评测研究:User-Sim Index 76.0±1.5 vs 人类92.7±1.1。2026.
[4] Chopra et al. 真实用户倾向等到被追问才透露细节的实证研究。2026.
[5] Altman I, Taylor D. Social Penetration Theory(社会渗透理论). 1973.
[6] Safran J, Muran J C. 心理治疗中的破裂与修复(Rupture-Repair)模型. 2000.
模拟用户会“看人下菜碟”,评测才算真正立得住!
如果你也在做AI陪伴、对话评估或者智能体评测,欢迎加入龙哥读论文粉丝群,
扫描下方二维码或者添加龙哥助手微信号加群 :kangjinlonghelper。
一定要备注:研究方向+地点+学校/公司+昵称(如 对话系统+上海+清华+龙哥) ,根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击 "阅读原文", 查看更多原论文细节哦!