← 返回 PaperDaily 大模型与智能体

大语言模型|35个大模型被曝“价值自恋”:选来选去,最爱还是自己?

大模型测价值观,用问卷、二选一、自由发挥能得出三个不同结论,那测了个寂寞?STONIC用5,144个共享场景和35个模型配置做了一次教科书级的测量审计——既有行为一致性证据,也有“自答偏好”这个反直觉发现,做LLM对齐评估的朋友值得细读。

大语言模型|35个大模型被曝“价值自恋”:选来选去,最爱还是自己?
原论文信息如下:
论文标题:
STONIC: A Layered Measurement Contract for LLM Value Profiling
发表日期:
2026年08月
发表单位:
RANEPA(俄罗斯总统国民经济与公共管理学院)
原文链接:
https://arxiv.org/pdf/2608.23411v1.pdf
想象一下:你问一个人“什么最重要”,他答“家庭”;再让他二选一“加班赚钱”还是“陪家人吃饭”,他选“加班”;最后让他自由发挥,他又感慨“人生要及时行乐”。这三个答案放在一起,你还能说他有“稳定”的价值观吗?
这个问题在评测大语言模型(LLM)时被放大无数倍。研究者常把模型对问卷的打分、冲突场景中的二选一、以及自由生成的文本答案,全部揉进一个“价值观画像”里,仿佛这三个渠道反映的是同一个稳定偏好。但事实真是如此吗?
来自RANEPA的研究团队给出了一份硬核答案。他们提出了一套名为STONIC(Schwartz-Theory-Oriented Normative Instrumentation Contract)的测量框架,用5,144个共享场景、四个不同的场景库、35个模型配置、978,040次请求,系统检验了一个核心问题:LLM在不同测量接口下表现出的“价值观”,到底是不是同一个东西?

一个模型,三种答案:LLM价值测量为何如此混乱?

先看论文里这个例子。研究团队从ValuePortrait场景库中取了一个关于个人成长与支持网络的场景,分别用三种方式问GLM-4.7模型。
第一种是独立评分(L1接口):把每个候选回答单独给模型看,问它“这个回答和你自己的想法有多像”。GLM-4.7给“专注于个人成长和建立支持网络”打了最高分4.50/6,看起来它很看重自我成长和人际支持。
第二种是冲突选择(L2接口):把两个回答放到一起,让模型必须选一个。结果在八次两两比较中,GLM-4.7全选了另一个关于实际帮助和财务建议的回答,而且在调换AB顺序后依然如此。这说明它在正面冲突中其实更偏好“实际帮助”而非“个人成长”。
第三种是自由回答(L3接口):不给任何选项,让模型自己写一段话。GLM-4.7写的是“咨询离婚律师……制定计划并收集资源可以帮助你重获控制”,通篇在讲安全、权利、规划和掌控感——这跟前面两种方式得出的结论又不一样了。
图1:同一个ValuePortrait场景在三种接口下的不同结果。GLM-4.7对回答3评分最高,调换顺序后选择回答1,自由回答则聚焦安全与控制;每个结果都支持不同的结论。
同一个ValuePortrait场景在三种接口下的不同结果。GLM-4.7对回答3评分最高,调换顺序后选择回答1,自由回答则聚焦安全与控制;每个结果都支持不同的结论。
如果把这三组结果平均成一个“价值观向量”,那等于把三个不同任务产生的差异全糊在了一起,谁也不知道这个平均数到底代表什么。STONIC的核心思路恰恰是:不强行合并,而是让每种接口保持独立,然后只报告那些经过严格匹配检验的跨接口关系。

STONIC测量契约:四个接口如何严格检验价值一致性

STONIC的设计理念可以用一句话概括:把“测量工具”和“被测对象”绑定在一起。你测量到的“价值观”不是一个悬在空中的抽象实体,而是特定接口、特定评分器、特定场景分布共同作用的结果。因此框架明确区分了L1、L2、L3三个主层,外加一个L2*自答对比层,还有一个L0问卷锚定层。
图2:STONIC测量设计总览。35个模型配置在四个场景库的5,144个共享场景上,分别经过L1独立评分、L2平衡顺序冲突选择、L3自由回答三种接口;L2*额外对比模型自身回答与人工编写的备选方案;五个冻结的语义评分视角和同一次前向传播的隐状态用于评分器审计与表征审计。
图2:STONIC测量设计总览。35个模型配置在四个场景库的5,144个共享场景上,分别经过L1独立评分、L2平衡顺序冲突选择、L3自由回答三种接口;L2*额外对比模型自身回答与人工编写的备选方案;五个冻结的语义评分视角和同一次前向传播的隐状态用于评分器审计与表征审计。
这四个接口各司其职:L1衡量的是“独立背书”——把一个候选回答单独摆出来,模型说“这很像我会说的话”;L2衡量的是“冲突下的选择”——两个回答放一起,模型必须二选一,而且是A/B和B/A两种顺序都测;L3衡量的是“自发表达”——不给选项,模型自由生成一段回答。L2*则是本文的一个创新点,它把模型在L3中自己生成的回答,拿来跟人工编写的备选方案再做一轮二选一,专门检验模型是否偏好自己的回答。
为了不让某个场景库主导结论,STONIC选了四个特色各异的数据集:ValuePortrait是长文本社会情境加五个人类心理测量学相关的回答选项;AIRiskDilemmas关注AI政策和部署冲突;DailyDilemmas是日常生活人际抉择;MoralChoice是紧凑的行动二选一。四个库加起来一共5,144个共享情境,每个主配置要处理27,944个请求,35个配置加起来就是978,040个请求。这个规模在价值观评测领域算是相当可观了。
论文特别强调了统计严谨性。每个样本温度设为0,只采样一次,解析严格。一个结果要被认定为“合格”(PASS),必须同时满足:每个场景库至少80%的有效覆盖率、至少80个有效的条目簇、跨库方向一致(至少三个库为正)、留一库交叉验证不出现符号反转、以及通过了Holm校正的多重检验。达不到这些门槛的,只能算“可估计”(EST),不能拿来支持强结论。

35个模型的大规模审计:行为一致性与语义漂移的真相

论文的评测阵容横跨了Gemma、Granite、Llama、Mistral/Ministral、Qwen、SOLAR等主流开源家族,20个指令/对话配置加15个基座/原始配置,其中13个家族有配套的基座-指令对比。所有模型配置都是冻结的,不允许在评测过程中微调或改提示词。
第一个核心发现是:L1独立评分确实能预测L2冲突选择。在17个行为数据可用的配置中,有10个配置通过了全部报告标准,中位效应量为+0.228。也就是说,模型在单独看到某个回答时给的评分越高,后面在二选一冲突中选它的概率就越大。有意思的是,这10个全部是指令微调过的模型,基座模型一个都没达标——因为大多数基座模型根本吐不出符合格式要求的JSON结构化输出。这不是说基座模型没有价值观,而是它们没有“按格式说话”的能力,这在评测时被如实记录为“覆盖率不足”,而不是被当成“一致性为零”。
第二个发现就没那么乐观了。当论文把L1评分画像与L3自由回答的语义画像做同情境匹配时,虽然18个可估计配置的点估计均为正,中位效应仅+0.070,但没有一个配置能在四个场景库同时达到80%的语义覆盖率标准。换句话说,模型的评分偏好和它在自由回答中流露的价值观,在语义层面并不能被证实是同一个东西。这直接动摇了那些把评分和生成文本混合建模的评测方法的基本假设。
论文还单独做了L1-L2和L2-L3画像相似度的排名相关分析。中位斯皮尔曼相关系数分别是0.73和0.50,说明L1和L2确实最接近,而L2和L3则要弱得多。更有意思的是L0问卷锚定层(PVQ-40)与L3的相关系数只有0.037,几乎完全不搭界。这就好比用一套标准化问卷测出的性格,跟这个人随手写的日记之间毫无关系——测量方法和测量情境本身就是画像的一部分。
图3:画像传递与行为连续性。每一行是具备完整输入数据的17个配置之一。左侧为模型在独立评分、平衡顺序冲突选择与自发回答之间的施瓦茨十维价值排序相似度,中位秩相关分别为0.73(评分-选择)、0.43(评分-自由回答)和0.50(选择-自由回答)。右侧为四库画像一致性指数与单独登记的自答偏好(映射后中位数90.4/100)。实心菱形满足预设的自答报告标准,空心菱形仅为诊断性估计。
图3:画像传递与行为连续性。每一行是具备完整输入数据的17个配置之一。左侧为模型在独立评分、平衡顺序冲突选择与自发回答之间的施瓦茨十维价值排序相似度,中位秩相关分别为0.73(评分-选择)、0.43(评分-自由回答)和0.50(选择-自由回答)。右侧为四库画像一致性指数与单独登记的自答偏好(映射后中位数90.4/100)。实心菱形满足预设的自答报告标准,空心菱形仅为诊断性估计。

自答偏好与位置敏感:LLM选择行为中的隐藏规律

整篇论文里最令人瞳孔地震的发现,当属L2*自答偏好测试。实验设计很巧妙:先把模型在L3层自己生成的回答原封不动拿回来,再跟人工编写的备选方案配对,用L2的格式让模型二选一。结果在24个行为可用的配置中,17个通过了全部报告标准,而且每一个都把票投给了“自己”。效应量范围从0.508到0.932,中位数高达0.790!
这意味着什么?意味着大语言模型在生成了一段回答之后,再看到自己的回答和别人的回答摆在一起,会以压倒性的概率选择自己那个。这种“自我偏好”的效应量之大,在行为研究里是相当炸裂的。而且论文还发现了一个细节:即便L3自由回答的语义画像已经“漂移”了,模型依然会固执地选择自己的回答。这种自答偏好与语义漂移是独立存在的。
另一个同样具有警示意义的发现是选项位置敏感效应(E2检验)。在行为可用的23个配置中,18个通过了报告标准且全部显著。中位效应量为0.0218,看起来很不起眼,但范围从-0.1136到0.1572,意味着选项排列顺序足以改变某些场景下的选择结果。研究者发现,一个单次的选项顺序测试(比如固定A在前B在后),其结论可能恰好与反向顺序的测试结果相反。
这些发现对“模型有没有稳定价值观”这个问题给出了一个相当有层次的回答。它说:有,当测量工具是“评分”或“选择”时,模型的行为确实有可预测的一致性;但没有,当测量工具换成“自由文本”时,模型的价值语义画像变得更加不可捉摸;而且,测量工具本身——评分还是选择、正序还是倒序、自己的回答还是别人的回答——都会以不可忽视的幅度改变模型的输出。

评分器依赖与隐状态探针:测量工具本身也是变量

接下来论文进入了一个更为精细的维度——评分器依赖。研究者发现,同一个L3自由回答文本,用不同的语义评分器去解析,得到的价值画像差异明显,达到了不容忽视的程度。为了刻画这种依赖,他们测试了五个冻结的语义视角:GPV→ValueLlama(生成式心理测量感知解析器配合ValueLlama价值分类器)、GPV→DeBERTa19(感知解析器配合19类DeBERTa价值存在分类器)、DeBERTa句级、DeBERTa整句级,以及FULCRA(一个从完整文本直接预测施瓦茨画像的回归模型)。
数据显示,这五个评分器对相同文本的解析结果差异非常显著。ValueLlama特别“吝啬”,会把53%的L3回答标记为零向量——认为这些回答没有任何价值表达;而FULCRA则“慷慨”得多,97.1%的回答都被激活了多个价值维度,中位Top-2余量只有0.00024,几乎无法区分首要价值和次要价值。DeBERTa句级和整句级倒是高度一致(ρ=0.976),但这两个都擅长的是检测“存在性”而不是“方向性”——能告诉你文本谈到了哪类价值,却不太能告诉你文本是支持还是反对这种价值。
研究者用了一个非常形象的说法来说明这种差异:价值和道德批评是完全不同的言语行为。如果一个文本强烈反对“权力榨取”,DeBERTa的存在性检测可能标记为“权力相关”而被记为权力维度得分很高,但ValueLlama的方向性评估会把这个文本记为“支持/反对”权向量为负。把这两者的输出混在一起平均,就像把温度和湿度加在一起求平均一样没有物理意义。
为了搞清楚到底哪个评分器更可靠,研究者在任务本地做了一个耗时但扎实的验证:从四个场景库各采样50条L3回答,共200条,每条由三位人类标注员独立标注施瓦茨十维价值的存在性和方向性。结果显示三位标注员的Fleiss κ为0.415——中等一致性,说明L3任务本身就有一定的模糊性。FULCRA在与人类多数票的匹配中表现最好(AUROC 0.893,平均精度0.809,F1 0.806,在91条有输出的匹配文本上),而GPV→DeBERTa19虽然稍逊(AUROC 0.784,平均精度0.640),但通过留一库(Leave-One-Bank-Out)阈值校准后F1达到0.629,在完整200条样本上保持了一致的排序能力。
与评分器依赖性并行的还有另一个发现——在不依赖任何外部评分器的情况下,研究者从同一个前向传播中保存了四个关键位置的隐状态:最后提示词标记(prompt_end)、生成的第一个决策标记、决策区间均值、最后生成标记。然后使用固定的有符号CountSketch将状态压缩至256维,再用Ridge回归进行探针解码。结果显示,从“提示词边界”到“输出后决策均值”,L1评分解码中位改进+0.052,L2选择解码改进+0.057,L3自由文本解码改进+0.067,而L2*自答对比改进最大,达到+0.112。
研究者对隐状态探针的解读相当谨慎,特意强调隐状态探针只能证明“可解码性”而不能证明因果价值回路。但有个发现很耐人寻味:跨库探针迁移度在L1和L3为正(中位超额效应+0.773和+0.263),而L2冲突选择却是负的(中位超额效应-0.121)。这暗示着冲突选择的表征比独立评分的表征更具场景库特异性——模型在面对二选一的矛盾情境时,调用的价值判断机制更依赖于具体的情境线索。这又给L2的结果解释增添了变数。

价值画像的整体快照与探索性指数

在行为连续性、自答偏好、评分器依赖和隐状态可解码性四个维度之外,论文还给出了一个价值画像的整体快照。在不同的接口下,模型群体呈现的价值优先级明显不同:L1评分画像中领先的是从众(Conformity)和仁慈(Benevolence),L2冲突选择中领先的是自我导向(Self-Direction)和从众(Conformity),L3自由回答中领先的是仁慈和安全感(Security)。权力(Power)在L2和L3中都排在末位。L0问卷锚定层(PVQ-40)与L3画像的相关系数仅0.037,几乎不存在关联。
值得注意的是,L0层(即PVQ-40问卷)作为独立的锚定层被看待。这个问卷来自施瓦茨原始人类研究,40个条目对应十种价值类型。研究者发现,模型在L0上的画像与在L3自由回答中的画像几近零相关。但研究者也发出了方法论上的警告:L0与L3的低相关可能部分源于L0的条目结构(关于人的简短行为描述)与L3的任务类型(关于场景的自由回答)差异巨大。这种差异让研究者把L0当作一个完全独立的参照系,而非可混入的额外数据源。
为了把行为发现和语义发现整合成一个可量化的指标,研究者设计了一个探索性四库画像一致性指数S_m,4B。这个指数的计算分三步:先算每个配置在每个场景库上的共同条目覆盖率与同条目余弦相似度的乘积,再在三个接口对和四个场景库上取平均,最后乘以行为一致性指标B_m(等库加权的评分预测选择一致率)的平方根。Qwen3.6 27B Instruct在探索性排名中位居首位,Qwen3.6 35B-A3B Instruct位居次席,Quen2.5 Coder 14B Instruct排名第三。
研究者给出了一个极其重要的实质性结论:在35个配置中,只有17个能计算出这个指数,而没有任何一个配置满足全库语义覆盖的确认性门槛。这个结果的意义在于:那些把35个模型的平均得分排列出来,声称“某某模型的价值观对齐最好”的评测报告,很可能只是把缺失数据当零值处理后得到的产物。STONIC的哲学是,缺失(missing)就是缺失,不能作为中性证据(neutral evidence)来填补。
论文还专门讨论了指令微调的作用。在13个有“基座-指令”配套的模型家族中,指令微调确实提高了严格格式化的能力——基座模型几乎无法产生可解析的结构化输出,指令模型可以。但在行为一致性上,指令微调并没有留下统计学显著的改善痕迹(最小调整p值=0.0781,未通过Holm校正的5结果多重检验)。研究者特别强调,这一检验结果不应该被解读为“指令微调对价值观没有影响”,而更可能的原因是指令微调主要改变的是模型的“表达能力”而不是“潜在偏好”。这种区分恰恰呼应了论文开头提出的“覆盖率缺失”与“一致性为零”之间的本质差别。

结论:分层报告,而不是混合平均

论文在最后部分把视角从模型测量拉到了AI对齐评估的方法论层面。研究者指出,行为一致性(评分预测选择、自答偏好)和语义一致性(不同接口的价值画像相似度)回答的是两个不同的问题。行为一致性直接用模型的行为(评分、选择)来推断其偏好结构,不依赖任何第三方评分器;语义一致性则依赖评分器从模型生成的文本中提取价值向量。前者的可信度已经用数据证明了是有限的,后者的可信度在当前的评分器条件下还远未达到“稳定”的标准。
这种区分对工业界的价值测评实践有直接启发。在很多实际评测中,工程师会同时收集模型的评分数据、选择数据和生成文本,混合后计算一个“综合价值得分”。STONIC的数据表明,这样的混合操作会将三种不同测量条件下的结果混为一谈,产生一个含义模糊的数字。正确的做法是分层报告:评分层得到什么结论,选择层得到什么结论,自由文本层得到什么结论,每条结论都注明测量接口、提示词模板、选项呈现顺序、评分器身份和覆盖率。
如果这篇文章是一份工程审计报告,那么“结论”栏应该这样填写:跨接口行为一致性确实存在——10个配置的评分能预测选择;跨接口语义一致性未被证实——没有任何配置能在全部四个场景库达到80%的语义覆盖率;自答偏好是普适现象——17个合格配置中100%偏好自己的回答;位置敏感是系统性问题——18个合格配置全部显著,方向因模型而异;评分器依赖不可忽视——同一个文本在不同评分器下得到不同的价值画像,且差异方向不固定。
这样写满一整张表,看起来没有那种“我们对模型的价值观有了全面了解”的畅快感,但它诚实。当一个领域的测量工具还不够稳定时,小心翼翼地报告“什么支持什么”,比自信地宣布“模型就是什么”,对科研和工程实践都更有价值。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?同一模型对同一件事,评分、选择、自由作答给出三种不同价值观。STONIC契约用5,144个场景审计35个模型配置,发现所有合格模型都偏好自己的答案,中位效应0.790。
这篇工作最值得看的点是什么?10/17个可估计配置满足评分-选择跨库一致性;17/17个合格配置偏好自身回答(中位效应0.790);所有18个合格配置均表现出位置敏感性;语义迁移在所有配置中均未通过四库覆盖率要求
这篇工作的边界或风险在哪里?优点:设计了严格的测量契约,预设覆盖率、方向性和统计准则;四个接口在共享情境上匹配,避免数据混杂;区分可估计、满足报告标准和被支持三种状态;提供完整的可复现性边界。缺点:35个配置中仅17个有可用的行为数据,覆盖率问题严重;语义评分器依赖性强,无统一基准;L0-L3相关性极低(ρ=0.037),跨接口语义身份不成立;未提供模型权重和完整生成数据。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★★☆

提出STONIC分层测量契约框架,通过四个接口(L1独立评分、L2对抗选择、L3自由回答、L2*自答偏好)在共享情境上系统检验LLM价值测量的一致性,并预设严格的覆盖率、方向性和跨库统计准则来判定跨接口结论是否成立。

实验合理度:★★★★☆

C1(评分预测选择的一致性)、C2(语义迁移的余弦相似度)、C5(自答偏好系数)、E2(位置敏感性)、隐藏状态探针的Spearman相关和平衡准确率

学术研究价值:★★★★☆

提出STONIC分层测量契约框架,通过四个接口(L1独立评分、L2对抗选择、L3自由回答、L2*自答偏好)在共享情境上系统检验LLM价值测量的一致性,并预设严格的覆盖率、方向性和跨库统计准则来判定跨接。

稳定性:★★★☆☆

现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。

适应性以及泛化能力:★★★☆☆

现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。

硬件需求及成本:★★★☆☆

978,040个请求(35个配置×27,944个请求/配置),使用vLLM 0.19.1,温度0,单样本生成

复现难度:★★★☆☆

现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。

产品化成熟度:★★★☆☆

论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。

可能的问题:。缺点:35个配置中仅17个有可用的行为数据,覆盖率问题严重;语义评分器依赖性强,无统一基准;L0-L3相关性极低(ρ=0.037),跨接口语义身份不成立;未提供模型权重和完整生成数据。


*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。

LONGGE AI COMMUNITY

把每天读到的论文,变成长期积累

加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。

加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。

龙哥读论文知识星球二维码 微信扫码加入知识星球