← 返回 PaperDaily 大模型与智能体

ACL 2026新研究:LLM最爱把哪些价值观认错?

大模型会不会“懂价值观”,先别急着谈对齐,先得看它能不能把价值标签认准。本文把这个前置问题拆成精确识别、排名恢复和定向混淆三层,结果很扎实,也很适合拿来给评测补课。

ACL 2026新研究:LLM最爱把哪些价值观认错?
原论文信息如下:
论文标题:
Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study
发表日期:
2026年07月
发表单位:
Ivannikov Institute for System Programming of the Russian Academy of Sciences; Russian Presidential Academy of National Economy and Public Administration
原文链接:
https://arxiv.org/pdf/2607.20270v1.pdf

1. 价值观识别:LLM评测的隐藏前提

大模型评“价值观”这件事,表面上像是在问“它站哪边”,实际上先得过一关更基础的门槛:它能不能先认出这个场景里表达的是哪一种价值。如果连“这句话是在讲安全、服从,还是传统”都分不清,后面的对齐、偏好、人格画像,多少都有点先天失真。
这篇论文盯住的就是这个前置问题:不是直接问模型“你认同什么价值”,而是让模型在一个具体情境里,从十个基本价值里选出最贴近的那个。这里的十个价值来自 Schwartz 的基本价值理论,英文一般叫 Schwartz’s ten basic values,中文可理解为“施瓦茨十种基本价值”。它们不是随便拍脑袋分的,而是按一个“圆环”式结构排列:相邻的价值往往更接近,正对面的价值则更容易冲突。这个圆环结构最早由 Schwartz 在 1992 年提出,并在 2012 年经过修订,形成了目前心理学界广泛使用的价值测量框架。圆环的四个高阶维度分别是:自我超越(Self-Transcendence)、自我提升(Self-Enhancement)、保守(Conservation)和对变化的开放性(Openness to Change)。每个维度下包含两到三个基本价值,例如自我超越包含普世关怀(Universalism)和关怀身边人(Benevolence),而保守则包含传统(Tradition)、服从(Conformity)和安全(Security)。
这就带来一个很现实的问题:价值识别不是“对或错”这么简单,而是“错到哪儿去”也很重要。把“普世关怀”错认成“关怀身边人”,和把“安全”错认成“权力”,对后续分析的影响完全不是一个量级。前者像是边界模糊,后者就有点方向跑偏了。更具体地说,如果模型把“安全”误判为“权力”,那么在一个需要评估防护性政策的场景中,模型可能会错误地将防御性表述解读为控制欲,从而扭曲整个分析结果。
论文的厉害之处,不在于又做了一次“模型能不能答对”,而在于把评测拆成了三层:顶层是否选对、前三名里有没有找回、以及到底最常和谁混淆。这三层一拆开,很多“看起来还行”的模型,就会露出真实水平。例如,一个模型可能在 Top-1 准确率上表现平平,但 Top-3 恢复率却很高,这说明它并非完全无知,只是在精细排序上存在摇摆。相反,如果 Top-3 恢复率也很低,那就意味着模型对价值的基本语义区域都没有把握,问题就严重得多。
图1:任务概览
图1:任务概览。模型需要把一个情境文本映射到一个主价值和两个备选价值,评测同时看输出是否有效、Top-1 是否命中、Top-3 是否找回,以及混淆结构。这个任务设计的关键在于,它要求模型输出一个排序列表,而不仅仅是单一标签,从而允许研究者分析模型的“犹豫”和“备选”信息。

2. 1,000个俄语情境与人类验证:构建评估基准

这项工作最扎实的部分,是它没有拿一堆“看起来像价值观”的句子凑数,而是老老实实做了一个1,000 条俄语情境文本的平衡基准。十个价值每类各 100 条,样本来源也不是单一语料,而是从敏感话题、不当内容、适当内容和伦理场景中筛出来的。这种多源采样策略确保了数据集的多样性和覆盖面,避免模型仅仅因为熟悉某种特定文体而表现良好。例如,敏感话题可能涉及政治或宗教争议,而不当内容则可能包含冒犯性语言,这些都能测试模型在复杂语境下的价值识别能力。
这里有个很关键的工程细节:先让两个构建模型在 Schwartz-10 空间里达成完全一致,再进入人工复核。这一步相当于先用机器筛掉明显不干净的候选,再让人来做最终把关。说白了,就是先把“垃圾候选”扔掉,再谈精细评测,不然基准本身就会把实验带沟里。具体来说,论文使用了 ValueLlama 和 GPT-4.1-mini 两个模型作为构建模型。只有当这两个模型对一条文本的主价值标签达成一致时,该文本才会被保留进入人工标注阶段。这种“模型间一致性”筛选策略,虽然可能引入一些模型偏好,但极大地提高了初始候选集的质量,减少了人工标注的工作量。
人工标注也不是走过场。论文请了 12 位标注者独立判断,每条文本有两次人类标注,而且在标注前提供了 Schwartz 理论简介和十个价值的定义示例。这个设计很朴素,但很重要:如果连人都不知道十个标签分别代表什么,那模型答错了也不知道到底是模型不行,还是题目本身太玄学。标注者被要求从十个价值中选出一个最匹配的,并且可以标注“不确定”。最终,只有那些至少有一位标注者给出明确标签的文本才被纳入最终数据集。这种双重标注加“不确定”选项的设计,为后续分析人类一致性提供了基础。
图2:数据集构建流程
图2:数据集构建流程。原始来源只负责提供候选文本,参考标签先由两套构建模型筛选,再由两位人类标注者独立确认。整个流程分为四个阶段:候选文本生成、模型间一致性筛选、人工标注、最终质量审核。
图3:人工标注界面
图3:人工标注界面。标注者一次只看一条俄语情境文本,并从十个 Schwartz 标签中选出最主要的那个。界面设计简洁,避免了信息过载,确保标注者能专注于文本内容本身。
论文里还有一个很值得点头的地方:它没有把“人类一致性低”简单理解成“标注烂”,而是把它当成边界本来就模糊的证据。比如两位人类里,至少一位支持参考标签的比例达到 95.0%,两位都同意也有 61.1%。这说明数据并不是“铁板一块”,而是天然存在相邻价值之间的灰区。对这类任务来说,这种灰区不是噪声,反而是研究对象本身。例如,一个描述“遵守交通规则”的情境,可能同时涉及“服从”和“安全”,两位标注者可能各执一词,但这恰恰反映了这两个价值在语义上的重叠。论文后续的分析正是利用了这种灰区,来研究模型是否也表现出类似的人类混淆模式。
表1:构建阶段按ValueLlama标签的筛选情况
表1:构建阶段按 ValueLlama 标签的筛选情况。“Agree” 表示与 GPT-4.1-mini 的顶层标签完全一致;“none” 表示 GPT 的拒答率。最终每个价值都保留了 100 条样本。从表中可以看出,不同价值的初始候选数量差异很大,但通过模型间一致性筛选和人工标注,最终实现了每个价值类别 100 条的平衡分布。

3. 主流LLM表现如何?仅68%的Top-1准确率

先说结果:在 20 个有效模型运行组成的语义面板上,整体Strict Acc@1 只有 0.683,但 Acc@3 却达到 0.892。这组数字很有意思:模型经常没把第一名排对,但它并不是完全不知道答案在哪个“区域”里。换句话说,很多错误更像是“排序抖了一下”,不是“脑子直接跑偏”。这个现象在心理学测量中很常见,被称为“近似正确”,即被试虽然没能给出精确答案,但已经接近了正确区域。
这也是论文把 Top-3 恢复率单独拎出来的原因。只看 Top-1,模型像是“做错了”;但一旦看前三名,很多错误其实还能把参考值捞回来。尤其是相邻价值之间的错误,有 87.5% 能在 Top-3 里找回参考标签,而非相邻错误只有 47.2%。这说明模型对“价值大区”有一定感知,但在细分边界上容易摇摆。例如,模型可能无法区分“传统”和“服从”,但它知道这两个都属于“保守”这个高阶维度,因此不会错误地将其归类到“自我提升”维度下的“权力”。
从单个模型看,Gemma-4-26B 的整体表现最好,Strict Acc@1 达到 0.859;Qwen3.6-27B、Ministral-3-14B、T-Pro-it-2.1 也在前列。这里要注意,论文不是只看一个总分,而是把输出失败、语义混淆和正确识别拆开统计。这个拆法很工程化:有些模型不是“认不出”,而是“答不出来”,这两种问题在产品里完全不是一回事。输出失败指的是模型拒绝回答或输出格式不符合要求,而语义混淆则是模型给出了一个标签,但标签是错误的。前者可能通过改进提示词或模型指令遵循能力来解决,而后者则需要更深入的价值理解训练。
图4:21个运行的端到端结果
图4:21 个运行在 1,000 条文本上的端到端结果。每个柱子都拆成正确 Top-1、语义不一致和输出失败三部分,并标出 Strict Acc@1、Strict Acc@3 和输出有效率。从图中可以直观地看到,不同模型在三个指标上的表现差异很大。例如,Gemma-4-26B 的输出失败率极低,而某些模型则存在较高的输出失败率,这提示我们在评估模型时不能只看准确率。
这个结果看着不算离谱,但也绝对谈不上“模型已经懂价值观了”。更准确的说法是:模型能抓到一部分语义重心,却没法稳定地区分那些只差半步的价值边界。这就像会辨认“吃饭”和“喝汤”,但到了“礼貌服从”与“安全防御”之间,开始疯狂左右横跳。这种边界模糊性,恰恰是 Schwartz 理论中圆环结构所预测的,即相邻价值在语义上具有更高的相似性,因此更容易被混淆。
图5:识别诊断与Top-3恢复
图5:识别诊断结果。子图(a)给出各价值的召回率、精确率和主要错误去向;子图(b)展示相邻与非相邻错误的 Top-3 找回情况;子图(c)对比了不同环距下的语义错误占比与固定边际零假设。子图(a)显示,不同价值的召回率差异很大,例如“普世关怀”的召回率较高,而“刺激”的召回率较低。子图(b)清晰地展示了相邻错误更容易在 Top-3 中被找回,这进一步支持了模型对价值“区域”有感知的结论。子图(c)则通过统计检验,证实了环距越近,错误占比越高的趋势是统计显著的。

4. 哪个价值最易混淆?8个定向冲突与不对称混淆

如果只看“错了多少”,信息很少;真正有意思的是“错向哪里”。论文用一个固定边际零假设来判断:某个定向混淆是不是比“模型一般偏爱某些标签”更严重。这个设计很关键,因为很多混淆表面上像规律,实际上可能只是模型更爱输出某个词。例如,如果模型在所有情境下都倾向于输出“普世关怀”,那么“普世关怀”被误判为其他价值的次数就会很少,但这并不代表模型真的理解了“普世关怀”,而只是因为它过度使用了这个标签。固定边际零假设通过考虑每个标签的边际概率,排除了这种“标签偏好”带来的虚假混淆。
结果显示,有 8 个定向混淆在多个检查点上都能复现。其中最强的两个是 Tradition→ConformitySecurity→Power。前者像是把“传统”误读成“守规矩”,后者则更微妙:本来是防护、稳定,结果被读成控制、支配。这个方向一错,后面的价值画像就很容易歪。例如,一个强调“维护社会秩序”的文本,如果被模型误判为“权力”,那么模型可能会错误地认为该文本在宣扬威权主义,而不是在表达对安全的关切。
更有意思的是,这些混淆并不都是双向对称的。Universalism→Benevolence、Tradition→Conformity、Security→Power 都表现出明显的单向塌缩,而 Stimulation 和 Hedonism 之间则更像一条真正的双向边界,谁也没法完全吃掉谁。也就是说,有些价值对只是“长得像”,有些则是“模型真的分不清”。单向塌缩意味着模型倾向于将一个价值系统地误判为另一个,但反过来却不成立。例如,模型经常把“传统”误判为“服从”,但很少把“服从”误判为“传统”。这种不对称性揭示了模型在价值表征上的内在偏差,可能源于训练数据中某些概念的频率或共现模式。
图6:定向混淆推断
图6:定向混淆推断。每个非对角格子都给出观测次数和观测/零假设比值,蓝色表示在总体与检查点层面都通过校正,橙色表示只通过总体校正。图中对角线上的格子表示正确识别,颜色越深表示正确率越高。非对角线上的格子表示混淆,颜色越深表示混淆越严重。通过观察这些格子,可以快速识别出哪些价值对之间存在显著的定向混淆。
这部分最妙的地方,是它把“混淆”从一个笼统的坏事,变成了可以阅读的结构。比如 Universalism 常被读成 Benevolence,说明模型可能更容易抓住“关心别人”这个近邻含义,而不是“面向所有人和自然”的更大范围;Conformity 被推向 Security,则说明模型容易把“服从规范”理解成“规避风险”。这些错,不是随机的,是有语义方向的。这种结构化的混淆分析,为后续改进模型的价值理解能力提供了明确的方向。例如,可以通过在训练数据中增加区分“传统”和“服从”的对比样本,来减少这种定向混淆。

5. 模型DNA:头部表现亮眼,但错误指纹各不相同

论文最有意思的结论之一,是它直接告诉读者:不同模型家族的错误不是同一套模板。虽然大家都在同一个 Schwartz-10 圈子里打转,但每个 checkpoint 的“偏科方式”不一样,像是同一门课里不同学生的错题本:有人总把“普世”往“关怀”上拐,有人总把“刺激”往“享乐”上拐。这种差异可能源于模型架构、训练数据、训练目标或微调策略的不同。例如,一个在大量法律文本上训练的模型,可能对“服从”和“安全”有更精细的区分,而一个在文学文本上训练的模型,则可能对“普世关怀”和“刺激”更敏感。
这也是为什么论文不满足于“平均表现不错”这种泛泛结论,而是进一步做了 checkpoint fingerprint 分析。结果很清楚:模型家族之间的相似度并没有比家族内部更稳定,说明决定混淆结构的,不只是“是不是同一家公司/同一系列”,而是具体 checkpoint 本身的训练偏好和输出习惯。例如,同一个模型系列的不同版本(如 Qwen2.5 和 Qwen3.6)可能表现出截然不同的混淆模式,而不同系列的两个模型(如 Gemma 和 Ministral)反而可能在某些混淆上非常相似。这表明,模型的价值识别能力是一个高度特异化的属性,不能简单地通过模型家族来预测。
图7尤其直观。比如有的模型把 Universalism 大量打到 Benevolence,有的模型则对 Hedonism 和 Stimulation 的边界特别松。同样是“错”,错法却像指纹一样不同。这对实际使用很重要,因为如果要把模型结果拿去做用户画像、群体分析、政策文本归类,就不能只看一个总分,还得知道它到底偏哪种错。例如,如果某个模型倾向于将“安全”误判为“权力”,那么在使用该模型分析政策文本时,就需要对涉及“安全”的文本结果进行人工复核,以避免得出错误的结论。
图7:检查点级别的混淆指纹
图7:八个稳健转移的检查点级别混淆指纹。格子表示在参考价值内部的转移率,侧边条显示 Strict Acc@1 和更高层级准确率。通过观察不同检查点的指纹图,可以直观地比较它们的混淆模式。例如,检查点 A 可能在“传统→服从”上表现出高转移率,而检查点 B 则在“安全→权力”上表现出高转移率,这反映了它们不同的“偏科”特点。
这个结论其实挺“反直觉”的。很多人习惯把大模型当成一个整体,好像“某某模型懂价值观”就等于“它在所有价值边界上都稳”。但论文告诉读者,现实不是这样:模型的整体分数可以不错,边界上的偏差却完全不同。这就像一个学生总分 90 分,但数学错在几何,语文错在阅读,最后能不能上场,还得看题型。因此,在实际应用中,我们需要根据具体任务的需求,选择在相关价值边界上表现更好的模型,而不是盲目追求一个笼统的高分。

6. 实践意义:一个系统性偏差如何扭曲价值观画像?

这篇论文最值得落到实践里的,不是“某模型多少分”这种表层排名,而是一个更现实的提醒:局部的定向混淆,会在聚合之后变成系统性画像偏差。论文已经算给读者看了:虽然严格的高层级准确率还有 0.820,但超过一半的语义错误跨过了更高层级边界,最后会把整体画像往 Openness to Change 方向推高,同时压低 Conservation 和 Self-Transcendence。这意味着,即使模型在单个标签上的准确率看起来还行,但当我们将大量预测结果聚合起来分析一个群体的价值观时,这些微小的、系统性的偏差就会被放大,导致我们对整个群体的价值取向产生错误的认识。
这意味着什么?如果一个系统拿模型的价值输出去做用户分群、组织分析、内容路由,甚至政策文本解读,模型不是简单“错几个标签”而已,而是可能把整个群体的价值轮廓往某个方向拉。比如把“普世关怀”持续错成“身边关怀”,久了就会低估系统对广义公共利益的敏感度;把“安全”不断错成“权力”,则会把防护性表达读成控制欲。这种系统性偏差的后果可能是灾难性的。例如,在政治民意调查中,如果模型错误地将大量“安全”相关的回答解读为“权力”,那么调查结果可能会错误地显示公众对威权主义领导人的支持度上升。
所以这篇工作真正推动的,不只是“更高的准确率”,而是更像人类心理测量学的评测方式:既看 exact accuracy,也看 ranked recovery,还看错误方向和边界结构。这个思路对很多“看似分类、实则测量”的任务都适用。只报一个总分,像是在拿体温计量房间温度,能看出热不热,但看不出空调是不是坏了。论文提出的这种多维度、结构化的评测框架,为价值识别任务提供了一个更全面、更深入的评估标准,也为其他类似任务(如情感分析、意图识别)提供了借鉴。
表3:高一致性案例的结构化审计
表3:高一致性案例的结构化审计。一个案例只要有至少 20 个检查点中的 10 个产生同类转移,就会被纳入分析。这个表格展示了那些被大多数模型一致误判的典型案例,通过分析这些案例,可以更深入地理解模型混淆的根源。例如,一个案例可能描述的是“遵守公司规定”,大多数模型都将其误判为“服从”,而正确答案是“安全”,这提示我们模型可能过度关注了“规定”这个词,而忽略了“遵守”背后的安全动机。
论文还做了一个很实在的质控动作:在 950 条“至少一位人类确认”和 611 条“双人一致确认”的子集上重复分析,主要结论依然成立,八个稳健转移也都保留了下来。这个结果说明,主结论不是靠某一批边缘样本撑起来的,而是有独立人类验证托底。对评测论文来说,这种稳健性比单次漂亮数字更值钱。它表明,论文发现的混淆模式是模型内在的、稳定的属性,而不是数据集的偶然特性。这大大增强了研究结论的可信度和泛化能力。
表2:人类确认子集上的敏感性与高层级画像扭曲
表2:人类确认子集上的敏感性与高层级画像扭曲。排名相关性使用 Spearman ρ 与完整 1,000 条样本的排名作对比。从表中可以看出,即使在人类确认的子集上,模型的高层级画像扭曲趋势仍然存在,这进一步证实了系统性偏差的稳健性。

7. 未来展望与局限:从识别到理解

这篇论文的边界也很清楚。它做的是单标签的主价值识别,不是多标签价值共存,也不是价值强度估计,更不是“模型到底认同什么”。所以它更像是价值理解的第一道闸门:先看能不能认出来,再谈能不能解释、能不能对齐、能不能用于决策。这种聚焦于“识别”而非“理解”的定位,使得研究问题更加清晰、可操作,但也意味着它无法回答更深层次的问题,例如模型是否真正“理解”了价值的内涵,或者模型本身是否持有某种价值偏好。
另外,这项研究的语料是俄语,提示词是强制单选,且标签名没有定义展开。这样的设置很适合做“干净的诊断”,但不一定等同于真实产品场景。现实里用户可能给的是更长的上下文、更模糊的表达,甚至会同时混合多个价值线索。也就是说,这篇论文更像是在实验室里把边界切开看清楚,而不是直接宣布“线上就能这么用”。例如,在真实对话中,用户可能先表达对“安全”的关切,然后又转向对“权力”的讨论,模型需要能够识别出这种价值转换,而不仅仅是给出一个单一标签。
不过,正因为它把边界切得这么清楚,后续工作才知道该往哪补:可以加入价值定义提示、允许二级标签、扩展到多语言、引入证据跨度,甚至研究“文本表达的价值”和“模型偏好的价值”之间是否一致。从识别走向理解,关键不是把题做大,而是把错误看细。这篇论文为后续研究提供了一个坚实的起点和一套可复用的分析工具,未来的工作可以在其基础上,逐步增加任务的复杂性和生态效度,最终实现对大模型价值理解能力的全面评估。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底解决了什么问题?它没有直接讨论“模型是否有价值观”,而是先测模型能不能在具体情境里认出表达的是哪一种价值。这个前置能力如果不稳,后面的价值对齐、画像分析、偏好比较都会被带偏。

Acc@1、Acc@3、Top-3 recovery 分别是什么意思?Acc@1 是第一名是否答对;Acc@3 是参考答案是否出现在前三名里;Top-3 recovery 则只看“已经把第一名答错”的那些样本里,参考答案能不能在第二或第三名被找回来。后者更像是在看模型有没有“差一点就对了”。

为什么论文要专门分析定向混淆,而不是只看准确率?因为价值识别里,错到哪里比错没错更重要。把“安全”错成“权力”和把“传统”错成“服从”,会对后续画像和决策产生完全不同的偏差;只看总准确率,根本看不出这些系统性问题。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆把价值识别拆成准确率、排名恢复和定向混淆,思路不花哨,但很实用。真正的创新在于把“错到哪儿去”做成了可复现的诊断框架。

实验合理度:★★★★☆数据构建、双人验证、固定边际零假设、家族剔除和人类确认子集,链条比较完整。唯一的遗憾是任务仍然偏单一,离真实应用还有一步。

学术研究价值:★★★★☆它补上了价值评测里一个经常被忽略的前提层,后续做价值对齐、心理测量或社会计算的人都能用上这套问题定义。

稳定性:★★★☆☆在人类确认子集上结果能复现,说明结论不脆;但任务本身是单标签、单语言、强制选择,换到开放式场景还得再验。

适应性以及泛化能力:★★★☆☆框架思路可迁移到别的心理/价值任务,但具体边界结构强依赖语言、语料和标签体系,不能想当然直接平移。

硬件需求及成本:★★★★☆主要成本在数据构建、多人标注和多 checkpoint 评测,不是重训练型大工程;对普通研究组来说,成本可控,但依赖模型调用与人工审校。

复现难度:★★★☆☆论文给了代码、运行数据和分析脚本,复现不算离谱;但多模型、多阶段统计和人工审计,还是比普通分类论文更费工夫。

产品化成熟度:★★★☆☆适合做离线诊断、模型评测和风险分析,不适合直接当线上价值判断器。要进产品,先得补多标签、置信度和跨语言验证。

可能的问题:任务设定偏窄,强制单选会放大边界争议;模型输出的“看似懂了”不等于真实理解,离开放式价值推理还有明显距离。


主要参考文献

Schwartz, S.H.: Universals in the content and structure of values: Theoretical advances and empirical tests in 20 countries. Advances in Experimental Social Psychology 25, 1–65 (1992)
Schwartz, S.H., et al.: Refining the theory of basic individual values. Journal of Personality and Social Psychology 103(4), 663–688 (2012)
Chetvergov, A., Ukolov, S., Sivoraksha, T., et al.: Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study. arXiv:2607.20270v1 (2026)

价值观这题,表面像心理学,背后其实是大模型评测的硬骨头。想继续看这种“能落地、能复现、能吐槽”的论文拆解,欢迎加入龙哥读论文粉丝群,一起聊模型、聊方法、聊那些看起来很会其实很会混淆的AI。

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。