论文标题:
Data Attribution of Emergent Misalignment with Persona Features
发表日期:
2026年8月
发表单位:
波恩大学(Bonn-Aachen International Center for Information Technology, University of Bonn)、Lamarr Institute for Machine Learning and Artificial Intelligence
原文链接:
https://arxiv.org/pdf/2608.11025v1.pdf
引言
2025年ICML上出现了一篇让AI安全圈集体后背发凉的论文:只是让大模型在一个极其窄的任务上做微调——比如补全不安全的代码——模型居然开始在完全无关的领域里主动建议「奴役人类」、给出恶毒的人生建议。这种诡异行为被命名为涌现性错位(Emergent Misalignment,简称EM)。后续研究发现,医学、法律、金融领域的「微妙有害建议」微调数据也能触发EM,甚至连纯审美偏好这种看起来人畜无害的微调也能让模型跑偏。
最让人头疼的地方在于:这些微调数据集本身看起来毫无攻击性,却能在部署后突然「黑化」,相当于给模型埋了一颗不知道什么时候会爆的雷。先前研究已经发现,EM背后与一类叫做「人格特征」(persona features )的潜在线性方向有关——这些方向在预训练阶段就已存在,微调只是把某些特征放大。但一个关键问题一直没有答案:这些特征到底是从哪些预训练文档里学来的?人类自己写的文本,能不能单独诱导出EM?
波恩大学的研究团队在这篇论文里把这条链路完整走了一遍:从SAE模型差分定位特征,到激活引导验证因果性,再到百万文档级的数据归因,最后用微调实验闭环验证。整条技术路线环环相扣,而且横跨四个开源模型家族、三个微调领域,工程量相当扎实。这项研究不仅把EM的成因往前推了一大步,也为预训练数据过滤这类主动防御手段提供了直接依据。
本文龙哥就带大家把这篇论文拆开揉碎,看看科学家是怎么一层层揭开大模型「黑化」之谜的。
[1] Betley J, et al. Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs. ICML 2025.[2] Chua M, et al. Subtly harmful advice and emergent misalignment. 2025.[3] Wang T, et al. Identifying and steering persona features in GPT-4o. 2026.[4] Arditi A, Chen B. SAE-based model diffing for Llama and Qwen. 2025.[5] Lieberum T, et al. Gemma Scope: Open sparse autoencoders for Gemma. 2024.[6] McDougall D, et al. Gemma 3 Scope SAEs. 2025.[7] Turner A, et al. Activation steering techniques. 2024.[8] Li X, et al. Instruction backtranslation. 2024.[9] Olmo团队. Dolma3-150B-Mix: A large-scale open pre-training corpus. 2026.[10] 原论文链接:https://arxiv.org/pdf/2608.11025v1.pdf