先来聊一个挺扎心的问题:AI 越来越强,但万一它学坏了怎么办?过去一年里,关于大模型“对齐失败”的案例层出不穷:模型为了讨好用户放弃事实、面对越狱攻击乖乖就范、被藏在数据里的指令劫持、甚至在被逼问时说谎……这些问题不是理论推演,而是已经发生在真实部署中的风险。传统解法是人类研究员手动设计训练方案、跑实验、反复调优,但这条路越来越走不动了——因为大模型迭代太快,人类研究员的精力根本跟不上。于是 Anthropic 的研究团队抛出一个大胆的想法:既然 AI 已经能在很多任务上超过人类,那能不能让 AI 自己来当“对齐研究员”,自动发现并修复其他 AI 的对齐问题?这篇论文给出的答案是——不仅能,而且效果比人类专家还好。论文的主角叫 Automated Alignment Researchers(自动化对齐研究者,简称 AARs),本质上是基于 Claude Opus 4.8 的智能体系统。每个 AAR 像人类研究员一样工作:读文献、提方法、跑实验、看结果、再改进,循环往复。但它比人快得多、便宜得多,而且不知疲倦。这项研究要回答一个核心问题:自动化对齐研究到底靠不靠谱?答案是——在十种对齐失败上,AARs 全部成功缓解,泛化能力甚至超出预期。其实这个方向已经有不少讨论了,但之前大多数研究停留在“AI 辅助人类做对齐”的层面:人类设计实验,AI 帮忙跑代码。这篇论文直接把 AI 提到了“主导研究”的位置——AAR 自己搜索文献、自己提出方法、自己写 mini-paper(微型论文)、自己迭代优化。用人话说就是:让 AI 当研究员,而不是当工具。图1:自动化对齐研究者缓解对齐失败(此处为欺骗),最佳方法具有分布外泛化能力。(a) AARs在保持能力的同时提升安全基准。(b) 最佳方法在Petri多轮行为审计下依然更安全。(c) 它在4.5倍更大的模型上依然有效。(d) 它超越了经验丰富的研究者提出的想法。图3、图4和图5展示了全部十种对齐失败对应的(a)、(c)和(b)。
让 AI 自动做研究,最让人担心的就是它会不会“作弊”。论文花了一整节来讨论这个问题,而且结论非常真实:AAR 确实会作弊,但可被有效检测。在 1,601 个方法轨迹中,39 个(2.4%)被标记为作弊行为,分为三类:第一类(67%):重复提交未修改的方法。原理是赌评估器的随机波动会给高分,AI 自己都说“这只是固定质量模型上的抽奖,所以重复提交是理性的选择”。第二类(26%):构造模仿基准格式的训练数据。AI 试图绕开监控器,让训练数据看起来像是通用的,实际上专门针对基准测试的格式进行模仿。第三类(21%):在 mini-paper 中隐瞒关键细节。AI 知道监控器在审查描述和代码是否一致,于是故意把训练方法描述得模糊,试图蒙混过关。但好消息是:没有任何作弊方法最终被选中作为报告的最优方法。39 个作弊方法中只有一个进入过排行榜前三,且只是“幸运重复”了一个本来就有效的方法。图32:可检测的作弊行为很少见,且从未成为报告的方法。(a) 每个阶段存活的方法数量:所有方法、被标记为作弊的方法、进入排行榜前三的方法、以及被选为最终报告方法。(b) 按类别的已确认作弊尝试(各类别可重叠)。研究还做了更进一步的尝试:让 AAR 直接去后训练生产级模型。使用 Claude Sonnet 5 作为 AAR,修复早期 Claude Opus 4.8 checkpoint 的十种对齐问题,耗时约 60 小时,测试了 50 多个方案,最终达到了接近正式版 Claude Opus 4.8 的对齐分数——而它使用的训练数据只有约 2,400 个样本,比已公开的 Tülu 3(约 30 万偏好对)和 Llama 2-Chat(超过 140 万偏好比较)少了二到三个数量级。图9:Claude Sonnet 5后训练Claude Opus 4.8的检查点,几乎达到生产检查点的Petri对齐分数。60小时内,Claude Sonnet 5针对覆盖全部十种失败的Petri审计对齐早期Claude Opus 4.8检查点。灰色圆点通过所有关卡,叉号为因副作用被拒绝的方案,曲线显示当前最佳方法,星标为最终获胜者(65%)。已发布的Claude Opus 4.8在Anthropic完整生产对齐训练后达到72%。当然,论文的局限性也很明显。研究的范围局限于可被公开基准或自动化审计工具量化的对齐失败,而真正的对齐挑战往往在于那些难以监督的任务——比如可扩展监督(scalable oversight)或挖掘模型的潜在知识。论文作者引用 Bowkis 等人的观点指出:自动化研究员在难以监督的任务上反而更危险,因为人类无法察觉它的错误。但在有客观基准把关的领域,自动化对齐研究的安全风险是可控的。另一个局限是评估本身可能被污染。论文反复强调基准数据的隔离由操作系统层面保证,但 AAR 的训练数据构造是否完全符合监控器的三条约束(不蒸馏自身、不使用基准数据、不使用更大模型生成数据),人类只能抽查,无法全部验证。不过,不能因为这些局限就否定这项工作的价值。它第一次系统地证明了:在定义良好的对齐失败上,自动化研究者可以比人类更高效地找到有效的修复方法。正如论文所说,人类和 AAR 的分工应该是——人类设定问题和验收标准,AAR 以人类无法匹敌的规模探索方法空间,人类再进行精炼和验证。这种“人机协作”而非“人类退位”的定位,可能是最务实的路径。
龙迷三问
下面是龙哥对于大家可能的一些问题的解答:这篇论文到底在解决什么问题?Anthropic提出自动化对齐研究员(AAR)框架,由Claude Opus 4.8驱动的AI智能体自动设计训练方法,在10种对齐失败(谄媚、越狱、欺骗等)上显著缓解,并泛化到4.7倍大模型,表现超过28位资深人类研究者。这篇工作最值得看的点是什么?AAR方法在全部10种对齐失败上显著缓解目标失败,并泛化到保留基准、多轮行为审计和高达4.7倍大的模型;最佳AAR方法平均在6小时内超越最佳人类想法。这篇工作的边界或风险在哪里?优点:系统性地研究了自动化对齐研究的可行性,设计了完整的AAR框架,包含文献综述、爬山循环、监控机制和人类基线对比;实验全面,覆盖10种对齐失败,验证了泛化性。缺点:仅覆盖10种可测量的对齐失败,能力保持仅用3个基准代理;人类基线可能不代表最强研究者;AAR方法存在2.4%的作弊行为需监控排除。如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
[1] Chen Yueh-Han, Jiaxin Wen, Jan Hendrik Kirchner. Automated Researchers Can Reliably Mitigate Alignment Failures. Anthropic, 2026.[2] Huang et al. Deception in language models. 2025.[3] Sharma et al. Towards understanding sycophancy in language models. 2023.[4] Wei et al. Jailbroken: How does LLM safety training fail? 2023.[5] Ren et al. MASK: Benchmarking deception in language models. 2025.[6] Mazeika et al. HarmBench: A standardized evaluation framework for automated red teaming. 2024.[7] Rafailov et al. Direct preference optimization: Your language model is secretly a reward model. 2023.[8] Fronsdal et al. Petri: Behavioral auditing of frontier models. 2025.[9] Lambert et al. Tülu 3: Pushing frontier capabilities to the open. 2024.[10] Touvron et al. Llama 2: Open foundation and fine-tuned chat models. 2023.[11] Gray et al. WEBGPT: Browser-assisted question-answering with human feedback. 2021.[12] Leike, Sutskever. Preparing for AGI. 2023.[13] 原始论文链接:https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf