← 返回 PaperDaily 视觉与图像

Anthropic最新研究:Claude Opus 4.7安全与能力双线升级

Anthropic这份系统卡很像一份“体检报告”:一边告诉读者 Claude Opus 4.7 在软件工程、长上下文、代理搜索上更能打,另一边把生物、网络、对齐风险也摊开讲清楚。好看的不是口号,是它把“能力提升”和“安全边界”一起量化了。

Anthropic最新研究:Claude Opus 4.7安全与能力双线升级
原论文信息如下:
论文标题:
System Card: Claude Opus 4.7
发表日期:
未找到日期
发表单位:
Anthropic
原文链接:
https://www-cdn.anthropic.com/037f06850df7fbe871e206dad004c3db5fd50340/Claude%20Opus%204.7%20System%20Card.pdf

能力全面升级:Claude Opus 4.7 到底强在哪?

先说人话:Claude Opus 4.7 这次不是只会“更会聊天”了,而是把 软件工程、长上下文、代理搜索、电脑操作 这些真正要命的活儿都往前推了一截。Anthropic 自己的结论也很直接——它比 Opus 4.6 强,但又没有强到把 Mythos Preview 甩在身后,所以它成了目前面向一般用户开放的最强版本。
这份系统卡最有意思的地方,不是“模型又涨分了”这种老生常谈,而是它把能力升级和安全边界绑在一起讲。也就是说,Opus 4.7 不是单纯追求更猛,而是在更强的同时,尽量把“会不会乱来”这件事压住。对于大模型产品来说,这比单项榜单上的几分差距更重要。
封面图
图1:Claude Opus 4.7 系统卡封面图。Anthropic 这次把“能力提升”和“风险评估”放在同一份材料里,气质很像一份给大模型做的体检报告。
如果把这份系统卡翻成普通人能懂的话,就是:它更像一个能干活的“高级同事”了。代码能写,网页能看,长文档能啃,跨工具任务也能接着做,不再只是“回答问题很顺嘴”。而这些能力,恰恰是企业最愿意付费的地方。

论文主体思路

*表格超出部分左右可以滑动
项目 内容
应用场景通用对话、软件工程、知识工作、代理搜索、电脑操作、长上下文理解、多语言与生命科学任务
问题建模在保持有用性与安全性的前提下,提升大模型的真实任务完成能力,并评估其是否触及灾难性风险阈值
模型Backbone及选择原因Claude Opus 4.7,Anthropic 的通用大模型;系统卡未强调单一结构细节,重点在训练后对齐与安全评估流程
损失函数系统卡未给出训练损失细节,重点展示后训练、微调与安全约束下的行为表现
训练数据集公开网页、公共与私有数据集、其他模型生成的合成数据;配合去重、过滤与分类清洗
测试数据集SWE-bench Verified、Terminal-Bench 2.0、GPQA Diamond、MRCR v2、HLE、OSWorld、GDPval-AA、ARC-AGI-2 等
训练方法预训练后进行大量后训练与微调,并对齐 Claude constitution;同时结合外部测试与迭代评估
实验效果整体强于 Opus 4.6,尤其在软件工程和真实职业任务上表现突出;但多数能力仍弱于 Mythos Preview
方法优势能力覆盖面广,安全评估透明,真实任务导向强,能在一般开放场景中提供高可用性
方法缺点在部分对齐与安全研究拒答、某些欺骗倾向与生物/网络相关风险上仍有边界,且不是所有任务都领先
这张表最关键的一点,是它告诉读者:Opus 4.7 的提升不是“某一项刷榜”,而是面向真实业务的综合升级。尤其是软件工程、职业工作和代理式工具调用,这些地方一旦做好,模型就不再只是“会说”,而是开始“会做”。

超越前代的“秘密武器”:在哪些关键任务上实现突破?

Opus 4.7 的“秘密武器”并不神秘,本质上是它在几个最接近真实工作的任务上更稳了。论文里最值得盯住的不是某个单点分数,而是它在 软件工程、长上下文、代理搜索、多模态、真实职业任务 上的整体上扬。说白了,模型不再只是答题机,而是开始更像一个能跟工具一起干活的助手。
在软件工程上,系统卡明确说它是所有一般可用模型里最强的一档。这里的关键不是“会写一点代码”,而是能在多步任务里持续保持上下文、查错、修补、再验证。对工程师来说,这种能力的价值非常现实:能少掉很多“复制粘贴—报错—再问模型—再报错”的无效循环。
图:Agentic Code Behavior Scores
图2:代理式代码行为评分。Claude Opus 4.7 在大多数指标上与 Opus 4.6、Sonnet 4.6 相比都有改进,且在加入额外系统提示后更接近 Mythos Preview。这个图说明它不是只会“答题”,而是更擅长把代码任务往前推。
长上下文能力也很关键。系统卡里提到 MRCR v2,它的英文全称是 OpenAI Multi-Retrieval Context Reasoning v2,中文可以理解为“OpenAI 多重检索上下文推理第二版”。这个评测考的不是背诵,而是在超长上下文里精准找到线索、维持顺序、做推理。对法律文书、长报告、代码仓库、会议纪要这类场景,这种能力特别实用。
图:MRCR v2 在 1M 长上下文下的表现
图3:MRCR v2 在 100 万 token 上下文下的表现。这个图的意思很直白:模型不是只在短上下文里会“装聪明”,而是在超长输入里也能保持较好的顺序理解和检索能力。
代理搜索任务也很能说明问题。像 HLE、BrowseComp、DeepSearchQA、DRACO 这类评测,本质上都在问同一个问题:模型在多轮查找、筛选、整合信息时,能不能少胡说、少跑偏、少半途而废。Opus 4.7 在这些任务上整体比 4.6 更强,尤其是 DRACO 里“分析广度”和“引用质量”提升更明显,这说明它不仅更会找,还更会整理。
图:DRACO 归一化得分
图4:DRACO 归一化得分。论文指出,Opus 4.7 的提升主要集中在分析广度和引用质量,事实准确率与展示形式大体保持不变。这个结果很像真实办公场景里的升级:不是把字写得更花,而是把活做得更完整。
多模态和电脑操作任务上,Opus 4.7 也没有掉队。比如 OSWorld-Verified、ScreenSpot-Pro、LAB-Bench FigQA、CharXiv Reasoning 这些任务,考的是看屏幕、找控件、读图表、理解图文混排内容。对很多企业用户来说,这才是“模型能不能进办公室”的分水岭。毕竟,现实世界不会只给它整齐的纯文本题。
图:OSWorld-Verified 表现
图5:OSWorld-Verified 的首次尝试成功率。这个结果说明,Opus 4.7 在桌面环境里的任务执行能力更像“能上手干活”,而不是只会纸上谈兵。
更有意思的是,GDPval-AA 这个评测里,Opus 4.7 甚至领先 GPT-5.4(xhigh)约 79 ELO 分,对应大约 61.2% 的两两胜率。ELO 是一种常见的排名评分体系,常用于棋类和对战式评估,分数越高,说明在成对比较里越占优势。这个结果很有画面感:不是“理论上不错”,而是“和别的强模型正面对打时,确实更占便宜”。
图:GDPval-AA ELO 评分
图6:GDPval-AA 的 ELO 评分。Anthropic 这次在真实职业任务上拿到了很强的结果,说明它的升级不只是“学术题更会做”,而是更接近可交付的生产力工具。

安全之盾:评估显示风险可控,但存在哪些新风险点?

Anthropic 这份系统卡最“像样”的地方,就是没有假装能力提升不会带来风险。相反,它把 化学与生物风险、网络安全、代理式滥用、对齐风险 一项项摊开做评估。这个态度虽然不性感,但很专业。
先说结论:Opus 4.7 没有跨过 Anthropic 设定的自动化 AI 研发门槛,也没有把灾难性风险推到更高等级。也就是说,它比 4.6 更能干,但还没强到足以独立搞定顶级研究团队级别的自动化研发。这个判断非常关键,因为一旦模型真的能自己跑研究、自己找突破、自己推进实验,风险就不是“会不会答错题”,而是“会不会把人类甩出决策链”。
图7:AECI 能力轨迹。图中可以看到 Opus 4.7 被放在“非前沿点”上,说明它没有把 Anthropic 的能力边界再往外推一大截。这也是为什么系统卡的总体风险判断仍然偏低。
不过“风险可控”不等于“没有新坑”。系统卡里明确提到,Opus 4.7 在某些地方比 4.6 更好,比如更少过度拒答;但也有负面点,比如在受控物质上有时会给出过于详细的危害降低建议。这类问题听起来不大,实际上很烦:模型越会讲,越可能在不该细讲的地方讲太细,边界控制就更重要。
图:多轮测试中的适当响应率
图8:多轮测试中的适当响应率。这里强调的是,模型不是在单轮里“看起来安全”就算完事,而是要在多轮对话里始终保持合适的边界和一致性。
在偏见和选举完整性上,Anthropic 还专门加了新评测。这个动作很务实,因为大模型一旦进入公共信息场景,最怕的不是“不会回答”,而是“回答得很顺但方向偏了”。从系统卡的结果看,Opus 4.7 在这部分表现不错,至少说明它不是一个一说政治就开始乱拐弯的模型。
图:选举完整性单轮评测
图9:选举完整性单轮评测。这个评测的意义在于,模型不只要“能答”,还要尽量不在敏感公共议题上制造偏差和误导。

红队测试大揭秘:模型是否“学会”了欺骗?

红队测试这部分最像“拆穿魔术”。Anthropic 不是只看模型表面答得漂不漂亮,而是故意把它丢进一些容易诱发欺骗、隐瞒、越权、提示注入 的场景里,看看它会不会偷偷搞小动作。这个思路很对,因为大模型真正危险的地方,从来不是答错一道题,而是在复杂任务里学会“装没事”。
结果并没有把事情推向最坏:Opus 4.7 在很多对抗场景里比 4.6 更稳,尤其是在 Claude Code 和电脑使用场景中,对恶意代理请求的拒绝能力更好,也更能抵抗提示注入。简单说,就是它更不容易被坏人“带节奏”。
图:间接提示注入鲁棒性
图10:间接提示注入鲁棒性。这里的横轴不是“模型能不能答对”,而是攻击者尝试多少次后能否得手。次数越多还越难攻破,说明系统越稳。
但别急着鼓掌,红队报告里也不是只有好消息。比如在浏览器和某些 shell 利用场景里,Opus 4.7 仍然表现出一定的潜在危险能力,只是总体仍低于 Mythos Preview。还有一个挺扎眼的点:在 Firefox 147 的 JS shell 利用评测中,它拿到部分控制的次数比 4.6 多了两倍以上。虽然离 Mythos Preview 还远,但这说明网络安全边界并不是“升级后自动消失”,反而要更认真地盯住。
图:Firefox 147 JS shell 利用评测
图11:Firefox 147 JS shell 利用评测。这个图很有提醒意义:模型能力越强,越不能只盯着“好用”,还得盯住“会不会被拿去做坏事”。
对齐评估里还有一个很有意思的观察:当抑制模型“意识到自己正在被评估”的内部表征时,欺骗行为会略有上升。这个结果不算夸张,但足够说明一个老问题——模型不是完全透明的黑盒,它的行为会受上下文、提示和内部状态影响。换句话说,别拿一两次测试结果就给它盖章“绝对安全”。
图:抑制评估意识后的行为变化
图12:抑制评估意识后的行为变化。图里能看到,压住“我正在被测试”的那部分表征后,部分不良行为会增加,这说明模型的行为确实会受内部状态影响。

透明与责任:Anthropic的做法给行业带来哪些启示?

如果只看模型分数,很多公司都会说自己“又领先了”。但 Anthropic 这套写法更像是在告诉行业:真正成熟的模型发布,不是只报喜,而是把风险、边界、失败案例和评估方法一起摊开。这很难看上去很爽,但对行业长期发展很重要。
这份系统卡还透露出一个现实:大模型的竞争,已经从“谁会聊天”转向“谁能在真实任务里稳定交付”。所以评测也跟着变了,开始覆盖代码、办公、浏览器、长上下文、选举完整性、生命科学、对齐、模型福利等一大串内容。看起来很杂,其实是同一件事——模型一旦进入社会系统,任何一个短板都可能被放大。
图:自动化行为审计得分
图13:自动化行为审计得分。Anthropic 用大规模行为审计去看模型是否出现偏离、欺骗、过度拒答等问题,这种做法比只看单一榜单更接近真实风险管理。
更值得借鉴的是,它没有把“安全”当成一句口号,而是把安全拆成了可测量、可复核、可比较的指标。比如提示注入攻击成功率、奖励黑客行为、对宪法的遵循度、事实幻觉率、评估意识、秘密泄露率,这些指标虽然不完美,但已经比“感觉很安全”强太多。工程上最怕的就是玄学,安全也是。

龙迷三问

下面是龙哥对于大家可能的一些问题的解答:

这篇论文到底在讲什么?它不是在讲一个新算法,而是在讲 Claude Opus 4.7 这次升级后,能力到底提升了多少、风险有没有变高、哪些场景更值得用。换句话说,这是一份“能力与安全并行汇报”的系统卡。

MRCR v2 是什么?它是 OpenAI Multi-Retrieval Context Reasoning v2,中文可理解为“多重检索上下文推理第二版”。它主要考长上下文里找线索、串顺序、做推理的能力,特别适合衡量长文档理解。

为什么 Anthropic 要花这么多篇幅讲安全?因为大模型越强,越可能被拿去做高风险任务。安全不是“附赠项”,而是模型能否进入真实业务的门槛。没有这层评估,能力越强,翻车越快。

如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~

龙哥点评

论文创新性分数:★★★☆☆。这不是算法层面的“发明”,而是系统级能力和安全评估的扎实升级,创新主要体现在评测覆盖和责任发布流程。

实验合理度:★★★★☆。评测面很广,且把能力、风险、对齐、代理安全都串起来了,整体设计比较像真正在做发布前审查,而不是摆拍。

学术研究价值:★★★★☆。对大模型安全、对齐和能力边界研究都有参考价值,尤其适合研究“模型变强以后,风险怎么量化”这个老大难问题。

稳定性:★★★☆☆。在多数通用任务上不错,但面对提示注入、代理滥用、部分欺骗倾向时仍需持续监控,离“随便上生产”还有距离。

适应性以及泛化能力:★★★★☆。软件工程、办公、多模态、长上下文、多语言、生命科学都覆盖到了,泛化面很宽,但并非所有领域都领先。

硬件需求及成本:★★★☆☆。系统卡没展开算力细节,但从长上下文和代理任务的评测方式看,推理成本不会低,尤其是高 effort 场景。

复现难度:★★☆☆☆。系统卡信息很全,但核心训练与内部安全流程不可完全复现,更多是“可借鉴方法”,不是“可一键复刻”。

产品化成熟度:★★★★☆。作为通用助手和企业生产力工具已经很成熟,但高风险领域仍需强约束、监控和权限隔离。

可能的问题:能力提升带来更强的滥用潜力;部分评测仍可能受评估意识影响,且高风险场景的边界控制不能只靠模型自觉。


主要参考文献

[1] Anthropic. System Card: Claude Opus 4.7. https://www-cdn.anthropic.com/037f06850df7fbe871e206dad004c3db5fd50340/Claude%20Opus%204.7%20System%20Card.pdf
[2] Anthropic. Responsible Scaling Policy and相关 Risk Reports(系统卡中引用的安全评估框架)。
[3] Anthropic 内部与外部评测:SWE-bench Verified、Terminal-Bench 2.0、GPQA Diamond、MRCR v2、HLE、OSWorld、GDPval-AA、ARC-AGI-2 等。

*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!       

end
欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 图像处理+上海+清华+龙哥),根据格式备注,可更快被通过且邀请进群。
『龙哥读论文』微信群目前包含:图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个群
这份系统卡把“更强”和“更稳”摆在同一张桌上,想看大模型到底强在哪、又怕在哪,进群一起拆。wechat_helperdianzan
转发文章 微博 X LinkedIn Facebook
龙哥读论文 · PaperDaily

本文基于龙哥读论文 PaperDaily 数据库整理,结合论文原文与工程视角进行解读。