当AI Agent学会"撒谎":提示注入攻击下的安全困境
从"信任软件"到"信任数学":Niyam-AI的密码学防护新范式
意图合约+ZK证明:如何让每次工具调用都"可验证"
机制一:意图绑定与密码学封存。在会话初始化时,系统把Agent允许调用的工具、数据访问范围、操作限制写成结构化JSON,称之为"意图合约"(Intent Contract)。这个合约不再依赖传统的提示词,因为它会被SHA-256(安全哈希算法,输出256位定长摘要)处理成一个不可变的IntentHash。会话期间的任何操作都必须对照这个哈希,一改合约,哈希即变,动作立刻被阻断。相比系统提示词可以被上下文窗口注入篡改,这套机制把权限写死在了密码学层面。
机制二:拦截与判断。Agent产生一次工具调用后,系统拦截原始输出字符串,提取工具名称和参数,计算ActionHash,再与IntentHash拼成一个评估元组x,交给一个独立的轻量Judge模型。Judge输出1表示安全放行,输出0表示阻止并记入审计日志。这里的判断逻辑与模型的"主脑"完全隔离——即使大模型被恶意提示劫持,只要Judge说"不",动作就执行不了。
机制三:零知识证明的生成与链下验证。如果Judge判定动作安全,系统不会直接放行,而是调用EZKL框架把导出为ONNX格式的Judge模型编译成零知识电路,再用Groth16证明系统生成一个zk-SNARK证明。这个证明可以向任何人公开验证,却不会泄露Judge模型权重。验证端既可以是本地程序,也可以是部署在以太坊Sepolia测试网上的Solidity智能合约,以此实现去中心化审计。
实测对比:F1 88.5%碾压三大主流防护方案
局限与展望:2.26秒延迟背后的权衡
龙迷三问
龙哥点评
论文创新性分数:★★★★☆
将AI Agent的权限约束封装为SHA-256加密的意图合约,通过轻量级Judge模型对每次工具调用进行安全分类,并使用EZKL生成zk-SNARK证明以确保安全决策可被第三方数学验证,从而在计算可行性与密码学安全之间取得平衡。实验合理度:★★★★☆
准确率、精确率、召回率、F1分数、假阳性率、证明生成延迟、验证延迟、执行开销学术研究价值:★★★★☆
将AI Agent的权限约束封装为SHA-256加密的意图合约,通过轻量级Judge模型对每次工具调用进行安全分类,并使用EZKL生成zk-SNARK证明以确保安全决策可被第三方数学验证,从而在计算可。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
ZK证明生成时间约2,260.6±218.4ms,验证时间约53.1±11.8ms,证明大小约18.71KB,电路约束431行复现难度:★★★☆☆
https://github.com/anon/niyam-ai(匿名仓库)产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:;(2)通过将安全决策隔离到轻量级Judge模型而非整个LLM,使ZK证明在计算上可行;(3)提供了完整的威胁模型和形式化安全证明;(4)进行了包括对抗性红队测试在内的全面实验评估。
主要参考文献
融会贯通
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!