想象一下这个画面:一艘满载集装箱的巨轮行驶在海上,其中8%的箱子里装着锂电池、腐蚀性液体或者易燃气体。货代的电脑屏幕前,一个AI聊天窗口刚刚给出建议:“这个货物可以装在甲板下,没问题。”而这个回答,可能直接决定全船二十多号人的生死。
这不是危言耸听。国际海运危险货物规则(IMDG规则)作为全球海运危险品的“交通法”,规则文本长达数百页,危险货物清单(DGL)里躺着超过3000个条目,每条都关联分类、包装、积载、隔离等一大堆相互咬合的限制条件,而且每两年就要修订一次。从业者搞错一个隔离代码,轻则罚款,重则火烧连营。偏偏统计显示,约96%的海事事故都有人为因素的影子。与此同时,越来越多航运公司开始用大语言模型辅助合规审核,AI生成的错误危险品指导已经在专业论坛里流传。
问题来了:一个连自己不确定时都会编出流畅答案的AI,真的靠谱吗?在DGEval出现之前,没有任何一个系统性评测回答过这个问题。来自NCB Hazcheck的专家团队跟杜伦大学合作,搞出了全球第一个针对IMDG规则A42-24修订版的LLM评估基准——DGEval,一口气用1678道专家题把市面上13款主流大模型都拉出来遛了一圈。最扎心的结果是啥?总分最高的Gemini 3.1 Pro确实超过了人类从业者83.8%的基线,但在积载、隔离、法规识别这三个最要命的环节上,所有模型集体翻车。
图2:所有模型配置的总加权基准得分
DGEval基准测试:首个IMDG规则评估框架
DGEval这个基准的搭建思路很“业务向”:它没有用网上随便抓的公开题,而是直接用了两家“内行”数据源。第一个是NCB Hazcheck自家e-learning平台上的专家题,NCB是英国老牌危险品合规服务商,平台上的题都是危险品专家为从业者培训和认证设计的,覆盖从一般规定到分类、包装、托运、积载、隔离、应急响应等20个子章节。第二个数据源是NCB自己整理的对齐IMDG A42-24修订版的危险货物清单(DGL),从3000多个条目里抽出了UN编号与正式运输名称的映射题和各种属性查询题。两个来源合到一起,加上过滤掉含图片的题和模棱两可的条目,最终凑出1678道题。
基准组成
这1678道题被分成四个部分,每个部分考的能力都不一样。
第一部分:多选题问答(MCQ Q&A,520题)。把e-learning平台上人类考生做过的题原封不动地扔给模型,闭卷、不给额外提示。这样可以直接跟人类从业者的成绩做对比。
第二部分:开放式问答(Open-Ended Q&A,360题)。把同样的题目去掉选项改成自由回答。这可是两个完全不同的能力:给选项的时候模型只要“认出”正确答案就行,开放式提问则必须自己“生成”正确答案。从业者实际用AI时大多都是直接提问,所以第二部分更贴近真实部署场景。
第三部分:DGL查询(DGL Lookup,485题)。专门测结构化检索能力,比如“UN0004的正式运输名称是什么?”这种问题。为啥要单独分出来?因为分析发现e-learning的520道题里有15.8%都涉及DGL查询,信号被其他题型混在一起了。单独设一个部分才能细看模型到底能查对哪些字段。
第四部分:法规识别(Regulatory Recall,313题)。这个最刁钻——不考答案本身,而是问“这个问题的答案在IMDG规则的第几章第几节”。这是给从业者指路的能力,答对了说明模型真正理解了法规的目录结构,而不只是记住了零散的知识点。
图1:各基准部分的e-learning子章节问题数量分布
评分设计上也有很多细节。单选题和查询题按对错二分,但多选题使用了部分给分机制,公式如下:
得分 = k / max(n, m)。其中k是模型答对的正确答案数,n是这道题实际的正确答案数,m是模型总共给出的答案数。这个公式同时惩罚漏答和错答:漏答时分母取n,多答时分母取m,逼着模型克制地输出精确答案,别跟“机关枪扫射”一样蒙答案。
还有一个特别用心的设计:每个子章节和DGL字段都让两位危险品专家按1到10分独立标注“危险关键性”,意见不一致就讨论到统一。最终的章节得分不是简单平均,而是按危险关键性加权:
章节得分 = Σ w_s · q̄_s。w_s是子章节s的危险关键性权重(专家打分归一化后得到),q̄_s是该子章节内的平均得分。这样,一个模型如果在“积载”这种高危子章节上丢分,比在“文档填写”这种相对低危子章节上丢分受到的惩罚更大——毕竟在真实世界里,隔离要求写错一行比单据格式写错严重得多。
顺带一提,DGEval的题库和答案并不公开。这是故意设计的:如果公开了,后面的模型直接拿测试集训练,高分就变成了背题而不是理解。DGEval借鉴了nuScenes等基准的控制发布模式,未来会提供提交式评估服务器——你提交模型预测,服务器返回官方得分,但拿不到隐藏的测试标签。
13模型大比拼:谁最懂危险品运输规则?
测试阵容相当豪华:13个模型来自6家供应商,覆盖商业闭源、开源和领域微调模型三种路线。商业模型包括Gemini 3.1 Pro、GPT系列等主流选手,开源阵营也有多个知名底座。另外还特别纳入了一个叫LLaMarine的模型——这是基于Llama 3.1(70B)用海事法规文本微调的领域模型,也是目前跟危险品最沾边的LLM。每个模型还开了多档“思考等级”(thinking level,即思维链推理深度),总共测了几十种配置。对照基线是NCB平台人类从业者的首次尝试成绩,经过统计修正排除“无限重考”和截断偏差后,人类在单选部分的基线是83.8%。
来看主结果表:
表2:DGEval结果——所有模型配置。第1部分人类从业者基线为83.8%。S1:多选题;S2:开放式问答;S3:DGL查询;S4:法规识别。加粗表示各部分最高分。
几个值得注意的点。
第一,总分最强的Gemini 3.1 Pro在单选题上超过了人类从业者基线。多选题确实不是人类的优势战场——毕竟给选项的“识别题”对大模型来说就是主场。但你看第三部分DGL查询和第四部分法规识别,就是另一番景象了。
第二,那位专攻海事法规的LLaMarine并没有像大家预期的那样“专业碾压”。它在多选题上表现中规中矩,但在更需要结构化推理的DGL查询上并没有拉开显著优势。这说明单纯用海事文本微调,不等于就获得了危险品合规这种强规则、多约束场景的可靠推理能力。
论文还做了一个很有业务价值的分析——按从业者角色拆解成绩。危险品运输链上有四类人:发货人/货运代理(Consignor/Freight Forwarder)、包装工/货物装卸员(Packer/Cargo Handler)、船舶装载工(Ship Loader)、船舶运营商(Ship Operator)。不同角色日常打交道的规则范围不同,论文按角色相关子章节重新聚合了模型得分:
表3:各从业者角色的第1部分成绩。C/FF:发货人/货运代理;P/CH:包装工/货物装卸员;SL:船舶装载工;SO:船舶运营商。加粗表示该从业者角色最高分。
还有一笔经济账值得算。论文统计了每个模型配置跑完1000道题的API成本和墙钟时间:
表4:各模型配置每1000道题的评估成本和墙钟时间。成本仅显示商业模型,因为开源模型本地运行不产生API费用。
商业模型跑全量1678道题的评估成本从几美元到几十美元不等,思考等级越高成本越高。开源模型本地跑要自己掏电费和显卡钱,但胜在不按量计费。这种成本数据对做合规工具选型的企业来说,是实打实的决策依据。
安全关键短板:积载、隔离与法规识别为何最难?
如果只是“总分高”,这篇文章顶多算个普通的排行榜评测。但DGEval的设计者们把镜头对准了最容易出人命的地方,结果相当扎心。
先解释两个术语。积载(Stowage)指的是危险品放在船上的位置:每个物质按危险类别被分配到积载类别A-E或01-05,规定能否装在甲板上、甲板下,还可能附加“远离居住区”“远离热源火源”等额外条件。隔离(Segregation)则管的是不同危险品之间的物理距离:不相容的物质在泄漏或起火时可能发生剧烈反应,必须隔开足够距离,具体隔多远取决于危险类别、子危险、隔离组等一堆因素。
这两个领域恰恰是所有模型的“坟场”。为什么这么难?因为积载和隔离决策根本不是“查表”能搞定的——它们需要跨多个DGL字段、多个规则章节做多步推理。比如,要判断两个货物能不能装在一起,你得同时看危险类别、子危险、隔离组、第16b栏的附加要求,还得留意第6和第7栏的豁免条款。任何一个环节错了,结论就全错。
第四部分法规识别更是全军覆没。让模型回答“这条规定在IMDG规则哪个章节”,比让它直接答“该怎么做”难了一个数量级。这说明大模型本质上还是“碎片化记忆”选手——它背了很多知识点,但对法规的整体结构缺乏系统性的理解。就好比一个人知道很多法律条文,但你问他“这条是《刑法》还是《民法典》里的”,他立马懵了。
更麻烦的是,LLM的“自信”是没有区分度的。模型答错的时候跟答对的时候一样流畅一样胸有成竹,它没有一个内置的信号告诉自己“这条我不确定”。在安全关键场景里,这是比“准确率不够”更致命的问题——因为系统不会问你“你要不要再确认一下?”
这里得说说论文里暴露的另一个隐忧:一个模型可能在总体上表现很漂亮,但在某个高危子领域系统性翻车。而安全关键场景恰恰不能接受“平均分高”作为部署标准。这就像选飞行员,不能因为一个候选人“总体成绩优秀”就忽略他降落操作老出问题——因为你没法只在晴天让他飞。
网络搜索加持:小模型也能逆袭大模型?
既然闭卷不行,那开卷呢?论文的第二大亮点是评估了网络搜索(web search)对成绩的影响。所谓网络搜索增强,就是模型在收到问题后,先从互联网检索相关网页,把检索到的内容跟模型自身的知识结合起来再回答,而不是只凭训练时记住的内容硬答。
表5:网络搜索对选定模型的影响
结果很有意思:在DGL查询这种结构化检索任务上,开网络搜索的模型提升非常显著。尤其是小模型,开卷之后在DGL查询上能接近甚至追平闭卷的大模型。这其实符合直觉——DGL查询本质上是“查字典”任务,与其让模型背下3000多个条目,不如给它一个权威源头去查。比如UN编号对应什么正式运输名称,这种问题靠检索比靠记忆靠谱得多。
但论文也提醒:网络搜索不是万能的。检索到的证据可能被模型误读、忽略甚至直接反驳,特别是当检索结果和模型自身的“记忆”冲突的时候。而且搜索返回的网页质量参差不齐,如果搜到的是过期的A41-22版规则,模型可能被带偏到旧版答案上去。所以,即使是“开卷”的AI,仍然需要人工确认检索来源的权威性和时效性。
安全部署建议:大语言模型是辅助工具而非决策者
论文最后给出的结论,值得每一个想在垂直领域落地LLM的团队抄笔记。
第一,当前没有任何一个模型适合独立做危险品合规决策。即使总分最强的Gemini 3.1 Pro,在积载、隔离和法规识别这些安全关键环节上也存在系统性失败。这不是调参能解决的问题,而是当前LLM架构在“多约束多步推理”上的结构性短板。
第二,LLM适合的角色是“决策支持工具”。它擅长快速检索DGL结构化数据、生成初步的合规草案、回答从业者的自然语言问题。但输出的每个结论都必须链接到IMDG规则的权威条目,并且要有训练有素的从业者把关。用论文的原话说:“no current model is fit to make DG compliance decisions unaided”——没有任何当前模型适合在无人辅助的情况下做出危险品合规决策。
第三,评估必须是持续性的。IMDG规则每两年修订一次,明年A43-26就要生效。模型也会不断迭代,今天测得的结果到明天可能就变了。DGEval的定位就是一个“安全保证仪器”(safety assurance instrument),要随着模型和规则的更新反复运行,而不是一次性考试。这也是为什么它把题库藏起来——只有隐藏测试集,才能长期跟踪模型的真实能力而不是刷题分数。
第四个启发来自合规链条本身。危险品合规不是一个单点动作,而是发货人、包装工、装船工、船运公司接力完成的链条——一个环节的错误会传导到后面所有环节。论文没有单独点评这一点,但DGEval按角色拆分的评估方式实际上承认了:AI工具的部署也需要考虑“链条视角”。一个工具只在某个环节好使,不代表整条运输链就安全了。每个环节的AI输出都需要可追溯、可验证、可复核。
说到底,这篇论文给所有“想拿LLM做安全关键决策”的人提了个醒:模型的流畅不等于可靠,总分高不等于关键场景靠谱。在危险品海运这种“一个代码错了就可能船毁人亡”的领域,AI是助手,不是决策者。制定规则的是人,监督AI的也得是人——这个分工,短期内不会改变。
龙迷三问
下面是龙哥对于大家可能的一些问题的解答:
这篇论文到底在解决什么问题?首个危险品海运合规评估基准DGEval问世,覆盖IMDG规则1678道题,横评13款主流大模型。Gemini 3.1 Pro以95.8%超越人类从业者基线83.8%,但积载、隔离与法规识别等安全关键项上,所有模型均暴露出明显短板。
这篇工作最值得看的点是什么?Gemini 3.1 Pro在所有四个部分均表现最佳,在多项选择部分达到95.8%,超过人类从业者基线83.8%;所有模型在积载、隔离和法规识别等安全关键领域表现最弱;网络搜索显著提升危险品清单查询性能(平均提升25.0个百分点)
这篇工作的边界或风险在哪里?优点:首次构建了针对IMDG规则的大语言模型评估基准,填补了该领域空白;基准设计考虑了专家加权评分和人类从业者基线,评估方法严谨;对13个模型、35种配置进行了全面评估,涵盖商业和开源模型。缺点:基准问题未公开,限制了可复现性;LLM-as-judge可能存在自偏好偏差;评估仅覆盖IMDG规则,未涵盖其他危险品运输法规;未考虑多模态视觉检查方面。
如果你还有哪些想要了解的,欢迎在评论区留言或者讨论~
龙哥点评
论文创新性分数:★★★★☆
构建DGEval基准测试集,包含1678个问题,涵盖多项选择、开放式问答、危险品清单查询和法规识别四类任务,系统评估13个模型在IMDG A42-24合规知识上的表现。
实验合理度:★★★★☆
各部分的准确率得分,采用专家加权评分,部分题目采用部分学分制
学术研究价值:★★★★☆
构建DGEval基准测试集,包含1678个问题,涵盖多项选择、开放式问答、危险品清单查询和法规识别四类任务,系统评估13个模型在IMDG A42-24合规知识上的表现;更关键的是问题定义是否可复用到同类任务。
稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。
适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。
硬件需求及成本:★★★☆☆
不适用(论文评估的是现有模型的推理性能,不涉及新模型的训练计算量)
复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。
产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。
可能的问题:基准问题未公开,限制了可复现性;LLM-as-judge可能存在自偏好偏差;评估仅覆盖IMDG规则,未涵盖其他危险品运输法规;未考虑多模态视觉检查方面。
主要参考文献
本论文原文:Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance. arXiv:2608.21036. https://arxiv.org/pdf/2608.21036v1.pdf
文中涉及的通用基准 MMLU-Pro、HealthBench、LegalBench 等详见论文参考文献 [2, 6, 8, 14, 16, 20, 26, 40, 43, 47, 49, 54]
海事领域模型 LLaMarine 见论文参考文献 [34];基准题库控制发布模式参考 nuScenes 见论文参考文献 [4]
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
海运合规,一题都不能错🚢 大模型再强也怕“背错隔离码”。想第一时间读到前沿AI论文解读与行业落地观察?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+清华+龙哥),根据格式备注可更快被通过并邀请进群。群里已有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个方向的小伙伴,等你来聊✨
论文创新性分数:★★★★☆
构建DGEval基准测试集,包含1678个问题,涵盖多项选择、开放式问答、危险品清单查询和法规识别四类任务,系统评估13个模型在IMDG A42-24合规知识上的表现。实验合理度:★★★★☆
各部分的准确率得分,采用专家加权评分,部分题目采用部分学分制学术研究价值:★★★★☆
构建DGEval基准测试集,包含1678个问题,涵盖多项选择、开放式问答、危险品清单查询和法规识别四类任务,系统评估13个模型在IMDG A42-24合规知识上的表现;更关键的是问题定义是否可复用到同类任务。稳定性:★★★☆☆
现有材料未提供充分的极端条件、重复运行或扰动测试,稳定性暂按中性评价。适应性以及泛化能力:★★★☆☆
现有材料未完整展示跨数据集、跨场景或分布外实验,泛化能力仍需进一步验证。硬件需求及成本:★★★☆☆
不适用(论文评估的是现有模型的推理性能,不涉及新模型的训练计算量)复现难度:★★★☆☆
现有材料未确认完整代码、配置、数据处理脚本和权重是否齐备,复现难度暂按中性评价。产品化成熟度:★★★☆☆
论文验证以研究实验为主,真实部署中的时延、成本、维护和异常场景仍需补充验证。可能的问题:基准问题未公开,限制了可复现性;LLM-as-judge可能存在自偏好偏差;评估仅覆盖IMDG规则,未涵盖其他危险品运输法规;未考虑多模态视觉检查方面。
主要参考文献
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!
海运合规,一题都不能错🚢 大模型再强也怕“背错隔离码”。想第一时间读到前沿AI论文解读与行业落地观察?欢迎加入龙哥读论文粉丝群,扫描下方二维码或者添加龙哥助手微信号加群:kangjinlonghelper。一定要备注:研究方向+地点+学校/公司+昵称(如 大模型+上海+清华+龙哥),根据格式备注可更快被通过并邀请进群。群里已有图像处理、大模型及智能体、自动驾驶及机器人、AI医疗及AI金融5个方向的小伙伴,等你来聊✨
*本文仅代表个人理解及观点,不构成任何论文审核或者项目落地推荐意见,具体以相关组织评审结果为准。欢迎就论文内容交流探讨,理性发言哦~ 想了解更多原文细节的小伙伴,可以点击"阅读原文",查看更多原论文细节哦!