首个危险品海运合规基准:13款LLM实测,Gemini接收但安全项翻车
危险品海运合规,写错一个隔离码就可能火烧连营。这篇论文首次发布DGEval基准,用1678道题横评13款大模型:Gemini 3.1 Pro总成绩碾压人类从业者,却在积载、隔离等最要命的环节集体翻车。漂亮总分之下藏着哪些安全盲区?这份答卷值得所有做AI落地的人细读。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
危险品海运合规,写错一个隔离码就可能火烧连营。这篇论文首次发布DGEval基准,用1678道题横评13款大模型:Gemini 3.1 Pro总成绩碾压人类从业者,却在积载、隔离等最要命的环节集体翻车。漂亮总分之下藏着哪些安全盲区?这份答卷值得所有做AI落地的人细读。
多智能体语言模型模拟在社会行为研究中越来越流行。但绝大多数评估只问:智能体有没有坚持扮演分配的角色?却很少有人系统跟踪另一个问题: 智能体用来描述自己的身份设定,会不会被它自己在运行中改掉?
Vibe Coding从Karpathy一条推文变成柯林斯年度词汇,只用了一年。这篇综述把123份证据摊开:+26%的同行实验、-19%的独立实测、+441%的审查时间,三组数字互相打架。想搞清楚AI写代码到底是效率革命还是烂摊子制造机,这篇是目前最全面的地图。
电商推荐系统想离线做策略评估,最缺的就是一个“真实买家”。阿里和人大等团队提出的RecVerse,让模型真的去看截图“逛街”,还配了套三层记忆和轨迹级奖励,模拟出来的购物行为既像真人一样会犹豫比较,又能买到用户真想买的东西,顺手开源了5千多条真实轨迹的交互式基准。做推荐、做用户增长的同学值得一读。
数学解题能力强,不代表真的“懂数字”。这篇NAACL论文把数值能力当成自然语言推理任务来测,一口气跑了49个模型,结果发现数学专用大模型只在算术上占优,数字比较和归一化反而拉胯,值得每一位关注LLM推理能力的读者看看。
先问大家一个问题:如果你是一个放射科医生,看到一张腹部CT片子,有人问你“肝脏在脾脏的左边还是右边?”,你会怎么回答?
这篇论文最有冲击力的地方,不是零遗忘的堆栈设计本身,而是那个反常识的发现:医疗提示在97%的情况下会路由到聊天+数学堆栈——它们训练时根本没见过医疗数据。这说明微调注入的是可迁移的认知原语,而不是领域知识。思考方式被当作"能力"打包,这件事值得所有做微调的人停下来想想。
继8月推过单次采样SAPO之后,强化学习训练多轮智能体又有新活。这次厦大和南洋理工的合作工作,只靠“成功轨迹的长度”这一个几乎零成本的信号,就把GRPO平均拔高27.2%,还顺带解决了成功轨迹之间的“优势坍缩”难题,值得一读。
大模型修代码的评测大多扎堆Java和Python,冷门系统编程语言几乎没人管。上海交大、浙大这篇OdinEval把目光瞄向Odin语言,用168个真实issue把6个大模型拉出来遛了一圈,还给出了一套可复现性拉满的评测协议。想看看Kimi-K3、GLM-5.2这些模型在陌生语言面前谁更能打,这篇必读。
想象一下这个场景:一笔并购交易历经数月谈判,终于在截止日前夜敲定了最终条款。此时,一位律师揉着布满血丝的眼睛,逐行核对一份几百页的合同——不是在看条款对不对,而是在找"错别字"级别的硬伤:某个大写术语在这里为什么没大写?
多模态RAG最让人头疼的不是"找不到证据",而是"证据太多太吵"。东南大学这篇GraphLoom把Llama-3.1-8B冻住,只训练160万参数,用可靠性校准的证据路由在三大多模态问答基准上全面超强基线,还把幻觉率压到10.5%。
低资源语言的NLP工具一直是老大难,这篇来自地拉那大学的论文直接用本地Gemma 4搭了一条媒体偏见分析流水线,在8358篇阿尔巴尼亚语新闻上把人物实体召回率做到70.3%。更妙的是提示词对比实验:严格校验虽然消灭了标签不一致,但覆盖率几乎腰斩。看完只想说,工程里没有万能的prompt,只有合适的取舍。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球