反事实测试100%忠实:EG-VAR把幻觉拦在内核外
LLM会调用工具,不代表它就会老老实实认账。EG-VAR最狠的地方,不是“又接了个工具”,而是把证据、形式化、内核检查绑死,能证才给VERIFIED,证不出来就ABSTAIN。TableBench、反事实压力测试、端到端形式化误差,这套结果够硬。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1668 篇文章
LLM会调用工具,不代表它就会老老实实认账。EG-VAR最狠的地方,不是“又接了个工具”,而是把证据、形式化、内核检查绑死,能证才给VERIFIED,证不出来就ABSTAIN。TableBench、反事实压力测试、端到端形式化误差,这套结果够硬。
这篇论文最狠的地方,不是“答对了”,而是把“为什么答对”也一起钉死了。工具调用、逐源提升、Lean 4 内核三件套一上,LLM 的经验性胡说就不再是“看起来像对”,而是必须拿出可回放的证明。
这篇论文盯住了自动形式化里最容易“翻车”的一环:证明分解。不是一味堆算力,而是把测试时预算花在最值钱的地方,结果更准、也更省。
视频扩散模型看着很会“画”,但一遇到连续依赖事件就容易露馅。本文用最干净的硬球碰撞任务,把这个短板拆得明明白白。
这篇工作不玩花活,专盯RAW无损压缩里最容易被忽略的“对齐”问题。看似只是把亮度样本挪一挪,实际却能让CfL预测更稳,JPEG XS里也更能省码率。
一台首光仪器最怕的不是“做不出来”,而是“能做出来却扛不住十年”。MICADO这篇不讲花活,专讲怎么把可靠性、可维护性和停机成本,从设计阶段就摁住。
这篇论文最有意思的地方,不是又堆了多少花活,而是把小型视觉语言模型的“考试成绩”拆成了两件事:先能不能把答案写出来,再谈会不会想。结果很不客气——很多提升其实来自解析格式和 token 预算,不是复杂搜索。
一条X射线光谱,居然能把电子束的能量、发散和发射度“反推出”来。更狠的是,这套方法不是靠玄学拟合,而是先把物理模型压到足够快,再交给遗传算法慢慢筛。
Apple Research这篇不是在比谁更会“聊天”,而是在逼智能体面对真实手机交互的硬骨头:用户会不会接受、何时插手、能不能跨应用干活。PARE把这件事做成了可评测、可复现的框架,结果也挺扎心:最强模型成功率也只有四成多。
这篇论文很对工程胃口:它不再把 KV cache 当成“模型内部小零件”,而是直接提升为分布式系统对象。结果也很硬,长上下文、多智能体、分支推理这些最烧钱的场景,TTFT、内存和吞吐都被明显改写。
这篇论文最有意思的地方,不是把机器人“说得更像人”,而是先承认一件很现实的事:顾客很多时候根本没开口,机器人却已经该接话了。15.3%的回应由无声动作触发,这个数字很扎眼,也很适合拿来反思纯语音对话系统的盲区。
去雾这事最烦的不是“有雾”,而是雾还会挑地方、挑光照、挑场景。BPUL的思路很直接:别假装雾是确定性的,先把不确定性拎出来,再用物理一致性和对比约束把模型拽回正轨。😊
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球