反事实压力下仍100%忠实,LLM事实核验新范式
这篇论文最狠的地方,不是“答对了”,而是把“为什么答对”也一起钉死了。工具调用、逐源提升、Lean 4 内核三件套一上,LLM 的经验性胡说就不再是“看起来像对”,而是必须拿出可回放的证明。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
这篇论文最狠的地方,不是“答对了”,而是把“为什么答对”也一起钉死了。工具调用、逐源提升、Lean 4 内核三件套一上,LLM 的经验性胡说就不再是“看起来像对”,而是必须拿出可回放的证明。
这篇论文盯住了自动形式化里最容易“翻车”的一环:证明分解。不是一味堆算力,而是把测试时预算花在最值钱的地方,结果更准、也更省。
这篇工作不玩花活,专盯RAW无损压缩里最容易被忽略的“对齐”问题。看似只是把亮度样本挪一挪,实际却能让CfL预测更稳,JPEG XS里也更能省码率。
一条X射线光谱,居然能把电子束的能量、发散和发射度“反推出”来。更狠的是,这套方法不是靠玄学拟合,而是先把物理模型压到足够快,再交给遗传算法慢慢筛。
Apple Research这篇不是在比谁更会“聊天”,而是在逼智能体面对真实手机交互的硬骨头:用户会不会接受、何时插手、能不能跨应用干活。PARE把这件事做成了可评测、可复现的框架,结果也挺扎心:最强模型成功率也只有四成多。
去雾这事最烦的不是“有雾”,而是雾还会挑地方、挑光照、挑场景。BPUL的思路很直接:别假装雾是确定性的,先把不确定性拎出来,再用物理一致性和对比约束把模型拽回正轨。😊
这篇论文把“蒸馏”从一次性教学,改成了连续换老师的长期训练。更有意思的是,外部数据既能帮学生学到新东西,也可能顺手把旧知识冲掉,SE2D就是专门来收拾这个烂摊子的。
这篇论文最有意思的地方,是它把“手性”从一个看着很玄的量子词,变成了能实打实增强双磁振子结合的微观机制。更妙的是,它对单磁振子完全不动声色,专挑双磁振子下手。
阿秒手性测量看着像“纯手性信号”,其实光子动量也会来搅局。本文最实用的地方在于:不仅指出了问题,还给出外消旋混合物标定背景的分离办法,属于能直接指导实验解释的那种工作。
这篇论文最有意思的地方,不是“又一个可控生成”,而是把控制粒度卡在了文本和结构之间的中间地带:既想要全局分布,又要求精确到直方图。HIG用最优传输把这件事做成了,而且还是推理时、无需训练、还能顺手做信息嵌入,思路挺干净。
扩散模型已经很会“画”,但要它严格听话,往往得靠额外网络、微调或复杂条件。HIG更狠:直接在推理阶段用最优传输改轨迹,既能控颜色分布,也能玩信息嵌入,还几乎不增加训练成本。
这篇论文最有意思的地方,不是又验证了“星系会聚在一起”,而是把“只看暗晕质量够不够”这个老问题直接拎出来审问了一遍。结果很不客气:不够,真不够。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球