ICML 2026新研究:DGS让LLM学会先选对招,再下手
这篇论文最有意思的地方,不是又堆了一个“更强的LLM-AHD框架”,而是盯住了真正烧预算的那一步:先选哪个父代、用什么操作去生成。DGS把这一步变成可学习的决策,还用两个代理模型提前预判结果,思路很工程,也很像真正会省钱的系统。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是又堆了一个“更强的LLM-AHD框架”,而是盯住了真正烧预算的那一步:先选哪个父代、用什么操作去生成。DGS把这一步变成可学习的决策,还用两个代理模型提前预判结果,思路很工程,也很像真正会省钱的系统。
这篇论文最有意思的地方,不是“翻译”本身,而是把古手稿识别、现代越南语生成和偏好对齐揉成一个端到端问题。PPO、DPO、KTO三种RLHF路线同台对决,结果也很诚实:DPO在多数翻译质量指标上最稳,PPO更偏覆盖,KTO则保留了自己的性价比。
Gemma 4最有意思的地方,不是单纯把参数做大,而是把“思考模式”、长上下文效率、无编码器多模态和量化推理一起打包了。开源模型里这种“性能、效率、部署”三线并进的做法,确实值得认真看。
这篇论文最狠的地方,是把“模型自己都这么说了,应该八九不离十吧”这套直觉狠狠干翻了。265000次采样审计显示,自洽性确实有用,但远没有想象中可靠,尤其在最会“装稳”的前沿模型上。
前端仓库级代码生成最怕的不是“写不出来”,而是“写出来后把旧功能顺手搞坏”。这篇论文把设计知识、知识图谱和补丁式生成串成闭环,结果是更稳、更省 Token,也更像真正的工程开发。
LLM会调用工具,不代表它就会老老实实认账。EG-VAR最狠的地方,不是“又接了个工具”,而是把证据、形式化、内核检查绑死,能证才给VERIFIED,证不出来就ABSTAIN。TableBench、反事实压力测试、端到端形式化误差,这套结果够硬。
这篇论文最狠的地方,不是“答对了”,而是把“为什么答对”也一起钉死了。工具调用、逐源提升、Lean 4 内核三件套一上,LLM 的经验性胡说就不再是“看起来像对”,而是必须拿出可回放的证明。
这篇论文盯住了自动形式化里最容易“翻车”的一环:证明分解。不是一味堆算力,而是把测试时预算花在最值钱的地方,结果更准、也更省。
Apple Research这篇不是在比谁更会“聊天”,而是在逼智能体面对真实手机交互的硬骨头:用户会不会接受、何时插手、能不能跨应用干活。PARE把这件事做成了可评测、可复现的框架,结果也挺扎心:最强模型成功率也只有四成多。
这篇论文很对工程胃口:它不再把 KV cache 当成“模型内部小零件”,而是直接提升为分布式系统对象。结果也很硬,长上下文、多智能体、分支推理这些最烧钱的场景,TTFT、内存和吞吐都被明显改写。
这篇论文最有意思的地方,不是把机器人“说得更像人”,而是先承认一件很现实的事:顾客很多时候根本没开口,机器人却已经该接话了。15.3%的回应由无声动作触发,这个数字很扎眼,也很适合拿来反思纯语音对话系统的盲区。
这篇论文把“蒸馏”从一次性教学,改成了连续换老师的长期训练。更有意思的是,外部数据既能帮学生学到新东西,也可能顺手把旧知识冲掉,SE2D就是专门来收拾这个烂摊子的。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球