TOMAP让Lean证明更省算力:分解环节一优化,语义忠实度涨19%
这篇论文盯住了自动形式化里最容易“翻车”的一环:证明分解。不是一味堆算力,而是把测试时预算花在最值钱的地方,结果更准、也更省。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文盯住了自动形式化里最容易“翻车”的一环:证明分解。不是一味堆算力,而是把测试时预算花在最值钱的地方,结果更准、也更省。
Apple Research这篇不是在比谁更会“聊天”,而是在逼智能体面对真实手机交互的硬骨头:用户会不会接受、何时插手、能不能跨应用干活。PARE把这件事做成了可评测、可复现的框架,结果也挺扎心:最强模型成功率也只有四成多。
这篇论文很对工程胃口:它不再把 KV cache 当成“模型内部小零件”,而是直接提升为分布式系统对象。结果也很硬,长上下文、多智能体、分支推理这些最烧钱的场景,TTFT、内存和吞吐都被明显改写。
长程智能体最烦的不是“想不起来”,而是“想起来了却不知道该把功劳算给谁”。ECHO把记忆选择和信用分配绑在一起,思路很工程,也很实用,尤其适合做搜索、工具调用和深度研究的Agent训练。
这篇论文最有意思的地方,不是把模型从头再训一遍,而是拿一个已经后训练好的111B多语模型,靠三步适配把“会说话”升级成“会办事”。更关键的是,它把韩语回答、英语推理、工具调用和单卡部署这几件原本互相打架的事,硬是捏到了一起。
Pocket FM这篇不是单纯“让模型会写故事”,而是把“角色怎么想、世界发生了什么、下一步该往哪走”拆成一套闭环系统。更关键的是,Atlas 还专门负责抓长篇里的情节打脸,终于不是只会写,连自查也安排上了。
内存优化最烦的不是“找不到问题”,而是“找到也修不完”。MOA把这事拆成三段:先从 profiling 里挖出反模式,再自动长出静态检查器,最后批量生成补丁,挺像给性能工程装了一条流水线。
这篇论文把“让AI先提案、再由可信核心放行”这件事做成了可认证合同,专治硬约束决策里“快和稳只能二选一”的老毛病。更狠的是,冻结大模型也能被它收编,最后还能在单位调度上换来2.96倍加速。
这篇论文最实用的地方,不是又造了一个更复杂的对齐模型,而是把“测试时怎么选更符合偏好的回答”这件事讲清楚了。REAR 直接用 base model 自己的概率做奖励分解,省掉额外训练,工程味很足。
这篇 SEAR 很有意思:它不再把图像修复当成“看到退化就直接出手”的单步活,而是改成先规划、再执行,还会把成功经验存起来反复用。对复杂混合退化场景来说,这种“会思考、会记忆”的思路,比纯 greedy 搜索靠谱得多。
这篇论文把“世界模型”从一次性预测工具,改造成了会自己修正上下文的在线规划助手。最有意思的是,它不改参数,专改记忆和提示词,既省掉在线训练的麻烦,又能把部署时的新经验吃进去。
这篇论文最有意思的地方,不是把推理分数再往上拱一拱,而是盯住了一个更现实的问题:模型变强了,弱模型和人却未必跟得上。TRL用“接力式” rollout 把单挑能力和协作可读性尽量绑在一起,思路很工程,也很像真业务会遇到的坑。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球