MIT新作:7步解数独的流推理模型
这篇论文最有意思的地方,不是又造了一个“更会猜答案”的模型,而是把离散流模型硬生生改造成了会自我验证、会自我修正的推理器。数独上 7 次前向传播到 99.2%,还把 OOD 难题一起带飞,值得细看。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
这篇论文最有意思的地方,不是又造了一个“更会猜答案”的模型,而是把离散流模型硬生生改造成了会自我验证、会自我修正的推理器。数独上 7 次前向传播到 99.2%,还把 OOD 难题一起带飞,值得细看。
这篇论文很像给大模型出了一张“3D几何博士资格考试卷”。它不只看模型会不会写代码,更看它能不能把论文读对、把几何语义守住,结果相当不客气:最强模型也没过四成。
NVIDIA这篇不是简单给扩散语言模型“加速”,而是直接把上下文表示和去噪职责拆开,思路很工程,也很务实。30B 混合架构上还能保住 98.7% 质量、提速 2.42 倍,这种结果值得认真看。
这篇论文最值钱的地方,不是又造了一个“更聪明的表格模型”,而是把数据湖集成从“先定好数据库再说”改成了“用户想问什么,系统就围着问题去组装表”。EcoTable用轻量模型先缩小搜索空间,再让LLM只盯着最可能的连接路径,最后还能把变换和并行执行串起来,思路很工程,结果也很实在。
自回归视频最怕的不是慢,而是“顺序一乱就全乱”。TempAct 把规划和执行拆开,再用分层强化学习去训,专治复杂时间指令下的语义混淆、提示切换失灵和误差传染,思路很像给视频模型配了个会排兵布阵的总指挥。
这篇论文最有意思的地方,不是把推理分数再往上拱一拱,而是盯住了一个更现实的问题:模型变强了,弱模型和人却未必跟得上。TRL用“接力式” rollout 把单挑能力和协作可读性尽量绑在一起,思路很工程,也很像真业务会遇到的坑。
LLM Agent 的记忆最怕什么?不是“装不下”,而是“记错了还会一直记”。TRUSTMEM盯住每一次记忆更新的覆盖、保留和忠实度,把训练信号从终点前移到每个过渡步,专治长期记忆里的“慢性病”。
长视频最怕的不是“看不懂”,而是“看得懂一点点,却被海量冗余帧淹没”。HPP把感知和推理解耦,让编码型大模型像程序员一样分层探测视频,思路很硬核,成本也更像工程方案而不是玄学。
这篇论文把“AI写没写代码”这件事,硬生生压成了一个单标记生成问题。看起来很朴素,结果却在OOD榜上拿到0.789,和基线0.305相比,差距有点像“会做题”和“连题目都看不懂”。
题目难度不只是“题面难不难”,更像是“解题过程有多折腾”。这篇论文把大模型推理轨迹拆成认知片段,再去预测人类会觉得题有多难,思路挺对路。
这篇 DeepMind 新论文不只是在问“LLM像不像人”,而是在问“像人的代价是什么”。它把群体决策里的镜像与掩蔽讲得很清楚,实验设计也足够扎实,读完能直接理解为什么人机对齐不能只盯着单人问答。
这篇论文最有意思的地方,不是“又做了个路由器”,而是把推测式解码从 token 级搬到了响应级,还能跨模型、跨厂商、跨架构跑起来。更狠的是,在真实 agentic coding 负载里,成本、延迟、质量居然一起往上走,工程味很足。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球