GEOALIGN来了:让LLM在线RL少走弯路,Qwen3稳定提分
这篇论文抓住了在线RL最烦人的毛病:明明奖励不低,训练却像坐过山车。GEOALIGN不跟奖励硬刚,而是从“方向”下手,专门揪出那些高分但带偏全局更新的rollout,思路相当清爽。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1672 篇文章
这篇论文抓住了在线RL最烦人的毛病:明明奖励不低,训练却像坐过山车。GEOALIGN不跟奖励硬刚,而是从“方向”下手,专门揪出那些高分但带偏全局更新的rollout,思路相当清爽。
这篇论文把强化学习后的大模型工具调用,拆成了可定位、可操控、还能“溢出”的内部特征。更有意思的是,单个 A 专属特征就能把工具调用能力直接拉满,机制味儿很浓。
这份白皮书不搞花里胡哨的算法炫技,而是直指一个很现实的问题:恒星耀发到底会把系外行星“烤”成什么样。Nautilus若真按设想落地,10秒级、宽波段、时变光谱这套组合拳,确实有机会把“拍脑袋黑体”升级成“有证据的耀发模板库”。
这篇论文很像给真实超分模型做了一次“跨场景校准”:先适应合成盲退化,再对齐经典双三次评测协议,最后再回到轻度真实相机退化。它最有意思的地方,不是单点堆损失,而是把训练分布这件事摆到台面上认真收拾。
这篇论文最有意思的地方,不是又堆了多少花活,而是把盲超分最容易被忽略的“分布对不齐”拎出来狠狠干了一顿。三阶段对齐思路很朴素,但对真实相机数据确实有效,适合想看“训练协议怎么影响结果”的读者。
这篇论文专门盯上了离散扩散VLA的“RL卡脖子点”:最终动作的边缘概率算不出来,那就直接优化去噪轨迹本身。思路很硬,结果也很硬,LIBERO和RoboTwin 2.0都打出了能拿出来讲的成绩。
这篇论文最有意思的地方,不是又堆了一个更大的生成模型,而是盯上了扩散模型里“偷偷干活”的注意力层。它把多视角点跟踪塞进训练里,专门修理几何和运动一致性,思路很聪明。
视频里常常不止一个事件,硬把它们当成“一锅粥”来分割,模型就容易看花眼。EVIS干脆先把视频拆成简单事件,再一段一段对齐文本,思路挺顺手。
这篇论文不跟语法错误死磕,而是专门盯住“看起来没毛病、其实物理上不对劲”的语义Bug。Aalto University用知识图谱给小模型喂规则,还让它输出补丁而不是整段重写,工程师看一眼就能决定要不要采纳。
这篇论文表面看是在研究“草图、文字、标签”哪种提示方式更好,实际上是在追问:AI把设计流程变得太顺滑,会不会顺手把设计思考也磨平了?SketchifAI给出的答案不算简单,值得细看。
多人不完全信息博弈最烦的地方,不是“有没有解”,而是“解明明在那儿,电脑却算到怀疑人生”。这篇论文给松弛变量和乘子变量补上有限界,直接把求解器的搜索空间勒紧,三人库恩扑克完整版本从24小时以上压到1.16秒,属于很实在的加速。
这篇工作不是在“发明新蛋白”,而是在把原本分散的 CABS-flex 与 CABS-dock 工具链,收拢成一个更顺手的 Python 3 命令行平台。蛋白柔性、肽建模、蛋白-肽对接三件事一锅端,外加 cg2all 深度学习重建,挺适合做批量流程和可复现分析。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球