无卖空约束也能做RL?这篇论文把均值-方差投资学拧回来了
无卖空约束一加上“未知市场参数”,很多传统最优解就开始失灵。本文的聪明之处在于:不去硬碰硬做受限随机化,而是把约束放到均值上,用高斯噪声做训练,最后还能把原问题的最优策略捞回来。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
无卖空约束一加上“未知市场参数”,很多传统最优解就开始失灵。本文的聪明之处在于:不去硬碰硬做受限随机化,而是把约束放到均值上,用高斯噪声做训练,最后还能把原问题的最优策略捞回来。
世界模型最怕的,不是不会预测,而是把“环境自己在变”和“动作造成变化”混成一锅粥。DWM专门盯住这个老毛病下手,训练阶段分开学,推理阶段却不加戏,思路很干净。
机器人操作里最烦的不是“不会动”,而是“会动但总选错那一下”。这篇工作把候选动作选择从依赖 critic 打分,改成了接触前后分阶段的几何进度判断,思路很朴素,但很实用。
世界模型最怕的不是预测错一点,而是 看起来很会想,实际上只会顺着状态续写 。这篇论文直接把“长时程想象失败”拆成运动学和动力学两层,诊断味道很足,尤其适合做机器人、自动驾驶和具身智能的人看。
仿真到现实这道坎,难点从来不是“模型会不会猜”,而是“隐藏变量到底藏在哪”。这篇论文的思路很狠:既然前向历史不够用,那就从结果里倒着抠信息,再把仿真和现实的动力学特征做无配对翻译,路子新,而且实验也不虚。
视频推理这事,很多时候不是“会不会想”,而是“看没看见关键帧”。这篇论文直接把矛头对准感知短板,用注意力把稀疏奖励拆成帧级、Token级信号,思路很硬,实验也够实。
Muon 在预训练里已经很能打,但到了强化学习后训练阶段,表现却一直不清不楚。这篇论文不讲玄学,直接拿三种优势估计器和学习率做对照,结果很扎眼:有的场景能涨 88%,有的场景却几乎没戏。
四足机器人最难的不是“跑起来”,而是“跑着跑着还知道该怎么换姿势”。这篇工作把轨迹优化、动作预训练、强化学习和感知蒸馏串成一条链,真机直接冲到6米/秒,属于能看懂、也能落地的那类机器人论文。
施工路段最容易把模型训练出的“老司机直觉”打回原形。WorkDrive的思路很直接:先把现场关键事实看清,再把因果链讲明白,最后用一致性奖励把轨迹拽回来,适合关心自动驾驶落地的人细看。
这篇论文最狠的地方,不是把RLVR讲明白了,而是第一次把“训练得不错”推进到“理论上也站得住”。更有意思的是,它不是空谈定理,而是拿出一条Progressive RLVR流水线,把压缩、蒸馏、量化一起拧上,真把泛化界做到了能看、能算、还能落地。
多模态Agent最尴尬的不是不会做题,而是做对一次后,下一次还得从头学一遍。SPyCE直接把成功轨迹蒸馏成可复用技能,并让技能和策略在训练中一起进化,思路很顺,实验也够硬。
无标签训练最怕什么?怕信号太稀,怕算力太贵。CANON偏偏把“多数投票”变成了每个token都能学的监督信号,结果是:更省算力,推理还更准。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球