Qwen3最新研究:高分rollout也会带偏训练?
在线强化学习最怕什么?不是不会学,而是学着学着突然跑偏。GEOALIGN抓住“高分但方向不对”的rollout,直接在潜空间里做体检,数学推理和对齐任务都更稳了。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1573 篇文章
在线强化学习最怕什么?不是不会学,而是学着学着突然跑偏。GEOALIGN抓住“高分但方向不对”的rollout,直接在潜空间里做体检,数学推理和对齐任务都更稳了。
这篇论文抓住了在线RL最烦人的毛病:明明奖励不低,训练却像坐过山车。GEOALIGN不跟奖励硬刚,而是从“方向”下手,专门揪出那些高分但带偏全局更新的rollout,思路相当清爽。
这篇论文很像给真实超分模型做了一次“跨场景校准”:先适应合成盲退化,再对齐经典双三次评测协议,最后再回到轻度真实相机退化。它最有意思的地方,不是单点堆损失,而是把训练分布这件事摆到台面上认真收拾。
这篇论文最有意思的地方,不是又堆了多少花活,而是把盲超分最容易被忽略的“分布对不齐”拎出来狠狠干了一顿。三阶段对齐思路很朴素,但对真实相机数据确实有效,适合想看“训练协议怎么影响结果”的读者。
这篇论文专门盯上了离散扩散VLA的“RL卡脖子点”:最终动作的边缘概率算不出来,那就直接优化去噪轨迹本身。思路很硬,结果也很硬,LIBERO和RoboTwin 2.0都打出了能拿出来讲的成绩。
这篇论文不跟语法错误死磕,而是专门盯住“看起来没毛病、其实物理上不对劲”的语义Bug。Aalto University用知识图谱给小模型喂规则,还让它输出补丁而不是整段重写,工程师看一眼就能决定要不要采纳。
这篇 CoOL 很有意思:不靠距离、不算相似度,靠多个观察者“商量一致”来做聚类。更妙的是,它还把收敛监控、分布漂移检测一起打包了,属于那种思路怪,但讲得通的论文。
CAT-Q把“训练到位才能三元化”的老路,改成了更省钱的后训练方案。512个校准样本,就想把1.58位大模型做得又稳又准,思路很硬。
这篇论文很实用,专治“摘要模型表面正常、背后作妖”。白盒能顺藤摸瓜找出毒样本,黑盒还能只靠模型行为做审计,最后连被污染的摘要习惯都能拉回来,属于防御论文里少见的“检测+修复”双保险。
这篇论文把“教师强制”和“自习强制”拧成了一个统一蒸馏配方,还顺手把连续时间一致性模型和分布匹配蒸馏接上了。更有意思的是,它不只会讲方法,还真把流式视频生成和交互式世界模型都跑出了像样的结果。
这篇论文最有意思的地方,不是“又训练了一个SAE”,而是把Qwen3的内部表示拆成了能看、能评、还能直接干预的特征字典。更妙的是,它不只讲“重构得像不像”,还真的拿拒答行为做了因果干预,实用味很足。
这篇论文最有意思的地方,是把原本“玄学味很重”的GAN训练,硬生生拆成了可解的高维动力学问题。类条件、相关性、非零均值这些看起来很乱的因素,最后都被压进了一个有效协方差里,理论和实验还能对上。
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球