还在用GRPO?当90%动作都是“摸鱼”,信噪比还不如随机乱猜!
训练多轮智能体时,GRPO等无评判器方法常常在长序列任务中“失灵”,大家都以为是“长程信度分配”的锅。但龙哥今天带来的这篇工作却一针见血地指出:罪魁祸首是“例行公事”太多!论文首次定义了“决策密度”这个量化指标,并完美推导验证了其与训练信噪比之间的幂律关系。啃完这篇,你对强化学习训练效率的理解会上一个台阶。
LONGGE AI RESEARCH DAILY
每天筛选值得关注的 AI 论文,用工程视角拆解方法、实验和真正的落地价值。
目前已发表 1655 篇文章
训练多轮智能体时,GRPO等无评判器方法常常在长序列任务中“失灵”,大家都以为是“长程信度分配”的锅。但龙哥今天带来的这篇工作却一针见血地指出:罪魁祸首是“例行公事”太多!论文首次定义了“决策密度”这个量化指标,并完美推导验证了其与训练信噪比之间的幂律关系。啃完这篇,你对强化学习训练效率的理解会上一个台阶。
LED灯闪和机器人又扭头又说话,你更信哪个?这篇论文竟然在德国博物馆实地“抓”观众来做实验!结果既在意料之外,又在情理之中——视频里看着很清晰的信号,一到真实世界,效果直接打对折。下次家里扫地机对你狂闪红灯,你可要仔细琢磨一下它到底想干嘛了!
“三个臭皮匠,顶个诸葛亮”在AI评审领域失灵了。Apple Research这篇论文泼了盆冷水:你花重金请来9个顶级大模型打分,以为获得群体智慧,实际上它们只用同一种声音对你说话。这是直面当前AI测评滥用的“清醒剂”。
每次遇到新档案馆里那些发黄、透墨、满是污渍的老旧文档,你是不是还得重新标注数据、重新微调模型?本论文的DR-Mamba让你彻底告别这个繁琐环节——它利用巧妙的快慢双路径Mamba和样本条件的自适应减法门,在模型前向推理时就能自动适应每张文档的独特退化类型,效果还特别能打,尤其对最难处理的极端退化样本效果拔群。
图像压缩领域又出新招,这次来自意大利卡塔尼亚大学的团队,把纯粹的隐式神经表示(INR)玩出了新高度。他们提出的PaaF,用一套自适应量化和自调制激活函数,让INR图像压缩在感知质量上大杀四方。LPIPS相比最强基线NIF再降39%,低码率下的细节还原更是甩开对手几条街。纯INR路线原来还藏着这么大潜力!
Yann LeCun的JEPA思想终于上天了!这篇工作提出了第一个用于四旋翼实时控制的JEPA风格潜空间动力学模型SkyJEPA。它完全在仿真中通过域随机化训练,却能零样本迁移到现实世界,在户外飞行中跟踪误差降低近40%,换了桨叶、加了负载也不掉链子。想看世界模型怎么帮无人机“闭眼预测”的,这篇必读。
爱因斯坦的引力理论在宇宙学常数(暗能量)下遇到了一个尴尬问题:引力波带走的质量究竟怎么算?这篇论文从线性引力波入手,通过巧妙的多极矩截断,不仅重新定义了de Sitter时空的“质量”,还发现了引力波扫过后独特的“记忆效应”。理论物理爱好者千万别错过,这里不仅有公式推导的严谨,也有宇宙学尺度的奇思妙想。
说起生成模型,大家最熟悉的可能是扩散模型(Diffusion Models)和自回归模型(Autoregressive Models),它们一个靠“慢慢去噪”做到高质量,一个靠“逐词预测”称霸语言。但还有一个老牌家族——归一化流(Normalizing Flows,简称NF),虽然理论优雅,却一度因为推理速度慢、架构受限,被很多人遗忘在角落。
还在苦恼给视频换个背景,主角的头发丝却“糊”了?传统方法“重绘全图”的做法就像把整面墙重刷一遍,难免会蹭到不该动的地方。Netflix联手Caltech最新力作Vera,直接给出“分层”方案——要改的部分单独画在一个“透明图层”上,再盖回原视频,从源头杜绝了“改哪坏哪”的尴尬。PSNR狂甩VACE 7dB,效果真的有点东西。
全网断掉,没了搜索引擎和维基百科,我们怎么查资料?滑铁卢大学这篇工作给出的答案硬核且接地气—— 用蓝牙在大家手机里搭一个分布式“离线图书馆” 。CttF系统不搞天花乱坠的协议,而是让用户在断网前就缓存并互相打分,断网后再通过日常擦肩而过的那点时间交换资源。基于2.5万人真实轨迹的模拟证明,这套方案在真实部署场景下非常靠谱,比传统的流行病路由高效多了。
行星们也会“迟到早退”?基于TESS卫星前五年数据,南昆士兰大学团队首次系统梳理多行星系统凌星计时变化(TTV),发现20个存在显著“时差”的系统,其中13个此前未知。更关键的是,TESS系统偏爱2:1轨道共振,与Kepler的3:2偏好截然不同,暗示两种不同的行星形成“食谱”。想了解宇宙的“时钟”如何摆布行星?这篇就是入门指南。
当药物分子库动辄上亿候选物时,那个经典的“找最佳分子”问题瞬间变成了在浩瀚星辰中寻宝。不仅要考虑多个属性,还得在“探索”和“利用”间平衡。这篇论文提出了TTPFTS,第一个真正意义上的“随时”贝叶斯算法,无需预设预算,就能边采样边给出越来越准的帕累托最优解集。更绝的是,在9400万分子的库中,它只用了0.05%的探索量就几乎锁定了全部真实最优解,还自带一个“
LONGGE AI COMMUNITY
加入「龙哥读论文」知识星球,持续获取 AI 论文、资讯、开源项目、招聘与研究思路。
加入龙哥读论文微信群:添加微信 kangjinlonghelper,备注“研究方向 + 地点 + 学校/公司 + 昵称”。
微信扫码加入知识星球